Ricerca
VoxMem: valutazione comparativa della memoria multimodale nei grandi modelli linguistici per l’audio
I sistemi di conversazione vocale devono recuperare informazioni dalle interazioni precedenti, cioè fare ricorso alla memoria. Nel parlato, però, le informazioni rilevanti non riguardano soltanto ciò

- arXiv
- 2609.32607
- Pubblicato
- 2026-09-26
- Autori
- Yang Xiao, Vidhyasaharan Sethu, Eun-Jung Holden, Ting Dang
Abstract degli autori
I sistemi di conversazione vocale devono recuperare informazioni dalle interazioni precedenti, cioè fare ricorso alla memoria. Nel parlato, però, le informazioni rilevanti non riguardano soltanto ciò che è stato detto, ma anche chi l’ha detto, come l’ha detto e che cosa era udibile: informazioni presenti solo nel segnale audio, che non si possono ricavare da una trascrizione. Oltre a decidere che cosa ricordare, la memoria richiede operazioni diverse: recuperare un singolo fatto, integrare informazioni emerse in diversi turni di conversazione e tenere traccia di uno stato che cambia nel tempo. Le interazioni reali si svolgono inoltre nell’arco di più sessioni: le informazioni si accumulano in episodi distinti, anziché in un’unica registrazione continua. I benchmark esistenti sono carenti su tutte e tre queste dimensioni: si concentrano soprattutto sul contenuto lessicale, prevedono operazioni di memoria limitate e definite caso per caso e trattano la memoria come un problema circoscritto a una sola sessione. Sosteniamo che una valutazione rigorosa della memoria richieda di caratterizzare congiuntamente le informazioni acustiche da conservare e le operazioni applicate a tali informazioni, e proponiamo una tassonomia basata su questi due assi. Su questa base presentiamo VoxMem: 3.196 casi di valutazione tratti da 34.743 sessioni vocali (177 ore), che combinano quattro tipi di informazioni acustiche (semantica del parlato, identità del parlante, indizi paralinguistici e suoni ambientali) con quattro operazioni di memoria (estrazione di informazioni, ragionamento su più sessioni, monitoraggio dei cambiamenti nel tempo e rifiuto di rispondere). I casi si basano su storie articolate in più sessioni e sono suddivisi per limiti di contesto da 8K a 64K token. Nella valutazione di 15 LALM, nessun modello supera il 40% con 32K token. I modelli ricordano ciò che è stato detto molto meglio di chi l’ha detto, come è stato detto o che cosa era udibile. Questo divario si amplia per le operazioni complesse, cresce con la lunghezza della storia e si manifesta in modalità di errore qualitativamente diverse a seconda del tipo di informazione. VoxMem mira a offrire una base per misurare e favorire i progressi sull’intera gamma di capacità richieste dalla memoria delle conversazioni vocali.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv