Ricerca
Oltre la memoria diadica: memoria multimodale attenta alle interazioni con recupero agentico adattivo per conversazioni orali tra più partecipanti
La memoria a lungo termine consente agli agenti di accumulare informazioni e ragionare attraverso più sessioni, ma la ricerca esistente si concentra soprattutto su conversazioni diadiche testuali o ch

- arXiv
- 2609.32522
- Pubblicato
- 2026-09-26
- Autori
- Wenxu Jia, Xize Cheng, Zihan Zhang, Dongjie Fu, Linjun Li, Wenshi Chen, Yangyang Wu, Tao Jin
Abstract degli autori
La memoria a lungo termine consente agli agenti di accumulare informazioni e ragionare attraverso più sessioni, ma la ricerca esistente si concentra soprattutto su conversazioni diadiche testuali o che combinano immagini e testo. La memoria a lungo termine per le conversazioni orali tra più partecipanti resta quindi poco esplorata. In questo contesto occorre conservare il contenuto delle conversazioni, identificare i partecipanti da una sessione all’altra e ricordare chi parla con chi. A questo scopo proponiamo VoxPolyMem, un framework di memoria multimodale attento alle interazioni che combina l’identificazione incrementale dei parlanti con una gerarchia composta da memoria delle interazioni, memoria dei fatti e profili dei partecipanti. Formuliamo il recupero delle informazioni come un processo decisionale sequenziale: un agente riformula le richieste e sceglie gli strumenti di recupero e i livelli di memoria in base alle evidenze raccolte, per colmare le lacune informative. Introduciamo inoltre Evidence-Gain GRPO (EG-GRPO), che attribuisce il merito a ogni turno per favorire l’acquisizione di evidenze complementari. Abbiamo anche costruito VoxPolyBench per valutare, nelle conversazioni orali tra più partecipanti, l’evoluzione della memoria, la capacità di fornire risposte personalizzate, il recupero dalla memoria e il ragionamento, nonché il ragionamento sulle interazioni e l’attribuzione. VoxPolyMem ottiene un punteggio complessivo di 85,0 su VoxPolyBench, superando di 23,6 punti la migliore baseline valutata. Su Mem-Gallery e H2HMem-Multi ottiene rispettivamente 89,6 e 74,4 punti, superando in entrambi i casi di oltre 8 punti le migliori baseline di memoria pubbliche valutate. Questi risultati ne evidenziano il potenziale per un’assistenza continuativa e personalizzata nelle interazioni multimodali tra più partecipanti. Il codice e i dataset sono disponibili all’indirizzo https://voxpolymem.github.io/VoxPolyBench/demo/
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv