Vai al contenuto
AI.info

Ricerca

SpeakerMem-R1: memoria a doppio binario incentrata sui parlanti per il dialogo tra più partecipanti

La memoria conversazionale a lungo termine nei contesti con più partecipanti richiede più del recupero di contenuti pertinenti da conversazioni a lungo termine: deve distinguere chi ha detto cosa, a c

SpeakerMem-R1: memoria a doppio binario incentrata sui parlanti per il dialogo tra più partecipanti
arXiv
2609.26780
Pubblicato
2026-09-22
Autori
Haobo Zheng, Tan Tang, Yan Chen, Weijie Wang, Yingcai Wu

Abstract degli autori

La memoria conversazionale a lungo termine nei contesti con più partecipanti richiede più del recupero di contenuti pertinenti da conversazioni a lungo termine: deve distinguere chi ha detto cosa, a chi si riferisce ciascuna affermazione, come le persone si percepiscono a vicenda, quali informazioni sono condivise dal gruppo e come cambiano gli stati nel tempo. Studi recenti sui benchmark per il dialogo tra più partecipanti mostrano che gli attuali sistemi di memoria basati su LLM generalisti tendono a perdere le relazioni relative a persone e gruppi o faticano a integrare indizi distribuiti tra membri, gruppi e momenti diversi. Nel complesso, questi problemi rivelano due ostacoli fondamentali: l’attribuzione dei messaggi e la comprensione delle relazioni nel dialogo tra più partecipanti, e la ricostruzione degli stati a partire da cronologie intrecciate. Per affrontarli entrambi, proponiamo $\textbf{SpeakerMem-R1}$: la sua memoria a doppio binario conserva i messaggi verbatim con l’indicazione del parlante e gli stati derivati, organizzati in viste per persona e per gruppo, quindi, al momento della query, combina le evidenze dei due binari per entità, evento e tempo. Per ridurre gli errori di attribuzione e aggiornamento durante la costruzione della memoria strutturata e consentire al contempo l’utilizzo in locale, addestriamo Writer-R1 con SpeakerLevenshtein e GRPO condizionato dal parlante. Su GroupMemBench, SocialMemBench ed EverMemBench, SpeakerMem-R1 raggiunge accuratezze binarie rispettivamente del 47,9%, del 69,2% e del 61,9%. Nella classifica pubblica di EverMemBench di EverMind-AI raggiungiamo il 62,33%, il miglior risultato riportato tra i più recenti framework allo stato dell’arte. Raggiunge inoltre il 70,85% su tutte le 1.986 domande di LoCoMo, che utilizziamo come test limite per le conversazioni a lungo termine tra due persone. In una valutazione controllata su 305 domande, l’RL porta l’accuratezza media del Writer addestrato con SFT dal 57,38% al 68,20%. Riportiamo sia l’accuratezza binaria sia il token-F1; gli studi di ablazione mostrano che il binario verbatim e quello strutturato, così come le viste per persona e per gruppo, sono complementari nell’ambito dell’interfaccia di valutazione standardizzata.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv