Ricerca
La rilevanza non basta: cosa colma davvero le lacune nelle evidenze nelle domande sulla memoria a lungo termine
Gli agenti basati su LLM che interagiscono con un utente nel corso di molte sessioni accumulano cronologie che superano la loro finestra di contesto. Per questo conservano le interazioni passate in un

- arXiv
- 2610.09348
- Pubblicato
- 2026-10-07
- Autori
- Yufeng Li, Shuxin Li, Zhenhua Xu, Junxian Li, Peng Zeng, Sheng Yao, Changting Lin, Gaolei Li, Ran Bi, Meng Han
Abstract degli autori
Gli agenti basati su LLM che interagiscono con un utente nel corso di molte sessioni accumulano cronologie che superano la loro finestra di contesto. Per questo conservano le interazioni passate in una memoria esterna e rispondono a ogni domanda sulla base di un piccolo insieme di record recuperati. I sistemi di memoria esistenti ordinano i record in base alla pertinenza lessicale o degli embedding. Tuttavia, i ricordi ai primi posti possono essere tutti pertinenti e, nel loro insieme, non contenere un fatto complementare necessario per rispondere, soprattutto nel caso di domande che riguardano più sessioni o la dimensione temporale. Riprendendo la distinzione tra rilevanza e sufficienza negli studi sulle prove giuridiche, riformuliamo il recupero dei ricordi come costruzione di un insieme di ricordi sufficiente. Per rendere operativa questa prospettiva, introduciamo una valutazione in cieco dell’insieme recuperato da parte di un LLM, insieme a Gold Hit e Turn Hit come indicatori indiretti della copertura delle evidenze. Proponiamo quindi Budgeted Flat Reconstruction (BFR), che costruisce insiemi sufficienti a partire da un archivio di memoria piatto e fisso, in due fasi. Per prima cosa applichiamo Formal Concept Analysis for Memory Selection (FCA-MS) per scomporre la domanda in requisiti informativi e selezionare un sottoinsieme compatto di candidati che, nel loro insieme, li soddisfino. Poi recuperiamo ripetutamente record non ancora esaminati mediante ricerche testuali più approfondite o viste complementari per entità e per sessione, fermandoci quando il budget è esaurito. Gli esperimenti su LoCoMo e LongMemEval-S mostrano che BFR supera gli adattamenti di recenti sistemi di memoria per agenti basati sullo stesso archivio, sia nella qualità delle risposte sia nella copertura delle evidenze. In particolare, su LongMemEval-S porta l’accuratezza valutata dal 72,4% all’82,2% e Turn Hit al 91,4%.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv