Ricerca
La memoria giusta nel contesto sbagliato: verificare l’ammissibilità del recupero nella memoria a lungo termine degli agenti
Gli agenti dotati di memoria a lungo termine possono recuperare informazioni pertinenti ma non ammissibili per la richiesta corrente, perché appartengono a un altro soggetto, violano una policy o rifl

- arXiv
- 2610.07309
- Pubblicato
- 2026-10-05
- Autori
- Zi Wang, Xingqiao Wang, Emmanuel Addai, Devika Ambekar, Xiaowei Xu
Abstract degli autori
Gli agenti dotati di memoria a lungo termine possono recuperare informazioni pertinenti ma non ammissibili per la richiesta corrente, perché appartengono a un altro soggetto, violano una policy o riflettono uno stato del ciclo di vita incompatibile. Il recall e la correttezza della risposta finale non lo rivelano: un percorso può sembrare sicuro perché non recupera le evidenze richieste, mentre una risposta corretta può arrivare dopo l’esposizione nel prompt a informazioni non ammissibili. Presentiamo un quadro di verifica dell’ammissibilità del recupero che assegna a ogni coppia memoria-query uno di tre stati (ammissibile, non ammissibile o irrisolto), confronta i percorsi a parità di recall delle evidenze richieste, con limiti per i casi irrisolti, e traccia gli ID delle memorie fino all’esposizione nel prompt, collegando tale esposizione alla divulgazione a livello di obiettivo. Valutiamo le sue fasi su popolazioni distinte, senza accorparle. Una rianalisi a posteriori delle prime 20 posizioni di classifiche fissate provenienti da due benchmark pubblici sulla memoria a lungo termine, RHELM e MemOps, comprende 3.767 query. Tutte le ancore rese disponibili si trovano negli spazi dei nomi fidati delle query; poiché i punteggi all’interno degli spazi dei nomi restano invariati, filtrare gli elementi esterni non può peggiorare il posizionamento delle ancore. Il recall delle ancore nelle prime 20 posizioni sale da 0,432 a 0,533, la fattibilità di un recall dell’80% passa da 0,237 a 0,311 e le valutazioni esatte della similarità diminuiscono del 98,3%. In un’analisi diagnostica di sviluppo su 72 casi fissati, un riferimento basato sui metadati resi disponibili conserva le evidenze richieste, mentre nessuno dei due verificatori basati solo sul testo rileva violazioni rispettando il limite dell’1% sui falsi rifiuti delle ancore richieste. Su 1.523 casi appaiati tratti direttamente dai benchmark, l’instradamento per spazio dei nomi è associato a incrementi della correttezza valutata compresi tra 0,053 e 0,068 per tre lettori; anche il recall cambia, quindi il confronto è osservazionale. In 16 scenari di esposizione controllati, solo uno dei quattro intervalli di confidenza al 95% specifici per lettore esclude lo zero per la divulgazione letterale di informazioni pertinenti ma non ammissibili (+0,156, IC al 95% [0,031, 0,312]). I risultati indicano l’opportunità di verificare separatamente il supporto dei candidati, l’ammissibilità, l’esposizione nel prompt e la divulgazione nella risposta.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv