Ricerca
Memoria just-in-time: imparare a selezionare memorie adattive al compito per agenti LLM
I sistemi di memoria per agenti riutilizzano le esperienze passate per migliorare le prestazioni future, ma la maggior parte delle soluzioni esistenti seleziona i ricordi al momento della scrittura: u

- arXiv
- 2609.27334
- Pubblicato
- 2026-09-23
- Autori
- Yefan Zhou, Yang Li, Zeyu Leo Liu, Semih Yavuz, Shafiq Joty
Abstract degli autori
I sistemi di memoria per agenti riutilizzano le esperienze passate per migliorare le prestazioni future, ma la maggior parte delle soluzioni esistenti seleziona i ricordi al momento della scrittura: una volta completato un compito, la sua traiettoria viene condensata in un artefatto fisso, come una riflessione, un flusso di lavoro, una competenza o una strategia di ragionamento, che in seguito viene recuperato in base alla somiglianza. In questo modo, il sistema deve decidere che cosa vale la pena ricordare prima di conoscere la futura query, scartando informazioni in modo irreversibile e producendo un riepilogo indipendente dalla query, che deve servire a molti possibili compiti successivi. Anche imparare a selezionare i ricordi al momento della scrittura è difficile, perché il valore di una decisione su cosa archiviare potrebbe emergere solo quando arriva una query pertinente, magari molti compiti più tardi: si crea così un problema di attribuzione del merito su un orizzonte temporale lungo. Noi conserviamo invece le traiettorie grezze e rimandiamo la selezione dei ricordi al momento della lettura, quando il compito corrente è noto. Sulla base delle tracce recuperate e del nuovo compito, un selettore di memoria sintetizza un contenuto compatto e adattato al compito, pensato per l’esigenza immediata. Poiché questo contenuto viene utilizzato nello stesso compito, il selettore può essere addestrato direttamente sulla riuscita immediata del compito, evitando segnali di utilità ritardati e la necessità di raggruppare artificialmente compiti correlati. Su ALFWorld, WebShop e $τ^2$-bench, la nostra Just-in-Time Memory (JitMem) supera con regolarità sia gli agenti senza memoria sia i metodi euristici e appresi che selezionano i ricordi al momento della scrittura, migliorando il risultato del baseline più forte rispettivamente di 16,2, 16,3 e 3,9 punti percentuali assoluti nel tasso di successo. È degno di nota che anche un selettore non addestrato sia già competitivo con questi baseline o li superi, mostrando che la selezione dei ricordi adattata al compito al momento della lettura è di per sé una fonte importante del guadagno; addestrare ulteriormente il selettore amplifica il miglioramento.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv