Ricerca
Oltre la memoria: sfruttare gli agenti su lunghi orizzonti con stati di credenza espliciti
Gli agenti basati su modelli linguistici di grandi dimensioni (LLM) possono ormai affrontare compiti sempre più complessi, ma il modo in cui organizzano la cronologia delle interazioni nella memoria n

- arXiv
- 2610.01415
- Pubblicato
- 2026-10-01
- Autori
- Yu Luo, Jiamin Jiang, Yimin Zuo, Xidao Wen, Rongchen Gao, Yongqian Sun, Shenglin Zhang, Guiyang Liu, Cheng Zhang, Fang Situ, Qi Zhou, Dan Pei
Abstract degli autori
Gli agenti basati su modelli linguistici di grandi dimensioni (LLM) possono ormai affrontare compiti sempre più complessi, ma il modo in cui organizzano la cronologia delle interazioni nella memoria non garantisce una comprensione coerente dello stato attuale del mondo. Presentiamo PoS, un framework che, durante l’inferenza, costruisce e aggiorna continuamente stati di credenza espliciti come contesto per le decisioni dell’agente. Ogni stato di credenza combina una stima dello stato attuale del mondo con i requisiti del compito ancora irrisolti, rendendo esplicito ciò che l’agente deve ancora apprendere e portare a termine. Per mantenere affidabile e utilizzabile questo stato di credenza, PoS ne verifica la coerenza e monitora l’avanzamento del compito per rilevare il Belief Trapping: una situazione in cui l’agente continua ad agire senza compiere progressi significativi verso l’obiettivo. Il recupero viene quindi adattato sia alla modalità di blocco sia al tipo di requisito del compito ancora irrisolto. Esperimenti su quattro benchmark che riguardano esecuzione e diagnosi mostrano che PoS ottiene le migliori prestazioni complessive in ciascun benchmark con tutti e tre i modelli LLM di base. Gli studi di ablazione dimostrano l’importanza della verifica della coerenza e del recupero, mentre gli esperimenti sulla scalabilità del contesto mostrano una buona tenuta all’aumentare delle sue dimensioni. Nel complesso, questi risultati indicano che costruire e aggiornare continuamente stati di credenza può costituire una base per gestire il contesto su lunghi orizzonti, andando oltre la conservazione e la compressione della cronologia.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv