Vai al contenuto
AI.info

Ricerca

PARSER: leggere in parallelo, ragionare in profondità per agenti LLM con contesti lunghi

Gli agenti con memoria sequenziale elaborano documenti lunghi leggendo un blocco dopo l’altro e mantenendo uno stato di memoria compatto. In questo modo, la lettura del documento resta legata alla pro

PARSER: leggere in parallelo, ragionare in profondità per agenti LLM con contesti lunghi
arXiv
2609.06702
Pubblicato
2026-09-06
Autori
Kun Li, Zexuan Qiu, Tianhua Zhang, Irwin King, Helen Meng

Abstract degli autori

Gli agenti con memoria sequenziale elaborano documenti lunghi leggendo un blocco dopo l’altro e mantenendo uno stato di memoria compatto. In questo modo, la lettura del documento resta legata alla profondità del ragionamento: il risultato diventa sensibile alla posizione delle evidenze e il tempo di inferenza cresce linearmente con la lunghezza del documento. Presentiamo PARSER, che separa la lettura dal ragionamento. Un insieme di subagenti leggeri, ciascuno assegnato a un solo blocco, legge in parallelo l’intero documento, mentre un agente principale ragiona in profondità attraverso cicli iterativi di distribuzione e raccolta: a ogni ciclo invia una query a tutti i subagenti, aggrega le evidenze ricevute e formula una query successiva più approfondita sulla base di quanto trovato fino a quel momento. In questa architettura, tutti i comportamenti apprendibili sono concentrati nell’agente principale, ottimizzato mediante apprendimento per rinforzo, mentre i subagenti sono modelli preesistenti i cui parametri restano invariati. Nei compiti di domande e risposte a più passaggi, con contesti da 7K a 896K token, PARSER con un backbone 4B supera la migliore baseline con memoria sequenziale di 5,7 punti in media e di 12,0 punti a 896K token. Passando a un backbone 9B, PARSER supera DeepSeek-V4-Pro di 6,3 punti. Esperimenti controllati confermano che PARSER è robusto alle variazioni nella posizione, nell’ordine e nella distanza delle evidenze, condizioni che provocano forti oscillazioni dell’accuratezza nei metodi sequenziali, e riduce il tempo di inferenza fino a 11 volte.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv