Ricerca
IterSynth: ripensare gli agenti di ricerca approfondita con la sintesi iterativa e la separazione dei ruoli
La ricerca approfondita richiede agli agenti basati su LLM di scomporre query complesse, cercare prove e sintetizzare risposte fondate su di esse; gli agenti ReAct esistenti presentano però due limiti

- arXiv
- 2609.29444
- Pubblicato
- 2026-09-24
- Autori
- Xingyu Wu, Yuchen Yan, Zhengxi Lu, Siqi Chen, Xin ZHANG, Aiting Liu, Chao Deng, Jie Liu, Jin Ma, Jian Shao, Jun Xiao, Yongliang Shen
Abstract degli autori
La ricerca approfondita richiede agli agenti basati su LLM di scomporre query complesse, cercare prove e sintetizzare risposte fondate su di esse; gli agenti ReAct esistenti presentano però due limiti: l’accoppiamento dei ruoli, per cui un’unica policy deve occuparsi della pianificazione, dell’uso delle prove e della sintesi; e l’accumulo di contesto, per cui l’aumento dello storico delle ricerche introduce rumore e rende meno visibili le informazioni utili. Per affrontare questi problemi, proponiamo IterSynth, un paradigma basato sulla separazione dei ruoli e sui riassunti, che alterna un Planner, incaricato di individuare le esigenze informative, e un Synthesizer, che integra le prove in uno stato riassuntivo in evoluzione. Questo approccio separa la pianificazione dalla sintesi e usa il riassunto come stato persistente della ricerca, riducendo sia l’accoppiamento delle capacità sia il rumore nel contesto. Per addestrare IterSynth in modo efficace, introduciamo inoltre Role-Decoupled Policy Optimization (RDPO) per l’apprendimento per rinforzo, che combina ricompense per l’esito finale con valutazioni per turno basate su rubriche e calcola vantaggi specifici per ciascun ruolo, così da attribuire il merito con maggiore precisione. Gli esperimenti su cinque benchmark di ricerca approfondita a orizzonte lungo, tra cui BrowseComp e Xbench-DS, mostrano che IterSynth-8B ottiene un punteggio medio di 50,7, superando di +4,2% l’agente precedente più performante con dimensione $\leq$8B. Inoltre, IterSynth funge da paradigma di prompting indipendente dal modello e offre miglioramenti sostanziali in modalità zero-shot rispetto a ReAct e a paradigmi di prompting simili sui modelli proprietari più avanzati.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv