Ricerca
DAGent: pianificazione Evaluate-then-Grow per agenti di ricerca approfondita
I compiti di ricerca approfondita richiedono agli agenti di orientarsi in vasti spazi di conoscenza, sintetizzare evidenze provenienti da molte fonti e adattare i propri piani man mano che emergono nu

- arXiv
- 2609.39154
- Pubblicato
- 2026-09-30
- Autori
- Hanwen Liu, Yuanfu Sun, Qiaoyu Tan
Abstract degli autori
I compiti di ricerca approfondita richiedono agli agenti di orientarsi in vasti spazi di conoscenza, sintetizzare evidenze provenienti da molte fonti e adattare i propri piani man mano che emergono nuovi risultati. I sistemi multiagente basati su grafi aciclici orientati (DAG) si prestano a questo contesto perché consentono l’esecuzione parallela e collocano ogni sottoattività in un contesto di dipendenze circoscritto. Tuttavia, gli agenti basati su DAG esistenti definiscono un piano per l’intero compito prima dell’esecuzione e correggono il grafo solo dopo aver rilevato errori o lacune nelle evidenze. Questa strategia Plan-then-Patch è fragile nella ricerca approfondita: il sistema assume gli impegni più vincolanti proprio quando dispone delle evidenze più deboli, e le revisioni successive sprecano risorse di calcolo su rami che non avrebbero dovuto essere pianificati. Proponiamo DAGent, un framework multiagente basato su DAG che adotta la pianificazione incrementale Evaluate-then-Grow: un Orchestrator espande il grafo delle attività un gruppo alla volta, basando ogni espansione sui segnali di fiducia e incertezza provenienti dai nodi completati. Un livello gerarchico di contesto trasmette per impostazione predefinita QueryDocs compatti, conservando al tempo stesso le tracce complete dell’esecuzione per consultarle quando necessario. La topologia del DAG registrata permette di definire segnali strutturali per l’apprendimento per rinforzo che i metodi basati soltanto sul risultato non possono definire; DAGRPO, un adattamento di GRPO, introduce un’attribuzione del merito condizionata dalla topologia nei rollout degli Executor e una regolarizzazione della conformità strutturale nei piani dell’Orchestrator. Su BrowseComp-Plus, GAIA e xbench-DeepSearch, DAGent supera il più forte termine di confronto open source rispettivamente di 5,3 / 5,8 / 2,0 punti alla scala di Qwen3-235B-A22B; il vantaggio si conferma con quattro modelli di base open source e si estende a GPT-5 con un contesto di 327K. Alla scala di Qwen3-8B, DAGRPO ottiene in media 3,0 punti Pass@1 in più rispetto a un termine di confronto GRPO basato solo sul risultato e con lo stesso budget. Un confronto a parità di architettura mostra che la pianificazione basata sulle evidenze raggiunge una maggiore accuratezza usando meno token, chiamate agli strumenti e passaggi per compito rispetto alla corrispondente strategia Plan-then-Patch. Codice: https://github.com/hanwenliu6825/DAGent
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv