Ricerca
Potenziare gli agenti di ricerca automatica con modelli del mondo
Automatizzare la ricerca empirica è da tempo un obiettivo dell’IA. I recenti agenti di ricerca automatica (AutoResearch) lo rendono più vicino, perché i moderni LLM mostrano di saper implementare solu

- arXiv
- 2608.12564
- Pubblicato
- 2026-08-12
- Autori
- Xiyuan Yang, Sheikh Sarwar, Jingru Cheng, Zhan Shi, Duanshun Li, Huiyuan Chen, Haiyang Zhang, Xing Fan, Chenlei Guo, Jingrui He, Zhenyu Liao
Abstract degli autori
Automatizzare la ricerca empirica è da tempo un obiettivo dell’IA. I recenti agenti di ricerca automatica (AutoResearch) lo rendono più vicino, perché i moderni LLM mostrano di saper implementare soluzioni in autonomia e imparare dai risultati della loro esecuzione. L’addestramento successivo, soprattutto tramite apprendimento per rinforzo (RL), ha un ruolo centrale in questi progressi. In questo articolo individuiamo una tensione fondamentale nel potenziamento dell’RL per questi agenti: le due componenti di ogni traiettoria AutoResearch — la generazione da parte dell’agente e l’esecuzione nell’ambiente — scalano in modi molto diversi. Tutte le operazioni di generazione condividono infatti le risorse di calcolo tramite batching, mentre ogni esecuzione occupa una sandbox dedicata e richiede tempo macchina reale. Di conseguenza, l’esecuzione nell’ambiente domina i costi di addestramento e diventa il collo di bottiglia man mano che le traiettorie aumentano. Per risolvere questa tensione proponiamo World Model RL (WMRL), che sostituisce l’esecuzione nell’ambiente con un modello del mondo, eliminando così il collo di bottiglia. Il modello del mondo, tuttavia, può essere imperfetto: le ricompense che produce possono essere alterate da distorsioni e rumore. Per questo dotiamo WMRL di due ulteriori meccanismi di mitigazione, Online Debiasing e Inverse-Variance Denoising, che rispettivamente compensano le distorsioni e attenuano il rumore. Sul piano teorico dimostriamo che entrambi migliorano in senso stretto la garanzia di convergenza. Sul piano empirico, WMRL accelera l’addestramento di 3-4 volte su diversi compiti e con agenti di diverse dimensioni, superando al contempo le prestazioni dei baseline RL standard. Inoltre, i nostri agenti 4B e 9B sottoposti ad addestramento successivo superano, su benchmark tenuti da parte per la valutazione, agenti a pesi aperti molto più grandi, da 48B e 120B. Oltre che ad AutoResearch, WMRL si applica anche all’addestramento successivo di politiche VLA incarnate, dimostrando la generalizzabilità del nostro metodo.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv