Ricerca
AREX-2: verso agenti capaci di migliorarsi autonomamente attraverso compiti di riflessione su orizzonti lunghi
Presentiamo AREX-2, un progetto volto a sviluppare la capacità degli agenti basati su modelli linguistici di grandi dimensioni di migliorarsi autonomamente, che definiamo come la capacità di perfezion

- arXiv
- 2609.38288
- Pubblicato
- 2026-09-29
- Autori
- Hongjin Qian, Chaofan Li, Kun Luo, Wenqing Wei, Jianlyu Chen, Shuqi Lu, Yuyang Hu, Hongwang Xiao, Hui Wang, Chaozhuo Li, Qiwei Ye, Zhicheng Dou, Defu Lian, Zheng Liu
Abstract degli autori
Presentiamo AREX-2, un progetto volto a sviluppare la capacità degli agenti basati su modelli linguistici di grandi dimensioni di migliorarsi autonomamente, che definiamo come la capacità di perfezionare iterativamente una soluzione in fase di test. Questa capacità poggia su due componenti complementari: la riflessione, che produce una soluzione migliore di quella attuale, e l’esecuzione su orizzonti lunghi, che mantiene efficace il processo iterativo per molti cicli. Ipotizziamo che entrambe siano indipendenti dal dominio e possano quindi essere apprese in contesti adatti alla supervisione. A questo scopo, generiamo traiettorie di miglioramento su orizzonti lunghi a partire da compiti di apprendimento automatico e di programmazione algoritmica: due ambiti che offrono riscontri verificabili e premiano la continuità del processo iterativo. Addestrato su questi dati, il nostro agente, basato su Qwen3.8-27B, ottiene risultati elevati su MLE-bench Lite (81,8) e Frontier-CS (70,7). Le sue capacità si trasferiscono anche alla ricerca approfondita, con 84,0 su BrowseComp, 52,6 su HLE, 92,2 su GAIA e 93,8 su DeepSearchQA; inoltre, l’agente continua a migliorare all’aumentare del budget di cicli. Questi risultati mostrano che i dati di riflessione su orizzonti lunghi sono una via efficace per sviluppare agenti capaci di migliorarsi autonomamente.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv