Vai al contenuto
AI.info

Ricerca

Evoluzione degli ambienti per gli agenti da terminale

Ampliare la disponibilità di ambienti interattivi e verificabili è fondamentale per addestrare gli agenti da terminale. Man mano che i modelli di frontiera diventano più capaci, gli ambienti sintetizz

Evoluzione degli ambienti per gli agenti da terminale
arXiv
2609.04128
Pubblicato
2026-09-03
Autori
Zhiyuan Fan, Tinghao Yu, Yuanjun Cai, Jiang Zhou, Jiangtao Guan, Jincheng Liu, Yun Yang, Dingxin Hu, Zhuo Han, Xing Wu, Feng Zhang, Lilin Wang

Abstract degli autori

Ampliare la disponibilità di ambienti interattivi e verificabili è fondamentale per addestrare gli agenti da terminale. Man mano che i modelli di frontiera diventano più capaci, gli ambienti sintetizzati da zero diventano meno impegnativi e forniscono quindi segnali di apprendimento limitati. I recenti metodi di coevoluzione sintetizzano iterativamente ambienti vicini alla frontiera di ciò che il modello può apprendere, basandosi sui punti deboli emersi durante i rollout. Tuttavia, la loro dipendenza dai rollout on-policy limita la generalizzazione e la capacità di fornire continuamente segnali di apprendimento mentre il modello diventa più potente. In questo articolo proponiamo l’evoluzione degli ambienti: aumentiamo progressivamente la loro difficoltà off-policy e, durante l’addestramento, introduciamo gli ambienti evoluti generazione dopo generazione, così da fornire segnali di apprendimento continui. Ricaviamo dall’obiettivo di apprendimento multi-turno tre direzioni evolutive che influiscono sulla difficoltà degli ambienti e realizziamo poi l’evoluzione lungo queste direzioni mediante un’infrastruttura multiagente progettata attorno a un ciclo. Esperimenti quantitativi sui rollout con Hy4 preview, Claude Opus 5 e GPT-5.6 Sol mostrano che l’evoluzione degli ambienti produce sistematicamente ambienti più difficili. Ne verifichiamo l’efficacia su Qwen3.6-27B e Qwen3.6-35B-A3B con un semplice addestramento tramite apprendimento per rinforzo su orizzonti lunghi, migliorandone le prestazioni su Terminal-Bench 2.1 rispettivamente di 14,4 e 18,0 punti percentuali.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv