Vai al contenuto
AI.info

Ricerca

T1: apprendimento per rinforzo di agenti da terminale per compiti a lungo termine

L’impiego degli agenti si sta spostando verso compiti a lungo termine, come la programmazione e la scoperta scientifica; tra questi, i compiti svolti tramite terminale sono particolarmente importanti.

T1: apprendimento per rinforzo di agenti da terminale per compiti a lungo termine
arXiv
2609.11042
Pubblicato
2026-09-10
Autori
Junyao Yang, Yucheng Shi, Zhongzhi Li, Ruhan Wang, Zongxia Li, Haitao Mi, Leowei Liang

Abstract degli autori

L’impiego degli agenti si sta spostando verso compiti a lungo termine, come la programmazione e la scoperta scientifica; tra questi, i compiti svolti tramite terminale sono particolarmente importanti. Presentiamo T1, un modello Mixture-of-Experts da 122 miliardi di parametri complessivi, addestrato con l’apprendimento per rinforzo. T1 opera in una shell reale all’interno di una sandbox cloud per oltre 300 turni di chiamate agli strumenti per compito e riceve una ricompensa basata sull’esecuzione del verificatore specifico di ciascun compito. Forniamo una procedura completa. Primo, una fase di warm start particolarmente spinta per stabilizzare l’addestramento actor-critic, con una ricompensa di processo densa che valuta le traiettorie in base al numero assoluto di verificatori che danno esito positivo. Secondo, un’ottimizzazione stabile attraverso la costruzione di TITO, l’addestramento sugli identificativi esatti dei token campionati con correzione della deriva ai confini tra i turni e il replay dell’instradamento durante i rollout, che registra le scelte dell’esperto effettuate dal campionatore per ciascun token a ogni livello MoE e le riproduce durante l’addestramento. Terzo, un corpus di addestramento interamente fuori distribuzione: seed isolati e compiti sintetizzati, distinti da quelli di Terminal-Bench 2.1, assicurano che i miglioramenti riflettano un’effettiva capacità di trasferimento, anziché un adattamento eccessivo al benchmark. Insieme, TITO e R3 riducono da 0,021 a 0,013 la differenza tra le log-probabilità in addestramento e in inferenza, con una deriva dei token pari esattamente a zero nella regione di calcolo della loss. Su Terminal-Bench 2.1, la nostra pipeline di post-addestramento porta il modello di base iniziale dal 43,8% a T1, che risolve il 64,0% dei compiti. Su Long-Horizon Terminal Bench, T1 raggiunge il 27,9% e supera GPT-5.4 e GLM-5.1.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv