Ricerca
Terminal-Universe: dalle traiettorie degli agenti ad ambienti terminale scalabili
Con la crescente diffusione degli agenti di programmazione basati sul terminale, le loro traiettorie si sono accumulate su larga scala, mentre gli ambienti realistici ed eseguibili restano scarsi. Epp

- arXiv
- 2609.04148
- Pubblicato
- 2026-09-03
- Autori
- Jie Wu, Zhenru Zhang, Beichen Zhang, Xuwu Wang, Yuhui Su, Mouxiang Chen, Peng Wang, Zhihai Wang, Que Shen, Hao Zhou, An Yang, Fei Huang, Yujiu Yang, Dayiheng Liu
Abstract degli autori
Con la crescente diffusione degli agenti di programmazione basati sul terminale, le loro traiettorie si sono accumulate su larga scala, mentre gli ambienti realistici ed eseguibili restano scarsi. Eppure, è degli ambienti che ha bisogno la fase di addestramento successiva degli agenti: ciascuno può essere interrogato più volte per ricavarne molti compiti verificabili e fornisce riscontri sull’esecuzione, mentre una traiettoria è un’unica dimostrazione statica. Anziché generare ambienti da zero, osserviamo che la cronologia delle operazioni eseguite dagli strumenti nelle traiettorie esistenti rivela la struttura e il contenuto degli ambienti in cui sono state prodotte, rendendo possibile ricostruire quegli ambienti a partire dalle traiettorie stesse. Presentiamo quindi Terminal-Universe, un framework che trasforma ogni traiettoria in un ambiente riutilizzabile e lo esplora per generare nuovi compiti e interazioni successive. Nello specifico, Terminal-Universe riproduce le operazioni sui file registrate in una traiettoria per ripristinare ciascun file allo stato precedente alle modifiche dell’agente, ottenendo uno spazio di lavoro parziale; un agente di completamento aggiunge poi i file e le dipendenze mancanti. In questo spazio di lavoro ricostruito, ricostruiamo sia il compito corrispondente all’intento originale sia compiti del tutto nuovi. Inoltre, ampliamo i compiti lungo due assi complementari: ampiezza e profondità. Per l’ampiezza, individuiamo relazioni di dipendenza direzionali tra ambienti correlati e generiamo richieste trasversali a più spazi di lavoro, che coinvolgono diverse basi di codice, come fanno abitualmente gli sviluppatori nel lavoro reale. Per la profondità, estendiamo la richiesta iniziale a turno singolo in una sessione a più turni che, tramite un agente utente, coglie i riscontri iterativi dell’utente e il perfezionamento dei requisiti. Applicato a traiettorie pubbliche di agenti che operano nel terminale, Terminal-Universe produce 37,3 mila ambienti sufficienti per svolgere i compiti. Il fine-tuning supervisionato di Qwen3.5-27B su questo corpus migliora le prestazioni a turno singolo su Terminal-Bench 2.1 di 11,9 punti e quelle a più turni su EvoCode-Bench v2 MT@4 di 13,8 punti.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv