Vai al contenuto
AI.info

Ricerca

Mid-Harness: scaling delle azioni tra modello e harness per gli agenti da terminale

Gli agenti da terminale agiscono sulla base di generazioni stocastiche del modello, ma saper generare un’azione utile non ne garantisce l’esecuzione affidabile. Un comando inadeguato, per esempio l’in

Mid-Harness: scaling delle azioni tra modello e harness per gli agenti da terminale
arXiv
2609.39982
Pubblicato
2026-09-30
Autori
Minki Kang, Ryo Hachiuma, Shaokun Zhang, Subhashree Radhakrishnan, Yonggan Fu, Jindong Jiang, Mingjie Liu, Ehsan Hosseini-Asl, Yi Dong, Yu-Chiang Frank Wang, Byung-Kwan Lee

Abstract degli autori

Gli agenti da terminale agiscono sulla base di generazioni stocastiche del modello, ma saper generare un’azione utile non ne garantisce l’esecuzione affidabile. Un comando inadeguato, per esempio l’installazione del pacchetto sbagliato, può modificare l’ambiente in modi che ostacolano i progressi successivi, anche quando il modello sarebbe in grado di generare un’alternativa migliore. Esaminiamo se assegnare risorse di calcolo in fase di test al confine tra modello e harness possa migliorare l’affidabilità delle azioni e il successo delle traiettorie, e che cosa renda efficace questa scelta. Per studiare queste domande, introduciamo Mid-Harness, che campiona e verifica azioni candidate prima di inoltrarne una per l’esecuzione, senza modificare il generatore né l’harness. Con un generatore TMAX-9B, campionare più azioni offre pochi benefici se la verifica è poco efficace, mentre un verificatore capace può sfruttare le alternative utili prodotte dallo stesso generatore. Su TerminalBench-Lite, un verificatore GPT-5.6 Sol porta Pass@1 dal 50,00% dell’agente di base al 68,03% con 8 azioni campionate. Quando lo stesso modello TMAX-9B funge da verificatore, la verifica a coppie ottiene i risultati migliori tra i meccanismi di verifica valutati. Distillare in TMAX-9B le risposte del verificatore più potente migliora ulteriormente Pass@1, lasciando invariato il generatore di azioni. Con TMAX-9B su TerminalBench-Lite, combinare lo scaling delle azioni e quello delle traiettorie consente di raggiungere un tasso di successo più alto, con un costo stimato in token inferiore rispetto alla sola generazione di un maggior numero di traiettorie. Mid-Harness migliora inoltre le prestazioni con altri modelli, benchmark e harness. Questi risultati indicano nello scaling delle azioni un obiettivo promettente per aumentare le risorse di calcolo in fase di test degli agenti da terminale.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv