Vai al contenuto
AI.info

Ricerca

HarnessDev: gli LLM possono creare e far evolvere il proprio agent harness?

Man mano che gli agenti passano da prototipi di ricerca a strumenti impiegati nella pratica, le loro capacità dipendono sempre più dall’infrastruttura di esecuzione esterna al modello, comunemente chi

HarnessDev: gli LLM possono creare e far evolvere il proprio agent harness?
arXiv
2609.01437
Pubblicato
2026-09-01
Autori
Yuhao Wu, Jingyuan Zhang, Jiajun Shi, Xinping Lei, Qingshui Gu, Yuxuan Zhang, Zexuan Wang, Chen He, Chen Huang, Maojia Song, Zhiyuan Zeng, Shaowen Wang, Jinkai Liu, Yunfeng Shi, Jiaheng Liu, Shen Yan, Wenhao Huang, Ge Zhang, Wenxuan Zhang

Abstract degli autori

Man mano che gli agenti passano da prototipi di ricerca a strumenti impiegati nella pratica, le loro capacità dipendono sempre più dall’infrastruttura di esecuzione esterna al modello, comunemente chiamata agent harness. Modificare questa infrastruttura senza cambiare i pesi del modello può alterare in modo sostanziale le prestazioni nei compiti. Le valutazioni degli agenti riportano di norma le prestazioni nei compiti a valle con un harness prestabilito, mentre la capacità di un modello di sviluppare l’harness stesso resta relativamente poco esplorata. Presentiamo HarnessDev, un benchmark che sposta l’unità di valutazione dai risultati dei compiti a un’infrastruttura eseguibile. HarnessDev comprende due fasi. Nella fase di creazione, l’agente parte da una base minima e da un numero limitato di casi, per poi costruire un sistema di esecuzione completo. Nella fase di evoluzione, parte dall’harness che ha creato e lo modifica iterativamente in base ai riscontri ottenuti dall’esecuzione dei compiti a valle, con l’obiettivo di migliorare le prestazioni nei benchmark. Valutiamo quindi ogni harness costruito in termini di capacità (successo nei compiti su benchmark tenuti da parte) ed efficienza (costo in token di esecuzione). I risultati riportati per la fase di creazione riguardano sei LLM impiegati per la creazione, quattro ambiti e cinque benchmark a valle, per un totale di 2.207 istanze distinte, con compiti di valutazione nascosti esclusi dalla fase di sviluppo. Riscontriamo che gli harness generati restano notevolmente indietro rispetto ai sistemi di riferimento consolidati e progettati da esseri umani nella scrittura di codice e nelle attività di ricerca di informazioni e di ricerca, mentre eguagliano o superano i sistemi di riferimento selezionati nella scrittura e nella sperimentazione nel machine learning, con ampie differenze nel costo di esecuzione. La fase di evoluzione produce alcuni miglioramenti delle prestazioni, ma sono instabili e si trasferiscono solo in parte ai compiti tenuti da parte. Esperimenti con un modello di esecuzione fisso mostrano inoltre che i miglioramenti dipendono fortemente dal modello che esegue l’harness, indicando una trasferibilità limitata tra modelli.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv