Ricerca
EvoHarnessBench: i tuoi agenti riescono a tenere il passo con un harness in evoluzione?
I moderni agenti basati su LLM operano attraverso un harness di strumenti, skill riutilizzabili e agenti specializzati, che determina ciò che possono osservare e fare. Nella pratica, questo harness ev

- arXiv
- 2609.04280
- Pubblicato
- 2026-09-14
- Autori
- Zixuan Ke, Vaidehi Patil, Haizhou Shi, Yang Li, Ye Liu, Sarath Shekkizhar, Anurag Koul, Jiayu Wang, Xuan Phi Nguyen, Semih Yavuz, Mohit Bansal, Shafiq Joty
Abstract degli autori
I moderni agenti basati su LLM operano attraverso un harness di strumenti, skill riutilizzabili e agenti specializzati, che determina ciò che possono osservare e fare. Nella pratica, questo harness evolve continuamente con l’aggiunta di nuove capacità. Presentiamo EVOHARNESSBENCH, un benchmark per valutare gli agenti mentre l’harness evolve in modo controllato lungo tre assi: strumenti, skill e agenti. A differenza dei benchmark esistenti sull’apprendimento continuo degli agenti, che in genere collocano la non stazionarietà (ossia ciò che cambia nel tempo) nella sequenza dei compiti mantenendo fisso l’harness, EVOHARNESSBENCH la colloca nell’harness stesso, fornito dall’esterno. Comprende 17 sequenze di evoluzione dell’harness articolate in più fasi e costruite in modo deterministico a partire da benchmark basati su verificatori, per un totale di 802 compiti, 520 strumenti, 42 skill e 62 agenti. Valutiamo due scenari complementari, corrispondenti alle sfide centrali dell’evoluzione dell’harness: la valutazione in fase di deployment, che isola la capacità di mantenere competenze già accessibili man mano che l’harness si amplia, e la valutazione dell’adattamento autoevolutivo, che verifica se l’esperienza accumulata resta utile quando vengono introdotte nuove capacità. I risultati rivelano tre lacune persistenti. Primo, il solo ampliamento dell’harness può peggiorare le prestazioni su compiti già risolti, causando una perdita di competenze dovuta all’harness. Secondo, i miglioramenti ottenuti con l’adattamento autoevolutivo restano incostanti tra le diverse fasi dell’evoluzione dell’harness, i diversi assi delle capacità e i diversi ambienti. Terzo, il mantenimento delle competenze e l’adattamento possono procedere in direzioni diverse: preservare le competenze precedenti non migliora necessariamente l’adattamento alle capacità appena introdotte, e viceversa. Questi risultati mostrano che l’evoluzione dell’harness è una sfida a sé per la costruzione di agenti capaci di tenere il passo con un harness in evoluzione, preservando al tempo stesso i comportamenti che si erano già dimostrati efficaci.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv