Vai al contenuto
AI.info

Ricerca

ActiveSaddler: apprendimento automatizzato del curriculum per l’ottimizzazione degli harness degli agenti

L’ottimizzazione automatizzata degli harness può migliorare notevolmente gli agenti basati su LLM aggiornandone in modo iterativo i prompt, le interfacce degli strumenti e la logica di controllo sulla

ActiveSaddler: apprendimento automatizzato del curriculum per l’ottimizzazione degli harness degli agenti
arXiv
2610.00906
Pubblicato
2026-10-01
Autori
Sungho Park, Wonjoong Kim, Jue Zhang, Wook-Shin Han, Pengfei Gao, Chanyoung Park, Yongqiang Yao, Rao Fu, Elsie Nallipogu, Qingwei Lin, Victor Rühle

Abstract degli autori

L’ottimizzazione automatizzata degli harness può migliorare notevolmente gli agenti basati su LLM aggiornandone in modo iterativo i prompt, le interfacce degli strumenti e la logica di controllo sulla base del feedback ottenuto durante l’esecuzione. Tuttavia, i metodi esistenti ottimizzano soprattutto il modo in cui viene aggiornato l’harness, mentre lasciano sostanzialmente invariati gli scenari di addestramento che generano il feedback alla base di quegli aggiornamenti. Man mano che l’harness evolve, gli scenari più utili per ottimizzarlo ulteriormente possono cambiare: anche il curriculum di addestramento dovrebbe quindi adattarsi insieme all’harness. Formuliamo questa dimensione finora trascurata dell’ottimizzazione degli harness come un problema di apprendimento automatizzato del curriculum e introduciamo ActiveSaddler. ActiveSaddler modella il curriculum in evoluzione come un problema del bandito non stazionario con obiettivi di ottimizzazione definiti dinamicamente. Raggruppa gli errori ricorrenti in schemi riutilizzabili, trattati come bracci del bandito; stima i potenziali progressi nell’apprendimento ottenibili concentrandosi ulteriormente su ciascuno schema; e bilancia in modo adattivo il ritorno sulle debolezze note con l’esplorazione di scenari non ancora esaminati alla ricerca di nuove debolezze. I risultati dell’ottimizzazione aggiornano continuamente sia l’insieme degli schemi di errore individuati sia le loro priorità, consentendo al curriculum di evolvere insieme all’harness. Gli esperimenti su GAIA2 e Terminal-Bench 2.0 mostrano che ActiveSaddler individua sistematicamente harness più efficaci, migliorando il Pass@1 nei test rispettivamente di 4,4 e 7,5 punti percentuali rispetto allo stesso ottimizzatore di harness che usa una sequenza di scenari fissata prima dell’ottimizzazione. Gli studi di ablazione mostrano inoltre che questi miglioramenti dipendono dalla definizione dinamica degli obiettivi di ottimizzazione, dalla stima della loro utilità man mano che evolve e dal bilanciamento tra il proseguimento dell’ottimizzazione e la scoperta di nuovi errori. Nel complesso, questi risultati indicano che l’apprendimento automatizzato del curriculum è una nuova dimensione cruciale dell’ottimizzazione degli harness.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv