Ricerca
SkillForge: coevoluzione delle competenze e degli agenti attraverso cicli di vita dinamici delle competenze
L’apprendimento per rinforzo potenziato dalla memoria rafforza la capacità degli agenti basati su LLM di risolvere compiti complessi che richiedono molti passaggi. Le skill sono una forma di memoria d

- arXiv
- 2610.09832
- Pubblicato
- 2026-10-07
- Autori
- Yuyao Ge, Yiwei Wang, Yuchen He, Baolong Bi, Lingrui Mei, Jiayu Yao, Lizhe Chen, Shenghua Liu
Abstract degli autori
L’apprendimento per rinforzo potenziato dalla memoria rafforza la capacità degli agenti basati su LLM di risolvere compiti complessi che richiedono molti passaggi. Le skill sono una forma di memoria di questo tipo: associano istruzioni a una condizione che ne determina l’applicabilità a diversi tipi di compiti. Tuttavia, conservare indiscriminatamente ogni skill mentre la policy migliora permette l’accumulo di voci obsolete o dannose, che possono trarre in inganno l’agente. Proponiamo SkillForge, un metodo di apprendimento per rinforzo basato su agenti che costruisce ed evolve la libreria di skill attraverso un ciclo di vita guidato dalla fitness, con stati di prova, attivo, stabile e ritirato, così che le skill e il modello evolvano insieme durante l’addestramento. Prima dell’apprendimento per rinforzo, una fase di valutazione usa le traiettorie generate dal modello di base per ritirare in anticipo le skill con bassa fitness. La libreria così filtrata costituisce poi il punto di partenza per il fine-tuning supervisionato. Da quel punto subentra l’apprendimento per rinforzo: a ogni iterazione, il ritiro selettivo, la stabilizzazione e la modifica guidata da LLM continuano a plasmare la libreria di skill parallelamente all’ottimizzazione della policy. Su diversi benchmark interattivi per agenti, SkillForge ottiene il più alto tasso di successo aggregato, con un miglioramento relativo fino al 7,8% rispetto alla baseline più forte, mantenendo al contempo compatta la libreria di skill per tutta la durata dell’addestramento. Presentiamo SkillFurnace, un dataset di oltre 5k record annotati che comprende traiettorie di fine-tuning supervisionato filtrate in base al ritiro delle skill, librerie di skill evolute con annotazioni della fitness ed eventi di ritiro con categorie di errore annotate da esseri umani, per sostenere la ricerca sulla qualità delle skill e sulla gestione del loro ciclo di vita.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv