Ricerca
ACLArena: apprendimento continuo degli agenti nel post-training multistadio
La realizzazione di agenti generalisti destinati all’impiego industriale richiede l’integrazione di più capacità, ciascuna acquisita in genere in una fase distinta dell’addestramento. Tuttavia, al mom

- arXiv
- 2609.23989
- Pubblicato
- 2026-09-21
- Autori
- Haixin Wang, Xiaoxuan Wang, Junkai Zhang, Han Zhang, Renliang Sun, Alexander K Taylor, Yidan Shi, Haoran Deng, Chenguang Wang, Jason Cong, Yizhou Sun, Wei Wang
Abstract degli autori
La realizzazione di agenti generalisti destinati all’impiego industriale richiede l’integrazione di più capacità, ciascuna acquisita in genere in una fase distinta dell’addestramento. Tuttavia, al momento non esiste una procedura consolidata per l’apprendimento continuo degli agenti (ACL) e si conoscono poco i compromessi tra i paradigmi di integrazione esistenti. Per colmare questa lacuna, presentiamo ACLArena, un framework per studiare, analizzare e valutare in modo completo l’ACL. Per prima cosa, realizziamo una pipeline di addestramento sequenziale e conduciamo un’analisi approfondita che spiega i meccanismi dell’oblio e della generalizzazione da due prospettive complementari: quella del modello e quella dei token. Sulla base di queste analisi, confrontiamo sistematicamente la distillazione on-policy con più insegnanti, il fine-tuning con auto-distillazione e la fusione di modelli, per valutarne la capacità di recuperare le capacità apprese in precedenza preservando quelle appena acquisite. Attraverso esperimenti approfonditi, sviluppiamo una comprensione dettagliata di come le capacità si trasferiscono tra le diverse fasi. Infine, proponiamo una nuova procedura di ACL che combina il replay offline di traiettorie di alta qualità con una rete instradata di più esperti LoRA, ciascuno specializzato tramite RL, migliorando notevolmente la capacità dell’agente di apprendere in più domini. Esperimenti approfonditi su quattro compiti di ragionamento e agentici, valutati sia in contesti interni sia esterni al dominio, dimostrano il valore della nostra analisi e l’efficacia del nostro approccio.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv