Vai al contenuto
AI.info

Ricerca

ACLArena: apprendimento continuo degli agenti nel post-training multistadio

La realizzazione di agenti generalisti destinati all’impiego industriale richiede l’integrazione di più capacità, ciascuna acquisita in genere in una fase distinta dell’addestramento. Tuttavia, al mom

ACLArena: apprendimento continuo degli agenti nel post-training multistadio
arXiv
2609.23989
Pubblicato
2026-09-21
Autori
Haixin Wang, Xiaoxuan Wang, Junkai Zhang, Han Zhang, Renliang Sun, Alexander K Taylor, Yidan Shi, Haoran Deng, Chenguang Wang, Jason Cong, Yizhou Sun, Wei Wang

Abstract degli autori

La realizzazione di agenti generalisti destinati all’impiego industriale richiede l’integrazione di più capacità, ciascuna acquisita in genere in una fase distinta dell’addestramento. Tuttavia, al momento non esiste una procedura consolidata per l’apprendimento continuo degli agenti (ACL) e si conoscono poco i compromessi tra i paradigmi di integrazione esistenti. Per colmare questa lacuna, presentiamo ACLArena, un framework per studiare, analizzare e valutare in modo completo l’ACL. Per prima cosa, realizziamo una pipeline di addestramento sequenziale e conduciamo un’analisi approfondita che spiega i meccanismi dell’oblio e della generalizzazione da due prospettive complementari: quella del modello e quella dei token. Sulla base di queste analisi, confrontiamo sistematicamente la distillazione on-policy con più insegnanti, il fine-tuning con auto-distillazione e la fusione di modelli, per valutarne la capacità di recuperare le capacità apprese in precedenza preservando quelle appena acquisite. Attraverso esperimenti approfonditi, sviluppiamo una comprensione dettagliata di come le capacità si trasferiscono tra le diverse fasi. Infine, proponiamo una nuova procedura di ACL che combina il replay offline di traiettorie di alta qualità con una rete instradata di più esperti LoRA, ciascuno specializzato tramite RL, migliorando notevolmente la capacità dell’agente di apprendere in più domini. Esperimenti approfonditi su quattro compiti di ragionamento e agentici, valutati sia in contesti interni sia esterni al dominio, dimostrano il valore della nostra analisi e l’efficacia del nostro approccio.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv