Ricerca
Agire prima, ragionare dopo: accelerare la distillazione on-policy degli agenti a più turni con la dinamica inversa condizionata sul riferimento
La distillazione on-policy (OPD) addestra agenti linguistici a più turni sottoponendo le risposte generate dallo studente a una supervisione fitta da parte del modello insegnante. Tuttavia, nelle trai

- arXiv
- 2609.36608
- Pubblicato
- 2026-09-29
- Autori
- Zubin Zheng, Jiahao Wu, Shaofeng Zhang, Zhirui Zhang, Yew-Soon Ong, Shengcai Liu
Abstract degli autori
La distillazione on-policy (OPD) addestra agenti linguistici a più turni sottoponendo le risposte generate dallo studente a una supervisione fitta da parte del modello insegnante. Tuttavia, nelle traiettorie standard in cui si ragiona prima di agire, ogni breve azione è preceduta da un lungo ragionamento: questo ritarda le transizioni nell’ambiente e la raccolta di esperienze. Generare direttamente le azioni riduce il ritardo, ma può peggiorare la qualità delle traiettorie. Per affrontare il problema, proponiamo ActFirst-OPD, un metodo di addestramento in cui si agisce prima di ragionare e l’interazione con l’ambiente è separata dalla generazione della risposta completa. Lo studente deduce ed esegue le azioni mediante la dinamica inversa condizionata sul riferimento, usando il contesto dell’interazione in corso e un’osservazione successiva di riferimento; passa invece alla previsione autonoma dell’azione successiva quando la transizione risultante si discosta dalla traiettoria di riferimento. A partire dai contesti di interazione raccolti, lo studente genera in modo asincrono risposte complete in cui ragiona prima di agire, destinate alla supervisione del modello insegnante a livello di token. Esperimenti con modelli studenti Qwen3 da 0,6, 1,7 e 4 miliardi di parametri mostrano che ActFirst-OPD ottiene, rispetto a Vanilla OPD, accelerazioni medie dell’addestramento misurate sul tempo effettivo di $2.3\times$ su ALFWorld, $1.8\times$ su WebShop e $4.9\times$ su ScienceWorld. Eguaglia o supera tutte le baseline OPD confrontate per tasso medio di successo nei compiti in otto delle nove combinazioni di benchmark e modello. Questi risultati dimostrano che, durante la distillazione degli agenti a più turni, il ragionamento non deve necessariamente bloccare l’azione.