Ricerca
Il modello insegnante off-policy nella distillazione on-policy
La distillazione on-policy (OPD) si è recentemente affermata come un promettente paradigma di post-addestramento in cui il modello studente apprende da traiettorie generate dalla propria policy, sotto

- arXiv
- 2609.38360
- Pubblicato
- 2026-09-29
- Autori
- Langlin Huang, Hao Liu, Mononito Goswami, Xinyu Li, Prithwith Jana, Nikos Kanakaris, Patrick Blöbaum, Purak Jain
Abstract degli autori
La distillazione on-policy (OPD) si è recentemente affermata come un promettente paradigma di post-addestramento in cui il modello studente apprende da traiettorie generate dalla propria policy, sotto la supervisione densa del modello insegnante. Tuttavia, l’OPD introduce un’asimmetria fondamentale: le traiettorie campionate sono on-policy per il modello studente, ma off-policy per il modello insegnante. Quest’ultimo è in genere ottimizzato per generare continuazioni a partire da prefissi prodotti dalla propria policy, mentre durante l’OPD deve supervisionare prefissi generati dal modello studente. Osserviamo empiricamente che le sue prestazioni nel generare continuazioni peggiorano man mano che questi prefissi si allungano. Per affrontare il problema, proponiamo Student-COnditioned Updates of the Teacher (SCOUT), un framework di addestramento congiunto che adatta il modello insegnante ai prefissi generati dallo studente. Accanto ai consueti aggiornamenti dell’OPD, SCOUT ottimizza periodicamente, tramite apprendimento per rinforzo con ricompense verificabili, la capacità del modello insegnante di generare continuazioni a partire dai prefissi dello studente: il modello insegnante genera tali continuazioni e apprende dalle ricompense basate sui risultati. Esperimenti controllati mostrano che SCOUT migliora la capacità del modello insegnante di generare continuazioni a partire da prefissi prodotti dallo studente, a sostegno del meccanismo previsto di adattamento del modello insegnante allo studente. In diverse configurazioni di modelli insegnante e studente, scale dei modelli e ambiti di ragionamento, SCOUT migliora inoltre in modo costante l’efficacia della distillazione on-policy.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv