Vai al contenuto
AI.info

Ricerca

Il modello insegnante off-policy nella distillazione on-policy

La distillazione on-policy (OPD) si è recentemente affermata come un promettente paradigma di post-addestramento in cui il modello studente apprende da traiettorie generate dalla propria policy, sotto

Il modello insegnante off-policy nella distillazione on-policy
arXiv
2609.38360
Pubblicato
2026-09-29
Autori
Langlin Huang, Hao Liu, Mononito Goswami, Xinyu Li, Prithwith Jana, Nikos Kanakaris, Patrick Blöbaum, Purak Jain

Abstract degli autori

La distillazione on-policy (OPD) si è recentemente affermata come un promettente paradigma di post-addestramento in cui il modello studente apprende da traiettorie generate dalla propria policy, sotto la supervisione densa del modello insegnante. Tuttavia, l’OPD introduce un’asimmetria fondamentale: le traiettorie campionate sono on-policy per il modello studente, ma off-policy per il modello insegnante. Quest’ultimo è in genere ottimizzato per generare continuazioni a partire da prefissi prodotti dalla propria policy, mentre durante l’OPD deve supervisionare prefissi generati dal modello studente. Osserviamo empiricamente che le sue prestazioni nel generare continuazioni peggiorano man mano che questi prefissi si allungano. Per affrontare il problema, proponiamo Student-COnditioned Updates of the Teacher (SCOUT), un framework di addestramento congiunto che adatta il modello insegnante ai prefissi generati dallo studente. Accanto ai consueti aggiornamenti dell’OPD, SCOUT ottimizza periodicamente, tramite apprendimento per rinforzo con ricompense verificabili, la capacità del modello insegnante di generare continuazioni a partire dai prefissi dello studente: il modello insegnante genera tali continuazioni e apprende dalle ricompense basate sui risultati. Esperimenti controllati mostrano che SCOUT migliora la capacità del modello insegnante di generare continuazioni a partire da prefissi prodotti dallo studente, a sostegno del meccanismo previsto di adattamento del modello insegnante allo studente. In diverse configurazioni di modelli insegnante e studente, scale dei modelli e ambiti di ragionamento, SCOUT migliora inoltre in modo costante l’efficacia della distillazione on-policy.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv