Ricerca
Calibrare la discrepanza tra docente e studente per la distillazione on-policy
La distillazione on-policy (OPD) migliora i modelli di ragionamento apprendendo la discrepanza a livello di token tra un docente più potente e uno studente on-policy. Tuttavia, questa discrepanza non

- arXiv
- 2609.21619
- Pubblicato
- 2026-09-18
- Autori
- Qiangqiang He, Jin Li, MingCai Chen
Abstract degli autori
La distillazione on-policy (OPD) migliora i modelli di ragionamento apprendendo la discrepanza a livello di token tra un docente più potente e uno studente on-policy. Tuttavia, questa discrepanza non riflette esclusivamente il divario di capacità tra docente e studente: include anche scostamenti dovuti al docente stesso, che si mescolano così alla discrepanza osservata tra docente e studente e vengono appresi indiscriminatamente dalla OPD standard durante l’addestramento. Il problema si aggrava ulteriormente con la OPD privilegiata, in cui le informazioni privilegiate inducono variazioni più ampie nelle probabilità assegnate dal docente, incoraggiando così lo studente ad apprendere maggiormente gli scostamenti del docente stesso. Introduciamo \textbf{Calibrated On-Policy Distillation (Cal-OPD)}, che stima la regione di autoscostamento del docente tramite interventi privilegiati positivi e negativi e calibra la discrepanza originaria tra docente e studente mantenendo soltanto la componente che si trova al di fuori di questa regione. Gli esperimenti sui benchmark di ragionamento matematico mostrano che, pur mantenendo come segnale di ottimizzazione soltanto circa il 52--65\% della discrepanza originaria tra docente e studente, Cal-OPD supera costantemente la OPD standard e le sue varianti su diverse scale di modelli.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv