Ricerca
Che cosa aggiungono le informazioni privilegiate all’autodistillazione on-policy?
L’autodistillazione on-policy (OPSD) permette a un modello linguistico di imparare da una copia di sé i cui parametri restano fissi e che può vedere una risposta o una soluzione svolta. Dare al modell

- arXiv
- 2609.20612
- Pubblicato
- 2026-09-17
- Autori
- XiuYu Zhang, Wei Chow, Junfeng Fang, Xingyu Zhu, Zhenkai Liang, Tat-Seng Chua
Abstract degli autori
L’autodistillazione on-policy (OPSD) permette a un modello linguistico di imparare da una copia di sé i cui parametri restano fissi e che può vedere una risposta o una soluzione svolta. Dare al modello insegnante queste informazioni aggiuntive sembra offrire allo studente più materiale da cui imparare, ma quanto aggiungono rispetto alla distillazione in sé? Per isolare questo contributo, abbiamo costruito AMPLE-Math, una raccolta riutilizzabile di 5.319 problemi matematici con sei rappresentazioni del ragionamento che condividono la stessa risposta, e confrontiamo ciascuna rappresentazione con una corrispondente distillazione senza riferimento. Quando un modello insegnante con ragionamento attivato supervisiona rollout a risposta diretta, la distillazione senza riferimento spiega gran parte dei miglioramenti di Qwen3-1.7B nella valutazione con ragionamento attivato, sia nel dominio sia nei benchmark esterni. In Qwen, le prove di un beneficio aggiuntivo dovuto al riferimento sono limitate, benché più solide nel caso di una soluzione rifinita; in SmolLM3-3B, invece, le tracce complete aggiungono due punti percentuali al passo 50. Questi benefici dipendono dal modello studente addestrato. Allo stesso checkpoint, sostituire rollout brevi a risposta diretta con rollout lunghi con ragionamento attivato trasforma i miglioramenti in peggioramenti in entrambe le famiglie, mentre i problemi, i riferimenti e la valutazione restano invariati. I profili del modello insegnante e gli interventi corrispondenti sulla funzione di perdita in Qwen mostrano inoltre che modificare la supervisione a livello di token può lasciare sostanzialmente invariato il comportamento dello studente. Nel loro insieme, questi risultati suggeriscono che l’OPSD possa migliorare l’accesso a capacità di ragionamento già esistenti attraverso parametri condivisi dall’inferenza a risposta diretta e da quella con ragionamento attivato. Il valore di un riferimento privilegiato sta in ciò che aggiunge a questo trasferimento tra modalità, non nella quantità di soluzione che rivela.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv