Ricerca
DuoOPD: apprendere dagli esiti congiunti di insegnante e studente per la distillazione on-policy su più compiti
La distillazione on-policy (OPD) addestra un modello studente sulle proprie risposte, usando il feedback a livello di token di un modello insegnante più forte. L’insegnante, però, può sbagliare domand

- arXiv
- 2609.33711
- Pubblicato
- 2026-09-27
- Autori
- Ao Yu, Weibo Gao, Heng Zhou, Linan Yue, Rui Li, Suyi Liu, Yu Yan, Yizhong Zhang, Qi Liu
Abstract degli autori
La distillazione on-policy (OPD) addestra un modello studente sulle proprie risposte, usando il feedback a livello di token di un modello insegnante più forte. L’insegnante, però, può sbagliare domande a cui lo studente risponde già correttamente, e la frequenza con cui ciascun modello riesce varia da un compito all’altro. L’OPD ignora questi esiti e, in media, penalizza persino le risposte corrette dello studente; subordinare il feedback alla correttezza dello studente ne corregge la direzione, ma impiega l’insegnante allo stesso modo, che abbia risposto correttamente o meno. Presentiamo DuoOPD, in cui l’esito dello studente determina la direzione del feedback e l’esito congiunto di insegnante e studente determina come l’insegnante la sostiene: quando riesce solo l’insegnante, la sua risposta verificata diventa il contesto per valutare la risposta errata dello studente; quando riesce solo lo studente, un peso condiviso all’interno del compito rafforza l’intera risposta. Un’unica regola copre tutte e quattro le combinazioni di esiti, senza impostazioni specifiche per ciascun compito. Su Qwen3 e Llama, DuoOPD supera tutti e cinque i metodi di riferimento per accuratezza macro media, migliorando rispetto all’OPD di 2,58 e 5,98 punti percentuali; ottiene inoltre i risultati migliori in altre due combinazioni di compiti che comprendono calcolo scientifico, rispetto delle istruzioni e generazione di codice. Gli studi di ablazione mostrano che determinare la sola direzione del feedback in base agli esiti dà risultati vicini a quelli del metodo di riferimento con feedback condizionato, mentre le soluzioni basate sugli esiti congiunti producono la maggior parte del miglioramento.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv