Vai al contenuto
AI.info

Ricerca

DuoOPD: apprendere dagli esiti congiunti di insegnante e studente per la distillazione on-policy su più compiti

La distillazione on-policy (OPD) addestra un modello studente sulle proprie risposte, usando il feedback a livello di token di un modello insegnante più forte. L’insegnante, però, può sbagliare domand

DuoOPD: apprendere dagli esiti congiunti di insegnante e studente per la distillazione on-policy su più compiti
arXiv
2609.33711
Pubblicato
2026-09-27
Autori
Ao Yu, Weibo Gao, Heng Zhou, Linan Yue, Rui Li, Suyi Liu, Yu Yan, Yizhong Zhang, Qi Liu

Abstract degli autori

La distillazione on-policy (OPD) addestra un modello studente sulle proprie risposte, usando il feedback a livello di token di un modello insegnante più forte. L’insegnante, però, può sbagliare domande a cui lo studente risponde già correttamente, e la frequenza con cui ciascun modello riesce varia da un compito all’altro. L’OPD ignora questi esiti e, in media, penalizza persino le risposte corrette dello studente; subordinare il feedback alla correttezza dello studente ne corregge la direzione, ma impiega l’insegnante allo stesso modo, che abbia risposto correttamente o meno. Presentiamo DuoOPD, in cui l’esito dello studente determina la direzione del feedback e l’esito congiunto di insegnante e studente determina come l’insegnante la sostiene: quando riesce solo l’insegnante, la sua risposta verificata diventa il contesto per valutare la risposta errata dello studente; quando riesce solo lo studente, un peso condiviso all’interno del compito rafforza l’intera risposta. Un’unica regola copre tutte e quattro le combinazioni di esiti, senza impostazioni specifiche per ciascun compito. Su Qwen3 e Llama, DuoOPD supera tutti e cinque i metodi di riferimento per accuratezza macro media, migliorando rispetto all’OPD di 2,58 e 5,98 punti percentuali; ottiene inoltre i risultati migliori in altre due combinazioni di compiti che comprendono calcolo scientifico, rispetto delle istruzioni e generazione di codice. Gli studi di ablazione mostrano che determinare la sola direzione del feedback in base agli esiti dà risultati vicini a quelli del metodo di riferimento con feedback condizionato, mentre le soluzioni basate sugli esiti congiunti producono la maggior parte del miglioramento.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv