Vai al contenuto
AI.info

Ricerca

Comporre ciò che ogni insegnante ha appreso: distillazione on-policy con più insegnanti tramite scarti relativi all’insegnante

La distillazione on-policy con più insegnanti (MOPD) viene usata in due contesti. Nella composizione entro un dominio comune, diversi insegnanti valutano ogni sequenza generata dallo studente a partir

arXiv
2610.10460
Pubblicato
2026-10-07
Autori
Hejian Sang, Zhengze Zhou, Shayan Mohajer Hamidi, Xiaomin Li, Rohit Jain, Alborz Geramifard

Abstract degli autori

La distillazione on-policy con più insegnanti (MOPD) viene usata in due contesti. Nella composizione entro un dominio comune, diversi insegnanti valutano ogni sequenza generata dallo studente a partire da un dominio di prompt e i loro segnali formano un unico target; nella distillazione con instradamento per dominio, i prompt di domini diversi vengono assegnati allo specialista corrispondente. In entrambi i contesti, di solito si trasferisce la policy finale di ciascun insegnante, che mescola le modifiche apportate dal post-training con le preferenze ereditate dal suo modello di base. Introduciamo $Δ$-MOPD, che trasferisce lo scarto dei logit tra ciascun insegnante e il suo modello di base, riancorandolo all’inizializzazione congelata dello studente, e lo confrontiamo con la supervisione basata sulla policy finale in entrambi i contesti, mantenendo fissa la selezione degli insegnanti. Mostriamo anzitutto il meccanismo che ostacola il trasferimento della policy finale: l’attrazione ereditata dal modello di base può superare lo scarto prodotto dal post-training. Eliminarla riduce il rapporto tra le norme dei termini relativi agli insegnanti e la divergenza KL tra target e studente. Nei nostri esperimenti, i risultati suggeriscono che i target basati sugli scarti siano particolarmente utili quando i segnali degli insegnanti vengono combinati in uno stesso stato. Con tre insegnanti combinati, $Δ$-MOPD supera la composizione delle policy finali di $4.11$ punti su Math e di $1.95$ punti sui cinque benchmark; con due, eguaglia l’accuratezza ottenuta con le policy finali. Con l’instradamento per fasi, ottiene prestazioni medie superiori in entrambi gli ordini delle fasi e riduce il divario osservato tra i due ordini da $10.50$ a $6.42$ punti. Con l’instradamento intercalato, in cui ogni aggiornamento coinvolge un solo insegnante, i due target ottengono risultati comparabili. I risultati dell’instradamento per fasi corroborano la possibilità che il beneficio si estenda ai segnali accumulati nel corso delle fasi di addestramento. La costruzione del target è quindi una scelta progettuale autonoma nella MOPD, complementare alla selezione degli insegnanti.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv