Ricerca
MOPD-Router: ripensare l’instradamento dei modelli insegnanti nella distillazione on-policy multi-insegnante
La distillazione on-policy multi-insegnante (MOPD) riunisce capacità specializzate in un unico modello studente, ma le pratiche attuali assegnano in genere ogni prompt a un modello insegnante dello st
- arXiv
- 2609.30837
- Pubblicato
- 2026-09-25
- Autori
- Tianze Xu, Yanzhao Zheng, Zhentao Zhang, Yuanqiang Yu, Chao Ma, Jihuai Zhu, Lelun Wu, Lyumanshan Ye, Pengfei Liu, Baohua Dong, Hangcheng Zhu, Ruohui Huang, Gang Yu
Abstract degli autori
La distillazione on-policy multi-insegnante (MOPD) riunisce capacità specializzate in un unico modello studente, ma le pratiche attuali assegnano in genere ogni prompt a un modello insegnante dello stesso dominio per l’intero rollout. Questa dipendenza dalle etichette di dominio associate ai prompt limita l’uso di dati di addestramento misti privi di etichette e lascia inutilizzati i segnali complementari degli altri modelli insegnanti. Presentiamo MOPD-Router, un framework che, a ogni token, instrada i segnali di supervisione attingendo all’intero insieme dei modelli insegnanti, senza etichette di dominio né l’addestramento di un modello di instradamento separato. La sua interfaccia plug-in supporta diverse metriche per selezionare e ponderare i segnali OPD specifici di ciascun modello insegnante. All’interno di questa interfaccia, proponiamo ExpertAlign, che valuta ciascun modello insegnante in base al fatto che la correzione apportata al modello studente sul token corrente esprima o meno la specializzazione acquisita da quel modello insegnante durante il post-training, e lo confrontiamo con due metriche di riferimento basate sulla confidenza del modello insegnante (Entropy) e sulla discrepanza tra modello insegnante e modello studente (Novelty). Esperimenti condotti su dati di addestramento misti privi di etichette e su dati con etichette di dominio, in scenari di distillazione da modelli più forti a modelli più deboli e tra modelli di pari dimensioni, mostrano che ExpertAlign ottiene le migliori prestazioni complessive in tutte e quattro le configurazioni. Sui dati privi di etichette migliora il punteggio complessivo di 5,88 punti (+12,3%) rispetto all’aggregazione Mean; sui dati con etichette di dominio supera la MOPD standard di 3,95 punti (+7,8%) senza usare le etichette di dominio disponibili. Questi risultati dimostrano che l’instradamento a livello di token può sfruttare segnali di supervisione complementari tra domini diversi e ridurre la dipendenza esclusiva dall’assegnazione dei prompt ai domini. Il codice è disponibile all’indirizzo: https://github.com/TURLEing/MOPD-Router.