Vai al contenuto
AI.info

Ricerca

Oltre l’assegnazione dei modelli insegnanti: distillazione on-policy con più insegnanti normalizzata per dominio

L’apprendimento per rinforzo può trasformare un modello linguistico in più specialisti, ciascuno eccellente in una sola capacità, come la matematica, la programmazione o il rispetto delle istruzioni.

Oltre l’assegnazione dei modelli insegnanti: distillazione on-policy con più insegnanti normalizzata per dominio
arXiv
2609.35347
Pubblicato
2026-09-28
Autori
Xin Li, Hao Jiang, Xin Gao, Annan Wang, Yuchen Xie, Jinghao Guo, Xingwei Qu, Yichi Zhang, Chau Yuen

Abstract degli autori

L’apprendimento per rinforzo può trasformare un modello linguistico in più specialisti, ciascuno eccellente in una sola capacità, come la matematica, la programmazione o il rispetto delle istruzioni. Agli utenti, però, serve un unico modello che le possieda tutte. La distillazione on-policy con più insegnanti (MOPD) li riunisce facendo sì che insegnino a un unico modello studente: lo studente risponde a ogni prompt e lo specialista del dominio a cui appartiene quel prompt fornisce un feedback su ogni token. Questo instradamento stabilisce quale specialista insegna, ma non quanto il suo feedback influisca sullo studente condiviso. Esaminando modelli Qwen3.5 di tre dimensioni, scopriamo che lo studente ottenuto con MOPD non supera quello addestrato dal migliore tra i singoli specialisti e acquisisce solo una piccola parte del vantaggio dello specialista in matematica. Il feedback è sbilanciato: quello sul rispetto delle istruzioni ha una dispersione diverse volte superiore a quello sulla matematica e domina gli aggiornamenti dello studente. Proponiamo Domain-Normalized MOPD (DN-MOPD), che mantiene l’instradamento e ricalibra il feedback di ciascun dominio in base alla dispersione misurata. Su sei benchmark pubblici, DN-MOPD migliora il punteggio medio rispetto a MOPD per tutte le dimensioni, con tre semi casuali e con due limiti alla lunghezza delle risposte, e recupera gran parte del vantaggio perduto in matematica. I test di controllo con pesi fissi per dominio mostrano che il miglioramento deriva soprattutto dalla riduzione del peso del feedback sul rispetto delle istruzioni, più che dal solo aumento di quello sulla matematica, e che pesi fissi vicini a quelli misurati da DN-MOPD danno risultati comparabili. Per combinare gli specialisti occorre quindi decidere non solo quale di essi insegni, ma anche quanto debba contare il suo feedback.

Leggi il paper originale su arXiv