Vai al contenuto
AI.info

Ricerca

Dai gradienti alle capacità: comprendere la distillazione on-policy con più insegnanti

La distillazione on-policy con più insegnanti (MOPD) mira a riunire in un unico modello studente i punti di forza di insegnanti addestrati con RL, ma resta poco studiato il modo in cui i loro segnali

Dai gradienti alle capacità: comprendere la distillazione on-policy con più insegnanti
arXiv
2610.02179
Pubblicato
2026-10-01
Autori
Siqi Zhu, Suozhi Huang, Kaixuan Zhang, Yuheng Yang, Zhanyang Jin, Yihang Sun, Jiaxuan You

Abstract degli autori

La distillazione on-policy con più insegnanti (MOPD) mira a riunire in un unico modello studente i punti di forza di insegnanti addestrati con RL, ma resta poco studiato il modo in cui i loro segnali influenzano le modifiche ai parametri. Studiamo Qwen3-1.7B con quattro insegnanti specializzati in diversi domini, addestrati con RL a partire dalla stessa inizializzazione dello studente, confrontando gradienti, aggiornamenti dell’ottimizzatore e curve di apprendimento dei compiti, con ulteriori analisi diagnostiche su SmolLM3-3B. Troviamo che diversi fattori influenzano i segnali degli insegnanti. Primo, il calcolo della media della loss attribuisce implicitamente pesi diversi alle risposte: la media sui token favorisce le risposte più lunghe e, anche quando si rendono uguali i contributi dei domini, questa ponderazione rimane all’interno di ciascun dominio. Secondo, il primo momento di Adam riduce le differenze negli aggiornamenti dei parametri: la similarità coseno è di 0,83 tra insegnanti e di 0,96 tra criteri di calcolo della media, nonostante le differenze nei gradienti grezzi. Terzo, l’arrotondamento BF16 nasconde le piccole modifiche: circa il 97\% dei pesi master FP32 differisce dai valori iniziali, ma solo il 7--11\% dei pesi BF16. Infine, il gradiente KL calcolato sull’intersezione dei primi 64 token corrisponde da vicino al gradiente sull’intero vocabolario di Qwen, ma l’effetto sulle prestazioni nei compiti dipende dal criterio di calcolo della media: la precisione in matematica è superiore di 2,6 punti rispetto al policy-gradient su token campionati (PG) quando si calcola la media sulle risposte, e inferiore di 2,1 punti quando si calcola la media globale sui token.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv