Vai al contenuto
AI.info

Ricerca

LastOPD: contrastare il collasso nella distillazione on-policy latente

La distillazione on-policy (OPD) corregge il modello studente sulle risposte che produce, ma il segnale su cui si basa è la distribuzione del token successivo del modello insegnante: gli indica che co

LastOPD: contrastare il collasso nella distillazione on-policy latente
arXiv
2609.28845
Pubblicato
2026-09-23
Autori
Jie Yang, Zhengyu Fang, Zelin Xu, Jiarui Sun, Xiran Fan, Junpeng Wang, Liang Wang, Qinghua Liu, Yiwei Cai, Yan Zheng

Abstract degli autori

La distillazione on-policy (OPD) corregge il modello studente sulle risposte che produce, ma il segnale su cui si basa è la distribuzione del token successivo del modello insegnante: gli indica che cosa dice l’insegnante, ma non come ragiona. La supervisione latente promette di colmare questa lacuna allineando gli stati latenti dello studente a quelli dell’insegnante. Metodi recenti come OPRD introducono questo segnale nella distillazione on-policy. Tuttavia, distillando Qwen3-4B e Qwen3-8B in Qwen3-1.7B-Base, osserviamo due limiti di questo approccio. Guadagno iniziale, collasso successivo: la sola supervisione latente porta l’accuratezza su MATH-500 da 25 a 46 in 10 passaggi, ma proseguire l’addestramento fa scendere le prestazioni fino a 11, senza alcuna ripresa. Allineamento migliore, comportamento peggiore: sebbene la misura dell’allineamento migliori costantemente durante il collasso, il modello più allineato risulta quello con le prestazioni peggiori. Ulteriori analisi suggeriscono una discrepanza nel modo in cui viene applicato il segnale latente: gli strati abbinati in base alla profondità svolgono ruoli diversi nei due modelli, perciò continuare ad allinearli potrebbe spingere lo studente verso stati dell’insegnante che non è in grado di comprendere. Per affrontare il problema, proponiamo LastOPD, che applica il segnale latente solo allo stato dell’ultimo strato, l’interfaccia comune da cui leggono entrambe le teste LM, e solo durante una transizione graduale di 10 passaggi verso l’OPD a livello di token. In questo modo conserva la parte utile del segnale latente e affida lo studente alla supervisione a livello di token prima che inizi il collasso. Numerosi esperimenti mostrano che LastOPD migliora il risultato su MATH-500 rispetto all’OPD basata solo sui token di 5,55 e 4,02 punti con gli insegnanti 4B e 8B, ottiene i risultati migliori sulla maggior parte dei dataset tenuti da parte e raggiunge il punteggio finale dell’OPD basata solo sui token in circa la metà dei passaggi. Il codice è disponibile all’indirizzo https://github.com/Muyiiiii/LastOPD.

Leggi il paper originale su arXiv