Ricerca
Quando i token EOS divergono: comprendere l’aumento della lunghezza nella distillazione on-policy
Studiamo l’aumento della lunghezza nella distillazione on-policy (OPD), in cui le risposte del modello studente possono diventare eccessivamente lunghe e persino esaurire il budget di generazione. Ind

- arXiv
- 2609.20511
- Pubblicato
- 2026-09-17
- Autori
- Yuxiao Yang, Tianrun Yu, Shangzhe Li, Kaixiang Zhao, Xuchao Zhang, Chetan Bansal, Huaxiu Yao, Taylor W. Killian, Weitong Zhang
Abstract degli autori
Studiamo l’aumento della lunghezza nella distillazione on-policy (OPD), in cui le risposte del modello studente possono diventare eccessivamente lunghe e persino esaurire il budget di generazione. Individuiamo nel \emph{disallineamento dei token di terminazione} tra modelli studenti di base e modelli insegnanti sottoposti a post-training una causa importante di questo comportamento. Nelle famiglie Qwen3, Llama e Gemma, i due modelli possono assegnare la probabilità di arresto a token EOS diversi, anche quando gli insiemi di token di arresto dichiarati sono identici. Questo disallineamento può inibire l’azione di terminazione preferita dallo studente senza trasferire in modo affidabile l’alternativa preferita dall’insegnante. Mostriamo che allineare soltanto l’insieme di token che arrestano la decodifica non basta, mentre considerare i token EOS funzionalmente equivalenti come un’unica azione semantica di arresto attenua notevolmente l’aumento della lunghezza dovuto al disallineamento in tutte e tre le famiglie di modelli. Per capire meglio come evolve il comportamento di terminazione durante l’addestramento, studiamo l’OPD nelle diverse fasi di addestramento di K2-Horizon. Questa analisi fase per fase mostra che le preferenze di terminazione possono cambiare notevolmente durante l’addestramento e rivela anche un distinto aumento della lunghezza verso la fine dell’esecuzione dell’OPD, che persiste nonostante l’allineamento della terminazione. Nel complesso, questi risultati individuano nel disallineamento della terminazione una causa importante, ma non l’unica, delle dinamiche della lunghezza nell’OPD. Rendiamo disponibile un’implementazione che incorpora le correzioni proposte per la gestione della terminazione.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv