Ricerca
Distillazione guidata dall’influenza: superare il collo di bottiglia della diversità nella distillazione on-policy basata su token campionati
La distillazione on-policy basata su token campionati (OPD) trasferisce in modo efficiente le capacità dal modello docente al modello studente usando token generati da quest’ultimo: richiede le probab

- arXiv
- 2608.29846
- Pubblicato
- 2026-08-30
- Autori
- Run Yang, Runpeng Dai, Jie Sun, Jielei Zhang, Fan Zhou, Hongtu Zhu, Peiyi Li, Longwen Gao
Abstract degli autori
La distillazione on-policy basata su token campionati (OPD) trasferisce in modo efficiente le capacità dal modello docente al modello studente usando token generati da quest’ultimo: richiede le probabilità del modello docente solo per i token campionati. Tuttavia, soffre spesso di un fallimento nella distillazione della diversità: il pass@1 dello studente migliora, mentre il suo pass@$k$ si stabilizza, senza ereditare la diversità del modello docente. Per spiegare questo fenomeno, introduciamo First-Order Local Entropy Influence, un’approssimazione con segno di primo ordine che scompone l’effetto di ogni aggiornamento sull’entropia in due componenti: la differenza tra le log-probabilità del modello docente e dello studente e la struttura locale delle probabilità dello studente. Colleghiamo inoltre empiricamente la contrazione dell’entropia alle posizioni a influenza negativa. Su questa base, proponiamo Influence-Directed Adaptive On-Policy Distillation (IDA-OPD): anziché affidarsi a costose funzioni obiettivo Forward-KL sull’intero vocabolario, preserva gli aggiornamenti che aumentano l’entropia e sostituisce quelli che la riducono con una riduzione dell’advantage adattiva alla divergenza, usando soltanto la log-probabilità del modello docente per il token campionato. Gli esperimenti sulla distillazione orientata al ragionamento mostrano che IDA-OPD migliora sistematicamente il pass@$k$, ereditando attraverso la distillazione la diversità del modello docente, eguaglia i metodi più efficaci che sfruttano informazioni del modello docente a un costo strettamente inferiore e mantiene sostanzialmente il pass@1 dell’OPD standard, il tutto senza informazioni del modello docente sull’intero vocabolario.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv