Vai al contenuto
AI.info

Ricerca

Distillazione guidata dall’influenza: superare il collo di bottiglia della diversità nella distillazione on-policy basata su token campionati

La distillazione on-policy basata su token campionati (OPD) trasferisce in modo efficiente le capacità dal modello docente al modello studente usando token generati da quest’ultimo: richiede le probab

Distillazione guidata dall’influenza: superare il collo di bottiglia della diversità nella distillazione on-policy basata su token campionati
arXiv
2608.29846
Pubblicato
2026-08-30
Autori
Run Yang, Runpeng Dai, Jie Sun, Jielei Zhang, Fan Zhou, Hongtu Zhu, Peiyi Li, Longwen Gao

Abstract degli autori

La distillazione on-policy basata su token campionati (OPD) trasferisce in modo efficiente le capacità dal modello docente al modello studente usando token generati da quest’ultimo: richiede le probabilità del modello docente solo per i token campionati. Tuttavia, soffre spesso di un fallimento nella distillazione della diversità: il pass@1 dello studente migliora, mentre il suo pass@$k$ si stabilizza, senza ereditare la diversità del modello docente. Per spiegare questo fenomeno, introduciamo First-Order Local Entropy Influence, un’approssimazione con segno di primo ordine che scompone l’effetto di ogni aggiornamento sull’entropia in due componenti: la differenza tra le log-probabilità del modello docente e dello studente e la struttura locale delle probabilità dello studente. Colleghiamo inoltre empiricamente la contrazione dell’entropia alle posizioni a influenza negativa. Su questa base, proponiamo Influence-Directed Adaptive On-Policy Distillation (IDA-OPD): anziché affidarsi a costose funzioni obiettivo Forward-KL sull’intero vocabolario, preserva gli aggiornamenti che aumentano l’entropia e sostituisce quelli che la riducono con una riduzione dell’advantage adattiva alla divergenza, usando soltanto la log-probabilità del modello docente per il token campionato. Gli esperimenti sulla distillazione orientata al ragionamento mostrano che IDA-OPD migliora sistematicamente il pass@$k$, ereditando attraverso la distillazione la diversità del modello docente, eguaglia i metodi più efficaci che sfruttano informazioni del modello docente a un costo strettamente inferiore e mantiene sostanzialmente il pass@1 dell’OPD standard, il tutto senza informazioni del modello docente sull’intero vocabolario.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv