Vai al contenuto
AI.info

Ricerca

Ripensare la distillazione on-policy tra tokenizer diversi: dalla copertura dell’allineamento all’affidabilità della supervisione

On-Policy Distillation (OPD) addestra uno studente sulle proprie generazioni usando il feedback di un docente. Quando i tokenizer sono diversi, confrontare le predizioni del docente e dello studente r

Ripensare la distillazione on-policy tra tokenizer diversi: dalla copertura dell’allineamento all’affidabilità della supervisione
arXiv
2610.08448
Pubblicato
2026-10-06
Autori
Bingxi Hou, Guochao Jiang, Guofeng Quan, Weiqing Li, Wenfeng Feng, Guohua Liu, Yuewei Zhang

Abstract degli autori

On-Policy Distillation (OPD) addestra uno studente sulle proprie generazioni usando il feedback di un docente. Quando i tokenizer sono diversi, confrontare le predizioni del docente e dello studente richiede un allineamento sia a livello di sequenza sia a livello di vocabolario. In questo articolo esaminiamo se ampliare la copertura dell’allineamento migliori l’apprendimento. Su tre coppie eterogenee docente-studente, in compiti di ragionamento matematico e generazione di codice, i gruppi con corrispondenza rigorosa 1:1 coprono già la maggior parte dei token generati dagli studenti, nonostante le notevoli differenze tra i vocabolari. Nelle risposte campionate dagli studenti prima della distillazione, il vocabolario condiviso conserva in media quasi tutta la massa di probabilità del docente e dello studente nelle posizioni rigorosamente allineate. Limitare la KL inversa, in ogni posizione rigorosamente allineata, ai 16 token del vocabolario condiviso con la probabilità più alta secondo lo studente permette di ottenere un’accuratezza paragonabile a quella dell’OPD sull’intero vocabolario condiviso e superiore a quella dei metodi di riferimento valutati per tokenizer diversi. Aggiungere, nei gruppi senza corrispondenza, una supervisione basata sull’errore quadratico medio delle log-probabilità degli intervalli garantisce una copertura completa della supervisione, ma riduce l’accuratezza. Nei checkpoint dell’addestramento basato sulla sola funzione di perdita per le posizioni rigorosamente allineate, i gradienti degli intervalli mostrano una concordanza direzionale debole o negativa con i gradienti delle posizioni rigorosamente allineate e aumentano di ampiezza rispetto a questi ultimi. Queste analisi possono contribuire a spiegare il calo di accuratezza dovuto all’aggiunta della supervisione sugli intervalli. I nostri risultati suggeriscono di non puntare più a massimizzare la copertura dell’allineamento, ma di dare priorità all’affidabilità della supervisione: una supervisione circoscritta alle posizioni rigorosamente allineate può essere più efficace di una copertura più ampia che introduce segnali di addestramento debolmente allineati o in conflitto.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv