Ricerca
Ripensare la distillazione on-policy dei modelli linguistici di grandi dimensioni II: un solo esempio di addestramento
La distillazione on-policy (OPD) combina sequenze generate dallo studente con una supervisione dettagliata a livello di token fornita da un insegnante. Gli studi esistenti ne hanno esaminato soprattut

- arXiv
- 2609.04172
- Pubblicato
- 2026-09-03
- Autori
- Zixuan Fu, Bingxiang He, Yuxin Zuo, Haohuan Huang, Jinqian Zhang, Ruhang Xiao, Cheng Qian, Qinyu Luo, Huan-ang Gao, Yudong Wang, Zhiyuan Liu, Ning Ding, Chaojun Xiao
Abstract degli autori
La distillazione on-policy (OPD) combina sequenze generate dallo studente con una supervisione dettagliata a livello di token fornita da un insegnante. Gli studi esistenti ne hanno esaminato soprattutto il comportamento algoritmico, lasciando poco chiaro il ruolo dei dati di addestramento. Esaminiamo questo ruolo nel caso di dati ridotti al minimo, addestrando il modello su una sola query. L’OPD con una sola query continua a migliorare per centinaia di passi e recupera gran parte dei miglioramenti ottenuti dall’OPD con l’intero dataset, in diversi domini di attività e famiglie di modelli. Spieghiamo questo risultato attraverso gli stati visitati durante l’addestramento e la velocità con cui lo studente si allinea all’insegnante. Misuriamo la \emph{state coverage}, ossia la frazione degli stati visitati dall’OPD con l’intero dataset che vengono raggiunti dalle sequenze generate a partire da un insieme di query. Una sola query raggiunge già \(71.5\%\), perlopiù entro i primi 100 passi. Aggiungere query semanticamente distinte aumenta sia la copertura sia l’accuratezza in validazione, fino a quando 16 query raggiungono \(98.9\%\) e eguagliano l’addestramento sull’intero dataset. Eppure l’allineamento rallenta a un ritmo simile sia che l’OPD sia addestrata su una sola query sia che lo sia sull’intero dataset, e persino assimilare un insieme fisso di stati richiede centinaia di passi. L’OPD è quindi sovralimentata di dati, ma carente sul piano algoritmico. Le sequenze generate rendono rapidamente disponibile un’ampia supervisione, mentre lo studente la assimila sempre più lentamente. Il risultato sulla copertura degli stati si estende all’OPD con più insegnanti: 16 query semanticamente diverse per dominio eguagliano la MOPD con l’intero dataset. Come ulteriore prova di robustezza, anche template con poco contenuto e query di WildChat estranee al dominio si avvicinano al risultato di riferimento ottenuto con query reali. Il contenuto delle attività e la copertura degli stati indotta possono quindi essere disgiunti. Ci auguriamo che questi risultati orientino la ricerca futura verso l’efficienza dell’OPD in termini di passi e stimolino un riesame dei dati e dei meccanismi alla base dei suoi recenti successi nel post-addestramento dei modelli di frontiera.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv