Vai al contenuto
AI.info

Ricerca

Proprietà di scala della distillazione on-policy tra modelli della stessa famiglia

L’apprendimento per rinforzo (RL) può sviluppare notevoli capacità di ragionamento nei modelli linguistici di grandi dimensioni (LLMs), ma non è chiaro quanta parte di queste capacità si trasferisca t

Proprietà di scala della distillazione on-policy tra modelli della stessa famiglia
arXiv
2609.32722
Pubblicato
2026-09-26
Autori
Yuntai Bao, Qinfeng Li, Guoqing Jiang, Liwei Chen, Zhiheng Qin, Xuanping Li, Wenqi Zhang, Xuhong Zhang

Abstract degli autori

L’*apprendimento per rinforzo (RL)* può sviluppare notevoli capacità di ragionamento nei modelli linguistici di grandi dimensioni (LLMs), ma non è chiaro quanta parte di queste capacità si trasferisca tra modelli di scale diverse, né con quale rapidità. Studiamo le proprietà di scala della *distillazione on-policy (OPD)* in configurazioni insegnante--studente *da debole a forte*, *con la stessa base* e *da forte a debole*. Riscontriamo che le dinamiche delle prime fasi dell’addestramento OPD presentano sistematicamente un regime regolare di *trasferimento utile*, nel quale l’accuratezza su dati tenuti da parte (il *punteggio gold*, $G$) cresce in modo approssimativamente lineare rispetto a $d=\sqrt{\mathrm{KL}(π_θ\Vert π_{\mathrm{ref}})}$, la radice quadrata della divergenza KL inversa a livello di token rispetto all’inizializzazione dello studente. In ogni coppia da debole a forte osservata, il punteggio gold massimo dello studente supera quello del suo insegnante: un esperto compatto addestrato con RL può quindi trasferire capacità a uno studente molto più grande tramite OPD. Per stimare i risultati dell’OPD, adattiamo *leggi di potenza* che descrivono come $G_{\mathrm{peak}}$ e la pendenza del regime di trasferimento utile variano in funzione del numero di parametri dello studente e dell’insegnante e del punteggio gold dell’insegnante. Queste leggi mostrano che il punteggio gold massimo migliora all’aumentare della scala dell’insegnante solo fino a una scala all’incirca pari a quella dello studente e che, a parità di punteggio gold, gli insegnanti più piccoli trasferiscono meglio le capacità. Il punteggio di un insegnante, quindi, non basta da solo a determinarne il valore per la supervisione. Studiamo inoltre gli effetti di scala di due varianti dell’OPD, del bootstrapping dell’OPD da debole a forte e del grado di supervisione on-policy.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv