Vai al contenuto
AI.info

Ricerca

Modelli più piccoli, risposte scartate migliori: la scalabilità della distillazione delle preferenze

Nella distillazione delle preferenze, la risposta di un modello insegnante viene di norma considerata preferita, mentre quella generata dallo stesso modello studente viene scartata. Questo presuppone

Modelli più piccoli, risposte scartate migliori: la scalabilità della distillazione delle preferenze
arXiv
2609.38987
Pubblicato
2026-09-30
Autori
Rui Cai, Wenhui Zhu, Xiwen Chen, Jincheng Cao, Han Yu, Shayan Mohajer Hamidi, Zelin He, Qiyao Ma, Daiwei Chen, Xuanzhao Dong, Yuanda Xu, Jelena Markovic-Voronov, Kayhan Behdin, Zhengze Zhou, Ran He, Alborz Geramifard, Rohit Jain, Zhe Zhao

Abstract degli autori

Nella distillazione delle preferenze, la risposta di un modello insegnante viene di norma considerata preferita, mentre quella generata dallo stesso modello studente viene scartata. Questo presuppone che gli errori prodotti dallo studente siano gli esempi negativi più informativi e che le risposte scartate debbano provenire da un modello almeno altrettanto grande, rendendone costosa la generazione su larga scala. Abbiamo riscontrato che nessuno dei due presupposti regge: con modelli studenti da 7B a 72B, modelli più piccoli e con parametri congelati generano risposte da scartare usando meno risorse di calcolo per l’inferenza, ma permettono di addestrare studenti più efficaci rispetto alle risposte scartate generate dagli studenti stessi. Il risultato vale sia prima sia dopo la distillazione della conoscenza a livello di sequenza, nella generazione di codice e nel ragionamento matematico. Per spiegarlo, ricaviamo un limite dell’utilità a orizzonte finito per Direct Preference Optimization in un modello con feature linearizzate. Il limite caratterizza le distribuzioni favorevoli delle risposte scartate e suggerisce tre interventi. Primo, combinare risposte scartate provenienti da modelli più piccoli e da modelli delle dimensioni dello studente migliora le prestazioni all’aumentare della quota fornita dal modello più piccolo. Secondo, riassegnare le risposte scartate ad altri prompt e rimescolarne i token di codice produce comunque risultati migliori di un testo senza senso di pari lunghezza: la struttura del compito contribuisce dunque all’utilità delle risposte scartate. Terzo, selezionare candidati con una verosimiglianza inferiore secondo la policy di riferimento migliora il trasferimento netto quando i candidati con verosimiglianza superiore offrono un contrasto meno utile. Per ogni fonte, le selezioni a verosimiglianza inferiore superano quelle a verosimiglianza superiore. Questi risultati suggeriscono che le risposte scartate efficaci conservano la struttura del compito, limitando al tempo stesso il legame con la policy di riferimento, e che modelli più piccoli e con parametri congelati possono fornirle a basso costo.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv