Vai al contenuto
AI.info

Ricerca

Miglioramenti e collasso nella distillazione on-policy: una prospettiva basata sull’apprendimento per rinforzo

La distillazione on-policy (OPD) è diventata un approccio importante nella fase di post-addestramento dei modelli linguistici. Tuttavia, nonostante i miglioramenti delle prestazioni, l’OPD può anche d

Miglioramenti e collasso nella distillazione on-policy: una prospettiva basata sull’apprendimento per rinforzo
arXiv
2610.03185
Pubblicato
2026-10-02
Autori
Han Cui, Jianhao Yan, Yun Luo, Hongbo Zhang, Zhizhang Fu, Yue Zhang

Abstract degli autori

La distillazione on-policy (OPD) è diventata un approccio importante nella fase di post-addestramento dei modelli linguistici. Tuttavia, nonostante i miglioramenti delle prestazioni, l’OPD può anche degenerare nella generazione di testi eccessivamente lunghi e ripetitivi, e il meccanismo alla base di questi esiti divergenti resta poco chiaro. Li spieghiamo attraverso una prospettiva basata sull’apprendimento per rinforzo: il modello insegnante premia implicitamente i comportamenti dello studente, anche quelli che esso stesso manifesta raramente. Da questa prospettiva, i nostri esperimenti mostrano che l’OPD migliora le prestazioni senza ampliare le capacità dello studente. Quando il modello di ricompensa implicito è affidabile, l’OPD rende più facile campionare risposte corrette. Quando invece le sue preferenze non sono allineate alla qualità, si verifica il reward hacking: il modello di ricompensa implicito favorisce i rollout dello studente eccessivamente lunghi e ripetitivi, pur generando esso stesso raramente testi del genere. Sulla base di questa diagnosi, riscontriamo che sia mascherare le risposte problematiche durante l’addestramento sia ricorrere all’inizializzazione tramite SFT può mitigare efficacemente il collasso. Nel complesso, questi risultati mostrano che l’OPD amplifica i comportamenti dello studente favoriti dal feedback implicito del modello insegnante, spostando l’attenzione da quanto bene quest’ultimo generi testo a quanto affidabilmente valuti i rollout dello studente. Il nostro codice è disponibile su https://github.com/HancCui/opd_hacking.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv