Ricerca
Ridurre il costo dell’aumento della lunghezza con la distillazione online
L’aumento della lunghezza delle risposte durante il post-training con apprendimento per rinforzo (RL) è spesso considerato un segnale di miglioramento della capacità di ragionamento, soprattutto sui p

- arXiv
- 2609.38854
- Pubblicato
- 2026-09-30
- Autori
- Xu Wan, Wenyue Xu, Shengjie Zhao, Mingyang Sun
Abstract degli autori
L’aumento della lunghezza delle risposte durante il post-training con apprendimento per rinforzo (RL) è spesso considerato un segnale di miglioramento della capacità di ragionamento, soprattutto sui problemi difficili, ma può anche rendere inutilmente prolisse le risposte a problemi già risolti. Quantifichiamo questo effetto collaterale come costo dell’aumento della lunghezza (LST): una lunghezza eccessiva delle risposte a quesiti già risolti, senza un corrispondente aumento dell’accuratezza. Per ridurre l’LST, proponiamo Length Self-Distillation (LSD), che indirizza i prompt già risolti alla distillazione on-policy e mantiene l’obiettivo RL originale per quelli non risolti. LSD usa come insegnante una media mobile esponenziale della policy online, senza richiedere un modello esterno. Rileviamo che LSD ottiene prestazioni paragonabili o superiori a quelle dell’RL in diverse varianti, limitando al contempo in misura sostanziale la crescita della lunghezza delle risposte ai quesiti facili. LSD riduce l’LST dal 19,0% al -3,7% nei compiti di ragionamento a turno singolo e dal 31,4% al 13,7% nei compiti agentici a più turni, dimostrando che durante il post-training RL preserva efficacemente schemi di risposta concisi per i quesiti facili e, al tempo stesso, favorisce un’esplorazione efficiente per quelli difficili.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv