Vai al contenuto
AI.info

Ricerca

Ridurre il costo dell’aumento della lunghezza con la distillazione online

L’aumento della lunghezza delle risposte durante il post-training con apprendimento per rinforzo (RL) è spesso considerato un segnale di miglioramento della capacità di ragionamento, soprattutto sui p

Ridurre il costo dell’aumento della lunghezza con la distillazione online
arXiv
2609.38854
Pubblicato
2026-09-30
Autori
Xu Wan, Wenyue Xu, Shengjie Zhao, Mingyang Sun

Abstract degli autori

L’aumento della lunghezza delle risposte durante il post-training con apprendimento per rinforzo (RL) è spesso considerato un segnale di miglioramento della capacità di ragionamento, soprattutto sui problemi difficili, ma può anche rendere inutilmente prolisse le risposte a problemi già risolti. Quantifichiamo questo effetto collaterale come costo dell’aumento della lunghezza (LST): una lunghezza eccessiva delle risposte a quesiti già risolti, senza un corrispondente aumento dell’accuratezza. Per ridurre l’LST, proponiamo Length Self-Distillation (LSD), che indirizza i prompt già risolti alla distillazione on-policy e mantiene l’obiettivo RL originale per quelli non risolti. LSD usa come insegnante una media mobile esponenziale della policy online, senza richiedere un modello esterno. Rileviamo che LSD ottiene prestazioni paragonabili o superiori a quelle dell’RL in diverse varianti, limitando al contempo in misura sostanziale la crescita della lunghezza delle risposte ai quesiti facili. LSD riduce l’LST dal 19,0% al -3,7% nei compiti di ragionamento a turno singolo e dal 31,4% al 13,7% nei compiti agentici a più turni, dimostrando che durante il post-training RL preserva efficacemente schemi di risposta concisi per i quesiti facili e, al tempo stesso, favorisce un’esplorazione efficiente per quelli difficili.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv