Vai al contenuto
AI.info

Ricerca

RISE: miglioramento ricorsivo tramite distillazione di policy autoestrapolante

La distillazione on-policy (OPD) offre una supervisione densa, token per token, per il post-training dei modelli linguistici, ma la sua efficacia è limitata dalla qualità del modello docente: i docent

RISE: miglioramento ricorsivo tramite distillazione di policy autoestrapolante
arXiv
2609.05295
Pubblicato
2026-09-04
Autori
Yang Li, Semih Yavuz, Shafiq Joty

Abstract degli autori

La distillazione on-policy (OPD) offre una supervisione densa, token per token, per il post-training dei modelli linguistici, ma la sua efficacia è limitata dalla qualità del modello docente: i docenti esterni risentono del disallineamento delle distribuzioni, mentre l’autodistillazione con condizionamento privilegiato è limitata dalla capacità di apprendimento in contesto. Proponiamo \textbf{RISE} (\textbf{R}ecursive \textbf{I}mprovement via \textbf{S}elf-\textbf{E}xtrapolating Policy Distillation), che costruisce un modello docente sintetico direttamente dalla traiettoria di addestramento RLVR del modello stesso. Estrapolando lo scarto tra il checkpoint corrente e un’ancora precedente, nello spazio dei parametri o in quello dei logit di output, RISE trasforma un aggiornamento dei parametri indotto da un esito, che fornisce un segnale poco frequente, in un obiettivo denso a livello di token, senza ricorrere a modelli esterni né a condizionamento privilegiato. RISE combina RLVR e OPD in un ciclo complementare: le ricompense basate sull’esito orientano l’estrapolazione verso un ragionamento corretto, mentre il modello docente estrapolato affina le decisioni a livello di token. Inoltre, poiché il modello docente viene aggiornato a ogni iterazione man mano che il modello allievo migliora, la distillazione diventa un meccanismo di miglioramento ricorsivo anziché una fase di compressione una tantum. Esperimenti che comprendono ragionamento matematico, discipline STEM in più ambiti, generazione di codice e compiti agentici a più turni mostrano che RISE supera sia l’addestramento basato soltanto su RLVR sia l’autodistillazione on-policy in tutte le configurazioni.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv