Vai al contenuto
AI.info

Ricerca

Dove il modello cambia idea: Hindsight-Divergence Localization per un apprendimento per rinforzo efficiente con ricompense verificabili

I metodi basati sul confronto all’interno di gruppi per l’apprendimento per rinforzo con ricompense verificabili (RLVR) apprendono dalle differenze tra i risultati dei rollout. Campionare indipendente

Dove il modello cambia idea: Hindsight-Divergence Localization per un apprendimento per rinforzo efficiente con ricompense verificabili
arXiv
2609.36864
Pubblicato
2026-09-29
Autori
Fanchao Chen, Hengyu Fu, Shivaram Venkataraman, Jiantao Jiao

Abstract degli autori

I metodi basati sul confronto all’interno di gruppi per l’apprendimento per rinforzo con ricompense verificabili (RLVR) apprendono dalle differenze tra i risultati dei rollout. Campionare indipendentemente traiettorie complete è costoso e non consente di esplorare esplicitamente lo spazio delle decisioni nei punti critici. Il feedback su una traiettoria completata può rivelare quali scelte precedenti la policy riconsidera, suggerendo dove campionare continuazioni alternative. Introduciamo Hindsight-Divergence Localization (HDL), che usa le variazioni delle log-verosimiglianze dei token indotte dalla conoscenza a posteriori per selezionare i punti di diramazione. HDL genera un piccolo numero di traiettorie radice complete e riempie ciascun gruppo di addestramento con continuazioni dai punti selezionati, nel contesto originale del compito. Ogni continuazione riutilizza il prefisso della propria traiettoria radice e contribuisce agli aggiornamenti della policy solo attraverso la parte finale appena generata, riducendo il costo di generazione e concentrando l’esplorazione e l’apprendimento aggiuntivi sulle decisioni successive alla diramazione. Esperimenti con tre modelli su compiti di matematica, programmazione e agenti mostrano miglioramenti sia nell’efficienza dei rollout sia nelle prestazioni nei compiti. Rispetto a GRPO, a parità di dimensioni dei gruppi e di passi di addestramento, HDL riduce fino a 2,5$\times$ il numero di token generati e accelera fino a 1,8$\times$ il tempo effettivo dei rollout. Nonostante il budget di generazione ridotto, HDL migliora le prestazioni in tutti e tre gli ambiti, con guadagni fino a 12,5 punti nei compiti per agenti.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv