Vai al contenuto
AI.info

Ricerca

Imparare oltre ciò che si campiona: scambio di traiettorie tra modelli che tiene conto dell’off-policy per RLVR

I metodi di Reinforcement Learning with Verifiable Rewards (RLVR), come GRPO, si basano su traiettorie generate dal modello stesso che portano a un successo, ma un budget limitato di rollout può produ

Imparare oltre ciò che si campiona: scambio di traiettorie tra modelli che tiene conto dell’off-policy per RLVR
arXiv
2609.37868
Pubblicato
2026-09-29
Autori
Doohyuk Jang, Yoonsik Park, Gyouk Chu, Sihwan Park, Eunho Yang

Abstract degli autori

I metodi di Reinforcement Learning with Verifiable Rewards (RLVR), come GRPO, si basano su traiettorie generate dal modello stesso che portano a un successo, ma un budget limitato di rollout può produrre gruppi in cui tutti i tentativi falliscono e che non forniscono alcun segnale per il gradiente della policy basato sulla ricompensa. Eseguire più rollout aumenta le probabilità di successo, ma anche i costi; inoltre, le traiettorie riuscite assenti dai rollout di un modello potrebbero essere già state scoperte da un altro. Osserviamo infatti che modelli eterogenei spesso riescono a risolvere prompt diversi e complementari, creando opportunità di apprendimento reciproco senza designare un modello più forte come insegnante. Per sfruttare questa complementarità, proponiamo GRAFT (Gated Replacement of Answer-Failed groups with peer Trajectories), un framework che tiene conto dell’off-policy e sostituisce i gruppi in cui tutti i tentativi falliscono con gruppi informativi provenienti da un altro modello. GRAFT trasferisce sia le risposte riuscite sia quelle non riuscite dell’altro modello, insieme ai valori di vantaggio calcolati da quest’ultimo, controllando al contempo le differenze tra modelli mediante una ponderazione della compatibilità a livello di sequenza e un clipping dei rapporti di importanza a livello di token. Su tre coppie di modelli eterogenei e cinque benchmark di ragionamento matematico, GRAFT migliora sistematicamente le prestazioni di entrambi i modelli rispetto a GRPO a parità di budget di rollout per modello, con un guadagno medio di 2,1 punti e fino a 4,5 punti nella prestazione media per modello. Le traiettorie dell’altro modello conservate in memoria mantengono gran parte dei miglioramenti: rispetto a GRPO, il guadagno medio è di 1,8 punti anche senza coaddestramento simultaneo.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv