Vai al contenuto
AI.info

Ricerca

EasyPPO: stabilizzare il critico è fondamentale

Un punto di forza di Proximal Policy Optimization (PPO) è il suo critico appreso, che usa le traiettorie raccolte durante l’apprendimento per rinforzo per stimare i ritorni attesi e ridurre la varianz

EasyPPO: stabilizzare il critico è fondamentale
arXiv
2609.36802
Pubblicato
2026-09-29
Autori
Xuanyi Zhou, Qiuyang Mang, Huanzhi Mao, Dacheng Li, Wenhao Chai, Mayank Mishra, Yichuan Wang, Karthik Narasimhan, Alvin Cheung, Joseph E. Gonzalez

Abstract degli autori

Un punto di forza di Proximal Policy Optimization (PPO) è il suo critico appreso, che usa le traiettorie raccolte durante l’apprendimento per rinforzo per stimare i ritorni attesi e ridurre la varianza del gradiente della politica. Tuttavia, riscontriamo che il critico è anche una delle principali fonti di instabilità nell’apprendimento per rinforzo dei modelli linguistici di grandi dimensioni (LLM). Individuiamo due modalità di errore del critico che destabilizzano PPO. In primo luogo, escludere i rollout troncati sia dall’addestramento dell’attore sia da quello del critico sposta l’obiettivo della politica verso la ricompensa condizionata al completamento, permettendo che i troncamenti aumentino anche mentre la ricompensa condizionata migliora. In secondo luogo, un rumore eterogeneo nei ritorni può far sì che, nei batch finiti, i prompt ad alta varianza dominino gli aggiornamenti del critico. Per affrontare questi problemi introduciamo EasyPPO. Il filtraggio dei rollout troppo lunghi applicato solo all’attore addestra il critico sui ritorni dei rollout sia completati sia troncati. La regressione del critico normalizzata rispetto al rumore pondera la perdita del critico per ciascun prompt in base all’inverso della deviazione standard dei ritorni campionati, bilanciando il contributo del rumore tra i prompt. Mini-batch del critico moderatamente più piccoli limitano l’influenza dei valori anomali a un numero minore di rollout durante il clipping del gradiente. Nei compiti di programmazione con ricompensa continua su FrontierCS, di ragionamento matematico con ricompensa binaria su AIME24 e di ricerca in più turni su Search-R1, EasyPPO rimane stabile per tutta la durata dell’addestramento e supera sistematicamente PPO nella versione standard, VAPO e HL-Gauss PPO. I suoi migliori punteggi di validazione mostrano guadagni relativi rispetto a PPO rispettivamente del 14,89%, del 2,28% e del 9,47%.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv