Vai al contenuto
AI.info

Ricerca

Ottimizzazione della policy con clipping adattivo per gruppo

L’ottimizzazione relativa della policy per gruppo nell’apprendimento per rinforzo con ricompense verificabili (RLVR) usa generalmente un limite fisso per il clipping del rapporto di campionamento per

Ottimizzazione della policy con clipping adattivo per gruppo
arXiv
2609.00444
Pubblicato
2026-08-31
Autori
Sheng Jia, Xiao Wang, Shiva Prasad Kasiviswanathan, Rein Houthooft

Abstract degli autori

L’ottimizzazione relativa della policy per gruppo nell’apprendimento per rinforzo con ricompense verificabili (RLVR) usa generalmente un limite fisso per il clipping del rapporto di campionamento per importanza (IS) in tutti i rollout. Individuiamo un limite importante: i rari rollout corretti nei problemi più difficili e i numerosi rollout corretti nei problemi più facili subiscono il clipping con frequenze comparabili, pur fornendo segnali di apprendimento molto diversi. I rollout associati a un basso tasso di successo nel gruppo presentano rapporti IS più elevati e forniscono un segnale di gradiente più forte per l’esplorazione e la risoluzione di nuovi problemi, ma vengono soppressi in misura sproporzionata dal clipping fisso. Per affrontare il problema, proponiamo Group Adaptive Clipping Policy Optimization (GAPO), una modifica integrabile nei metodi GRPO che adatta il limite di clipping al vantaggio del rollout. GAPO nasce da una prospettiva basata su una regione di fiducia con divergenza KL inversa, secondo cui i rollout con un segnale di apprendimento più forte dovrebbero avere un margine di aggiornamento proporzionalmente maggiore. GAPO non richiede modifiche alle ricompense e mantiene la funzione obiettivo surrogata standard di PPO/GSPO, adattando soltanto la soglia di clipping. Nei modelli Qwen e Llama, GAPO migliora sistematicamente sia Pass@1 sia Pass@k rispetto alle baseline con clipping fisso e con rimodulazione del vantaggio, nei benchmark di ragionamento matematico e programmazione in cui i tassi di successo del modello di base sono relativamente bassi.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv