Vai al contenuto
AI.info

Ricerca

CorrGRPO: Correlation-Normalized GRPO per l’apprendimento con ricompense multiple

Group Relative Policy Optimization (GRPO) è ampiamente usato per addestrare modelli linguistici capaci di ragionamento. Calcola i vantaggi centrando e normalizzando le ricompense dei rollout relativi

CorrGRPO: Correlation-Normalized GRPO per l’apprendimento con ricompense multiple
arXiv
2609.36820
Pubblicato
2026-09-29
Autori
Wenbin Hu, Huihao Jing, Haochen Shi, Yuxuan Liu, Haoran Li, Yangqiu Song

Abstract degli autori

Group Relative Policy Optimization (GRPO) è ampiamente usato per addestrare modelli linguistici capaci di ragionamento. Calcola i vantaggi centrando e normalizzando le ricompense dei rollout relativi allo stesso prompt. Quando le ricompense sono multiple, GRPO ne somma le componenti e normalizza la ricompensa totale usando la sua deviazione standard all’interno del gruppo. La varianza corrispondente è pari alla somma di tutte le covarianze tra coppie di ricompense. A parità di ricompensa centrata, una maggiore covarianza complessiva produce vantaggi minori, e viceversa: l’ampiezza degli aggiornamenti può così adattarsi alla dipendenza tra le ricompense. Tuttavia, ricompense correlate con scale elevate possono dominare questa normalizzazione e attenuare i segnali provenienti da ricompense su scale più piccole. Proponiamo Correlation-Normalized GRPO (CorrGRPO), che normalizza le covarianze tra coppie trasformandole in coefficienti di correlazione di Pearson. CorrGRPO lascia invariata la ricompensa totale centrata, bilanciando al tempo stesso l’influenza delle ricompense su scale diverse nella normalizzazione basata sulla correlazione. L’ampiezza dei vantaggi può così adattarsi alle correlazioni tra le ricompense senza che la normalizzazione sia dominata dalle componenti su scale elevate. Confrontiamo CorrGRPO con GRPO e altre varianti nella generazione di codice, nelle chiamate agli strumenti e nella sicurezza degli agenti, usando modelli da 0,5 a 8 miliardi di parametri. Tutti questi compiti prevedono ricompense multiple, che possono migliorare insieme oppure comportare compromessi. I risultati mostrano miglioramenti in tutti e tre gli ambiti: generazione di codice, chiamate agli strumenti e sicurezza degli agenti. Il nostro codice è disponibile all’indirizzo https://github.com/HKUST-KnowComp/CorrGRPO.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv