Ricerca
Far contare le ricompense sparse: aggregazione delle ricompense basata sulla densità nell’apprendimento per rinforzo con ricompense multiple
L’apprendimento per rinforzo con ricompense multiple addestra i modelli linguistici di grandi dimensioni a soddisfare contemporaneamente più obiettivi comportamentali. La normalizzazione per singola r

- arXiv
- 2610.00574
- Pubblicato
- 2026-09-30
- Autori
- Tong Zheng, Skylar Zhai, Zhan Cheng, TianMing Sha, Youling Huang, Shuo Zhou, Shaotong Qi, Jingcheng Liang, Xuwei Ding, Pengcheng Xu
Abstract degli autori
L’apprendimento per rinforzo con ricompense multiple addestra i modelli linguistici di grandi dimensioni a soddisfare contemporaneamente più obiettivi comportamentali. La normalizzazione per singola ricompensa, usata in GDPO, preserva le informazioni relative specifiche di ciascuna ricompensa all’interno dei gruppi di rollout, ma i diversi obiettivi possono comunque registrare progressi di apprendimento disomogenei. Studiamo questo fenomeno attraverso l’energia dei vantaggi, definita come la somma dei quadrati dei vantaggi di una ricompensa su un batch. Nel caso di una normalizzazione GDPO idealizzata, dimostriamo che questa energia è proporzionale alla densità dei gruppi attivi: la frazione di gruppi di rollout in cui la ricompensa produce vantaggi relativi non nulli. Questo mette in luce uno squilibrio residuo dei segnali a livello di batch e fornisce una base per calibrare il contributo delle ricompense. Sulla base di questa relazione, proponiamo Density-Aware Reward Aggregation (DARA). Deriviamo una correzione della densità proporzionale all’inverso della sua radice quadrata, che attribuisce maggior peso ai segnali delle ricompense attive meno spesso. DARA calcola i propri pesi a partire da ogni batch di rollout, adattandosi ai cambiamenti nell’attività delle ricompense durante l’addestramento senza modificare la funzione obiettivo sottostante per l’ottimizzazione della policy. Gli esperimenti sulla chiamata di strumenti e sul ragionamento matematico mostrano che DARA apprende i comportamenti desiderati più rapidamente di GDPO: raggiunge un elevato rispetto del formato con fino al 26% di passaggi di addestramento in meno nella chiamata di strumenti e un rispetto dei vincoli di lunghezza prossimo alla saturazione con fino al 65% di passaggi in meno nel ragionamento matematico, mantenendo al contempo prestazioni finali competitive. Il nostro codice è disponibile all’indirizzo https://github.com/zhaihaotian/DARA.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv