Ricerca
Valutazione agentica per gruppi e redistribuzione dei vantaggi nell’apprendimento per rinforzo degli agenti di programmazione
L’apprendimento per rinforzo (RL) degli agenti di programmazione usa spesso test eseguibili per assegnare ricompense binarie. Con queste ricompense, Group Relative Policy Optimization (GRPO) attribuis
- arXiv
- 2609.32577
- Pubblicato
- 2026-09-26
- Autori
- Jinhao Dong, Liang Zhao, Zihao Yue, Wenhan Ma, Linghao Zhang, Lei Li, Shicheng Li, Yifan Song, Bowen Ye, Fuli Luo
Abstract degli autori
L’apprendimento per rinforzo (RL) degli agenti di programmazione usa spesso test eseguibili per assegnare ricompense binarie. Con queste ricompense, Group Relative Policy Optimization (GRPO) attribuisce vantaggi identici alle traiettorie che superano i test all’interno di ciascun gruppo di rollout, senza considerare le differenze nella qualità dell’implementazione e nel rispetto dei requisiti del compito. La policy non riceve così un segnale di apprendimento che favorisca implementazioni pulite e mirate rispetto a quelle che contengono modifiche non necessarie o estranee al compito. Presentiamo GAGAR, un framework per redistribuire il credito in base alla qualità nell’RL degli agenti di programmazione. Basato su un campionamento dinamico che conserva i gruppi contenenti sia traiettorie che superano i test sia traiettorie che non li superano, GAGAR colloca tutte le traiettorie di ciascun gruppo in uno spazio di lavoro condiviso, dove un valutatore agentico addestrato con SFT le esamina congiuntamente e classifica le candidate che superano i test. In base a questa classifica, riduciamo il peso delle traiettorie nelle posizioni inferiori e riscaliamo proporzionalmente i vantaggi di tutte le traiettorie che superano i test per ripristinarne la somma originale. Questa redistribuzione, che preserva la somma, mantiene i pesi relativi determinati dalla riduzione basata sulla qualità, spostando al tempo stesso il credito verso le implementazioni di qualità superiore. Valutiamo GAGAR su scala industriale usando checkpoint SFT precedenti all’RL di MiMo-V2.6-Flash (310 miliardi di parametri totali) e MiMo-V2.6-Pro (1,02 bilioni di parametri totali). Esperimenti controllati condotti con Flash sui soli compiti di programmazione mostrano un miglioramento delle prestazioni degli agenti di programmazione, una minore crescita della lunghezza delle traiettorie e un addestramento più stabile. Applichiamo inoltre GAGAR all’RL su larga scala con compiti misti, sia con Flash sia con Pro. I nostri risultati indicano che combinare la verifica basata sui test con la valutazione agentica per gruppi migliora la qualità e la stabilità dell’RL degli agenti di programmazione.