Ricerca
SLCA-GRPO: risolvere l’attribuzione errata del credito tra segmenti nell’apprendimento per rinforzo con chiamate agli strumenti
Gli agenti che chiamano strumenti producono output eterogenei, alternando chiamate strutturate agli strumenti e riepiloghi in linguaggio naturale destinati agli utenti. Questa eterogeneità degli outpu

- arXiv
- 2609.29050
- Pubblicato
- 2026-09-24
- Autori
- Yan Zhan, Shaobo Liu, Qiunan Liu, Yuanjun Shi, Siqi Xu, WeiYi Hou, Xiang Xu, Zekang Li, Weizhou Pan, Jiahong Yan
Abstract degli autori
Gli agenti che chiamano strumenti producono output eterogenei, alternando chiamate strutturate agli strumenti e riepiloghi in linguaggio naturale destinati agli utenti. Questa eterogeneità degli output crea un problema strutturale nell’apprendimento per rinforzo (RL) on-policy standard: algoritmi come GRPO assegnano indiscriminatamente a tutti i token lo stesso vantaggio scalare a livello di traiettoria. Di conseguenza, il rumore del gradiente dovuto alla generazione dei riepiloghi si propaga ai token che determinano le decisioni sull’uso degli strumenti, causando un’attribuzione errata del credito tra segmenti e rendendo fragile l’ottimizzazione. In questo lavoro proponiamo SLCA-GRPO, un framework che incorpora Segment-Locked Credit Assignment (SLCA). Per consentire un’esplorazione su larga scala senza ricorrere a costose API reali e mantenere stabile l’addestramento, costruiamo anzitutto Schema-Guided LLM Simulator (SGLS) come infrastruttura di base per l’addestramento. Su questa base, SLCA separa la stima del vantaggio a livello dei segmenti strutturali all’interno di un unico gruppo di rollout, senza richiedere ulteriori rollout a partire da stati intermedi. Con il supporto di Hierarchical Rewards (HierR), SLCA assegna i vantaggi relativi all’esecuzione ai token degli strumenti e quelli relativi alle preferenze ai token dei riepiloghi, eliminando a ogni aggiornamento della policy la contaminazione dei vantaggi, il principale canale di attribuzione errata del credito tra segmenti. Su un modello di base 7B, SLCA-GRPO accelera la convergenza e supera GRPO standard, ToolPO e RLTR di +2,53 pp nella valutazione in-domain, di +1,36 pp nella Berkeley Function-Calling Leaderboard (BFCL) e di +9,15 pp su $τ^2$-Bench, a parità di budget di addestramento, ottenendo una maggiore accuratezza con meno ridondanza nell’uso degli strumenti e costi inferiori.