Vai al contenuto
AI.info

Ricerca

PACT: dall’assegnazione del credito all’allineamento del critico

L’apprendimento per rinforzo è diventato una componente centrale del post-training dei large language model (LLM), ma il credito a livello di token non dispone di una definizione matematica generalmen

PACT: dall’assegnazione del credito all’allineamento del critico
arXiv
2609.26355
Pubblicato
2026-09-22
Autori
Jiayan Fu, Hang Xu, Yong Zhang, Zhaokai Luo, Yao Hu, Dongyan Zhao, Mu Chuan

Abstract degli autori

L’apprendimento per rinforzo è diventato una componente centrale del post-training dei large language model (LLM), ma il credito a livello di token non dispone di una definizione matematica generalmente accettata, e il suo rapporto con i segnali di addestramento comunemente usati resta poco chiaro. Formuliamo tre condizioni di regolarità, ovvero completezza, coerenza dei prefissi e neutralità, e dimostriamo che determinano in modo univoco il credito a livello di token. Questa caratterizzazione fornisce una base unificata per spiegare i fenomeni osservati nei diversi algoritmi esistenti e guida lo sviluppo di una procedura di addestramento attore-critico migliorata. In quest’ottica, un insegnante ideale nell’On-Policy Distillation (OPD) agisce da critico implicito, producendo un gradiente atteso della policy proporzionale a quello indotto dal credito a livello di token. I segnali REINFORCE Leave-One-Out (RLOO) a livello di risposta corrispondono al contributo atteso del credito a livello di token al gradiente della policy, nonostante la loro granularità più grossolana. Dimostriamo inoltre che, con ricompense di esito limitate, il credito è approssimativamente sparso e mostriamo come gli errori intermedi del critico nella Generalized Advantage Estimation (GAE) possano diventare paragonabili al credito sottostante. Questi risultati motivano Policy Aligned Critic Training (PACT), che adotta un ordine di aggiornamento attore-poi-critico per applicare la correzione con campionamento per importanza all’addestramento del critico e allinearlo meglio alla policy aggiornata. Nel ragionamento matematico agentico, PACT raggiunge un’accuratezza media del 72,87% su quattro benchmark, superando rispettivamente GRPO e PPO di 8,80 e 13,16 punti percentuali. Su SWE-bench Verified, PACT raggiunge un tasso di successo del 67,4%, superando rispettivamente PPO, GRPO e SAO di 2,4, 2,0 e 3,8 punti percentuali.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv