Vai al contenuto
AI.info

Ricerca

Ottimizzazione delle politiche potenziata dall’attribuzione del credito semifattuale

L’apprendimento per rinforzo con ricompense verificabili (RLVR) ha migliorato le capacità di ragionamento dei modelli linguistici di grandi dimensioni (LLM), ma le loro previsioni restano sensibili a

Ottimizzazione delle politiche potenziata dall’attribuzione del credito semifattuale
arXiv
2609.40360
Pubblicato
2026-09-30
Autori
Junshu Pan, Zhizhang Fu, Shulin Huang, Yiran Ding, Zifan Cheng, Wenqi Shao, Qiaosheng Zhang, Yue Zhang

Abstract degli autori

L’apprendimento per rinforzo con ricompense verificabili (RLVR) ha migliorato le capacità di ragionamento dei modelli linguistici di grandi dimensioni (LLM), ma le loro previsioni restano sensibili a caratteristiche dei prompt irrilevanti per il compito. Esaminiamo questa sensibilità attraverso interventi semifattuali sui prompt che lasciano invariati il problema di fondo e la sua risposta. La nostra analisi rivela notevoli differenze nella sensibilità dei singoli token e mostra che, durante la generazione, escludere i token candidati che presentano forti variazioni migliora l’accuratezza del ragionamento senza aggiornare i pesi del modello. Questi risultati mettono in luce un limite di Group Relative Policy Optimization (GRPO), che assegna a ogni token di una risposta lo stesso vantaggio ricavato dall’esito e può rafforzare possibili dipendenze spurie insieme ai processi di ragionamento utili. Sulla base di questa osservazione, introduciamo Semifactual Credit-Augmented Policy Optimization (SCAPO), una variante di GRPO ispirata alla causalità che integra la stabilità semifattuale nell’attribuzione del credito ai singoli token. SCAPO misura la variazione della probabilità dei token per risposte fisse sottoposte a interventi semifattuali e usa punteggi di stabilità normalizzati per ridurre, nelle prime fasi dell’addestramento, i vantaggi assegnati ai token relativamente instabili, senza attribuire credito aggiuntivo alla sola stabilità. Su Qwen3-4B-Base e Qwen3-1.7B-Base, SCAPO migliora l’accuratezza su AIME 2024-2026 rispetto a GRPO rispettivamente di 5,63 e 4,17 punti percentuali. Per entrambe le dimensioni dei modelli, SCAPO ottiene i risultati migliori tra i metodi confrontati nella maggior parte dei benchmark matematici valutati e in tutti i benchmark fuori distribuzione valutati. Questi risultati suggeriscono che la stabilità semifattuale fornisce un segnale di addestramento efficace per migliorare il ragionamento e la generalizzazione attraverso un’attribuzione del credito più granulare nell’RLVR. Il codice è disponibile all’indirizzo https://github.com/DtYXs/SCAPO.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv