The Pulse
Uno studio rileva che i critici PPO appiattiscono le variazioni di valore nel ragionamento degli LLM
Un preprint individua l’appiattimento del valore nei critici PPO e propone una supervisione sparsa per preservare le variazioni di valore tra gli stati intermedi del ragionamento.

AI.info Team ·
Un preprint inviato ad arXiv il 16 settembre 2026 descrive una modalità di errore nei modelli di valore che aiutano Proximal Policy Optimization ad addestrare modelli linguistici capaci di ragionare. Gli autori chiamano il problema «appiattimento del valore»: la reale probabilità di successo può cambiare bruscamente mentre un modello elabora una risposta, mentre il critico PPO prevede un profilo di valore relativamente uniforme.
«Abbiamo individuato una modalità di errore sistematica nei critici PPO, che chiamiamo appiattimento del valore: i valori degli stati, stimati a partire da molteplici continuazioni Monte Carlo, cambiano bruscamente tra gli stati intermedi, mentre le previsioni del critico restano relativamente uniformi.»
Yizhuo Li, autore indicato per primo
L’articolo, intitolato Ripensare l’apprendimento del critico in PPO: comprendere e mitigare l’appiattimento del valore, elenca autori affiliati alla Shanghai Jiao Tong University, allo Shanghai AI Laboratory, alla Westlake University, alla Nanjing University, alla Tsinghua University, alla Chinese University of Hong Kong e alla Nanyang Technological University. Yizhuo Li e Jianhao Yan sono indicati come coautori con pari contributo. Yun Luo, Peilin Zhao, Yafu Li e Yu Cheng sono indicati come autori corrispondenti.
I ricercatori sostengono che il problema sia rilevante perché PPO usa la stima del critico per ciascun token generato per calcolare i vantaggi su cui si basano gli aggiornamenti della policy. Se il critico non coglie variazioni significative tra gli stati intermedi, l’attore può ricevere segnali deboli o distorti su quali parti di una traccia di ragionamento abbiano aumentato la probabilità di una risposta corretta.
Il critico vede lo stesso esito ripetuto lungo una risposta
Negli esperimenti, l’addestramento PPO standard usa ricompense solo terminali. A una risposta viene assegnato un esito binario finale, e lo stesso ritorno campionato è usato come obiettivo del critico in ogni stato lungo quella risposta. L’articolo distingue questo obiettivo di addestramento ripetuto dal valore condizionato alla policy: l’esito atteso se la policy corrente prosegue da un particolare stato intermedio.
Per misurare la differenza, gli autori campionano più continuazioni indipendenti da stati intermedi selezionati. La media di questi esiti produce una stima Monte Carlo del valore di ciascuno stato. Nelle esecuzioni di ragionamento con Qwen3, tali stime spesso variano bruscamente tra stati adiacenti, mentre il critico PPO rimane relativamente uniforme. In alcuni esempi, il critico varia nella direzione opposta rispetto alla stima Monte Carlo.
Gli autori testano anche un ambiente stocastico FrozenLake, in cui il valore di uno stato corrisponde alla probabilità di raggiungere infine l’obiettivo. Secondo l’articolo, mantenendo invariata la configurazione di addestramento e aumentando le dimensioni del labirinto, le previsioni del critico diventano progressivamente più uniformi e meno accurate. Il risultato suggerisce che il problema non riguarda solo le risposte dei modelli linguistici e potrebbe accentuarsi con l’aumento dello spazio degli stati.
Due forze spingono le previsioni verso la media
L’articolo individua due meccanismi che possono produrre l’effetto di appiattimento. Il primo deriva dall’obiettivo di errore quadratico medio del critico. Quando a ogni posizione di una risposta viene assegnato lo stesso obiettivo terminale, la funzione di perdita può essere scomposta in un termine che adatta la previsione media all’esito e in un secondo termine che penalizza direttamente le variazioni tra le previsioni all’interno della risposta.
La supervisione densa a livello di token scoraggia quindi il critico dall’assegnare valori nettamente diversi a stati vicini, anche quando il valore condizionato alla policy varia tra loro. L’effetto è particolarmente evidente quando le ricompense arrivano solo alla fine di una risposta lunga.
Il secondo meccanismo è legato alla correlazione temporale. Gli stati adiacenti di un modello linguistico differiscono per un solo token appena generato e condividono gran parte del contesto precedente. L’analisi delle rappresentazioni e dei gradienti svolta nell’articolo rileva che stati vicini producono aggiornamenti simili del critico; di conseguenza, supervisionare ogni token può ripetere molti aggiornamenti strettamente correlati, anziché fornire informazioni indipendenti.
SP³O mantiene solo pochi obiettivi per il critico
Per contrastare entrambi gli effetti, i ricercatori introducono SParse Proximal Policy Optimization, o SP³O. Il metodo lascia invariati l’obiettivo dell’attore, la procedura di generazione delle traiettorie e gli obiettivi dei ritorni. Modifica soltanto i punti in cui viene applicata la funzione di perdita del critico, selezionando pochi stati ben distanziati in ogni risposta.
La configurazione predefinita supervisiona gli stati al 30%, 60% e 90% della risposta, aggiungendo uno stato al 95% per le risposte di almeno 6.144 token. Quest’ultima ancora garantisce al critico una copertura esplicita verso la fine delle risposte lunghe, dove, secondo l’articolo, si registra un effetto misurabile sulle prestazioni e sulle ripetizioni.
Su Qwen3-4B-Base, SP³O ha ridotto l’errore quadratico medio del profilo del critico rispetto ai valori Monte Carlo condizionati alla policy del 36% al 30% del percorso della risposta, dell’11% al 60% e del 21% al 90%. L’articolo riferisce inoltre che il rango effettivo mediano delle rappresentazioni del critico centrate sulla risposta è aumentato da 4,33 con PPO a 5,63 con SP³O, un risultato che gli autori interpretano come prova del fatto che il metodo sparso preserva più informazioni sulle differenze tra gli stati.
Nei test riportati, tre ancore superano la supervisione densa
Gli autori valutano Qwen3-4B-Base e Qwen3-8B-Base, addestrati su DAPO-Math-17k. La valutazione comprende sette test di ragionamento matematico, tra cui AIME24, AIME25, AIME26, AMC23, MATH500, Minerva e OlympiadBench, oltre a sei benchmark fuori distribuzione: ARC-C, MMLU-Pro, GPQA, AGIEval-English, BigBenchHard e ZebraLogic-Grid.
Per Qwen3-4B-Base, PPO standard registra una media del 37,60% sul gruppo di test matematici, mentre SP³O raggiunge il 45,57%. Sul gruppo fuori distribuzione, le medie corrispondenti sono del 51,95% e del 59,28%. Per Qwen3-8B-Base, SP³O raggiunge il 50,51% sul gruppo di test matematici e il 66,37% su quello fuori distribuzione, contro rispettivamente il 48,50% e il 64,38% ottenuti da PPO standard.
Questi risultati derivano dalla valutazione a 24K riportata dagli autori. I punteggi matematici sono calcolati come media di 32 generazioni, mentre quelli fuori distribuzione sono la media di quattro generazioni. L’articolo confronta inoltre SP³O con GRPO, un metodo privo di critico, e riferisce medie più alte per SP³O sia nei test matematici sia in quelli fuori distribuzione, per entrambi i blocchi di dimensioni dei modelli.
Più supervisione non migliora il critico
Uno studio di ablazione su Qwen3-4B-Base rileva che supervisionare tre, quattro e otto stati per risposta produce ricompense medie di addestramento superiori rispetto a configurazioni più dense. Nell’esperimento riportato, le prestazioni raggiungono il massimo con tre ancore, poi calano considerevolmente con 16 e 64 stati supervisionati, avvicinandosi ai valori di riferimento di PPO denso.
Anche la posizione delle ancore è importante. Tre posizioni fisse al 20%, 50% e 80% producono una media del 44,65% nei test matematici, mentre la disposizione al 30%, 60% e 90% adottata nell’articolo raggiunge il 45,57%. La disposizione casuale ottiene il 36,59%, al di sotto del valore di riferimento del 37,60% di PPO. Aggiungere l’ancora finale porta il risultato riportato dal 44,10% al 45,57% e riduce una misura delle ripetizioni da 18,33 a 1,12.
Lo studio è un preprint e le prove derivano dagli esperimenti degli autori, non da una replica indipendente. La sua tesi, più circoscritta, è specifica: nella configurazione di addestramento del critico qui esaminata, con ricompense terminali e supervisione a livello di token, PPO può mantenere la capacità di distinguere tra le risposte, ma perdere risoluzione tra gli stati all’interno della stessa risposta. I miglioramenti riportati per SP³O derivano dall’applicazione della funzione di perdita del critico in tre posizioni ampiamente distanziate, anziché a ogni token.
Leggi il preprint completo su arXiv.