The Pulse
La centratura dello score mantiene stabile l’apprendimento per rinforzo dei LLM al 30% sotto stress INT4
Un nuovo studio di Together AI individua nell’accumulo di deriva una delle principali cause di instabilità nell’apprendimento per rinforzo dei modelli linguistici di grandi dimensioni. Con il metodo di centratura dello score, l’accuratezza

AI.info Team ·
La centratura dello score raggiunge un’accuratezza in addestramento del 30%, contro il 12% del campionamento per importanza troncato, secondo un nuovo studio in cui ricercatori di Together AI hanno messo alla prova l’apprendimento per rinforzo dei modelli linguistici di grandi dimensioni in condizioni di forte quantizzazione. Il confronto usa un campionatore INT8 con una cache chiave-valore INT4: una configurazione volutamente estrema, pensata per far emergere problemi che, con le normali differenze numeriche, potrebbero manifestarsi molto più tardi.
Lo studio, «Score Centering Stabilizes Off-policy Reinforcement Learning», è stato presentato su arXiv il 17 settembre 2026 da Martin Marek e Max Ryabinin. Secondo gli autori, l’addestramento diventa spesso instabile non semplicemente perché il modello che genera i rollout differisce da quello usato per l’addestramento, ma perché un piccolo scostamento si accumula nel corso degli aggiornamenti successivi.
Il risultato del 30% arriva da uno stress test INT4
Nell’apprendimento per rinforzo dei modelli linguistici di grandi dimensioni, di norma un sistema genera le risposte campionate e un altro calcola i gradienti. I due sistemi possono differire perché usano precisioni numeriche o kernel diversi, stack software separati oppure pesi del modello non sincronizzati a ogni passaggio. Lo studio chiama lo scarto che ne deriva «disallineamento tra addestramento e inferenza», o TIM.
Nel normale addestramento con gradiente di policy, la risposta campionata riceve una ricompensa e il modello aggiorna le probabilità dei suoi token in base allo score della risposta. Quando campionatore e modello usato per l’addestramento coincidono, il valore atteso dello score è zero per ogni prefisso. Lo studio mostra che, in presenza di TIM, tale valore atteso può diventare diverso da zero. La deriva che ne consegue spinge il modello usato per l’addestramento verso il campionatore anche quando la ricompensa non contiene informazioni che favoriscano un token campionato rispetto a un altro.
Le sincronizzazioni ripetute possono trasformare il problema in un circolo vizioso. Un campionatore che opera a precisione inferiore o usa pesi meno aggiornati orienta il modello usato per l’addestramento verso i propri output; il modello aggiornato fornisce poi il checkpoint successivo del campionatore, trascinando con sé la distorsione. Gli autori descrivono l’effetto come una forma di distillazione con un modello insegnante in movimento, che può amplificarsi fino al crollo della ricompensa o dell’accuratezza.
Sottrarre lo score atteso del campionatore
La centratura dello score affronta questa deriva con una correzione additiva. Per ogni posizione di un token, il metodo sottrae dallo score del modello usato per l’addestramento lo score atteso secondo la distribuzione del campionatore. Lo score corretto ha un valore atteso pari a zero sotto la distribuzione del campionatore: elimina così il termine responsabile della deriva, preservando la covarianza dipendente dalla ricompensa che fornisce il segnale di apprendimento.
L’approccio è diverso dal campionamento per importanza, che moltiplica il gradiente per un rapporto tra le probabilità del modello usato per l’addestramento e quelle del campionatore. Per i token rari, questi rapporti possono diventare molto grandi e aumentare la varianza del gradiente. Per questo, nei sistemi pratici si applicano soglie o maschere ai rapporti, limitando la correzione e rischiando di reintrodurre una distorsione.
Nella sua forma di base, la centratura dello score non usa rapporti di importanza, soglie di troncamento o iperparametri aggiuntivi. Per un dato prefisso, la correzione è deterministica, anziché dipendere dal token che è stato campionato. Gli autori mostrano inoltre che la correzione additiva può essere combinata con il campionamento per importanza quando il campionatore è molto indietro negli aggiornamenti.
Un’approssimazione basata sui primi 128 valori rende praticabile il metodo
Per calcolare la correzione esatta bisognerebbe conservare la probabilità assegnata dal campionatore a ogni token del vocabolario. Lo studio indica per Qwen3 un vocabolario di circa 152.000 token: conservare tutti i logaritmi delle probabilità in virgola mobile per rollout lunghi avrebbe un costo proibitivo.
L’implementazione registra invece i 128 logaritmi delle probabilità più alti del campionatore e stima la parte restante della distribuzione usando quella del modello impiegato per l’addestramento, riscalata affinché la sua massa corrisponda a quella della parte restante della distribuzione del campionatore. Secondo gli esperimenti riportati nello studio, l’uso di 128 valori, e perfino di 32, offre prestazioni paragonabili alla centratura completa dello score in tutte le configurazioni testate.
Questa scelta rende il metodo compatibile con i sistemi di generazione dei rollout che, dopo la generazione, scartano gran parte della distribuzione di output del campionatore. Lo studio presenta una formulazione basata su una funzione di perdita scalare e un esempio di implementazione in JAX, oltre al codice collegato dalla pagina arXiv.
I risultati sui modelli da 0,6B e 30B
Gli esperimenti usano Qwen3-0.6B-Instruct sul compito Countdown e Qwen3-30B-A3B-Base sulla parte matematica del dataset INTELLECT-2. I ricercatori applicano tutti i metodi di correzione alla stessa funzione obiettivo REINFORCE con ricompense centrate per gruppo, usando gli stessi campionatore, modello per l’addestramento, ottimizzatore e vantaggi, e un passo di gradiente stocastico per batch.
Per il modello mixture-of-experts da 30B, un campionatore FP8 consente al gradiente di policy senza correzioni di mantenere stabile l’addestramento e raggiungere il 58% di accuratezza in addestramento nell’esecuzione riportata. Il passaggio a una cache chiave-valore FP4 fa collassare il gradiente di policy senza correzioni entro 200 passaggi, mentre il campionamento per importanza con maschera collassa più tardi. La centratura dello score rimane stabile al 52% e il campionamento per importanza troncato raggiunge il 51%.
La configurazione più estrema combina un campionatore INT8 con una cache chiave-valore INT4. La centratura dello score raggiunge il 30% di accuratezza in addestramento, il campionamento per importanza troncato il 12% e tutti gli altri metodi testati terminano sotto il 5%. Il risultato misura l’accuratezza in addestramento nello stress test specificato; non dimostra un miglioramento delle capacità su dati tenuti da parte né un aumento della velocità end-to-end.
I rollout non aggiornati richiedono comunque il campionamento per importanza
La quantizzazione non è l’unica fonte di disallineamento. Gli autori testano anche un campionatore aggiornato una volta ogni 64 passaggi di addestramento. In questa configurazione, la sola centratura dello score funziona meno bene perché la covarianza residua è misurata sotto la distribuzione del campionatore, non sotto quella del modello usato per l’addestramento.
Combinare la centratura dello score con il campionamento per importanza troncato o con maschera dà i risultati migliori quando il campionatore è molto indietro negli aggiornamenti. Il campionamento per importanza corregge in parte la differenza tra le distribuzioni di campionamento, mentre la centratura dello score elimina la deriva residua. Lo studio raccomanda quindi la combinazione quando il modello usato per l’addestramento può allontanarsi molto dal campionatore tra una sincronizzazione e l’altra.
Gli autori sono espliciti sui limiti delle prove. I confronti principali usano sequenze brevi e un disallineamento volutamente grave, in modo che le differenze emergano nell’arco di poche centinaia di passaggi. Presentano queste esecuzioni come un indicatore indiretto di ciò che potrebbe accadere in un addestramento più lungo con un disallineamento meno marcato, non come una dimostrazione diretta che gli stessi miglioramenti di accuratezza si manifesteranno in sistemi di produzione su larga scala e con contesti lunghi.
La conclusione più circoscritta dello studio resta comunque concreta: nelle condizioni testate, la sola eliminazione della deriva impedisce il collasso dell’apprendimento per rinforzo laddove diversi metodi di campionamento per importanza e di troncamento falliscono. Resta da verificare sperimentalmente se il risultato si estenda ai livelli di quantizzazione ordinari, a compiti agentici più lunghi e a intervalli di sincronizzazione meno frequenti ma più realistici.