Vai al contenuto
AI.info

Ricerca

TRIAGE: stabilizzazione delle discrepanze in base alla direzione nell’apprendimento per rinforzo nativo NVFP4

L’esecuzione a bassa precisione può accelerare notevolmente l’apprendimento per rinforzo (RL) dei modelli linguistici di grandi dimensioni, ma le discrepanze tra l’esecuzione del modello in addestrame

TRIAGE: stabilizzazione delle discrepanze in base alla direzione nell’apprendimento per rinforzo nativo NVFP4
arXiv
2610.07043
Pubblicato
2026-10-05
Autori
Zhen Li, Shuai Zhang, Yanggan Gu, Yiming Zhang, Yang Yu, Mingfa Feng, Congkai Xie, Shuang Yu, Junjie Lai, Hongxia Yang

Abstract degli autori

L’esecuzione a bassa precisione può accelerare notevolmente l’apprendimento per rinforzo (RL) dei modelli linguistici di grandi dimensioni, ma le discrepanze tra l’esecuzione del modello in addestramento e quella del campionatore possono destabilizzare l’ottimizzazione della policy. In questo articolo analizziamo l’interazione tra le discrepanze e la direzione del gradiente della policy, distinguendo i contributi agli aggiornamenti che amplificano localmente le discrepanze da quelli che le riducono: la sola entità delle discrepanze non permette di identificarli. Nelle esecuzioni native NVFP4 osserviamo uno squilibrio iniziale tra le due regioni amplificanti, a favore degli aggiornamenti con vantaggio negativo e scarto negativo. I relativi token di coda si concentrano in una piccola parte dei segmenti delle risposte prima che le discrepanze si estendano globalmente. Sulla base di questi risultati, introduciamo TRIAGE, un metodo di stabilizzazione che tiene conto della direzione e usa una diagnosi a livello di segmento per riequilibrare selettivamente gli aggiornamenti del gradiente della policy, applicando una correzione limitata alle gravi discrepanze residue. TRIAGE modifica la funzione obiettivo dell’ottimizzazione, mantenendo l’esecuzione forward nativa NVFP4 con pesi e attivazioni a 4 bit (W4A4) sia nel campionatore sia nel modello in addestramento. Gli esperimenti su Qwen3-4B e Qwen3-30B-A3B mostrano un’ottimizzazione stabile per tutto l’orizzonte di addestramento valutato e prestazioni pari a quelle ottenute a piena precisione su cinque benchmark di ragionamento matematico. Con TRIAGE, NVFP4 nativo offre inoltre un throughput dei rollout fino a 2,3 volte superiore a quello di BF16.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv