Vai al contenuto
AI.info

Ricerca

Verso l’apprendimento per rinforzo FP8 sull’intera pipeline per gli LLM

L’apprendimento per rinforzo (RL) è diventato una tecnica fondamentale per migliorare le capacità di ragionamento e agentiche dei modelli linguistici di grandi dimensioni (LLM). Sebbene la quantizzazi

Verso l’apprendimento per rinforzo FP8 sull’intera pipeline per gli LLM
arXiv
2609.22870
Pubblicato
2026-09-19
Autori
Fanchao Chen, Ziheng Jiang, Ziyun Wei, Zheng Zhong, Du Li, Chi Zhang, Haibin Lin, Shivaram Venkataraman

Abstract degli autori

L’apprendimento per rinforzo (RL) è diventato una tecnica fondamentale per migliorare le capacità di ragionamento e agentiche dei modelli linguistici di grandi dimensioni (LLM). Sebbene la quantizzazione FP8 possa accelerare l’addestramento RL, mantenere la stabilità lungo un’intera pipeline RL in FP8 resta una sfida. Mentre i lavori precedenti si sono concentrati sulla risoluzione delle discrepanze tra addestramento e inferenza tramite tecniche di correzione come TIS, mostriamo che l’RL in FP8 sull’intera pipeline soffre ancora di gravi instabilità durante l’addestramento, che si manifestano con picchi anomali dell’entropia a metà addestramento e output incomprensibili. Riconduciamo questa instabilità a una causa finora trascurata: il rumore di quantizzazione FP8 cumulativo distorce il rapporto d’importanza, spingendo in misura sproporzionata i token con vantaggio negativo al di fuori della regione di fiducia e azzerando erroneamente i loro gradienti. Di conseguenza, gli output patologici non vengono penalizzati adeguatamente e si accumulano nel corso dell’addestramento. Per affrontare il problema, proponiamo Calibrated Clipping, un metodo dinamico che allinea i limiti di clipping FP8 alle distribuzioni BF16 ad alta precisione, facendo corrispondere il quantile di clipping del limite inferiore e riequilibrando di conseguenza quello superiore. Esperimenti approfonditi con gli algoritmi GRPO e DAPO, modelli di dimensioni comprese tra 8B e 32B e diverse granularità di scalatura FP8 dimostrano che il nostro approccio elimina efficacemente i picchi dell’entropia e ripristina prestazioni paragonabili a quelle del baseline BF16.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv