Ricerca
NeMo-DCR: refit compresso per differenze ed esatto al bit per l’apprendimento per rinforzo agentico scalabile su scala di mille miliardi di parametri
L’apprendimento per rinforzo agentico (RL) separa l’addestramento dal rollout: ogni aggiornamento della policy deve quindi raggiungere i cluster di rollout prima del batch successivo. Trasferire un ch

- arXiv
- 2610.08430
- Pubblicato
- 2026-10-06
- Autori
- Songlin Jiang, Zhiyu Li, Terry Kong, Yu Yao, Youngeun Kwon, Bernard Nguyen, Ashwath Aithal, Mario Di Francesco
Abstract degli autori
L’apprendimento per rinforzo agentico (RL) separa l’addestramento dal rollout: ogni aggiornamento della policy deve quindi raggiungere i cluster di rollout prima del batch successivo. Trasferire un checkpoint completo da 1T per sincronizzare i pesi con un refit richiede 87,5 min tra due regioni AWS. Le misurazioni dell’addestramento in BF16 mostrano che, a ogni passo, circa l’1% dei pesi cambia valore memorizzato. I sistemi recenti sfruttano questa sparsità, ma presentano limiti nel posizionamento, nell’esattezza o nell’efficienza: reimplementano le regole di posizionamento, assemblano tensori completi, ricostruiscono i valori mediante operazioni aritmetiche oppure usano un’operazione collettiva tra cluster. Nessuno, inoltre, garantisce un recupero completo in caso di guasti durante il refit. Presentiamo NeMo-DCR (Delta-Compressed Refit), che invia soltanto le modifiche pur mantenendo l’esattezza al bit: i destinatari ottengono per parametri e buffer gli stessi bit che otterrebbero con un refit denso. Per il posizionamento, mappature affini fisse proiettano le modifiche dalle partizioni usate nell’addestramento nelle coordinate canoniche del checkpoint; una conversione residua gestisce le altre modifiche e il modulo di caricamento nativo del runtime di servizio colloca tutte le modifiche nello spazio di memorizzazione dei destinatari. Per garantire l’esattezza, maschere XOR comprimibili veicolano le modifiche affini, per le quali la proiezione e il modulo di caricamento preservano i bit memorizzati; le sovrascritture veicolano le altre. I destinatari applicano entrambe direttamente nello spazio di memorizzazione, i nuovi tentativi sovrascrivono le scritture parziali e un commit congiunto lega la policy alla base di riferimento per il delta successivo. Per l’efficienza, i payload vengono trasmessi in streaming tramite un’archiviazione a oggetti o un albero di inoltro durante la costruzione del delta, senza un’operazione collettiva tra cluster. Anche con tassi di modifica del 3% e del 5%, i refit di NeMo-DCR per modelli da 30B-1T sono 12-40$\times$ più veloci di un riferimento basato sul solo trasferimento del checkpoint completo. Un refit di un modello da 1T tramite albero di inoltro, con un tasso di modifica del 3%, richiede 150 s invece di 87,5 min, rendendo pratici i refit per l’apprendimento per rinforzo agentico tra cluster su scala di mille miliardi di parametri.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv