Vai al contenuto
AI.info

Approfondimenti tecnici

La guerra degli ottimizzatori: come Muon sta sostituendo Adam nell’addestramento dell’IA di frontiera

Kimi K2 è stato addestrato su 15,5 bilioni di token con MuonClip, senza alcun picco della loss. Un anno dopo, Kimi K3, DeepSeek-V4 e GLM-5 ortogonalizzano tutti i propri aggiornamenti, mentre Muon ha un nuovo sfidante: Aurora.

La guerra degli ottimizzatori: come Muon sta sostituendo Adam nell’addestramento dell’IA di frontiera

Gabriele Masetti ·

L’ottimizzatore che nessuno metteva in discussione, fino a oggi

Per circa un decennio, scegliere un ottimizzatore per addestrare una grande rete neurale non è stata davvero una scelta. Adam, pubblicato da Diederik Kingma e Jimmy Ba nel 2014, e il suo parente AdamW, che corregge il decadimento dei pesi, sono diventati lo standard a tal punto che la maggior parte degli articoli scientifici non si preoccupava di motivare la scelta. Ogni modello GPT, ogni versione di Llama e ogni modello cinese a pesi aperti fino al 2024 ha addestrato i propri strati densi con una qualche variante di AdamW.

Quegli 11 anni di predominio incontrastato si sono conclusi nell’estate del 2025, quando Moonshot AI ha lanciato Kimi K2, un modello mixture-of-experts da 1.000 miliardi di parametri preaddestrato interamente con un nuovo ottimizzatore chiamato MuonClip. Il rapporto tecnico di Kimi K2 afferma senza mezzi termini che il modello «è stato preaddestrato su 15,5 bilioni di token senza alcun picco della perdita», un risultato in termini di stabilità che i modelli di scala comparabile addestrati con AdamW non hanno mai eguagliato.

14 mesi dopo, gli ottimizzatori della famiglia Muon addestrano GLM-5 di Zhipu AI, Kimi K3 di Moonshot, DeepSeek-V4 e i modelli Trinity di Arcee AI. Il confronto tra Adam e Muon non è più una curiosità accademica: è una questione concreta nel preaddestramento dei modelli di frontiera. E Muon è il primo nuovo ottimizzatore per l’addestramento dell’IA, dai tempi di Adam, a raggiungere una vera scala di produzione.

Per capire perché, bisogna distinguere 2 domande che nei confronti informali vengono spesso confuse: Muon addestra più velocemente di AdamW per token? E addestra con maggiore stabilità alla scala raggiunta oggi dai modelli mixture-of-experts? I dati che seguono rispondono a entrambe, con cifre riconducibili ai benchmark originali di Keller Jordan, ai rapporti tecnici di Moonshot e ai laboratori che ne hanno seguito l’esempio.

Che cos’è Muon? Momentum ortogonalizzato con Newton-Schulz

Muon — MomentUm Orthogonalized by Newton-Schulz — è stato presentato dal ricercatore indipendente Keller Jordan in un post pubblicato l’8 dicembre 2024, inizialmente come ottimizzatore per le matrici bidimensionali dei pesi degli strati nascosti di una rete neurale (gli embedding e lo strato finale di classificazione restano affidati ad AdamW). L’algoritmo esegue prima una normale SGD con momentum, poi sostituisce la matrice di aggiornamento risultante con la matrice semi-ortogonale più vicina, prima di applicarla ai parametri.

Jordan motiva quel passaggio in modo preciso: «gli aggiornamenti prodotti sia dalla SGD con momentum sia da Adam per i parametri 2D delle reti neurali basate su transformer hanno in genere un numero di condizionamento molto elevato». In parole semplici, poche direzioni dominano l’aggiornamento, mentre molte altre direzioni utili vengono quasi ignorate; ortogonalizzare l’aggiornamento appiattisce questa distribuzione, così che ogni direzione riceva una correzione di entità comparabile, anziché lasciare che poche direzioni singolari dominanti soffochino le altre.

Un’ortogonalizzazione esatta richiederebbe una decomposizione completa ai valori singolari per ogni matrice, a ogni passo: un’operazione troppo lenta per l’addestramento su GPU. Muon la approssima invece con un’iterazione di Newton-Schulz, una procedura ricorsiva per matrici che converge verso la componente ortogonale di una matrice usando soltanto moltiplicazioni tra matrici. Queste operazioni vengono eseguite in modo efficiente, con la precisione ridotta bfloat16, sui tensor core delle GPU. L’implementazione di Jordan usa una variante quintica (di quinto ordine) di Newton-Schulz con coefficienti fissi (a, b, c) = (3,4445, −4,7750, 2,0315), eseguendo in genere 5 iterazioni per aggiornamento.

Il costo aggiuntivo è contenuto: Jordan stima che l’ortogonalizzazione incida per circa lo 0,5–0,7% sui FLOP totali dell’addestramento in esperimenti su scala NanoGPT e Llama-405B. Nel benchmark di addestramento rapido NanoGPT, Muon ha ridotto di un fattore 1,35x il tempo effettivo necessario per raggiungere una perdita di validazione prefissata rispetto al precedente record basato su AdamW, e ha anche stabilito il record tuttora valido di velocità su CIFAR-10.

In un confronto interno riportato per un modello da 1,5 miliardi di parametri, Muon ha raggiunto la perdita prefissata in 10 ore su 8×H100 GPU, contro le 13,3 ore impiegate da AdamW sullo stesso hardware.

Benchmark Muon AdamW
Addestramento rapido NanoGPT (tempo effettivo fino alla perdita prefissata) 1,35x più veloce riferimento
Esperimento da 1,5 miliardi di parametri, 8×H100 10 ore 13,3 ore
Throughput su GB300 NVL72 1.080 TFLOPs/s/GPU 1.051 TFLOPs/s/GPU
Efficienza computazionale secondo le leggi di scala di Moonshot ~2x riferimento

Perché Adam(W) ha dominato per un decennio — e dove incontra difficoltà su larga scala

La longevità di AdamW dipendeva da un compromesso davvero valido: tassi di apprendimento adattivi per ciascun parametro, calcolati tramite stime progressive del primo e del secondo momento; decadimento dei pesi disaccoppiato; e un patrimonio di accorgimenti ingegneristici — fase iniziale di aumento graduale del tasso di apprendimento, limitazione dei gradienti, programmi WSD — accumulato in un decennio di addestramenti in produzione. Nulla di tutto questo, però, rendeva AdamW economico.

I suoi momenti adattivi sono notoriamente soggetti a instabilità che si accumulano quando le dimensioni dei modelli e i budget di token superano la soglia di 1.000 miliardi di parametri e diversi bilioni di token, la fascia in cui operano gli attuali modelli mixture-of-experts di frontiera. È proprio in questa fascia che, in diversi addestramenti pubblici, sono stati segnalati picchi della perdita che hanno richiesto il ripristino manuale di uno stato precedente e interventi mirati sul tasso di apprendimento.

L’articolo di Moonshot AI del febbraio 2025, «Muon è scalabile per l’addestramento degli LLM», affrontava direttamente questo problema di scalabilità: dopo aver aggiunto il decadimento dei pesi alla regola di aggiornamento di Muon e aver regolato l’entità degli aggiornamenti per ciascun parametro in modo da mantenere una scala coerente della radice quadratica media tra parametri matriciali e non matriciali, gli esperimenti del gruppo sulle leggi di scala hanno rilevato che Muon «raggiunge un’efficienza computazionale circa 2× superiore a quella di AdamW» a parità di risorse computazionali impiegate nell’addestramento.

Quell’articolo presentava anche Moonlight, un modello mixture-of-experts da 3B/16B parametri addestrato con Muon e preaddestrato su 5,7 bilioni di token, come prova di fattibilità della scalabilità di Muon oltre i piccoli esperimenti di ricerca: 5 mesi prima che Kimi K2 portasse la stessa idea a 1.000 miliardi di parametri.

Che cos’è MuonClip? La soluzione di Kimi K2 ai punteggi di attenzione che crescono senza controllo

Portare Muon alla scala di Kimi K2 ha rivelato un problema che non era emerso nelle esecuzioni più piccole: i logit dell’attenzione tra query e key crescevano senza limite. Poiché gli aggiornamenti ortogonalizzati di Muon spingono le matrici dei pesi più intensamente e in modo più uniforme nelle diverse direzioni rispetto ai passi adattivi di Adam, le matrici di proiezione di query e key nelle teste di attenzione potevano spostarsi in una condizione in cui il prodotto scalare tra i vettori query e key — il logit grezzo dell’attenzione — esplodeva prima della softmax, producendo NaN o picchi catastrofici della perdita.

Il rapporto tecnico di Kimi K2 presenta la soluzione in termini diretti: «Proponiamo l’ottimizzatore MuonClip, che migliora Muon con una nuova tecnica QK-clip per affrontare l’instabilità dell’addestramento, conservando al tempo stesso l’elevata efficienza nell’uso dei token di Muon».

QK-Clip interviene a posteriori: non pone un limite direttamente ai punteggi di attenzione, ma ridimensiona i pesi che li hanno prodotti. Per ogni testa di attenzione h, l’algoritmo tiene traccia del logit di attenzione massimo raggiunto durante il passo, S_max^h. Se quel valore supera una soglia fissa τ (impostata a 100 per l’intera esecuzione di Kimi K2), i pesi delle proiezioni di query e key di quella testa vengono ridimensionati secondo un fattore γ_h = min(1, τ / S_max^h), applicato come √γ_h a ciascuno di W_q^h e W_k^h, così che il loro prodotto venga ridotto complessivamente di un fattore γ_h.

È fondamentale che questo avvenga come fase di post-elaborazione dei pesi dopo il normale aggiornamento di Muon: non modifica il calcolo del passaggio in avanti né di quello all’indietro nel passo in cui è stato rilevato il picco, ma vincola soltanto i pesi impiegati nel passo successivo.

Nell’esecuzione di Kimi K2, il limite è stato effettivamente raggiunto per circa il primo 30% dei passi di addestramento, mantenendo i logit massimi entro la soglia di 100. Poi i punteggi di attenzione si sono assestati spontaneamente in un intervallo stabile intorno a 30 e il meccanismo ha smesso di attivarsi per il resto dell’esecuzione da 15,5 bilioni di token.

Nessun picco della perdita su 15,5 bilioni di token: perché questo dato conta

«Nessun picco della perdita» può sembrare una nota tecnica marginale, ma alla scala dei mille miliardi di parametri è quasi l’intera partita. Un picco della perdita durante il preaddestramento costringe di norma il team a interrompere l’esecuzione, tornare a un checkpoint precedente, saltare o riordinare il batch di dati responsabile e talvolta ridurre il tasso di apprendimento. Ogni ciclo di ripristino consuma ore di GPU che erano già state impiegate nei passi interessati dal picco, e un’instabilità ripetuta può imporre di ricominciare da capo un’intera fase di addestramento.

Le analisi retrospettive pubbliche di diverse grandi esecuzioni di preaddestramento aperte hanno documentato proprio questa sequenza di picchi e ripristini. Un’esecuzione su scala di bilioni di token completata senza interventi del genere significa che tutti i 15,5 bilioni di token visti da Kimi K2 hanno contribuito al modello finale, al primo tentativo, con un programma di addestramento stabilito una volta sola all’inizio (tasso di apprendimento costante di 2e-4 per i primi 10 bilioni di token dopo un warmup di 500 passi, poi decadimento cosinusoidale fino a 2e-5 nei restanti 5,5 bilioni) e mai rivisto durante l’esecuzione.

È un’affermazione sulla riproducibilità tanto quanto sulla stabilità: una procedura fissa che un team può ripetere, trasferire su nuovo hardware o affidare a un altro laboratorio senza aspettarsi ogni volta un risultato diverso e più soggetto a picchi.

Perché addestrare Kimi K2 costa poco?

Moonshot non ha pubblicato un budget di addestramento verificato per Kimi K2, e i vertici dell’azienda hanno contestato pubblicamente le cifre di costo non ufficiali circolate per la successiva variante K2 Thinking, affermando che il numero «non è ufficiale» perché è difficile separare i costi della ricerca e della sperimentazione da quelli dell’esecuzione finale del preaddestramento.

Stime indipendenti del calcolo impiegato collocano comunque il preaddestramento del modello base Kimi K2 intorno a 2,8 milioni di ore di GPU H800 su 14,8 bilioni di token: nell’ordine di 5,6 milioni di dollari alle tariffe tipiche delle GPU nel cloud. È una cifra paragonabile al costo di addestramento di DeepSeek-V3, ampiamente citato, e una piccola frazione di quanto i laboratori occidentali all’avanguardia hanno dichiarato per modelli di scala simile.

Tre fattori concorrono a questa efficienza: secondo lo studio di Moonshot sulle leggi di scala, Muon è circa 2x più efficiente di AdamW nell’uso dei campioni, il che significa che servono meno token per raggiungere un dato livello di perdita; un’architettura mixture-of-experts sparsa che attiva soltanto 32,6 miliardi degli 1,04 bilioni di parametri totali del modello per ogni token; e, come illustrato sopra a proposito della stabilità, un’intera esecuzione da 15,5 bilioni di token completata senza i cicli di riavvio e ripristino che fanno lievitare silenziosamente il costo computazionale effettivo delle esecuzioni di addestramento meno stabili.

Nessuno dei tre fattori sarebbe di grande aiuto senza gli altri due: un ottimizzatore efficiente nell’uso dei campioni serve a poco se diventa instabile su larga scala, e un’architettura sparsa serve a poco se l’ottimizzatore non riesce ad addestrarla in modo affidabile.

Ottimizzatore Muon contro Adam: chi altro ha adottato Muon

Kimi K2 non è stato l’ultimo a usarlo. GLM-4.5 di Zhipu AI, rilasciato nello stesso mese di Kimi K2, a luglio 2025, con 355 miliardi di parametri totali e 32 miliardi di parametri attivi, è stato addestrato con Muon standard nei suoi strati nascosti. Il successivo GLM-5 di Zhipu, rilasciato l’11 febbraio 2026 con 744 miliardi di parametri totali e 40 miliardi di parametri attivi distribuiti su 80 strati e 256 esperti, si è spinto oltre con una variante che il rapporto tecnico chiama Muon Split: le matrici di proiezione vengono suddivise in blocchi più piccoli, uno per testa, prima dell’ortogonalizzazione. Il team ha ritenuto questo passaggio necessario per rendere Muon compatibile con l’attenzione multi-latente di GLM-5 senza una perdita di prestazioni.

DeepSeek ha compiuto lo stesso passaggio con i propri modelli di frontiera. Il rapporto su DeepSeek-V4, pubblicato su arXiv il 26 aprile 2026, descrive due modelli — V4-Pro con 1,6 bilioni di parametri totali e 49 miliardi di parametri attivati, V4-Flash con 284 miliardi e 13 miliardi — addestrati su oltre 32 bilioni di token usando, nelle parole dell’abstract, «l’ottimizzatore Muon per una convergenza più rapida e una maggiore stabilità dell’addestramento».

Fuori dalla Cina, Trinity Large di Arcee AI — un MoE sparso con circa 400 miliardi di parametri totali e 13 miliardi attivi, addestrato su 2.048 GPU Nvidia B300 e rilasciato in anteprima a febbraio 2026 — ha usato Muon per gli strati nascosti e AdamW per gli embedding e le proiezioni di output. È la stessa ripartizione raccomandata dalla ricetta originale di Jordan e ne fa uno dei primi modelli addestrati negli Stati Uniti ad adottare questo approccio su larga scala. Il 1° aprile 2026 Arcee ha rilasciato sotto licenza Apache 2.0 una variante per il ragionamento, Trinity-Large-Thinking.

Da allora NVIDIA ha integrato il supporto nativo per Muon in Megatron-Core e nel NeMo Megatron Bridge. Nei suoi benchmark su GB300 NVL72, con una configurazione delle dimensioni di Kimi K2, l’addestramento con Muon ha raggiunto circa 1.080 TFLOPs/s/GPU contro 1.051 con AdamW: un divario piccolo ma positivo, che l’azienda attribuisce al conteggio delle moltiplicazioni di matrici di Newton-Schulz tra i FLOPs utili del modello.

Parametri attivi per token nei modelli di frontiera addestrati con ottimizzatori della famiglia Muon, secondo i dati riportati nell’articolo.

Modello Rilascio Parametri totali Parametri attivi
Kimi K2 luglio 2025 1,04 bilioni 32,6 miliardi
GLM-4.5 luglio 2025 355 miliardi 32 miliardi
Kimi K2.5 gennaio 2026 1 bilione 32 miliardi
GLM-5 febbraio 2026 744 miliardi 40 miliardi
Trinity Large febbraio 2026 ~400 miliardi 13 miliardi
DeepSeek-V4-Pro aprile 2026 1,6 bilioni 49 miliardi
Kimi K2.7-Code giugno 2026 1 bilione 32 miliardi
Kimi K3 luglio 2026 2,8 bilioni 104 miliardi

Per-Head Muon, Kimi K3 e l’ottimizzatore che sfida Muon

Kimi K3 è arrivato nelle app e nell’API di Moonshot il 16 luglio 2026. I pesi aperti e il rapporto tecnico sono seguiti il 27 luglio, nella data indicata dall’azienda. Nel frattempo, il laboratorio aveva rilasciato tre modelli intermedi da un bilione di parametri: K2.5 il 27 gennaio 2026, K2.6 ad aprile e K2.7-Code il 12 giugno.

Il rapporto pubblicato sostituisce le stime circolate in precedenza. K3 è «un modello Mixture-of-Experts da 2,8T parametri, con 104 miliardi di parametri attivati, capacità visive native e una finestra di contesto da 1 milione di token», basato su Kimi Delta Attention e Attention Residuals, con uno strato di instradamento chiamato Stable LatentMoE che attiva 16 dei 896 esperti instradati per token. Moonshot quantifica il guadagno complessivo in «un miglioramento di circa 2,5 volte nell’efficienza complessiva di scalabilità rispetto a Kimi K2».

La scelta dell’ottimizzatore è rimasta invariata anche dopo questo salto. K3 addestra i parametri delle matrici con Per-Head Muon, ortogonalizzando separatamente la proiezione di ciascuna testa di attenzione anziché l’intera matrice in una volta, insieme al meccanismo di limitazione dei pesi introdotto per Kimi K2. La risposta di Moonshot all’instabilità resta un vincolo applicato ai pesi dopo l’aggiornamento, mai una riscrittura dell’aggiornamento stesso. K3 è diventato disponibile a tutti su Amazon Bedrock il 18 settembre 2026.

La posizione di Muon come nuovo standard è già messa in discussione. Tilde Research ha pubblicato Aurora il 5 maggio 2026 dopo aver scoperto che Muon priva gradualmente una parte della rete di aggiornamenti efficaci: «al passo 500, più di un neurone su quattro è di fatto inattivo», perché le righe deboli di una matrice dei pesi alta continuano a ricevere aggiornamenti deboli. Aurora impone che ogni aggiornamento sia al tempo stesso ortogonale e uniforme nella norma delle righe, e Tilde lo presenta come un sostituto diretto che costa circa il 6% in più rispetto a Muon.

Un decennio in cui Adam è stato la scelta predefinita si è concluso con un modello da un bilione di parametri che non ha registrato picchi di instabilità. Quattordici mesi dopo, è l’ottimizzatore che gli è subentrato a richiedere correttivi.

Esplora

Altri articoli