The Pulse
Z.ai ha costruito lo stack di inferenza di GLM-5.3-Flash con 100.000 chip IA
Z.ai afferma di aver realizzato il sistema di inferenza in produzione per GLM-5.3-Flash su oltre 100.000 acceleratori IA di produzione cinese. L’azienda riferisce un aumento di tre volte del throughput e dice che un agente di programmazione

AI.info Team ·
100.000 acceleratori, sei giorni, 62.000 miliardi di token
Z.ai afferma di aver distribuito GLM-5.3-Flash su un cluster di oltre 100.000 acceleratori IA di produzione cinese, per poi usare il sistema per elaborare più di 62.000 miliardi di token in sei giorni, con traffico reale. L’azienda descrive il lavoro come uno dei primi esempi di un sistema di IA che contribuisce a costruire l’infrastruttura necessaria per far funzionare i suoi successori.
Le cifre compaiono in un post di Z.ai del 17 settembre 2026, che descrive come l’azienda abbia portato GLM-5.3-Flash dalla prima esecuzione riuscita sul nuovo hardware a un servizio in produzione. Z.ai afferma che il modello è diventato pronto per la produzione in meno di due settimane e che il sistema di serving finale ha raggiunto un throughput end-to-end circa tre volte superiore a quello della configurazione iniziale di riferimento.
La distribuzione è degna di nota perché, secondo Z.ai, nessuno aveva mai gestito prima un cluster di acceleratori di produzione cinese su questa scala. L’hardware presentava diverse limitazioni contemporaneamente: capacità e larghezza di banda della memoria ridotte, supporto incompleto dei kernel, un ecosistema software immaturo e scarsa documentazione a disposizione del team di ingegneri.
GLM-5.3-Flash ha imposto un diverso design del serving
Il modello ha messo ulteriormente sotto pressione il sistema. Z.ai afferma che GLM-5.3-Flash supporta una finestra di contesto da 1 milione di token e richieste multimodali, due caratteristiche che aumentano le esigenze di gestione della memoria e di trasferimento dei dati durante l’inferenza.
Invece di trattare il cluster di acceleratori come un sostituto immediato di una piattaforma GPU più consolidata, l’azienda ha riprogettato lo stack di serving tenendo conto dell’architettura del modello e dei limiti dell’hardware. Il sistema risultante combina diverse forme di parallelismo, quantizzazione, gestione della memoria e pianificazione delle richieste.
Z.ai indica come componenti principali il parallelismo tensoriale intra-nodo per l’attenzione lineare e la testa del modello linguistico, ReplaySSM, la quantizzazione W8A8, la quantizzazione della cache a precisione mista tramite INT8, FP8 e BF16 e Layer Split. L’azienda ha inoltre aggiunto un’architettura Encode-Prefill-Decode che separa le fasi di elaborazione delle richieste, invece di gestirle attraverso un unico percorso di serving indistinto.
Il throughput triplicato è stato ottenuto scambiando memoria con calcolo
La strategia di ottimizzazione ha spesso comportato lo scambio di una risorsa scarsa con un’altra. Z.ai afferma che i suoi ingegneri hanno impiegato più calcolo in cambio di larghezza di banda e comunicazione in cambio di memoria dei dispositivi, con l’obiettivo di mantenere produttivo il parco di acceleratori nonostante i limiti di capacità.
Secondo l’azienda, l’insieme delle modifiche ha migliorato di circa tre volte le prestazioni di serving end-to-end. Z.ai afferma inoltre che l’efficienza di utilizzo dell’hardware e il costo per token hanno raggiunto livelli paragonabili a quelli delle implementazioni con GPU Nvidia più diffuse, sebbene il post non fornisca una tabella dettagliata dei costi né un benchmark replicato in modo indipendente.
Il confronto è quindi un risultato operativo riferito dall’azienda, non una valutazione pubblica standardizzata. Il resoconto di Z.ai chiarisce la direzione del lavoro ingegneristico: ridurre la pressione sulla memoria, mantenere il flusso di dati attraverso il cluster e adattare l’architettura insolita del modello a un hardware dotato di uno stack software meno maturo.
Un agente per l’infrastruttura ha lavorato nel ciclo di ottimizzazione
Z.ai afferma che il lavoro non è stato svolto soltanto dagli ingegneri delle infrastrutture. Gran parte dell’implementazione è stata realizzata con un «Agente per l’infrastruttura» basato su GLM-5.3, che generava e modificava codice ricevendo dal sistema di serving riscontri sulle prestazioni e sulla correttezza.
Nella descrizione dell’azienda, particolare rilievo è dato a questo ciclo di feedback. Una base di codice può fornire a un agente informazioni statiche su funzioni e dipendenze, ma da sola non può spiegare perché un test numerico sia fallito, perché il tempo al primo token sia aumentato del 30 per cento o perché il throughput in output sia diminuito dopo una modifica.
Z.ai afferma quindi di aver costruito un processo che collegava i risultati end-to-end a parti specifiche del sistema, tra cui kernel, scelte di parallelismo, schemi di comunicazione, allocazione della memoria e orchestrazione del serving. L’agente poteva così usare questi segnali per formulare una nuova ipotesi e decidere cosa testare in seguito.
Ox-Alpha ha rivelato il carico di lavoro in produzione
Prima del lancio pubblico di GLM-5.3-Flash, Z.ai lo ha testato con il nome anonimo Ox-Alpha su OpenCode e OpenRouter. L’azienda afferma che, entro una settimana dal lancio, il modello è diventato il più utilizzato su entrambe le piattaforme e ha elaborato oltre 62.000 miliardi di token in sei giorni.
Queste implementazioni hanno sottoposto Z.ai a un carico di lavoro che andava oltre i benchmark interni. Le richieste reali hanno messo in luce l’interazione tra contesti lunghi, input multimodali, architettura del modello, memoria degli acceleratori e decisioni di serving, su una scala che i test isolati non avrebbero riprodotto.
Il traffico in produzione ha inoltre fornito all’Agente per l’infrastruttura una serie di errori e regressioni concreti da analizzare. Z.ai presenta questo ambiente operativo come parte del metodo ingegneristico, non come una semplice fase di convalida finale, successiva al completamento del software.
Z.ai definisce il risultato una prima forma di auto-miglioramento ricorsivo
Z.ai inquadra il progetto come un primo passo verso l’auto-miglioramento ricorsivo, un concetto in cui un sistema di IA contribuisce alla progettazione o all’addestramento di un successore. L’azienda non sostiene che GLM-5.3-Flash sia in grado di progettare e addestrare autonomamente un nuovo modello dall’inizio alla fine.
Il post descrive invece una capacità più circoscritta: GLM-5.3 ha contribuito a costruire l’infrastruttura di inferenza usata per fornire GLM-5.3-Flash, apportando modifiche al codice e svolgendo attività di ottimizzazione che, secondo Z.ai, in precedenza avrebbero richiesto settimane a un team di ingegneri esperti di infrastrutture.
La distinzione è importante. Il sistema dimostrato dipende ancora da obiettivi, hardware, procedure di valutazione e controlli di distribuzione progettati da esseri umani. Ciò che riferisce Z.ai è un ciclo di lavoro ingegneristico assistito dall’IA che ha abbreviato il percorso dall’adattamento all’hardware al servizio in produzione, ottenendo al contempo miglioramenti misurabili su un grande cluster.
Il risultato più concreto è il sistema di serving stesso: oltre 100.000 acceleratori di produzione cinese, un miglioramento dichiarato di tre volte rispetto al throughput iniziale di riferimento e una distribuzione in produzione completata in meno di due settimane. Il post di Z.ai non chiarisce quanto di questo ritmo sia dovuto alle capacità di ragionamento e generazione del codice di GLM-5.3 e quanto agli ingegneri che hanno progettato il sistema di feedback attorno al modello.