The Pulse
Un post su Weibo descrive l’API GLM-5.3-FlashX, con fino a 200 token al secondo
Un post su Weibo dell’utente 独孤九鎗, anziché dell’account ufficiale di Zhipu AI, descrive l’API GLM-5.3-FlashX e i relativi prezzi.

AI.info Team ·
Un post su Weibo dell’utente «独孤九鎗» afferma che Zhipu ha lanciato GLM-5.3-FlashX il 18 settembre 2026, con una velocità massima di inferenza fino a 200 token al secondo. Il post dice che l’API è stata aperta contemporaneamente all’uso commerciale e che per accedere al modello si utilizza una chiave unificata.
Il post descrive GLM-5.3-FlashX come un aggiornamento della precedente versione Flash, con un aumento dichiarato di cinque volte dell’efficienza di inferenza. Presenta il modello come un servizio ad alta velocità per conversazioni in tempo reale, assistenza clienti intelligente, interazioni frequenti e analisi di dati in batch.
Prezzi di Flash e FlashX
Secondo il post, la versione Flash precedente costa 8 yuan per milione di token in ingresso e 8 yuan per milione di token in uscita. Indica inoltre un prezzo per cache hit di 23 yuan per milione di token.
Il post indica per GLM-5.3-FlashX un prezzo di 2 yuan per milione di token in ingresso e 7 yuan per milione di token in uscita, con una tariffa per cache hit di 57 yuan per milione di token. Descrive il prezzo complessivo di FlashX come 2,5 volte quello della versione precedente, presentando i due servizi come opzioni per carichi di lavoro diversi.
Il post afferma che il precedente modello Flash è adatto all’elaborazione in background di grandi volumi di dati, per i quali i tempi non sono prioritari. Propone FlashX per le applicazioni in cui sono prioritari risposte più rapide e risultati più stabili.
Dichiarazioni sulla velocità massima e sull’infrastruttura
Il dato principale sulle prestazioni è una velocità massima di generazione di 200 token al secondo, che secondo il post è cinque volte superiore a quella dell’attuale versione Flash. Questo dato indica la velocità di inferenza pubblicizzata; i tempi effettivi di risposta dell’API possono dipendere anche dall’elaborazione del prompt, dalle condizioni della rete, dalle code e dal tempo necessario per generare il primo token.
Il post attribuisce l’aumento delle prestazioni a ulteriori investimenti nell’infrastruttura e a interventi di ottimizzazione. Afferma che la serie di modelli funziona su un cluster di inferenza realizzato con oltre 100.000 chip prodotti in Cina. Fa inoltre riferimento al sistema di pianificazione Infra Agent, sviluppato internamente da Zhipu, sostenendo che, nell’arco di due settimane, il throughput in un ambiente basato su chip cinesi è aumentato di 3,2 volte.
Il post presenta il lancio come parte di un più ampio passaggio dalla concorrenza sui prezzi bassi alla differenziazione in termini di velocità, efficienza e servizio. Afferma che le versioni Flash e FlashX sono destinate a casi d’uso distinti: il modello precedente per elaborazioni meno costose e meno sensibili ai tempi, FlashX per le interazioni ad alta velocità.
Disponibilità dell’API
Il post afferma che GLM-5.3-FlashX è pienamente disponibile tramite API per gli sviluppatori aziendali e i singoli utenti. Gli sviluppatori che stanno valutando il servizio dovrebbero consultare la documentazione aggiornata di Zhipu per verificare i formati delle richieste, le quote, le funzioni supportate e le condizioni di fatturazione specifiche del proprio account.
La fonte disponibile è un post su Weibo dell’autore «独孤九鎗», non un annuncio verificato dell’account ufficiale di Zhipu AI. Le dichiarazioni contenute nel post sulla data di lancio del modello, sulla velocità pubblicizzata, sui prezzi e sull’infrastruttura vanno quindi considerate come affermazioni dell’autore.