The Pulse
Cerebras aggiunge Qwen3.8-27B a 1.500 token al secondo
Cerebras ha aggiunto Qwen3.8-27B di Alibaba al proprio servizio pubblico di inferenza, indicando per il modello una velocità di circa 1.500 token generati al secondo. Il modello è disponibile attraverso il piano sviluppatori pay-as-you-go d

AI.info Team ·
Cerebras propone Qwen3.8-27B di Alibaba sullo stesso servizio pubblico di inferenza che usa per promuovere alcuni dei tempi di risposta più rapidi disponibili tramite API per i modelli open source. La mossa dà agli sviluppatori accesso a un modello Qwen di medie dimensioni, con una velocità indicata di circa 1.500 token generati al secondo; il piano pubblico prevede però anche limiti che potrebbero influire sui carichi di lavoro utilizzabili in produzione.
La documentazione di supporto di Cerebras indica Qwen 3.8 27B come uno dei due modelli disponibili nel suo Developer Tier, insieme a GPT OSS 120B di OpenAI. Il sistema pay-as-you-go dell’azienda addebita ai clienti i token in ingresso e in uscita, mentre Qwen3.8-27B ha una quota di token inferiore a GPT OSS 120B: 150.000 token al minuto non memorizzati nella cache e 450 richieste al minuto.
L’aggiunta porta uno dei più recenti modelli open-weight di Alibaba sull’hardware di inferenza wafer-scale di Cerebras. Fa inoltre della velocità, più che delle sole dimensioni del modello, il principale argomento di vendita. Gli sviluppatori possono ora provare Qwen3.8-27B senza eseguirlo localmente né procurarsi hardware dedicato; i team con un traffico elevato e continuativo dovranno però chiedere a Cerebras limiti più alti e capacità riservata.
Qwen3.8-27B arriva con un tetto di 150.000 token
Le FAQ del Developer Tier di Cerebras indicano Qwen 3.8 27B tra i modelli disponibili con il piano pay-as-you-go e gli assegnano un limite di 150.000 token al minuto non memorizzati nella cache. La stessa tabella indica 450 richieste al minuto. Secondo la documentazione dell’azienda, questi limiti si applicano al piano self-service e possono cambiare.
La distinzione tra token memorizzati nella cache e token non memorizzati è importante per le applicazioni che inviano ripetutamente lo stesso prefisso di prompt. L’API di Cerebras supporta la memorizzazione nella cache dei prompt, che può ridurre le elaborazioni ripetute per prefissi condivisi, come le istruzioni di sistema, i template di recupero delle informazioni o il contesto di un agente. Il limite pubblicato è però espresso in token non memorizzati nella cache: per pianificare carichi di lavoro con grandi documenti o agenti, gli sviluppatori devono quindi misurare i modelli effettivi delle richieste e non basarsi soltanto sul dato di velocità in evidenza.
Qwen3.8-27B non viene presentato come una soluzione riservata alle aziende. Cerebras afferma che gli utenti possono acquistare crediti, consumarli in base all’uso dei token e configurare la ricarica automatica. I crediti scadono un anno dopo l’acquisto. Se il saldo di un account arriva a zero, l’azienda afferma che i limiti di utilizzo scendono a zero finché non vengono aggiunti altri crediti.
Limiti del piano pubblico: Cerebras indica per Qwen 3.8 27B un limite di 150.000 token al minuto non memorizzati nella cache e 450 richieste al minuto. Limiti più alti, accordi sul livello di servizio e capacità dedicata richiedono un accordo commerciale separato.
Perché conta una velocità di 1.500 token al secondo
Secondo la documentazione consultata dopo che il modello è comparso nel catalogo pubblico dell’azienda, Cerebras indica per Qwen3.8-27B una velocità di circa 1.500 token al secondo sulla propria infrastruttura pubblica di inferenza. Il dato descrive la velocità di generazione nelle condizioni di misurazione di Cerebras; le prestazioni effettive variano in base alla lunghezza del prompt, alla concorrenza, alle impostazioni di campionamento, alla forma della richiesta e al piano dell’account.
A questa velocità, un modello può generare risposte lunghe o suggerimenti di codice in una frazione del tempo richiesto da molti endpoint tradizionali ospitati su GPU. La velocità conta soprattutto nelle applicazioni che producono molto testo: agenti di programmazione, assistenti di ricerca, pipeline di trasformazione dei documenti e sistemi che effettuano diverse chiamate al modello prima di restituire una risposta.
Una generazione più rapida non elimina gli altri colli di bottiglia. Un prompt lungo deve comunque essere elaborato, la latenza di rete continua a incidere sul primo token della risposta e i limiti di utilizzo possono restringere il numero di richieste parallele. Un team che gestisce centinaia di agenti simultaneamente potrebbe esaurire la quota di 150.000 token al minuto anche se ogni singola risposta arriva rapidamente.
Questa tensione rende la proposta di Qwen3.8-27B più specifica del semplice aggiungere un altro modello a un catalogo. Cerebras offre un modello denso e veloce per le applicazioni interattive, ma il piano pubblico è pensato per la sperimentazione e per carichi di lavoro moderati, non per implementazioni su larga scala senza restrizioni.
Il catalogo pubblico di Cerebras si concentra su due modelli di punta
L’aggiunta di Qwen modifica anche la composizione dell’offerta self-service di Cerebras. La pagina di supporto dell’azienda indica Qwen 3.8 27B e GPT OSS 120B come gli attuali modelli disponibili con il Developer Tier pay-as-you-go. A GPT OSS 120B è assegnata una quota più alta: 500.000 token al minuto non memorizzati nella cache e 1.000 richieste al minuto.
La differenza riflette il diverso posizionamento dei modelli. GPT OSS 120B è il modello più grande ed è presentato per il ragionamento, la programmazione e i flussi di lavoro basati su agenti. Qwen3.8-27B ha meno parametri e una capacità inferiore nel piano pubblico, ma il dato di circa 1.500 token al secondo offre agli sviluppatori un’opzione rapida quando il tempo di risposta e i costi di esercizio contano più delle dimensioni massime del modello.
Storicamente, Cerebras ha usato il proprio servizio di inferenza per ospitare modelli aperti di diverse aziende, tra cui Qwen, Meta, Google e OpenAI. Nel suo annuncio del servizio a pagamento per token, l’azienda ha dichiarato che il servizio era pensato per rendere disponibili modelli open-weight senza contratti né infrastrutture dedicate. L’azienda offre anche prodotti in abbonamento per la programmazione e accordi aziendali separati con instradamento prioritario e supporto dedicato.
«L’IA è passata dall’essere una novità a essere utile e produttiva», ha dichiarato Andrew Feldman, cofondatore e amministratore delegato di Cerebras Systems, nell’annuncio dei risultati finanziari dell’azienda del 23 giugno 2026. Feldman ha aggiunto che «un’IA veloce è più preziosa di un’IA lenta perché è più produttiva».
Qwen3.8-27B si adatta direttamente a questa tesi. La sua attrattiva non dipende soltanto dalle capacità del modello in sé, ma dalla combinazione di un modello open-weight, un flusso di lavoro API compatibile con OpenAI e una velocità di generazione insolitamente elevata sull’hardware Cerebras.
Il modello è aperto, ma il servizio non è senza limiti
Gli sviluppatori possono chiamare il modello tramite l’API di inferenza di Cerebras, senza gestirne direttamente i pesi, l’allocazione della memoria, la quantizzazione e l’infrastruttura di servizio. La documentazione pubblica dell’azienda sui modelli descrive endpoint che supportano funzionalità API comuni, come lo streaming e il recupero dei modelli; i materiali pubblici di Cerebras spiegano inoltre che i clienti possono iniziare con un account gratuito e passare all’uso a pagamento.
Il prezzo è una questione distinta dai limiti di utilizzo. Cerebras afferma che la fatturazione del Developer Tier si basa sul consumo di token in ingresso e in uscita, con prezzi diversi a seconda del modello. La documentazione dell’azienda invita gli utenti a consultare la pagina dei prezzi aggiornata anziché riportare un prezzo fisso nelle FAQ di supporto: prima di definire il budget per un’implementazione, gli sviluppatori dovrebbero quindi verificare l’importo indicato nel proprio account.
L’offerta lascia inoltre spazio tra un endpoint pubblico e un servizio di produzione dedicato. Cerebras afferma che i clienti che necessitano di limiti più alti, accordi sul livello di servizio o capacità dedicata dovrebbero contattare il team commerciale. Questa separazione è comune nell’inferenza ospitata, ma qui è importante perché un benchmark di 1.500 token al secondo può generare una domanda superiore a quella che una quota pubblica è in grado di assorbire.
I team che valutano Qwen3.8-27B dovrebbero quindi testare separatamente quattro aspetti: il tempo necessario per generare il primo token, la velocità di generazione sostenuta, il comportamento sotto carico simultaneo e il numero di token consumati per ogni attività completata. Un agente di programmazione che produce una patch corretta in un unico passaggio rapido può costare meno di un modello più lento che richiede diversi tentativi, ma il calcolo dipende dalla qualità del modello e dalla progettazione del flusso di lavoro, non soltanto dai token al secondo.
Il modello di Alibaba incontra la strategia di Cerebras incentrata sulla velocità
La famiglia Qwen di Alibaba è diventata una scelta comune tra gli sviluppatori in cerca di modelli open-weight che si possano scaricare, modificare o usare tramite provider terzi. L’aggiunta di Cerebras offre loro un altro modo per accedere a Qwen3.8-27B senza acquistare hardware in grado di contenere il modello e la sua finestra di contesto.
Il lancio rafforza inoltre l’impegno di Cerebras nel fare della velocità di inferenza il fulcro della propria offerta cloud. In precedenti annunci, l’azienda ha promosso i modelli Qwen3, GPT OSS e altri modelli aperti tramite l’accesso a pagamento per token. Cerebras ha annunciato separatamente importanti partnership infrastrutturali, tra cui una collaborazione con Amazon Web Services per combinare i sistemi AWS Trainium con i sistemi Cerebras CS-3 nei carichi di lavoro di inferenza.
Qwen3.8-27B è una prova più contenuta e accessibile di questa strategia rispetto a un modello da un trilione di parametri. Se gli sviluppatori lo usano per estrazione, correzione del codice, classificazione, sintesi o agenti multi-step, il confronto pratico sarà con altri endpoint ospitati e veloci e con l’hosting autonomo su GPU, non soltanto con modelli frontier più grandi.
Per ora, l’offerta concreta è semplice: Qwen3.8-27B è disponibile tramite il servizio per sviluppatori pay-as-you-go di Cerebras, l’azienda indica una velocità di circa 1.500 token generati al secondo e la quota pubblica è di 150.000 token al minuto non memorizzati nella cache, con 450 richieste al minuto. Sono questi numeri a definire il lancio più chiaramente dell’annuncio del modello in sé. Descrivono un servizio pensato per gli sviluppatori che vogliono i pesi aperti di Qwen e la velocità di Cerebras, ma possono operare entro i limiti del piano pubblico.