The Pulse
DeepSeek V4.1 Flash supera 1.000 miliardi di token su OpenRouter
DeepSeek V4.1 Flash ha elaborato più di 1.000 miliardi di token su OpenRouter poco dopo il lancio del 10 settembre. Il modello open-weight combina un’architettura mixture-of-experts con 552 miliardi di parametri, visione nativa e una finest

AI.info Team ·
«In base ai risultati dei benchmark, DeepSeek V4 sembra destinato a essere molto competitivo rispetto ai rivali statunitensi».
Lian Jye Su, analista capo della società di ricerca e consulenza tecnologica Omdia, ha formulato questa valutazione ad aprile, dopo che DeepSeek aveva presentato la famiglia V4. Cinque mesi dopo, il modello più recente dell’azienda offre un indicatore più concreto della domanda: DeepSeek V4.1 Flash ha superato 1.000 miliardi di token elaborati su OpenRouter, la piattaforma di instradamento dei modelli, poco dopo il suo lancio del 10 settembre.
La pagina pubblica di DeepSeek su OpenRouter indica che V4.1 Flash ha elaborato circa 1.050 miliardi di token. Un post attribuito a OpenRouter afferma che il modello ha raggiunto 1.000 miliardi di token nelle prime 24 ore sulla piattaforma e si avviava a totalizzarne circa 2.800 miliardi nelle prime 48 ore. OpenRouter non ha dichiarato che il dato rappresentasse tutto l’utilizzo globale e DeepSeek non ha pubblicato un conteggio dei token relativo all’intera azienda.
La distinzione è importante. OpenRouter misura il traffico instradato attraverso il proprio marketplace, non le richieste inviate direttamente a DeepSeek o tramite altri fornitori. Ciononostante, il volume registrato nei primi giorni colloca V4.1 Flash tra i nuovi modelli a pagamento più utilizzati sul servizio e offre un segnale visibile della rapidità con cui gli sviluppatori lo stanno testando in agenti in produzione, strumenti di programmazione e flussi di lavoro prolungati.
OpenRouter registra un avvio rapido per il nuovo modello Flash di DeepSeek
V4.1 Flash arriva su OpenRouter in un momento in cui l’utilizzo dei modelli è sempre più trainato da agenti software, anziché da singoli prompt in chat. A giugno, OpenRouter ha dichiarato che le richieste agentiche consumano circa 15 volte più token per richiesta rispetto alle normali interazioni umane. L’azienda ha inoltre rilevato che, a fine maggio, V4 Flash di DeepSeek rappresentava il 70% del flusso di token agentici di DeepSeek, circa un mese dopo il lancio della versione originale di V4.
I nuovi dati suggeriscono che V4.1 Flash stia proseguendo su questa strada. La scheda del modello su OpenRouter lo descrive come un sistema sparse mixture-of-experts con un’architettura da 552 miliardi di parametri. Il modello attiva 8 miliardi di parametri durante l’elaborazione dell’input e 16 miliardi durante la generazione dell’output: una configurazione pensata per ridurre la quantità di calcolo necessaria per le attività prolungate e basate su grandi quantità di input.
La pagina pubblica di OpenRouter non fornisce una serie storica completa del dato di 1.050 miliardi di token, quindi il numero non va interpretato come un ritmo giornaliero. Una pagina di monitoraggio separata pubblicata da TKX indicava che il 11 settembre erano stati instradati tramite OpenRouter 679 miliardi di token nell’arco di 24 ore, mentre la scheda di OpenRouter riportava un volume cumulativo elaborato superiore a 1.000 miliardi. Le misurazioni si riferiscono a intervalli temporali diversi e non vanno considerate totali contraddittori.
DeepSeek punta a ridurre il costo di lettura dei contesti lunghi
L’annuncio di DeepSeek del 10 settembre si concentra meno sul numero grezzo di parametri che sul costo di leggere ripetutamente grandi quantità di informazioni. V4.1 Flash utilizza un’architettura Causal Encoder-Decoder, con un encoder causale di 20 livelli seguito da un decoder di 20 livelli. L’encoder elabora il contesto in ingresso, mentre il decoder genera la risposta a partire dalla rappresentazione codificata.
La progettazione tecnica modifica la cache key-value del modello, la struttura di memoria usata per conservare le informazioni sull’attenzione durante l’inferenza. DeepSeek afferma che V4.1 Flash riduce l’ingombro della cache globale a circa 890 byte per token, all’incirca un quarto del valore della precedente V4 Flash. L’azienda sostiene inoltre che, rispetto alla generazione precedente, il nuovo modello richieda un quarto della memoria ad ampia banda e un ottavo dello spazio di archiviazione su unità a stato solido per la cache.
Queste riduzioni puntano a un problema specifico dei software basati su agenti. Un agente può rileggere lo stesso repository, lo stato del browser, la documentazione o la cronologia delle attività nel corso di decine di passaggi. Se ogni passaggio richiede di memorizzare e recuperare un contesto ampio, la memoria della cache e il traffico di archiviazione possono diventare costi superiori al prezzo dichiarato per l’output del modello. L’architettura di DeepSeek è progettata per questo schema di letture ripetute, non solo per brevi scambi conversazionali.
Il modello supporta contesti fino a 1 milione di token e accetta immagini in modo nativo, insieme al testo. La scheda del modello di DeepSeek afferma che è stato addestrato da zero su un corpus multimodale contenente 45.000 miliardi di token, con attenzione sparsa addestrata su sequenze di 64.000 token prima che il contesto fosse esteso a 1 milione di token, dopo aver raggiunto 34.000 miliardi di token di addestramento.
I prezzi aiutano a spiegare l’impennata dei token
DeepSeek ha lanciato V4.1 Flash con tariffe di punta e fuori punta. Fuori punta, l’azienda indica un prezzo per l’input di 0,003 dollari per milione di token memorizzati nella cache, 0,15 dollari per milione di token di input non memorizzati nella cache e 0,60 dollari per milione di token di output. Le tariffe di punta raddoppiano questi prezzi, portandoli rispettivamente a 0,006, 0,30 e 1,20 dollari per milione di token.
Nel suo post, OpenRouter afferma che il 90% dei primi 1.000 miliardi di token era costituito da letture della cache, con un prezzo di mercato di circa 0,006 dollari per milione di token. Questa composizione rende meno sorprendente il volume complessivo: un carico di lavoro basato su agenti può inviare gli stessi file di progetto, istruzioni o stati degli strumenti in molte richieste consecutive, creando prefissi ripetuti che rientrano nei prezzi della cache.
DeepSeek usa la memorizzazione nella cache per contenere i costi dal 2024. In un precedente annuncio aziendale, il fornitore di API aveva dichiarato che il suo servizio era progettato per gestire fino a 1.000 miliardi di token al giorno, senza indicare limiti di concorrenza o di frequenza. Quel dato descriveva la capacità della piattaforma, non l’utilizzo di V4.1 Flash, e precede il nuovo modello. I dati attuali di OpenRouter vanno quindi interpretati come una tappa nell’utilizzo di un singolo modello su una singola piattaforma esterna, non come prova che DeepSeek abbia raggiunto 1.000 miliardi di token al giorno in tutta la sua attività.
Anche il sistema di prezzi e instradamento di OpenRouter influisce sul risultato. La piattaforma aggrega le richieste degli sviluppatori tramite un’API unificata e le invia ai fornitori partecipanti. L’utilizzo registrato riflette la base clienti della piattaforma, la disponibilità dei fornitori, le scelte di instradamento e gli alias dei modelli. Offre una finestra utile sull’adozione, ma non è un censimento indipendente del traffico globale di inferenza.
DeepSeek sta ritirando i vecchi endpoint V4
Al momento del lancio, DeepSeek ha impostato V4.1 Flash come destinazione predefinita per diversi nomi di modelli esistenti. L’azienda ha ritirato V4 Flash e V4 Flash Vision Exp, mentre le richieste inviate ai vecchi nomi deepseek-v4-flash e deepseek-v4-flash-vision-exp vengono temporaneamente instradate a V4.1 Flash per garantire la compatibilità.
DeepSeek prevede inoltre di instradare tutte le richieste deepseek-v4-pro a V4.1 Flash a partire dalle 04:00 UTC del 14 settembre 2026. Le richieste saranno fatturate alle tariffe di V4.1 Flash finché l’azienda non rilascerà V4.1 Pro. Ciò significa che parte del traffico attribuito ai vecchi nomi V4 potrebbe presto riferirsi al nuovo modello, rendendo più difficili i confronti precisi tra versioni, a meno che i fornitori non conservino i dati a livello di modello.
I partner ufficiali WorkBuddy, tra cui CodeBuddy, e OpenCode supportano V4.1 Flash. DeepSeek ha pubblicato i pesi del modello su Hugging Face con licenza MIT e ha diffuso un rapporto tecnico che descrive l’architettura, il sistema di cache e la configurazione dell’inferenza. Nonostante il numero ridotto di parametri attivi a ogni passaggio, le dimensioni del modello richiedono risorse hardware considerevoli per un’implementazione a precisione piena.
Il dato segnala l’adozione, non la qualità del modello
Un bilione di token elaborati dice di più sulla distribuzione e sui prezzi che sulla precisione. Il volume di token può crescere perché gli sviluppatori inviano prompt più lunghi, gli agenti compiono più passaggi, le applicazioni ripetono le richieste non riuscite o gli utenti sperimentano con un endpoint economico. Nessuno di questi indicatori, preso singolarmente, dimostra che V4.1 Flash produca risposte migliori di un modello concorrente.
La pagina di valutazione di DeepSeek riporta punteggi tra cui 90,9 su GPQA Diamond, 90,6 su Terminal-Bench 2.1 e 74,2 su DeepSWE, anche se la scheda del modello precisa che alcuni risultati dipendono dall’ambiente di test e dalla configurazione degli strumenti. DeepSeek afferma che V4.1 Flash supera V4 Pro in termini di prestazioni, costo, velocità e tempo di esecuzione complessivo, ma questi confronti provengono dai materiali di lancio dell’azienda e richiedono una verifica indipendente.
Il dato sull’adozione ha comunque rilevanza pratica. Gli sviluppatori tendono a inviare grandi volumi ai modelli che combinano prezzi bassi e affidabilità adeguata, soprattutto quando gli agenti ripetono il contesto in numerose chiamate. Il traffico iniziale di V4.1 Flash su OpenRouter suggerisce che la progettazione della cache e i prezzi stiano attirando proprio questo tipo di carico di lavoro.
Per ora, l’affermazione verificata è circoscritta: OpenRouter riporta più di 1.000 miliardi di token elaborati per DeepSeek V4.1 Flash e attribuisce al modello il traguardo di 1.000 miliardi di token nel primo giorno. La capacità più ampia dell’API di DeepSeek, il traffico diretto e l’utilizzo globale complessivo restano dati distinti.