Vai al contenuto
AI.info

The Pulse

DeepSeek V4.1-Flash riduce i costi degli agenti con un’architettura Causal Encoder-Decoder

DeepSeek ha rilasciato V4.1-Flash, un modello MoE da 552 miliardi di parametri con visione nativa, contesto da 1 milione di token e cache KV ridotta a un quarto delle dimensioni precedenti. Dal 14 settembre il modello instrada il traffico V

DeepSeek V4.1-Flash riduce i costi degli agenti con un’architettura Causal Encoder-Decoder

AI.info Team ·

«DeepSeek-V4.1-Flash è ora disponibile sull’API di DeepSeek con supporto multimodale nativo.»

DeepSeek, nota di rilascio di V4.1-Flash, 10 settembre 2026

DeepSeek rilascia V4.1-Flash il 10 settembre

DeepSeek ha pubblicato l’annuncio di V4.1-Flash sul sito della documentazione della propria API il 10 settembre. Il rilascio introduce il modello più piccolo di una nuova famiglia di architetture Causal Encoder-Decoder e aggiunge alla linea capacità native di comprensione delle immagini.

Il modello mixture-of-experts da 552 miliardi di parametri ne attiva solo 8 miliardi durante l’elaborazione dell’input e 16 miliardi durante la generazione. Supporta una finestra di contesto da 1 milione di token e un output massimo di 384.000 token; i suoi pesi sono disponibili su Hugging Face con licenza MIT.

Un’architettura pensata per gli agenti

La nuova architettura divide un Transformer da 40 layer in un encoder causale da 20 layer e un decoder da 20 layer. La cache KV dell’encoder viene proiettata direttamente sul decoder, riducendo il calcolo attivo per le attività degli agenti che richiedono molto input e comportano l’elaborazione ripetuta dei risultati degli strumenti e di lunghe cronologie.

Altre tecniche — Compressed Sparse Attention 2, indicizzazione sparsa gerarchica, caching della KV in FP4 e SWA Bounded Replay — riducono la cache KV globale a circa 890 byte per token. Lo spazio di archiviazione permanente su SSD scende a circa un ottavo rispetto alla precedente generazione V4-Flash.

Prezzi e dettagli della migrazione

Fuori dalle ore di punta, il prezzo per gli input già presenti nella cache parte da 0,003 dollari per milione di token, mentre l’output costa 0,60 dollari per milione. Sull’API, il modello sostituisce sia V4-Flash sia lo sperimentale V4-Flash-Vision-Exp; i vecchi nomi ora indirizzano le richieste a V4.1-Flash.

A partire dalle 04:00 UTC del 14 settembre, si leggeva nella nota di rilascio, tutte le richieste all’endpoint V4-Pro sarebbero state indirizzate a V4.1-Flash alle tariffe più basse, fino all’arrivo di una versione V4.1-Pro. Da allora DeepSeek ha fatto marcia indietro: la sua pagina dei prezzi ora afferma che, «in risposta alla domanda degli utenti», continuerà a offrire V4-Pro dopo il 14 settembre, senza modifiche alla fatturazione. I partner ufficiali WorkBuddy e OpenCode hanno già integrato il nuovo modello.

La differenza tra i due listini è il punto centrale del rilascio. Fuori dalle ore di punta, un accesso riuscito alla cache su V4.1-Flash costa 0,003 dollari per milione di token di input, contro 0,022 dollari su V4-Pro; un mancato accesso alla cache costa 0,15 dollari contro 0,66 dollari e l’output 0,60 dollari contro 1,98 dollari: rispettivamente circa un settimo, un quarto e un terzo. Tutte le tariffe nelle ore di punta sono il doppio di quelle fuori punta. Anche il limite di richieste simultanee aumenta, da 500 su V4-Pro a 2.500 su Flash: per chi esegue agenti in parallelo conta più del prezzo messo in evidenza.

Risultati nei benchmark

La tabella dei benchmark è di DeepSeek, pubblicata nella scheda del modello, e non si basa su misurazioni indipendenti. Assegna a V4.1-Flash 74,2 punti su DeepSWE v1.1, davanti a Claude Opus 5 con 74,0 e GPT-5.6 Sol con 73,0; 90,6 su Terminal-Bench 2.1; e 88,1 su CyberGym. Nei test di ragionamento più difficili, la stessa tabella mostra il modello dietro ai modelli di frontiera proprietari: 36,8 su Humanity’s Last Exam contro 56,3 per Opus 5 e 90,9 su GPQA Diamond contro 94,1 per GPT-5.6 Sol.

Le misurazioni indipendenti finora sono più limitate. Artificial Analysis colloca il modello a 40 nel suo Intelligence Index, ben al di sopra della mediana di 18 dei modelli a pesi aperti di dimensioni paragonabili. La nota di rilascio di DeepSeek si limita ad affermare che «test condotti da più soggetti» collocano V4.1-Flash davanti a V4-Pro per prestazioni, costi, velocità e tempo totale di esecuzione, senza indicare i soggetti né pubblicare i dati.

Fonte

Esplora

Altri articoli