The Pulse
Alibaba rilascia Qwen3.8-Omni-Flash con un contesto da 1 milione di token
Il team Qwen di Alibaba ha rilasciato Qwen3.8-Omni-Flash, un modello multimodale che accetta testo, immagini, audio e video. Il modello supporta una finestra di contesto da 1 milione di token, chiamate agli strumenti, ricerca sul web e inpu

AI.info Team ·
Il team Qwen di Alibaba ha rilasciato Qwen3.8-Omni-Flash, un modello multimodale progettato per elaborare testo, immagini, audio e video tramite un’unica API. Il modello supporta una finestra di contesto fino a 1 milione di token, offrendo agli sviluppatori la possibilità di inviare lunghe registrazioni, grandi raccolte di immagini o video estesi insieme ai normali prompt testuali.
L’annuncio di Qwen è datato 18 settembre 2026. La documentazione di Alibaba Cloud elenca Qwen3.8-Omni-Flash per le API Chat Completions e Responses, con output solo testuale. Il modello è pensato per la comprensione di audio e video, i riepiloghi di riunioni e l’analisi dei contenuti, non per le risposte vocali.
Nei materiali del rilascio esaminati per questo articolo non compare alcuna dichiarazione attribuita a un portavoce.
Qwen riunisce audio, video e testo in un’unica richiesta
Qwen3.8-Omni-Flash accetta testo, immagini, audio e video come input. Gli sviluppatori possono combinare diverse modalità in una richiesta e chiedere al modello di riassumere una registrazione, analizzare contenuti visivi o rispondere a domande su materiale distribuito tra file diversi.
La documentazione di Alibaba Cloud indica il supporto per file fino a 2 GB quando gli sviluppatori forniscono URL pubblici. Il limite di durata documentato arriva a due ore per i video e a tre ore per l’audio; inoltre, l’API accetta fino a 64 file in una richiesta orientata ai video e fino a 2.048 file in una richiesta orientata all’audio, se si utilizzano URL pubblici.
Questi limiti rendono il modello adatto a carichi di lavoro che includono più di una breve clip o una singola immagine. Un archivio di riunioni, una raccolta di materiali formativi o un insieme di interviste registrate possono essere gestiti come un unico incarico di analisi, nel rispetto dei limiti del servizio relativi a token e file.
La finestra da 1 milione di token cambia l’unità di analisi
La finestra di contesto da 1 milione di token è la specifica più evidente del modello. Una finestra di contesto determina la quantità di materiale che il modello può prendere in considerazione all’interno di una richiesta e di una conversazione. Nei sistemi multimodali, il limite pratico dipende anche dal modo in cui audio, video e immagini vengono convertiti in token ai fini della fatturazione e dell’elaborazione.
La documentazione di Alibaba afferma che Qwen3.8-Omni-Flash converte l’audio al ritmo di sette token al secondo. Le immagini vengono conteggiate a un token per ogni blocco di 32 per 32 pixel, con un massimo predefinito di 1.280 token per immagine e una modalità ad alta risoluzione che porta il massimo a 16.384 token. L’elaborazione video utilizza fotogrammi campionati; il modello supporta fino a 2.048 fotogrammi.
Queste regole di conversione fanno sì che una finestra da 1 milione di token non corrisponda a un numero fisso di ore di video o audio. La risoluzione, il campionamento dei fotogrammi e la combinazione delle modalità determinano quanto materiale sorgente può rientrare in una richiesta.
Chiamate agli strumenti e ricerca sul web sono integrate nell’API
Qwen3.8-Omni-Flash supporta il function calling e la ricerca sul web. Alibaba Cloud afferma che al momento l’API Responses mette a disposizione la ricerca sul web come unico strumento Responses integrato; gli sviluppatori possono inoltre utilizzare il function calling per applicazioni che collegano il modello a servizi esterni.
Il modello supporta controlli sul ragionamento, compresa un’impostazione che consente agli sviluppatori di disattivarlo quando si preferiscono una latenza inferiore o un’elaborazione ridotta. Gli esempi nella documentazione mostrano come richiamare il modello tramite interfacce Chat Completions compatibili con OpenAI e tramite l’API Responses.
Le aree geografiche supportate per la distribuzione, elencate da Alibaba Cloud, includono Pechino, Singapore, Hong Kong, Tokyo, Francoforte e Virginia. L’accesso richiede una chiave API per l’area selezionata; gli endpoint e le credenziali variano da una regione all’altra.
Qwen separa la comprensione dalla generazione vocale
Qwen3.8-Omni-Flash produce testo, non audio. Alibaba Cloud rimanda gli sviluppatori che hanno bisogno di risposte vocali generate alla famiglia Qwen3.5-Omni, che supporta l’output audio e funzionalità più ampie di interazione vocale.
La distinzione separa due attività spesso presentate come un’unica capacità multimodale: interpretare audio e video e rispondere con voce sintetizzata. Qwen3.8-Omni-Flash si concentra sulla prima, con il supporto di 113 lingue e dialetti audio secondo la documentazione del modello di Alibaba Cloud.
Il rilascio segna anche il passaggio dai precedenti modelli Qwen Omni-Turbo. Alibaba Cloud afferma che quella serie non viene più aggiornata e raccomanda Qwen3.8-Omni-Flash per l’analisi testuale e Qwen3.5-Omni per l’output audio.
A chi è destinato il modello
Qwen3.8-Omni-Flash si rivolge agli sviluppatori che realizzano sistemi basati su registrazioni lunghe, archivi video e documenti multimediali. La combinazione di un’ampia finestra di contesto, input multimodale e accesso agli strumenti consente a un unico modello di esaminare il materiale sorgente prima di produrre riepiloghi, estrarre informazioni o avviare un’azione esterna.
Il modello è disponibile tramite le interfacce Model Studio di Alibaba Cloud e la piattaforma di Qwen. Il rilascio non rende Qwen3.8-Omni-Flash un modello open-weight: i materiali esaminati descrivono l’accesso tramite API ospitata, non un checkpoint scaricabile.
Per gli sviluppatori che scelgono tra gli attuali modelli Omni di Alibaba, la distinzione è netta: Qwen3.8-Omni-Flash gestisce la comprensione multimodale di contenuti lunghi e le risposte testuali, mentre Qwen3.5-Omni genera parlato e offre output audio interattivo.
Leggi l’annuncio di Qwen e la documentazione del modello di Alibaba Cloud per i dettagli del rilascio e i limiti delle API.