Vai al contenuto
AI.info

The Pulse

Qwen riduce a 2,3 secondi il ritardo nella traduzione in tempo reale

Qwen ha rilasciato Qwen3.8-LiveTranslate, un modello di interpretazione in tempo reale che riduce il ritardo medio da 2,8 a 2,3 secondi. Il modello aggiunge la separazione dei parlanti, un output bilingue sincronizzato, la disambiguazione b

Qwen riduce a 2,3 secondi il ritardo nella traduzione in tempo reale

AI.info Team ·

Qwen ha rilasciato Qwen3.8-LiveTranslate il 18 settembre, presentando un modello di interpretazione in tempo reale che riduce il ritardo medio da 2,8 secondi, nella generazione precedente, a 2,3 secondi. L’azienda afferma che il modello migliora la fedeltà, la fluidità e la concisione della traduzione e aggiunge la separazione dei parlanti e un output sincronizzato in lingua originale e traduzione.

Il rilascio è pensato per le conversazioni dal vivo, anziché per la normale traduzione a turni. Qwen afferma che il sistema è in grado di identificare chi sta parlando, mantenere le caratteristiche vocali di ciascun parlante nel parlato tradotto e mostrare insieme la lingua originale e quella tradotta. Il modello supporta l’input audio con output testuale in 60 lingue e l’output audio tradotto in 29.

Qwen presenta il rilascio come Qwen3.8-LiveTranslate, con un modello di servizio in tempo reale indicato come qwen3.8-livetranslate-flash-realtime.

Qwen riprogetta la traduzione attorno a uno stream intercalato

Il modello usa quella che Qwen chiama architettura Interleave, che combina audio e testo in un’unica sequenza in streaming. L’azienda afferma che l’audio già ascoltato e la traduzione già generata possono essere memorizzati nella cache e riutilizzati, consentendo al sistema di mantenere il contesto e ridurre i ritardi.

L’architettura usa due moduli: un Thinker basato su Hybrid-MoE e un Talker. Il Thinker elabora video, audio, testo di partenza e traduzione in ordine temporale. Il Talker combina poi la traduzione con l’audio di partenza per generare parlato che dovrebbe conservare il timbro della voce originale.

Questo approccio è diverso da una semplice catena di riconoscimento vocale, traduzione testuale e sintesi vocale. Qwen presenta il sistema come una pipeline di interpretazione end-to-end, in cui comprensione, traduzione e generazione vocale restano collegate durante lo scambio in tempo reale.

La separazione dei parlanti diventa una funzionalità del prodotto

Qwen3.8-LiveTranslate aggiunge la separazione dei parlanti in tempo reale per le conversazioni che coinvolgono più persone. Il sistema attribuisce le frasi ai diversi parlanti e usa queste informazioni per produrre il parlato tradotto; secondo Qwen, ciò rende più stabile la clonazione vocale e aiuta gli ascoltatori a capire chi ha detto cosa.

Il modello sincronizza inoltre la lingua di partenza e la traduzione su un’unica schermata bilingue. Qwen descrive questa funzione come utile per comprendere subito e verificare il testo di partenza, e segnala anche possibili applicazioni come sottotitoli, organizzazione dei contenuti e recupero delle informazioni.

La disambiguazione basata sul contesto esteso affronta un altro problema comune nell’interpretazione in tempo reale: nomi, riferimenti e termini il cui significato dipende dai turni precedenti. Qwen afferma che il modello collega il parlato corrente al testo precedente e alla cronologia della conversazione per mantenere più coerenti queste espressioni.

I risultati dichiarati coprono 70 direzioni linguistiche

Qwen ha valutato il sistema sul set audio lungo e multilingue Omnilingua-MSpeaker, con più parlanti, che comprende 14 direzioni linguistiche. L’azienda afferma che Qwen3.8-LiveTranslate ha superato i principali sistemi di interpretazione in tempo reale per fedeltà, fluidità e concisione della traduzione, oltre che per tasso di errore della diarizzazione.

Per testare più lingue, Qwen ha usato il set pubblico di test audio FLEURS su 70 direzioni linguistiche. L’azienda afferma che il nuovo modello ha superato sia la generazione precedente di Qwen sia gli attuali sistemi più diffusi per qualità della traduzione, ritardo medio, accuratezza del riconoscimento vocale e qualità della sintesi vocale.

L’annuncio non pubblica nel testo le tabelle dei benchmark sottostanti; è quindi meglio considerare i confronti del rilascio come dichiarazioni di Qwen, anziché come classifiche verificate in modo indipendente.

DashScope offre il primo percorso di implementazione

L’esempio di Qwen per usare il modello passa dall’API DashScope tramite una connessione WebSocket. Un client trasmette l’audio del microfono al servizio e riceve testo tradotto, audio sintetizzato o entrambi, a seconda della configurazione della sessione.

La stessa interfaccia può restituire identificativi dei parlanti e testo nella lingua di partenza insieme alla traduzione. L’esempio di Qwen supporta anche l’invio di fotogrammi come contesto visivo, consentendo al servizio di usare informazioni che vanno oltre lo stream audio nell’interpretazione di uno scambio.

Il rilascio indica 60 lingue supportate per l’input audio e l’output testuale, tra cui inglese, cinese, arabo, francese, tedesco, hindi, giapponese, coreano, spagnolo, turco, ucraino e vietnamita. L’output audio copre 29 lingue, tra cui inglese, cinese, giapponese, coreano, francese, tedesco, spagnolo, italiano, arabo, hindi e persiano.

Qwen afferma che i prossimi obiettivi di sviluppo sono ridurre ulteriormente il ritardo end-to-end, mantenere una memoria tra le sessioni e ampliare la copertura delle lingue meno supportate e dei dialetti regionali. Per il rilascio attuale, il cambiamento misurabile è più circoscritto: il ritardo medio diminuisce di mezzo secondo, scendendo a 2,3 secondi, mentre il servizio aggiunge l’attribuzione dei parlanti e un output bilingue sincronizzato.

Fonte

Esplora

Altri articoli