Vai al contenuto
AI.info

The Pulse

DeepL Voice preserva le voci degli oratori durante la traduzione in tempo reale

DeepL ha introdotto modelli vocali che preservano la voce, il tono e il modo di parlare di ciascun oratore durante la traduzione in tempo reale tra 12 lingue. L’azienda ha inoltre lanciato un’applicazione desktop per Windows e Mac, compatib

DeepL Voice preserva le voci degli oratori durante la traduzione in tempo reale

AI.info Team ·

DeepL Voice aggiunge l’identità degli oratori alla traduzione in tempo reale

DeepL afferma che i suoi ultimi modelli Voice sono in grado di preservare la voce e il modo di parlare distintivi di ciascun oratore, traducendo in tempo reale il parlato tra diverse lingue. L’azienda ha annunciato l’aggiornamento il 15 settembre 2026, insieme a una nuova applicazione desktop che porta la stessa esperienza Voice su Zoom, Microsoft Teams e Google Meet.

La novità punta a risolvere un limite della traduzione vocale in tempo reale: un sistema può trasmettere le parole, ma appiattire l’identità di chi le pronuncia. DeepL afferma che i suoi modelli conservano le differenze di tono, ritmo, cadenza e intonazione, permettendo ai partecipanti di riconoscere chi sta parlando anche quando più voci passano da una lingua all’altra. I modelli puntano inoltre a mantenere domande, entusiasmo, esitazione, enfasi e urgenza.

DeepL descrive il lancio nel suo annuncio come un’estensione dei suoi prodotti Voice, che comprende le riunioni online, le conversazioni in presenza e DeepL API for Voice.

Dodici lingue, e altre in arrivo

La conservazione della voce è inizialmente disponibile in 12 lingue. DeepL non elenca tutte le lingue nell’annuncio, ma afferma che ne seguiranno altre.

Secondo l’azienda, la funzione è progettata per operare senza archiviare campioni vocali né creare profili vocali da riutilizzare in seguito. La distinzione è importante per le aziende, dove l’audio delle riunioni, l’identità degli oratori e i dati vocali personali possono essere soggetti a norme interne di sicurezza o a obblighi di tutela della privacy. DeepL presenta questo modello di elaborazione come una trasformazione vocale in tempo reale, anziché come un sistema che conserva un profilo riutilizzabile di ciascun partecipante.

Nell’annuncio, DeepL colloca la nuova funzionalità vocale all’interno di un sistema di traduzione già esistente. L’azienda cita test indipendenti condotti da Slator, che hanno rilevato per DeepL Voice un tasso di errore nella traduzione del 4%, contro una media del 17% per Microsoft Teams, Google Meet e Zoom. DeepL presenta questi dati a sostegno dell’estensione del prodotto, dalla precisione delle parole alla resa e all’espressività.

Un’unica app desktop per Zoom, Teams e Meet

La nuova app desktop DeepL Voice funziona su Windows e Mac e si affianca a tre importanti servizi per le riunioni: Zoom, Microsoft Teams e Google Meet. DeepL afferma che l’app è in grado di rilevare automaticamente le riunioni e avviare la traduzione con un clic, senza richiedere un’integrazione separata per ciascuna piattaforma di videoconferenza.

I partecipanti possono seguire la conversazione tramite sottotitoli tradotti in una sovrapposizione personalizzabile, traduzione vocale o entrambe le opzioni. L’app funziona al di fuori delle singole piattaforme di riunione, consentendo a DeepL di aggiungere funzioni senza aspettare che Zoom, Microsoft o Google aggiornino i propri prodotti.

La traduzione da voce a voce nelle riunioni online tramite l’app desktop è ora disponibile per tutti. Questa funzionalità si aggiunge alla traduzione vocale per le conversazioni in presenza e a DeepL API for Voice, che consente alle organizzazioni di integrare la traduzione del parlato nei propri software e servizi.

La traduzione via browser resta in fase beta

DeepL distingue il nuovo lancio per desktop dalla sua esperienza via browser. Secondo l’annuncio dell’azienda, la traduzione da voce a voce per i partecipanti esterni che usano un browser resta in fase beta.

Questa distinzione assegna all’applicazione desktop un ruolo più definito nelle organizzazioni che gestiscono la configurazione delle riunioni o distribuiscono software ai dipendenti. L’accesso via browser può essere più semplice per i partecipanti esterni, ma DeepL non presenta questa modalità come una soluzione completa. L’affermazione dell’azienda sulla disponibilità generale riguarda la traduzione da voce a voce tramite la nuova app desktop, non tutte le versioni della funzione.

Una traduzione che mantiene riconoscibile chi parla

La scelta di DeepL riflette un cambiamento nelle aspettative degli utenti riguardo alla traduzione in tempo reale. I sottotitoli possono rendere comprensibile una riunione, ma una voce tradotta che conserva il modo di parlare dell’oratore può aiutare i partecipanti a seguire la conversazione in modo più naturale, soprattutto quando parlano più persone o quando il significato dipende dall’urgenza e dall’enfasi.

Il lancio amplia inoltre DeepL Voice oltre un singolo flusso di lavoro per le riunioni. Ora il servizio copre le riunioni online, le conversazioni faccia a faccia e un’API, mentre l’applicazione desktop offre all’azienda un unico livello di distribuzione per tre servizi di videoconferenza. Per gli utenti, il cambiamento concreto è semplice: il parlato tradotto dovrebbe suonare meno come una voce generica generata da un sistema e più come la voce della persona che ha parlato in origine.

Fonte

Esplora

Altri articoli