The Pulse
Nuance Labs raccoglie 50 milioni di dollari per avatar IA full-duplex
Nuance Labs ha raccolto 50 milioni di dollari in un round di Serie A per sviluppare un modello audiovisivo full-duplex destinato a conversazioni faccia a faccia con l’IA. La startup di Seattle afferma che il suo sistema è in grado di percep

AI.info Team ·
«La collaborazione più produttiva nasce dalla possibilità di esprimersi liberamente, con le parole, il tono, i gesti e le espressioni, come si farebbe con un amico o un collega stretto.»
Fangchang Ma, cofondatore e amministratore delegato di Nuance Labs
Il 14 settembre Nuance Labs ha annunciato di aver raccolto 50 milioni di dollari in un round di Serie A per realizzare avatar IA in grado di ascoltare, interpretare e rispondere durante una conversazione, invece di aspettare che ogni turno finisca. Lightspeed Venture Partners ha guidato il round, a cui hanno partecipato gli investitori già presenti Accel e South Park Commons e i nuovi investitori NVIDIA e Define Ventures.
L’azienda di Seattle afferma che il suo sistema si basa su un unico modello audiovisivo full-duplex. Riceve il parlato e i segnali visivi mentre genera contemporaneamente una risposta audiovisiva, consentendo all’avatar di reagire mentre una persona sta ancora parlando. Nuance Labs afferma che questo approccio è pensato per affrontare i ritardi, le interruzioni e le espressioni inespressive che caratterizzano i sistemi assemblati con modelli separati per il riconoscimento vocale, il linguaggio, la generazione vocale e l’animazione facciale.
Un unico modello per ascoltare e rispondere
Nuance Labs descrive il suo modello come un sistema di base per la conversazione e l’espressione umana. Invece di ridurre un’interazione a una trascrizione, l’azienda afferma che analizza le parole, il tono, lo sguardo, i gesti e i tempi, quindi genera risposte verbali e non verbali che possono includere espressioni facciali e vocali.
La distinzione è importante perché i sistemi convenzionali basati sulla voce e sugli avatar solitamente trasferiscono le informazioni attraverso una sequenza di componenti separati. Il parlato viene trascritto, un modello linguistico genera una risposta, un sistema vocale la pronuncia e un sistema di animazione cerca di sincronizzare un volto con il risultato. Nuance Labs sostiene che ogni passaggio aggiunge ritardi e fa perdere informazioni sul modo in cui una persona comunica.
Il suo modello, invece, riceve in streaming le informazioni audiovisive e contemporaneamente trasmette in streaming una risposta audiovisiva. L’azienda afferma che questa architettura gli consente di mostrare che sta seguendo la conversazione attraverso segnali come le interiezioni, le reazioni facciali e altri indizi di ascolto attivo.
Ex ricercatori di Apple puntano sull’IA faccia a faccia
Nuance Labs è stata fondata da Fangchang Ma, Edward Zhang e Karren Yang, che l’azienda identifica come ex ricercatori di Apple con un dottorato. Prima di fondare l’azienda, i fondatori hanno lavorato sulla percezione artificiale, la ricostruzione e la generazione audiovisiva, secondo l’annuncio del finanziamento.
Nuance Labs afferma che il team ha scelto un approccio basato su un unico modello perché i sistemi esistenti non erano progettati per gestire insieme la comunicazione verbale e non verbale. L’obiettivo dichiarato dell’azienda è creare un’IA in grado di capire come si esprimono le persone e rispondere sul momento, invece di costringere gli utenti ad adeguare il proprio modo di comunicare ai limiti di un’interfaccia macchina.
«Non sono mai sembrati naturali perché siamo stati noi ad adattare forzatamente noi stessi e il nostro modo di comunicare alla macchina, invece che la macchina ad adattarsi a noi», ha detto Ma nell’annuncio.
Vendite, coaching e istruzione tra gli usi previsti
L’azienda afferma che la tecnologia potrebbe supportare le vendite e il servizio clienti, il coaching, la formazione professionale e l’istruzione. Tra gli esempi figurano sistemi di IA che conducono colloqui, aiutano gli utenti a esercitarsi con una lingua o offrono formazione attraverso un’interazione video dal vivo.
Nuance Labs non ha annunciato un prodotto commerciale. Afferma che il finanziamento sosterrà lo sviluppo del modello, permetterà di ampliare il team di ricerca e contribuirà a preparare un’anteprima pubblica di ricerca più avanti nel 2026. L’azienda sta inoltre assumendo ricercatori e ingegneri nei campi della modellazione, dei dati, della valutazione, dell’inferenza e dell’erogazione in tempo reale.
Nnamdi Iregbulem, partner di Lightspeed Venture Partners, ha detto che l’azienda sta affrontando il tema dell’interfaccia tra le persone e l’IA, invece di costruire un altro chatbot generalista.
«C’è una grande opportunità per migliorare il modo in cui le persone interagiscono con questi strumenti di IA trasformativi», ha detto Iregbulem. «Nuance Labs sta costruendo quell’interfaccia: una capace di vedere e rispondere a una persona come fanno le altre persone.»
Il finanziamento segue una scommessa tecnica mirata
Il round da 50 milioni di dollari dà a Nuance Labs il capitale necessario per perseguire un prodotto tecnicamente impegnativo prima ancora di aver rilasciato un sistema pubblico. L’interazione audiovisiva in tempo reale richiede che il modello interpreti più flussi, produca parlato e immagini con bassa latenza e mantenga una risposta coerente mentre l’utente continua a parlare.
Nuance Labs presenta questa sfida come un problema architetturale, non semplicemente come una questione di aggiungere animazioni più espressive a un chatbot esistente. La sua tesi centrale è che la percezione e la risposta dovrebbero essere addestrate ed erogate come un unico processo continuo. L’anteprima pubblica di ricerca offrirà la prima verifica su più ampia scala per capire se questo approccio consente di avere conversazioni meno interrotte e più reattive rispetto agli attuali sistemi basati su avatar.