Vai al contenuto
AI.info

Ricerca

Motion-Omni: voce e movimento di tutto il corpo generati congiuntamente end-to-end per il dialogo parlato

Un avatar che sostiene una conversazione dovrebbe decidere cosa dire e come muoversi mentre parla. Oggi, però, queste capacità appartengono a famiglie di modelli separate: i modelli per il dialogo par

Motion-Omni: voce e movimento di tutto il corpo generati congiuntamente end-to-end per il dialogo parlato
arXiv
2609.04250
Pubblicato
2026-08-28
Autori
Chengqian Ma, Wei Tao, Haoyu Zhang, Yiwen Guo

Abstract degli autori

Un avatar che sostiene una conversazione dovrebbe decidere cosa dire e come muoversi mentre parla. Oggi, però, queste capacità appartengono a famiglie di modelli separate: i modelli per il dialogo parlato producono voce senza movimento, mentre i modelli di movimento associato al parlato producono movimento solo a partire da audio fornito loro. La soluzione standard è una cascata che genera prima la risposta vocale e poi elabora l’audio completo con un modello di movimento. Questo richiede una seconda passata completa di inferenza e impedisce qualsiasi ottimizzazione congiunta delle due componenti. Presentiamo Motion-Omni, un framework end-to-end in cui un modello per il dialogo parlato produce direttamente espressioni facciali esplicite e movimenti delle mani, della parte superiore e di quella inferiore del corpo, generandoli dagli stati nascosti che producono la voce. Qui l’addestramento congiunto non è facoltativo: se il ramo vocale resta bloccato, il movimento non si allinea all’audio. È l’adattamento congiunto di LLM, Speech Generator e Motion Generator rispetto a entrambi gli obiettivi a ripristinare l’allineamento, preservando la capacità di sostenere un dialogo parlato. I dati per l’addestramento provengono da una pipeline scalabile e indipendente dal modello, che assegna pseudo-etichette a risposte vocali dalla voce coerente usando un modello insegnante per il movimento sostituibile. Ne risultano 422.856 coppie ordinate per qualità (1.402 ore). Rendiamo inoltre disponibile SwDA-500 e, per quanto ne sappiamo, il primo protocollo pubblico di valutazione per il dialogo parlato aperto e stocastico con movimento di tutto il corpo: il protocollo usa lo stesso audio per i diversi sistemi di movimento e riunisce rendering, metriche automatiche, valutazione umana e misurazione della latenza. Basato su Qwen2.5-7B-Instruct, Motion-Omni-Q7 si colloca entro il 2% rispetto alla cascata con modello insegnante che usa lo stesso audio nelle metriche del movimento senza riferimento, pur rispondendo 5,4 volte più velocemente (RTF=0,78, più veloce del tempo reale). Supera inoltre tutte le cascate senza modello insegnante per correlazione con il ritmo e diversità e raggiunge un tasso di errore sulle parole del 2,62%, il più basso tra i sistemi omnimodali confrontati.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv