Ricerca
REALM: un framework generativo dal grossolano al fine per l’ascolto reattivo incarnato
Generare movimenti facciali reattivi per l’ascoltatore è un compito importante per l’IA conversazionale incarnata. Le sfide principali per la modellazione sono due: tenere conto dei tempi dei segnali

- arXiv
- 2609.33095
- Pubblicato
- 2026-09-27
- Autori
- Peizhen Li, Longbing Cao, Yang Zhang
Abstract degli autori
Generare movimenti facciali reattivi per l’ascoltatore è un compito importante per l’IA conversazionale incarnata. Le sfide principali per la modellazione sono due: tenere conto dei tempi dei segnali del parlante preservando la continuità con i movimenti in corso dell’ascoltatore, e riprodurre gli eventi facciali che variano localmente insieme alla traiettoria complessiva del movimento. Le risposte dell’ascoltatore possono seguire i segnali precedenti con un ritardo temporale, mentre espressioni brevi e battiti di ciglia introducono variazioni difficili da prevedere in modo deterministico. Queste sfide motivano un framework che combina un allineamento temporale basato sulla storia dei movimenti con un affinamento stocastico delle espressioni. Proponiamo REALM (Reactive Embodied Audio-driven Listening Model), un framework dal grossolano al fine per l’ascolto reattivo guidato dall’audio. Un modulo Reactive Gated Speaker-Listener Fusion combina la storia dei movimenti dell’ascoltatore con l’audio del parlante mediante un prior dell’attenzione centrato sul ritardo e un gating adattivo. Un decoder a grana grossa predice una traiettoria di movimento di base, che viene arricchita con residui stocastici condizionati dall’audio nel sottospazio delle espressioni, mantenendo invariati i parametri grossolani della posa. Le valutazioni su ViCo e L2L mostrano miglioramenti rispetto ai modelli di riferimento valutati secondo diverse metriche della qualità del movimento. Ulteriori analisi esaminano la sensibilità al ritardo, il comportamento del gating e la dinamica dei battiti di ciglia. Infine, l’implementazione su un robot umanoide Ameca e uno studio percettivo condotto con utenti dimostrano l’applicabilità dei comportamenti generati a un’incarnazione fisica. Codice: https://github.com/lipzh5/REALM Demo: https://youtu.be/Tf5mpd5S8VQ
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv