Ricerca
EvolvingAvatar: generazione interattiva di teste 3D che si adatta all’evolversi delle conversazioni
La generazione interattiva di teste 3D richiede movimenti coordinati nel parlare e nell’ascoltare, capaci di rispondere all’evolversi della conversazione. I generatori esistenti usano le osservazioni

- arXiv
- 2609.35616
- Pubblicato
- 2026-09-28
- Autori
- Junjie Chen, Fei Wang, Kun Li, Yiqi Nie, Xun Yang, Yanbin Hao, Linfeng Zhang, Meng Wang
Abstract degli autori
La generazione interattiva di teste 3D richiede movimenti coordinati nel parlare e nell’ascoltare, capaci di rispondere all’evolversi della conversazione. I generatori esistenti usano le osservazioni in arrivo come contesto, ma mantengono fissi i propri parametri, senza sfruttare i modelli ricorrenti della conversazione come segnale di apprendimento. Presentiamo EvolvingAvatar, un generatore causale che usa l’addestramento al momento dell’utilizzo per adattarsi al video del volto dell’utente e all’audio diadico durante l’interazione. Il suo obiettivo di predizione del contesto diadico ricava dal contesto audiovisivo un segnale di apprendimento autosupervisionato, senza richiedere etichette dei movimenti da generare al momento dell’utilizzo. Pesi rapidi persistenti accumulano questi aggiornamenti nel corso di ogni conversazione per guidare la generazione dei movimenti, mentre un adattamento transitorio della mandibola risponde al contesto audiovisivo corrente. L’attività vocale prevista determina in che modo l’adattamento persistente guida i movimenti. Presentiamo inoltre InterHead-Bench, un benchmark unificato di 455,95 ore costruito a partire da video di conversazioni con una o due inquadrature. Gli esperimenti mostrano un miglioramento delle statistiche dei movimenti conversazionali rispetto a solide baseline. Nella suddivisione fuori distribuzione più difficile, la generazione migliora con il procedere delle conversazioni, riducendo fino all’11,1% rispetto al primo intervallo lo scostamento dalle statistiche delle espressioni dell’utente e dell’avatar registrate.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv