Ricerca
Puppeteer: generazione di gesti che accompagnano il parlato, ancorati agli oggetti e sensibili alla postura
Generare gesti che accompagnano il parlato, coerenti nel tempo, in linea con il significato di ciò che viene detto e ancorati agli oggetti circostanti, resta una sfida. I precedenti modelli di generaz

- arXiv
- 2609.00369
- Pubblicato
- 2026-08-31
- Autori
- Vida Adeli, Soroush Mehraban, Jacob Rommann, Harrison Sanborn, Cole Clifford, Babak Taati
Abstract degli autori
Generare gesti che accompagnano il parlato, coerenti nel tempo, in linea con il significato di ciò che viene detto e ancorati agli oggetti circostanti, resta una sfida. I precedenti modelli di generazione dei gesti a partire dal parlato privilegiano l’allineamento tra audio e gesti, ma non tengono esplicitamente conto dei vincoli posturali o degli oggetti circostanti, e non riescono così a cogliere la correlazione intrinseca tra i gesti del corpo e lo spazio fisico. Presentiamo Puppeteer, un modello di diffusione per la generazione di gesti che accompagnano il parlato, sensibile alla postura e ancorato agli oggetti, che opera in uno spazio latente causale. Scomponiamo i gesti lunghi in primitive strutturate e addestriamo un autoencoder variazionale causale che le codifica in token latenti ordinati nel tempo, ciascuno dei quali dipende solo dal passato. Eseguiamo poi una diffusione condizionale direttamente nello spazio latente causale, usando come condizioni i segnali del parlato, la storia del movimento, un riferimento posturale iniziale e la geometria degli oggetti, per sintetizzare gesti fisicamente coerenti. Questa rappresentazione latente ordinata nel tempo consente un controllo temporale esplicito e supporta compiti come l’interpolazione e il completamento dei gesti. Per valutare meglio la sintesi dei gesti che accompagnano il parlato, al di là delle misure esistenti, introduciamo nuove metriche di valutazione specifiche per questo compito. Abbiamo inoltre creato SceneGes, il primo dataset sintetico 3D curato di gesti corporei che accompagnano il parlato e dei corrispondenti oggetti 3D, che consente di generare gesti ancorati agli oggetti. Gli esperimenti mostrano che Puppeteer genera gesti più vari e meglio sincronizzati nel tempo rispetto ai metodi precedenti, consentendo al contempo la sintesi di gesti ancorati agli oggetti.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv