Ricerca
Un benchmark per la generazione di gesti ancorati allo spazio
La comunicazione in uno spazio condiviso intreccia segnali verbali e non verbali, e i gesti di indicazione ancorano il linguaggio all’ambiente: «metti la tazza su quello» non è interpretabile senza il

- arXiv
- 2610.03105
- Pubblicato
- 2026-10-02
- Autori
- Anna Deichler, Rishabh Dabral, Fethiye Irmak Dogan, Anindita Ghosh, Jonas Beskow
Abstract degli autori
La comunicazione in uno spazio condiviso intreccia segnali verbali e non verbali, e i gesti di indicazione ancorano il linguaggio all’ambiente: «metti la tazza su quello» non è interpretabile senza il gesto che identifica il referente. Eppure non esiste un quadro di riferimento comune per valutare se i gesti generati indichino il referente previsto; le metriche distribuzionali premiano un gesto rivolto all’oggetto sbagliato purché sembri naturale. Presentiamo un benchmark per la generazione di gesti ancorati allo spazio, che comprende ~2K clip di dialoghi realistici in VR con annotazioni dei gesti di indicazione e referenti 3D effettivi, un compito in cui i sistemi devono decidere quando, come e dove indicare nel corso di una conversazione, e un protocollo che valuta separatamente l’allineamento temporale, l’ancoraggio spaziale e la naturalezza percepita. Forniamo inoltre MM-Conv-Flow, un modello di riferimento basato sul flow matching. Valutandolo insieme a un sistema indipendente basato sul recupero di informazioni e a movimenti umani acquisiti, riscontriamo che l’ancoraggio geometrico può superare quello dei gesti di indicazione umani senza alcun miglioramento della naturalezza percepita: la qualità referenziale dei gesti va dunque misurata lungo dimensioni distinte.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv