Ricerca
InfiniHand: stima in streaming del movimento delle mani nello spazio globale da video egocentrici
Stimare il movimento delle mani nello spazio globale a partire da video egocentrici richiede di ricostruirne la geometria articolata 3D e, al tempo stesso, di tracciare il movimento della camera. Gli

- arXiv
- 2609.35743
- Pubblicato
- 2026-09-28
- Autori
- Kerui Ren, Kaiwen Song, Weiguang Zhao, Yuxi Wang, Yufei Liu, Bo Dai, Haoyu Guo, Chunhua Shen, Mulin Yu, Tao Lu, Junting Dong
Abstract degli autori
Stimare il movimento delle mani nello spazio globale a partire da video egocentrici richiede di ricostruirne la geometria articolata 3D e, al tempo stesso, di tracciare il movimento della camera. Gli approcci esistenti si affidano in larga misura a stimatori indipendenti della posa delle mani e a sistemi SLAM collegati in cascata, con conseguente accumulo di errori, pipeline complesse e un notevole sovraccarico computazionale. Per superare questi limiti, presentiamo InfiniHand, un framework feed-forward end-to-end per l’elaborazione in streaming che stima congiuntamente i parametri MANO, le traiettorie della camera e le posizioni delle mani direttamente da video egocentrici non calibrati. InfiniHand integra una memoria spazio-temporale persistente con caratteristiche visive centrate sulle mani, collegando esplicitamente il movimento della camera alla geometria locale delle mani in un’architettura unificata. Addestriamo InfiniHand in due fasi successive: prima apprendiamo prior robusti sulle mani nello spazio della camera, poi estendiamo il modello alla ricostruzione in streaming nello spazio globale. A sostegno di questo processo, aggreghiamo un corpus di preaddestramento di circa 5.000 ore di dati egocentrici provenienti da diversi dataset pubblici. Valutazioni approfondite mostrano che InfiniHand supera i migliori metodi di riferimento sui benchmark dello stesso dominio, ottenendo una riduzione del 21,4% dell’ARCTIC PA-p rispetto a ViDiHand e attenuando sensibilmente la deriva nello spazio globale. Inoltre, InfiniHand si generalizza in modo robusto ai video acquisiti in contesti reali e opera a 11,19 FPS, con una velocità di elaborazione più che doppia rispetto a HaWoR.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv