Vai al contenuto
AI.info

Ricerca

InfiniHand: stima in streaming del movimento delle mani nello spazio globale da video egocentrici

Stimare il movimento delle mani nello spazio globale a partire da video egocentrici richiede di ricostruirne la geometria articolata 3D e, al tempo stesso, di tracciare il movimento della camera. Gli

InfiniHand: stima in streaming del movimento delle mani nello spazio globale da video egocentrici
arXiv
2609.35743
Pubblicato
2026-09-28
Autori
Kerui Ren, Kaiwen Song, Weiguang Zhao, Yuxi Wang, Yufei Liu, Bo Dai, Haoyu Guo, Chunhua Shen, Mulin Yu, Tao Lu, Junting Dong

Abstract degli autori

Stimare il movimento delle mani nello spazio globale a partire da video egocentrici richiede di ricostruirne la geometria articolata 3D e, al tempo stesso, di tracciare il movimento della camera. Gli approcci esistenti si affidano in larga misura a stimatori indipendenti della posa delle mani e a sistemi SLAM collegati in cascata, con conseguente accumulo di errori, pipeline complesse e un notevole sovraccarico computazionale. Per superare questi limiti, presentiamo InfiniHand, un framework feed-forward end-to-end per l’elaborazione in streaming che stima congiuntamente i parametri MANO, le traiettorie della camera e le posizioni delle mani direttamente da video egocentrici non calibrati. InfiniHand integra una memoria spazio-temporale persistente con caratteristiche visive centrate sulle mani, collegando esplicitamente il movimento della camera alla geometria locale delle mani in un’architettura unificata. Addestriamo InfiniHand in due fasi successive: prima apprendiamo prior robusti sulle mani nello spazio della camera, poi estendiamo il modello alla ricostruzione in streaming nello spazio globale. A sostegno di questo processo, aggreghiamo un corpus di preaddestramento di circa 5.000 ore di dati egocentrici provenienti da diversi dataset pubblici. Valutazioni approfondite mostrano che InfiniHand supera i migliori metodi di riferimento sui benchmark dello stesso dominio, ottenendo una riduzione del 21,4% dell’ARCTIC PA-p rispetto a ViDiHand e attenuando sensibilmente la deriva nello spazio globale. Inoltre, InfiniHand si generalizza in modo robusto ai video acquisiti in contesti reali e opera a 11,19 FPS, con una velocità di elaborazione più che doppia rispetto a HaWoR.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv