Ricerca
EventEgoHands++: ricostruzione della mesh 3D delle mani da una prospettiva egocentrica basata su eventi con un dataset reale
La ricostruzione della mesh 3D delle mani è un compito difficile ma essenziale per applicazioni a valle, tra cui l’interazione uomo-robot e la realtà aumentata e virtuale (AR/VR). Sebbene le videocame

- arXiv
- 2609.17189
- Pubblicato
- 2026-09-15
- Autori
- Ryosei Hara, Wataru Ikeda, Masashi Hatano, Mariko Isogawa
Abstract degli autori
La ricostruzione della mesh 3D delle mani è un compito difficile ma essenziale per applicazioni a valle, tra cui l’interazione uomo-robot e la realtà aumentata e virtuale (AR/VR). Sebbene le videocamere convenzionali siano ampiamente utilizzate per questo compito, i metodi che vi si basano incontrano difficoltà in condizioni di scarsa illuminazione e quando il mosso è molto accentuato. Per superare questi limiti, le videocamere basate su eventi hanno recentemente attirato l’attenzione grazie all’elevata gamma dinamica e all’alta risoluzione temporale. Tuttavia, applicarle alla ricostruzione egocentrica delle mani resta difficile: il movimento di chi indossa la videocamera genera numerosi eventi di sfondo che oscurano i segnali specifici delle mani. Sebbene il primo approccio egocentrico basato su eventi attenui questo problema mediante la segmentazione delle mani, la sua maschera binaria non distingue la mano sinistra dalla destra. Di conseguenza, il modello non dispone di informazioni sulle mani a livello di istanza e ricostruisce entrambe anche quando ne è presente una sola o non ne è presente nessuna. Questo limite produce relazioni errate tra le mani e riduce l’accuratezza della ricostruzione. In questo articolo proponiamo EventEgoHands++, un framework per ricostruire la mesh 3D delle mani da una prospettiva egocentrica usando dati basati su eventi. Il metodo proposto comprende un Hand Detector che stima riquadri di delimitazione e maschere a livello di istanza per la mano sinistra e quella destra. Introduciamo inoltre Adaptive Attention, che regola dinamicamente l’attenzione in base ai risultati del rilevamento per apprendere con precisione la relazione spaziale e le interazioni reciproche tra le mani. Per addestrare e valutare il nostro framework, ampliamo il dataset sintetico N-HOT3D e realizziamo EEH-R, a oggi il più grande dataset reale ed egocentrico di mani basato su eventi, composto da circa 1M di frame annotati acquisiti anche in condizioni di scarsa illuminazione. Numerosi esperimenti su dataset sintetici e reali dimostrano che il nostro metodo supera sistematicamente i metodi di riferimento.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv