Ricerca
RLHND: modelli fondazionali per video come sistemi di tracciamento delle mani ancorati alla fisica per l’apprendimento robotico
Negli ultimi tempi si sono diffusi sempre più gli approcci che utilizzano dataset di video di esseri umani per addestrare le policy robotiche. Tuttavia, la maggior parte dei sistemi di tracciamento de

- arXiv
- 2610.09455
- Pubblicato
- 2026-10-07
- Autori
- Seungjun Moon, Subin Jeon, Sangwoo Kim, Hanbyul Joo, Jinwoo Shin
Abstract degli autori
Negli ultimi tempi si sono diffusi sempre più gli approcci che utilizzano dataset di video di esseri umani per addestrare le policy robotiche. Tuttavia, la maggior parte dei sistemi di tracciamento delle mani esistenti stima la posa a partire da fotogrammi ritagliati, con conoscenze preliminari limitate sul movimento delle mani e sull’interazione con gli oggetti. Ne derivano stime imprecise e incoerenti dal punto di vista fisico. Inoltre, la mancanza di segnali fisici, come il contatto e la forza, limita l’impiego dei video di esseri umani per addestrare le policy robotiche. Per affrontare questi limiti proponiamo RLHND, un modello di tracciamento delle mani basato su un modello fondazionale per video che stima congiuntamente la posa delle mani e informazioni tattili realistiche a partire da video egocentrici monoculari. Tramite il condizionamento su rappresentazioni latenti pulite, RLHND trasforma il backbone di diffusione video preaddestrato Cosmos 3 in un estrattore deterministico di caratteristiche a livello di clip, trasferendo nel tracciamento le conoscenze apprese sul movimento delle mani e sull’interazione tra mani e oggetti. Per la stima della posa, RLHND (i) predice pose delle mani con angoli articolari anatomicamente plausibili e (ii) consente, facoltativamente, di condizionare il modello sul parametro di forma per mantenere costante la forma delle mani all’interno dello stesso video e persino tra video registrati dallo stesso soggetto. Per la stima tattile, un flusso esperto tattile separato, addestrato mantenendo invariato il flusso della posa, predice contatto e forza in modo denso sulla superficie delle mani. Adottiamo inoltre una diffusione delle caratteristiche basata su LBS, che consente di estrarre caratteristiche per ciascun vertice senza ricorrere a un costoso meccanismo di attenzione per ogni vertice. RLHND ottiene prestazioni all’avanguardia su diversi dataset benchmark per la stima della posa e raggiunge risultati all’avanguardia anche nella stima del contatto e della forza. Dimostriamo inoltre l’utilità di RLHND per l’apprendimento robotico attraverso risultati di retargeting ed esperimenti con robot nel mondo reale. Il codice sarà reso disponibile al pubblico all’indirizzo https://seungjun-moon.github.io/rlhnd/.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv