Ricerca
FlowHMR: acquisizione del movimento fisicamente plausibile da video
Presentiamo FlowHMR, un framework per ricostruire da video monoculari il movimento umano 3D globale in modo fisicamente plausibile. I metodi precedenti basati sull’apprendimento stimano in genere il m

- arXiv
- 2610.03691
- Pubblicato
- 2026-10-02
- Autori
- Zhanke Wang, Chengfeng Zhao, Qing Shuai, Jingzhong Lin, Heng Li, Zeyu Ling, Yuxin Wen, Jing Li, Di Kang, Chunchao Guo, Linchao Bao
Abstract degli autori
Presentiamo FlowHMR, un framework per ricostruire da video monoculari il movimento umano 3D globale in modo fisicamente plausibile. I metodi precedenti basati sull’apprendimento stimano in genere il movimento umano direttamente dal video mediante regressione e addestrano la rete con una supervisione geometrica. Tuttavia, ricostruire il movimento umano da un video monoculare comporta un’ambiguità intrinseca nella profondità, e la regressione diretta tende a convergere verso una soluzione media. Inoltre, non è garantito che i movimenti ricostruiti siano fisicamente plausibili, perciò il loro tracciamento con metodi basati sulla fisica spesso fallisce. Per affrontare queste difficoltà, formuliamo l’acquisizione del movimento da video come un problema di generazione del movimento condizionata dal video e, come primo passo, preaddestriamo un modello di flow matching per questo compito. Dato un video in ingresso, il modello preaddestrato genera diversi movimenti candidati, ma non tutti sono fedeli al video o tracciabili con metodi basati sulla fisica. Sottoponiamo quindi il modello a un ulteriore addestramento mediante Group Relative Policy Optimization (GRPO), con due ricompense. Una ricompensa per la fedeltà incoraggia la coerenza con il video in ingresso. Una ricompensa per il tracciamento favorisce i movimenti che un controller basato sulla fisica riesce a tracciare. Insieme, queste ricompense modificano le preferenze del modello nella generazione dei risultati: dopo l’ulteriore addestramento, il modello resta fedele al video in ingresso e produce movimenti fisicamente più plausibili. Introduciamo inoltre Wild-4K, un dataset ampio e diversificato di circa 4K video reperiti su internet, per valutare la ricostruzione del movimento umano in contesti reali. Esperimenti qualitativi e quantitativi su Wild-4K mostrano che il nostro metodo supera quelli più avanzati nella fedeltà complessiva del movimento e raggiunge un tasso di successo del tracciamento fisico dell’82,47%, contro il 62,82% del metodo di riferimento più efficace, GVHMR.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv