Vai al contenuto
AI.info

Ricerca

ReMoMask-2: generazione mascherata di movimenti potenziata dal recupero nello spazio latente

La generazione di movimenti a partire dal testo (T2M) traduce il linguaggio naturale in movimenti delle articolazioni umane, con applicazioni nei videogiochi, nella realtà virtuale e nella robotica. L

ReMoMask-2: generazione mascherata di movimenti potenziata dal recupero nello spazio latente
arXiv
2609.08365
Pubblicato
2026-09-08
Autori
Yiran Wang, Zeyu Zhang, Ling Shao, Hao Tang

Abstract degli autori

La generazione di movimenti a partire dal testo (T2M) traduce il linguaggio naturale in movimenti delle articolazioni umane, con applicazioni nei videogiochi, nella realtà virtuale e nella robotica. La generazione di movimenti a partire dal testo aumentata dal recupero (RAG-T2M) migliora i risultati per le descrizioni complesse utilizzando come contesto coppie di movimenti e testi recuperate. Tuttavia, i modelli RAG-T2M esistenti presentano due limiti: i meccanismi di recupero e fusione a grana grossa trascurano la topologia gerarchica e spazio-temporale del movimento umano; inoltre, esiste un divario tra le rappresentazioni, perché le informazioni recuperate si trovano in uno spazio semantico distinto dalle rappresentazioni latenti del generatore. Per affrontare il primo limite, presentiamo ReMoMask, un framework RAG che tiene conto della struttura e combina l’apprendimento contrastivo Hierarchical Bidirectional Momentum (HBM), per allineare al testo le caratteristiche globali e quelle delle singole parti; Semantic Spatial-Temporal Attention (SSTA), per una fusione che tiene conto della topologia; e Topology Structured Masking (TSM), per imporre un grounding robusto a livello delle singole parti mediante un mascheramento adattivo. Per affrontare il secondo, introduciamo ReMoMask-2, che ricostruisce il database di recupero direttamente nello spazio latente del generatore prima della quantizzazione e allinea le query testuali mediante un proiettore leggero ottenuto per distillazione, consentendo al generatore di utilizzare direttamente il contenuto semantico del movimento recuperato. Esperimenti approfonditi su HumanML3D, KIT-ML e SnapMoGen mostrano che il nostro sistema di recupero raggiunge un’accuratezza allo stato dell’arte, mentre ReMoMask-2 ottiene il valore FID più basso su KIT-ML e SnapMoGen. In particolare, la sua singola fase di mask-transformer supera l’intera pipeline a due fasi di ReMoMask e offre l’inferenza più rapida.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv