Ricerca
Dream4ACT: un’interfaccia visiva condivisa per le azioni nella modellazione di video e azioni tra diverse morfologie robotiche
I modelli di generazione video (VGM) offrono solide conoscenze a priori spazio-temporali per modellare osservazioni e azioni di sistemi incarnati. Tuttavia, i vettori di azioni nello spazio articolare

- arXiv
- 2609.40153
- Pubblicato
- 2026-09-30
- Autori
- Xiangyu Zhu, Jin Xu, Yue Guo, Xin Wu, Yifan Sun, Xiancong Ren, Jianxin Sun, Yong Dai, Xiaozhu Ju
Abstract degli autori
I modelli di generazione video (VGM) offrono solide conoscenze a priori spazio-temporali per modellare osservazioni e azioni di sistemi incarnati. Tuttavia, i vettori di azioni nello spazio articolare non hanno una struttura esplicita nello spazio dell’immagine e variano per numero di dimensioni e significato tra diverse morfologie, rendendo difficile sfruttare direttamente le ricche conoscenze a priori spazio-temporali dei VGM. Le visualizzazioni degli effettori terminali offrono un’alternativa, ma non specificano la configurazione articolata completa necessaria all’esecuzione da parte del robot. Presentiamo Dream4ACT, un modello del mondo progettato per modellare congiuntamente video e azioni di diverse morfologie. Per unificare le rappresentazioni delle azioni tra morfologie diverse, introduciamo un’interfaccia visiva condivisa per le azioni, chiamata action views, che riproduce le configurazioni articolari da raggiungere da quattro telecamere virtuali prestabilite, usando la cinematica diretta basata su URDF. Questa rappresentazione visiva condivisa preserva la geometria articolata specifica di ciascuna morfologia e consente alle sequenze di osservazioni e azioni di condividere un autoencoder video e un transformer a diffusione. Mediante il flow-matching con mascheramento, il nostro modello supporta la dinamica diretta, la dinamica inversa e la generazione congiunta di osservazioni e azioni in un unico modello addestrato congiuntamente, variando le sequenze future che vengono alterate. Per ricavare sequenze di azioni eseguibili dalle action views previste, proponiamo un meccanismo di ricostruzione multivista vincolato da URDF che non richiede addestramento, senza ricorrere a un decoder appreso specifico per ciascuna morfologia. Dream4ACT raggiunge un tasso medio di successo dell’88,98\% su RoboTwin~2.0 e un punteggio complessivo di 65,66 su TriWorldBench, a sostegno dell’efficacia della manipolazione a ciclo chiuso e della competitività della previsione multivista condizionata dalle azioni tramite l’interfaccia visiva per le azioni.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv