Vai al contenuto
AI.info

Ricerca

Magic-W0: un modello fondazionale strutturato di mondo e azione per l’intelligenza fisica

I modelli di mondo e azione (WAM) integrano le politiche dei robot con le dinamiche dell’ambiente condizionate dalle azioni. Gli approcci esistenti, però, si basano in larga misura sulla ricostruzione

Magic-W0: un modello fondazionale strutturato di mondo e azione per l’intelligenza fisica
arXiv
2609.39870
Pubblicato
2026-09-30
Autori
Xuhua Chen, Zhenhan Yin, Yuan Zhang, Lingfeng Zhang, He Zheng, Tong Mu, Shun Zuo, Dian Zhou, Di Wu, Xuan Zhou, Shaojie Wan, Rongtian Shen, Qiulong Xu, Yiduo Li, Yinglong Wang, Yanqian Wang, Kun Wang, Tao Zhang

Abstract degli autori

I modelli di mondo e azione (WAM) integrano le politiche dei robot con le dinamiche dell’ambiente condizionate dalle azioni. Gli approcci esistenti, però, si basano in larga misura sulla ricostruzione delle osservazioni future o su previsioni latenti generiche, e non dispongono di rappresentazioni strutturate del mondo, orientate al controllo e strettamente collegate alla generazione delle azioni. Presentiamo Magic-W0, un modello fondazionale di mondo e azione che modella congiuntamente l’evoluzione strutturata dello stato fisico e le azioni continue. Magic-W0 rappresenta l’interazione come una Transizione strutturata del mondo composta da Stato attuale, Transizione e Stato futuro. Lo Stato attuale combina il contesto visivo-linguistico con la Geometria 3D attuale; la Transizione è rappresentata dal Movimento 3D, che descrive i cambiamenti tridimensionali indotti dalle azioni; lo Stato futuro è rappresentato dalla Semantica futura, che descrive gli esiti rilevanti per il compito. Per collegare previsione e controllo, proponiamo un’architettura di interazione tra mondo e azione con livelli allineati, in cui le ipotesi sulle azioni, man mano che evolvono, condizionano la previsione delle transizioni del mondo, mentre le rappresentazioni previste del mondo contribuiscono continuamente alla generazione delle azioni. Magic-W0 è preaddestrato su dati su larga scala di manipolazione umana in prima persona, UMI, robot reali e simulazioni, con una supervisione latente per geometria, movimento 3D e semantica futura fornita da modelli visivi preaddestrati. Interventi in fase di inferenza mostrano che le rappresentazioni strutturate del mondo rispondono sistematicamente ai cambiamenti nelle azioni candidate e che le informazioni relative alle azioni si propagano attraverso rappresentazioni 3D condivise fino alle previsioni semantiche future. Su RoboDojo-Sim, Magic-W0 ottiene uno Score medio di 27,10, il più alto tra i WAM confrontati. In diversi compiti svolti da robot reali, mostra inoltre prestazioni elevate dopo il fine-tuning con una quantità limitata di dati relativi ai compiti a valle, a sostegno della sua capacità di generalizzazione e di rapido adattamento.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv