Vai al contenuto
AI.info

Ricerca

InternW0-$Δ$: un modello di azione del mondo che collega dinamiche predittive e azioni con 20K+ ore di dati aperti

I modelli di azione del mondo (World Action Models, WAM) modellano congiuntamente le dinamiche visive e la generazione di azioni per la manipolazione robotica generalista. Una sfida centrale consiste

arXiv
2609.31394
Pubblicato
2026-09-25
Autori
Xingyu Miao, Zizun Li, Baole Fang, Kaiwen Song, Tenghui Wang, Hanxue Zhang, Yating Wang, Xudong Li, Yuping He, Xueyuan Wei, Chao Gao, Xijie Yang, Yingxiang Xu, Kerui Ren, Wenqi Guo, Jianjun Zhou, Xinzhe Wang, Weiguang Zhao, Ni Yang, Zetao Cai, Yufei Xue, Hengjie Li, Zeyu He, Yuanzhen Zhou, Rong Fu, Jianyang Zhang, Siwei Cui, Fuxian Huang, Yunsong Zhou, Xing Gao, Yifei Yao, Qiaojun Yu, Kailin Li, Ming Zhou, Mu Huang, Xinyue Li, Wenze Cui, Bingqi Jiang, Xueyue Zhu, Junting Dong, Haoyu Guo, Tao Lu, Mulin Yu, Bowen Zhou, Bin Zhao, Tianfan Xue, Weinan Zhang, Chunhua Shen

Abstract degli autori

I modelli di azione del mondo (World Action Models, WAM) modellano congiuntamente le dinamiche visive e la generazione di azioni per la manipolazione robotica generalista. Una sfida centrale consiste nell’integrare in un quadro unificato per la generazione di azioni robotiche le informazioni a priori provenienti da modelli preaddestrati su larga scala, tra cui quelle sulla dinamica visiva, sulla semantica della scena, sulla geometria e sul movimento. Presentiamo InternW0-$Δ$, un WAM unificato preaddestrato su un corpus eterogeneo, che supera i metodi precedenti nei benchmark in simulazione e su piattaforme robotiche reali. InternW0-$Δ$ combina dinamica visiva preaddestrata, semantica a livello di scena, informazioni a priori sulla geometria 4D e sul movimento, e generazione di azioni in un’architettura Mixture-of-Transformers (MoT). Un modulo esperto video preaddestrato e un modulo esperto delle azioni interagiscono sotto la guida semantica di un VLM con parametri congelati, mentre un foundation model 4D preaddestrato introduce informazioni a priori sulla geometria e sul movimento mediante distillazione impiegata solo durante l’addestramento. Introduciamo inoltre Causal Imprint, che apprende i cambiamenti della scena rilevanti per il futuro attraverso una supervisione sul futuro impiegata solo durante l’addestramento e fornisce rappresentazioni predittive direttamente al modulo esperto delle azioni, senza generare video futuri mediante rollout in fase di inferenza. Per l’addestramento congiunto su larga scala, costruiamo un corpus eterogeneo di dimostrazioni robotiche, dati UMI, dimostrazioni umane in prospettiva egocentrica e dati Ego2Robot, selezionati e allineati secondo una rappresentazione comune di stati e azioni. Il corpus risultante contiene oltre 20K ore di dati di addestramento elaborati ed è, per quanto ne sappiamo, il più grande corpus open source del suo genere. Preaddestriamo InternW0-$Δ$ su questo corpus e ne dimostriamo le elevate prestazioni nei benchmark in simulazione e su piattaforme robotiche reali. Renderemo open source il codice di addestramento, i pesi del modello, l’infrastruttura, la pipeline di elaborazione dei dati e i dati elaborati, laddove le licenze lo consentano. Pagina del progetto: https://internrobotics.github.io/InternW0-Delta/

Leggi il paper originale su arXiv