Vai al contenuto
AI.info

Ricerca

ZimaBlue: modelli di azione del mondo generalizzabili attraverso un pre-addestramento video scalabile

La manipolazione robotica deve affrontare una sfida fondamentale di scalabilità: per generalizzare in modo robusto serve un’ampia esperienza fisica, ma raccogliere traiettorie robotiche corredate di e

ZimaBlue: modelli di azione del mondo generalizzabili attraverso un pre-addestramento video scalabile
arXiv
2609.00188
Pubblicato
2026-08-31
Autori
Xionghao Wu, Yijun Yang, Shiyang Zhou, Haoze Sun, Jianhui Liu, Songsong Yu, Jiyao Zhang, Wenbo Li, Bo Wang, Guoqing Ma, Lin Song, Renjie Liao, Shenghe Zheng, Wei Tang, Xiaojuan Qi, Yanwei Li, Yuan Zhang, Zhuotao Tian, Haoyang Huang, Nan Duan

Abstract degli autori

La manipolazione robotica deve affrontare una sfida fondamentale di scalabilità: per generalizzare in modo robusto serve un’ampia esperienza fisica, ma raccogliere traiettorie robotiche corredate di etichette delle azioni è costoso e la loro varietà è intrinsecamente limitata. I video egocentrici offrono una fonte molto più scalabile di esperienza fisica: documentano interazioni con gli oggetti, dinamiche di contatto, uso di strumenti e comportamenti di lunga durata in ambienti diversi. La sfida principale è trasformare questa esperienza abbondante, ma priva di etichette delle azioni, in un controllo efficace dei robot. Presentiamo ZimaBlue, un framework scalabile per apprendere modelli di azione del mondo generalizzabili (WAM) da grandi quantità di video. ZimaBlue segue un percorso di addestramento in tre fasi: dapprima esegue un pre-addestramento causale su larga scala con video egocentrici di esseri umani e robot che documentano esperienze fisiche; poi collega le dinamiche visive apprese a traiettorie robotiche eterogenee mediante un addestramento intermedio su video e azioni con una rappresentazione unificata delle azioni; infine specializza il modello per l’impiego su un robot bersaglio. Per rendere pratici i WAM generativi nel controllo in tempo reale, ZimaBlue adotta inoltre un’architettura asincrona a doppio sistema Slow-Fast, in cui un modello del mondo Slow ad alta capacità fornisce rappresentazioni spazio-temporali generalizzabili e un ramo Fast leggero consente di predire le azioni a 30 Hz su NVIDIA RTX 4090. Nelle valutazioni zero-shot su robot reali, passando dall’uso dei soli dati del robot bersaglio a oltre 120.000 ore di video che documentano esperienze fisiche, il tasso di successo sale dal 36,1% al 77,8%. ZimaBlue ottiene inoltre risultati elevati in diversi benchmark, con miglioramenti particolarmente marcati nei compiti mai incontrati prima.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv