Ricerca
OpenWAM: un’esplorazione aperta e modulare verso il pretraining sistematico dei modelli mondo-azione
I modelli mondo-azione ereditano conoscenze sul mondo dai priori dei modelli generativi video e le trasformano in segnali di controllo eseguibili attraverso l’esperienza incarnata. I sistemi esistenti

- arXiv
- 2609.07398
- Pubblicato
- 2026-09-07
- Autori
- Yuran Wang, Siqiao Huang, Mingleyang Li, Chenhao Zhang, Jiaqi Liang, Weiyang Jin, Yue Chen, Xuemin Chi, Donghao Zhou, Qize Yu, Yu-Kai Wang, Yuhan Rui, Shenzhe Yao, Zhen Yuan, Zhenhao Shen, Kefei Zhu, Zijie Zhu, Ning Gao, Xiaowei Chi, Guanqi He, Shanghang Zhang, Hao Dong, Lin Shao, Hang Zhao
Abstract degli autori
I modelli mondo-azione ereditano conoscenze sul mondo dai priori dei modelli generativi video e le trasformano in segnali di controllo eseguibili attraverso l’esperienza incarnata. I sistemi esistenti, però, sono monolitici: il backbone generativo, la rappresentazione visiva, l’architettura, il flusso di informazioni, la procedura di inferenza e i dati di addestramento sono strettamente interdipendenti, rendendo difficile capire quali scelte progettuali contino e perché. Presentiamo OpenWAM, un’infrastruttura di ricerca aperta che trasforma il pretraining dei modelli mondo-azione in un programma sperimentale controllato. OpenWAM-Infra suddivide lo spazio di progettazione dei WAM in moduli componibili, con procedure unificate di addestramento, inferenza, distribuzione e valutazione. Su questa base, OpenWAM-Study esamina tre domande attraverso esperimenti controllati: che cosa ereditare, come interagiscono l’apprendimento del mondo e quello delle azioni e come la loro sinergia varia al crescere della scala. Ne ricava tre principi: le conoscenze a monte si trasferiscono attraverso un backbone generativo sufficientemente capace e uno spazio latente compatto e ricco di informazioni; la sinergia tra mondo e azione richiede una capacità dedicata alle azioni, un flusso esplicito di informazioni dal mondo alle azioni e un denoising congiunto e sincronizzato; il pretraining basato sull’esperienza incarnata migliora soprattutto la generalizzazione fuori dominio, mentre l’addestramento congiunto in un’unica fase su dati egocentrici e dati robotici integra la copertura del mondo e l’ancoraggio delle azioni. Combinando questi principi, realizziamo OpenWAM-α, un WAM aperto sottoposto a pretraining su circa 6.400 ore di dati egocentrici umani e dati robotici e valutato su benchmark in simulazione e nel mondo reale. Negli otto benchmark in simulazione e negli esperimenti su robot reali, che insieme comprendono configurazioni dalla manipolazione con un solo braccio o con due braccia fino alle mani robotiche dotate di destrezza, OpenWAM-α ottiene prestazioni costantemente eccellenti, mantenendo la sua posizione tra i migliori dalla simulazione al mondo fisico. Rendiamo disponibile l’intera infrastruttura, inclusi i protocolli di valutazione, i modelli sottoposti a pretraining e le ricette per i dati, per facilitare le ricerche future.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv