Vai al contenuto
AI.info

Ricerca

EVO-WAM: evoluzione dei modelli di azione del mondo tramite la verifica video-azione

Migliorare le politiche robotiche per nuovi compiti senza raccogliere ulteriori dimostrazioni da esperti resta una sfida centrale nell’apprendimento robotico. I modelli di azione del mondo (WAM) sfrut

EVO-WAM: evoluzione dei modelli di azione del mondo tramite la verifica video-azione
arXiv
2609.38057
Pubblicato
2026-09-29
Autori
Shiyang Zhou, Xionghao Wu, Wenbo Li, Shenghe Zheng, Jiyao Zhang, Songsong Yu, Yijun Yang, Jianhui Liu, Haoze Sun, Senqiao Yang, Li Jiang, Jingyong Su, Haoyang Huang, Zhuotao Tian

Abstract degli autori

Migliorare le politiche robotiche per nuovi compiti senza raccogliere ulteriori dimostrazioni da esperti resta una sfida centrale nell’apprendimento robotico. I modelli di azione del mondo (WAM) sfruttano ampie conoscenze a priori sui video per prevedere congiuntamente video futuri e azioni, offrendo una potenziale fonte di supervisione per adattarsi a nuovi compiti. Tuttavia, i video generati potrebbero non mostrare il completamento del compito e persino video che appaiono riusciti possono essere associati ad azioni incoerenti, che portano al fallimento dell’esecuzione. Proponiamo EVO-WAM, un framework che adatta i WAM a compiti mai visti apprendendo dalle traiettorie video-azione generate dai modelli stessi, senza eseguire le azioni candidate in un ambiente esterno. In primo luogo, integriamo nell’addestramento dei WAM la previsione dello stato e un contesto ancorato a più fotogrammi, per consentire rollout autoregressivi completi senza feedback dall’esecuzione esterna. In secondo luogo, individuiamo esperienze di addestramento affidabili selezionando, con un modello visione-linguaggio, i prefissi in cui il compito viene completato e verificandone la coerenza tra video e azioni mediante un modello di dinamica inversa. In terzo luogo, addestriamo iterativamente il WAM sui prefissi verificati e generiamo nuovi rollout con il modello aggiornato. Su sette compiti mai visti di RoboTwin 2.0, EVO-WAM porta il tasso medio di successo dal 26,9% al 68,0% per Cosmos3 e dal 28,5% al 46,4% per DreamZero, raggiungendo rispettivamente circa $2.5\times$ e $1.6\times$ i tassi di successo iniziali. Su tre compiti compositi di lungo orizzonte mai visti, nel mondo reale, migliora il tasso medio di successo di Cosmos3 dal 20,0% al 76,7%, con un incremento di 56,7 punti percentuali. Pagina del progetto: https://evo-wam.github.io/.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv