Vai al contenuto
AI.info

Ricerca

Rolling-WAM: World Action Models con immaginazione a scorrimento

I World Action Models (WAM) combinano la generazione di azioni con la previsione di immagini future per la manipolazione robotica. Tuttavia, completare la rimozione congiunta del rumore da video e azi

Rolling-WAM: World Action Models con immaginazione a scorrimento
arXiv
2609.30247
Pubblicato
2026-09-24
Autori
Yinghua Zhou, Junjie Ye, Yiqi Zhao, Hao Dong, Celina Shiyu Wang, Ruohai Ge, Tingyi Yang, Basile Van Hoorick, Gaurav Sukhatme, Vitor Guizilini, Yue Wang

Abstract degli autori

I World Action Models (WAM) combinano la generazione di azioni con la previsione di immagini future per la manipolazione robotica. Tuttavia, completare la rimozione congiunta del rumore da video e azioni a ogni ciclo di ripianificazione comporta una latenza considerevole, ritarda l’aggiornamento delle azioni e limita la reattività del sistema a ciclo chiuso. Presentiamo Rolling-WAM, un approccio che distribuisce la rimozione congiunta del rumore su cicli di ripianificazione successivi. Il nostro metodo mantiene una finestra scorrevole di blocchi video-azione a diversi livelli di rumore. A ogni passaggio, uno schema scorrevole di riduzione del rumore lo elimina completamente dal blocco di azioni da eseguire a breve, mentre affina parzialmente i blocchi relativi a un futuro più lontano. Quando la finestra avanza con le nuove osservazioni delle telecamere, i blocchi futuri conservati continuano il processo di rimozione del rumore. Il costo computazionale viene così distribuito nel tempo, mantenendo un contesto visivo e d’azione in evoluzione tra un blocco e l’altro. Le valutazioni su LIBERO, RoboTwin e un robot umanoide Unitree G1 nel mondo reale mostrano che Rolling-WAM ottiene prestazioni competitive nella manipolazione. Eliminando la necessità di rimuovere da zero il rumore dall’intero orizzonte di previsione, consente una ripianificazione a regime 4,5 volte più rapida rispetto ai WAM congiunti standard.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv