Ricerca
WorldLine: simulazione visiva guidata dalle azioni per la manipolazione robotica
L’apprendimento dei robot nel mondo reale è limitato dal costo di raccogliere esperienze e valutare i comportamenti candidati. I modelli di generazione video offrono una base scalabile per simulatori

- arXiv
- 2609.38059
- Pubblicato
- 2026-09-29
- Autori
- Shenghe Zheng, Wenbo Li, Jiyao Zhang, Bin Xia, Haoyang Huang, Nan Duan, Jiaya Jia
Abstract degli autori
L’apprendimento dei robot nel mondo reale è limitato dal costo di raccogliere esperienze e valutare i comportamenti candidati. I modelli di generazione video offrono una base scalabile per simulatori visivi capaci di prevedere gli esiti delle azioni prima della loro esecuzione fisica. Tuttavia, spesso privilegiano la plausibilità visiva rispetto alla fedeltà alle azioni e alla coerenza delle dinamiche tra robot e oggetti, mentre i simulatori condizionati dalle azioni dipendono da dati scarsi e specifici per ciascuna configurazione robotica, difficili da condividere tra spazi di controllo incompatibili. Presentiamo WorldLine, un simulatore visivo guidato dalle azioni che separa l’apprendimento di dinamiche trasferibili dall’associazione delle azioni a configurazioni robotiche eterogenee. WorldLine apprende le dinamiche della manipolazione da oltre 10.000 ore di video di robot senza dati sulle azioni e le associa alle azioni usando oltre 2.000 ore di traiettorie di azioni relative a più di dieci configurazioni robotiche. Una rappresentazione delle azioni nello spazio delle immagini fornisce un’interfaccia di controllo condivisa tra le diverse configurazioni robotiche, mentre l’addestramento su più viste, arricchito con esempi di insuccesso e accompagnato da regolarizzazione relazionale, migliora la previsione delle interazioni. La distillazione in pochi passaggi, incentrata sui robot, consente rollout causali efficienti preservando i movimenti essenziali per le azioni. Nei contesti esclusi dall’addestramento e fuori dominio, WorldLine mantiene un’elevata qualità visiva e una forte corrispondenza con i movimenti del robot; sulle traiettorie fallite, migliora di 0,1626 la IoU della maschera del robot rispetto al miglior termine di confronto. Prevede il successo delle traiettorie con un’accuratezza media del 74% tra RoboTwin e AgiBot, un punto percentuale in più rispetto al miglior termine di confronto. Senza addestramento né adattamento su RoboTwin, i suoi rollout migliorano il successo nei compiti fino a 21,4 punti percentuali rispetto all’esecuzione diretta della policy. Nel complesso, queste capacità rendono WorldLine un simulatore visivo scalabile ed efficiente per la valutazione delle policy e la pianificazione di sistemi robotici. Altri risultati sono disponibili alla \href{https://zhengsh123.github.io/WorldLine/}{project page}.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv