Vai al contenuto
AI.info

Ricerca

Ripensare il modello mondo-azione per la manipolazione robotica composizionale e in contesto

La manipolazione composizionale su orizzonti lunghi è diventata sempre più importante per l’impiego dei robot nel mondo reale, dove un singolo compito comprende più sottocompiti coordinati. I modelli

Ripensare il modello mondo-azione per la manipolazione robotica composizionale e in contesto
arXiv
2610.02368
Pubblicato
2026-10-01
Autori
Shukai Gong, Xuanran Zhai, Yintianrun Zhang, Ruopeng Cui, Ye Huang, Yiyang Fu, Dexuan Lyu, Chaojie Li, Xinyi Song, Peiwen Lin, Chuang Wang, Mingyuan Jia, Yufan Deng, Jiaxin Fang, Bo Liang, Jiaxin Li, Yuxiang Gao, Hao Liu, Daquan Zhou

Abstract degli autori

La manipolazione composizionale su orizzonti lunghi è diventata sempre più importante per l’impiego dei robot nel mondo reale, dove un singolo compito comprende più sottocompiti coordinati. I modelli mondo-azione (WAM) esistenti prevedono congiuntamente stati visivi futuri e azioni su orizzonti brevi, ma in genere non dispongono di un ragionamento esplicito a livello dei sottocompiti. Proponiamo Visual Goal-conditioned Action Reasoning (ViGAR), un framework gerarchico che suddivide la manipolazione tra un pianificatore di sotto-obiettivi visivi e un esecutore di sotto-obiettivi. A partire dall’osservazione corrente e dall’istruzione globale, il pianificatore prevede un sotto-obiettivo visivo per il sottocompito successivo. L’esecutore genera quindi congiuntamente traiettorie visive future e azioni, condizionate dal sotto-obiettivo previsto. Entrambi i componenti condividono una rappresentazione preaddestrata del modello del mondo, consentendo alla pianificazione dei compiti e alla generazione delle azioni di beneficiare delle stesse conoscenze fisiche. Inoltre, il nostro framework supporta naturalmente l’apprendimento in contesto: usare come contesto un’immagine dell’obiettivo globale può indurre diverse scomposizioni in sottocompiti e diversi comportamenti senza aggiornare i parametri. Nel benchmark RoboTwin Clean2Random, ViGAR raggiunge tassi di successo dell’82,00% e del 67,02% rispettivamente nelle configurazioni Clean e Random, superando la migliore baseline di 12,86 punti percentuali nel tasso medio di successo. Esperimenti con robot nel mondo reale su cinque compiti composizionali e due compiti di apprendimento in contesto confermano ulteriormente l’efficacia di ViGAR.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv