Ricerca
RobotWorld: un benchmark degli agenti multimodali per l’uso dei robot in compiti e morfologie robotiche diverse
Gli agenti generalisti scrivono sempre più spesso codice, usano strumenti e portano a termine compiti digitali complessi. Ci si chiede quindi fino a che punto queste capacità si trasferiscano al mondo

- arXiv
- 2610.10409
- Pubblicato
- 2026-10-07
- Autori
- Zhiqin Yang, Chenxin Li, Xiaomeng Hu, Yibin Liu, Weidong Huang, Jiankai Sun, Haitao Li, Zijian Wu, Yuzhi Huang, Fanding Huang, Hanwen Sun, Jiashun Liu, Jingqi Tong, Mingxin Huang, Shaoli Hu, Shijue Huang, Tianyi Bai, Xinyuan Wang, Yunlong Lin, Zhengyang Tang, Zhexin Zhang, Zhuo Chen, Xierui Song, Juntao Dai, Boyuan Chen, Jiaming Ji, Fangneng Zhan, Mengkang Hu, Wei Xue, Yonggang Zhang, Han Hu, Tsung-Yi Ho, Yike Guo
Abstract degli autori
Gli agenti generalisti scrivono sempre più spesso codice, usano strumenti e portano a termine compiti digitali complessi. Ci si chiede quindi fino a che punto queste capacità si trasferiscano al mondo fisico. Per indagarlo, presentiamo RobotWorld, un impegnativo ambiente di prova simulato per l’uso dei robot: gli agenti devono trasformare istruzioni e osservazioni nell’esecuzione di compiti fisici attraverso interfacce robotiche. I suoi 84 compiti comprendono manipolazione, manipolazione mobile, locomozione, guida e controllo aereo, con budget di interazione espliciti e verifiche eseguibili del successo. Analizzando gli esiti dei compiti insieme alle tracce di esecuzione, individuiamo sia le capacità che si trasferiscono sia le lacune che impediscono di completare i compiti in modo affidabile. Riscontriamo inoltre che gli agenti attuali sanno costruire sofisticati flussi di lavoro per la percezione e il controllo, che comprendono la segmentazione delle immagini, la calibrazione delle telecamere, la stima spaziale e i calcoli basati sulla dinamica. Queste capacità, tuttavia, non si combinano sistematicamente in comportamenti efficaci: gli agenti perdono traccia degli stati degli oggetti rilevanti per il compito pur raggiungendo le pose richieste, non correggono le azioni inefficaci, recuperano troppo tardi o scambiano per conclusi compiti ancora incompleti. Questo trasferimento disomogeneo varia anche da un modello all’altro: Astra riesce più spesso a raggiungere obiettivi spaziali e di contatto vincolato, mentre Opus 5.5 riesce più spesso a raggiungere obiettivi di equilibrio continuo e di interazione con vincoli temporali. Collegando questi esiti al comportamento durante l’esecuzione, RobotWorld offre sia un rigoroso banco di prova sia un quadro empirico delle lacune ancora presenti, definendo così obiettivi concreti per l’addestramento e la progettazione di agenti più affidabili nel mondo fisico.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv