Ricerca
Trasferire l’intelligenza dei VLM al controllo robotico
Gli esseri umani si adattano senza difficoltà sia al mondo fisico sia a quello digitale: questo suggerisce che, sebbene esista un divario tra digitale e reale in termini di corporeità, ambiente e comp

- arXiv
- 2609.22966
- Pubblicato
- 2026-09-19
- Autori
- Meng-Hao Guo, Zhe-Han Mo, Jia-Jun Wang, Yi Zhang, Kejin Wang, Yi-Xuan Deng, Jia-Peng Zhang, Yongming Rao, Shi-Min Hu
Abstract degli autori
Gli esseri umani si adattano senza difficoltà sia al mondo fisico sia a quello digitale: questo suggerisce che, sebbene esista un divario tra digitale e reale in termini di corporeità, ambiente e compito, l’intelligenza umana stessa potrebbe trasferirsi attraverso questo divario. Ne deriva una domanda fondamentale: l’intelligenza dei modelli visione-linguaggio (VLM) può generalizzare in modo analogo dal mondo digitale a quello fisico per il controllo robotico? Indaghiamo questa questione con RoboDawn, un’interfaccia intuitiva per gli esseri umani che permette a un VLM agentico di controllare un robot tramite un insieme compatto di comandi discreti di traslazione, rotazione e azionamento della pinza. Con questa interfaccia, il VLM controlla il robot a ciclo chiuso: osserva lo stato visivo corrente, ragiona sull’azione successiva, la esegue e adatta le decisioni successive allo stato che ne risulta. Inoltre, introduciamo uno schema di apprendimento in contesto (ICL) che usa poche dimostrazioni per guidare il VLM sia nell’uso dell’interfaccia sia nelle strategie di risoluzione dei compiti. Gli esperimenti su RoboTwin 2.0 C2R e RoboDojo dimostrano che RoboDawn ottiene prestazioni elevate senza addestramento robotico specifico per il compito. In modalità zero-shot, RoboDawn supera diverse politiche solide addestrate su dati robotici specifici per benchmark, mentre una sola dimostrazione in contesto porta a ulteriori sostanziali miglioramenti delle prestazioni e stabilisce risultati allo stato dell’arte (SOTA). Su RoboTwin 2.0 C2R, il tasso di successo passa dal 53,2% in modalità zero-shot al 73,6% con un solo esempio, superando la solida baseline π0.5 (46,0%). Si osservano miglioramenti analoghi su RoboDojo, dove il tasso di successo sale dal 35,67% in modalità zero-shot al 47,17% con un solo esempio. Lo stesso approccio si trasferisce anche ai robot del mondo reale, che eseguono su Franka i compiti di mettere un blocco nel cestino e impilare blocchi.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv