Ricerca
MobileVLA-R1 2.0: ragionamento potenziato dall’apprendimento per rinforzo per il controllo dei robot mobili
Tradurre istruzioni in linguaggio naturale in azioni affidabili ed eseguibili resta una sfida fondamentale per i sistemi visione-linguaggio-azione (VLA) impiegati sui robot mobili, a causa del persist

- arXiv
- 2609.06251
- Pubblicato
- 2026-09-05
- Autori
- Ting Huang, Yue Huang, Zeyu Zhang, Shuicheng Yan, Hao Tang
Abstract degli autori
Tradurre istruzioni in linguaggio naturale in azioni affidabili ed eseguibili resta una sfida fondamentale per i sistemi visione-linguaggio-azione (VLA) impiegati sui robot mobili, a causa del persistente divario tra il ragionamento semantico di alto livello e il controllo di basso livello della locomozione e della manipolazione. Gli approcci esistenti si affidano spesso al ragionamento implicito o a una previsione monolitica delle azioni: questo rende difficile mantenere un processo decisionale coerente su orizzonti lunghi e, al tempo stesso, produrre azioni robotiche precise e adattabili. Per affrontare questa sfida proponiamo MobileVLA-R1 2.0, un framework VLA potenziato dall’apprendimento per rinforzo che collega esplicitamente il ragionamento strutturato sul mondo fisico al controllo eseguibile dei robot mobili. Il framework apprende a ragionare sulle traiettorie nel mondo fisico a più livelli di granularità attraverso l’allineamento supervisionato della Chain-of-Thought (CoT) e l’apprendimento per rinforzo, migliorando la coerenza tra ragionamento e azione rispetto alla sola supervisione comportamentale. Per supportare sia la locomozione sia la manipolazione, introduciamo inoltre un decoder delle azioni condizionato dal ragionamento, che mappa le rappresentazioni del ragionamento multimodale su obiettivi di azione a livello di compito, successivamente tradotti in comandi specifici per ciascun robot dai relativi controllori. Questa architettura offre un’interfaccia unificata tra percezione, ragionamento e azione, separando la generazione delle azioni di alto livello dall’attuazione specifica del robot. Conduciamo valutazioni approfondite sulla navigazione guidata dal linguaggio, sul controllo dei quadrupedi e sulla manipolazione mobile con robot umanoidi, comprendendo VLN-CE, QUARD e impieghi nel mondo reale sui robot Unitree Go2 e G1. MobileVLA-R1 2.0 supera costantemente solidi modelli VLA di riferimento: rispetto a MobileVLA-R1, ottiene in media 1,6 punti in più nella SR su VLN-CE e 10,0 punti in più nel tasso di successo nel completamento dell’intero compito nelle attività di manipolazione mobile svolte nel mondo reale con G1. Dimostra inoltre di saper seguire in modo robusto istruzioni su orizzonti lunghi e di eseguirle a ciclo chiuso su diverse piattaforme robotiche.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv