Ricerca
Oltre l’aumento dei dati: pre-addestramento continuato incentrato sulle rappresentazioni per modelli visione-linguaggio-azione
Aumentare la quantità di dati robotici è fondamentale per costruire modelli visione-linguaggio-azione (VLA) generalisti. Le traiettorie dei robot, però, sono più difficili da raccogliere su larga scal

- arXiv
- 2608.27550
- Pubblicato
- 2026-08-27
- Autori
- Senqiao Yang, Chengyao Wang, Yuxin Chen, Zixuan Wang, Longxiang Tang, Haokun Gui, Jinhui Ye, Changsheng Lu, Xiaoyang Wu, Mingkang Zhu, Pengguang Chen, Shu Liu, Zhuotao Tian, Hengshuang Zhao, Bei Yu, Jiaya Jia
Abstract degli autori
Aumentare la quantità di dati robotici è fondamentale per costruire modelli visione-linguaggio-azione (VLA) generalisti. Le traiettorie dei robot, però, sono più difficili da raccogliere su larga scala rispetto ai dati immagine-testo su scala web: la raccolta nel mondo fisico è costosa e ne copre solo una parte limitata. La qualità delle rappresentazioni diventa quindi un ostacolo centrale: con una quantità fissa di dati robotici, il pre-addestramento continuato deve trasformare un numero limitato di traiettorie in conoscenze visive e relative alle azioni trasferibili, anziché limitarsi a modellare le azioni. Proponiamo VLAct, un modello VLM di base orientato ai VLA, addestrato su dati robotici ampi ed eterogenei, provenienti da diverse configurazioni robotiche, prima del fine-tuning specifico per ciascun compito. VLAct preserva le conoscenze generali pregresse del VLM e favorisce una semantica delle azioni condivisa tra diverse configurazioni robotiche attraverso la preservazione di tali conoscenze, la co-supervisione delle azioni continue con più teste e una struttura delle azioni parzialmente unificata tra configurazioni robotiche, pur consentendo l’uso di teste per le azioni specifiche per ciascun compito durante il fine-tuning. VLAct migliora sistematicamente le prestazioni nelle attività a valle nei test di trasferimento in simulazione, nel mondo reale e verso configurazioni robotiche mai viste, seguendo protocolli di fine-tuning fissi. Su LIBERO-Plus e RoboTwin 2.0, VLAct supera sistemi VLA industriali tra cui ABot-M0 e LingBot-VLA, raggiungendo tassi di successo dell’82,6% e del 92,5%. Su RoboDojo, VLAct si colloca al sesto posto tra tutte le policy per tasso di successo e supera, su entrambe le metriche, tutte le voci esplicitamente designate come world-action model (WAM). Il risultato più notevole riguarda RoboCasa-GR1, una configurazione robotica umanoide mai vista: usando solo il 20% delle traiettorie delle attività a valle, VLAct supera il modello di riferimento GR00T-N1.6 addestrato con tutti i dati. Questi risultati sono ottenuti usando dati interamente open source e una configurazione di addestramento con sole 16 GPU. Mostrano che il pre-addestramento continuato incentrato sulle rappresentazioni può offrire prestazioni altamente competitive con risorse di calcolo contenute e costituisce una direttrice autonoma e importante del progresso dei VLA, oltre all’aumento dei dati.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv