Ricerca
Show-Harness: basta un agente VLM per «giocare» con i robot
I modelli fondazionali di visione e linguaggio (VLM) mostrano un’ampia conoscenza del mondo, ma tradurla nel controllo dei robot resta difficile. Presentiamo Show-Harness, un Embodied Harness che cons

- arXiv
- 2609.10522
- Pubblicato
- 2026-09-09
- Autori
- Yanzhe Chen, Zechen Bai, Zhijun Cao, Wenzheng Zeng, Kevin Qinghong Lin, Yiqi Lin, Guoqiang Liang, Kevin Yuchen Ma, Qiming Huang, Mike Zheng Shou
Abstract degli autori
I modelli fondazionali di visione e linguaggio (VLM) mostrano un’ampia conoscenza del mondo, ma tradurla nel controllo dei robot resta difficile. Presentiamo Show-Harness, un Embodied Harness che consente ai VLM di «giocare» con i robot attraverso un’interfaccia semantica compatta che collega le intenzioni alle azioni. Show-Harness mette a disposizione unità discrete di azione semantica su cui i VLM possono ragionare in modo naturale, mentre interpreti specifici per ciascuna incarnazione robotica le traducono in modo deterministico in azioni locali del robot. Il VLM resta così direttamente responsabile delle decisioni fisiche più dettagliate. Attraverso la stessa interfaccia, Show-Harness dimostra la fattibilità di (1) sbloccare direttamente VLM di frontiera a codice chiuso per il controllo dei robot zero-shot e (2) adattare VLM open source di piccole dimensioni per un impiego a basso costo con appena poche ore di fine-tuning su GPU. Sviluppiamo inoltre GUMI (GUI Manipulation Interface), che estende lo stesso spazio di azioni semantiche alla raccolta di dimostrazioni tramite GUI, consentendo a persone e agenti di «giocare» con robot dalle diverse incarnazioni senza hardware specializzato per la teleoperazione. Numerosi esperimenti mostrano che gli agenti VLM dotati di Show-Harness generalizzano in modo robusto tra compiti, incarnazioni e ambienti diversi, superando paradigmi rappresentativi basati su agenti e VLA. Questi risultati suggeriscono che l’interfaccia giusta può far emergere notevoli capacità di interazione con il mondo fisico dai VLM fondazionali, senza richiedere una maggiore capacità del modello né un costoso preaddestramento specifico per ciascuna incarnazione robotica.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv