Ricerca
HarnessVLN: unificare la navigazione embodied senza addestramento tramite un Agent Harness
La navigazione embodied richiede agli agenti di collegare istruzioni o obiettivi legati a oggetti alle osservazioni spaziali e di tradurre i piani in azioni eseguite con successo. I modelli linguistic

- arXiv
- 2609.15195
- Pubblicato
- 2026-09-14
- Autori
- Yang Chen, Lirong Che, Zhenyu Huang, Wenbo Fu, Chuang Wang, Xu Cao, Daqi Liu, Yuzhe Yang, Jian Su, Lan-Zhe Guo
Abstract degli autori
La navigazione embodied richiede agli agenti di collegare istruzioni o obiettivi legati a oggetti alle osservazioni spaziali e di tradurre i piani in azioni eseguite con successo. I modelli linguistici multimodali di grandi dimensioni (MLLM) diventano sempre più capaci e offrono un supporto migliore alla navigazione senza addestramento specifico per il compito; tuttavia, il solo miglioramento del ragionamento semantico non garantisce che le azioni proposte restino coerenti con le evidenze spaziali, l’avanzamento del compito e gli esiti dell’esecuzione. Presentiamo HarnessVLN, un framework zero-shot e senza addestramento che unifica la navigazione basata su istruzioni e quella verso oggetti obiettivo attraverso un Agent Harness condiviso. Tramite un’interfaccia unificata, l’Harness coordina gli strumenti di percezione, memoria ed esecuzione e, prima di inoltrare le proposte del pianificatore, ne verifica il supporto nelle evidenze, la fattibilità geometrica e la coerenza con i sotto-obiettivi. Gestisce congiuntamente una memoria gerarchica degli eventi e uno Spatiotemporal Graph persistente per seguire l’avanzamento del compito, conservare le evidenze spaziali e contestualizzare gli insuccessi. Il feedback strutturato sull’esecuzione aggiorna questo stato condiviso e guida la pianificazione successiva, il recupero dagli insuccessi e la conclusione del compito. Su R2R, RxR, HM3D-v2 e HM3D-OVON, HarnessVLN raggiunge rispettivamente tassi di successo del 60,8%, 53,9%, 76,0% e 59,3%, superando i precedenti metodi allo stato dell’arte senza addestramento. L’impiego su un robot umanoide dimostra inoltre la sua applicabilità a entrambi i compiti di navigazione in ambienti reali. La pagina del progetto è disponibile all’indirizzo https://agibot-harnessvln.netlify.app/.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv