Ricerca
UrbanGround: dalla percezione locale alla capacità di agire nello spazio in una città a scala reale
I modelli linguistici multimodali di grandi dimensioni (MLLM) possono interpretare una veduta stradale, ma la capacità di agire in un ambiente urbano dipende dal fatto che queste informazioni locali r

- arXiv
- 2608.27456
- Pubblicato
- 2026-08-27
- Autori
- Tianjie Ju, Zheng Wu, Yueqing Sun, Yuhan Cui, Bobo Li, Shengqiong Wu, Pengzhou Cheng, Haodong Zhao, Zongru Wu, Xinbei Ma, Doris Zhang, Kunling Li, Mong-Li Lee, Wynne Hsu, Hao Fei, Qi Gu, Gongshen Liu, Zhuosheng Zhang
Abstract degli autori
I modelli linguistici multimodali di grandi dimensioni (MLLM) possono interpretare una veduta stradale, ma la capacità di agire in un ambiente urbano dipende dal fatto che queste informazioni locali restino utili anche quando l’agente comincia a muoversi. In questo articolo esaminiamo fino a che punto gli attuali agenti MLLM riescano a trasformare la percezione locale dell’ambiente urbano in azioni affidabili in una città complessa a scala reale. Proponiamo UrbanGround, il primo sandbox che permette di verificare questa capacità in una replica di Hong Kong soggetta a vincoli fisici, costruita a partire da dati geospaziali 3D relativi all’intero territorio. UrbanGround consente l’interazione a ciclo chiuso da una visuale in prima persona e mette a disposizione una mappa interattiva per la navigazione. Gli agenti possono entrare direttamente nella città 3D ed esplorarla da una visuale in prima persona. La nostra analisi segue il progressivo ampliarsi del problema spaziale attraverso tre domande di ricerca. Verifichiamo innanzitutto se un agente, dopo un’osservazione attiva, riesca a collocare una scena locale nello spazio con sufficiente precisione da rispondere a domande spaziali. Ci chiediamo poi se questa capacità sostenga la navigazione quando le destinazioni diventano più lontane e meno esplicite. Infine, esaminiamo se il comportamento che ne risulta resista ai cambiamenti nella disponibilità dei percorsi e nel movimento dei pedoni. Gli agenti MLLM attuali mostrano di solito capacità elementari utili nel riconoscimento visivo e nel ragionamento spaziale a breve distanza, mentre l’orientamento e gli spostamenti che tengono conto dei pedoni restano inaffidabili. Il loro limite principale emerge durante l’esplorazione prolungata: le capacità locali non si combinano in un comportamento continuativo orientato a un obiettivo e gli errori si accumulano senza essere corretti in modo efficace. Ci auguriamo che UrbanGround favorisca uno studio più ampio di quanto gli attuali agenti MLLM riescano a esplorare in modo affidabile ambienti urbani complessi e aperti.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv