Vai al contenuto
AI.info

Ricerca

SatNav: un benchmark scalabile per la navigazione visivo-linguistica a lungo orizzonte degli UAV basata su immagini satellitari

La navigazione visivo-linguistica (VLN) dei velivoli senza equipaggio (UAV) in ambiente urbano richiede agli agenti di seguire istruzioni attraverso vaste aree urbane, facendo necessariamente affidame

SatNav: un benchmark scalabile per la navigazione visivo-linguistica a lungo orizzonte degli UAV basata su immagini satellitari
arXiv
2609.31507
Pubblicato
2026-09-25
Autori
Jiajun Jiang, Chunliang Hua, Zichun Chen, Yanxing Wu, Zeyuan Yang, Jie Song, Xiao Hu

Abstract degli autori

La navigazione visivo-linguistica (VLN) dei velivoli senza equipaggio (UAV) in ambiente urbano richiede agli agenti di seguire istruzioni attraverso vaste aree urbane, facendo necessariamente affidamento sulla memoria a lungo termine e sull’ancoraggio geospaziale. Ampliare i benchmark esistenti resta però difficile, perché dipendono da costose ricostruzioni 3D, che limitano la diversità geografica e il numero di episodi. Per affrontare questo problema, presentiamo SatNav, un benchmark scalabile per la VLN degli UAV a lungo orizzonte, costruito a partire da immagini satellitari ad alta risoluzione. SatNav è pensato per missioni di navigazione su scala cittadina e usa ritagli di immagini satellitari come approssimazioni delle viste dall’alto degli UAV per le osservazioni visive. Attraverso una procedura automatizzata che trasforma le indicazioni in episodi, SatNav costruisce 118K episodi da 59 scene in 18 città, con una lunghezza media delle traiettorie di 379 m. Per mettere alla prova la memoria a lungo orizzonte e il ragionamento geospaziale, SatNav definisce tre famiglie di compiti: Boundary, Landmark e Route, dedicate rispettivamente a monitorare l’avanzamento lungo un percorso ad anello, all’ancoraggio spaziale basato su punti di riferimento e a seguire percorsi con indicazioni di conteggio. La valutazione su SatNav di agenti VLN classici e di agenti recenti basati su grandi modelli visivo-linguistici (LVLM) mostra che la navigazione su scala cittadina resta difficile. Presentiamo inoltre SwiftVLN, un’architettura modulare con componenti di memoria selezionabili, e conduciamo analisi sistematiche dell’effetto delle scelte progettuali relative alla memoria. Infine, esperimenti di trasferimento dalle immagini satellitari agli UAV mostrano che i modelli di navigazione addestrati su immagini satellitari possono operare su osservazioni raccolte da UAV durante voli reali, dimostrando la rilevanza pratica di SatNav. La pagina del progetto: https://eku127.github.io/SatNav/

Leggi il paper originale su arXiv