Vai al contenuto
AI.info

Ricerca

Che cosa conservano le parole di un luogo: ragionamento linguistico zero-shot per la geolocalizzazione tra viste diverse

La geolocalizzazione tra viste diverse viene comunemente affrontata come un problema di ricerca per immagini: un’immagine ripresa da terra viene confrontata con un database di porzioni di immagini sat

Che cosa conservano le parole di un luogo: ragionamento linguistico zero-shot per la geolocalizzazione tra viste diverse
arXiv
2610.07269
Pubblicato
2026-10-05
Autori
Ayesh Abu Lehyeh, Jay Hwasung Jung, Safwan Wshah

Abstract degli autori

La geolocalizzazione tra viste diverse viene comunemente affrontata come un problema di ricerca per immagini: un’immagine ripresa da terra viene confrontata con un database di porzioni di immagini satellitari attraverso rappresentazioni vettoriali apprese congiuntamente. Questi modelli sono accurati, ma richiedono grandi quantità di coppie di immagini per l’addestramento supervisionato e non possono mostrare quali elementi giustifichino una corrispondenza. In questo articolo studiamo una domanda diversa: quanta parte di questo compito si può risolvere usando soltanto il linguaggio? Chiediamo a un modello linguistico multimodale di grandi dimensioni (MLLM) di descrivere ogni panorama ripreso da terra e ogni porzione di immagine satellitare sotto forma di testo strutturato, per poi individuare il luogo confrontando le descrizioni. Nessun componente viene addestrato. Valutiamo il metodo su 9.826 coppie del dataset VIGOR provenienti da quattro città statunitensi, in tre scenari. Nel primo, le descrizioni sono fedeli ma non permettono di distinguere i luoghi. Concordano strettamente tra le due viste, eppure ordinare l’intero insieme di candidati in base alla somiglianza tra le descrizioni non restituisce quasi mai la porzione corretta (Recall@1 dello 0,39%). Nel secondo, restringiamo l’insieme a dieci porzioni adiacenti, come farebbe un’informazione a priori approssimativa. Le stesse descrizioni diventano così utili: un MLLM che funge da giudice e valuta la coerenza strutturale ottiene il doppio dei risultati di un ordinamento casuale ed eguaglia una solida baseline lessicale. Indica inoltre quali campi delle due descrizioni concordano e quali sono in conflitto, cosa che una distanza tra rappresentazioni vettoriali non può fare e che consideriamo un passo verso una geolocalizzazione interpretabile. Nel terzo scenario, affianchiamo il giudice a un sistema di ricerca visiva addestrato. Per le query che quest’ultimo classifica erroneamente, riordinare i risultati in base alle immagini funziona, mentre riordinarli in base alle nostre descrizioni no (Recall@1 del 23,5% contro il 10,7%). La struttura della scena sopravvive alla conversione in linguaggio, ma non i dettagli visivi minuti necessari per distinguere luoghi vicini. Il codice e i prompt sono disponibili pubblicamente all’indirizzo https://github.com/AyeshAbuLehyeh/GeoLingual.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv