Ricerca
PANORAMA: didascalie panottiche con ancoraggio spaziale tramite selezione di proposte di maschere
I sistemi intelligenti che agiscono nel mondo hanno bisogno di una comprensione delle immagini che sia al tempo stesso completa e ancorata allo spazio. Gli attuali modelli visione-linguaggio (VLM) pos

- arXiv
- 2609.19143
- Pubblicato
- 2026-09-16
- Autori
- Sara Pieri, Evangelos Kazakos, Shizhe Chen, Josef Sivic, Cordelia Schmid
Abstract degli autori
I sistemi intelligenti che agiscono nel mondo hanno bisogno di una comprensione delle immagini che sia al tempo stesso completa e ancorata allo spazio. Gli attuali modelli visione-linguaggio (VLM) possono generare didascalie scorrevoli e dettagliate, ma associarle in modo affidabile ai pixel dell’immagine resta difficile. I metodi esistenti che combinano descrizioni dense e ancoraggio a livello di pixel producono spesso descrizioni incomplete oppure maschere di segmentazione imprecise. Studiamo questo problema attraverso la generazione di didascalie panottiche con ancoraggio spaziale, un compito che richiede a un VLM di descrivere sia gli oggetti in primo piano sia le regioni di sfondo, associando ogni espressione che vi fa riferimento a maschere a livello di pixel. Il nostro contributo si articola in tre parti. In primo luogo, presentiamo PanoCaps, un benchmark annotato da esseri umani e costruito a partire da dataset di segmentazione panottica. Offre didascalie dense con una copertura quasi completa dei pixel e allineamenti tra immagini e testo a livello di entità, utilizzabili sia per l’addestramento sia per la valutazione. Proponiamo inoltre un protocollo per l’abbinamento tra espressioni e maschere e una metrica Panoptic Quality generalizzata (gPQ), che valuta congiuntamente la corrispondenza del testo e delle maschere. In secondo luogo, formuliamo l’ancoraggio delle espressioni come una selezione da un insieme di proposte di maschere condizionate dall’espressione e presentiamo PANORAMA, un VLM che condiziona un modello di segmentazione preaddestrato su rappresentazioni contestualizzate delle espressioni per ottenere maschere candidate e impara a selezionare quelle corrispondenti a ciascuna espressione. Addestrare questa interfaccia insieme alla generazione delle didascalie consente a PANORAMA di produrre maschere di alta qualità e permette a ogni espressione di riferirsi a una singola regione o a più istanze. In terzo luogo, PANORAMA ottiene i migliori risultati complessivi nell’ancoraggio spaziale su PanoCaps e eguaglia o supera i modelli specializzati in diversi compiti di ancoraggio a livello di pixel. Gli esperimenti mostrano che il nostro metodo produce segmentazioni precise a livello di entità, mantenendo didascalie dettagliate e coerenti con le maschere. Codice, dati e modelli sono disponibili all’indirizzo https://www.di.ens.fr/willow/research/panorama/.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv