Vai al contenuto
AI.info

Ricerca

Ensemble di Vision Transformer per la segmentazione dei panorami stradali

La segmentazione semantica dei panorami stradali può contribuire a descrivere in dettaglio gli ambienti urbani, ma le dimensioni ridotte dei dataset e i diversi costi di addestramento rendono difficil

Ensemble di Vision Transformer per la segmentazione dei panorami stradali
arXiv
2610.06063
Pubblicato
2026-10-05
Autori
Yunus Serhat Bıçakçı

Abstract degli autori

La segmentazione semantica dei panorami stradali può contribuire a descrivere in dettaglio gli ambienti urbani, ma le dimensioni ridotte dei dataset e i diversi costi di addestramento rendono difficile la scelta del modello. Questo articolo presenta il sistema utilizzato per una candidatura classificatasi al primo posto nella challenge PalmCity, secondo la classifica rilevata il 5 ottobre 2026. Nove sistemi di segmentazione preaddestrati vengono confrontati utilizzando budget computazionali approssimativamente equivalenti. Tra i candidati figurano DeepLabV3+, SegFormer, UPerNet, Mask2Former, DINOv3 con un decoder lineare e un Encoder only Mask Transformer che utilizza DINOv3. I due candidati migliori vengono addestrati indipendentemente con tre seed casuali e budget più ampi. La media semplice delle probabilità delle classi prodotte dai tre modelli Encoder only Mask Transformer, valutati a tre scale delle immagini con ribaltamento orizzontale, raggiunge il 60,95% di intersezione sull’unione media e il 71,16% di F1 medio sull’insieme pubblico di validazione di 84 immagini. Le predizioni inviate ottengono il 57,08% di intersezione sull’unione media e il 67,96% di F1 medio nella classifica del test nascosto. La produzione di tutte le 249 maschere del test richiede 251,49 secondi, compresi l’inizializzazione dei modelli e i controlli di provenienza, su una sola NVIDIA RTX 5090. Il picco di memoria GPU allocata è di 2,70 GiB. Lo studio riporta tutti i modelli ammissibili, tutte le varianti di inferenza, gli errori per classe, le condizioni delle fonti e i controlli di riproducibilità, documentando una procedura per la challenge basata su architetture esistenti.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv