Ricerca
Meno decoder, più encoder: apprendere rappresentazioni geometriche dalla sintesi di nuove viste
Questo articolo esamina il ruolo della sintesi di nuove viste (NVS) nell’apprendimento di rappresentazioni geometriche. In linea di principio, la NVS dovrebbe ragionare sulla struttura tridimensionale

- arXiv
- 2610.03717
- Pubblicato
- 2026-10-02
- Autori
- Keerthi Kaashyap, Dennis Anthony, Akshay Krishnan, Nhi Ngoc Nguyen, Jeremy Collins, James Hays, Shreyas Kousik, Animesh Garg
Abstract degli autori
Questo articolo esamina il ruolo della sintesi di nuove viste (NVS) nell’apprendimento di rappresentazioni geometriche. In linea di principio, la NVS dovrebbe ragionare sulla struttura tridimensionale della scena, consentendo così di apprendere rappresentazioni geometriche multivista trasferibili. Eppure, i metodi NVS esistenti basati su encoder producono rappresentazioni scadenti. Non è per mancanza di un segnale di supervisione, ma per scelte architetturali poco evidenti: \textit{decoder con elevata capacità espressiva spaziale} che indeboliscono le capacità di rappresentazione dell’encoder della scena e \textit{obiettivi a basso livello nello spazio dei pixel} che ostacolano l’apprendimento delle feature. Presentiamo SNAP, un transformer encoder-decoder auto-supervisionato che affronta entrambi i problemi con un decoder locale condizionato dalla posa e un obiettivo di ricostruzione nello spazio latente. SNAP non è legato a un compito specifico e mostriamo che è competitivo rispetto a metodi specializzati supervisionati con dati geometrici. SNAP ottiene inoltre risultati competitivi rispetto alle rappresentazioni auto-supervisionate in cinque compiti: localizzazione visiva, stima della posa, corrispondenza tra punti, stima della profondità e manipolazione robotica. In particolare, le feature dei patch di SNAP mostrano un’invarianza al punto di vista che emerge spontaneamente e si avvicina a quella di modelli fortemente supervisionati, pur richiedendo meno risorse di calcolo e meno dati. Quando la fotocamera si sposta e le rappresentazioni 2D standard collassano, le prestazioni di SNAP peggiorano in modo più graduale: ciò mostra che limitare la capacità espressiva del decoder impedisce attivamente che la struttura geometrica trasferibile venga soppressa. https://snap-nvs.github.io
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv