Ricerca
I modelli generativi video come strumenti per apprendere la geometria
I recenti approcci generativi alla stima della geometria adattano modelli di diffusione per immagini preaddestrati e trattano il compito come una generazione condizionata da immagini. Partendo da mode

- arXiv
- 2608.28549
- Pubblicato
- 2026-08-28
- Autori
- Haosen Yang, Jifei Song, Zhensong Zhang, Xiatian Zhu, Jiankang Deng
Abstract degli autori
I recenti approcci generativi alla stima della geometria adattano modelli di diffusione per immagini preaddestrati e trattano il compito come una generazione condizionata da immagini. Partendo da modelli di diffusione per immagini già disponibili, (i) addestrano separatamente modelli specifici per ciascun compito, ossia la stima della profondità e delle normali di superficie, perdendo l’opportunità di sfruttare la correlazione intrinseca tra questi obiettivi geometrici; oppure (ii) sottopongono a fine-tuning congiunto architetture di base modificate dei modelli di diffusione per immagini, per esempio alterandone la self-attention, il che richiede generalmente molti dati etichettati. Per superare queste limitazioni in modo sistematico, riutilizziamo modelli generativi video preaddestrati come quadro unificato ed efficiente nell’uso dei dati per la stima della geometria, formulando il compito in modo innovativo come previsione dei fotogrammi successivi. Il nostro metodo, GeoNeXt, eredita dal modello video conoscenze strutturate in modo naturale e prior più ricchi, adattandoli ulteriormente alla modellazione congiunta di immagini e obiettivi geometrici (immagine <-> geometria). Ciò consente un apprendimento della geometria più efficace ed efficiente nell’uso dei dati. Ampi esperimenti convalidano il nostro metodo nella stima zero-shot della profondità monoculare e delle normali di superficie su diversi dataset: supera i precedenti metodi generativi concorrenti, sia quelli specifici per il compito sia quelli unificati, pur utilizzando molti meno dati di addestramento. In particolare, il nostro metodo compete con gli approcci discriminativi allo stato dell’arte addestrati su una quantità di dati oltre 100 volte maggiore e si distingue persino in diversi benchmark.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv