Ricerca
GAE: apprendere uno spazio latente a geometria nativa per la generazione di mondi coerenti in 3D
Presentiamo uno spazio latente compatto a geometria nativa, come base condivisa per percezione e generazione. I generatori visivi possono produrre fotogrammi fotorealistici senza mantenere la coerenza

- arXiv
- 2609.24981
- Pubblicato
- 2026-09-21
- Autori
- Jiahao Lu, Minghao Yin, Wenbo Hu, Hengyu Liu, Wang Zhao, Sai-Kit Yeung, Ying Shan, Yuan Liu
Abstract degli autori
Presentiamo uno spazio latente compatto a geometria nativa, come base condivisa per percezione e generazione. I generatori visivi possono produrre fotogrammi fotorealistici senza mantenere la coerenza della scena 3D. Sosteniamo che non si tratti solo di un problema di modellazione, ma anche di rappresentazione: in genere, i generatori sviluppano latenti incentrati sull’aspetto, mentre i modelli di percezione ricostruiscono la geometria in uno spazio semanticamente ricco, che codifica la struttura tra le diverse viste. Invece di aggiungere la geometria come un ulteriore output, riparametrizziamo le feature di un modello fondazionale per la geometria in uno spazio latente compatto destinato alla generazione. Realizziamo questo cambiamento con l’autoencoder a geometria nativa (GAE), il cui spazio latente può essere decodificato congiuntamente in aspetto, profondità, camere e mappe di punti. Con questa rappresentazione, un normale flow condizionale supporta diversi compiti di generazione. Nei confronti controllati, a parità di generatore e protocollo di addestramento, sostituire lo spazio latente con GAE migliora sia la qualità visiva sia la coerenza 3D, misurata in modo indipendente: l’FVD diminuisce del $12.7\%$ e del $23.1\%$ rispettivamente su RealEstate10K e DL3DV, mentre l’errore della traiettoria della camera si dimezza su RealEstate10K. Nel complesso, questi risultati mostrano che lo spazio latente è fondamentale per la generazione coerente in 3D e può fungere da interfaccia condivisa tra percezione e generazione.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv