Vai al contenuto
AI.info

Ricerca

GAE: apprendere uno spazio latente a geometria nativa per la generazione di mondi coerenti in 3D

Presentiamo uno spazio latente compatto a geometria nativa, come base condivisa per percezione e generazione. I generatori visivi possono produrre fotogrammi fotorealistici senza mantenere la coerenza

GAE: apprendere uno spazio latente a geometria nativa per la generazione di mondi coerenti in 3D
arXiv
2609.24981
Pubblicato
2026-09-21
Autori
Jiahao Lu, Minghao Yin, Wenbo Hu, Hengyu Liu, Wang Zhao, Sai-Kit Yeung, Ying Shan, Yuan Liu

Abstract degli autori

Presentiamo uno spazio latente compatto a geometria nativa, come base condivisa per percezione e generazione. I generatori visivi possono produrre fotogrammi fotorealistici senza mantenere la coerenza della scena 3D. Sosteniamo che non si tratti solo di un problema di modellazione, ma anche di rappresentazione: in genere, i generatori sviluppano latenti incentrati sull’aspetto, mentre i modelli di percezione ricostruiscono la geometria in uno spazio semanticamente ricco, che codifica la struttura tra le diverse viste. Invece di aggiungere la geometria come un ulteriore output, riparametrizziamo le feature di un modello fondazionale per la geometria in uno spazio latente compatto destinato alla generazione. Realizziamo questo cambiamento con l’autoencoder a geometria nativa (GAE), il cui spazio latente può essere decodificato congiuntamente in aspetto, profondità, camere e mappe di punti. Con questa rappresentazione, un normale flow condizionale supporta diversi compiti di generazione. Nei confronti controllati, a parità di generatore e protocollo di addestramento, sostituire lo spazio latente con GAE migliora sia la qualità visiva sia la coerenza 3D, misurata in modo indipendente: l’FVD diminuisce del $12.7\%$ e del $23.1\%$ rispettivamente su RealEstate10K e DL3DV, mentre l’errore della traiettoria della camera si dimezza su RealEstate10K. Nel complesso, questi risultati mostrano che lo spazio latente è fondamentale per la generazione coerente in 3D e può fungere da interfaccia condivisa tra percezione e generazione.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv