Ricerca
GeoVerse: sintesi di nuove viste coerenti con il mondo nello spazio latente geometrico
La sintesi di nuove viste a partire da immagini sparse deve conciliare la ricostruzione fedele delle regioni osservate con un completamento plausibile dei contenuti non visibili, mantenendo la coerenz

- arXiv
- 2609.35734
- Pubblicato
- 2026-09-28
- Autori
- Kerui Ren, Tao Lu, Linning Xu, Changjian Jiang, Mu Huang, Chunhua Shen, Mulin Yu, Bo Dai
Abstract degli autori
La sintesi di nuove viste a partire da immagini sparse deve conciliare la ricostruzione fedele delle regioni osservate con un completamento plausibile dei contenuti non visibili, mantenendo la coerenza del mondo tra i diversi punti di vista. I metodi esistenti basati sulla geometria preservano la struttura osservata della scena, ma spesso faticano a completare le regioni non visibili. I modelli generativi video, invece, offrono ricche informazioni a priori sull’aspetto, ma accumulano incoerenze quando generano le viste in sequenza. Proponiamo GeoVerse, un framework che sintetizza nuove viste coerenti con il mondo effettuando la generazione nello spazio latente geometrico di un foundation model 3D preaddestrato e integrando informazioni a priori sull’aspetto provenienti da un modello generativo video. In particolare, GeoVerse estrae caratteristiche a più livelli da Wan2.2 VACE e le integra nel modello di diffusione nello spazio latente geometrico tramite un adattatore in stile ControlNet, sfruttando le informazioni a priori sull’aspetto apprese dai video per migliorare il completamento strutturale. Per garantire la coerenza tra le viste, una memoria spaziale globale aggrega continuamente i contenuti osservati e sintetizzati, riproiettando indicazioni allineate alla vista di destinazione per ancorare le previsioni successive a una rappresentazione condivisa della scena. Esperimenti approfonditi su diversi dataset mostrano una migliore qualità visiva e una maggiore coerenza geometrica, con un PSNR superiore di 2,23 dB su DL3DV e un ATE inferiore del 32,4% su Mip-NeRF360 rispetto a GLD.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv