Vai al contenuto
AI.info

Ricerca

GeoVerse: sintesi di nuove viste coerenti con il mondo nello spazio latente geometrico

La sintesi di nuove viste a partire da immagini sparse deve conciliare la ricostruzione fedele delle regioni osservate con un completamento plausibile dei contenuti non visibili, mantenendo la coerenz

GeoVerse: sintesi di nuove viste coerenti con il mondo nello spazio latente geometrico
arXiv
2609.35734
Pubblicato
2026-09-28
Autori
Kerui Ren, Tao Lu, Linning Xu, Changjian Jiang, Mu Huang, Chunhua Shen, Mulin Yu, Bo Dai

Abstract degli autori

La sintesi di nuove viste a partire da immagini sparse deve conciliare la ricostruzione fedele delle regioni osservate con un completamento plausibile dei contenuti non visibili, mantenendo la coerenza del mondo tra i diversi punti di vista. I metodi esistenti basati sulla geometria preservano la struttura osservata della scena, ma spesso faticano a completare le regioni non visibili. I modelli generativi video, invece, offrono ricche informazioni a priori sull’aspetto, ma accumulano incoerenze quando generano le viste in sequenza. Proponiamo GeoVerse, un framework che sintetizza nuove viste coerenti con il mondo effettuando la generazione nello spazio latente geometrico di un foundation model 3D preaddestrato e integrando informazioni a priori sull’aspetto provenienti da un modello generativo video. In particolare, GeoVerse estrae caratteristiche a più livelli da Wan2.2 VACE e le integra nel modello di diffusione nello spazio latente geometrico tramite un adattatore in stile ControlNet, sfruttando le informazioni a priori sull’aspetto apprese dai video per migliorare il completamento strutturale. Per garantire la coerenza tra le viste, una memoria spaziale globale aggrega continuamente i contenuti osservati e sintetizzati, riproiettando indicazioni allineate alla vista di destinazione per ancorare le previsioni successive a una rappresentazione condivisa della scena. Esperimenti approfonditi su diversi dataset mostrano una migliore qualità visiva e una maggiore coerenza geometrica, con un PSNR superiore di 2,23 dB su DL3DV e un ATE inferiore del 32,4% su Mip-NeRF360 rispetto a GLD.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv