Vai al contenuto
AI.info

Ricerca

VGGT-Diff: la geometria visiva incontra la diffusione per la sintesi di nuove viste a partire da poche viste

Presentiamo VGGT-Diff, un modello di diffusione multivista guidato dalla geometria per la sintesi di nuove viste a partire da poche viste. I metodi esistenti per la sintesi di nuove viste (NVS) devono

VGGT-Diff: la geometria visiva incontra la diffusione per la sintesi di nuove viste a partire da poche viste
arXiv
2609.33253
Pubblicato
2026-09-27
Autori
Kangjie Chen, Xiangyu Li, Dongbin Zhang, Chaoda Zheng, Shijia Chen, Jinhao Deng, Hongbin Lin, Choo Sin Wai, Minqi Wang, Minghao Yang, Dake Zhong, Guorui Song, Yu Zhang, Xianming Liu, Boyang Wang

Abstract degli autori

Presentiamo VGGT-Diff, un modello di diffusione multivista guidato dalla geometria per la sintesi di nuove viste a partire da poche viste. I metodi esistenti per la sintesi di nuove viste (NVS) devono affrontare un compromesso fondamentale: quelli basati sulla ricostruzione preservano la geometria osservata, ma faticano a sintetizzare le regioni non visibili; quelli basati sulla diffusione dispongono di solide conoscenze generative pregresse, ma si affidano a una corrispondenza implicita tra le viste sorgente e quelle richieste. VGGT-Diff colma il divario tra i due approcci convogliando le rappresentazioni latenti della geometria visiva di VGGT-Ω in un modello di diffusione video preaddestrato. A ogni token visivo sono associati un punto 3D e un valore di confidenza; il Visual Geometry Router (VGR), che tiene conto della confidenza e preserva le informazioni sulle superfici anteriori e posteriori, trasforma poi i token in condizioni latenti allineate alle viste richieste. Queste condizioni guidano il denoising congiunto delle viste bersaglio, mentre Point-Track Residual Consistency (PTRC) regolarizza i residui delle stime del dato pulito lungo traiettorie 3D affidabili, migliorando la stabilità tra le viste. Introduciamo inoltre un condizionamento geometrico robusto, che combina la regolarizzazione durante l’addestramento con una guida in fase di inferenza per migliorare la robustezza. Gli esperimenti mostrano prestazioni competitive o allo stato dell’arte sia nell’interpolazione sia nell’estrapolazione, con diversi gradi di difficoltà dei punti di vista. Il nostro codice è disponibile all’indirizzo https://github.com/chenkangjie1123/VGGT-Diff.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv