Ricerca
LVSPM: modello per la sintesi di viste da sequenze lunghe e la stima delle pose
Presentiamo LVSPM, un modello generalizzabile che stima congiuntamente le pose delle fotocamere e sintetizza nuove viste a partire da raccolte di immagini non calibrate. Addestrato usando soltanto imm
- arXiv
- 2610.10960
- Pubblicato
- 2026-10-07
- Autori
- Xi Chen, Yachi Zhang, Linghao Chen, Minghua Liu, Hao Su, Zexiang Xu, Xiaoshuai Zhang
Abstract degli autori
Presentiamo LVSPM, un modello generalizzabile che stima congiuntamente le pose delle fotocamere e sintetizza nuove viste a partire da raccolte di immagini non calibrate. Addestrato usando soltanto immagini RGB e supervisione sulle pose, LVSPM non richiede dati 3D di riferimento densi e impiega livelli di test-time training (TTT) per gestire senza difficoltà centinaia di viste in ingresso. Su RealEstate10k, Co3Dv2 e DL3DV, LVSPM supera VGGT nella stima delle pose con 16-256 viste, con margini particolarmente ampi alle soglie più rigorose. Nella sintesi di nuove viste, secondo un protocollo pratico in cui un maggior numero di viste copre scene più ampie, LVSPM raggiunge una qualità allo stato dell’arte senza conoscere le pose — superando persino i modelli che dipendono dalle pose in termini di PSNR — e mantiene una qualità elevata anche al crescere delle dimensioni della scena, mentre le prestazioni dei modelli di riferimento crollano. Il codice è disponibile all’indirizzo https://burningdust21.github.io/Projects/LVSPM .
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv