Vai al contenuto
AI.info

Ricerca

LVSPM: modello per la sintesi di viste da sequenze lunghe e la stima delle pose

Presentiamo LVSPM, un modello generalizzabile che stima congiuntamente le pose delle fotocamere e sintetizza nuove viste a partire da raccolte di immagini non calibrate. Addestrato usando soltanto imm

arXiv
2610.10960
Pubblicato
2026-10-07
Autori
Xi Chen, Yachi Zhang, Linghao Chen, Minghua Liu, Hao Su, Zexiang Xu, Xiaoshuai Zhang

Abstract degli autori

Presentiamo LVSPM, un modello generalizzabile che stima congiuntamente le pose delle fotocamere e sintetizza nuove viste a partire da raccolte di immagini non calibrate. Addestrato usando soltanto immagini RGB e supervisione sulle pose, LVSPM non richiede dati 3D di riferimento densi e impiega livelli di test-time training (TTT) per gestire senza difficoltà centinaia di viste in ingresso. Su RealEstate10k, Co3Dv2 e DL3DV, LVSPM supera VGGT nella stima delle pose con 16-256 viste, con margini particolarmente ampi alle soglie più rigorose. Nella sintesi di nuove viste, secondo un protocollo pratico in cui un maggior numero di viste copre scene più ampie, LVSPM raggiunge una qualità allo stato dell’arte senza conoscere le pose — superando persino i modelli che dipendono dalle pose in termini di PSNR — e mantiene una qualità elevata anche al crescere delle dimensioni della scena, mentre le prestazioni dei modelli di riferimento crollano. Il codice è disponibile all’indirizzo https://burningdust21.github.io/Projects/LVSPM .

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv