Ricerca
Ripensare il contesto locale per la ricostruzione 3D in streaming su lunghi orizzonti temporali
La ricostruzione 3D in streaming da video estremamente lunghi richiede di stimare online il movimento della fotocamera e la geometria della scena con memoria e capacità di calcolo limitate. I primi mo

- arXiv
- 2608.27529
- Pubblicato
- 2026-08-27
- Autori
- Jiarong Han, Jincheng Xiong, Yuzhou Liu, Linzhe Shi, Changjie Wu, Ning Guo, Mu Xu, Hang Zhang, Ming Qian
Abstract degli autori
La ricostruzione 3D in streaming da video estremamente lunghi richiede di stimare online il movimento della fotocamera e la geometria della scena con memoria e capacità di calcolo limitate. I primi modelli di streaming consentono un’inferenza causale a costo limitato usando buffer di contesto finiti o stati ricorrenti compatti, ma le loro stime spesso peggiorano con l’allungarsi delle sequenze. I metodi recenti migliorano la stabilità su lunghi orizzonti temporali combinando il contesto a breve termine con una memoria persistente o articolata su più livelli a lungo termine. Noi seguiamo una strada diversa: manteniamo lo stato temporale appreso strettamente locale e formuliamo previsioni i cui obiettivi restano indipendenti dalla lunghezza della sequenza. Presentiamo ABot-Recon, un semplice modello di streaming che conserva nella cache le caratteristiche KV dei soli 11 fotogrammi precedenti. Il modello predice una mappa di punti nel sistema di coordinate della fotocamera corrente e una posa relativa tra fotogrammi adiacenti. Queste previsioni restano equivarianti rispetto ai cambiamenti del sistema di riferimento, mentre le pose globali e la geometria vengono ricavate mediante composizione sequenziale. Per ridurre la deriva accumulata, un leggero modulo di raffinamento temporale migliora le rotazioni relative usando il contesto visivo e di movimento recente, mentre una funzione di perdita sulla posa che tiene conto della composizione supervisiona la composizione delle pose su più passaggi. Valutazioni approfondite su benchmark impegnativi con sequenze lunghe dimostrano le prestazioni superiori del nostro approccio basato sul contesto locale su lunghi orizzonti temporali. Su Oxford Spires, ABot-Recon raggiunge un ATE di 4,35 m e un RPE-R di $0.12^\circ$, riducendo entrambi gli errori di circa 40\% rispetto ai migliori risultati precedenti.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv