Vai al contenuto
AI.info

Ricerca

Scal3R: apprendere interrogazioni efficienti sulle pose relative a più riferimenti per una ricostruzione 3D online scalabile

I modelli di ricostruzione 3D online ottengono risultati scadenti sui video lunghi. Questo accade perché stimare le pose rispetto a un riferimento fisso costituito dal primo fotogramma impone di estra

Scal3R: apprendere interrogazioni efficienti sulle pose relative a più riferimenti per una ricostruzione 3D online scalabile
arXiv
2609.04201
Pubblicato
2026-09-03
Autori
Chin-Yang Lin, Yang-Che Sun, Cheng Sun, Fu-En Yang, Min-Hung Chen, Yen-Yu Lin, Wei-Chen Chiu, Yu-Lun Liu

Abstract degli autori

I modelli di ricostruzione 3D online ottengono risultati scadenti sui video lunghi. Questo accade perché stimare le pose rispetto a un riferimento fisso costituito dal primo fotogramma impone di estrapolare ben oltre la distribuzione dei dati di addestramento. Piccole derive si accumulano e si amplificano fino a provocare un marcato collasso geometrico. Osserviamo però che, anche quando questo accade, la profondità stimata per ciascun fotogramma rimane stabile. La geometria locale del backbone resta intatta: è solo il componente che stima la posa globale a cedere. Questa distinzione ci ha spinto a sviluppare Scal3R, che riformula la ricostruzione online come interrogazione delle pose relative rispetto a più riferimenti. Utilizziamo token leggeri e apprendibili, che rappresentano circa l’1% dei parametri, e li inseriamo in un backbone completamente congelato tramite un meccanismo di attenzione asimmetrica. Questa configurazione permette di interrogare le pose rispetto a più fotogrammi chiave precedenti. Un sistema online di ottimizzazione del grafo delle pose con chiusura dei loop riduce la deriva a lungo raggio. Scal3R converge in 8 ore su una sola GPU. Su KITTI riduce l’ATE medio di oltre il 60% rispetto al modello di riferimento online. Ottiene inoltre prestazioni allo stato dell’arte su Virtual KITTI, Sintel, TUM-Dynamic, ScanNet e 7-Scenes. Pagina del progetto: https://linjohnss.github.io/scal3r/

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv