Ricerca
TrackEverything: tracciamento denso su lunghi orizzonti mediante deduplicazione delle rappresentazioni 3D della scena
I modelli esistenti per il tracciamento dei punti devono affrontare un compromesso fondamentale: possono seguire un insieme sparso di punti di interrogazione su lunghi orizzonti temporali, oppure segu

- arXiv
- 2609.30222
- Pubblicato
- 2026-09-24
- Autori
- Ayush Jain, Sreeharsha Paruchuri, Ishita Gupta, Fan Zhang, Tanner Schmidt, Jakob Engel, Katerina Fragkiadaki, Adam W. Harley
Abstract degli autori
I modelli esistenti per il tracciamento dei punti devono affrontare un compromesso fondamentale: possono seguire un insieme sparso di punti di interrogazione su lunghi orizzonti temporali, oppure seguire tutti i punti, ma solo in clip brevi. Presentiamo TrackEverything, un tracker di punti 3D che supera questo compromesso rappresentando i video come tracce 3D persistenti della scena nelle coordinate del mondo. Partendo dalla constatazione che i video sono proiezioni 2D di un mondo 3D sottostante, TrackEverything rende la complessità del modello indipendente dalla durata del video, facendola dipendere invece dalla geometria fisica distinta della scena. Il nostro approccio introduce tre innovazioni principali. In primo luogo, ai confini delle finestre scorrevoli impieghiamo un meccanismo di deduplicazione basato sulla voxelizzazione per unire le tracce che occupano la stessa posizione, impedendo che le osservazioni ripetute della stessa superficie si accumulino in modo ridondante. In secondo luogo, suddividiamo il tracciamento in un modulo di affinamento del punto finale, che predice la destinazione di ciascun punto e lo classifica come statico o dinamico, seguito da un modulo leggero di affinamento delle traiettorie, che ricostruisce traiettorie dense esclusivamente per i punti dinamici. In terzo luogo, proponiamo 3D WAFT, che sostituisce i volumi di correlazione 4D, proibitivi in termini di memoria, con un campionamento efficiente delle caratteristiche nella nuvola della scena. Per quanto ne sappiamo, TrackEverything è il primo tracker 3D in grado di seguire tutti i punti visibili in video di oltre 1000 fotogrammi restando entro 40 GB di memoria GPU. Su TAPVid-3D, TrackEverything supera di oltre il 20% in termini di APD tutti i tracker 3D densi open source che coprono tutti i fotogrammi nelle clip brevi, pur rimanendo competitivo con i tracker sparsi più avanzati sulle sequenze lunghe, nonostante segua molti più punti.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv