Ricerca
Individuare qualsiasi cosa nei video: ripensare la localizzazione spazio-temporale generativa efficiente
La localizzazione spazio-temporale nei video (STVG) richiede ai modelli di individuare quando si verifica un evento a cui si fa riferimento e di localizzare l’entità bersaglio per tutta la durata dell

- arXiv
- 2608.28192
- Pubblicato
- 2026-08-28
- Autori
- Hanoona Rasheed, Haania Siddiqui, Ming-Hsuan Yang, Fahad Shahbaz Khan, Salman Khan
Abstract degli autori
La localizzazione spazio-temporale nei video (STVG) richiede ai modelli di individuare quando si verifica un evento a cui si fa riferimento e di localizzare l’entità bersaglio per tutta la durata dell’intervallo. I modelli linguistici multimodali di grandi dimensioni esistenti serializzano in genere traiettorie dense di localizzazione in modo autoregressivo: la latenza di decodifica cresce così con la lunghezza del tubo spazio-temporale e gli errori di localizzazione possono propagarsi nel tempo. Presentiamo Parallel Tube Decoding (PTD), una formulazione generativa che suddivide la localizzazione in un blocco temporale seguito da blocchi spaziali condizionati dal tempo e decodificati simultaneamente. Questo elimina le dipendenze sia a livello di token sia a livello di traiettoria, riducendo la profondità della decodifica sequenziale a $1 + 1$ passaggi fissi, indipendentemente dalla lunghezza del tubo spazio-temporale. Per consentire la generazione spaziale parallela, introduciamo Decoupled Block Attention, che mantiene l’accesso al contesto condiviso del video e della query eliminando le dipendenze tra riquadri, insieme a un’ottimizzazione della policy che tiene conto della localizzazione per i confini temporali e la geometria spaziale. Su VidSTG, PTD riduce la Tube Completion Latency di 79 volte e aumenta il throughput della decodifica spaziale di 92 volte rispetto alla decodifica autoregressiva standard, migliorando al contempo l’accuratezza della localizzazione. Con un backbone compatto da 4B, il nostro modello ottiene buoni risultati su VidSTG e HC-STVG e si generalizza in modalità zero-shot alla localizzazione temporale, alla VideoQA con localizzazione e al tracciamento di oggetti nei video a partire da riferimenti linguistici. I nostri risultati mostrano che la generazione parallela di tubi spazio-temporali è un’alternativa efficiente ed efficace alla localizzazione autoregressiva nei video.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv