Vai al contenuto
AI.info

Ricerca

TT-VidT: separare l’asse temporale per un preaddestramento video efficiente incentrato sul movimento

Nel campo dell’apprendimento autosupervisionato sui video, i confronti spesso valutano procedure di addestramento complete anziché isolare il metodo in sé: architettura, funzione obiettivo, esposizion

TT-VidT: separare l’asse temporale per un preaddestramento video efficiente incentrato sul movimento
arXiv
2609.33419
Pubblicato
2026-09-27
Autori
Shih-Ying Yeh, Daniel Z. Kaplan, Xuehai Wang, Fu-En Yang, Min-Hung Chen, Shang-Hong Lai

Abstract degli autori

Nel campo dell’apprendimento autosupervisionato sui video, i confronti spesso valutano procedure di addestramento complete anziché isolare il metodo in sé: architettura, funzione obiettivo, esposizione ai dati, programma di addestramento, scala e capacità del decoder possono variare tutte insieme. Diventa così difficile individuare quali scelte producano rappresentazioni che diano priorità al movimento, con vantaggi concentrati sui cambiamenti da un fotogramma all’altro pur conservando informazioni utili sull’aspetto visivo. Affrontiamo il problema con uno studio comparativo, a parità di condizioni, di $4 \times 6 = 24$ combinazioni di architettura e funzione obiettivo, con encoder di scala compresa all’incirca tra 170M ~ 190M, addestrati per 8 epoche su $\sim$1,7M clip di OpenVid e Moments-in-Time v2, e proponiamo TT-VidT. TT-VidT combina un percorso spaziale ViT-B/16 per ciascun fotogramma, inizializzato con DINOv3, con un Temporal Transfer Layer compatto, addestrato mediante Diff Compression a ricostruire i fotogrammi bersaglio a partire dall’aspetto visivo del primo fotogramma, usato come riferimento, e da token di movimento specifici per ciascun fotogramma. L’esame delle combinazioni mostra che è TT3D con Diff Compression, e non uno dei due componenti da solo, a raggiungere il regime più forte in termini di sensibilità al movimento; gli studi di ablazione sul decoder favoriscono un decoder compatto preaddestrato su video. Nel confronto finale, TT-VidT ottiene contemporaneamente i risultati migliori nel fine-tuning su Jester, Something-Something V2, ARID e Diving48, superando la migliore configurazione non-TT del 54% ~ 121%, con il 48% di FLOPs dell’encoder in meno rispetto a DisMo e il 55% in meno rispetto a VideoMAE o V-JEPA2. HMDB51, IARD ed EPIC-Kitchens delimitano la portata di questa conclusione.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv