Ricerca
Ho un flusso: far funzionare l’apprendimento autosupervisionato sui video continui
L’apprendimento autosupervisionato si ispira allo sviluppo visivo dei neonati, eppure le procedure di addestramento standard gli somigliano ben poco: le immagini vengono campionate indipendentemente e

- arXiv
- 2609.40333
- Pubblicato
- 2026-09-30
- Autori
- Ivan Martinović, Lukas Knobel, Yuki M. Asano
Abstract degli autori
L’apprendimento autosupervisionato si ispira allo sviluppo visivo dei neonati, eppure le procedure di addestramento standard gli somigliano ben poco: le immagini vengono campionate indipendentemente e rimescolate globalmente a ogni epoca. Studiamo l’apprendimento autosupervisionato da flussi video continui, in cui i fotogrammi vengono elaborati in ordine temporale usando batch a finestra mobile rigorosa, senza rimescolamento globale né ripetizione su più epoche. A questo scopo realizziamo WT++, un dataset di video di passeggiate urbane della durata complessiva di 95 ore, destinato al preaddestramento su flussi continui. Attraverso un insieme completo di valutazioni, constatiamo che i metodi contrastivi e quelli basati sulla distillazione incontrano difficoltà in questo contesto, mentre MAE è più robusto ma resta comunque al di sotto del preaddestramento standard i.i.d. Rileviamo che l’elevata somiglianza tra batch, causata dall’uso della finestra mobile in batch consecutivi, non spiega questo divario. La difficoltà principale è l’elevata somiglianza all’interno dei batch: i fotogrammi di ciascun batch sono quasi duplicati. Per attenuare il problema proponiamo StreamMAE, che conserva l’obiettivo fondamentale di ricostruzione di MAE, adattando al contempo la procedura di preparazione degli input con una regolarizzazione che tiene conto del flusso e una selezione dei ritagli orientata al movimento. StreamMAE supera le prestazioni dei metodi di riferimento per i flussi continui, eguaglia quelle di MAE addestrato con dati i.i.d. sugli stessi video, rimane competitivo rispetto a MAE preaddestrato su ImageNet e migliora le proprie prestazioni man mano che la durata del flusso di preaddestramento cresce da 12 a 95 ore.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv