Ricerca
VidaForge: un’infrastruttura aperta per la ricerca sulle ricette di preparazione dei dati per il preaddestramento su video
I modelli fondativi per i video si affidano sempre più a dati di preaddestramento su larga scala, ma le pipeline complete che li producono restano in gran parte chiuse e difficili da esaminare o riuti

- arXiv
- 2609.06652
- Pubblicato
- 2026-09-06
- Autori
- Yan Ma, Jiadi Su, Zhulin Hu, Ethan Chern, Linhao Zhang, Tiantian Mi, Pengfei Liu
Abstract degli autori
I modelli fondativi per i video si affidano sempre più a dati di preaddestramento su larga scala, ma le pipeline complete che li producono restano in gran parte chiuse e difficili da esaminare o riutilizzare. Chi studia gli effetti delle ricette di preparazione dei dati video sul preaddestramento dei modelli deve spesso costruire un’infrastruttura considerevole prima di poter verificare anche un’ipotesi circoscritta. Presentiamo VIDAFORGE, un’infrastruttura aperta per la ricerca che rappresenta una ricetta di preparazione dei dati video come un flusso di lavoro eseguibile in cinque fasi, dai video grezzi ai dataset di addestramento. Una scelta all’interno di questo flusso può essere modificata per costruire dataset alternativi, conservando le informazioni su come è stato prodotto ogni campione. Per mostrare questo metodo di ricerca, confrontiamo ricette con diversi livelli di copertura e qualità nelle prime fasi del preaddestramento da zero di Wan 2.1 e V-JEPA 2.1. Per entrambi gli obiettivi di apprendimento, la ricetta con la copertura più ampia ottiene i punteggi più alti nei benchmark a valle, mentre la valutazione basata sulla funzione di perdita favorisce ricette diverse. Lo studio mostra come VidaForge colleghi le scelte relative alle ricette di preparazione dei dati alle prestazioni successive dei modelli. Pubblichiamo inoltre VIDAFORGE-3M, che contiene 3,14 milioni di clip a livello di scena, per un totale di 6.475 ore, con annotazioni dettagliate e indicatori per la selezione dei dati destinati alla ricerca sulle ricette di preparazione dei dati video.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv