Ricerca
OmniVBench: un benchmark e un dataset su larga scala per la generazione di video da riferimenti omni
La generazione reference-to-video (R2V) si sta evolvendo verso un controllo dei riferimenti sempre più generale e versatile, dando origine al paradigma emergente della generazione omni R2V. I benchmar

- arXiv
- 2609.22069
- Pubblicato
- 2026-09-18
- Autori
- Wenxue Li, Peiyan Guan, Haoyang Jiang, Junxian Cai, Hualuo Liu, Chunjie Zhang, Chong Guan, Songlian Li, Taiyi Wu, Yongjian Yu, Xiaotong Zhao, Alan Zhao, Eric Liu, Xi Chen, Yu Liu, Lei Zhu
Abstract degli autori
La generazione reference-to-video (R2V) si sta evolvendo verso un controllo dei riferimenti sempre più generale e versatile, dando origine al paradigma emergente della generazione omni R2V. I benchmark esistenti, tuttavia, non sono all’altezza di queste nuove capacità: i casi di test coprono tipologie e composizioni di riferimenti limitate, mentre i protocolli di valutazione esaminano soprattutto la coerenza complessiva con i riferimenti, trascurando se i fattori di riferimento siano preservati e disambiguati correttamente e indirizzati agli elementi giusti. Nel frattempo, l’alto costo di costruzione dei dati di addestramento per l’omni R2V rende scarse le risorse adatte. Per colmare queste lacune, presentiamo OmniVBench e il dataset Omni-R2V, destinati alla valutazione e all’addestramento di modelli omni R2V. OmniVBench amplia la valutazione R2V includendo una maggiore varietà di tipologie di riferimenti, compiti di controllo più granulari e composizioni di riferimenti più articolate, con 7 famiglie di compiti e 18 compiti granulari che spaziano tra contenuti, movimento, stile, struttura, narrazione e scenari con riferimenti multipli. Introduciamo una valutazione basata sui fattori, con 12.172 voci di checklist specifiche per ciascun caso, per verificare se i fattori di riferimento previsti siano preservati fedelmente, disambiguati correttamente e associati ai rispettivi elementi, nonché realizzati nel modo richiesto dall’istruzione. Presentiamo inoltre il dataset Omni-R2V, che mette a disposizione della comunità di ricerca più ampia risorse di addestramento di livello industriale per diverse attività R2V. Attingendo principalmente a un corpus su larga scala di filmati video professionali, il dataset comprende 340 mila campioni di addestramento elaborati, che coprono diverse tipologie di riferimenti e composizioni con riferimenti multipli. Sviluppiamo pipeline specifiche per ciascun compito per costruire coppie di riferimenti e obiettivi, offrendo una procedura pratica e scalabile per la creazione di dati omni R2V. La valutazione approfondita di modelli R2V avanzati, open source e a codice chiuso, rivela in OmniVBench chiare differenze di prestazioni tra le famiglie di compiti e le dimensioni di valutazione, mettendo in luce i limiti ancora presenti nei modelli R2V attuali.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv