Vai al contenuto
AI.info

Ricerca

VTR-Bench: un benchmark sistematico per valutare la resa visiva del testo nella generazione di video

I recenti modelli di generazione video possono produrre, a partire da istruzioni in linguaggio naturale, video molto realistici, con una qualità visiva che si avvicina agli standard cinematografici. I

VTR-Bench: un benchmark sistematico per valutare la resa visiva del testo nella generazione di video
arXiv
2610.01499
Pubblicato
2026-10-01
Autori
Yu Huang, Jungang Li, Zhiyuan Wang, Yonghua Hei, Song Dai, Jiayu Yang, Deyuan Liu, Xiang Zheng, Xiaoshuang Shi, Hao Cheng, Kaidi Xu

Abstract degli autori

I recenti modelli di generazione video possono produrre, a partire da istruzioni in linguaggio naturale, video molto realistici, con una qualità visiva che si avvicina agli standard cinematografici. I benchmark esistenti, tuttavia, valutano soprattutto la qualità visiva, l’attrattiva estetica e la plausibilità fisica, dedicando poca attenzione al testo, un mezzo essenziale per comunicare informazioni nelle scene quotidiane. Un video generato può risultare visivamente convincente e mostrare soggetti realistici, ma rappresentare comunque in modo errato il testo presente nella scena. Per affrontare questo aspetto trascurato, presentiamo \textbf{VTR-Bench}, un benchmark sistematico per valutare le capacità di \textbf{V}isual \textbf{T}ext \textbf{R}endering dei modelli di generazione video. VTR-Bench colloca il testo in scenari applicativi concreti, come pubblicità e video scientifici, con 300 prompt costruiti con cura e distribuiti in cinque categorie di scenari. Sviluppiamo una procedura di valutazione automatizzata, allineata ai giudizi umani, che valuta separatamente la fedeltà del testo mediante una trascrizione specifica per il supporto su cui compare e i requisiti relativi alla scena e al movimento mediante una catena di interrogazioni specifica per ciascun prompt. Oltre alla valutazione, presentiamo un \textbf{Keyframe-Guided Agentic Framework} in cui un agente Director coordina la generazione di immagini e video con la valutazione visiva, guidando il perfezionamento iterativo e la selezione delle proposte attraverso il feedback visivo. Esperimenti condotti su 11 modelli all’avanguardia rivelano difficoltà diffuse nel rappresentare correttamente il testo nelle scene: il modello con i risultati migliori registra un tasso complessivo di errore sulle parole (WER) pari a 0,250. Analizziamo inoltre gli errori nella resa del testo per caratterizzare le sfide che gli attuali modelli di generazione video devono affrontare. Questi risultati evidenziano che la resa visiva del testo è una sfida fondamentale per la generazione video e mostrano una via praticabile per migliorarla. Il codice è disponibile all’indirizzo https://github.com/hardenyu21/VTR-Bench.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv