Ricerca
UltraText Bench: un benchmark bilingue completo per valutare la resa del testo visivo nella generazione di immagini
Il testo visivo denso richiede ai generatori di immagini di riprodurre stringhe lunghe in più aree, collocandole correttamente e rendendole leggibili. Con il miglioramento della resa delle stringhe br

- arXiv
- 2610.09823
- Pubblicato
- 2026-10-07
- Autori
- Deyuan Liu, Yihao Hu, Jingxuan Zhang, Xingying Li, Jun Xie, Jiacheng Liu, Jungang Li, Yu Huang, Xuanyi Liu, Yue Ding, Zecheng Wang, Lei Zhao, Mingda Wang, Zhenglin Cheng, Peng Sun, Tao Lin
Abstract degli autori
Il testo visivo denso richiede ai generatori di immagini di riprodurre stringhe lunghe in più aree, collocandole correttamente e rendendole leggibili. Con il miglioramento della resa delle stringhe brevi, la valutazione deve mettere alla prova la capacità di mantenere le prestazioni in scene più impegnative. Presentiamo UltraText Bench, un benchmark bilingue per la generazione di testo visivo denso a partire dai soli prompt. Comprende 432 prompt distribuiti in 24 categorie di scene del mondo reale e tre livelli di difficoltà, suddivisi in parti uguali tra inglese e cinese. Ogni prompt, esaminato da persone, specifica le stringhe esatte per un numero di aree di testo compreso tra quattro e dodici, insieme a riferimenti strutturati per il contenuto, la collocazione e le caratteristiche visive di ciascuna. Usiamo il modello visione-linguaggio Q-Judger per valutare ogni immagine rispetto al riferimento completo, riportando la fedeltà del testo, la sua leggibilità, la qualità spaziale e la qualità della scena. Nelle 24 configurazioni di modello, queste dimensioni rivelano punti di forza diversi: nelle impostazioni riportate, Z-Image-Turbo guadagna 3,81 punti in leggibilità rispetto a Z-Image-Base, ma ne perde 14,76 in fedeltà. Le prestazioni variano anche in base alla difficoltà del compito: il punteggio composito di Qwen-Image-2512 per l’inglese scende da 86,50 a L1 a 42,86 a L3. Dieci partecipanti hanno preso parte alla valutazione umana dei punteggi automatici. Repository: https://github.com/LINs-lab/UltraText_Bench.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv