Ricerca
OmniCapBench: un quadro di valutazione a struttura profonda per la descrizione audiovisiva dettagliata
I modelli linguistici multimodali di grandi dimensioni (MLLM) si stanno evolvendo rapidamente verso il ragionamento audiovisivo continuo, rendendo urgente disporre di valutazioni che ne mettano in luc
- arXiv
- 2610.12458
- Pubblicato
- 2026-10-08
- Autori
- Zhongyu Yang, Jiale Tao, Ruitao Chen, Zuhao Yang, Yingfang Yuan, Xueliang Zhao, Auden, Kai Wang, Shuai Shao, Biao Wang, Steve Yves, Qinglin Lu
Abstract degli autori
I modelli linguistici multimodali di grandi dimensioni (MLLM) si stanno evolvendo rapidamente verso il ragionamento audiovisivo continuo, rendendo urgente disporre di valutazioni che ne mettano in luce i limiti. La descrizione audiovisiva è un compito diagnostico ideale, ma i benchmark attuali presentano un compromesso: i punteggi assegnati alla descrizione nel suo insieme offrono copertura senza localizzazione, le verifiche locali offrono localizzazione senza copertura e i valutatori LLM privi di vincoli introducono instabilità. Presentiamo OmniCapBench (Omni-Video Caption Benchmark), un benchmark che riformula la valutazione delle descrizioni audiovisive come un quadro diagnostico a struttura profonda. OmniCapBench sposta l’obiettivo della previsione dal testo libero a insiemi di unità di valutazione atomiche e verificabili, articolate in tre ambiti: riferimenti alle entità, inquadrature ed eventi audio. Questo consente di attribuire punteggi affidabili mediante controlli deterministici dei vincoli e confronti semantici localizzati basati su LLM. Con 786 video annotati in modo dettagliato, OmniCapBench distingue efficacemente gli errori di percezione degli MLLM, tra cui i mancati ancoraggi temporali, la deriva dell’identità, il disallineamento tra modalità e le descrizioni inventate. La valutazione degli MLLM più avanzati rivela una buona percezione locale ma una debole capacità di ragionamento audiovisivo su lunghi orizzonti temporali, in particolare per quanto riguarda la deriva dell’identità e il disallineamento tra modalità, offrendo indicazioni dettagliate per lo sviluppo omnimodale.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv