Vai al contenuto
AI.info

Ricerca

TempCloze: i Video-LLM sanno individuare la parte centrale mancante?

I benchmark di ragionamento temporale per i Video-LLM passano spesso attraverso il linguaggio, lasciando spazio a scorciatoie linguistiche basate sulla formulazione delle opzioni, sulle correlazioni t

TempCloze: i Video-LLM sanno individuare la parte centrale mancante?
arXiv
2609.01515
Pubblicato
2026-09-01
Autori
Wenqi Pei, Henry Hengyuan Zhao, Yilai Liu, Jiahao Meng, Han Chen, Ziyu Wang, Hongyang Du

Abstract degli autori

I benchmark di ragionamento temporale per i Video-LLM passano spesso attraverso il linguaggio, lasciando spazio a scorciatoie linguistiche basate sulla formulazione delle opzioni, sulle correlazioni tra le risposte o su conoscenze linguistiche a priori. Per ridurre queste scorciatoie, presentiamo TempCloze, un benchmark di completamento video per valutare il ragionamento temporale visivo dei Video-LLM. Date le clip iniziale e finale di un video, i modelli devono individuare la vera parte centrale mancante tra quattro candidate. TempCloze contiene 1.521 video accuratamente selezionati da sette fonti, principalmente video girati in piano sequenza e in prima persona. Costruiamo alternative errate tratte dalla stessa fonte lungo tre dimensioni: Semantic chiede quale evento dovrebbe verificarsi, Alignment verifica quando dovrebbe verificarsi e Progression mette alla prova la capacità di stabilire come dovrebbe svolgersi; scene e oggetti condivisi riducono gli indizi legati all’aspetto visivo. La nostra valutazione di 10 Video-LLM proprietari e 21 open source rivela che Alignment è il principale ostacolo: i modelli spesso riconoscono contenuti semanticamente plausibili e la progressione locale degli eventi, ma faticano ad allinearli nel tempo. Conduciamo inoltre analisi degli schemi di errore e della sensibilità del comportamento su TempCloze-Mixed e TempCloze-Hard, usando quattro modelli rappresentativi per esaminare dove insorgono gli errori e in che modo l’ordine delle alternative, la direzione del contesto, l’intervallo visibile, la densità dei fotogrammi e lo scaling in fase di test influenzano le scelte dei modelli.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv