Ricerca
HeiCo-FOCUS: un dataset fondato sulla pratica clinica per la comprensione di video con contesti lunghi
I recenti progressi dei modelli visivo-linguistici (VLM) hanno accelerato la comprensione dei video in un’ampia gamma di benchmark. Le valutazioni esistenti, tuttavia, si concentrano in larga misura s

- arXiv
- 2610.10156
- Pubblicato
- 2026-10-07
- Autori
- Leon Mayer, Lucas Luttner, Patrick Godau, Kai Fritzsche, Annika Reinke, Leonie Boland, Jule Brandt, Janne Heinecke, Chloe K. Nobuhara, Niklas Holzwarth, Evangelia Christodoulou, Marcel Knopp, Dominik Michael, Pascale Piermarco, Saliq Neyaz, Korhan Derin Özarslan, Jakob Hennighausen, Carlos Aumente-Maestro, Tim Rädsch, Dheeraj Baji, Peter Maximilian Full, Finn Aichholz, Justus Veit Erpenbeck, Linus Finn Schott, Bastian Winkelhausen, Claas de Boer, Bianca Güttner, Anneli Hummel, Gregor Just, Max Kirchner, Chenyang Li, Rozenn Raffaut, Ariel Rodriguez, Danush Kumar Venkatesh, Kevin Wang, Jinjing Xu, Mona Sheikh Zeinoddin, Salman Khan, Thomas M. Pausch, Stefanie Speidel, Danail Stoyanov, Daniel A. Hashimoto, Fiona R. Kolbinger, Thomas G. Weiser, Lena Maier-Hein
Abstract degli autori
I recenti progressi dei modelli visivo-linguistici (VLM) hanno accelerato la comprensione dei video in un’ampia gamma di benchmark. Le valutazioni esistenti, tuttavia, si concentrano in larga misura sul ragionamento a breve termine e non misurano una capacità cruciale: mantenere una coerenza temporale cumulativa su periodi prolungati. Per colmare questa lacuna, presentiamo HeiCo-FOCUS, un dataset fondato sulla pratica clinica che valuta la comprensione di video con contesti lunghi attraverso il task Foreign Object Contextual Understanding in Surgery. Basato su un dataset di interventi di chirurgia colorettale di Heidelberg, il task richiede ai modelli di seguire continuamente più oggetti mentre vengono inseriti, manipolati, nascosti alla vista e rimossi nel corso di interventi che possono durare ore. HeiCo-FOCUS comprende 30.000 coppie di domande e risposte visive (VQA) relative a cinque capacità fondamentali: riconoscimento degli oggetti, ancoraggio temporale, aggregazione, comprensione degli eventi e delle procedure e ragionamento complesso. Il dataset è stato realizzato mediante un rigoroso processo di annotazione in più fasi, con annotazioni collettive su larga scala e il contributo di 39 esperti di chirurgia, per garantirne l’alta qualità e la rilevanza clinica. Per esaminare sistematicamente il comportamento dei modelli, introduciamo un quadro di valutazione a più percorsi in cui le esigenze temporali e contestuali aumentano progressivamente, dai singoli fotogrammi agli interventi completi. Gli esperimenti condotti con dieci VLM all’avanguardia mostrano che i task di HeiCo-FOCUS sono ancora lontani dall’essere risolti: solo circa la metà dei modelli supera nettamente una baseline basata esclusivamente sul testo. Nei percorsi di valutazione video, i modelli ottengono i risultati migliori nella comprensione degli eventi e delle procedure (accuratezza media: 56,5% considerando tutti i modelli), mentre l’ancoraggio temporale resta particolarmente difficile per tutti i modelli valutati (accuratezza media: 19,7%). Ci aspettiamo quindi che HeiCo-FOCUS favorisca lo sviluppo di modelli capaci di ragionare in modo affidabile e temporalmente coerente su video della durata di ore.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv