Ricerca
OpenTumorBoard: un benchmark basato su dati reali delle traiettorie di discussione dei comitati oncologici multidisciplinari
I comitati oncologici multidisciplinari integrano osservazioni cliniche multimodali e storie cliniche longitudinali dei pazienti attraverso il confronto tra specialisti, ma i benchmark raramente colgo

- arXiv
- 2609.32810
- Pubblicato
- 2026-09-26
- Autori
- Anqi Li, Zhixuan Ge, Yixuan Duan, Jiarong Qian, Chi-Yu Chen, MingYu Lu, Huan-Yu Hsu, Yu Gu, Yue Guo, Sheng Wang, Wei Qiu, Hanwen Xu
Abstract degli autori
I comitati oncologici multidisciplinari integrano osservazioni cliniche multimodali e storie cliniche longitudinali dei pazienti attraverso il confronto tra specialisti, ma i benchmark raramente colgono queste traiettorie di discussione reali. Presentiamo OpenTumorBoard, un benchmark che comprende 611 casi di pazienti e 19.157 interventi nelle discussioni, distribuiti tra dieci ruoli specialistici e trascritti da 12.534 minuti di registrazioni di comitati oncologici pubblicamente disponibili su YouTube. Il benchmark valuta due scenari: SPECIALIST TURN, in cui un LLM risponde a una domanda clinicamente rilevante posta durante una discussione reale, e BOARD SIMULATION, in cui genera un’intera discussione con scambi tra specialisti e raggiunge un consenso su raccomandazioni terapeutiche, piani chirurgici, azioni successive e abbinamento ai trial clinici. La valutazione di 14 LLM generalisti all’avanguardia e medici rivela limiti sostanziali: i modelli migliori ottengono 3,43 su 5 per l’equivalenza clinica con le risposte degli specialisti e 2,78 su 5 per la concordanza con le conclusioni registrate del comitato. Il fine-tuning supervisionato e l’apprendimento per rinforzo migliorano le prestazioni su un set di test tenuto da parte, suggerendo che le traiettorie delle discussioni reali possono contribuire all’adattamento dei modelli. Tre medici esperti esaminano un sottoinsieme del benchmark e riscontrano un’elevata copertura delle informazioni e accuratezza fattuale nei casi dei pazienti, oltre a una forte fedeltà delle conclusioni consensuali estratte. Renderemo disponibili OpenTumorBoard e la relativa pipeline di raccolta e preparazione automatizzata dei dati per sostenere lo sviluppo e la valutazione di LLM destinati alle decisioni oncologiche multidisciplinari e personalizzate.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv