Ricerca
Un benchmark in continua evoluzione per il recupero delle informazioni dalle cartelle cliniche elettroniche
Gli assistenti clinici basati su modelli linguistici di grandi dimensioni (LLM) vengono integrati sempre più spesso nei sistemi di cartelle cliniche elettroniche (EHR), trasformando il modo in cui i m

- arXiv
- 2609.30205
- Pubblicato
- 2026-09-24
- Autori
- Jordan L. Cahoon, Chloe O. Stanwyck, Sulaiman Somani, Philip Chung, Kevin R Keet, Kameron C. Black, Andrea T. Fisher, Sarita Khemani, Jerry Liu, Stephen Ma, Saloni K. Maharaj, Rita M. Pandya, Eduardo Perez-Guerrero, Priyanka Pillai, Lisa Shieh, David J. H. Wu, James Xie, James C. McAvoy, Teresa Nguyen, Jessica Tran, Lucy Yin, Bridget Lin, Alison Callahan, Jason A. Fries, Nigam H. Shah, Emily Alsentzer
Abstract degli autori
Gli assistenti clinici basati su modelli linguistici di grandi dimensioni (LLM) vengono integrati sempre più spesso nei sistemi di cartelle cliniche elettroniche (EHR), trasformando il modo in cui i medici recuperano e sintetizzano le informazioni contenute nelle cartelle dei pazienti. La loro sicurezza e utilità dipendono da valutazioni rigorose; tuttavia, i benchmark esistenti sono curati manualmente, costosi da aggiornare e diventano rapidamente obsoleti con l’evolversi della tecnologia. Presentiamo un framework scalabile che genera automaticamente coppie domanda-risposta a partire da note longitudinali delle cartelle cliniche elettroniche. Diciannove medici convalidano il generatore di benchmark, dando origine al Benchmark for Retrieving Information in EHRs (BRIE), un dataset di valutazione che può essere aggiornato in modo continuativo. Nell’ambito di nove LLM e cinque strategie di inferenza, i sistemi all’avanguardia omettono spesso informazioni clinicamente importanti, soprattutto quando le domande richiedono di sintetizzare contenuti tratti da più documenti e incontri clinici. Poiché il generatore stesso è convalidato, BRIE consente valutazioni che i benchmark statici non permettono, tra cui la generazione di più risposte che rispecchiano le variazioni nel ragionamento dei medici, per una valutazione solida delle prestazioni, e l’aggiornamento continuo dei contenuti del benchmark per prevenire la contaminazione. I nostri risultati dimostrano che la generazione scalabile di benchmark consente una valutazione rigorosa e aggiornata degli LLM clinici, man mano che vengono utilizzati in contesti sanitari in rapida evoluzione.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv