Vai al contenuto
AI.info

The Pulse

RADAR ottiene un’AUC di 0,913 su 146 reperti alla TC addominale

Uno studio pubblicato su <em>Science</em> valuta RADAR, un modello di IA generalista per la diagnosi tramite TC addominale, su 146 reperti e in diversi contesti clinici.

RADAR ottiene un’AUC di 0,913 su 146 reperti alla TC addominale

AI.info Team ·

RADAR raggiunge un’area media sotto la curva di 0,913 su 146 reperti alla TC addominale, secondo uno studio pubblicato il 17 settembre 2026 su Science. Il punteggio è superiore a 0,776, ottenuto dal migliore modello concorrente di visione-linguaggio, con un ampio margine nei test condotti su diverse malattie, organi e contesti clinici.

Sviluppato da ricercatori guidati da Qi Zhang, RADAR è progettato per interpretare le scansioni TC addominali con mezzo di contrasto come sistema diagnostico ad ampio raggio, anziché come strumento per una singola malattia o un singolo organo. I ricercatori lo descrivono come «Rapid Abdominal Diagnosis with AI and Radiology». I risultati collocano il modello tra i tentativi più promettenti finora presentati di sviluppare un sistema di IA generalista per uno dei compiti di diagnostica per immagini più impegnativi in radiologia.

I risultati provengono da un articolo sottoposto a revisione paritaria, intitolato «Un’IA generalista di livello esperto per la diagnosi tramite TC addominale», pubblicato su Science.

La base di addestramento di RADAR: 424.911 esami

RADAR è stato addestrato su 424.911 esami contenenti 1,5 milioni di coppie immagine-testo e oltre 15 milioni di coppie specifiche per l’anatomia. L’approccio di addestramento suddivide i volumi TC in singole strutture anatomiche e le collega alle descrizioni contenute nei referti radiologici.

Questa impostazione affronta un problema specifico dell’imaging addominale: i segnali diagnostici utili possono essere rari, mentre la stessa scansione può includere decine di organi e numerose possibili anomalie. Un modello deve collegare una piccola caratteristica visiva alla corretta sede anatomica e alla descrizione clinica pertinente. RADAR utilizza l’apprendimento contrastivo su larga scala per migliorare queste associazioni tra immagini e referti.

Lo studio confronta RADAR con sistemi di IA specializzati e modelli di visione-linguaggio attraverso valutazioni interne ed esterne. Il risultato principale è un’AUC media di 0,913 su 146 reperti, mentre il migliore modello concorrente di visione-linguaggio raggiunge 0,776. L’AUC misura quanto bene un sistema distingue i casi positivi da quelli negativi in un’attività diagnostica; valori più alti indicano una migliore capacità di discriminazione.

Le scansioni d’emergenza mettono alla prova le prestazioni fuori dalle condizioni di addestramento

RADAR ottiene buoni risultati anche negli esami d’emergenza, benché i dati di emergenza non siano stati usati specificamente per addestrare il sistema. Su oltre 27.000 casi di TC d’emergenza, il modello registra un’AUC di 0,904.

Il risultato è importante perché l’imaging d’emergenza può differire dagli esami ospedalieri di routine per le condizioni dei pazienti, il momento in cui viene eseguita la scansione e la varietà delle malattie sospette. Secondo il comunicato, RADAR ha mantenuto prestazioni elevate su organi, malattie e casi d’emergenza, compresi i reperti rari.

La valutazione in emergenza non dimostra che RADAR possa gestire autonomamente la diagnosi nelle cure acute. Mostra che la capacità di discriminazione misurata del modello si è mantenuta in un’ampia coorte di casi d’emergenza che non faceva parte specificamente del processo di addestramento.

Otto centri esterni misurano la capacità di generalizzazione

Nei test condotti in otto centri esterni, RADAR ha raggiunto un’AUC di 0,895. La valutazione esterna ha incluso pazienti, contesti clinici e protocolli di imaging diversi da quelli dei dati utilizzati per sviluppare il modello.

La differenza tra il punteggio complessivo riportato, pari a 0,913, e quello ottenuto nei centri esterni, pari a 0,895, è coerente con le difficoltà che si incontrano nel passare dai dati di sviluppo a quelli di nuove istituzioni. Le differenze tra scanner, protocolli, popolazioni di pazienti e pratiche di refertazione possono influire sui sistemi di imaging medico anche quando le malattie sottostanti sono simili.

I risultati di RADAR supportano quindi un’affermazione sulle prestazioni nei contesti esaminati dallo studio, non una garanzia di accuratezza in ogni ospedale. Le prove riportate nell’articolo coprono un’ampia gamma di valutazioni, mentre l’impiego clinico richiederebbe ulteriori verifiche, test dei flussi di lavoro e supervisione.

Anche un modello generalista deve affrontare il passaggio alla pratica clinica

I radiologi fanno più che classificare i reperti. Selezionano il contesto clinico pertinente, valutano spiegazioni alternative, decidono quali anomalie richiedono un intervento e comunicano l’incertezza nel referto. La valutazione di RADAR misura la capacità di discriminazione diagnostica su reperti etichettati, un ambito più ristretto rispetto alla dimostrazione che il sistema possa sostituire un intero flusso di lavoro radiologico.

Lo studio mostra comunque perché i sistemi generalisti attirino l’attenzione nel campo della TC addominale. Una serie di strumenti specifici può individuare singole patologie, mentre un modello ad ampio raggio potrebbe esaminare la stessa scansione alla ricerca di molti reperti in un solo passaggio. Potrebbe essere utile quando le anomalie non rientrano nell’indicazione che ha portato a eseguire la scansione o quando occorre esaminare insieme diversi organi.

Le prove immediate sono numeriche: 0,913 su 146 reperti, 0,904 su oltre 27.000 casi d’emergenza e 0,895 in otto centri esterni. Questi risultati definiscono l’estensione dei test riportati per RADAR, ma da soli non stabiliscono come il modello dovrebbe essere integrato nell’assistenza ai pazienti.

Fonte

Esplora

Altri articoli