Vai al contenuto
AI.info

The Pulse

La FDA assegna a Cognita 1,29 milioni di dollari per testare giurie di LLM in radiologia

Cognita Imaging riceve dalla FDA un contratto di ricerca da 1,29 milioni di dollari per valutare referti radiologici generati dall’IA con più modelli linguistici di grandi dimensioni. Il progetto, della durata di 18 mesi, esaminerà circa 1

La FDA assegna a Cognita 1,29 milioni di dollari per testare giurie di LLM in radiologia

AI.info Team ·

Un milione di esami per verificare se l’IA può valutare l’IA

La Food and Drug Administration statunitense ha assegnato a Cognita Imaging un contratto di ricerca da 1,29 milioni di dollari per verificare se più modelli linguistici di grandi dimensioni possano valutare referti radiologici generati dall’IA su una scala che supera quella dei tradizionali studi con lettori. Il progetto, della durata di 18 mesi, è entrato in vigore il 22 giugno 2026 e analizzerà circa 1 milione di esami dei pazienti.

Cognita, una società interamente controllata da Mosaic Clinical Technologies, chiama il metodo proposto «LLM come giuria». Invece di chiedere a un modello di giudicare il referto di un altro, il sistema confronterà le valutazioni prodotte da più modelli prima di sottoporre ai radiologi i disaccordi clinicamente rilevanti.

L’annuncio è stato pubblicato da Mosaic il 16 settembre. L’azienda afferma che il lavoro intende affrontare un problema normativo specifico: valutare referti radiologici completi è più difficile che valutare sistemi che individuano un singolo reperto o segnalano una sola area di un’immagine.

Leggi l’annuncio originale di Mosaic Clinical Technologies.

Akshay Chaudhari guida il progetto della FDA

Akshay Chaudhari, Ph.D., cofondatore di Cognita e professore associato di radiologia e scienza dei dati biomedici alla Stanford University, guida il lavoro in qualità di ricercatore principale. Louis Blankemeier, Ph.D., cofondatore e amministratore delegato di Cognita, è co-ricercatore.

«Quando un sistema di IA inizia a scrivere l’intero referto, cambia il problema della valutazione. Qualche centinaio di casi può dirti se un modello funziona in un contesto circoscritto. Non mostra tutti i modi in cui può fallire nella pratica. Vogliamo verificare se un gruppo di modelli linguistici, con i radiologi che esaminano i casi difficili, possa offrirci un quadro più chiaro e ripetibile su scala reale.»

Akshay Chaudhari, Ph.D., cofondatore di Cognita e ricercatore principale

Il progetto valuterà sia i referti redatti da persone sia quelli generati dall’IA. I ricercatori analizzeranno i risultati in diversi gruppi di pazienti, contesti assistenziali, apparecchiature di imaging e malattie, compresi reperti non comuni che potrebbero non comparire abbastanza spesso nei campioni di validazione più piccoli.

I radiologi esamineranno i disaccordi

La valutazione automatizzata non sarà l’autorità finale. I radiologi esamineranno i disaccordi clinicamente rilevanti e determineranno se il problema ha avuto origine nel referto generato dall’IA, nella giuria di modelli linguistici o nel referto del radiologo originale.

Nina Kottler, M.D., direttrice sanitaria per l’IA di Mosaic Clinical Technologies, ha affermato che lo studio è pensato per far emergere errori che possono passare inosservati nei dataset selezionati con cura.

«I radiologi sanno che i casi limite contano. Un modello può sembrare valido in uno studio selezionato con cura e avere comunque difficoltà in un altro ospedale, con apparecchiature diverse o davanti a una manifestazione rara. Questo lavoro ci permette di cercare queste differenze su una scala che sarebbe molto difficile raggiungere con i soli studi con lettori, coinvolgendo i radiologi nei casi in cui il loro giudizio conta di più.»

Nina Kottler, M.D., direttrice sanitaria per l’IA, Mosaic Clinical Technologies

Cognita ricreerà anche coorti di validazione più piccole a partire dal dataset più ampio. Il confronto intende mostrare che cosa può sfuggire a uno studio basato su un numero limitato di casi, in particolare quando malattie rare, manifestazioni insolite o differenze tra sistemi di imaging incidono sulla qualità dei referti.

Dal progetto GREEN alle indicazioni normative

Il lavoro finanziato dalla FDA si basa sul progetto GREEN di Cognita, uno strumento open source che confronta referti radiologici di riferimento con referti generati dall’IA e individua differenze clinicamente significative. L’azienda intende avvalersi delle competenze cliniche, dell’infrastruttura tecnologica e dei flussi di lavoro radiologici di Mosaic e del più ampio ecosistema di Radiology Partners.

In base al contratto, Cognita fornirà alla FDA il codice del software e indicazioni pratiche per costruire giurie di LLM. I risultati includeranno anche analisi che confrontano coorti di validazione grandi e piccole, studi sulle discrepanze esaminate dai radiologi e rapporti che descrivono i risultati e i limiti del progetto.

La FDA ha assegnato il contratto attraverso il programma Broad Agency Announcement, dedicato alla ricerca avanzata e allo sviluppo nel campo della scienza regolatoria. L’accordo riguarda un metodo di valutazione, non l’autorizzazione di un prodotto commerciale: Cognita e Mosaic dichiarano che non rappresenta un’approvazione, un’autorizzazione o un via libera della FDA per alcuna tecnologia di Cognita.

La prova è capire se il consenso intercetta ciò che sfugge ai campioni

La valutazione basata su LLM può elaborare molti più referti di un tradizionale gruppo di esperti, ma il progetto parte dalla possibilità che anche i giudici automatizzati commettano errori. Il metodo di Cognita prevede quindi una revisione umana dei casi in cui i modelli sono in disaccordo o le conseguenze cliniche potrebbero essere rilevanti.

Il successo dipenderà dalla capacità del consenso della giuria di rispecchiare i giudizi dei radiologi sull’intera gamma di esami, anziché limitarsi a ottenere accordo tra modelli linguistici. La prova concreta prevista dal contratto riguarderà circa 1 milione di esami dei pazienti; nel corso dei 18 mesi di ricerca, la FDA riceverà il codice, le analisi delle coorti, gli studi sulle discrepanze e i rapporti sui limiti.

Fonte

Esplora

Altri articoli