The Pulse
Tempus punta a 100.000 genomi completi per la ricerca sull’IA
Tempus AI sta costruendo un dataset de-identificato di 100.000 genomi completi, specifici per determinate patologie e collegati a esiti clinici longitudinali. L’azienda prevede di rendere la piattaforma ampiamente disponibile entro la metà

AI.info Team ·
Tempus AI sta costruendo un dataset di genomi completi che inizialmente collegherà 100.000 genomi specifici per determinate patologie a esiti clinici longitudinali, per poi ampliarsi fino a un milione di genomi. L’azienda con sede a Chicago ha annunciato l’iniziativa l’11 settembre, descrivendola come una piattaforma di ricerca progettata appositamente per l’intelligenza artificiale, anziché come un archivio di genomi assemblato principalmente per studi sulla popolazione.
La distinzione è importante, perché raramente un genoma, da solo, spiega la patologia di un paziente o la sua risposta a un trattamento. Tempus afferma che i ricercatori potranno esaminare i dati di sequenziamento dell’intero genoma insieme alle storie cliniche, alle immagini diagnostiche, ai referti patologici e agli esiti, all’interno dell’ambiente di dati de-identificati già esistente. Il dataset iniziale è già disponibile per alcuni partecipanti selezionati attraverso un programma Early Adopter, mentre la disponibilità generale è prevista per la metà del 2027.
Con il suo annuncio, Tempus si inserisce nella corsa alla creazione di dataset biomedici che combinano misurazioni molecolari con ciò che accade ai pazienti nel tempo. L’obiettivo dichiarato non è semplicemente aumentare il numero di genomi, ma creare una risorsa per il machine learning che possa supportare il pre-training, il post-training, la convalida dei modelli e i flussi di lavoro di ricerca, senza richiedere ai clienti di trasferire i dati sottostanti da un sistema all’altro.
Tempus ha dichiarato che la piattaforma si concentrerà su gruppi di pazienti con specifiche patologie e sui loro esiti, una struttura pensata per aiutare i ricercatori a indagare la progressione delle malattie, la risposta ai trattamenti e i fattori biologici associati a entrambi.
Tempus parte da 100.000 genomi e punta a un milione
La prima fase prevede di raccogliere, nei prossimi anni, 100.000 sequenze dell’intero genoma collegate a informazioni cliniche longitudinali. Tempus non ha fornito un calendario dettagliato per il completamento di questa prima fase, non ha reso noto quanti genomi siano già stati raccolti né ha pubblicato una suddivisione della coorte prevista per patologia.
L’azienda ha però dichiarato che lo sviluppo è già in corso. Ricercatori e sviluppatori di modelli possono accedere al dataset iniziale attraverso un programma Early Adopter; si prevede che altri partecipanti si aggiungano progressivamente man mano che la risorsa cresce. Tempus prevede di renderla ampiamente disponibile entro la metà del 2027: una data che offre ai potenziali utenti un’indicazione più chiara del momento in cui il progetto dovrebbe andare oltre il gruppo iniziale di partecipanti.
Dopo aver raggiunto i 100.000 genomi, Tempus intende perseguire un obiettivo molto più ambizioso: un milione. Si tratta di un obiettivo dell’azienda, non delle dimensioni attuali del dataset, e l’annuncio non stabilisce che la risorsa completa da un milione di genomi sarà realizzata secondo un calendario preciso.
Tempus non descrive il progetto come un database pubblico aperto. Il comunicato lo presenta come una piattaforma di ricerca accessibile attraverso l’ambiente dell’azienda, con accesso iniziale tramite il programma Early Adopter. Nell’annuncio non sono stati specificati i termini commerciali, i requisiti di idoneità e le condizioni precise d’uso.
Perché i genomi completi cambiano il problema dei dati
Molti programmi di genomica clinica si basano su pannelli mirati o altri test che esaminano geni e regioni selezionati. Questi approcci possono rispondere in modo efficiente a quesiti clinici specifici, ma non rilevano tutte le varianti presenti nel genoma. Tempus afferma che la nuova iniziativa andrà oltre i pannelli genici mirati, offrendo ai ricercatori una visione più approfondita di come le variazioni genomiche possano essere correlate alla progressione delle malattie e alla risposta ai trattamenti.
Il sequenziamento dell’intero genoma produce un ampio quadro molecolare, ma l’ampiezza, da sola, non garantisce che la ricerca sia utile. Un genoma diventa più informativo quando i ricercatori possono collegarlo a diagnosi, terapie, risultati di laboratorio, immagini diagnostiche, referti patologici e al successivo decorso del paziente. Tempus presenta questo collegamento come l’elemento centrale del progetto.
Secondo Tempus, i programmi genomici di dimensioni pari a quelle degli studi sulla popolazione sono in genere basati su popolazioni ampie e non sono progettati per concentrarsi sull’andamento longitudinale delle patologie e sugli esiti dei trattamenti. Un dataset incentrato sulle patologie può consentire di indagare questioni diverse: se determinate varianti siano più frequenti nei pazienti affetti da una specifica condizione, se i profili genetici siano correlati ai benefici o alla resistenza ai trattamenti e se i segnali genomici migliorino le previsioni ottenute dai soli dati clinici.
Queste domande richiedono un’attenta progettazione degli studi. I gruppi di pazienti con specifiche patologie possono introdurre effetti di selezione, mentre la completezza degli esiti registrati nell’assistenza ordinaria può variare tra sistemi sanitari e gruppi di pazienti. L’annuncio di Tempus descrive la struttura prevista per la risorsa, ma non presenta risultati di convalida che mostrino quanto la coorte sarà rappresentativa o con quale coerenza saranno raccolti gli esiti clinici.
La piattaforma unisce DNA, note cliniche, immagini ed esiti
La risorsa pianificata di genomi completi farà parte dell’ambiente di dati multimodali de-identificati già esistente di Tempus. L’azienda afferma che, attraverso Tempus Lens, la sua piattaforma di ricerca e analisi, i ricercatori potranno analizzare le informazioni genomiche insieme alle storie cliniche, alle immagini diagnostiche, ai referti patologici e agli esiti dei pazienti.
Questa soluzione è pensata per ridurre un onere tecnico comune nel machine learning biomedico: raccogliere dati da archivi separati, allineare gli identificativi, standardizzare i formati e preservare la sequenza temporale degli eventi. Tempus afferma che il suo sistema consentirà ai ricercatori di costruire e convalidare modelli di IA senza trasferire i dataset da un sistema all’altro. Il comunicato descrive inoltre un’infrastruttura computazionale pensata sia per i flussi di lavoro di pre-training sia per quelli di post-training.
Eric Lefkofsky, fondatore e amministratore delegato di Tempus, ha affermato che il valore del progetto dipende da ciò che i ricercatori possono fare con i dati, non soltanto dal numero di genomi.
«Un dataset di grandi dimensioni è utile solo se si riesce a trasformarlo in conoscenza», ha dichiarato Eric Lefkofsky, fondatore e AD di Tempus.
Lefkofsky ha aggiunto che l’azienda ha trascorso l’ultimo decennio a collegare diagnostica, dati clinici multimodali e infrastrutture di IA, e ha affermato che l’aggiunta di informazioni sull’intero genoma collegate a esiti longitudinali offrirà ai ricercatori una base più ricca per costruire modelli e produrre risultati di ricerca.
Tempus porta nel progetto il suo patrimonio di dati oncologici
Tempus non parte da zero. L’azienda afferma di aver creato una delle più grandi banche dati multimodali oncologiche del mondo reale e di aver utilizzato questi dati in centinaia di decisioni sullo sviluppo di farmaci. Le risorse esistenti comprendono informazioni molecolari, cartelle cliniche, referti patologici e immagini diagnostiche, anche se l’iniziativa sui genomi completi rappresenta un passo oltre la precedente attenzione dell’azienda al sequenziamento mirato e ad altri test genomici.
In passato Tempus ha descritto un’attività di gestione dei dati che si estende su oltre 500 petabyte e più di 45 milioni di percorsi di pazienti de-identificati. In un annuncio del maggio 2026 sul suo lavoro con i modelli fondazionali multimodali, l’azienda ha dichiarato di avere più di 1,5 milioni di pazienti con dati di sequenziamento e oltre 400.000 cartelle oncologiche contenenti informazioni genomiche, trascrittomiche, di imaging e cliniche complete.
Lo stesso annuncio descriveva un modello addestrato su 2,5 milioni di cartelle longitudinali, più di 250 milioni di pagine di note cliniche, 450.000 immagini mediche digitalizzate e 500.000 sequenze genomiche e trascrittomiche. Queste cifre si riferiscono alle iniziative più ampie di Tempus nell’ambito dell’IA multimodale, non al nuovo dataset di genomi completi. La distinzione è importante: la risorsa appena annunciata ha un obiettivo dichiarato di 100.000 genomi completi, mentre la più ampia libreria di dati dell’azienda contiene molti tipi di cartelle cliniche e test di sequenziamento.
Tempus sta anche sviluppando modelli fondazionali specifici per determinate patologie. Ad agosto, l’azienda ha annunciato i risultati di PRISM2, un modello di patologia sviluppato con ricercatori di Microsoft. Tempus ha dichiarato che PRISM2 è stato addestrato su 2,3 milioni di immagini istologiche complete e 14 milioni di coppie di domande e risposte diagnostiche ricavate da quasi 700.000 referti patologici. Questo lavoro mostra la strategia più ampia dell’azienda: combinare grandi dataset con modelli specializzati e software in grado di trasformarli in strumenti di ricerca.
La privacy dei pazienti e le modalità di accesso influiranno sul progetto
Un dataset che collega genomi e storie cliniche comporta un onere maggiore in materia di privacy rispetto a una raccolta di sequenze genomiche isolate. Tempus descrive la risorsa prevista come de-identificata, ma l’annuncio non specifica i metodi di de-identificazione, il quadro del consenso, il processo di governance o i controlli di sicurezza applicabili ai dati dei genomi completi.
Questi dettagli saranno importanti per gli ospedali, le aziende biofarmaceutiche e i ricercatori accademici che decideranno se partecipare. I genomi completi possono contenere informazioni rilevanti per i familiari di un paziente, oltre che per la persona il cui campione è stato sequenziato. Collegarli alle storie dei trattamenti e agli esiti clinici aumenta il valore per la ricerca, ma accresce anche la sensibilità dei dati risultanti.
L’annuncio non chiarisce inoltre come Tempus misurerà la rappresentatività dei diversi gruppi di ascendenza, sottotipi di patologia, sistemi sanitari e contesti di trattamento. Un modello addestrato su una coorte ampia ma disomogenea potrebbe funzionare bene per i gruppi più rappresentati nei dati e risultare meno affidabile per gli altri. Tempus non ha ancora pubblicato un profilo della coorte per l’obiettivo iniziale di 100.000 genomi.
L’accesso commerciale solleva un’altra questione. Tempus gestisce sia un’attività di diagnostica clinica sia un’attività di dati e analisi al servizio delle aziende del settore delle scienze della vita. Il comunicato afferma che i ricercatori e gli sviluppatori di modelli potranno lavorare attraverso Tempus Lens, ma non specifica se l’accesso sarà basato su abbonamento, su singoli progetti, su partnership o su un altro modello.
La metà del 2027 sarà il primo punto di verifica pubblico
Per ora, il traguardo più concreto non è l’ambizione di arrivare a un milione di genomi, ma la disponibilità generale prevista per la metà del 2027. Prima di allora, Tempus dovrà ampliare il dataset, completare il collegamento tra dati clinici e genomici, definire le procedure di accesso e dimostrare che la risorsa può sostenere ricerche riproducibili su gruppi di pazienti con diverse patologie.
L’annuncio dell’azienda avanza una tesi precisa sul progetto: definisce la risorsa prevista il primo dataset multimodale de-identificato di sequenziamento dell’intero genoma, incentrato su gruppi di pazienti con specifiche patologie e sui loro esiti, e ottimizzato per la ricerca basata sull’IA. Questa affermazione riflette la descrizione che Tempus dà del progetto; il comunicato non fornisce un confronto indipendente con tutti i database genomici esistenti.
Le prossime evidenze arriveranno dal programma Early Adopter. I ricercatori vorranno conoscere il numero di genomi disponibili in ciascuna fase, le patologie rappresentate, la percentuale di casi con esiti longitudinali completi, la qualità dei dati di sequenziamento e le prestazioni dei modelli addestrati sui dati combinati. Avranno inoltre bisogno di informazioni chiare sulle autorizzazioni dei pazienti, sulla governance dei dati e sui limiti allo sviluppo dei modelli a valle.
Tempus ha annunciato un obiettivo iniziale di 100.000 genomi, un traguardo di lungo periodo di un milione di genomi e la disponibilità generale prevista per la metà del 2027. Restano da chiarire la capacità dell’azienda di raccogliere queste cartelle con esiti coerenti, quanto la coorte rappresenterà i pazienti al di fuori delle sue reti esistenti e cosa sarà consentito ai ricercatori costruire con i dati una volta ampliato l’accesso.