Vai al contenuto
AI.info

The Pulse

Liquid AI apre LongevityBench per testare l’invecchiamento biologico

Liquid AI e Insilico Medicine hanno rilasciato LongevityBench, un benchmark aperto per testare i modelli linguistici su dati clinici e biologici relativi all’invecchiamento. Il benchmark comprende 17 task, 25.457 prompt e cinque domini di d

Liquid AI apre LongevityBench per testare l’invecchiamento biologico

AI.info Team ·

Liquid AI ha rilasciato LongevityBench, una suite di test aperta progettata per misurare se i modelli linguistici sono in grado di interpretare i dati clinici e molecolari usati nella ricerca sull’invecchiamento. Sviluppato insieme a Insilico Medicine, il benchmark riunisce 17 task e 25.457 prompt che coprono cinque domini di dati biologici.

L’azienda ha pubblicato i risultati il 17 settembre 2026, insieme al rilascio di due modelli adattati al dominio: LFM2-1.2B-Longevity e LFM2-2.6B-Longevity. Liquid AI afferma che entrambi i sistemi compatti hanno ottenuto risultati competitivi rispetto a modelli frontier molto più grandi in diversi task riguardanti la previsione dell’età, l’attività genica e le misurazioni biologiche.

L’annuncio di Liquid AI descrive il lavoro come un tentativo di stabilire un metodo comune di valutazione per i modelli che elaborano dati eterogenei sull’invecchiamento, anziché un orologio biologico progettato per un unico scopo.

Cinque tipi di dati, 17 modi per testare un modello

LongevityBench attinge a cartelle cliniche del National Health and Nutrition Examination Survey statunitense, studi sulla metilazione del DNA del Gene Expression Omnibus, profili trascrittomici del progetto Genotype-Tissue Expression, misurazioni delle proteine plasmatiche da tre studi pubblici Olink e dati genetici da OpenGenes, CellAge e SynergyAge.

Il benchmark usa quattro formati di risposta: classificazione binaria, confronto a coppie, classificazione multiclasse e regressione numerica. Gli stessi dati di origine possono essere usati per test diversi. Per esempio, i dati NHANES possono servire a chiedere a un modello di identificare quale di due persone è più anziana, assegnare una persona a una fascia d’età o stimarne l’età cronologica.

Liquid AI afferma che il benchmark separa l’addestramento dalla valutazione in base allo studio o all’unità biologica sottostante. I dati NHANES sono suddivisi per ondata dell’indagine; i dati sulla metilazione del DNA per studio GEO; i dati GTEx e Olink per individuo; i dati OpenGenes per famiglia proteica; e i dati SynergyAge per specie. Questa impostazione mira a rendere più difficile per un modello riuscire richiamando direttamente esempi correlati.

I modelli LFM2 compatti sfidano sistemi più grandi

L’azienda ha valutato i propri modelli confrontandoli con 18 modelli linguistici di frontiera. LFM2-1.2B e LFM2-2.6B sono stati sottoposti a fine-tuning per tre epoche con una finestra di contesto di 32.000 token. Liquid AI ha addestrato versioni usando solo dati sulla longevità, dati sulla longevità mescolati con il 10% di dati generali di chat e dati sulla longevità mescolati con il 20% di dati generali di chat; ha poi combinato le varianti di ciascuna dimensione del modello con una fusione lineare a pesi uguali.

I risultati riportati variano a seconda del task, ma i migliori mostrano l’effetto dell’addestramento specifico per dominio. LFM2-2.6B-Longevity si è classificato al primo posto nel task NHANES di confronto a coppie dell’età, in cui si chiede al modello di stabilire quale di due partecipanti sia più anziano sulla base dei profili clinici. I due modelli LFM2 hanno anche occupato le prime due posizioni in un task OpenGenes con dati mascherati, che chiede se l’espressione di un gene aumenti o diminuisca con l’età.

In un task GTEx che prevede la fascia d’età di un donatore sulla base dei dati di espressione genica, LFM2-2.6B si è classificato al secondo posto e LFM2-1.2B al quarto. Entrambi hanno superato tutti i modelli di frontiera inclusi nel confronto. LFM2-2.6B si è inoltre classificato al secondo posto nel task GEO di confronto a coppie dell’età basato sulla metilazione del DNA, mentre entrambi i modelli LFM2 hanno superato tutti i sistemi di frontiera valutati nel confronto Olink basato sulla proteomica plasmatica.

Cosa non dimostra il benchmark

Liquid AI ha anche testato quali misurazioni influenzassero le previsioni dei modelli tramite ablazioni controllate. I ricercatori hanno rimosso gruppi definiti di caratteristiche biologiche da prompt altrimenti identici e misurato i cambiamenti nella sicurezza dei modelli e i cambi di risposta.

L’azienda avverte che questi risultati individuano informazioni associate a una previsione, non cause biologiche. Una caratteristica la cui rimozione modifica la risposta di un modello può essere rilevante per il suo ragionamento senza causare l’esito dell’invecchiamento sottostante.

La distinzione è importante perché LongevityBench valuta se un modello sa associare misurazioni strutturate a una risposta definita. Non dimostra che un modello abbia scoperto un nuovo meccanismo dell’invecchiamento, convalidato un biomarcatore per l’uso clinico o prodotto prove a sostegno di un intervento.

Dai punteggi del benchmark ai sistemi di ricerca locali

Liquid AI presenta i modelli compatti come candidati per l’implementazione locale, anche in situazioni in cui le informazioni a livello di paziente non dovrebbero essere inviate a un’interfaccia di programmazione delle applicazioni esterna. Nell’annuncio, l’azienda chiede comunque ulteriori test su affidabilità, equità, latenza e costi in contesti di ricerca realistici.

Il rilascio più ampio del progetto comprende il benchmark e i checkpoint dei due modelli basati su Liquid; Insilico Medicine elenca inoltre altri sistemi Longevity-LLM e un’interfaccia per la ricerca sull’invecchiamento. L’articolo che accompagna il progetto, «Un benchmark aperto e modelli linguistici per l’IA nella biologia dell’invecchiamento», è pubblicato su Cell e illustra nel dettaglio la metodologia e l’analisi del benchmark.

Per ora, LongevityBench offre una prova concreta di una capacità circoscritta ma impegnativa: verificare se un modello linguistico sa usare misurazioni cliniche, epigenetiche, trascrittomiche, proteomiche e genetiche per rispondere a domande sull’invecchiamento senza affidarsi a un unico formato di dati.

Fonte

Esplora

Altri articoli