The Pulse
Paper2Agent trasforma 74 dei 100 articoli di ricerca in agenti di IA
Nature riferisce che Paper2Agent ha trasformato con successo 74 dei 100 articoli di biologia computazionale in agenti, convertendone metodi, codice e dati in sistemi interattivi collegati tramite server del Model Context Protocol.

AI.info Team ·
Paper2Agent ha trasformato con successo 74 dei 100 articoli di biologia computazionale in agenti di IA funzionanti, convertendo i metodi pubblicati in software in grado di rispondere a domande, ripetere analisi ed elaborare nuovi dati. Il sistema, sviluppato sotto la guida di Stanford, ha inoltre generato 599 strumenti proposti a partire da quegli articoli, 593 dei quali hanno superato la convalida automatica.
I risultati, pubblicati su Nature il 16 settembre 2026, indicano un possibile impiego pratico degli agenti di IA nella pubblicazione scientifica: riunire il manoscritto di un articolo, il codice, i dataset e i flussi di lavoro in un sistema eseguibile, anziché lasciarli come materiali di ricerca scollegati tra loro.
Paper2Agent non tratta un articolo come un documento da riassumere. Costruisce un server del Model Context Protocol, o MCP, attorno ai metodi e alle risorse dell’articolo, quindi collega quel server a un agente di IA. Gli utenti possono chiedere un’analisi in linguaggio comune, mentre l’agente richiama strumenti convalidati basati sul codice di ricerca originale.
Da un PDF a un sistema di ricerca funzionante
Per usare un metodo pubblicato, spesso chi legge articoli computazionali deve trovare un repository di codice, installare le dipendenze, individuare gli input corretti, ricostruire passaggi non documentati e adattare gli script. Paper2Agent automatizza gran parte di questo lavoro con una pipeline in sei fasi.
Il sistema individua la base di codice dell’articolo, crea un ambiente software isolato, cerca tutorial, esegue flussi di lavoro di esempio, estrae funzioni riutilizzabili e le verifica confrontandole con i risultati originali. Gli strumenti così ottenuti vengono assemblati in un server MCP che può essere ospitato da remoto e collegato ad agenti di IA compatibili.
Ogni server contiene strumenti eseguibili, risorse statiche e prompt. Gli strumenti eseguono operazioni come valutare una variante genetica o elaborare dati a singola cellula. Le risorse includono il manoscritto, il materiale supplementare, il codice, i dataset e le figure. I prompt codificano procedure in più passaggi, così che un agente possa seguire l’ordine previsto invece di improvvisare un flusso di lavoro da zero.
I ricercatori hanno usato Claude Code per implementare il sistema e Claude Sonnet 4 come agente a valle nei loro casi di studio. Durante la valutazione, Paper2Agent non richiede che l’agente finale mantenga l’accesso diretto al repository originale: questo ha permesso al gruppo di verificare se gli strumenti generati conservassero le funzionalità dell’articolo.
AlphaGenome mette in luce il divario nelle prestazioni
I risultati individuali migliori sono stati ottenuti da un agente basato su AlphaGenome, un modello che prevede gli effetti delle varianti del DNA sulla regolazione genica. Paper2Agent ha generato 22 strumenti MCP per AlphaGenome in circa 45 minuti, con un costo dichiarato di 14 dollari su un laptop personale. Tutti e 22 hanno superato la convalida automatica.
Nei test di benchmark, l’agente AlphaGenome ha raggiunto un’accuratezza del 98,7% su 15 domande ricavate dai tutorial e del 100% su 15 nuove domande, in cinque esecuzioni indipendenti. Claude Code con accesso diretto al repository ha ottenuto rispettivamente l’82,7% e il 78,7% nelle stesse categorie, mentre Biomni ha raggiunto il 37,3% e il 56%.
Su 30 domande a risposta aperta che richiedevano l’uso di più strumenti e un’interpretazione biologica, Paper2Agent ha raggiunto un’accuratezza dell’82,7%. Claude Code con accesso al repository ha ottenuto il 56,7% e Biomni il 72,2%. Il sistema Paper2Agent ha inoltre ridotto il tempo mediano di esecuzione rispetto a entrambe le alternative.
I test comprendevano attività come stimare l’effetto di una variante del DNA sull’espressione genica, sullo splicing o sull’accessibilità della cromatina in particolari tessuti e tipi cellulari. Ogni strumento generato includeva un riferimento verificabile al codice sorgente originale, consentendo agli utenti di controllare da dove provenisse un’operazione.
Scanpy mostra come gli agenti possano eseguire un flusso di lavoro completo
Un secondo caso di studio ha utilizzato Scanpy, un pacchetto ampiamente usato per la trascrittomica a singola cellula. Paper2Agent ha generato sette strumenti per il pre-processing e il clustering in circa 45 minuti, con un costo dichiarato di 13 dollari; tutti gli strumenti hanno superato la convalida.
L’agente ottenuto poteva eseguire il controllo di qualità, normalizzare i dati, selezionare le caratteristiche, ridurre la dimensionalità, costruire un grafo delle cellule vicine, raggruppare le cellule e identificare i tipi cellulari. I ricercatori hanno codificato la sequenza nei prompt MCP, permettendo agli utenti di fornire il percorso di un dataset senza dover specificare manualmente ogni passaggio.
Nei test condotti su quattro dataset pubblici di dati a singola cellula non presenti nel repository Scanpy, i risultati dell’agente corrispondevano a quelli delle analisi svolte da esseri umani per quanto riguarda il numero di cellule e di geni dopo il controllo di qualità e i principali geni marcatori identificati per ciascun cluster. I test su sette dataset diversi hanno mostrato che l’agente adattava i parametri alle caratteristiche di ciascun dataset.
Paper2Agent ha creato anche un agente per TISSUE, un metodo per la trascrittomica spaziale. Gli autori hanno usato il risultato per mostrare come un agente basato su un articolo possa fornire analisi consapevoli dell’incertezza mantenendo al contempo l’accesso al metodo originale e ai dati di supporto.
I 26 articoli che non è stato possibile trasformare in agenti
La valutazione su larga scala di Paper2Agent ha anche messo in luce lo stato del software scientifico. Dei 100 articoli di biologia computazionale, 26 non sono stati trasformati con successo in agenti. Tra le cause indicate figurano l’assenza di codice eseguibile, la mancanza di dati o file di modelli, problemi con le dipendenze e gli ambienti software, e script che non funzionavano al di fuori degli esempi originali.
I ricercatori descrivono questo tasso di insuccesso come un possibile indicatore della riproducibilità. Un articolo che non può essere installato, eseguito e testato può comunque comunicare un risultato scientifico, ma il suo metodo è più difficile da riutilizzare. Il ciclo di convalida del sistema può correggere alcuni bug ereditati, ma non può fornire gli artefatti di ricerca mancanti né risolvere tutte le ipotesi non documentate.
Su 300 domande ricavate dai tutorial, Paper2Agent con Sonnet 4 ha raggiunto un’accuratezza del 91,2%, contro l’80,3% di Claude Code, che operava direttamente sull’articolo e sul repository. Ogni domanda a Paper2Agent è costata circa 20 centesimi e ha richiesto un tempo mediano di 1,6 minuti, contro i 38 centesimi e i 4,3 minuti dell’approccio basato sull’accesso diretto al repository.
La valutazione è andata oltre la biologia. Su 42 attività basate sull’esecuzione, tratte da 10 articoli in ambiti tra cui IA, statistica, econometria, teoria dei giochi e astrofisica, Paper2Agent ha raggiunto un’accuratezza del 98,1%. Per 26 articoli incentrati sui dati e sulla scoperta, il livello di risorse ha raggiunto un’accuratezza dell’89% su 100 domande di sintesi, con costi inferiori e tempi più rapidi rispetto a un sistema di riferimento basato sull’uso del browser.
Tre agenti basati su articoli mettono alla prova un’ipotesi sulla psoriasi
I ricercatori hanno poi collegato agenti distinti, ciascuno basato su un articolo, per studiare una variante genetica associata alla psoriasi. AlphaGenome ha previsto che GPR137 fosse il gene più colpito nel locus rs887314 nelle cellule T CD4-positive, assegnandogli un punteggio quantile di 0,997 nell’analisi RNA-seq.
Un co-scienziato basato sull’IA ha confrontato quella previsione con i risultati di altri due agenti: uno rappresentava uno screening che misurava i cambiamenti nell’espressione genica dopo la perturbazione di elementi regolatori, l’altro uno studio Perturb-seq sui knockdown genici nelle cellule T CD4-positive umane.
Il sistema ha proposto dieci strategie di convalida. Un ricercatore ha scelto l’analisi della correlazione delle firme, che ha confrontato il profilo di espressione causato dalla perturbazione degli elementi regolatori con quelli prodotti dai knockdown dei geni candidati. GPR137 era l’unico candidato ai primi posti a mostrare una concordanza significativa in condizioni di stimolazione, con correlazioni di Spearman di 0,613 e 0,630 in due condizioni di stimolazione.
Il risultato indica che GPR137 è probabilmente un gene causale nel locus, ma l’articolo non presenta il risultato come un meccanismo confermato sperimentalmente. La correlazione non era significativa nelle cellule a riposo e gli autori descrivono il ruolo come dipendente dall’attivazione.
Perché il giudizio umano resta importante
Paper2Agent può generare ipotesi, proporre test ed eseguire analisi, ma i ricercatori attribuiscono agli studiosi umani la responsabilità di scegliere le direzioni della ricerca e valutare le prove. Descrivono l’accuratezza nei benchmark soprattutto come una misura dell’esecuzione fedele, non come prova che l’interpretazione aperta di un agente sia scientificamente corretta.
Questa distinzione è importante: il sistema può rendere più facile riutilizzare il lavoro pubblicato senza stabilire se un risultato abbia significato biologico. Un agente basato su un articolo può riprodurre fedelmente un’analisi e tuttavia ereditarne i limiti nei dati, nel disegno dello studio o nell’interpretazione.
Gli autori propongono che, in futuro, le riviste possano aggiungere una sezione sulla «disponibilità di agenti» accanto alle dichiarazioni già previste su dati e codice. La sezione specificherebbe se un articolo dispone di un agente interattivo, quali operazioni può eseguire e quali dipendenze richiedono manutenzione.
Paper2Agent rende il processo di pubblicazione più esigente oltre che più accessibile. Gli agenti dipendono da repository funzionanti, ambienti documentati e software a monte sottoposto a manutenzione. Introducono inoltre questioni di sicurezza, proprietà intellettuale e attribuzione che non si pongono nello stesso modo con un PDF statico. Il risultato più evidente dello studio è quindi sia tecnico sia editoriale: dei 100 articoli di biologia computazionale esaminati, 26 non disponevano degli elementi necessari per diventare agenti funzionanti affidabili.