Vai al contenuto
AI.info

Approfondimenti tecnici

L’IA come scienziata autonoma: da strumento di ricerca a scopritrice indipendente

AI Scientist di Sakana, Co-Scientist di Google, Coscientist e A-Lab: che cosa hanno fatto davvero i sistemi di ricerca autonomi, che cosa ha messo in luce la correzione relativa ad A-Lab e perché la verifica resta affidata agli esseri umani

L’IA come scienziata autonoma: da strumento di ricerca a scopritrice indipendente

Gabriele Masetti ·

Da assistente a ricercatrice

Per gran parte dell’ultimo decennio, «l’IA nella scienza» è stata una sorta di microscopio più veloce: un modello che classificava immagini, prevedeva la struttura delle proteine o ordinava spettri, mentre uno scienziato prendeva ancora tutte le decisioni importanti — quale domanda porsi, quale esperimento condurre, che cosa significassero i risultati. Ora questa divisione del lavoro viene messa direttamente alla prova.

Alcuni sistemi reali, descritti in pubblicazioni, hanno cominciato a farsi carico di parti del metodo scientifico stesso: generano ipotesi, progettano esperimenti, azionano apparecchiature di laboratorio e, in almeno un caso, redigono i risultati e li sottopongono alla revisione tra pari. Nessuno di questi sistemi è uno scienziato autonomo in grado di operare in qualsiasi ambito. Presi insieme, però, rappresentano il primo serio tentativo di automatizzare la scoperta, anziché limitarsi ad accelerare l’analisi. E i risultati — successi, insuccessi e una correzione imbarazzante — offrono un quadro più sincero della direzione intrapresa rispetto alla promozione di qualunque singolo prodotto.

Sistema Ambito Risultato principale
Sakana AI Scientist-v2 Automazione della ricerca nel machine learning Ha ottenuto 6,33/10 in un workshop dell’ICLR 2025; l’articolo è stato ritirato volontariamente
Google AI co-scientist Generazione di ipotesi Ha suggerito che vorinostat riducesse del 91% una modificazione della cromatina indotta da TGFβ in organoidi della fibrosi epatica
Coscientist (CMU) Chimica robotizzata Ha ottimizzato autonomamente una reazione di accoppiamento incrociato catalizzata da Pd in 6 attività dimostrative
A-Lab (Berkeley Lab) Sintesi autonoma di materiali Ha sintetizzato 36 dei 57 composti previsti nell’arco di 17 giorni consecutivi

«AI Scientist» di Sakana AI: l’intero ciclo, con molte zone d’ombra

Nel 2024, Sakana AI, con sede a Tokyo, ha presentato «The AI Scientist», un sistema progettato per gestire l’intero ciclo della ricerca su temi di machine learning senza intervento umano oltre alla configurazione iniziale: elabora idee di ricerca, scrive ed esegue codice per metterle alla prova, analizza i dati ottenuti e redige un manoscritto completo, includendo una fase automatizzata di revisione tra pari che, secondo Sakana, si avvicinava alla precisione umana nell’attribuire punteggi agli articoli. Il costo faceva notizia quanto le capacità: Sakana lo stimava in circa 15 dollari per articolo generato, una cifra pensata per mostrare quanto potesse diventare economica la produzione di ricerca generata dalle macchine.

Il successore, AI Scientist-v2 (aprile 2025), ha sostituito alcune parti della pipeline originale con un processo agentico di ricerca ad albero per esplorare e perfezionare gli esperimenti. Sakana lo ha usato per produrre un articolo sottoposto, secondo la consueta procedura a doppio cieco del workshop, a un workshop dell’ICLR 2025. Ha ottenuto 6,33 punti su 10 — sopra la soglia media di accettazione di quella sede — diventando, secondo Sakana, il primo articolo interamente generato dall’IA a superare una vera soglia di accettazione nella revisione tra pari condotta da esseri umani.

Il contesto conta: si trattava di un workshop con un tasso di accettazione del 60–70%, non di una presentazione alla conferenza principale, dove il tasso è nell’ordine del 20–30%. Inoltre, Sakana ha ritirato volontariamente l’articolo prima della pubblicazione, anziché lasciarlo figurare come lavoro accettato, dichiarando di voler rispettare le convenzioni dell’ICLR.

La distanza tra la presentazione promozionale e la realtà emerge chiaramente dalle analisi indipendenti. Una valutazione separata dell’AI Scientist originale ha rilevato che il 42% degli esperimenti tentati falliva del tutto a causa di errori nel codice e che, nella fase di rassegna della letteratura, il sistema valutava abitualmente male la novità dei lavori, segnalando idee già consolidate come contributi nuovi. Nei suoi stessi resoconti, Sakana riconosce che il sistema inventa citazioni bibliografiche e, occasionalmente, fabbrica risultati; in un caso specifico segnalato dalla stessa azienda, aveva attribuito una tecnica a un articolo del 2016, quando la sua vera origine era una pubblicazione del 1997.

Tutto questo non cancella il risultato di aver costruito una pipeline capace di produrre, dall’inizio alla fine, un articolo accettabile per un workshop. Significa però che, oggi, «scoperta completamente automatizzata» vuol dire «produzione automatizzata su larga scala, con un alto tasso di difetti che un essere umano deve individuare».

AI co-scientist di Google: ipotesi a un altro ritmo

«AI co-scientist» di Google, presentato il 19 febbraio 2025 e basato su Gemini 2.0 — la generazione di modelli allora più recente, sei versioni prima di Gemini 3.8 Flash del settembre 2026 — affronta una parte più circoscritta del problema e, finora, meglio convalidata: la formulazione di ipotesi e di proposte per la progettazione degli esperimenti, anziché la loro esecuzione. È organizzato come una coalizione di agenti specializzati — Generation, Reflection, Ranking, Evolution, Proximity e Meta-review — che perfezionano iterativamente le ipotesi candidate attraverso un torneo auto-migliorativo basato su «genera, dibatti, evolvi». In pratica, il sistema sottopone le proprie idee a un dibattito automatizzato simile alla revisione tra pari, prima di presentare a uno scienziato umano una rosa ristretta di ipotesi ordinate per merito.

A distinguerlo dall’approccio di Sakana è il fatto che i suoi risultati sono stati verificati con esperimenti di laboratorio reali e pubblicati su Nature il 19 maggio 2026 nell’articolo «Accelerating scientific discovery with Co-Scientist» (doi:10.1038/s41586-026-10644-y). L’articolo si fonda su tre casi. Nella ricerca sulla leucemia mieloide acuta, il sistema ha proposto farmaci candidati a un nuovo impiego e approcci basati su terapie combinate, poi testati in vitro: diversi composti suggeriti hanno effettivamente ridotto la vitalità tumorale in più linee cellulari di leucemia mieloide acuta, a concentrazioni clinicamente rilevanti. Il dato più netto dell’articolo riguarda KIRA6, un inibitore di IRE1α: un IC50 di 10 nM sulle cellule KG-1a di leucemia mieloide acuta e una differenza di 18 volte rispetto ai controlli normali.

In un progetto sulla fibrosi epatica guidato da Stanford, il ricercatore Gary Peltz ha usato il sistema per cercare farmaci già esistenti, ma trascurati, da destinare a un nuovo impiego. Il sistema ha individuato vorinostat, un farmaco oncologico già approvato dalla FDA, come possibile candidato; nei test su organoidi epatici, vorinostat ha ridotto del 91% un’alterazione della struttura della cromatina indotta da TGFβ.

In uno studio di caso sulla resistenza antimicrobica, il sistema ha proposto autonomamente che le isole cromosomiche inducibili dai fagi e capaci di formare capsidi interagiscano con code fagiche diverse per ampliare la gamma dei loro ospiti. Secondo l’articolo, l’IA è arrivata a questa ipotesi in due giorni di lavoro in silico, giungendo alla stessa conclusione che un altro gruppo di laboratorio aveva impiegato anni a raggiungere sperimentalmente e che i dati non pubblicati di quel gruppo corroboravano.

Google è prudente su ciò che questi risultati dimostrano, e i dati giustificano tale prudenza. Sono tutti risultati preclinici o ottenuti in vitro. Nessuno è stato verificato in una sperimentazione sull’uomo. Il sistema abbrevia la fase iniziale della ricerca: le settimane o i mesi normalmente necessari per esaminare e sintetizzare la letteratura e selezionare le ipotesi prima di un singolo esperimento. Questa riduzione dei tempi è reale e misurabile. Non equivale però a eseguire l’esperimento o a convalidarne il risultato: compiti che restano interamente affidati ai laboratori umani.

Coscientist: un LLM che dirige il lavoro in laboratorio

Se il sistema di Google si ferma alla lavagna, Coscientist — sviluppato da Gabe Gomes, Daniil Boiko e Robert MacKnight alla Carnegie Mellon e presentato su Nature nel dicembre 2023 — è stato progettato per entrare nel laboratorio vero e proprio. È un sistema modulare basato su più LLM (principalmente su GPT-4, con Claude impiegato anche in alcune parti del processo) che pianifica ed esegue attività chimiche reali: cerca informazioni su Internet e nella documentazione tecnica, scrive ed esegue codice e invia comandi ai sistemi robotici di automazione del laboratorio, completando il percorso dall’idea al risultato fisico con una supervisione umana limitata.

Fra le sei attività dimostrative, il risultato più citato di Coscientist è l’ottimizzazione autonoma di una reazione di accoppiamento incrociato catalizzata dal palladio: il genere di problema di ottimizzazione con più parametri (catalizzatore, ligando, solvente, temperatura, stechiometria) che un chimico normalmente affronterebbe di persona nell’arco di giorni.

Coscientist è una prova di fattibilità, non uno strumento pronto per l’uso operativo: sei attività costituiscono un benchmark ristretto e l’«autonomia» consisteva nel dirigere apparecchiature robotiche preesistenti, costruite per l’automazione, non nel progettare nuovi dispositivi fisici. Resta però una delle dimostrazioni pubblicate più chiare del fatto che un modello linguistico può costituire il livello decisionale che controlla direttamente le apparecchiature di laboratorio, anziché limitarsi a generare testi a loro supporto.

Laboratori autonomi: A-Lab e la verifica della riproducibilità

La versione più industriale di questa idea è il «laboratorio autonomo»: un ciclo chiuso di calcolo, robotica e machine learning che funziona per giorni consecutivi con un intervento umano minimo. L’esempio pubblicato più chiaro è A-Lab, presso il Lawrence Berkeley National Laboratory, descritto in un articolo uscito su Nature nel 2023: combina previsioni di stabilità ab initio (tra cui quelle relative a composti candidati individuati dal progetto GNoME di DeepMind, che ha aggiunto circa 380.000 nuovi candidati al database Materials Project), dati storici sulla sintesi ricavati dalla letteratura e robotica guidata dall’apprendimento attivo per pianificare, eseguire e reinterpretare esperimenti di sintesi allo stato solido. Nella serie di esperimenti principale descritta nell’articolo, A-Lab ha operato ininterrottamente per 17 giorni e ha sintetizzato con successo 36 dei 57 composti inorganici prescelti.

A-Lab è anche il caso che illustra meglio perché le affermazioni sulla «scoperta autonoma» vadano verificate, anziché prese per buone. Nel 2024, il chimico dello stato solido della UCL Robert Palgrave e i suoi colleghi hanno pubblicato una critica in cui mostravano che una parte consistente dei composti presentati da A-Lab come «nuovi» era già presente nell’Inorganic Crystal Structure Database: non erano dunque nuovi per la scienza, ma soltanto per il database di previsione con cui A-Lab li confrontava.

Palgrave ha sostenuto che la discrepanza fosse abbastanza grave da giustificare il ritiro dell’articolo. Nature ha invece pubblicato una rettifica formale degli autori il 19 gennaio 2026. Nella rettifica, gli autori hanno chiarito che per «nuovi» intendevano «nuovi per la piattaforma di previsione», non nuovi per la letteratura scientifica, e hanno aggiornato di conseguenza il testo dell’articolo. La rettifica ha risolto quello specifico problema di rappresentazione dei risultati, ma non tutte le obiezioni metodologiche sollevate dai critici, comprese le domande su quanto il modello sottostante riesca a gestire il disordine strutturale riscontrato nel mondo reale.

L’episodio è un utile correttivo all’enfasi sulla scoperta autonoma in generale: automatizzare la sintesi e automatizzare la formulazione di un’affermazione difendibile sulla novità di un composto sono due problemi diversi, e non risolti nella stessa misura.

Il livello infrastrutturale: laboratori cloud e database delle proteine

La sperimentazione autonoma dipende da un’infrastruttura che non finisce sui giornali, ma che probabilmente è più fondamentale di qualsiasi singolo sistema di IA. Emerald Cloud Lab opera come laboratorio remoto commerciale: gli scienziati spediscono campioni alla sua struttura e progettano gli esperimenti tramite software anziché lavorare al banco, usando il Symbolic Lab Language proprietario di ECL per specificare protocolli con una precisione tale che le stesse istruzioni producano la stessa esecuzione, indipendentemente da chi le esegue, che sia un tecnico umano o un braccio robotico.

La piattaforma comprende oggi oltre 200 tipi di strumenti e più di 100 classi distinte di esperimenti, e il suo linguaggio è stato usato in oltre 600.000 esperimenti registrati. Nel 2021 Carnegie Mellon ha stretto una partnership con ECL per costruire quello che è stato descritto come il primo laboratorio cloud affiliato a un’università, integrando questo modello di esecuzione a distanza direttamente nella ricerca accademica anziché lasciarlo confinato all’ambito commerciale.

Piattaforma Metrica Dato
Emerald Cloud Lab Tipi di strumenti 200+
Emerald Cloud Lab Classi di esperimenti 100+
Emerald Cloud Lab Esperimenti registrati 600.000+
AlphaFold DB Strutture previste 214 milioni+
AlphaFold DB Ricercatori che lo utilizzano 2 milioni+
AlphaFold DB Paesi raggiunti ~190

AlphaFold rientra in questo discorso non tanto come «scienziato autonomo», quanto come il precedente che ha reso plausibile finanziare il resto. Non genera ipotesi né esegue esperimenti; elimina un preciso collo di bottiglia nelle previsioni — ricavare la struttura di una proteina dalla sua sequenza — trasformando un’attività di laboratorio che poteva richiedere mesi per ogni struttura in un calcolo che richiede minuti. L’AlphaFold Protein Structure Database comprende oggi più di 214 milioni di strutture previste e, secondo quanto riportato, è usato da oltre 2 milioni di ricercatori in circa 190 paesi.

Questo impatto ha ricevuto un riconoscimento formale nel 2024, quando Demis Hassabis e John Jumper hanno ricevuto metà del premio Nobel per la chimica per le previsioni della struttura delle proteine realizzate con AlphaFold, condividendo il premio con David Baker per il suo lavoro sulla progettazione computazionale delle proteine. AlphaFold è la prova più solida finora disponibile che un sistema di IA può produrre risultati di cui la comunità scientifica si fida abbastanza da usarli come base per ulteriori lavori su larga scala. Ma ci è riuscito risolvendo in modo esaustivo un compito di previsione ben definito, non agendo come agente di ricerca generalista.

La chimica robotica oltre i sistemi più noti

L’idea di codificare la chimica come codice eseguibile precede l’attuale ondata di sistemi basati sui grandi modelli linguistici. Il Cronin Group della University of Glasgow lavora da anni allo sviluppo della «chemputation»: la rappresentazione dei percorsi di sintesi in un Chemical Description Language (χDL) che una piattaforma robotica può eseguire direttamente, rendendo una sintesi chimica condivisibile e riproducibile quanto il codice sorgente. Questa linea di ricerca, che comprende piattaforme precedenti descritte in pubblicazioni scientifiche per la sintesi in flusso di molecole organiche pianificata dall’IA, è stata commercializzata attraverso Chemify, spinout del Cronin Group fondato nel 2022.

È un promemoria del fatto che «laboratorio autonomo» non è sinonimo di «grande modello linguistico»: alcune delle forme più mature di automazione in chimica si basano sulla pianificazione simbolica e sulla robotica, senza alcun modello linguistico nel processo. L’attuale spinta ad aggiungere a questa infrastruttura capacità di ragionamento basate sui grandi modelli linguistici rappresenta un’integrazione di un sistema di automazione già esistente, non la sua creazione da zero.

Che cosa significa davvero «autonomo» oggi

Considerati uno accanto all’altro, questi sistemi non delineano un’unica traiettoria verso ricercatori artificiali indipendenti, ma diverse capacità che maturano a ritmi differenti. La generazione di ipotesi e la selezione della letteratura scientifica — come nel caso del co-scientist di Google — sembrano le capacità più avanzate, con una validazione sottoposta a revisione paritaria, sebbene preclinica.

L’esecuzione di esperimenti fisici — Coscientist, A-Lab, l’infrastruttura di Emerald Cloud Lab — funziona, ma solo negli ambiti in cui le azioni possibili sono abbastanza circoscritte da poter essere gestite in modo affidabile dalla robotica e dai software di pianificazione; la sintesi di materiali allo stato solido e le reazioni organiche ben caratterizzate sono molto più gestibili della progettazione sperimentale senza vincoli prestabiliti. L’automazione dell’intero processo, compresa la stesura dell’articolo che ne deriva e la difesa delle sue conclusioni — come nel caso di AI Scientist di Sakana — è la meno affidabile delle tre: negli esperimenti stessi sono stati riscontrati tassi di errore non trascurabili, resi pubblici, e gli autori hanno riconosciuto la presenza di allucinazioni nei testi.

La rettifica relativa ad A-Lab offre la lezione più netta: anche un sistema autonomo davvero capace può produrre un’affermazione da titolo di giornale («abbiamo creato nuovi materiali») che poi risulta basata su un confronto incompleto con la documentazione scientifica esistente. Per individuare quell’errore è servito un esperto esterno, non un’ulteriore automazione.

Il numero dei sistemi continua a crescere, ma lo schema non cambia. Il 28 agosto 2026 Sapient Intelligence ha lanciato in versione beta PRAXIST, un sistema autonomo di R&S che sceglie da sé l’approccio tecnico anziché eseguirne uno assegnato. Nelle 75 competizioni Kaggle di MLE-Bench ha raggiunto la fascia più alta delle medaglie in 49, con un costo del modello dichiarato di circa 3.000 dollari, contro le 34 di Claude Code a circa 38.000 dollari nelle stesse condizioni. Il 16 settembre 2026 Novo Nordisk ha dichiarato che avrebbe introdotto Claude Science di Anthropic in specifici processi di R&S, prevedendo protocolli di governance dei dati e requisiti di supervisione umana. Ricerche meno costose, strumenti migliori, la stessa firma in calce.

È a questo punto che si trova il settore nel settembre 2026: questi sistemi formulano sempre più spesso autentiche questioni scientifiche, eseguono le relative attività di ricerca e talvolta agiscono di conseguenza. Ma la verifica — accertare la novità rispetto all’intera documentazione scientifica, individuare una citazione inventata, stabilire se un risultato in vitro abbia qualche significato per un paziente — dipende ancora dalle competenze umane, di cui ogni risultato attendibile pubblicato finora ha avuto bisogno.

Esplora

Altri articoli