Vai al contenuto
AI.info

The Pulse

Microsoft rilascia RetroChimera con licenza open source per pianificare la sintesi di molecole

Microsoft Research ha rilasciato RetroChimera, un modello di IA con licenza MIT che prevede percorsi retrosintetici per piccole molecole. Il sistema combina due modelli complementari e, nelle valutazioni di esperti su difficili obiettivi di

Microsoft rilascia RetroChimera con licenza open source per pianificare la sintesi di molecole

AI.info Team ·

Microsoft Research pubblica il codice e i pesi del modello RetroChimera, sostenendo che l’IA può migliorare un’attività che i chimici svolgono ancora attraverso una pianificazione laboriosa e guidata da esperti: partire dalla molecola desiderata e risalire agli ingredienti e alle reazioni necessari per ottenerla.

La pubblicazione accompagna un articolo su Nature che descrive il modello e la sua valutazione. Microsoft presenta RetroChimera come una risposta a una debolezza persistente della pianificazione della sintesi assistita dal computer: i sistemi possono ottenere buoni risultati sulle reazioni comuni, ma non individuare trasformazioni rare, generare suggerimenti chimicamente implausibili o proporre percorsi che non funzionano quando si concatenano più passaggi.

Questa affermazione è accompagnata da una precisazione nel repository della stessa Microsoft. L’azienda avverte che RetroChimera può avere allucinazioni, in particolare al di fuori della distribuzione dei dati di addestramento, e afferma che tutte le previsioni devono essere valutate e verificate in modo indipendente da esperti di chimica. La tensione tra risultati migliori nei benchmark e necessità di supervisione esperta definisce questa pubblicazione.

Due modelli colmano punti ciechi diversi in chimica

RetroChimera prevede passaggi retrosintetici. Data una molecola bersaglio, procede a ritroso proponendo molecole precursori e reazioni che potrebbero produrle, ripetendo il processo finché il percorso non raggiunge elementi costitutivi più semplici o disponibili in commercio.

Il sistema combina due sottomodelli con architetture diverse. R-SMILES 2 è un modello basato su Transformer che genera direttamente le molecole precursori a partire dalla struttura bersaglio. La libertà di apprendere schemi di reazione dai dati lo aiuta a gestire trasformazioni che comportano cambiamenti sostanziali a una molecola, ma quella stessa libertà può generare risultati non validi.

NeuralLoc adotta un approccio più vincolato. La rete neurale a grafo rappresenta la molecola bersaglio e i template di reazione come grafi, quindi prevede quale template applicare e in quale punto. Le previsioni basate su template possono essere più affidabili quando la chimica pertinente è presente nei dati di addestramento, anche se il metodo è meno flessibile quando una reazione non rientra nella sua libreria di template.

RetroChimera combina le proposte dei due modelli usando un sistema di classificazione appreso. Ciascun modello assegna punteggi ai possibili insiemi di reagenti in base alla loro posizione in classifica, con un ulteriore supporto quando entrambi propongono la stessa reazione. Secondo Microsoft, il modello d’insieme può eguagliare il componente più efficace nelle diverse classi di reazioni, riducendo al contempo i punti deboli di ciascun modello usato da solo.

Gli esperti hanno accettato nove percorsi completi su 10

La valutazione di Microsoft si è concentrata su un aspetto difficile della pianificazione della sintesi: una sola reazione errata può invalidare un intero percorso a più passaggi. Nella valutazione di esperti su 10 bersagli difficili, i chimici hanno accettato percorsi completi generati da RetroChimera per nove bersagli. I valori corrispondenti sono stati cinque per il modello de novo, quattro per un modello basato sulla modifica e due per il modello di riferimento NeuralSym.

Anche le singole previsioni di reazione hanno ottenuto buoni risultati nei confronti in cieco. Microsoft afferma che i chimici con un dottorato hanno preferito i suggerimenti di RetroChimera ai risultati dei suoi modelli componenti, agli approcci consolidati e alle reazioni tratte dal set di test. Un resoconto separato di Microsoft sul lavoro afferma che nove chimici organici di Microsoft e di importanti aziende farmaceutiche hanno preferito la proposta migliore di RetroChimera ai percorsi documentati in precedenza circa il 64% delle volte.

Questi risultati misurano se gli esperti ritengono accettabile una reazione o un percorso proposto. Non dimostrano che il modello abbia sintetizzato autonomamente ogni composto proposto e non eliminano la necessità di test di laboratorio. Il repository di Microsoft consiglia espressamente agli utenti di richiedere non più di cinque-10 reazioni per input, a meno che non applichino filtri rigorosi.

I dati proprietari sono la prova più difficile

I set di dati pubblici sulle reazioni sono utili per i benchmark, ma non rappresentano la chimica di tutte le aziende. I team farmaceutici lavorano spesso con registri elettronici di laboratorio interni e raccolte di reazioni che differiscono dai dati pubblici di addestramento per le molecole, le classi di reazione e le pratiche di documentazione che comprendono.

Lo studio su Nature riporta un trasferimento zero-shot a un set di dati interno di una grande azienda farmaceutica, mentre il resoconto di Microsoft afferma che il modello è stato adattato ai dati proprietari di GSK. L’azienda presenta questo risultato come prova del fatto che RetroChimera può andare oltre i benchmark accademici standard e supportare contesti in cui la chimica disponibile differisce dai dati usati per sviluppare il modello originale.

Microsoft non presenta la pubblicazione come quella di un chimico autonomo già pronto all’uso. Il repository afferma che il checkpoint principale di RetroChimera è stato addestrato sui dati sulle reazioni di Pistachio e che i dati di addestramento a disposizione del modello arrivano fino al 2023. Microsoft fornisce anche checkpoint meno efficaci, addestrati su USPTO-50K e USPTO-FULL per i benchmark, oltre a un checkpoint per il modello diretto, addestrato su Pistachio.

Licenza MIT, ma la revisione degli esperti resta obbligatoria

L’implementazione è disponibile nel repository pubblico di GitHub di Microsoft con licenza MIT, e Microsoft afferma che il modello è accessibile anche tramite Microsoft Foundry. Il repository include istruzioni per l’installazione, esempi di inferenza e indicazioni per usare i checkpoint pubblicati.

La documentazione di Microsoft elenca diverse limitazioni. Le previsioni possono essere meno accurate nella chimica accademica specialistica e nella chimica dei prodotti naturali, mentre il rumore nel set di dati di Pistachio rende necessario verificare i risultati consultando la letteratura pertinente. L’azienda consiglia di affiancare il modello a strumenti che valutano la fattibilità delle reazioni, usare modalità basate sul consenso e fare fine-tuning su dati di laboratorio o di letteratura specifici del settore, ove opportuno.

RetroChimera è quindi un sistema di ricerca per dare priorità alle idee di sintesi e verificarle, non un sostituto del giudizio chimico. Il suo contributo immediato è più concreto: i ricercatori possono ora esaminare, eseguire e adattare lo stesso framework d’insieme descritto nello studio su Nature, invece di affidarsi soltanto ai risultati pubblicati.

Il codice e i pesi di RetroChimera sono disponibili su GitHub; i risultati della ricerca sul modello sono descritti da Microsoft Research.

Fonte

Esplora

Altri articoli