Ricerca
DianShi-RxnDB: una piattaforma di dati sulle reazioni organiche su larga scala e a granularità fine, realizzata mediante una pipeline interamente automatizzata per ricercatori e agenti di IA
I dati strutturati di alta qualità sulle reazioni organiche sono essenziali per sviluppare l’intelligenza artificiale per la chimica (AI4Chem), ma gran parte di queste conoscenze resta dispersa tra te

- arXiv
- 2609.06703
- Pubblicato
- 2026-09-06
- Autori
- Yubin Wang, Xingjian Wei, Jiang Wu, Yinfan Wang, Boyu Zhu, Lin Zhang, Jianing Yu, Huazheng Zeng, Ruiyi Ding, Junyuan Gao, Jiaxing Sun, Lingli Ge, Haote Yang, Jingchao Wang, Aijia Guo, Qian Jiang, Yurui Zhao, Wenjian Zhang, Chen Zhu, Lijun Wu, Xiaolei Yang, Haodong Chen, Junjie Yuan, Zichao Ye, Shaowei Hou, Jing Ye, Jia Yu, Shan Wang, Lijun Wu, Jiantao Qiu, Chao Xu, Yuqiang Li, Guangyu Wang, Bowen Zhou, Dahua Lin, Conghui He
Abstract degli autori
I dati strutturati di alta qualità sulle reazioni organiche sono essenziali per sviluppare l’intelligenza artificiale per la chimica (AI4Chem), ma gran parte di queste conoscenze resta dispersa tra testi di brevetti, immagini e schemi di reazione. Presentiamo DianShi-RxnDB, una piattaforma di dati sulle reazioni organiche su larga scala e a granularità fine, realizzata mediante una pipeline interamente automatizzata di estrazione e normalizzazione che integra testi di brevetti, immagini e schemi di reazione. Il corpus comprende brevetti sulla sintesi organica pubblicati dall’USPTO e dall’EPO tra il 1976 e il 2025 e contiene circa 24 milioni di istanze di reazione, di cui circa 14,8 milioni (61,7%) superano i controlli automatici di qualificazione. Ogni istanza rappresenta uno specifico esperimento in un’unica fase e registra partecipanti, ruoli, quantità, temperature, tempi di reazione, rese, procedure sperimentali e collegamenti ai brevetti di origine per la tracciabilità. In una valutazione manuale di 1.300 istanze qualificate selezionate a campione, l’accuratezza a livello dei campi, calcolata mediante micro-media, è stata del 92,95%. Un confronto a parità di condizioni con Pistachio ha inoltre indicato vantaggi nel numero di record dopo la deduplicazione, nella granularità della rappresentazione e nella corrispondenza esatta a livello dei campi. La piattaforma offre un ambiente di lavoro per la ricerca accessibile via Web, che consente di cercare, filtrare, confrontare e verificare i record rispetto alle fonti, e un servizio Model Context Protocol (MCP) che mette a disposizione degli agenti di IA strumenti componibili per il recupero strutturato dei dati. DianShi-RxnDB è disponibile all’indirizzo https://dianshi.opendatalab.org.cn/ .
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv