开发新药可能需要数千次化学实验,才能确定安全、有效且价格合理的药物配方。这个过程缓慢且劳动密集,许多反应还依赖难以获取的金属作为关键催化剂。
虽然人工智能正在帮助加速药物发现,但它只能从现有数据中学习,而化学反应领域恰恰缺乏训练强大AI工具所需的大规模高质量数据集。
这正是密歇根大学药学院Tim Cernak及其团队的工作方向。他们创建了一个包含超过5万次精心设计的化学实验的开放数据库,测试了数千种成分和条件的组合,以更好地理解形成碳氮键(许多药物的关键结构单元)的反应。
Cernak表示,该数据库是迄今为止最大的化学反应数据集,并且只是可能发展成更大规模化学反应条件库的开始,这个库将为AI系统提供数据。
耗时十年构建平台
“构建能够实现这一目标的平台花了十多年时间,但这仍然只是冰山一角,”药学院药物化学副教授Cernak说。这些数据通过开放反应数据库(Open Reaction Database)免费向科学家提供。“我们对其他科学家能够在这个新数据集中发现的成果感到兴奋,这里有太多数据可以挖掘。”
让研究人员和AI系统获得更多反应数据,有助于更快、更高效地识别有前景的药物制造方法。它还可以帮助科学家找到基于贵金属的昂贵或难以获取催化剂的替代品,这些催化剂常用于药物制造。
“最新在研药物对化学合成的复杂性要求越来越高。与此同时,贵金属及其他关键反应组分的供应链正暴露出风险,”Cernak说。“像这样的大数据批量发布,将是构建能够更快制造更好药物的预测模型所必需的。”
镍和铜显示出潜力
除了共享所有数据,这项发表在《美国化学会志》上的研究还比较了不同催化剂(特别是钯、镍和铜)在相似条件下的表现。这一点很重要,因为钯是药物合成中许多反应的首选催化剂,但钯的供应仅由少数几个国家控制。
然而,研究发现某些反应使用镍催化剂时表现同样良好,甚至有些使用铜催化剂也可以,而铜在全球范围内都能获得。该数据库使研究人员能够更轻松、更快速地比较催化剂和反应。
“一个关键发现是,大规模、系统设计的反应数据集可以揭示传统范围研究难以发现的模式,”Cernak说。“例如,我从未预料到高度反应性的中间体分子(如芳炔)能在如此低的温度下形成,但当我们成百上千次观察到这一现象时,就难以忽视。这为无需贵金属催化剂合成药物提供了令人兴奋的可能性。”
更详细信息:Jayabrata Das等人,《一个包含50,688次反应的数据集揭示了C-N偶联中的通用配体和机理多样性》,《美国化学会志》,2026年。
提供:密歇根大学
本报道最初发表于Phys.org。
【全文结束】

