开发新药往往需要进行数千次化学实验,以确定安全、有效且价格合理的药物配方。这一过程缓慢且劳动密集,许多反应依赖难以获取的金属作为必要的催化剂。
尽管人工智能正在加速药物发现过程,但它只能从现有数据中学习。而在化学反应领域,训练强大AI工具所需的高质量大型数据集仍然匮乏。
这时,密歇根大学药学院的Tim Cernak及其团队介入了。他们创建了一个开放获取的数据库,包含50,000多个精心设计的化学实验,测试了数千种原料组合和反应条件,以更好地理解形成碳氮键的反应——这是许多药物的基本构建模块。
Cernak表示,该数据库是迄今为止最大的化学反应数据集合,仅是未来可能发展成更庞大化学反应条件库的开端,这些条件数据将为AI系统提供支持。
"构建这一平台已耗时十余年,但这仍只是触及表面。"密歇根大学药学院药物化学副教授Tim Cernak表示。
这些数据通过Open Reaction Database(一个用于共享化学反应的网站)向全球科学家免费开放。
Cernak表示:"我们对其他科学家在这个新数据集中可能发现的成果感到兴奋。这里有大量数据可供挖掘。"
为研究人员和AI系统提供更多反应数据,可以帮助更快速、高效地识别有前景的药物合成方法。它还可以帮助科学家找到替代药物制造中使用的昂贵或难以获取的贵金属催化剂的方案。
"研发管线中的最新药物正在提高化学合成的复杂度标准,"Cernak说,"同时,贵金属和其他关键反应组件的供应链风险日益凸显。像这样的大数据集将有助于构建能够更快制造更好药物的预测模型。"
除了共享所有数据外,这项发表在《美国化学学会杂志》上的研究还比较了不同催化剂(特别是钯、镍和铜)在相似条件下的表现。这一点很重要,因为钯是药物合成中许多反应的首选催化剂,但钯的供应仅由少数几个国家控制。
然而,研究发现,某些反应使用镍催化剂表现同样良好,有些甚至使用铜催化剂也能达到效果,而铜可以在全球各地获取。该数据库使研究人员能够更轻松、快速地比较不同催化剂和反应条件。
Cernak表示:"一个关键发现是,大规模系统设计的反应数据集可以揭示仅从传统范围研究中难以看到的模式。例如,我从未预料到称为芳炔(arynes)的高度反应性中间分子能够在如此低的温度下形成,但当我们反复观察到这一现象时,很难忽视其重要性。这为无需贵金属催化剂合成药物提供了一个令人兴奋的可能性。"
【全文结束】

