在寻找新型药物分子的过程中,研究人员通常依赖计算机辅助的快速筛选大量化合物库,以识别能够阻断药物靶点的物质。这种靶点可能是一种使细菌能够抵抗抗生素或病毒能够感染宿主的酶。近年来,这些小有机分子集合的规模大幅增长。由于化合物库的增长速度超过了处理它们所需计算机的速度,即使是使用最先进的超级计算机,对现代十亿级化合物库进行单一药物靶点的筛选也可能需要数月甚至数年时间——因此,显然迫切需要更快的方法。
在最近发表在《化学信息与建模杂志》上的一项研究中,东芬兰大学药学院的Ina Pöhner博士及其同事与芬兰强大超级计算机的主办机构CSC——科学IT中心有限公司——以及Orion Pharma的工业合作伙伴合作,研究了机器学习在加速千兆级虚拟筛选中的前景。
在应用人工智能加速筛选之前,研究人员首先建立了一个基线:在一项前所未有的大规模虚拟筛选活动中,借助Mahti和Puhti超级计算机以及分子对接技术,在近六个月的时间里评估了15.6亿个药物样分子对两个药理相关靶点的作用。对接是一种计算技术,它将小分子拟合到靶点的结合区域,并计算"对接评分"来表示它们的匹配程度。通过这种方式,首先确定了所有15.6亿个分子的对接评分。
接下来,将结果与使用HASTEN的机器学习增强筛选进行比较,HASTEN是由Orion Pharma的Tuomo Kalliokoski博士开发的工具,也是该研究的合著者。Kalliokoski解释道:"HASTEN使用机器学习来学习分子的特性以及这些特性如何影响化合物的评分。当提供足够多从传统对接中提取的示例时,机器学习模型可以比蛮力对接方法更快地预测库中其他化合物的对接评分。"
事实上,仅使用整个库1%的分子对接并用作训练数据,该工具就能在不到十天内正确识别90%的最佳评分化合物。
该研究代表了首次在千兆规模上对机器学习增强对接工具与传统对接基线进行严格比较。"我们发现机器学习增强工具能够可靠且重复地在显著缩短的时间框架内重现传统对接识别的大部分高评分化合物,"Pöhner说。
"这个项目是学术界和产业界合作的绝佳范例,以及CSC如何提供世界一流的计算资源。通过结合我们的想法、资源和技术,我们实现了雄心勃勃的目标,"领导东芬兰大学DrugTech研究社区内计算药物发现小组的Antti Poso教授继续说道。
在大多数环境中,类似规模的研究仍然难以实现。因此,作者将研究过程中生成的大型数据集发布到公共领域:他们用于对接的现成筛选库,使其他人能够加速各自的筛选工作,以及针对两个靶点的全部15.6亿化合物对接结果作为基准数据。这些数据将鼓励开发节省时间和资源的工具,并最终推动计算药物发现领域的发展。
【全文结束】

