众所周知,当今进入临床试验的许多候选药物最终都无法到达患者手中。绝大多数药物研发失败,部分原因是人体生物学比临床前研究中所能模拟的要复杂得多。
新方法学和人工智能的出现标志着一个新时代的到来,在这个时代,我们不再需要完全依赖传统模型。特别是,人工智能工具不仅能预测结果——提高药物开发后期阶段的成功几率——还能发现曾经难以触及的新型靶点,以及开发以前无法实现的治疗方法。
此前已探讨过数字孪生在药物开发中的作用,Bioptimus的联合创始人兼首席执行官Jean-Philippe Vert博士与《科技网络》讨论了药物发现中使用的人工智能方法、迄今为止的影响以及限制其全部潜力的障碍。本文是探索人工智能在药物发现和开发全流程中作用的系列文章的第一篇,涵盖临床前研究、虚拟对照组和临床试验。
结合人工智能方法进行药物发现
大型语言模型(LLM)利用统计模式和数学概率生成响应。输出是逐步或逐字生成的,通常是文本或代码。扩散模型通过从一张随机数学噪声开始创建输出,几乎就像电视静态屏幕,然后在空间上预测要减去什么,直到图像变得清晰。
问(Izzy Hirst): 目前药物发现中主要使用哪些人工智能方法?哪些治疗领域取得了最有意义的影响?
Jean-Philippe Vert博士: 人工智能实现的一大突破是新小分子和大分子的设计。就使用的技术而言,与大型语言模型(LLMs)中的技术非常相似。例如,几年前,DeepMind开发了AlphaFold(一种用于蛋白质的LLM),用于从蛋白质序列预测其结构。此后该模型不断发展。现在,我们可以给它一个序列,它就能预测蛋白质结构和相互作用,甚至可以设计具有目标结构的新蛋白质。
用于蛋白质设计的主要工具将LLMs与扩散网络或生成式人工智能相结合。这些是用于理解蛋白质语言并生成新的治疗性蛋白质的核心技术。
当您有明确目标时,这些工具非常强大,但有许多疾病我们并不知道什么是好的靶点。在肿瘤学领域,我们已经看到了显著进展,部分原因是了解其生物学原理。这可能并非适用于所有癌症,但在许多癌症中,存在明确的靶点——可能是体内变得过度活跃的某种蛋白质——我们知道,如果我们能干扰它,就能减缓或阻止癌症。因此,我认为肿瘤学可能是目前受益最多的领域。
问(Izzy Hirst): 到目前为止,人工智能在药物发现中提供了哪些最显著的益处?
Jean-Philippe Vert博士: 人工智能正在加速药物发现,从靶点识别到将候选药物带入临床试验。到目前为止,人工智能最具影响力的效果是减少了所需时间。
这并不是说我们以前不能做这些事情,但公司表示过去需要五到七年——现在不到两年。
这些阶段的时间被压缩了,支出也减少了,但这产生了一个新问题。太多候选药物将进入临床试验。我们已经看到进行临床试验的困难:找到足够的患者并充分利用他们的时间。我们希望确保为患者提供最佳机会。
虽然人工智能已经彻底改变了从靶点发现到临床前工作的过程,但下一阶段真正的问题是,人工智能如何降低风险、优化和加速临床试验?一旦我们在患者身上测试药物,如何改进?理解患者反应要复杂得多。
当我们将药物送入临床试验时,即使有最聪明的人才和最大的预算,我们仍有90%的失败率。这就是人工智能擅长理解、模拟和生成假设的地方。生物学是一个复杂的领域,当你拥有大量复杂数据时,人工智能善于建立联系。
在我们看到市场上涌现大量新药之前,我想谨慎地表示,目前我们所拥有的只是期望。
问(Izzy Hirst): 人工智能生成的假设需要哪些支持才能进入临床前研究?我们是否正在看到——或者何时可能看到——资源使用的显著减少?
Jean-Philippe Vert博士: 我们已经看到时间的减少,而且通常时间就等于预算。目标是更高效地筛选并确定具有强大潜力的候选药物。
但是,虽然人工智能在计算世界中几乎是自主的,但仅凭这一点你永远不会进入临床试验。这就是"实验室闭环"(lab-in-the-loop)方法的用武之地。要使人工智能在药物发现过程中高效,必须将其与现实世界相结合。实验室可以生成蛋白质和分子,在细胞中测试它们,等等。
因此,在时间和金钱方面,计算部分更快,但其余部分基本保持不变,因为我们仍然需要在现实世界中验证人工智能的预测。
问(Izzy Hirst): 如何有效地训练和及时迭代用于药物发现的人工智能模型?
Jean-Philippe Vert博士: 该领域正试图寻找更快的迭代方式,而不是等待临床试验成功或失败所需的10年时间。
最终,临床试验的成功仍然是唯一重要的事情。归根结底,这是我们为需要治疗的患者提供治疗的方式。但这对于人工智能迭代来说不够快。
因此,我们了解到这可以在临床前阶段完成,通过向LLMs提供在细胞培养、类器官、动物模型等中收集的数据。然后,在临床试验的每个阶段,都有迭代的机会。
这有助于在过程早期改进决策,并实现更准确的人工智能预测。有很多研究正在尝试捕捉药物可能有效或无效的早期信号。这是我们能更早做出正确决策的唯一途径。
人工智能中的黑箱
在人工智能背景下,黑箱可以指两件事。首先,是人工智能系统的不可解释性,因为黑箱模型意味着可以看到输入和输出,但看不到中间的处理步骤。其次,它也可以指数据孤岛,因为人工智能系统及其专有信息通常不共享。
问(Izzy Hirst): 该领域如何应对人工智能"黑箱"挑战并减少数据孤岛以支持更大程度的合作?
Jean-Philippe Vert博士: 有些模型的黑箱特性是可以接受的。在这种情况下,我的意思是,我们知道网络的架构、其物理特性等。我们想要的输出是从问题到假设的转换。在这种情况下,很难准确解释人工智能做了什么,就像LLMs一样。当你提出一个问题,你会得到一个答案。它不可解释。但如果答案是好的,那就足够了。在这样的情况下,我会说人工智能的黑箱性质没有问题。
在其他领域,包括诊断或疾病病理生理学,获得该输出的解释更有用。例如,如果我们问"患者会对治疗有反应吗?",我们关心解释。有答案是有用的,但如果能说"患者没有反应是因为特定通路或基因被激活,因此……"那就更有用了。
一旦你有了这个解释,你就会对该系统建立信任,并且还可以取得进展。在那个领域,与蛋白质设计相反,可解释性很重要。这部分是一个技术问题,促使人工智能解决方案开发者优先考虑可解释性。
另一方面,如果问题也是关于封闭模型与开放模型的,这与其说是一个技术问题,不如说是一个公司决策。这也是你看到数据孤岛的地方。就个人而言,我认为模型应该更加开放。
如果数据能够共享,将为社会、患者和科学进步带来诸多益处。这更多是一个经济问题:我们如何鼓励那些花费大量资金生成数据的人在没有好处的情况下分享数据?
【全文结束】

