人工智能有潜力通过提高整个开发流程的生产力来变革药物开发,促进生物制药创新,加速新疗法的交付,并推动竞争以改善公共卫生结果。药物开发是一个昂贵、漫长且风险较高的过程,其生产力正在下降。将一种新药推向市场可能耗资数十亿美元,耗时超过十年,且早期候选药物的成功率低于8%。人工智能的应用覆盖了整个药物开发流程——从加速药物发现、优化临床试验,到简化制造和供应链。为了在药物开发中更广泛、有效地采用AI,必须解决数据质量和可用性、算法偏差的潜在风险、工作流程整合以及监管指南等关键挑战。关键政策要素包括对基础研究的公共资助、劳动力培训、支持隐私增强的数据共享和访问,以及基于每种AI应用可能带来的风险水平的风险导向监管框架。这些政策对于释放AI在药物开发中的全部潜力、使潜在挽救生命的疗法更快地交付给患者以及扩大患者可及性至关重要。
关键要点
药物开发是漫长、复杂且成本高昂的过程,以广泛的临床试验、巨大风险和严格监管为特征。人工智能有潜力改变整个药物开发过程——从加速药物发现、优化临床试验,到改进制造和供应链物流。创新政策的一个重要挑战是确保药品支出为社会带来最大回报。实施价格控制或削弱知识产权保护的政策可能旨在降低药品价格,但已知会削弱未来药物研发的激励,并且无法提高研发生产力。更可持续的方法是追求最大化研发投资价值的政策。提高研发生产力,尤其是在回报率下降和风险上升导致资本成本增加(这是药物开发成本的主要因素)的情况下,提供了更有效的途径来最大化公共卫生回报、促进公平可及性和推动经济增长。技术进步有望改善研发生产力,加速新疗法的可及性,促进健康公平和竞争力,最终为投入药品的资源带来更大价值,同时不扼杀创新。人工智能在药物开发各个阶段的应用可以增强研发生产力,增加药物产出,促进竞争,推动创新并扩大新疗法的可及性,从而改善社会福利。这种增加的药物供应反过来可以通过市场竞争推动消费者获益。此外,人工智能可以加速发现数千种仍缺乏治疗选择的疾病的新治疗靶点和候选药物。
本报告探讨了人工智能在药物开发各个阶段可能发挥的变革性作用,呈现了早期证据,展示了AI如何增强药物发现、多样化临床试验以及优化药物制造流程,最终实现更高效的开发、更短的时间线和更好的结果。此外,报告还指出了在药物开发中更广泛采用AI的关键挑战,并提出了若干政策建议,以支持有效的AI采用,旨在促进创新同时确保患者安全。
药物开发过程
药物开发过程漫长、风险高且成本高昂。虽然不同治疗领域的估计差异很大,但最近的数据表明,将一种新药推向市场的研发成本可能高达28.3亿美元(未资本化),考虑批准前后的研发(如新适应症、患者群体和剂型)——或资本化(年利率10.5%)后高达40.4亿美元。根据2021年生物技术创新组织(BIO)的报告,一种药物从I期临床试验到上市需要超过十年,且只有7.9%的I期临床试验候选药物最终获得批准。药物开发是一个复杂、多阶段的过程,将科学发现转化为安全有效的疗法。关键阶段包括药物发现、临床前测试、临床试验、监管审查和制造。在药物发现阶段,科学家寻找并识别参与疾病的治疗靶点(如蛋白质,包括受体和酶)。然后筛选数千种潜在的治疗化合物,以找到能够调节靶点活性的化合物。有希望的化合物被优化并推进到临床前测试阶段,在该阶段进行实验室和动物研究以评估安全性、有效性和药代动力学/药效学。发现和临床前阶段通常总共需要大约五到六年。临床前测试后,候选药物进入人体临床试验,平均需要9.1年。成功完成临床试验的药物提交给监管机构(如美国食品药品监督管理局FDA)批准,基于临床前和临床研究的证据。最近的一份报告发现,一个成功的候选药物从I期临床试验到监管批准平均需要10.5年,此前需要多年的早期研究来发现治疗靶点并设计有效调节它的药物。现代药物发现的一种突出方法是基于靶点的方法,涉及设计与疾病中特定治疗靶点相互作用的药物。这种方法依赖于对靶点在疾病中作用的深入理解,以开发有效的疗法。该过程从基于假设识别靶点开始,即修改其活性将影响疾病进展。靶点识别涉及分析广泛的基因组、蛋白质组和其他生物学数据,以确定疾病通路中的关键分子。靶点识别之后通过体内和体外模型进行验证。在这个发现阶段,采用高通量筛选、生物信息学和实验验证等技术来识别和确认这些靶点。这个过程费时费力且复杂,需要大量的时间和精力。一旦验证,候选药物进入临床试验以评估在人类中的安全性和有效性。在实践中,药物发现通常整合了基于靶点和表型的方法。在表型药物发现中,化合物根据其对疾病相关特征(表型)的影响进行筛选,而不事先了解确切的分子靶点或潜在机制。这种方法对于涉及多个基因和通路的复杂疾病(如癌症、心血管和免疫疾病)特别有用。通过结合这些方法,研究人员可以利用各自的优势来提高开发有效疗法的可能性。近几十年来,药理学、合成生物学和生物技术等领域的进步,以及2003年人类基因组解码和2000年代中期下一代测序技术的出现,极大地扩展了人们对健康和疾病的科学理解。在过去的几十年里,美国生物制药研发投资从1980年的20亿美元激增至2023年的960亿美元。然而,尽管资源大幅增加,一些指标表明生物制药创新正在放缓(或趋于平稳)。值得注意的是,新药上市数量没有显著相应增加,临床试验成功率下降,药物开发的总体时间延长。此外,随着时间的推移,开发新药变得更加昂贵。德勤的一份报告指出:“包括失败成本在内的开发资产的平均成本在八年中有六年是上升的。”2019年版报告得出结论,自2010年以来,将一种新生物制药药物推向市场的平均成本增加了67%。与此同时,德勤发现,每项资产的预测峰值销售额自2010年以来已经下降了一半以上。重要的是,生物制药行业经历了制药研发回报率下降的趋势:德勤发现,12家大型制药公司的研发回报率从2010年的10.1%下降到2015年的4.2%,再到2019年的1.8%。有几种因素被提出来解释研发生产力下降和生物制药创新日益复杂的原因。这些包括科学和技术性质的变化、更严格的监管要求,以及研发投资向新颖、高风险、高价值靶点转移,这些靶点具有更多的不确定性和难度。此外,科学进步,特别是在遗传学、分子生物学和系统生物学方面,揭示了许多疾病高度复杂,是遗传、环境和生活方式因素共同作用的结果。这种复杂性通常需要复杂的治疗,如靶向治疗或精准医学,这需要额外的研究和先进技术(如基因编辑、生物标志物识别等),增加了药物开发的时间和成本。除了药物开发(发现、设计和测试新药的过程)之外,生物制药制造(大规模生产药物)也出现了生产力下降。全要素生产率(TFP)从2010年到2018年每年下降近2%,表明产出能力下降。虽然TFP此后有所改善,平均年增长率为2%,但劳动生产率(以每工时产出衡量)每年下降超过3%,表明存在持续的挑战。这种下降可能源于更严格的监管要求、需要更专业的处理与监控,或制造复杂性增加,这可能降低了劳动投入效率,即使整体TFP有所改善。这些因素很可能与行业越来越多地追求更先进的治疗(如细胞和基因疗法)有关,这些疗法需要更复杂的处理和资源密集型的制造过程。
人工智能在药物开发中的作用
在药物开发生产力下降的背景下,新兴技术有望提升生物制药生产力。人工智能、量子计算、CRISPR、3D生物打印、器官芯片和纳米技术等进步可以显著缩短新疗法上市的时间和成本,使挽救生命的疗法更容易为患者所获得。下一代测序技术已经能够产生大型生物医学数据集,特别是基因组学(研究生物体的基因)和转录组学(研究RNA转录本)等。连同实验研究和药物研究的数据,这些庞大的数据集为人工智能提供了肥沃的土壤,人工智能可以分析这些数据集以发现模式并进行预测,这些预测可作为药物开发不同阶段(从靶点识别和临床试验到监管流程、制造和供应链优化)的有价值输入。量子计算虽然仍处于早期阶段,但可以补充人工智能,解决经典计算机无法解决的问题——例如分子模拟和蛋白质折叠——这两者对于建模生物系统和识别新候选药物都至关重要。这些技术共同可以加速生物制药创新,为新疗法提供更高效的途径。在《预测机器:人工智能的简单经济学》一书中,Ajay Agrawal、Joshua Gans和Avi Goldfarb将人工智能描述为一种将数据转化为预测的工具,为决策提供有价值的见解。在生物制药行业,人工智能可以分析庞大的生物数据集,预测哪些治疗靶点与疾病相关,识别有希望的候选药物,并预测药物反应。使用先进的机器学习技术,特别是基于在大数据集上训练的神经网络的深度学习,人工智能擅长识别模式并生成预测。重要的是,人工智能补充而不是取代人类科学家。人工智能的一个关键局限性在于执行高级因果推理——这是一项需要人类判断的基本任务。虽然人工智能擅长识别相关性,例如将靶点与疾病联系起来,但它难以理解解释这些联系为何存在的复杂潜在生物学机制——这是有效药物开发的关键方面。尽管如此,人工智能提供了一个强大的工具,可以显著推进药物开发的不同阶段,从发现和临床前测试到临床试验、监管审查和制造。在药物发现中,人工智能加速分析大型数据集以识别有希望的化合物,减少寻找新候选药物的时间和成本。在临床前测试中,人工智能模型模拟生物过程以预测药物在人体中的行为,减少对动物测试的依赖。在临床试验中,人工智能可以优化患者选择、改进试验设计并加速数据分析,从而带来更快、更准确的结果。它还可以通过协助准备监管机构(如美国FDA和欧洲药品管理局EMA)所需的复杂文件来简化监管流程。最后,在制造中,人工智能可以增强生产流程,提高效率并确保一致的质量。通过在这些阶段整合人工智能,将新药推向市场的过程可以变得更加高效,有可能更快地将急需的疗法推向市场。
促进药物发现
人工智能常被誉为药物发现的未来,能够减少识别治疗靶点和有前景药物化合物的时间和成本,优化药物化学结构以提高疗效,并增强潜在靶点的分子多样性。传统的靶点发现实验方法可能缓慢且范围有限,但人工智能提供了一种更高效的方法,通过基于表明靶点与疾病相关的属性,从大型数据集中预测一组靶点。然后科学家可以验证这些预测,并发展关于这些靶点为何与疾病相关的治疗假设,以开发安全有效的疗法。2021年7月,谷歌DeepMind的AlphaFold2系统解决了长期存在的“蛋白质折叠问题”的一个关键方面,这是一个50年的生物学挑战。通过从氨基酸序列预测几乎所有已知蛋白质的3D结构,AlphaFold2改变了生物学研究的一个关键领域。该系统利用一个庞大的已知蛋白质结构数据库,将预测蛋白质结构所需的时间从数月缩短到数分钟。与欧洲分子生物学实验室(EMBL)合作,谷歌DeepMind将这些数据免费提供给科学界。这一突破对理解蛋白质功能具有深远意义,而蛋白质功能是设计更有效药物的关键。这一成就使谷歌DeepMind的Demis Hassabis和John M. Jumper获得了2024年诺贝尔化学奖“用于蛋白质结构预测”,该奖项也与David Baker共享“用于计算蛋白质设计”。此外,人工智能可以辅助生物活性预测——评估药物与其预期靶点相互作用的有效性——通过从大型候选池中识别有前景的化合物,从而最大限度地减少昂贵、耗时的实验。2024年,一个研究团队开发了ActFound,这是一个采用成对和元学习技术的人工智能模型,在来自ChEMBL(EMBL的欧洲生物信息学研究所维护的公共生物活性数据库)的数百万数据点上进行了训练。ActFound已被证明比传统计算方法更准确且成本更低。虽然人工智能仍处于早期阶段,但一些指标表明它已经在简化药物发现。波士顿咨询集团(BCG)的一项研究检查了20家专注人工智能的制药公司的研发管线,发现进入临床试验的15个AI辅助候选药物中有5个在不到四年的时间里就做到了,而历史平均为五到六年。BCG和Wellcome Trust 2023年的报告预测,人工智能的努力可以将药物发现和临床前阶段的时间和成本减少25%至50%。美国政府问责局和国家医学科学院2019年的报告指出,一家公司估计,人工智能加速的药物发现每款药物可以节省3亿到4亿美元——这源于提高的研发生产力,因为人工智能提高了资本投资的效率,使得更早、更快地识别更好的药物。几家AI药物发现公司已经开始报告显著加速的药物发现时间线。2019年9月,加拿大生物技术公司Deep Genomics宣布其首个AI发现的治疗候选药物,旨在治疗威尔逊病,一种导致血液中铜过量的遗传性疾病。该候选药物在靶点发现工作开始后仅18个月就被提出,公司的人工智能平台分析了超过2400种疾病和10万种致病突变。2020年1月,英国制药公司Exscientia与日本住友制药合作报告称,其AI开发的用于强迫症(OCD)的化合物在短短12个月内就进入了临床试验,而典型的时间线是五到六年。该化合物也据称是首个AI设计的进入临床试验的药物。2023年6月,总部位于香港和纽约的Insilico Medicine宣布,其AI开发的用于特发性肺纤维化(一种慢性肺病)的药物在不到30个月的时间里进入了临床试验。虽然这些早期证据表明人工智能有潜力显著缩短药物发现的速度,但需要更长的时间才能确定AI开发的药物在临床试验中与非AI对手相比表现如何。BCG研究表明,AI药物发现公司倾向于将其管线集中在成熟的治疗靶点类别上。超过60%的披露靶点来自熟悉的类别,如酶(例如激酶)和G蛋白偶联受体。这种对已知靶点的关注可能反映了降低药物开发风险并证明其AI平台可行性的策略。相比之下,大型制药公司通常保持更多样化的管线,平衡新靶点和已建立的靶点。此外,Deep Pharma Intelligence最近的一份报告显示,在药物发现中采用AI的地理格局中,美国是全球领导者。截至2023年,超过50%的AI药物发现生物技术公司位于美国,其次是欧洲的17%和中国的近4%。此外,大型制药公司与AI公司之间的合作关系数量激增,从2017年的21个新合作增加到2022年的66个,增长了三倍多。根据S&P Global Ratings最近的一项研究,这些合作在药物发现方面的例子包括阿斯利康与BenevolentAI合作优化靶点识别;GSK与Insilico Medicine合作识别新的生物靶点和通路;辉瑞与Genetic Leap合作开发RNA遗传药物候选物。
简化临床试验
临床试验用于评估拟议新疗法的安全性和有效性,是药物开发过程中的关键步骤。然而,进行临床试验昂贵、耗时且有风险。截至2020年,全球临床试验市场价值443亿美元。一项研究发现,一种典型药物的平均临床开发时间——从首次人体试验到监管批准——是9.1年,尽管这可能因治疗领域、适应症、试验设计和患者可用性而异。BIO最近的一份报告详细说明,I期试验平均需要2.3年,II期3.6年,III期3.3年,监管审查1.3年。此外,进入I期试验的候选药物中只有不到8%成功。鉴于这些挑战,人工智能有潜力在多个方面简化和改进临床试验,使其更快、更有效、成本效益更高。
增强患者资格和招募
临床试验中最耗时的方面之一是识别和招募符合条件的患者,这个过程可能占试验总时长的三分之一。此外,20%的试验未能招募到所需数量的参与者。为了解决这一挑战,研究人员探索了放宽过于严格的资格标准,同时保持患者安全。Trial Pathfinder是斯坦福大学开发的一个AI系统,它分析已完成的临床试验,以评估修改标准(如血压阈值)如何影响不良事件(如严重疾病或死亡)的发生率。在一项针对非小细胞肺癌试验的研究中,Trial Pathfinder 显示,放宽某些标准(例如实验室检测结果,这些对试验结果影响不大)可以在不增加不良事件风险的情况下,使符合条件的患者数量翻倍。这种方法对其他癌症(包括黑色素瘤和滤泡性淋巴瘤)也有效,在某些情况下,甚至通过纳入病情更重、更可能从治疗中获益的患者,减少了负面结果。这些发现表明,放宽限制性资格标准可以扩大患者获得有前景新疗法的机会。
确定资格标准后,下一个主要挑战是招募患者,因为招募失败可能导致延误和试验终止。通常,患者招募涉及手动预筛选,因为临床标准文本复杂,通常包含令人困惑的缩写和术语。Criteria2Query 是一个人工智能系统,它可以通过解析自然语言中的资格标准并将其转换为结构化的、可搜索的数据来简化这一过程。研究人员可以用通俗语言输入纳入和排除标准,Criteria2Query 将其转换为正式的数据库查询,筛选电子健康记录(EHR)以找到匹配的参与者。该系统旨在增强人机协作,通过结合机器效率和人类专业知识来简化复杂概念并训练算法,从而优化队列生成。Criteria2Query 可以加速招募,并有助于纳入儿童和老年人等群体,这些群体通常不必要地被排除在试验之外,从而加快临床试验速度并使其多样化。
除了像 Criteria2Query 这样将试验与患者匹配的系统外,人工智能还改善了患者与试验的匹配。例如,TrialGPT 通过预测患者对特定研究的资格来帮助患者找到合适的试验。患者用通俗语言描述自己的病情,TrialGPT 会生成一个反映其适合某项试验的分数,并解释每个资格标准。在测试中,TrialGPT 达到了接近人类的准确性,并将试验匹配的筛选时间缩短了 40% 以上,凸显了人工智能提高临床试验效率和加速患者招募的潜力。2023 年 10 月,丹娜-法伯癌症研究所(Dana-Farber Cancer Institute)在 Meta 的资助下,开始开发一种新颖的开源人工智能平台,以“计算方式将癌症患者与临床试验匹配”。该计划利用 Meta 的大型语言模型 Llama 3 分析非结构化的临床笔记和试验资格标准,从而更快、更准确地将患者与合适的临床试验相匹配。
人工智能还可以在识别预测治疗结果和疾病进展的生物标志物方面发挥关键作用,这对于将患者与最有效的临床试验和疗法相匹配至关重要。由洛杉矶西达赛奈癌症中心(Cedars-Sinai Cancer)主任 Dan Theodorescu 领导的研究团队开发了分子双胞胎精准肿瘤学平台(MT-POP),以发现预测胰腺癌(最致命的癌症之一)疾病进展的生物标志物。他们的研究结果表明,仅依赖 CA 19-9(FDA 批准的胰腺癌唯一生物标志物)并不足以预测治疗结果。相反,一组多个生物标志物提供了更准确的预测。这种多组学方法展示了优化患者选择(无论是临床试验还是已批准的疗法)的潜力,通过识别最有可能从特定治疗中获益的个体。这些进展有助于完善试验设计,并提高为胰腺导管腺癌和其他棘手疾病开发新疗法的成功率。
优化临床试验设计
人工智能还可以通过优化药物剂量、患者入组人数和数据收集策略等方面来增强临床试验设计。在伊利诺伊大学,研究人员开发了 HINT(层次交互网络)算法,根据药物分子、目标疾病和患者标准等因素预测试验成功。该算法在药代动力学和历史试验数据上训练,已在不同的临床试验阶段和疾病中展现出高准确性。在此基础上,该团队创建了 SPOT(临床试验结果的序贯预测模型),该模型实时跟踪试验进展,并随着更多数据的可用而细化预测,从而允许在试验期间及时调整以改善结果。此外,总部位于伊利诺伊州的 Intelligent Medical Objects 公司开发了 SEETrials,它利用 OpenAI 的 GPT-4 从临床试验摘要中提取安全性和有效性数据,帮助临床研究人员评估不同的试验设计。
此外,由人工智能驱动的临床试验设计初创公司 QuantHealth 开发了 Katina,这是一个人工智能平台,可以模拟数十万种潜在的试验方案组合——例如各种患者群体、治疗参数(如治疗剂量、给药途径、持续时间)和试验终点(如肿瘤缩小)——以提高试验成功的可能性。该 AI 指导的工作流程在广泛的生物医学、临床和药理学数据上训练,旨在增强试验设计和执行。2024 年 8 月,QuantHealth 报告称,Katina 已模拟了 100 多项试验,准确率达到 85%。它能够以 88% 的准确率预测 II 期试验结果,显著高于当前 28.9% 的成功率,并以 83.2% 的准确率预测 III 期试验结果,而当前成功率为 57.8%。该平台还能降低试验成本和缩短试验时间。QuantHealth 报告称,其与一家制药公司呼吸系统疾病团队的合作,通过将试验时间平均缩短 11 个月、减少 251 名试验参与者以及使用 1.5 名更少的全职员工来进行试验,从而使临床试验成本大幅降低了 2.15 亿美元。
简化临床试验方案
人工智能还可以简化临床试验方案(CTP)的分析,这些方案通常是超过 200 页的冗长复杂文件。CTP 涵盖了从试验目标、设计到参与者资格标准和统计方法的所有内容,是进行结构化、合规试验的蓝图。通过使用人工智能从非结构化文档中提取有价值的见解,研究人员可以提高参与者多样性并降低脱落率,最终通过提高临床试验效率来加速药物开发。
例如,基因泰克(Genentech)使用 Snorkel AI 从超过 34 万个 CTP 资格标准中提取关键信息。这项工作带来了更好的研究设计和更准确的参与者纳入/排除标准。该过程有助于可视化不同资格标准如何影响试验参与者的人口统计数据,从而允许就试验做出更明智的决策。Snorkel AI 识别了临床相关特征的模式,并进行了人口统计权衡分析,使基因泰克能够调整标准以提高试验的多样性和成功率。
改善临床试验的多样性对于解决健康不平等问题至关重要。根据 FDA 的数据,令人担忧的是,2020 年 FDA 批准的药物临床试验参与者中,75% 是白人,而只有 11% 是西班牙裔,8% 是黑人,6% 是亚裔。这种缺乏多样性是有问题的,不仅因为某些疾病在特定的代表性不足群体中更普遍,而且因为不同人群可能对疗法有不同的反应。例如,世界上最常用的支气管扩张剂吸入器沙丁胺醇(Albuterol)对黑人儿童的效果不如白人儿童。由于 95% 的肺部疾病研究是在欧洲血统的个体中进行的,这种遗传差异多年来未被发现。科学家后来将涉及肺容量和免疫反应的特定遗传变异与沙丁胺醇在黑人儿童中疗效降低联系起来。为了应对临床试验中缺乏多样性的问题,FDA 于 2022 年发布了草案指南,鼓励更具包容性的代表性。制药公司越来越多地利用人工智能,包括 TrialPathfinder 和 Criteria2Query 等工具,以安全地招募更多样化、更具代表性的参与者,从而帮助改善代表性不足人群的试验结果。
优化监管提交
临床试验的监管提交阶段既资源密集又耗时。监管事务团队是制药公司与监管机构之间的关键纽带,负责根据现行指南确保获得批准。这些团队整理提交所需的数据和文件,同时确保申请符合所有监管要求。人工智能可以通过减少收集和标准化数据所需的时间,以及根据模板和指南生成草稿来支持这一过程。此外,人工智能可以通过提供及时见解、自动化数据监控、文档管理和不良事件检测等任务,以及确保符合不断变化的法规,来增强工作流程。
例如,Medidata 的临床数据工作室使用人工智能实时监控临床试验数据,简化临床数据管理、运营和安全性。该平台自动化数据审查,通过可视化识别模式,监控试验站点性能和合规性,并通过检测患者数据中的不一致或异常等异常来降低数据质量风险。这种主动方法使临床研究人员能够及早解决潜在问题,有助于确保整个试验过程中的数据完整性,并降低危及监管合规的风险。最终,这有助于提高试验效率和可靠性,加快监管审查过程。
另一个值得注意的例子是 Veeva Systems 开发的 Veeva Vault RIM(监管信息管理),这是一个由人工智能驱动的平台。该平台提供一套全面的服务,旨在管理提交、确保合规性并简化跨地区的监管流程。凭借其合规跟踪功能,Veeva Vault RIM 持续监控和更新全球范围内不断变化的监管指南,从而提高监管提交过程的效率。当监管机构(如 FDA 或 EMA)发布新指南时,该平台会提醒临床试验团队,分析变化,并实时推荐对试验程序或文件的调整,以确保持续合规。此外,该平台通过汇总来自各种来源的数据,根据最新指南进行格式化,并生成可提交的文档,从而自动化监管提交过程,这减少了人工劳动和错误风险。
增强制造和供应链
人工智能还可以通过优化生产流程、通过预测性维护减少停机时间、改善需求预测以及简化库存管理来增强药物制造和加强供应链,最终提高效率。
人工智能在制造中的应用
除了在药物发现、临床试验和监管提交中的作用外,人工智能还可以增强制造并帮助加强供应链。它可以通过简化生产流程、改进质量控制和降低成本来优化药物制造。预测分析可以识别高效的生产途径,预测设备故障,预见必要的维护,并改善资源分配。人工智能还可以支持连续制造系统的开发,从而实现更灵活、响应更快的药物生产,而人工智能驱动的需求预测可以帮助减少库存短缺和过度生产。
人工智能在供应链中的应用
药物短缺是一个日益严重的公共卫生问题,对医疗系统产生重大的财务影响。仅在美国,由于医疗费用、生产力损失和不良患者结果,这些短缺每年估计造成 2.3 亿美元的损失。此类短缺的根本原因包括供应链管理挑战、业务连续性规划不足以及需求波动等市场动态。全球制药供应链是一个由制造商、供应商和分销商组成的复杂网络,跨越多个国家,使其容易受到自然灾害、运输延误和监管障碍等中断的影响。人工智能可以通过优化供应链流程来帮助减轻这些风险。它可以分析运输成本、交货时间和供应商绩效,从而实现更好的路线规划、成本节约和改进交货时间。例如,美国药典(USP)的药品供应图使用人工智能分析全球数百万个数据点,以预测中断,从而允许及时干预以防止短缺。默克(Merck)使用 Aera 开发的人工智能系统,通过数据分析和主动建议来优化其供应商网络。该系统使默克能够预测供应链波动,调整生产计划,并重新安排货物运输,从而提高效率并增强供应链弹性。
总体而言,人工智能可以推动制造效率、供应链管理和先进疗法可扩展性的改进,有助于更快、更具成本效益的药物生产和供应链弹性。
人工智能采纳的挑战
人工智能在药物开发中的采纳面临几个重大挑战。数据访问和隐私问题构成了重大障碍,因为利益相关者——包括医疗保健提供者、制药公司、研究人员和联邦机构——必须收集和共享大量数据来开发有效的人工智能模型。改善组织内部和组织之间的协调对于实现这一目标至关重要。此外,验证人工智能算法对于解决人工智能系统如何做出决策的“黑箱”性质以及减轻可能的偏见至关重要,从而建立对这些技术的信任。将人工智能与现有工作流程整合也可能具有挑战性,尤其是在监管路径不明确的情况下。激励措施不匹配,包括对失业的担忧,可能进一步减缓采纳。然而,通过积极的战略和加强公私部门之间的合作,这些挑战可以得到有效解决,为人工智能在药物开发中的成功整合铺平道路。
数据访问、质量和隐私
人工智能可以在支持药物开发中发挥关键作用,但其有效性取决于训练数据的可用性和质量。多种类型的数据对于该领域的人工智能应用至关重要。首先,临床数据,包括电子健康记录(EHR),提供患者病史、诊断、实验室结果、影像数据和治疗计划的信息。其次,基因组数据,通过测序技术获得,有助于识别遗传变异,并提供对基因功能和调控的见解,这对于理解疾病机制至关重要。第三,药物数据包括药物疗效、不良反应、药代动力学和药效学信息。第四,化学和结构数据对于从广泛的化合物库中识别和优化候选药物非常重要。最后,科学文献中的数据——如研究论文、临床指南、临床试验结果和专利——有助于综合现有知识并识别新药开发的空白。这些不同类型的数据共同构成了一个全面的图景,增强了识别有前景的治疗靶点和候选药物、对个体患者进行靶向治疗以及简化药物开发过程的能力。重要的是,将基因型(基因组记录中的遗传信息)与表型(临床记录中的可观察特征)联系起来,使研究人员能够更好地理解遗传变异如何影响疾病风险、治疗反应和疾病过程。这种联系对于开发靶向疗法和推进精准医学尤为重要。然而,在收集、共享和链接这些数据以支持人工智能应用方面仍然存在挑战。
二十年前,人类基因组计划(HGP)成功解码了人类遗传密码。这一国际科学努力成功的一个核心原则是数据共享。HGP 领导层建立了百慕大原则,承诺所有项目参与者电子共享数据,并向公众提供人类基因组序列,以促进科学进步。此后,测序技术的进步产生了来自数百万人的大量基因组数据,现在存储在世界各地的存储库中。百慕大原则被期刊和资助机构采纳,旨在确保已发表的基因组研究数据对所有人仍然可访问,从而促进进一步的科学发现。然而,大量多样化和敏感数据的涌入,促使政府、资助机构以及与之合作的研究联盟开发定制数据库来管理这些信息。不兼容和不可共享的数据集的存在进一步复杂化了连接基因组和表型数据的努力,而这正是突破的关键。发现复杂疾病(如癌症和心血管疾病)的遗传原因需要在全基因组范围内精确定位多个遗传风险因素。这是通过全基因组关联研究(GWAS)实现的,该研究分析数十万患病和未患病个体的基因型,以识别相关的遗传变异。这些研究整合了基因组和表型数据,这些数据通常来自 EHR 和医学队列研究——例如弗雷明汉心脏研究(Framingham Heart Study),该研究跟踪了多代人调查心血管风险因素——从而提供了关于遗传变异如何导致疾病的见解。然而,数据整合问题给 GWAS 带来了挑战,因为这些研究的成功依赖于大规模基因组和表型数据集的整合。自 2005 年以来,已进行了超过 10,700 项 GWAS,产生了大量数据集,这些数据集主要存储在受控访问的数据库中,以保护个人信息,出于法律和伦理原因。研究人员必须经历严格的审查过程才能访问这些数据。例如,美国国立卫生研究院(NIH)的受资助者需要将其 GWAS 数据存入官方存储库——基因型和表型数据库(dbGaP),而欧洲研究人员则被鼓励使用 EMBL-EBI 的欧洲基因组-表型档案(EGA)。然而,尽管如此,访问这些公开数据的过程仍然繁琐。此外,越来越多的国家已经启动了对本国人口的大规模基因组测序工作,包括美国的“我们所有人”研究计划、巴西基因组计划、卡塔尔基因组计划、土耳其基因组计划和韩国基因组计划等。这些全球基因组测序计划对于捕捉不同人群的遗传多样性至关重要,这可以带来更具包容性和更有效的生物制药研究。但目前,这些计划的数据将如何共享并整合到现有的工作流程和联盟中仍不清楚,从而削弱了此类大规模数据集的潜力。
全球基因组学与健康联盟(GA4GH)等倡议致力于创建技术标准,以连接全球不同的基因组数据库。此外,GWAS 目录,由 EMBL-EBI 和国家人类基因组研究所(NHGRI)合作建立的开放获取资源,正在努力标准化和集中 GWAS 数据,以支持对疾病机制的更深入理解,以及发现新的治疗靶点和因果变异。其他努力,如人类细胞图谱(HCA),一个创建公开可访问的详细人类细胞参考图谱的全球联盟,进一步寻求支持人工智能驱动的药物开发,并促进我们对健康和疾病的理解。
电子健康记录
除了基因组数据,临床数据(通常存储在 EHR 中)提供了有关患者病史的关键细节,并在加深我们对疾病机制的理解方面发挥着重要作用。这两种类型的数据对于揭示遗传变异如何影响可观察特征和疾病结果至关重要,构成了构建有效的人工智能药物开发模型的基础。推动电子健康信息交换的努力始于 2009 年《美国复苏与再投资法案》(ARRA)的签署,该法案建立了《健康信息技术促进经济和临床健康法案》(HITECH)。该条款促进了患者记录的数字化以改善医疗保健服务,拨款超过 350 亿美元支持医院和诊所采用 EHR。如今,EHR 的采用已很普遍,96% 的美国医院和近 80% 的办公室医生使用 EHR。一些最大的 EHR 系统包括 Epic Systems、Oracle Cerner 和 MEDITECH。Epic 拥有最大的市场份额,为 37.7%,其次是 Oracle Cerner(21.7%)和 MEDITECH(13.2%)。Epic 是美国领先的供应商,被许多著名的医院系统和学术医疗中心使用,包括克利夫兰诊所、梅奥诊所和约翰霍普金斯医学中心。除了隐私问题带来的问题外,美国存在数百个 EHR 系统,每个系统都有不同的临床术语和技术标准,这使得互操作性复杂化。真正的互操作性不仅需要交换,还需要使用标准化数据,这是美国医疗系统长期存在的问题,继续限制着电子数据共享。此外,实现互操作性依赖于许多利益相关者之间的合作,包括患者、提供者、软件供应商、立法者和健康信息技术专业人员。然而,医疗系统仍然分散,数据通常被视为竞争优势的商品,而不是改善患者护理的共享资源。最近,FDA 推动增加在药物开发中使用真实世界数据(RWD),包括 EHR、账单数据和管理性索赔。这些数据富含患者详细信息,包括疾病状态、治疗、程序和结果,可以增强药物开发。随着美国 EHR 采用率的增长,FDA 发布了关于在临床研究和监管提交中使用 EHR 数据的指南。然而,将 RWD 与人工智能整合存在几个挑战。EHR 通常由临床医生不一致地记录,使得难以统一提取数据,例如治疗结果。缺失数据和选择偏差等问题进一步复杂化了分析。此外,不同数据源之间缺乏标准化和协调,阻碍了重复和再现性。尽管存在这些挑战,大型研究网络(如国家以患者为中心的临床研究网络 PCORnet、观察性健康数据科学和信息学 OHDSI 联盟以及临床与转化科学奖临床试验招募 CTSA ACT 网络)的建立改善了数据共享。这些网络跨越全球多个站点,采用标准化数据基础设施,并提供对多样化患者群体的访问,从而能够进行大规模研究,以探索影响健康和疾病的因素。2013 年,美国国家科学基金会(NSF)召开了一次研讨会,以确定挑战并制定研究议程,以实现国家规模的学习健康系统(LHS)。LHS 是一种基础设施,能够实现快速的数据共享和知识生成,为医疗保健决策提供信息,最终改善健康结果。议程强调了系统整合数据、证据和实践的必要性,突出了标准化存储在 EHR 中数据的重要性。通过促进对全面患者数据的访问,EHR 使医疗保健提供者能够参与持续学习。议程指出,为了最大限度地发挥 EHR 在促进协作、运作良好的 LHS 方面的潜力,建立标准化的数据共享协议并确保互操作性对于适应和创新以应对新兴的医疗保健挑战至关重要。
将 EHR 与其他数据源(包括基因组数据)链接起来,可以进一步研究药物-表型和药物-基因相互作用。来自范德比尔特药物基因组学评估电子系统(VESPA)项目的研究人员表明,基于 EHR 的生物样本库(人类生物材料的储存库)为生物医学发现提供了经济高效的工具,因为它们允许跨多项研究重复使用生物样本并提高研究效率。这种 EHR 驱动的基因组研究(EDGR)很有价值,因为这种整合方法可以通过复制研究并将传统的 GWAS 发现扩展到代表性不足的人群来增强 GWAS。这是因为 EDGR 队列反映了临床环境中护理的人群,这些人群比基因组研究中通常代表的人群要多样化得多。EHR 关联的基因组研究还可以实现全表型组关联研究(PheWAS),该研究分析遗传变异对 EHR 中捕获的多种疾病和特征的影响。然而,一个主要障碍仍然是需要开发和采用国际标准化的患者同意模型,以允许在生物医学研究中使用其临床数据,因为不同地区的同意制度差异很大。
Omada Health 的首席隐私和监管官、前美国卫生与公众服务部国家健康 IT 协调员办公室首席隐私官 Lucia Savage 强调,各国对通过传统医疗保健流程收集的数据的使用规定差异很大。在美国,将患者数据用于三级研究应用(例如开发用于药物开发的人工智能模型)有更多的余地,因为《健康保险流通与责任法案》(HIPAA)允许在数据去标识化后,未经明确同意即可将患者健康数据用于研究。相比之下,许多其他国家,包括受欧盟《通用数据保护条例》(GDPR)约束的国家,对此类用途和个人数据的国际传输施加了更严格的限制。法律框架的这些差异使得跨境数据共享和访问更具挑战性。因此,考虑数据收集时的监管环境并探索互操作性的可能性以应对这些挑战至关重要。
除了真实世界数据,人们对合成数据(由计算机算法人工生成,模拟真实世界数据的统计特性)作为训练人工智能模型的可扩展、经济高效且保护隐私的替代方案也越来越感兴趣。然而,挑战依然存在:合成数据可能无法完全捕捉真实临床人群的复杂性和变异性,例如多样化的人口统计数据以及影响治疗反应和副作用的复杂生物学和临床相互作用。关于合成数据在多大程度上反映疾病、治疗方案和患者群体的演变性质也存在疑问。在药物开发中使用合成数据仍然是一个新兴的研究领域。
药物数据
药物数据与基因组和临床数据一起,在生物制药创新中发挥着关键作用。虽然生物制药公司出于竞争原因通常倾向于对其数据保密,但公司与研究机构之间的合作可以显著加快药物开发。将学术界、工业界和政府联合起来的公私合作伙伴关系(PPP)提供了一条前进的道路,特别是在风险较低的竞争前研究领域。一个值得注意的例子是创新健康倡议(IHI),这是世界上最大的生物医学 PPP,由欧盟和欧洲制药工业协会联合会(EFPIA)于 2008 年发起,旨在加速下一代疗法的开发。其他例子包括由 NIH 国家老龄化研究所(NIA)发起的阿尔茨海默病神经影像学倡议(ADNI),以推进阿尔茨海默病研究;由癌症首席执行官圆桌会议发起的 Project Data Sphere,通过促进对去标识化肿瘤学临床试验数据的访问来加速药物开发;Open Targets,使用生物学数据来识别和验证治疗靶点;以及结构基因组学联盟,专注于推进人类蛋白质结构的知识。通过鼓励学术界、工业界和政府之间在竞争前研究领域共享数据,PPP 正在为人工智能驱动的药物开发产生有价值的训练数据。除了 PPP,替代支付模式可以为制药公司提供分享数据的激励。数据货币化允许公司通过提供基于订阅的匿名数据集访问权限来从其数据中获利。例如,被罗氏收购的 Flatiron Health 在这种模式下运营,通过汇总和分析去标识化的肿瘤学真实世界数据,提供增强癌症护理和加速药物开发的见解。这种模式将数据视为一种产品,为公司创造持续的收入流。
隐私增强技术的作用
在共享数据时,一个关键的考虑因素是确保能够以安全、保护隐私的方式进行,考虑到药物开发所涉及数据的机密性和敏感性。在不同实体之间共享数据的传统方法涉及将数据发送给第三方,例如为每个实体创建数据副本或将数据聚合到所有实体都可以访问的单个存储库中。实体可以通过访问控制、监督和法律机制来维护共享数据的隐私。然而,较新的去中心化数据共享方法允许多个实体在协作训练人工智能模型,而无需共享原始内部数据。去中心化数据共享将数据分布在多个位置,消除了在中央存储库中传输或聚合数据的需要。这种方法在隐私敏感的环境中特别有价值,因为它能够在保护敏感信息的同时进行协作。在药物开发中,去中心化方法使不同的研究机构和公司能够共享数据,支持开发更安全、更有效的疗法。去中心化数据共享的关键方面包括对数据隐私、协作和安全性的高度重视。在这种方法中,各方保留对其数据的控制权,降低了第三方泄漏的风险,并最大限度地减少了可能危及整个数据集的单点故障威胁。去中心化方法通常由隐私增强技术(PET)支持,如安全多方计算(SMPC)、联邦学习(FL)、全同态加密(FHE)和差分隐私(DP),这些技术能够以保护隐私的方式访问和分析不同的数据源。PET 可以支持在庞大的生物学、化学和临床数据集上训练人工智能算法,从而加速人工智能驱动的药物开发。
安全多方计算
SMPC 是一种加密方法,允许多个参与者使用私有数据共同进行计算,而无需相互透露数据,允许团队在维护数据机密性的同时使用内部数据进行协作。SMPC 确保只有计算的最终结果向参与者透露,而不会泄露联合分析中的任何中间信息,从而提供更高级别的安全性。在药物发现中,SMPC 有几个重要的应用。例如,它可以用于基于基因组和化学数据预测治疗靶点和药物之间的相互作用。这是开发有前景药物的关键步骤,需要大型数据集来训练人工智能模型以生成准确的预测。公共数据集,包括 ChEMBL(一个药物样化合物的生物活性数据库),通常依赖于学术机构、制药公司和合作项目的贡献,有助于在这些庞大的数据上训练模型。但它们只是拼图的一部分。整合其他敏感数据,包括 EHR,可以进一步增强算法。诸如 SMPC 之类的方法可以提供帮助,并且已经为 GWAS 和药物-靶点相互作用预测问题部署了可行的 SMPC 协议。然而,为人工智能驱动的药物发现开发全面的 SMPC 协议的努力仍在进行中。考虑一下 SMPC 如何在药物发现中有用。制药公司,即使是竞争对手,也能从合作中受益,但必须保护其专有数据。例如,公司 A 擅长小分子的高通量筛选,公司 B 拥有全面的生物靶点数据集,它们可以使用 SMPC 安全地结合其数据集,以发现与某些生物靶点相互作用的化合物。通过这种方式,他们可以共同识别潜在的候选药物进行进一步探索,同时保护每家公司的专有数据并增强其研究。
联邦学习
FL 强调协作训练人工智能模型,同时保持训练数据分散并位于每个参与者本地。在这种方法中,每个参与者使用自己的数据训练人工智能模型,只与中央服务器共享模型参数(而不是原始数据),中央服务器聚合这些参数以增强全局人工智能模型。然后将改进的模型返回给参与者进行进一步的本地训练,从而在不交换敏感数据的情况下实现协作模型开发。与允许多方共同对私有数据进行计算的 SMPC 不同,FL 侧重于协作构建模型。例如,医院可以使用 FL 协作训练一个根据其 EHR 预测患者结果的模型,而无需交换任何实际患者数据。在药物发现中,FL 特别有活力,并提供了众多应用。一个显著的例子是 IHI 的 MELLODDY 项目,它体现了合作与竞争的融合。该倡议源于全球 10 家最大的制药公司的联合呼吁,旨在开发用于药物发现的预测性人工智能模型,同时保护数据隐私。该项目的集体数据集将涵盖超过 1000 万个小分子和超过 10 亿个在生物测定中测量的活性标签,使其成为该领域最大的基于 FL 的努力之一。
全同态加密
FHE 是另一种强大的技术,它允许对加密数据进行计算而无需解密,确保数据保持安全。2017 年,来自工业界、政府和学术界的专家成立了同态加密标准化联盟,该联盟于 2018 年制定了一项标准,概述了 FHE 应用的安全要求。在药物发现中,FHE 为隐私问题提供了一个有前景的解决方案,它允许科学家对加密数据进行计算,从而保护敏感信息,例如新药化合物的结构和基因组数据。虽然算法改进已经提高了 FHE 的效率,但广泛实施仍然面临挑战,包括高计算需求以及与现有数据工作流程的整合。然而,硬件加速和优化算法的进步可以增强其在使用隐私增强的去中心化人工智能模型构建中的应用。
差分隐私
DP 由 Cynthia Dwork 于 2006 年提出,是一种数学概念,能够在保护个人隐私的同时共享数据。DP 的核心原则是,无论包含还是排除单个数据点,计算的结果都应几乎保持不变。这是通过向结果中添加校准噪声来实现的,有效地隐藏了个人贡献,同时保持分析的总体准确性。虽然 DP 结果是近似的,并且可能随着重复分析而变化,但合理校准的噪声使人工智能模型能够平衡隐私和效用。尽管如此,DP 需要仔细调整噪声水平,以确保数据效用不受损害。DP 已被证明在药物敏感性预测等应用中特别有用。例如,2022 年的一项研究表明,将 DP 与深度学习相结合(一种称为差分隐私深度学习的技术),可以使用基因组数据有效预测乳腺癌状态、癌症类型和药物敏感性,同时保护个人隐私。除了推进包括 SMPC、FL、FHE 和 DP 在内的隐私增强技术的发展以确保人工智能驱动的药物开发中的安全数据共享之外,使这些工具对生物制药创新领域的广大科学家来说易于访问和用户友好也至关重要。处于 PET 开发前沿的组织包括美国的 OpenDP、Duality Technologies 和 Actuate,以及英国的 OpenMined。例如,Duality Technologies 与领先的研究机构(如丹娜-法伯癌症研究所)合作,以改善肿瘤学结果。
算法验证与偏差缓解
随着人工智能在药物开发中变得越来越不可或缺,模型准确性、可靠性、透明度和可解释性等属性对于创造有效的疗法非常重要。然而,人工智能底层神经网络的复杂性常常导致这些模型像黑箱一样运作。为了应对这一挑战,可解释人工智能(XAI)正在成为一个专注于开发更清晰、更可解释模型的人工智能分支。这使得研究人员能够识别和纠正潜在的错误,例如由于训练数据缺陷导致的不准确预测。此外,药物开发是一个日益多学科的过程,涉及化学家、生物学家、临床医生和数据科学家,XAI 有助于使人工智能驱动的见解对非人工智能专家更易理解,从而促进合作。人类专业知识与人工智能见解的有效整合对于加速开发安全有效的疗法至关重要。
美国国家标准与技术研究院(NIST)将值得信赖的人工智能定义为“有效且可靠、安全可靠、有韧性、负责任且透明、可解释且可解释、增强隐私、公平且有害偏差得到管理”。像马里兰大学 NSF 可信人工智能法律与社会研究所(TRAILS)和 AI Now 研究所这样的组织正在努力推广这些原则,以便在包括生物制药在内的不同行业中使用人工智能。验证人工智能的一个日益重要的原因是识别和减轻模型中的潜在偏差。FDA 将算法偏差定义为“模型预测或结果相对于某些数据点或群体与其他数据点或群体相比的系统性偏差”。偏差可能出现在药物开发过程的不同阶段——从用于识别新治疗靶点和候选药物的临床研究数据中的偏差,这些偏差可能使代表性不足的人群处于不利地位,到制造数据中的偏差,这些偏差可能损害模型性能并限制疗法生产的泛化能力。在没有人类监督的情况下,人工智能系统可能会无意中学习并延续其训练数据中存在的偏差。在药物开发中,这种偏差可能导致不公平的结果,例如某些患者群体代表性不足,这可能会扭曲对药物疗效或安全性的预测。这可能导致对这些人群效果较差甚至有害的疗法。验证人工智能模型以检测和纠正偏差,可确保这些技术支持药物开发中的公平性和包容性,为所有患者生产更安全、更有效的疗法。为了促进人工智能辅助药物开发中的公平性,使用多样化、有代表性的数据集非常重要。然而,2009 年的一项研究显示,96% 的 GWAS 参与者是欧洲血统,这一数字到 2018 年下降到 78%。基因组研究缺乏多样性可能会在人工智能算法中引入偏差,如果不加以解决,可能会加剧医疗保健差距,因为它既未能解释不同群体间药物反应的差异,也忽视了在代表性不足人群中流行的疾病。例如,如前所述,最常用的支气管扩张剂吸入器沙丁胺醇对黑人儿童效果较差,原因在于多年来未被发现的遗传差异,因为 95% 的肺部疾病临床试验参与者是欧洲血统。识别导致沙丁胺醇反应差异的特定遗传变异,既增强了科学家对药物疗效的理解,也凸显了包容性研究的价值。为了解决这些偏差,必须使用更具多样性的数据集,这些数据集代表各种人口统计学和临床属性,并采用诸如数据重加权以平衡代表性不足的群体、跨人群模型验证和定期审计等技术。此外,通过 EHR 扩展遗传测序工作并整合来自代表性不足群体的临床数据可能会有所帮助,因为 EHR 数据更能反映现实世界临床环境中看到的多样化人群。除了临床研究中算法偏差的潜在后果外,数据偏差也可能出现在药物制造中,损害模型性能和泛化能力。例如,不同生产批次之间的变异性(例如原材料差异或设备微小变化)如果人工智能模型不成比例地在特定批次的数据上训练,可能会引入偏差,导致不准确的预测和无法跨批次泛化的过程调整。因此,在整个药物开发过程中,从临床研究到制造,减轻算法偏差至关重要。
减少算法偏差的努力
正在开展几项努力来改善生物医学研究中使用的数据的代表性。一个值得注意的例子是 NIH 于 2018 年启动的“我们所有人”研究计划。这项大规模遗传测序计划旨在通过收集来自不同人群的数据来促进健康公平。凭借超过 31 亿美元的资金,它旨在创建世界上最多样化的生物医学研究遗传数据集。目前,“我们所有人”计划中 80% 的参与者来自历史上在生物医学研究中代表性不足的群体,涵盖不同的种族、民族、年龄、地理位置、医疗保健可及性和残疾状况。数据包括调查回复、EHR、基因组序列以及来自 Fitbit 等设备的活动数据。研究人员可以通过一个集中的基于云的工作台访问这些信息。自 2020 年首次数据发布以来,基于这些数据已发表了超过 200 篇同行评审文章。“我们所有人”计划通过提供大多数主要生物样本库资源所缺乏的增强多样性,填补了基因组研究中的一个关键空白。例如,世界上最大的全基因组数据集 UK Biobank 已发布了约 50 万个基因组,其中约 88% 来自白人个体。一项关于 2 型糖尿病的研究说明了拥有多样化数据集的优势。利用来自超过 250 万个体的数据,其中也来自“我们所有人”计划,包括近 40% 的非欧洲血统,研究人员识别了 611 个可能影响糖尿病发展和进展的遗传标记,其中 145 个是以前未知的。这些发现有可能指导更精确、基于遗传信息的糖尿病护理。此外,与药物代谢相关的遗传变异的人群特异性差异强调,某些药物可能对特定群体更安全或更有效。这些发现对于确保人工智能驱动的药物开发公平且反映多样化人群至关重要。
与工作流程整合
人工智能有可能重塑生物制药创新的生产过程,快速扫描庞大数据集以发现相关性并进行预测。但人工智能应被视为人类科学家的补充,而非替代品。虽然人工智能擅长检测模式,但它无法辨别因果关系——例如,一种与疾病相关的蛋白质是实际导致疾病,还是仅仅与之相关。人类专业知识对于设计有效药物仍然至关重要,因为科学家发现并绘制了这些关键的因果关系,人工智能模型可以在此基础上进行预测。这也有助于缓解对失业的潜在担忧。通过将工作的任务重新打包成不同的类别——一些适合人类,另一些适合人工智能——我们可以阐明它们在药物开发中各自的互补作用。将人工智能有效整合到药物开发工作流程中,对于利用人工智能的预测能力和人类判断力来加速开发安全有效的疗法至关重要。这种整合涉及大量的前期成本,用于员工培训和工作流程系统调整。实施这些变化需要协调努力、互补资产、财务资源、管理支持和长期投资视角。
政策建议
支持人工智能在药物开发中的采纳需要一种全面的方法,将公共政策结合起来,以应对许多技术、运营和监管挑战,同时促进创新。以下是几项政策建议,可以促进人工智能在药物开发中的有效整合。
支持隐私增强的数据共享和访问
信息技术与创新基金会(ITIF)2019 年的一份报告主张在美国开发一个国家健康研究数据交换平台,这可以增加支持数据驱动药物开发的数据可用性。朝着这个方向努力的一个突出倡议是可信交换框架和共同协议(TEFCA),旨在促进安全、有效的健康数据交换,并在国家层面推进互操作性。TEFCA 作为 2016 年《21 世纪治愈法案》的一部分引入,由 HHS 实施。TEFCA 于 2022 年初正式启动,2023 年底上线。它旨在创建一个全国性的安全健康数据交换网络,实现医疗保健提供者、患者和公共卫生机构之间的互操作性和 EHR 共享。目前有七个组织被指定为 TEFCA 下的合格健康信息网络(QHIN),促进包括 Epic Nexus、eHealth Exchange 和 Health Gorilla 在内的不同利益相关者之间的数据共享。支持 EHR 采纳的额外公共政策,例如旨在加强在行为健康服务中使用 EHR 的拟议立法,可能会进一步提供帮助。促进整个生物制药生态系统数据格式标准化、使其不那么分散和零散的政策,也将使人工智能模型能够共享和访问多样化数据集,增强其稳健性和有效性。此外,EHR 系统需要一个更深层次的概念框架,能够系统地捕捉临床心理模型的复杂性,并整合额外的数据,如患者报告的结果,以改善人工智能模型训练。隐私增强技术(PET)可以进一步支持并鼓励不同数据源的共享。虽然 PET 已取得重大进展,但在其开发、实施和采纳方面仍需取得更多进展。最近的政策努力旨在加强这些进展。2023 年 10 月,白宫发布了由科技政策办公室(OSTP)牵头的《推进隐私增强技术愿景的行政命令》。该命令呼吁设计、开发和部署 PET。随后,2024 年 4 月,《隐私增强技术研究法案》(H.R.4755)在众议院通过,截至本文撰写时正在参议院审议。该法案将授权 NSF 支持 PET 研究,并指示 OSTP 与其他联邦机构协调以加速其开发、部署和采纳用。推动 PET 创新的关键组织包括美国的 OpenDP、Duality Technologies、Actuate 以及英国的 OpenMined。支持 PET 进步的政策可以促进生物医学研究中敏感数据的更多使用,从而加速人工智能驱动的药物开发。
此外,政府可以支持建立数据银行——收集临床、遗传和药物数据的大规模存储库——以增强人工智能模型的训练。一个突出的例子是 NIH 的“我们所有人”计划,通过创建一个全面且多样化的数据资源,可以作为人工智能驱动的生物制药研究的训练数据。另一个例子是“癌症登月计划”,该计划促进医疗保健和制药部门之间的合作与数据共享,以推进癌症治疗。
除了隐私增强的数据共享方法,其他策略可以进一步鼓励整个生物制药生态系统的合作。一个很有前景的方法是建立公私合作伙伴关系(PPP),以促进工业界、学术界和政府利益相关者之间的合作。此类 PPP 可以通过解决关键问题(如知识产权和竞争优势)来协调公共机构和私营公司的利益。虽然生物制药公司通常对其数据集保密以保持竞争优势,但促进公司与研究机构之间的合作可以加速人工智能驱动的药物开发。这种合作方式可以带来更安全、更透明、更可重复的创新过程,同时减少冗余和相关风险。
许多 PPP 已经出现,专注于竞争前研究,这是一个数据共享不会损害公司竞争优势的阶段。在这种环境下,公司可以从共享的研究成本、访问更大和更多样化的数据集以及简化流程中受益。这种模式已在不同地区成功实施。例如,IHI,世界上最大的生物医学 PPP,旨在通过其前述的联邦学习平台 MELLODDY 等举措,增强欧盟在药物研究中的竞争地位并加速下一代疗法的开发。
另一个例子是 ADNI,由 NIH 国家老龄化研究所(NIA)于 2004 年启动。它仍然是阿尔茨海默病研究中最大的 PPP,汇集了美国各地的领先研究中心、NIA、制药公司和基金会,以推进阿尔茨海默病研究。ADNI 的公开数据库由神经影像学实验室托管,也为增强对阿尔茨海默病以外复杂疾病的理解做出了重大贡献,促进了更广泛的科学发现。如前所述,另一个著名的 PPP 是 Open Targets,它是 EMBL-EBI 和 Wellcome Sanger 研究所等研究机构以及辉瑞、基因泰克和 GSK 等制药公司之间的合作。其目标是利用生物学数据识别和验证药物发现的治疗靶点,并将数据公开以加速进展。
结构基因组学联盟(SGC)是一个 PPP,联合了学术研究人员和制药公司,如强生、辉瑞和基因泰克。它专注于开放获取研究,旨在理解人类蛋白质的结构和功能,并生成公开可用的数据,如蛋白质结构和化学探针。在 SGC 开放科学模式的基础上,一项名为 Conscience 的新倡议于 2023 年启动,与 SGC 合作,并得到加拿大政府 4900 万美元的投资支持。Conscience 汇集了学术界、研究人员、工业界和社区领袖,以解决药物开发中的市场失灵问题,特别是在神经退行性疾病、大流行防范、罕见儿童疾病和抗菌素耐药菌等领域。Conscience 的方法依赖于两个关键支柱:人工智能和开放科学。通过促进公司和研究人员之间的合作,Conscience 旨在推进人工智能的最佳实践,构建加速药物发现的工具,并为共享学习创造基准。其开放科学模式鼓励组织之间交换数据和发现,减少重复、低效和成本。这些举措共同推动了一种整体的生态系统创新方法,弥合了工业界、学术界、政府和非营利组织之间的差距,以加速人工智能驱动的药物开发。
这些举措凸显了 PPP 如何在竞争前研究中鼓励数据共享,支持人工智能模型的训练,从而在有效构建的情况下加速人工智能驱动的药物开发。学术界、工业界和政府之间的合作可以建立安全、隐私增强的数据共享和分析框架,使生物制药生态系统中的多个利益相关者受益,并推动创新,同时促进可重复性、透明度和可解释性等原则,并降低风险和冗余。
公共资助
政府可以通过增加对关键举措的资助来显著推进人工智能驱动的药物开发研究。例如,NIH 的 Bridge2AI 计划旨在通过跨学科合作和大规模数据创建来加速人工智能在生物医学研究中的采用。此外,NIH 的小企业创新研究(SBIR)和小企业技术转让(STTR)计划为小企业(包括那些为药物开发开发人工智能解决方案的企业)提供种子资金,而 NSF 的技术、创新与合作局已支持人工智能驱动的平台来加速药物发现。高级健康研究计划局(ARPA-H)也领导了几项旨在增强人工智能驱动的药物发现的举措。公共资助——作为生物制药公司投资的先导和补充——对于几个原因至关重要。它为基础研究提供资金,例如关于新药物开发算法的人工智能研究以及人工智能在基础科学中的应用,这些研究可能不会立即产生商业回报,但可以为重大突破铺平道路,并进一步激励私营部门投资。通过资助没有直接商业应用或具有高度不确定性的研究,公共资助可以促进可能被忽视的创新。此外,公共资助有助于提高效率、降低早期创新的风险,并确保人工智能工具满足公共卫生需求,从而增强健康公平。这对于解决抗菌/抗菌药物研究等领域未满足的医疗需求至关重要,因为在这些领域,私人投资可能不足。例如,ARPA-H 应对大规模健康挑战的使命与过去国防高级研究计划局(DARPA)开发互联网和全球定位系统(GPS)技术早期基础设施的努力相呼应。这些过去的成功表明,公共资助如何通过支持高风险创新(这些创新后来可以商业化)来推动变革性进步。公共资助还鼓励开放科学和合作,导致创建公共产品,如庞大数据集、工具和基础设施,可供药物开发生态系统中的所有参与者使用。最后,公共资助可以解决伦理和隐私问题,确保人工智能的发展符合公平、透明和减轻偏差等指导原则,以支持公平的人工智能驱动的药物开发。
政府还可以促进学术界与私营部门之间的合作,以推进人工智能在药物开发中的研究和应用。例如,加速药物合作伙伴计划(Accelerating Medicines Partnership program),这是一个由 NIH、FDA、生物制药公司和非营利组织于 2014 年发起的 PPP,可以扩展以支持人工智能驱动的药物发现。最后,为投资人工智能药物开发的公司提供激励措施,可以降低采纳的财务障碍,鼓励创建人工智能工具并将其整合到药物开发管线中。
教育与劳动力发展
政府还应投资于人工智能和数据科学培训,为下一代科学家做好人工智能辅助药物开发的准备,包括更新医学和制药课程以反映人工智能的进步。药物开发的未来取决于人类科学家与人工智能技术之间的有效合作,科学家利用其因果推理技能将人工智能预测转化为有效疗法。这种合作不仅增强了药物开发过程,还确保了治疗创新建立在坚实的科学理解基础上。为了确保有效的人机协作,政策必须鼓励将人工智能整合到生物医学研究中,支持跨学科合作,并建立最佳实践。诸如 NSF 等机构可以支持对人机交互复杂性的研究,而劳工部可以通过专注于高水平问题解决和推理任务的培训计划,帮助工人为人工智能密集型就业市场做好准备。拥抱人类创造力和人工智能的优势可以共同推动生物制药创新。NSF 的人工智能研究所等项目体现了这种方法,推进人工智能研究并培训科学家,包括在生物医学领域。同样,NIH 的大数据到知识(BD2K)计划提供跨学科培训,使研究人员掌握人工智能和生物医学数据科学技能,以加速创新。培养人工智能人才管道是关键。政策制定者应促进各级人工智能相关教育,确保课程计入毕业要求,扩大 STEM 重点特许学校的准入,并激励高等教育中的计算机科学。随着人工智能重塑药物开发并改变传统角色,对公共和私营部门的工人进行再培训,有助于确保人工智能顺利融入现有工作流程。此外,政策制定者可以为人工智能专业人员建立新的移民渠道,以吸引和留住该领域的人才。2023 年 10 月白宫关于安全、可靠和值得信赖地开发和使用人工智能的行政命令承认了外国人工智能专业知识的重要性,并倡导政策改革以现代化人工智能专家的移民途径。这些措施有助于美国在竞争激烈的全球人工智能专业知识市场中保持领导地位。
监管指南
药品监管机构已看到人工智能驱动的药物应用激增,并正在积极努力理解这些工具的监管影响。仅在 2021 年,FDA 就收到了 100 多份此类提交,涉及人工智能应用,涵盖药物发现、临床研究、上市后监督和先进制造等领域。2024 年 9 月,在与开发者、学者和监管机构就先前草案进行数月磋商后,EMA 发布了一份关于人工智能在药物开发中的反思文件。该文件鼓励采用基于风险的方法来开发、部署和监控此类工具,风险取决于具体的人工智能用例。例如,药物发现中的人工智能应用通常被认为是低风险的,因为人工智能辅助提出的候选药物仍将经过通常严格的临床试验测试。在非临床开发中,取代或减少动物测试的人工智能模型必须遵守良好实验室规范(GLP)。在临床试验中,早期试验(例如,用于患者选择和招募的人工智能)的监管风险较低,但在后期阶段会增加。在制造中,在工艺设计、优化、放大和质量控制中应用人工智能应遵循质量风险管理原则,以确保患者安全和产品质量。2023 年,FDA 发布了一份讨论文件《在药物和生物制品开发中使用人工智能和机器学习》,概述了人工智能/机器学习在药物开发中的不同用例,并强调采用基于风险的方法来评估此类工具,基于特定人工智能应用对患者的风险。FDA 已征求利益相关者对其文件的反馈,并旨在 2024 年底前完成指南,旨在安全地扩大人工智能/机器学习工具在药物开发中的采纳。明确和简化审查过程以支持在药物开发中使用人工智能/机器学习,并采用基于风险的方法,认识到某些应用(如药物发现)的风险低于其他应用的政策,可以鼓励更广泛地采纳这些工具。为了在全球范围内推动其采纳,来自不同国家的监管机构也可以协调制定统一的标准和批准流程,用于人工智能辅助的药物开发,使在多个国家运营的监管机构和制药公司都受益。
此外,国际人用药品技术要求协调理事会(ICH)致力于制定指南以促进全球监管流程的一致性,也在寻求协调如何在药物开发中使用人工智能,确保跨国际边界的安全性、有效性和质量。
结论
药物开发已变得越来越复杂,其特点是时间线更长、风险更高、成本不断上升。这种复杂性源于几个因素。首先,科学家对与健康和疾病相关的生物学过程的理解日益加深,需要更先进的研究方法和技术工具。其次,更严格的监管要求需要广泛的数据收集和分析,以确保安全性和有效性。第三,对复杂疾病(如癌症和神经退行性疾病)的日益重视需要创新的方法,包括新的药物模式。第四,增加临床试验多样性的努力导致了更全面的试验设计。最后,对精准医学日益增长的需求,需要靶向方法,进一步增加了这种复杂性。
新兴技术,特别是人工智能,有潜力改变生物制药创新。人工智能可以增强药物开发的各个阶段,从加速药物发现和优化临床试验,到简化监管审查和改进制造与供应链。这些进步可以显著提高研发生产力,通过实现更高效的资源利用、更快地识别可行候选药物以及减少昂贵的临床试验失败——最终促进更大的创新,并增加将更多有效、新颖的疗法更快推向市场的可能性。通过加快药物开发的每个阶段,人工智能可以加速突破性疗法的可及性,帮助满足紧迫的公共卫生需求,并减轻社会疾病负担。正如本报告中的案例研究所展示的,人工智能具有广泛的应用:它可以改善临床试验的包容性,以确保疗法在不同人群中有效,从而推进健康公平的政策目标;当与 EHR 结合时,人工智能可以帮助识别未被诊断的个体,特别是在服务不足的社区中,从而减少健康差距;在药物发现中,人工智能可以加速治疗靶点识别和药物设计;在制造中,人工智能可以增强基因疗法的设计和生产。通过提高研究生产力,人工智能加强了生物制药部门对创新的贡献,促进就业、经济韧性和全球竞争力。此外,人工智能可以通过提高数据质量和自动化合规来简化监管流程,允许更快、更安全地获得基本疗法,同时保持严格的安全标准。
一个支持性的公共政策框架对于人工智能在药物开发中有效和负责任的整合至关重要。关键要素包括对人工智能相关药物开发基础研究的公共资助;为劳动力做好生物制药创新中人工智能辅助未来准备的教育倡议;支持隐私增强共享和获取高质量数据的工具;通过公私合作伙伴关系等努力进行合作;以及开发基于风险的方法来评估人工智能工具,根据每个人工智能应用可能对患者构成的风险水平进行调整。这些政策对于释放人工智能在药物开发中的全部潜力、加速提供和更广泛地获得可能挽救生命的疗法至关重要。
致谢
作者感谢 Robert Atkinson、Stephen Ezell、Daniel Castro、Hodan Omaar、Randolph Court 和 Austin Slater 对本报告的有益反馈。作者还要感谢 Asimov、基因泰克、吉利德和强生为案例研究提供的见解。任何错误或遗漏均由作者本人负责。
关于作者
Sandra Barbosu 博士是 ITIF 生命科学创新中心副主任。她的研究重点是科学和创新经济学,特别关注医疗保健领域的新兴技术。Sandra 还是纽约大学坦登工程学院技术管理与创新系的兼职教授。她拥有多伦多大学罗特曼管理学院战略管理博士学位、牛津大学精准癌症医学硕士学位以及罗切斯特大学经济学和数学学士学位。
关于 ITIF
信息技术与创新基金会(ITIF)是一个独立的 501(c)(3) 非营利、无党派研究和教育机构,多次被公认为世界领先的科学技术政策智库。其使命是制定、评估和推广政策解决方案,以加速创新和提高生产力,从而刺激增长、机遇和进步。更多信息,请访问 itif.org/about。
【全文结束】

