数据基础设施为何决定药物发现中AI的成功Why Data Infrastructure Determines AI Success in Drug Discovery

环球医讯 / AI与医疗健康来源:www.genengnews.com美国 - 英语2026-08-28 15:59:53 - 阅读时长8分钟 - 3930字
本文探讨了数据基础设施在药物发现中应用AI的关键作用,指出AI模型的成功并非仅取决于算法先进性,更依赖于数据质量、结构和治理。文章分析了三大挑战:以机器可读格式捕获分子复杂性,大规模实施FAIR数据原则,以及通过协作平台准备数据集。文章强调,为生物制剂、抗体药物偶联物等提供原子级表示,并构建符合监管要求的、可追溯的数据架构,是实现AI从理论到实际研发价值的基础。作者认为,忽视数据基础而只关注算法的组织将缺乏远见,而投资数据基础设施的组织将能更好地利用未来的计算进步。
药物发现AI数据质量FAIR原则生物制剂抗体药物偶联物监管合规协作
数据基础设施为何决定药物发现中AI的成功

过去五年,药物发现行业对AI的投资和依赖达到了前所未有的水平。在这种兴奋之中,一个基本问题常常被忽视:当复杂的AI模型遇到实验室数据的混乱现实时,会发生什么?

AI正变得与现代药物发现密不可分——机器学习模型被应用于定量构效关系分析、靶点识别、先导化合物优化,甚至监管策略。尽管算法取得了令人瞩目的进步,但生命科学领域的许多AI工作要么表现不佳,要么彻底失败。这并非AI模型复杂性的问题,而是数据质量、结构和治理的问题。

在此,我们探讨AI就绪的药物发现数据所需的基础设施要求,重点关注三个相互关联的挑战:以机器可读格式捕获分子复杂性、大规模实施FAIR(可查找、可访问、可互操作、可重用)数据原则,以及通过以协作为中心的平台准备数据集。所有这些都为AI在现实研发环境中可靠运行提供了基础。

数据质量至关重要

Fay Lin在2025年12月对Najat Khan博士的专访提醒我们,Recursion公司的下一章表明,由AI驱动的药物发现能够持续提供临床价值。临床严谨性依赖于卓越的临床前执行力。AI赋能的药物发现需要支持“设计-制造-测试-分析”循环的平台——这是制药研发中用于将治疗性知识产权推进为药物的、基本的、迭代的四阶段工作流程。

计算药物发现长期以来依赖于化学感知原则:即分子的特定化学特性是其生物功能和发挥作用机制的主要驱动因素。这一重点建立了一个标准,即平台针对小分子进行了优化,将其结构表示为原子和化学键的离散图,以促进高通量属性预测和先导化合物优化。

机器学习模型从数据中学习,其有效性完全取决于输入数据的质量。输入干净、结构良好的数据,它们就能识别出微妙的构效关系模式,从而补充人类直觉。输入不一致、不完整、模棱两可或格式不佳的数据,它们就会从信号中学习噪声,从而产生自信但不可靠的预测。在药物发现中,这些弱点因系统性问题而被放大,包括:

  • 异质性分析方法和命名惯例
  • 不完整或模糊的化学表示
  • 生物学结果与化学背景之间的关联性差
  • 在协作、外包、人员更替、重组或并购过程中丢失来源信息

对于当今的生物治疗药物来说,挑战更大。抗体药物偶联物、多肽治疗药物和寡核苷酸药物带来了额外的表示复杂性,这是传统的小分子数据库无法处理的。

生物制剂的原子级表示

几十年来,制药行业将小分子和生物制剂视为不同的领域,需要不同的信息学方法。小分子使用SMILES或MOL文件等格式进行原子级表示。生物制剂——蛋白质、多肽、寡核苷酸——通常被简化为序列符号,即代表氨基酸或核苷酸的字母字符串。

这种二分法在治疗药物模式融合时会产生问题。抗体药物偶联物将单克隆抗体(通常通过化学连接子与细胞毒性小分子药物有效载荷连接)结合起来。连接子的连接化学、有效载荷的结构以及药物-抗体比率都会影响药理特性。仅靠序列符号表示法无法捕获这些信息。

一种更全面的方法是在原子分辨率下表示生物制剂,同时保持生物学家偏好的、熟悉的序列级别视图(例如,混合模式、HELM)。"化学感知生物制剂"信息学不仅仅意味着"赖氨酸",而是意味着每个修饰氨基酸的完整原子连接性。当半胱氨酸残基与连接子-有效载荷形成硫醚键时,该键会被明确捕获,而不是消失在脚注中。

实际实施需要能够同时理解化学结构和生物序列的数据库——一种具有"化学感知"能力的生物制剂。当研究人员查询"显示所有通过马来酰亚胺化学连接该有效载荷的抗体药物偶联物"时,系统必须解析小分子结构以及抗体上的结合位点。

这种原子级方法扩展到其他治疗模式。含有非天然氨基酸的合成多肽、具有硫代磷酸酯骨架的化学修饰寡核苷酸,以及具有非标准连接性的环状多肽,都受益于能够捕获完整分子结构(而非通过序列注释进行近似)的表示方法。

图1. 单体SCSR——一次观察一个单体结构对于许多用例来说是一个很好的解决方案,但有时你只想看到整个化学结构。这对于寡聚物尤其相关。

图2. 抗体注册——在这个特定数据库管理平台的框架内,构建抗体的第一步是拉出重链上的铰链区并将其对齐,保持比例。如果指示了任何其他结构域,则对片段进行划分和注释。绘制链间连接,以及任何指示的单个链内的二硫键。最后,使用颜色"条形码"样式指示每个氨基酸的身份。

图3. 抗体和抗体药物偶联物的渲染图,以描绘化学感知序列。

在工业规模上实施FAIR原则

FAIR数据原则已成为各科学领域的号召。在药物发现中,实施这些原则需要的不仅仅是哲学上的承诺;它需要特定的技术基础设施。

可查找性始于更好的元数据注释,这反过来需要降低捕获数据来源和上下文难度的工具。使用标准化描述符(指定运行了何种分析方法、筛选了何种靶点、使用了何种条件)的实验更有价值。没有一致的元数据,有价值的数据集的价值就会降低——只有碰巧知道其存在的研究人员才能发现它们。

本体论为注释提供了正式的、计算机可读的词汇表。本体论定义了标准术语及其关系:"IC50"是"剂量-反应参数"的一种,而"剂量-反应参数"是"效力测量"的一种。当研究人员使用相同的本体论来注释他们的分析方法时,数据集就变得可在项目和治疗模式之间进行搜索。

实施是挑战所在。专注于推进其项目的科学家没有时间进行数据注释。有效的系统必须使FAIR实践更容易被采纳,例如根据实验上下文建议合适的本体论术语,在传播前标记不一致的注释,并提供立竿见影的好处(例如,更好的可搜索性、更容易生成报告),以证明适度的额外努力是值得的。

互操作性需要通用的数据格式和交换标准。当计算化学家想要使用来自多个内部项目的数据构建机器学习模型时,这些数据集必须在结构上兼容。字段名称、单位和化学表示应无需大量手动协调即可对齐。注释提供了定量定义相关分析方法相似性的机会。

这在研究人员合作时尤其重要,例如在并购期间。组织必须整合来自不同信息学系统的数十年研究数据。保持严格数据标准的公司可以相对顺利地进行数据迁移和合并。它们通常也能够适应新的监管要求,例如体外药理学和非动物方法。

符合监管要求的数据架构

药物发现数据服务于多个学科。其架构必须支持科学管理决策、实验性构效关系优化、AI模型训练,并最终经受住监管审查。监管提交材料越来越强调数据完整性和可追溯性。

审计员寻求的不仅仅是最终结果。他们寻找完整的证据链:原始仪器数据、处理步骤、分析决策和最终解释。仅设计用于训练AI的系统可能缺乏监管机构所需的审计追踪。

解决方案是从一开始就将监管合规性嵌入数据基础设施中。这意味着捕获每个数据点的来源,维护分析方法的版本控制,并实施能够证明数据完整性的访问控制。

监管要求与AI最佳实践一致并非巧合,它们都要求一致的数据格式、清晰的实验方法文档以及分析决策的可追溯性。为监管合规性而构建的组织也会发现其数据非常适合机器学习,反之亦然。

连接计算与实验工作流程

如果最复杂的数据基础设施给实验室科学家带来不便,那它就价值甚微。为了避免减慢工作的系统,研究人员通常会寻找变通方法,并诉诸于维护自己的电子表格和本地"数据库",这会使组织知识碎片化。

有效的实施需要与科学家的工作方式相结合。这转化为需要无需安装软件的基于浏览器的界面、集成平台以处理各种功能和模式的科学工作流程,或与计算化学工作流程连接的API。目标是让良好的数据实践成为阻力最小的路径。也许最重要的要求是实验科学家能够在其现有工作流程中自然使用的软件。

新兴的AI能力提供了新的机会。生成模型可以建议问题官能团的生物电子等排体替代品,从而可能提高代谢稳定性或降低毒性。蛋白质结构预测工具如AlphaFold2、ESMFold、Boltz-2及其后继者,使得计算机模拟评估成为可能。

将这些能力集成到管理实验数据的同一环境中,创建了一个从假设生成到实验验证的无缝工作流程。

图4. 在与实验数据关联的实体注册的同一环境中,进行生物电子等排体建议。

图5. Boltz-2数据与湿实验室数据存储在同一环境中无缝连接的示例。

协作式药物发现

药物发现越来越多地通过伙伴关系进行:学术合作、CRO关系、联盟努力、初创公司与大型制药公司的合作,以及针对被忽视的热带病和罕见病的竞争前合作。有效的协作需要精细的访问控制。

额外的挑战需要协作信息学来实现数据分区、来源管理以及只读与读写用户权限。合作中产生的数据谁拥有?每一方可以保留多久?谁可以用它来训练AI模型?

信息学基础设施必须足够灵活,以实现任何达成的协议。这意味着基于角色的权限、项目特定的访问规则,以及能够证明符合数据共享协议的审计追踪能力——在通过明确的数据治理政策保护专有信息的同时,允许合作伙伴查看相关数据。

随着AI的发展,对高质量训练数据的需求只会增加。在当前AI热潮中投资于数据基础设施的组织,将发现自己在未来无论出现何种计算进步都处于有利地位。那些只关注算法而忽视构建数据基础的组织,将被视为缺乏基本的远见和洞察力。

教训并非AI被过度炒作。要实现其潜力,需要同样关注数据管理这个不那么光鲜但更重要的角色。在药物发现中,如同在建筑学中一样,基础决定了可以在其上建造什么样的结构。

Barry Bunin博士是Collaborative Drug Discovery的首席执行官和董事会成员;Alex Clark博士是研究科学家;Peter Gedeck博士是化学信息学与数据科学家;Janice Darlington是科学家和导师。

【全文结束】

猜你喜欢
  • Quotient Therapeutics宣布与默克合作,利用体细胞基因组学平台技术发现炎症性肠病新药靶点Quotient Therapeutics宣布与默克合作,利用体细胞基因组学平台技术发现炎症性肠病新药靶点
  • 低剂量白血病药物可清除衰老脂肪细胞并减轻炎症低剂量白血病药物可清除衰老脂肪细胞并减轻炎症
  • 与肾移植共存的感觉与肾移植共存的感觉
  • 从碎片到地图:规模化药物-靶点相互作用数据从碎片到地图:规模化药物-靶点相互作用数据
  • 克里斯托普洛斯教授荣获NHMRC研究卓越奖克里斯托普洛斯教授荣获NHMRC研究卓越奖
  • 2026年医疗保健领域人工智能统计与事实2026年医疗保健领域人工智能统计与事实
  • 三合一的“活体药房”植入物可在体内生产多种药物三合一的“活体药房”植入物可在体内生产多种药物
  • Pharmaceutical Executive Daily:礼来施压英国政府提高NHS药品定价Pharmaceutical Executive Daily:礼来施压英国政府提高NHS药品定价
  • 为什么2026年是人工智能成为药物研发合作伙伴而非单纯处理器的一年为什么2026年是人工智能成为药物研发合作伙伴而非单纯处理器的一年
  • 人工智能在医疗保健中的应用:七大用例与益处人工智能在医疗保健中的应用:七大用例与益处
热点资讯
全站热点
全站热文