天然产物发现中人工智能应用的化合物鉴定障碍
人工智能(AI;见术语表)正在通过加速去重、结构注释、靶点优先排序和多组学整合,迅速重塑天然产物(NP)药物发现。质谱(MS)、谱图网络、深度学习和基础模型的最新进展扩大了可用于NP研究的计算工具范围。这些发展使AI在发现管道的各个阶段都变得越来越有价值,从提取物级分析到候选物优先排序(图I)。
图I:AI改变了药物发现格局。传统流程可以将20,000多种化合物过滤为单个获批药物,历时10-15年(上方面板)。AI驱动的靶点识别整合组织表达、人类遗传学、生物医学知识图谱和计算机模拟扰动,汇聚到经验证的靶点上,将范式从高失败率的试错转变为预测性、低失败率的候选物选择(下方面板)。关于监管级AI证据和机制可解释性:根据FDA现代化法案2.0版,包括生理药代动力学建模和计算机毒理学在内的非动物方法可以在提供机制依据的情况下支持IND申请。对于天然产物,监管级AI证据需要三个要素:(i)具有MSI 1级置信度的化学定义输入,实现可审计的结构-活性追溯;(ii)与特定分子特征相关联而非黑箱相关性的机制可解释模型输出;(iii)将计算推断与湿实验室数据正交实验验证相锚定。数据质量引导框架满足所有三个要求,产生可解释、可审计的AI证据轨迹,而传统黑箱平台在结构上无法提供。
然而,与合成化合物不同,NP通常在结构确定性不完全、受栽培条件和季节变化等因素影响的可变组成以及不均匀分析分辨率条件下进行研究。这些挑战不仅影响传统NP研究;它们还限制了AI在此领域的可靠应用,因为计算性能强烈依赖于基础化学输入的质量、一致性和可解释性。因此,当前AI在NP药物发现中的应用仍然有限,且难以在研究之间进行标准化。
这一限制的核心原因是持续的成分规格问题——在化学未解析提取物或馏分中观察到的生物活性与AI方法可靠推断所需的定义成分级化学身份之间的不匹配。在许多研究中,生物活性是在提取物或部分注释馏分级别上观察到的,而负责成分的身份仍不确定。在这种情况下,即使基础化学输入未完全定义,计算输出也可能显得精确。这种转化瓶颈可能因化学暗物质——在参考库和AI训练数据集中未表征的、具有生物活性或结构相关性的成分——而进一步加剧。AI模型越复杂,如果分析证据不足,则过度解释的风险就越大。因此,核心挑战不仅仅是如何在NP发现中应用更多AI,而是如何使AI策略与实际可用的化学确定性水平相匹配。
上述观察指向一个简单但有影响力的见解:NP研究已经拥有了一个持久且广泛接受的化学证据质量锚点。代谢组学标准倡议(MSI),于2007年建立以标准化代谢组学报告,提供了一个稳定的框架来分类代谢物鉴定置信度(图I)。正如最近的综述已经突出了AI启用工具在NP药物发现各个方面的潜力,我们认为下一步的关键是将这些有前景的工具与MSI定义的化学证据水平对齐,从而为它们的使用开发更操作化的策略。在此基础上,我们介绍数据质量引导的AI框架,其中MSI水平证据作为在整个发现管道中选择阶段适当AI方法的基础。该框架将AI定位为由人类专业知识指导并根据分析证据校准的决策支持工具,而非自主发现引擎。
通过数据质量引导策略选择重新审视当前AI应用
数据质量引导框架不是按功能组织AI工具,而是按可用的化学证据水平组织。随着MSI鉴定置信度从3级提高到1级,更依赖结构的方法逐渐变得可行。
提取物级推断(MSI 3级)
在MSI 3级,单个化合物身份仍未解析——这在NP研究中很常见,因为复杂提取物可能包含许多难以通过常规纯化分离的结构相关成分。在这种情况下,AI策略不能依赖于定义的分子输入,而必须从提取物级别的组成概况推断生物活性。
人参属(Panax)物种的皂苷丰富提取物说明了这一挑战:它们含有多种结构相关的皂苷,其单独分离不切实际,但质量控制和地理认证在商业上仍然至关重要。训练于这些提取物组成指纹的深度学习模型已将化学概况与地理来源和质量属性联系起来,无需化合物级纯化,表明MSI 3级的AI引导模式识别可以产生可行输出——尽管此类预测的转化范围仍受基础化学输入未解析性质的限制。
除单化合物建模外,网络药理学提供了MSI 3级的补充策略,通过将分析目标从复杂提取物中的单个分子转移到途径级相互作用。当化合物级分辨率不可用时,这种方法特别相关,因为它允许研究人员从提取物的集体药理学特征推断多靶点机制,即使每个成分的先验识别在分析上具有挑战性。例如,对毛冬瓜(Benincasa hispida)——一种用于亚洲传统医学中代谢疾病的葫芦科植物——的代谢物分析揭示了胰岛素抵抗途径的协调调节,而无需单化合物分离,而对共给药的黄芩(Scutellaria baicalensis)和茜草(Rubia cordifolia)提取物的整合分析则确定了溃疡性结肠炎模型中的协同免疫调节作用。
重要的是,MSI 3级的协同作用预测涉及随提取物复杂性因子增长的组合空间。这个问题因化学暗物质而进一步复杂化——训练数据集中不存在的未表征成分可能引入系统预测偏差。MSI 3级的预测应被视为需要正交实验验证的假设(见"关键问题")。
混合物级谱图分析和片段评分(MSI 3级 → 2级)
第二类MSI 3级方法在谱图级别而非生物活性级别操作。虽然前述策略从组成概况推断药理效应,但混合物级分析直接从谱图数据中提取结构信息——使研究人员能够在纯化仍不切实际的情况下生成化合物级假设。混合深度学习架构,如FlavorFormer和生化计量2D 核磁共振(NMR)异核协方差分析,将谱图特征与生物活性相关联,从而在无需分离的情况下实现化合物优先排序。例如,一种结合液相色谱(LC)-紫外检测-高分辨率串联质谱(HRMS)谱图处理与监督机器学习的AI引导工作流程,使研究人员能够无需广泛纯化即可优先选择和分离泡桐果实提取物中的预nylated黄酮类化合物。
随着分析分辨率提高到MSI 2级,这些谱图方法可以从混合物级模式识别转向化合物级假设生成。深度学习方法现在整合¹H和¹³C NMR谱图表示,以改进定量结构-性质关系(QSPR)建模和片段评分,帮助优先选择化合物进行纯化。例如,从复杂植物提取物中优先选择出的刺茄(Solanum muricatum)的生物活性成分与抗甲氧西林金黄色葡萄球菌的抗菌活性相关联,展示了上游谱图评分如何简化下游生物活性分析。
分子网络和质谱注释(MSI 2级)
在MSI 2级,部分结构信息通过质谱数据获得,使网络分析与MSI 3级描述的途径级推断有根本不同。全球天然产物社交分子网络(GNPS)分子网络通过MS/MS谱图相似性将结构相关的代谢物聚类,实现同时去重和新类似物发现。与SIRIUS和CSI:FingerID的整合支持直接从碎片化模式进行计算机结构注释。
此前,我们将此工作流程应用于褐藻Endarachne binghamiae的次级代谢物,在MSI 2级鉴定出生物活性化合物,包括叶绿素A和digiprolactone。深度学习辅助的气相色谱-MS工作流程也可以无需手动参数优化即可解析重叠的色谱峰。一种伪孪生卷积神经网络方法在精油分析中优于传统工具,如自动质谱解卷积和识别系统(AMDIS)、Chemprop和mzmine。深度学习集成工作流程,如DeepHalo,进一步将GNPS网络扩展到未探索的化学空间,实现从复杂微生物基质中高通量鉴定卤化代谢物,包括新型肽支架。
配体靶点预测(MSI 1级)
MSI 1级分析实现配体靶点预测,这需要定义的分子结构作为输入。传统上,配体与已知药物的化学相似性是主要推断路线。最近,含有超过35,000个NMR表征NPs的天然产物磁共振数据库,可在资源密集型靶点识别活动之前实现快速去重和新颖性评估。贝叶斯机器学习框架进一步提高了发现效率。主动学习方法通过迭代选择最大信息量的实验指导大规模药物组合筛选,提高预测能力同时减少实验负担。
基于结构的分子对接和动力学(MSI 1级)
MSI 1级的完整结构确认实现了管道中最数据密集的策略:基于结构的对接和分子动力学模拟。AI增强的对接框架与传统基于物理的评分相比,改进了对接姿势和结合亲和力估计,当与分子动力学结合时,允许研究人员在生理条件下评估预测结合模式的稳定性。例如,蜂王浆生物活性化合物的集成对接和分子动力学分析确定了与乳腺癌相关激酶和雌激素受体靶点的稳定复合物。
例如,AI辅助对接管道在Whipple病菌(Tropheryma whipplei)中识别出murE抑制剂,通过整合溶解度考虑来优化候选选择,用于抗菌药物发现。在另一项应用中,结构导向建模用于评估抗菌肽Wuchuanin-A1的靶点结合和膜相互作用,从而在实验验证前有效优先选择候选物。
生物转化预测(跨层级)
生物转化预测说明了数据质量引导框架的一个关键原则:同一分析任务——预测代谢命运——根据执行它的MSI层级,会产生根本不同的置信度水平。这一原则已在监管毒理学中得到证明,其中MSI鉴定置信度直接决定代谢组学数据是否可用于化学分组、通路为基础的评估或正式监管提交。
在MSI 1级,预测依赖于确认的结构,并为转化应用提供良好基础。某些工具,如BioTransformer,能够系统预测肠道微生物和肝脏代谢命运,支持生物活性代谢物识别和前药策略开发。BioTransformer与GNINA分子对接和AMBER MD模拟的集成应用已在大麻素A和B的MSI 1级验证研究中得到证明,确认了结构确认NP支架的抗糖尿病靶点相互作用和代谢命运预测。
在MSI 2级,结构身份仍是假设性的,但基于MS的注释提供了足够的化学分辨率进行可靠的假设生成。例如,TransDiscovery将分子网络与宏基因组关联数据整合,直接从MS/MS注释代谢物识别微生物生物转化,使底物-产物-酶映射达到足以支持转化假设生成的置信度,而无需完全结构确认。这一原则已在实践中得到证明:桉树皮代谢物的SIRIUS辅助液相色谱-质谱(LC-MS)注释,结合BioTransformer生物转化预测和分子对接,生成了随后通过体外细胞毒性测定验证的肝保护先导候选物。此示例说明MSI 2级的协调计算工作流程可产生转化可行输出。
在MSI 3级,化合物身份未解析。在此层级将生物转化模型应用于复杂提取物会引入指数组合复杂性,并因化学暗物质——训练数据集中不存在的未表征成分——导致级联预测错误。严格的实验验证和显式过拟合控制可以缓解这些风险。然而,此层级的输出必须被视为初步假设,而非转化证据。
肽类NPs——包括核糖体合成和翻译后修饰肽(RiPPs)、环肽和非核糖体肽——提出了独特的生物转化挑战,因为其结构复杂性和酶促生物合成起源使它们大部分处于当前小分子训练数据集代表的化学空间之外。当前工具模拟CYP介导的氧化代谢,而肽降解主要由肽酶和蛋白酶通过蛋白水解裂解驱动。BioTransformer 3.0通过约1500 Da以下的去聚合预测提供有限的肽处理能力,但完整大环支架——如环孢素类似物或daptomycin类脂肽——的代谢命运预测仍然不可用。新兴的肽焦点平台,如pepADMET,现在能够系统吸收、分布、代谢、排泄和毒性(ADMET)评估线性和环肽,而伪NP策略重组NP衍生片段提供了扩展此类代表性不足化合物类别训练可访问化学空间的补充途径。虽然肽类NPs的生物转化产物预测仍然是一个未满足的前沿领域,但这些汇聚的方法表明,用于此模式的专用计算工具开始成形。
走向转化整合(跨层级)
先前描述的AI策略各自解决数据质量引导框架内的个别分析步骤。然而,转化价值只有在研究人员在整个MSI引导管道中协调这些工具时才会出现。这需要将生物转化预测、ADMET分析和靶点识别与每个阶段可用的鉴定置信度相匹配,并且只有在分析分辨率提高时才升级到更数据密集的方法。
目前没有单一生物转化工具能够充分覆盖所有层级。对GLORYx、BioTransformer 3.0、SyGMa和MetaTrans的比较评估显示了显著的可变性,且没有一个工具能捕获所有实验观察到的代谢物。整合多步代谢背景的网络级方法——如代谢物真实性预测的消息传递神经网络——提供了一种互补的验证策略。下一代集成引擎,如结合MetabFlow的BioTransformer 4.0,代表了弥合这一差距的新兴努力。数据质量引导框架通过将每个工具与其证据层级相匹配来支持这种协调,防止过早升级,同时为分析分辨率提高时保留清晰的升级路径。对于肽类NPs——其中蛋白水解代谢与当前小分子工具假设的CYP介导途径不同——该框架引导研究人员转向序列基础策略,而非误用预测。用于计算机预测蛋白水解肽释放和生物利用度的新兴工作流程与现有ADMET平台互补,并表明此模式特定工具链开始成形。
扩展框架:历史证据和多组学数据
数据质量引导框架将AI策略与当前分析证据相匹配。然而,NP研究独特受益于合成药物发现中不可用的另外两个证据源:人类使用的历史记录和多组学生物数据。传统医学记录提供了在任何实验进行前减少转化风险的数百年经验安全性和有效性观察。多组学技术提供了超越仅化学鉴定所能提供的生物分辨率。这两个来源通过为发现管道中的AI引导决策提供额外证据层来扩展框架。
传统知识作为转化先验
NPs以合成化合物所缺乏的回顾性转化先验进入发现管道,该先验根植于先前的人类暴露和积累的安全性观察。具有记录的长期使用的历史传统疗法携带初步安全信号,减少了合成候选物最常失败的早期阶段的淘汰率。
COCONUT、KNApSAcK和PlantCyc等经过策划的数据库——在"术语表"中描述——提供对NP使用数据的结构化访问。AI工具可以放大这些数据库的效用。应用于传统中医配方的机器学习模型绘制了单化合物分析无法解决的多代谢物、多靶点相互作用,从而揭示系统级治疗机制。最近,直接在策划NP数据库上预训练的基础模型——如在COCONUT衍生NP结构上训练的NaFM——已证明这些仓库中编码的支架级生物合成模式可以提高生物活性预测和分类学分类能力。
计算毒理学平台——包括ProTox-II、DeepTox和Pred-hERG——通过预测新型衍生物或非标准给药途径的毒性来补充这些安全记录。扩展的数据库,如SuperNatural 3.0,通过深度学习框架扩展化学覆盖范围,超越已建立的化合物类别,使研究人员能够发现先前被忽视的机制。
多组学整合用于系统级预测
多组学技术以三种不同角色与数据质量引导框架相交,每种角色与MSI引导化合物鉴定有不同的关系。在此框架中,它们通过完善机制、解决生物异质性和扩展人类转化相关性来加强AI引导的NP发现,而不仅仅是替换未解析的化学输入。因此,它们的贡献最好理解为置信度修饰而非身份替代,增加了已定位在MSI引导管道中的化合物的解释和转化价值,而不会绕过未解析的化学输入。
第一种角色是发现使能。基因组挖掘工具——如antiSMASH和基于变压器的BGC-Prophet——直接从基因组序列数据预测新型NP支架,提供可独立于MSI分类启动的发现路线。相比之下,AI驱动的逆合成平台在支架鉴定后运行,预测合成和生物合成路线以解决经常限制转化进展的供应链瓶颈。当与MSI 1级确认的结构相关联时,它们的效用显著提高。
第二种角色是机制解析。AI启用的转录组学、蛋白质组学和表观基因组学数据整合实现了仅通过化学鉴定无法达到的机制推断分辨率。蛋白质组学和表观基因组学层揭示了翻译后调控和染色质水平调节——NP多效性效应中经常涉及的机制。随着MSI置信度的提高,这些方法变得越来越可靠:在MSI 1级,化合物-靶点-通路归因完全可追溯;在MSI 2级,MS注释代谢物与转录组学特征之间的假设相关性可以支持假设生成,但不能用于确定性机制声明。在MSI 3级,化合物身份未解析,系统级推断可能将生物效应归因于未表征的化学输入;在此阶段,多组学整合不应替代分析分辨率。
第三种角色是异质性解析。药物基因组学信息捕获药物代谢和反应中的个体间变异性。代谢疾病的多组学聚类揭示了具有不同生物特征和治疗轨迹的临床上不同的亚型,强化了AI引导NP工作流程可以支持的精准方法的必要性。在单细胞分辨率下,如scGPT和CellFM等基础模型完善了细胞类型特异性NP响应,超越了批量测量所能提供的范围。因为这些工具将反应变异性归因于特定分子机制,它们至少需要MSI 2级注释——理想情况下是1级确认——以避免将化合物级效应与患者级变异性混淆。这些方法是MSI引导框架的后期扩展,而非上游化合物规格的替代品。
结论与未来展望
在本文中,我们介绍了一个基于一个简单但有影响力的见解构建的数据质量引导框架:AI在NP药物发现中的可靠性不仅取决于算法复杂性,还取决于使用点可用的化学证据质量。通过将MSI鉴定层级重新用作AI策略选择的操作标准,该框架将数据异质性从障碍转化为设计参数——将AI定位为由人类专业知识指导的决策支持工具,而非自主发现引擎。具有有限分析基础设施的实验室可以像具有完整多组学能力的实验室一样轻松应用此框架。
该框架整合了从MSI 3级的提取物级推断到MSI 1级的基于结构的对接和动力学的AI策略,同时将民族药理学遗产作为转化先验,将多组学数据作为系统级扩展。鉴于成分规格问题仍然是AI在NP研究中可靠应用的核心障碍,我们认为MSI引导框架可以作为将AI策略与化学证据相匹配的有效新基础。在现阶段,其角色仍然是概念性的而非操作性规定性的,但随着分析基础设施和AI系统的成熟,此框架可以提供未来标准化的结构化起点。
重要问题仍然存在,包括何时升级分析分辨率是合理的、如何将协同作用预测限制在实验可测试的假设中,以及在结构确定性不完全的情况下推断的限制在哪里。这些问题的进展将有助于确定此框架如何从概念指南发展为AI引导NP药物发现中的更标准化实施。
展望未来,量子增强机器学习、基于数字孪生的转化建模和完全计算的临床前验证系统可能会进一步扩大研究人员在NP发现中所能实现的范围。如果这些技术成熟,它们将提供用于分子行为、药代动力学和系统级生物反应高保真模拟的工具。目前,它们的角色仍然是推测性的,而本文介绍的框架旨在在已验证的分析能力内运行。
我们设想一个未来,来自不同资源环境的研究人员——从仅拥有高效液相色谱(HPLC)的设施到全面的多组学中心——都可以通过选择与证据匹配的AI工具作为其研究工作流程中的可靠合作伙伴,参与AI引导的NP发现,而不是依赖于超出可用数据分辨率的计算输出。实现这一点必须负责任地进行——以对AI限制的透明治理、对共享知识的公平获取以及对这些药物起源的生物多样性和社区的尊重。AI在NP药物发现中的未来将不取决于计算在数据之外能延伸多远,而是取决于它如何明智地与证据保持一致。
【全文结束】

