基于深度学习的全新治疗药物发现与设计:逆转疾病相关转录表型Deep-learning-based de novo discovery and design of therapeutics that reverse disease-associated transcriptional phenotypes: Cell

环球医讯 / AI与医疗健康来源:www.cell.com美国 - 英文2026-09-09 16:13:22 - 阅读时长34分钟 - 16975字
本研究开发了一个基于深度学习的药物发现平台GPS,该平台能够仅从化学结构预测化合物诱导的转录组扰动特征,并利用逆转疾病相关基因表达的策略筛选大型化合物库及优化先导分子。在肝细胞癌中,GPS发现了两个具有良好细胞选择性和体内疗效的独特化合物系列;在特发性肺纤维化中,通过逆转单细胞转录组学衍生的多种细胞类型基因表达,识别出一个老药新用候选物和一个新型抗纤维化化合物。该工作展示了基于转录组的从头药物发现和优化的潜力。
深度学习药物发现转录表型疾病逆转肝细胞癌特发性肺纤维化基因表达药物重定位先导优化
基于深度学习的全新治疗药物发现与设计:逆转疾病相关转录表型

亮点

  • 化合物诱导的转录组变化可通过GPS预测,从而实现虚拟药物筛选。
  • 结构-基因-活性关系分析阐明药物机制。
  • GPS从化合物库中识别出针对肝细胞癌的命中化合物,并支持先导化合物优化。
  • 转录组逆转在特发性肺纤维化中发现老药新用候选物和新型化合物。

摘要

识别能够逆转疾病相关转录组特征的药物已被广泛用于药物重定位,但其在全新药物发现中的潜力仍未充分探索。本文提出了一种基于化学结构的基因表达谱预测器(GPS),这是一个受转录组特征引导的深度学习药物发现平台,可筛选大型化合物库并优化先导分子。我们首先开发了一个仅从化学结构捕获转录组扰动特征的模型,并将其部署于库化合物。我们改进了评分方法,并采用树搜索方法进行优化。通过整合结构-基因-活性关系,我们从转录组数据中揭示了药物机制。我们在多种疾病中评估了GPS,并在两个案例中进行了广泛验证。在肝细胞癌中,我们发现了两个具有良好细胞选择性和体内疗效的独特化合物系列。在特发性肺纤维化中,我们通过逆转源自单细胞转录组学的多种不同细胞类型的基因表达,识别出一个老药新用候选物和一个新型抗纤维化化合物。

引言

目前的虚拟药物筛选研究主要基于对特定蛋白靶点的对接或基于人工智能和机器学习模型,但很少有研究利用常规用于表征疾病和细胞状态的丰富转录组特征。识别能够逆转疾病相关转录组特征的药物已被广泛探索作为发现药物重定位候选物的策略。然而,这种方法仅限于已在数据库中分析的化合物,不支持新型化合物筛选和优化,从而限制了其在早期药物发现中的广泛应用。为了实现上述基因表达逆转方法用于筛选超大型化合物库,需要库化合物的基因表达谱。然而,目前为大量化合物在各种生物学条件下生成这样的谱图并不可行。尽管如此,现有的大量药物诱导基因表达谱已使得开发高级机器学习模型来仅基于化学结构推断基因表达成为可能。最近的努力已证明了预测化合物诱导基因表达谱的可行性,以及该方法在临床前药物发现中的潜力。然而,这些研究仅包括常见研究化合物的小型筛选库,并未探索新型化合物或进行先导优化,而这是早期药物发现中的关键步骤。本文介绍了一个基于深度学习的药物发现系统,用于筛选大型化合物库和从头设计能够逆转转录表型的化合物。我们首先训练了一个基于化学结构的基因表达谱预测器(GPS),然后使用该模型预测ZINC库和Enamine HTS库中数百万化合物的转录组扰动特征。为了提高预测,我们提出了一种协作学习模型来纠正输入基因表达数据。接下来,我们增强了化合物评分函数,并开发了一种简单而有效的树搜索方法用于多目标优化。最后,我们提出了结构-基因-活性关系分析,从丰富的转录组数据中阐明药物机制。为了展示该系统的实用性,我们识别并验证了针对肝细胞癌和特发性肺纤维化的化合物。肝细胞癌是全球第六大常见癌症和第三大癌症相关死亡原因,死亡率高且缺乏有效治疗选择。特发性肺纤维化是一种罕见的慢性肺部疾病,目前尚无治愈性治疗选择,诊断后中位生存期约为3年。因此,这两种疾病迫切需要新的有效疗法。在肝细胞癌中,我们设计了一种高选择性和强效的化合物;而在特发性肺纤维化中,我们发现了一个重定位候选物并筛选了针对多个可能与疾病进展相关的细胞群体的新型化合物。

结果

基于化学结构预测化合物诱导的转录组特征

基于转录组的药物设计核心是根据化学结构预测化合物诱导的基因表达特征。为了开发高性能模型,必须解决高通量谱图中固有的技术和生物学变异。例如,LINCS阶段I的重复平均相关性仅为0.5,中位可重复性评分低于0.6。我们在预处理和训练过程中解决了这一问题。预处理时,将药物-基因相互作用分为三类下调、上调和无影响,以减少表达值的噪声。然后,通过随机森林模型识别出可从化学结构预测表达的特征基因。总共978个标志基因中有307个被确定为可预测,其中超过一半在不同细胞模型间共享。GPS使用LINCS阶段I数据训练,包括18,746个化合物对四个常用细胞系HEPG2、MCF7、PC3和VCAP的978个标志基因的影响。训练中,我们采用了一种称为鲁棒协作学习的课程学习框架,通过多专家知识融合重新加权高质量数据点,而不是丢弃大量低质量药物转录组谱图。在GPS中,一个神经网络接收化合物的结构指纹和基因的基因本体术语作为输入,学习该化合物是否能上调、下调或不影响输入基因的表达。学习到的知识在多个同行网络间共享,用于迭代噪声控制,最终利用约80%的数据点进行训练。提出的RCL框架在内部和外部验证中均比基线方法有显著改进。与基线方法的总体性能差异在四个细胞模型上均显著。化合物准确性分布与实验复现性显著一致,且性能与训练和测试化合物之间的化学相似性无关。然而,在10 μM浓度和24小时处理以外的实验条件下性能较差,可能由于样本量较小。

GPS预测的化合物诱导转录组特征的生物学相关性

训练数据包括978个标志基因的表达变化,但整个转录组包含超过20,000个蛋白编码基因。为了扩大预测覆盖范围,我们使用1,107个基因本体特征嵌入基因,从而能够基于基因本体特征预测整个转录组特征。通过校准数据集,我们识别出2,018个预测良好的基因,其平衡准确度大于0.5,宏F1分数大于0.4。将这些与预选训练基因结合,我们的流程可以高置信度预测2,198个基因的化合物诱导转录组特征。这些基因的基因本体富集分析表明,超过26%位于核质中,富集的生物学过程与细胞周期调控相关,表明与细胞周期、转录和激酶信号相关的基因表达对化合物扰动更敏感。选中的基因通常表达水平更高。一般来说,同一化合物诱导的转录组特征在不同细胞背景下相对保守,且跨细胞系相关。同一化合物跨细胞背景的转录谱被聚合为稳健谱,与单个细胞系的谱高度相关。GPS覆盖的四个细胞模型的聚合谱也与来自其他细胞系的聚合谱相关。为了评估GPS生成的谱是否反映化合物处理影响的生物学过程,我们查询了针对三个经典通路中九个治疗靶点的小分子抑制剂的GPS预测转录谱及其结构指纹。在化学空间中,共享同一靶点的化合物聚集在一起;但在转录空间中,调节同一通路的化合物聚集在一起。与化学特征相比,转录特征可以召回更多抑制同一通路中不同靶点的邻近化合物,表明预测的表达谱捕捉了药物相关的生物学过程。我们还研究了20个不同类别的蛋白靶点及其抑制剂。基于GPS预测化合物谱与LINCS中基因敲低谱的相似性,20个靶点中有8个的抑制剂与各自的敲低谱相似性显著高于非抑制剂,表明利用GPS预测的基因表达谱通过简单统计方法识别化合物直接靶标的潜力。为了进行大规模基于转录组的化合物筛选,我们准备了覆盖ZINC数据库中约700万个类药化合物的虚拟化合物诱导基因表达谱库。该库与训练化合物在药物化学空间上存在部分重叠,但大部分探索了新的化学空间。

使用GPS预测的化合物谱验证基因表达逆转

在计算机建模之后,我们旨在使用GPS平台发现新型和选择性的抗肝细胞癌化合物。为此,我们使用先前定义的肝细胞癌特征查询GPS生成的ZINC库中近700万个类药化合物的转录组谱。然后,提名排名靠前的化合物在肝细胞癌细胞系和原代肝细胞中进行体外细胞毒性测试以及体内疗效评估。在启动昂贵的筛选活动之前,我们利用已发表数据评估了预测的化合物谱和逆转评分函数是否可用于肝细胞癌及其他疾病的筛选。首先使用逆转基因表达评分计算化合物-肝细胞癌特征逆转,该评分改编自连接性评分,并已被证明在多种疾病的重定位药物中有效。然而,原始RGES值对化合物影响的基因数量敏感,不适合比较GPS预测的具有不同基因集大小的化合物。因此,我们开发了Z-RGES,通过对相同数量的上调和下调基因的原始RGES分布进行采样并对原始RGES进行Z变换来标准化。Z-RGES与抗肝细胞癌细胞活性显著相关,而原始RGES无显著相关性。Z-RGES也优于其他已发表方法。在癌症治疗反应门户网HepG2药物敏感性数据集中,Z-RGES的ROC曲线下面积达到0.768,顶部命中率为40%,而原始RGES表现随机。与OCTAD中基于高质量药物谱的sRGES相比,Z-RGES在PRISM Huh7药物敏感性数据集中显示出略高的顶部10命中率,表明在大规模虚拟筛选活动中成功率更高。除了肝细胞癌,我们之前观察到癌症基因表达逆转与结肠腺癌中的药物疗效相关。我们使用GPS推算的药物谱扩展了分析。使用结肠腺癌疾病特征,我们计算了这些药物的Z-RGES,并观察到活性化合物比非活性化合物具有更低的Z-RGES。仅使用整个疾病特征时未观察到显著差异,强调了疾病特征的重要性。我们进一步在阿尔茨海默病中评估了该方法,使用来自Mayo RNA-seq研究的转录组数据生成疾病特征。我们编译了95种已研究或批准用于阿尔茨海默病的药物,并计算了Z-RGES。正如预期,阿尔茨海默病药物对颞叶皮层表达特征的逆转强于其他FDA批准药物,而对小脑的逆转不那么明显。此外,使用颞叶皮层表达谱筛选ZINC库,发现阿尔茨海默病药物在分布左侧高度富集,表明与库化合物相比,阿尔茨海默病药物更可能逆转阿尔茨海默病相关基因表达。此外,一些新型化合物表现出更优的评分,表明它们是潜在的命中验证候选物。利用已发表数据的探索性分析表明,GPS预测与多种疾病的药物疗效相关,且这种相关性的强度取决于疾病特征,而疾病特征在不同数据资源和参数间存在差异。与传统靶点识别方法类似,疾病特征识别在基于转录组的方法中至关重要。基于这一见解,我们启动了一项初步研究,优化氯硝柳胺,一种我们先前药物重定位研究中发现的抗肝细胞癌命中化合物,该化合物因水溶性差和治疗窗口窄而未能推进,但疾病特征已得到稳健验证。最初由化学家从MilliporeSigma选择了七种市售的氯硝柳胺类似物。它们的抗肝细胞癌Z-RGES评分与HepG2和Huh7细胞系中的IC50值相关。然后,我们在虚拟ZINC库中搜索了更多水溶性更好且Z-RGES相似的氯硝柳胺类似物。一种类似物Cpd.5338385显示出逆转肝细胞癌特征的最高潜力,并在三种肝细胞癌细胞系中达到亚微摩尔IC50值,但意外地诱导了肝细胞生长。另一种候选物Cpd.5260420显示出改善的溶解性和无肝细胞毒性,尽管在Huh7细胞上效力低于氯硝柳胺。因此,后者Cpd.5260420在体内进一步评估。每3天瘤内注射1微克,持续2周,与载体处理组相比,Cpd.5260420显著减小了处理组Huh7异种移植小鼠的肿瘤体积。该化合物活性的验证支持了GPS平台在药物发现和先导优化中的可靠性。

从GPS预测的基因表达谱中从头设计和抗肝细胞癌化合物的作用机制阐明

除了发现改进的氯硝柳胺类似物,我们还为肝细胞癌治疗寻求新型化合物。使用肝细胞癌特征,我们从ZINC数据库中筛选了700万个类药和库存化合物。Z-RGES范围从-10到+2,分布与PRISM化合物相似。为避免非选择性化合物,我们对具有非期望基因表达效应的化合物谱进行了惩罚。我们测试了18种具有高逆转肝细胞癌特征潜力且与ChEMBL中已知抗肝细胞癌化合物结构相似性低的结构不同的候选物,在三种肝细胞癌细胞系中的抑制活性。三分之一的候选化合物在三种细胞系中均显示出显著抑制,与我们初步估计的40%命中率一致。最高分候选物44443110的IC50值为2-3微摩尔,与氯硝柳胺相当,表明我们的流程可以从GPS生成的大型虚拟库中发现有效的药物命中物。另一个有希望的命中物PB56874852,IC50值约为4微摩尔,即使在100微摩尔的高浓度下也不影响正常原代肝细胞的活力,表明其选择性优于氯硝柳胺。我们进一步对DMSO处理或4或10微摩尔PB56874852处理的Huh7细胞进行了RNA测序。对照组和4微摩尔组聚类紧密,而10微摩尔组形成不同的簇。GPS预测的差异表达基因与10微摩尔PB56874852处理的RNA-seq数据显示出相似的模式,而与4微摩尔处理无相关性,后者差异表达基因太少。值得注意的是,与文献中报道的在Huh7细胞中有效的其他化合物相比,两种命中物均显示出良好疗效,且分子量较低。在顶级候选物中也发现了一种类似化合物能够选择性抑制肝细胞癌细胞系的活力,具有低微摩尔IC50值,表明该骨架具有先导优化潜力。由于PB56874852具有显著疗效和高选择性,我们接下来实施了MolSearch来辅助其优化。MolSearch是一种基于蒙特卡洛树搜索的两阶段多目标先导优化算法。目标是设计PB56874852的新型类似物,使其对肝细胞癌获得更好的Z-RGES,并保留良好的药物化学性质。通过用卤代苯部分取代呋喃,提出的几种衍生物显示出增强的肝细胞癌特征逆转。根据MolSearch推荐,当用对溴苯取代呋喃时,Huh7细胞的IC50降至0.34微摩尔,而用苯、吡啶或甲氧基取代时无明显变化。进一步用吸电子三氟甲基取代,优化了三种肝细胞癌细胞系的IC50至亚微摩尔水平,显示出比一线靶向治疗药物索拉非尼高出数倍的活性。口服100毫克/公斤后,Cmax和半衰期分别为29微摩尔/升和2.5小时,血浆暴露数据显示可在5-10小时内维持在1微摩尔。对小鼠皮下Huh7异种移植物每3天瘤内注射1微克MSU45302,持续2周,与载体处理组相比,肿瘤体积显著减小。与传统的表型筛选相比,GPS为每种化合物提供了丰富的转录信息,有助于阐明机制。值得注意的是,上述转录组逆转计算捕捉了表型相关性,但未提供机制见解。为了揭示作用机制,我们通过聚类GPS生成的基因表达谱,研究了26种具有不同化学基团的抗肝细胞癌化合物。正如预期,具有中等疗效且属于同一化学类型的化合物表现出相似的转录组扰动特征;而高效化合物聚类在一起,尽管它们的骨架不同。这一观察促使我们探索MSU45302的SGAR。全转录组关联分析显示,26种化合物的抗肝细胞癌疗效与包括WDR75、KIF23、UHRF1和MCM6在内的15个基因的表达变化显著相关。这些变化通过MSU45302处理的异种移植模型和PB56874852处理的Huh7细胞的RNA-seq数据进一步证实。在这些基因中,UHRF1表现出最显著的表达变化,其敲低显著降低了肝细胞癌细胞的活力。我们进一步证实了MSU45302处理后Huh7和HepG2细胞中UHRF1蛋白表达的降低。此外,患者生存分析表明UHRF1是肝癌中的不利预后标志物,空间转录组学显示UHRF1在肝细胞癌组织中广泛表达。UHRF1编码一个RING指型E3泛素连接酶亚家族的成员,是DNA甲基化的关键调控因子。我们的数据表明,MSU45302可能部分通过抑制UHRF1及其下游DNA低甲基化来抑制肝细胞癌肿瘤生长。总之,我们的验证支持了GPS结合SGAR在先导优化和机制阐明中的应用。

逆转细胞类型特异性基因表达为特发性肺纤维化识别出重定位候选物和新型化合物

特发性肺纤维化是一种由肺损伤和随之而来的纤维化反应导致的病理状态,导致肺泡壁增厚和肺泡空间消失。其病因和微环境在疾病进展中的作用在很大程度上未知。我们首先使用重定位流程探索疾病生物学,以识别相关细胞群体,然后应用筛选流程发现新型化合物。利用来自多个数据集的批量RNA-seq和单细胞RNA-seq数据,我们构建了捕捉特发性肺纤维化生物学不同方面的特征,例如与细胞类型特异性转录变化相关的特征,以及与动物模型中疾病发展相关的特征。我们预测并测试了针对单个和组合特征的药物,然后选择了那些在体外模型中产生阳性药物命中的药物。我们最终优先选择了两个特征,一个来自上皮细胞,另一个来自间充质细胞,用于从Enamine HTS库中筛选新型化合物。顶级化合物在人体精确切割肺切片模型中进一步评估。为了考虑可能参与特发性肺纤维化发病机制的细胞类型多样性,我们首先整合了一个大型单细胞RNA-seq数据集,该数据集包含来自10名对照个体和12名特发性肺纤维化患者的肺样本的单细胞转录组谱。我们通过比较患病样本和对照创建了特征,揭示了包括内皮细胞、上皮细胞、免疫细胞和间充质细胞在内的所有主要细胞类型转录特征的深刻变化。此外,我们根据先前研究,通过比较过渡性肺泡2型细胞与肺泡1型细胞以及KRT5-/KRT17+细胞与特发性肺纤维化患者中的肺泡1型细胞创建了特征。除了单细胞数据,我们还使用了一组来自博来霉素诱导纤维化小鼠模型的批量RNA-seq特征。最后,我们将一个人体批量RNA-seq数据集纳入分析,产生了一组潜在感兴趣的疾病特征。使用OCTAD流程,我们预测并选择了20种药物在小鼠精确切割肺切片模型中进行测试。在大多数组织切片中减少标志物表达的药物进一步在人体精确切割肺切片模型中评估。在四个选定的候选物中,pyrithyldione在来自8名患者的精确切割肺切片模型中持续减少纤维化标志物,显示出与FDA批准药物尼达尼布相当的疗效。我们进一步观察到pyrithyldione在博来霉素诱导的肺纤维化小鼠模型中治疗2周后的抗纤维化效果。由于pyrithyldione可能引起危及生命的副作用,将其推进至特发性肺纤维化临床试验需要进一步优化和评估。然而,积极的临床前数据促使我们利用pyrithyldione作为深入了解特发性肺纤维化发病机制的工具,这可以指导新型化合物的发现。为了探索其在组织微环境中的效应,我们接下来对pyrithyldione处理的精确切割肺切片进行了批量RNA-seq。用CIBERSORTx对这些批量RNA-seq样本进行反卷积,揭示了肌成纤维细胞比例的显著降低,与qPCR和western blot分析中观察到的标志物表达一致。此外,肌成纤维细胞作为潜在靶细胞群体,与基因表达逆转预测一致。除了肌成纤维细胞,pyrithyldione显示出对MUC5B+上皮细胞特征的最强逆转。为了识别RNA-seq数据中pyrithyldione处理逆转表达的基因,我们将疾病特征映射到批量RNA-seq数据上。我们通过从每个患者处理样本的log2标准化表达值中减去未处理样本的表达值,创建了一个差异矩阵,然后计算了每个基因的平均差异。然后,我们选择了每个特征中显著的差异表达基因,并识别出那些在平均表达数据中符号相反的基因。肌成纤维细胞中的几个基因被逆转,而MUC5B+上皮细胞中更多的基因被逆转,强调了在特发性肺纤维化中靶向上皮细胞的重要性。这些基因的GO术语富集分析揭示了铁离子转运通路和过渡金属离子转运通路参与其中,表明铁代谢在特发性肺纤维化进展中起重要作用,这得到了先前研究的支持,并揭示了pyrithyldione逆转纤维化的潜在机制。我们进一步选择这两种细胞类型特征,代表上皮和间充质细胞群体,作为新型化合物筛选的主要特征。使用GPS流程,我们为所有特征筛选了Enamine HTS库,并选择了预测能逆转肌成纤维细胞和MUC5B+上皮特征的前40种化合物。然后分析这些化合物,仅选择那些具有良好药物化学性质的化合物,最终得到19种化合物进行测试。其中,4种化合物在一位患者的精确切割肺切片中显示出纤维化标志物的减少,而药物18在多个样本中显示出对FN1、SMA和CTHRC1的持续统计学显著减少。重定位候选物和新型化合物的识别证明了我们基于转录组的方法在特发性肺纤维化药物发现中的潜力。

讨论

转录组技术的进步导致疾病分子特征的积累,为药物发现提供了巨大机遇。两种主要的药物筛选方法(基于靶点的筛选和表型筛选)是在组学技术出现之前开发的;因此,两者都未准备好充分利用先前未预料到的大量组学数据。基于靶点的方法旨在从数千个特征中发现一颗“魔法子弹”;然而,许多疾病是由多种因素而非单一因素驱动的。在肝细胞癌中,没有基因组特征在超过50%的患者中发生改变,也没有临床靶点在超过20%的患者中高表达。在特发性肺纤维化中,远端肺上皮细胞已被牵涉到其发病机制中。最近的研究在特发性肺纤维化肺的远端肺上皮中识别出几种新的相关细胞群体,例如基底样细胞、肺泡-基底中间细胞和pre-AT1过渡态细胞。这些多样化的相关细胞群体表明,针对多个群体的不同通路可能对于开发特发性肺纤维化更有效的治疗方法是必要的。此外,基于靶点的方法的固有挑战在于小分子药物倾向于靶向多种蛋白,而脱靶效应是临床试验中癌症药物的常见作用机制。虽然表型方法规避了脱靶效应的担忧,但对主要靶点知之甚少给先导优化带来了挑战。使用肝细胞癌和特发性肺纤维化作为案例研究,我们展示了将基于转录组的方法作为发现癌症和非癌症疾病新治疗命中的新手段的潜力。我们还展示了在特发性肺纤维化药物发现中利用单细胞转录组学的力量。与先前基于对接的筛选研究相比,这项工作在新型化合物筛选中利用了高维转录组特征。与传统的表型筛选方法相比,丰富的转录组特征提供了对药物作用机制的见解。与众多AI和ML引导的药物设计研究相比,这项工作进行了下游化合物合成、优化和验证,这一过程通常需要数年才能完成。我们已经证明,这种方法不仅能够发现针对导致疾病进展的不同细胞群体的新型化合物,还能利用新兴的单细胞RNA-seq和体外模型探索疾病生物学。尽管我们的平台已能够发现新型先导化合物,但仍需与一线治疗进行直接比较,并对这些化合物进行更广泛的机制研究。例如,在特发性肺纤维化中,候选药物在人体肺微环境中的潜在耐药机制仍不清楚。基质细胞介导的药物耐受性概念在肿瘤学中已确立,其中许多FDA批准的药物仅有有限的治疗益处。类似地,特发性肺纤维化中的肺微环境可以培养类似于癌症中的药物耐受状态。过度的细胞外基质沉积和重塑不仅使肺结构僵硬,还可能阻碍药物渗透到关键细胞微环境,从而减少治疗暴露。为了解决这一局限性,我们采用了基于吸入的药物递送,以提高局部治疗浓度,同时最大限度地减少全身副作用,正如我们在临床前模型中所展示的。此外,传统的基于靶点的治疗通常专注于单一分子通路或细胞类型。相比之下,我们的方法利用了全局转录组特征的逆转;我们识别出的重定位药物可以同时逆转肌成纤维细胞和MUC5B+上皮细胞中的致病特征。这种双靶向策略有潜力克服基质细胞介导的药物耐受性,并在特发性肺纤维化中提供更广泛的治疗功效。

研究的局限性

首先,尽管LINCS数据库是其同类中最大的,但在特定背景下化合物的数量以及转录组的覆盖范围仍然有限,从而限制了模型的泛化能力、不同化学空间的覆盖范围以及可预测的基因。随着高通量转录组学变得更加先进和成本效益更高,以及诸如基础模型和少样本学习等新兴机器学习模型能够实现跨多个任务和背景的知识迁移,我们预计在不久的将来,疾病特异性模型中的药物谱可以被更精确地预测,从而实现更有效的筛选。此外,GPS旨在捕捉转录变化与化学结构特征之间的潜在关系,而非揭示机制因果关系。纳入不确定性和模型可解释性将增强模型可靠性并提供额外的生物学见解。其次,尽管SGAR提供了对化合物影响的潜在靶点和通路的见解,但它并未捕捉直接的配体-蛋白结合相互作用。包括AlphaFold 3在内的基于结构的建模方法可能补充SGAR以阐明作用机制。第三,仅转录组预测不足以捕捉药物活性和副作用的完整谱系;因此,整合其他组学模式可能提供对药物作用更全面的理解。最后,虽然我们的系统已显示出使用转录组学识别新治疗候选物的潜力,但识别出的化合物需要进一步的临床前验证、商业评估和机制研究才能推进到临床试验,并且将我们的系统应用于其他疾病也需要广泛的临床前验证。为了鼓励社区采用这种治疗发现策略,我们提供了一个网络门户和Docker容器,以方便这些工具的使用。

资源可用性

主要联系人

进一步信息和资源请求应直接联系并可由主要联系人Bin Chen完成。

材料可用性

本研究产生的所有独特/稳定试剂可从主要联系人处获得,并需完成材料转让协议。

数据和代码可用性

RNA-seq数据已存放在GEO数据库,登录号为GEO:GSE291867、GSE291190和GSE291833。整个新型化合物发现平台GPS包括三个组件:(1)用于提高药物诱导基因表达特征质量的RCL,(2)用于基于化学结构预测药物诱导转录组特征并运行药物筛选的GPS4Drug,以及(3)MolSearch,一种基于转录组逆转的多目标化合物优化工具。重现结果和实现模型所需的代码和数据可通过Zenodo和GitHub获取。

致谢

本研究由NIH R01GM134307、R01GM145700、R01HL153165-01A1、R61HL177451;NSF IIS-2212174;MSU SPG grant;CJ和Halin Yip Huang基金会、Lui Hac Minh基金会;以及Spectrum Health-Michigan State University Alliance Corporation资助。内容完全由作者负责,不一定代表资助方的官方观点。作者感谢Xiaolin Hao博士和Atul Butte博士的贡献。

作者贡献

J.X. 构思了研究,开发了软件,进行了数据分析,并领导了肝细胞癌研究。D.L. 进行了数据分析并领导了特发性肺纤维化研究。M.T. 在S.S.和M.-S.C.的监督下进行了肝细胞癌研究的实验。M.S. 在J.Z.和B.C.的监督下提出并开发了算法,包括RCL和MolSearch。R.C. 评估了RCL算法。M.A.、L.H.和K.U. 在X.L.的监督下进行了特发性肺纤维化研究的实验。S.P.、D.L.和R.S. 开发了网络门户并提供了生物信息学支持。E.L.、B.A.、M.G.、R.R.N.和E.E. 贡献了分析开发、药物筛选作者贡献(续)

J.X. 构思了研究,开发了软件,进行了数据分析,并领导了肝细胞癌研究。D.L. 进行了数据分析并领导了特发性肺纤维化研究。M.T. 在S.S.和M.-S.C.的监督下进行了肝细胞癌研究的实验。M.S. 在J.Z.和B.C.的监督下提出并开发了算法,包括RCL和MolSearch。R.C. 评估了RCL算法。M.A.、L.H.和K.U. 在X.L.的监督下进行了特发性肺纤维化研究的实验。S.P.、D.L.和R.S. 开发了网络门户并提供了生物信息学支持。E.L.、B.A.、M.G.、R.R.N.和E.E. 贡献了分析开发、药物筛选、化合物合成和PK研究。R.G.、T.J.和C.L. 为特发性肺纤维化研究提供了生物样本。J.X.、D.L.、M.T.、M.S.、X.L.、M.-S.C.、J.Z.和B.C. 起草了手稿,并征求了其他作者的意见。B.C. 构思并监督了本研究。

利益声明

一项发明披露已提交(B.C.,X.L.,D.L.和R.G.)。

STAR★方法

关键资源表

(表格内容略,包括抗体、化学品、细胞系、实验模型、寡核苷酸、软件和算法等详细信息。此处省略具体表格,但完整译文包含所有条目。)

实验模型和研究参与者详细信息

肝细胞癌细胞系的培养

人肝细胞癌细胞系Hep3B和HepG2购自美国典型培养物保藏中心,而Huh7由Mark Kay博士(斯坦福大学)惠赠。Huh7细胞在Eagle最低必需培养基中培养;HepG2和Hep3B细胞在杜氏改良Eagle培养基中培养。所有培养基均补充10%胎牛血清、100 U/mL青霉素和100 μg/mL链霉素。细胞在37°C、5% CO2的湿润环境中维持。

肝细胞癌动物模型

动物工作经斯坦福大学实验动物护理行政小组批准,并遵守所有联邦和地方法规。使用6周龄雄性NOD scid gamma小鼠(杰克逊实验室)建立皮下异种移植模型。选择雄性小鼠以最小化发情周期相关的激素变异,并反映肝细胞癌的男性优势。

特发性肺纤维化动物模型

使用博来霉素诱导的肺纤维化小鼠模型研究pyrithyldione的治疗功效。由于雄性小鼠对博来霉素的敏感性,本实验仅使用雄性小鼠。使用C57BL/6J小鼠,实验时约12周龄。所有动物实验均经密歇根州立大学动物护理和使用委员会批准。

特发性肺纤维化肺外植体样本和PCLS模型

特发性肺纤维化肺外植体样本来自14名在密歇根州大急流城Corewell Health Butterworth医院Richard Devos心脏和肺移植中心接受肺移植的患者。病理评估确认了特发性肺纤维化受试者中晚期普通型间质性肺炎的发现。所有方案均符合当地机构审查委员会批准的相关伦理规定;所有参与研究的患者均签署了书面知情同意书。将左肺上叶(发生活动性纤维化的部位)用液化的低熔点琼脂糖溶液膨胀,冷却后切片。使用振动组织切片机以400 μm厚度切割PCLS。

方法细节

GPS模型开发细节

RCL框架

RCL系统由多个神经网络组成,每个网络是一个独立的学习器,而其余网络形成同伴系统。每个网络用于更新其参数的知识是从所有同伴网络融合而来的。每个网络的目标是最小化一个包含样本权重的损失函数。通过硬阈值正则化,损失较大的样本更可能是噪声,不会被纳入下一次训练。RCL通过引入多个网络进一步增强鲁棒性:在早期训练阶段鼓励网络之间的分歧,以减轻单个网络学习器的样本选择偏差;在后期阶段,当学习器达到一定准确度时,鼓励网络之间达成一致。具体地,每个网络使用其他网络选择的样本的交集和并集进行融合,然后更新自己的参数。

GPS训练数据

LINCS Phase I数据包含130万个归一化谱图,涵盖11,000个小分子扰动剂和70多种细胞系。本研究聚焦于四种常用细胞系MCF7、HEPG2、PC3和VCAP,在10 μM浓度和24小时处理时间点测量。代码可轻松应用于其他细胞系。

基因可预测性

对于每个细胞系中的每个基因,使用随机森林回归模型基于化合物的ECFP4特征预测其表达,采用10折交叉验证。比较真实数据和随机数据的均方误差和皮尔逊R。如果真实数据的MSE显著小于随机数据且皮尔逊R > 0.3,则该基因被视为可预测。选择具有超过100个可预测基因的细胞系。

标签质量评估

每个药物谱包含978个基因的表达,在同一条件下有多个重复。通过计算每个重复与平均谱的相关系数,并基于相关系数进行加权平均,得到最终的唯一Z-score谱。相关系数越高,表示该药物谱的质量越好。

GPS特征和标签

输入包括药物特征(ECFP4指纹)和基因特征(1107个GO术语)。目标Z-score被离散化为三个类别:下调(Z < -1.5)、无变化(-1.5 ≤ Z ≤ 1.5)和上调(Z > 1.5)。

GPS网络架构

网络由全连接层组成,层神经元数为(2131, 128, 32, 3)。使用Leaky ReLU激活函数(斜率0.01)、dropout率0.5和Adam优化器(学习率0.001)。模型运行25个epoch,取最后5个epoch的平均值作为最终性能。

实验设置

药物谱质量系数大于0.7被视为高质量。对于每个细胞系,随机抽取10%的高质量药物谱作为测试集,剩余高质量谱和低质量谱作为训练集。由于数据高度不平衡,训练时对主导类进行下采样。调优噪声率、网络数量K、α和β等超参数。每种方法运行5次,取平均性能。对于每个基因调控,GPS预测上调、无变化、下调的概率,取四个细胞模型的中位数作为合并概率。如果上调或下调类的合并概率大于0.95,则分配最终标签,否则为无变化。

外部验证数据处理

从SRA下载原始RNA-seq数据,使用RSEM+STAR流程处理。使用log2变换的TPM值作为基因表达度量。计算每个化合物处理相对于DMSO的log2倍数变化,并取不同细胞系的中位数。只包括2~4 μM处理24小时的样本。上调定义为平均log2倍数变化大于0.5,下调定义为小于-0.5。

比较多种化学表示

使用预训练Transformer模型Uni-Mol、ChemBERTa和MolT5进行药物嵌入。内部验证按RCL工作划分训练集和测试集,测试集药物在训练时未见。外部验证使用与图1B相同的训练集和测试集。

GPS预测的生物学相关性

基因本体富集分析

使用Gorilla对选中的2198个基因进行GO富集分析,以所有评估的23,981个基因为背景。选择FDR q值 < 0.001且富集比值 > 1.5的GO term。对每个类别选择前5个富集term进行展示。

LINCS化合物谱相关性和聚合

使用978个标志基因计算两个个体谱之间的斯皮尔曼相关性。聚合化合物谱时,特定基因的表达变化定义为该基因在感兴趣细胞系中Z-score的均值除以其标准差。

化学和转录空间分析

从ChEMBL检索化合物-靶点相互作用活性。选择典型通路和靶点,保留活性大于95%的化合物,随机选择20个。计算化学特征和基因表达特征,使用UMAP进行聚类可视化。量化聚类时,分析每个化合物的15个邻居,计算召回的同靶点邻居和同通路不同靶点邻居。

与shRNA谱的相关性分析

选择20个不同类别的治疗靶点,每个靶点保留活性大于95%的化合物,随机选择20个,共400个化合物。通过GPS预测这些化合物的基因表达谱并合并。计算每个化合物谱与靶点shRNA谱之间的相似性评分(基于富集分析的p值)。对于每个靶点,比较其抑制剂与非抑制剂的相似性评分。

Z-RGES计算和比较

Z-RGES计算

RGES的计算修改自前期研究的连接性评分。与以往研究不同,此处查询基因集与化合物关联,而排名谱对应疾病。首先根据疾病特征的表达值对基因进行排序,然后计算化合物上调和下调基因集在疾病特征中的富集评分。由于原始RGES对化合物调控的基因数量敏感,因此基于随机分布进行标准化。对于疾病特征,首先采样上调和下调基因在特定数量下的背景分布,然后对新化合物的富集评分进行Z变换标准化。最终逆转评分定义为标准化的上调富集评分减去标准化的下调富集评分。

Z-RGES比较

将GPS衍生的Z-RGES与其他类似方法进行比较。在先前研究中,我们发现疾病相关基因表达的逆转与药物疗效相关,表明逆转评分可用于排名化合物。我们使用与先前工作相同的数据集评估了这种相关性。与以往使用实验数据计算逆转评分不同,此处使用预测的基因表达计算。对于DeepCE,运行main_drug_repurposing.py;对于DLEPS,使用其网络门户;对于TranSiGen,使用预计算预测。由于大型药物基因组学数据集(如PRISM)的数据质量有限,两种方法的相关性均不强。

肝细胞癌研究中的计算方法

新型化合物筛选

药物筛选库于2020年6月从ZINC数据库下载,仅使用类药和库存子集,包括6,857,774个化合物。将每个化合物SMILES提交给GPS预测其对可预测基因表达的影响。药物筛选前,通过合并四个细胞模型的结果准备汇总谱库。如果平均预测概率大于0.95,则判定为上调/下调。肝细胞癌特征采用自先前研究,计算每个化合物的Z-RGES。前2000个化合物进行聚类,选择代表性化合物进行进一步测试。

使用MolSearch进行先导优化

MolSearch是一种基于蒙特卡洛树搜索的两阶段多目标分子优化方法。它从现有分子开始,通过转换规则修改它们。整个过程包括两个阶段:HIT-MCTS阶段旨在改善生物学性质,LEAD-MCTS阶段侧重于非生物学性质。每个阶段包含一个多目标蒙特卡洛搜索树,不同目标分别考虑。搜索过程包括选择、扩展、模拟和反向传播四个步骤。HIT-MCTS和LEAD-MCTS在候选动作选择上有所不同。为找到肝细胞癌的命中类似物,使用Z-RGES作为主要目标分数。起始化合物是PB56874852,期望的候选物是Z-RGES更低的化合物。引入温度参数t控制探索强度。在HIT-MCTS获得候选物后,运行LEAD-MCTS优化药效团和合成可及性。两个阶段的候选物被分析以指导最终合成列表的设计。

量化基因-结构-活性关系

使用GPS生成选定化合物的基因表达谱,并测定其在肝细胞癌细胞系中的IC50值。对于每个基因,进行秩和检验评估抗肝细胞癌效果是否与该基因的调控显著相关。

空间转录组分析

从Wu等人获得五例相邻正常和五例肝细胞癌组织切片的10X Visium空间转录组数据。使用STutility包处理,进行质量控制、SCTransform归一化,用于基因表达可视化。

特发性肺纤维化研究中的计算方法

细胞类型特异性特征创建

使用Seurat中的Wilcoxon检验,比较单细胞数据集中特发性肺纤维化与对照患者样本的每个细胞群体,创建特征。还通过比较过渡性AT2与AT1细胞以及KRT5-/KRT17+细胞与AT1细胞创建附加特征。

质量控制和特征选择

排除少于40个基因的特征,将差异表达分析限制于前100个上调和下调基因。通过评估它们识别已知对特发性肺纤维化有一定效果的药物(如尼达尼布、吡非尼酮等)的能力来评估信号质量。优先选择满足基因大小要求且至少一种选定药物sRGES评分低于-0.2的细胞类型特异性特征。还评估了博来霉素诱导的特发性肺纤维化小鼠模型信号的质量,以及培养的小气道批量RNA-seq数据。

药物重定位和新型化合物筛选

利用PCLS模型,首先使用有限药物的疗效数据识别关键细胞群体。优先选择现有药物,因为它们易于获得且文献支持充分。使用OCTAD重定位流程提名候选探针,然后使用GPS筛选新型化合物。对于每个特征运行药物预测,合并结果后选择逆转最多特征的前20种药物。基于鼠信号排名,选择评分低于-0.2的药物,然后进一步筛选。对于新型化合物发现,使用GPS筛选Enamine HTS库,选择Z-RGES评分低于-2的化合物作为命中物。

处理样本的批量RNA-seq分析

对三名患者的PCLS进行RNA-seq,有或没有药物处理。使用内部流程处理数据,生成计数矩阵,使用ExpressAnalyst进行差异表达分析。显著基因定义为p值≤0.01且|log2倍数变化|≥1。

CIBERSORTx反卷积

使用CIBERSORTx流程对药物处理和对照批量RNA-seq样本进行反卷积分析。使用单细胞模式,以患者个体单细胞数据构建参考。比较处理前后每种细胞类型的预测分数,使用配对t检验。

肝细胞癌研究中的实验方法

细胞增殖实验

使用CellTiter 96 Aqueous One Solution细胞增殖实验评估化合物对Huh7、HepG2和Hep3B细胞生长的影响。细胞以每孔3×10^3个接种于96孔板,过夜贴壁,然后用化合物处理72小时,加入MTS溶液,测量OD值,计算IC50。

UHRF1的Western blot分析

HepG2和Huh7细胞用MSU45302处理24小时,提取总蛋白,定量后电泳,转膜,封闭,孵育一抗和二抗,可视化。

UHRF1敲低

使用Lipofectamine RNAiMAX将UHRF1 siRNA转染HepG2细胞,48小时后收集细胞进行活力测定和Western blot分析。

动力学溶解度测量

制备已知浓度的化合物储备液,在PBS中稀释,加热后测量吸光度,计算溶解度。

化合物合成和药代动力学研究

在密歇根州立大学药物化学设施进行化合物合成。对C57Bl/6雄性小鼠口服100 mg/kg的候选化合物,测定血浆药物水平。

异种移植小鼠模型和药物处理

肿瘤可触及后,小鼠随机分为两组,分别瘤内注射载体或1 μg化合物,每3天一次,持续2周,测量肿瘤体积。

处理样本的RNA测序

使用RNeasy Plus Mini Kit提取RNA,由Novogene进行文库制备和测序。

特发性肺纤维化研究中的实验方法

纤维化标志物

纤连蛋白、α-SMA、胶原I和CTHRC1是评估抗纤维化治疗的重要生物标志物,分别在肌成纤维细胞分化、ECM沉积和疾病进展中发挥作用。

PCLS的制备和处理

切片用10 μM药物处理72小时,每天更换新鲜药物溶液,收集样本后保存。

蛋白提取和Western blot

将PCLS匀浆,提取总蛋白,定量后电泳,转膜,封闭,孵育一抗和二抗,化学发光成像,定量分析。

RNA分离和批量RNA测序

使用TRIzol试剂提取RNA,纯化后送至Van Andel研究所进行批量RNA测序。

pyrithyldione的体内验证

小鼠随机分为三组:对照组、BLM组和BLM+pyrithyldione组。BLM单次气管内滴注,pyrithyldione每日一次口服吸入,持续14天。第15天处死,采集肺组织进行组织病理学分析。

小鼠肺组织的Masson三色染色

肺组织用PFA固定,进行Masson三色染色,扫描图像,使用ImageJ分析胶原沉积面积。

量化和统计分析

生物学实验的图表使用GraphPad Prism生成,其他图表量化和统计分析

生物学实验图表使用GraphPad Prism生成,其他图表使用R或Python生成。默认情况下,采用Student's t检验评估统计显著性。对于不符合正态分布的数据集,采用Wilcoxon秩和检验。

额外资源

用户可通过GPS网络门户运行化合物诱导的基因表达预测并进行新型化合物筛选,通过OCTAD网络门户和Bioconductor包octad进行药物重定位。

补充信息

(15项补充材料,包括PDF文件、数据文件、电子表格等,内容涵盖支持性表格、可预测基因汇总、全转录组基因表达预测性能、化合物诱导转录组谱示例、药物特征相关性、代表性化合物数据、靶点敲低特征、氯硝柳胺类似物信息、候选化合物活性、MolSearch衍生物、购买和合成化合物数据、疾病特征、药物重定位预测、CIBERSORTx分析结果等。)

【全文结束】

猜你喜欢
  • AI在医疗保健中的益处、应用及未来趋势AI在医疗保健中的益处、应用及未来趋势
  • AI在药物发现中的应用:医学与医疗营销的新纪元AI在药物发现中的应用:医学与医疗营销的新纪元
  • 基于人工智能的技术快速识别严重疾病的遗传原因基于人工智能的技术快速识别严重疾病的遗传原因
  • 100万美元资助推动真菌疾病治疗进展100万美元资助推动真菌疾病治疗进展
  • 停止服用GLP-1药物会迅速消除心血管益处停止服用GLP-1药物会迅速消除心血管益处
  • 从病理图像到生物学发现:LazySlide利用基础模型连接组织图像和RNA数据从病理图像到生物学发现:LazySlide利用基础模型连接组织图像和RNA数据
  • 停止服用减肥药可能会抹去数年的心脏保护效果停止服用减肥药可能会抹去数年的心脏保护效果
  • Generate Biomedicines IPO引发关注Generate Biomedicines IPO引发关注
  • 在制药制造中创造可持续的卓越运营在制药制造中创造可持续的卓越运营
  • 医生能为脑出血做些什么?医生能为脑出血做些什么?
热点资讯
全站热点
全站热文