发现新药一直是一个耗时数年的漫长过程。随着人工智能的最新进展和生物数据库中研究数据的积累,药物发现过程和研究速度比以往任何时候都快。哈佛大学创新与科学实验室的研究人员正在开展连接性图谱项目[1],旨在通过改进药物作用机制(MoA)预测算法来推进药物开发。这一挑战作为Kaggle竞赛[2]启动,目的是构建机器学习模型来预测未知药物的作用机制。
1- 数据集:
我们首先了解竞赛的数据集:我们有一个数据集,以基因表达和细胞活力数据为特征,206个作用机制(MoA)为目标。
1–1 基因表达特征:
![图1. 概述 (1) 人类细胞经药物处理。(2) 基因表达和细胞活力测量。(3) 数据输入神经网络。(4) 神经网络预测药物是否具有作用机制。[作者提供]](
该数据集中测量了772个基因的基因表达。
![图2. 基因表达检测:基因表达检测经历一系列步骤,从细胞系选择、药物处理、孵育到mRNA提取和部分基因定量。[作者提供]](
![图3. 5个基因分布:g-1、g-2、g-3、g-400和g-771(共772个基因)。[作者提供]](
基因表达是使用L1000检测测量的。您可以在这个连接性图谱网页上了解更多关于这项新技术的信息,以及研究论文:"下一代连接性图谱:L1000平台和第一个1,000,000个特征,"《细胞》,2017年。[3]
为简化起见,这里只解释了一种实验条件。实际上,一种药物在不同剂量(低和高)和不同处理时间(24小时、48小时和72小时)下进行了多次分析。
1-2 细胞活力特征:
除了772个基因的基因表达数据外,还提供了100个细胞系的细胞活力数据,细胞活力检测基于PRISM(混合物中相对抑制同时分析)。[4]
![图4. 细胞活力检测:细胞混合并用药物处理,孵育,计算每个细胞系的死亡细胞数。[作者提供]](
![图5. 5个细胞系的细胞活力分布(共100个)。[作者提供]](
细胞活力评估基于PRISM。您可以在连接性图谱网页和研究论文:"通过系统活力分析发现非肿瘤学药物的抗癌潜力"中了解这项新技术的更多信息。
与代表100个细胞系混合的基因表达值不同,细胞活力值是按细胞系区分的,换句话说:
- 基因-1值是100个细胞系中基因-1表达的平均值,如图2步骤4所示。
- 细胞-1值是属于细胞系1的细胞活力,如图4所示。
到目前为止,我们已经了解了药物处理后的基因表达特征和细胞活力特征。缺失的唯一环节是药物的作用机制,这也是我们需要预测的目标。
1-3 目标:药物作用机制(MoA)
在药理学中,"作用机制"(MoA)一词指的是药物物质产生其药理作用的特定生化相互作用。[5]
让我们简化这个定义,例如,阿司匹林减少疼痛和炎症,所以阿司匹林的作用机制:
- MoA功能:减少疼痛和炎症。
- MoA生化功能:涉及对环氧化酶酶的不可逆抑制,因此抑制前列腺素和血栓素的产生,从而减少疼痛和炎症。
这种功能或作用机制只是阿司匹林可能具有的多种作用机制之一,因此一种药物可以具有多种作用机制。这使得药物作用机制预测成为一个多标签问题。我们为每种药物提供了206个MoA目标,标记为(0:无作用机制,1:有作用机制)。下表显示了4个目标(共提供206个目标)。
- sig_id:包含经药物-X处理的100个细胞系混合物的样本。(步骤1)
- 5-alpha_reductase_inhibitor, 11-beta-hsd1_inhibitor, acat_inhibitor…是目标作用机制
,它用药物X处理(见步骤2),这种药物X没有'5-alpha_reductase_inhibitor'的作用机制,因此标记为0,但它具有'acat_inhibitor'的作用机制,因此标记为1。
问题陈述: 100个细胞系用药物处理。收集基因表达和细胞活力数据以了解该药物的生物活性。任务是基于基因表达和细胞活力特征预测新药物的作用机制。(见图1)
您可以在我的Kaggle笔记本中了解更多关于竞赛数据以及特征交互(基因、细胞和药物)的信息:[药物MoA分类:探索性数据分析](
2- 药物作用机制预测:
我们到达了分析中最令人兴奋的部分,即基于基因表达和细胞活力特征预测新药物的作用机制。
虽然深度学习在计算机视觉和自然语言处理任务中占据主导地位,但基于树的算法(随机森林、决策树等)和梯度提升机(XGBoost、LGBM、CatBoost等)仍然是处理表格数据的首选方法。然而,这里的情况并非如此,深度学习算法的表现优于梯度提升机。为什么会这样?因为我们有一个多标签问题,需要预测206个目标。浅层机器学习算法不支持多标签任务,换句话说,它们没有利用206个目标之间的相关性和共现性来提高预测准确性。
为了更好地理解,让我们比较岭回归、LGBM、XGBoost和3种深度学习模型在此次竞赛中的表现。
![图6. Kaggle上MoA预测竞赛中的模型性能。红色为浅层机器学习模型,绿色为深度学习模型。[作者提供]](
这些分数是近似的,要更好地了解这些模型的表现,您可以查看在Kaggle上训练它们的笔记本:[岭回归](
从上图中得出的结论是浅层机器学习模型和深度学习模型之间的差距。深度学习模型在此竞赛中表现更好,因为它们能够从206个目标连接中提取信息。
浅层机器学习模型和神经网络之间的分数差异对于对数损失这样的指标来说可能看起来很小。我想指出的是,神经网络从目标相关性中提取信号,这就是它们在这种情况下表现更好的原因,然而,该数据集中206个目标之间的相关性非常差(图7),大多数目标的相关性为0,只有13对目标的相关性为+0.3,因此没有太多信号可以提取,因此,如果目标之间联系更紧密,对数损失分数的差异会大得多。
![图7. 热图:206个目标之间的相关性。[作者提供]](
在下一节中,我想谈谈3种在具有多标签目标的表格数据上表现非常好的深度学习架构。
2–1. 多层感知机:
MLP或简单的前馈神经网络,最简单的神经网络架构,包含4个密集层(前两层有2048个神经元,后两层有1048个神经元),以及dropout、批归一化层和ReLU激活函数,表现得异常出色。
![图8. 4个全连接层神经网络架构。每个块由批归一化、dropout、密集层和ReLU激活函数组成。[作者提供]](
使用此模型获得的分数非常有竞争力,使用了Adam优化器、Reduce on plateau调度器和包含sigmoid激活的二元交叉熵BCE With Logits损失函数。
代码:4层[MLP代码GitHub仓库](
2–2 TabNet:
TabNet于2019年由Google Cloud AI在论文《TabNet:可解释的表格学习注意力》中介绍。它是一种用于表格数据的深度学习模型。TabNet结合了神经网络和基于树的算法的特性: [6]
- 它具有神经网络的强大功能,能够拟合和学习具有大量参数的复杂函数。
- 它具有类似于基于树的算法的特征选择机制。它还在特征选择中使用注意力机制。
。

