利用口腔微生物组实现食管鳞状细胞癌的跨洲普适性预测A generalizable cross-continent prediction of esophageal squamous cell carcinoma using the oral microbiome | Communications Medicine

环球医讯 / 硒与微生态来源:www.nature.com南非 - 英语2026-09-13 23:27:38 - 阅读时长30分钟 - 14582字
本研究对南非高发区的48名食管鳞状细胞癌(ESCC)患者和110名对照的口腔微生物组进行16S rRNA测序分析,发现患者口腔微生物组发生显著改变,包括α多样性降低和核梭杆菌(Fusobacterium nucleatum)丰度增加。基于微生物组数据的逻辑回归模型对ESCC的分类准确率(auROC=0.96)远高于临床模型(0.69),且该模型可推广到中国的独立队列,表明唾液微生物组有潜力成为ESCC的非侵入性筛查工具,尤其适用于高发地区。
口腔微生物组食管鳞状细胞癌预测唾液非侵入性筛查早期检测生物标志物
利用口腔微生物组实现食管鳞状细胞癌的跨洲普适性预测

摘要

背景:食管鳞状细胞癌(ESCC)预后差,且缺乏早期检测工具。唾液易于获取,其微生物组组成可作为上消化道疾病的标志物。本研究旨在评估口腔微生物组特征用于ESCC分类的潜力。

方法:在一项包含48名ESCC患者和110名对照的横断面研究中,研究对象来自南非(ESCC高发地区),我们研究了口腔微生物组特征对该疾病的潜在效用。我们采用嵌套交叉验证构建模型,评估该特征对留出样本的泛化能力,并进一步在中国(一个不同的地理区域)的研究中评估其泛化能力。

结果:我们发现ESCC患者的口腔微生物组发生显著改变,包括α多样性显著降低和核梭杆菌(Fusobacterium nucleatum)丰度增加。我们还发现,基于微生物组数据的逻辑回归模型在留出样本中(auROC=0.96)比基于临床和人口统计数据(auROC=0.69;DeLong检验p<1×10⁻⁸)能更好地分类ESCC。最后,我们发现基于微生物组的模型在多个研究中训练后,可以很好地泛化到地理上不同的研究。

结论:我们的结果表明,ESCC患者的口腔微生物组与对照组不同,并且这种信号可以泛化到未见过的样本,提示唾液有潜力作为ESCC的非侵入性筛查工具。

通俗语言摘要

食管鳞状细胞癌(ESCC)是一种起源于食管(连接咽喉和胃)内衬细胞的癌症。其预后不良,需要非侵入性诊断方法。唾液易于获取,口腔中微生物的丰度(“口腔微生物组”)可能用于指示食管癌症的存在。本研究探索了计算模型利用口腔微生物组数据识别ESCC存在的能力。我们的结果表明,ESCC患者的口腔微生物组与健康个体明显不同。我们还表明,分类模型可以区分不同地理区域的ESCC。这些发现为开发非侵入性诊断ESCC的工具铺平了道路。

引言

全球食管癌的主要组织学亚型是鳞状细胞癌(ESCC),其预后极差,在东亚、东非和南非发病率极高,而食管腺癌(EAC)在西方国家占主导地位¹。ESCC的早期检测是一项重大的临床挑战。由于缺乏早期症状以及高风险地区内镜筛查的不可及性,导致诊断时多为晚期,死亡率高²。已确定的ESCC风险因素包括吸烟、饮酒、多环芳烃暴露、热食和热饮摄入以及口腔健康不良,这些都可能促进癌变³⁻⁴。然而,这些风险因素只能部分解释该疾病在世界某些地区极高的发病率,并且未能指导筛查实践。

越来越多的证据表明,与食管黏膜直接接触的食管微生物组可能通过免疫激活和慢性炎症调节上皮癌的风险⁵,并可能影响ESCC的治疗反应⁶⁻⁷。此外,既往研究报告了ESCC中食管和口腔微生物组的改变⁸⁻⁹。这些关联可能为开发基于微生物组的早期ESCC检测生物标志物铺平道路,从而可能改善患者预后¹⁰。我们课题组先前证明,唾液微生物组可以区分晚期癌前病变和早期食管腺癌患者¹¹,提示唾液微生物组也可能有助于识别早期、可治疗阶段的ESCC患者。

考虑到已知的人类微生物组在不同人群和地区之间的差异,确定微生物组与ESCC在不同人群中稳固的关联对于开发基于微生物组的诊断方法至关重要。在本研究中,我们重点关注南非(ESCC高发病率地区¹²⁻¹³)一个研究不足的人群的口腔微生物组。来自中国(也有ESCC高发地区)的几项研究报告了区分ESCC患者口腔微生物组的差异⁸⁻¹⁴⁻¹⁹。然而,仍需要确定其他高发地区是否存在口腔微生物组差异,以及这些差异是否在不同人群中具有普适性。

虽然直接取样食管微生物组涉及上消化道内镜等侵入性操作,但唾液取样相对简单,并且证据表明唾液微生物组与食管微生物组密切相关²⁰。因此,唾液微生物组可以作为食管微生物组及相关疾病的“窗口”。此外,一些研究表明唾液微生物组在个体内具有时间稳定性,提示其可能提供与取样时间无关的诊断信息,尽管这方面的证据存在一些不一致²¹⁻²³。

在此,我们在一项包含158名来自南非高发地区个体(包括48名ESCC患者和110名匹配对照)的病例对照研究中,调查了口腔微生物组是否是ESCC的可靠标志物。我们发现口腔微生物组与ESCC显著相关,并鉴定出特定微生物,包括核梭杆菌(Fusobacterium nucleatum)、米拉李劳特氏菌(Lautropia mirabilis)、差异韦荣氏球菌(Veillonella dispar)和唾液普雷沃氏菌(Prevotella salivae),在ESCC患者中丰度较高。然后我们评估了基于口腔微生物组的模型在四个研究中识别ESCC患者的泛化能力(包括我们自身的研究和另外三项在中国进行的研究),并表明这些模型可以从留出的研究中识别出ESCC患者。总体而言,我们发现与基线临床因素相比,口腔微生物组能准确分类ESCC。

方法

研究设计

这项横断面研究旨在评估ESCC病例和匹配对照之间口腔微生物组组成的差异。从2021年9月至2022年11月,我们在索韦托的Chris Hani Baragwanath学术医院和约翰内斯堡的Charlotte Maxeke约翰内斯堡学术医院的两家胃肠病诊所招募了55名经组织学确诊为ESCC的南非黑人。尽管患者未进行癌症分期,但许多人出现吞咽困难和体重减轻。所有癌症病例均获得了组织学确认。我们从唾液微生物组分析中排除了7例已登记的病例:4名参与者的组织学亚型无法确认,1名参与者患有EAC,1

名参与者患有胃癌,还有1名参与者在组织学评估中未显示癌症证据。对照组按2:1的比例与ESCC病例进行匹配,通过一项基于人群的多发性骨髓瘤筛查研究PROMISE-SA从索韦托地区招募,时间从2022年1月至2023年3月,并根据年龄(±5岁)、性别、自我报告的种族和研究地点进行频率匹配。由于符合条件的年长对照组数量相对较少,年龄匹配受到限制,导致病例组和对照组之间年龄略有失衡。通过问卷确认,对照组年龄在40至75岁之间,自我认定为黑人或非洲裔,目前未被诊断出任何癌症,并且没有吞咽困难症状。病例组和对照组均无头颈癌或任何其他类型癌症的既往诊断史。在收集唾液时,所有患者均未接受过针对ESCC的治疗,包括化疗、放疗或手术。

我们收集了每位参与者的人口统计学和临床数据。此外,我们使用Oragene OG-500 DNA唾液收集试剂盒(DNAGenotek,加拿大安大略省)收集了2毫升唾液,未使用唾液刺激剂。在我们的微生物组分析和预测建模中,我们纳入了以下临床变量,因为它们可能与ESCC和/或唾液微生物组组成相关:患者年龄(岁)、性别、婚姻状况、居住地点、烹饪地点、最高教育程度、吸烟、饮酒、热饮消费、HIV状态和糖尿病史(表S1)。有两名对照的临床和人口统计数据缺失。其他数据缺失情况包括:年龄(3名ESCC)、性别(2名ESCC)、居住地点(2名ESCC;1名对照)、烹饪地点(3名ESCC)、教育程度(3名ESCC)、吸烟(2名ESCC)、饮酒(2名ESCC;1名对照)、热饮消费(5名ESCC)、糖尿病状态(2名ESCC)和HIV状态(4名ESCC;21名对照)。在表S1中,仅将1至7年级的教育水平合并为“小学”,8至12年级合并为“中学”。

所有入组患者均提供了书面知情同意。本研究遵循《赫尔辛基宣言》原则,并获得了金山大学人类研究伦理委员会(证书编号:M180306)和哥伦比亚大学机构审查委员会的批准。

统计与可重复性

样本量计算基于病例和对照之间α多样性的差异;预计样本量为50例病例和100例对照,假设I类错误率为0.05,则有82%的统计功效检测到0.5个标准差差异。表S1中人口统计学变量的组间比较采用卡方检验(分类变量)和Mann-Whitney U检验(连续变量)。病例和对照之间未经调整的α多样性比较采用Mann-Whitney U检验,调整后的比较采用逻辑回归模型,模型中包含上述临床和人口统计学变量。β多样性比较采用排列多元方差分析(PERMANOVA),使用10,000次排列来计算p值。调整后的PERMANOVA检验在模型中包含了上述临床和人口统计学变量。使用DeLong检验评估机器学习模型性能差异的统计显著性,并使用Mann-Whitney U检验评估模型是否优于随机分类器。统计显著性定义为p<0.05。对于多重比较,报告的p值使用Benjamini-Hochberg方法对错误发现率(FDR)进行了校正²⁴。

微生物组测序与分析

使用QIAamp BiOstic Bacteremia DNA试剂盒,按照制造商方案,从唾液样本中分11个批次分离微生物DNA。其中9个批次同时处理了阴性提取空白对照。使用Illumina adaptor连接引物(27F-338R)扩增16S rRNA基因的V1-V2区域。使用的正向引物为AGAGTTTGATCCTGGCTCAG,反向引物为TGCTGCCTCCCGTAGGAGT。所得文库经过条形码标记,并使用Illumina MiSeq平台进行测序。

为了将分析仅限于细菌读段,使用bowtie2(参考文献25)以包容性参数将比对到CHM13-V2人类和PhiX基因组序列的读段从后续分析中移除。使用QIIME 2 v2024.2微生物组分析平台(它是各种微生物组生物信息学工具的封装器)进行以下分析²⁶。使用DADA2 v1.26.0过滤低质量读段、合并双端读段,并鉴定每个样本中总共11,277个扩增子序列变体(ASV)及其计数²⁷(表S2)。每个样本用于分析的中位清洁非嵌合读段数为44,788个。所有ASV使用mafft²⁸进行比对,并使用fasttree2(参考文献29)构建系统发育树。使用q2-feature-classifier classify-sklearn朴素贝叶斯分类器³⁰将分类学分配给ASV。为了可解释性,使用基于人类口腔微生物组数据库v15.23(HOMD)OTU序列训练的分类器为每个ASV分配分类学³¹(表S3),但在跨研究的物种水平分析中,我们使用了Greengenes2 2022.10(详见下文)。

使用SCRuB进行计算机模拟去除可能的细菌污染物,该软件基于阴性提取空白中观察到的分类群比例概率性地估计样本中的真实计数³²。11个批次中的9个使用其相应的空白对照进行“去污染”,而没有相应空白对照的两个批次则使用汇总所有可用空白对照的分类群组成的合并空白进行去污染。

样本α多样性使用Shannon指数估计,样本间多样性(β多样性)使用未加权和加权的UniFrac距离³³估计。在进行多样性估计之前,稀有分类群被过滤(仅保留至少在5个样本中存在的分类群),并且每个样本被稀化至9,700条读段,这是所有样本中的最小读段深度。过滤后保留了11,277个ASV中的2,091个。通过QIIME2 q2-diversity插件中的“adonis”函数,使用PERMANOVA检验ESCC样本和对照组之间的群落水平差异,一次不调整协变量,一次调整模型中所有可用的临床和人口统计学协变量,包括年龄、性别、居住地点、教育程度、婚姻状况、热饮消费、吸烟、糖尿病、HIV、烹饪地点和批次³⁴。

差异丰度检验

使用R v4.3.2中Corncob v.4.1的beta-binomial回归模型进行差异丰度分析³⁵。ASV表格被过滤,仅保留在5个或更多样本中存在的分类群,结果保留了2,091个ASV。模型调整了批次、年龄、饮酒、烹饪地点、热饮消费和吸烟;Corncob默认在其模型中调整测序深度。为了鉴定差异丰富的分类群,我们评估了哪些分类群在仅调整批次的模型中的FDR校正p值小于0.1,然后在这些分类群中鉴定出那些在包含其余协变量的完整模型中仍然显著(FDR校正p<0.05)的分类群。对于梭杆菌属(Fusobacterium)优势分析,模型额外调整了每个样本中该属的总丰度。报告的p值使用Benjamini-Hochberg方法进行了FDR校正²⁴;显示显著p值的分类群列于表S4(属)、S5(ASV)和S6(梭杆菌属ASV)。

ESCC分类器的训练、测试和评估

使用scikit-learn Python库(v1.3.1)构建监督预测模型,以将我们队列中的ESCC样本与对照组样本进行分类。由于逻辑回归的可解释性以及与更复杂模型(包括lightGBM、支持向量机和随机森林)相当的性能,所有分类任务均使用逻辑回归(补充图1)。模型性能在四个特征集上进行了评估:(1)临床和人口统计学变量(包括年龄、性别、婚姻状况、教育程度、居住地点、烹饪地点、吸烟、饮酒、热饮消费、HIV状态和糖尿病状态);(2)ASV水平的微生物组数据(11,277个特征);(3)物种水平的微生物组数据(Greengenes2;576个特征);以及(4)结合临床和微生物组(ASV)数据的组合数据集(即1+2)。

对于所有模型,样本通过按批次分组分为训练集和测试集,创建11个测试-训练分割,每次留出一个批次作为保留的测试集(即11折交叉验证)。这样做是为了解决由每个批次中类别不平衡引入的模型混淆效应(例如,某些批次仅包含ESCC样本)。对于临床模型,缺失信息使用训练集连续变量的中位数和分类变量的众数进行填补。为了调整超参数,我们使用了嵌套交叉验证。我们微生物组模型中的模型超参数包括预处理和特征选择的步骤(表S7)。所有方差为0的微生物组特征被移除,剩余特征进行了中心化对数比(CLR)变换³⁶。特征选择作为嵌套交叉验证程序的一部分实施,以确保特征选择仅在每折的训练数据上执行,从而防止验证集或测试集中的信息泄露。我们对数据拟合了一个lasso模型,然后保留了所有系数非零的特征。我们调整了一个超参数k,它控制要保留的特征比例。对于每个k值,我们确定产生大约k%的输入特征具有非零系数的最优L1正则化强度(α)。每个训练集被分为5折(即“内部折”),在其上我们使用了1,000次随机超参数集迭代。此过程重复五次以考虑随机性。最佳超参数集被选为基于内部折性能获得最高平均受试者工作特征曲线下面积(auROC)分数的模型。然后将此模型在整个训练数据上进行训练,并在未见过的保留批次上评估一次。对于模型评估,我们计算了所有折的总auROC和精确率-召回率曲线下面积(auPR),以及每外部折的auROC和auPR统计量。跨折的平均值和标准差是针对嵌套交叉验证中11个外部折中的9个计算的;两个仅包含对照的折被排除在每折计算之外。

跨研究预处理和ESCC分类器的验证

我们进行了文献检索,以确定适合进行基于微生物组的ESCC预测器外部验证的研究。初步确定了12项研究,这些研究对ESCC个体和非ESCC对照的口腔和/或食管微生物组进行了采样³⁻¹⁹⁻³⁷⁻⁴¹。我们排除了没有公开可用唾液样本16S rRNA测序数据的研究。

我们使用与上述相同的步骤将PRJNA660092¹⁸、PRJNA587078¹⁵和PRJNA961904³⁷重新处理至ASV水平。对于所有三个队列(包括我们自己的),我们使用基于Greengenes2 2022.10数据库训练的q2-feature-classifier classify-sklearn朴素贝叶斯分类器分配分类学,并将“-p-confidence”参数设置为0。这种方法确保所有ASV都有物种水平分配,而与置信度分数无关,从而实现所有研究间一致的物种水平协调。我们过滤掉了在少于10%样本中出现的特征,结果保留了315个特征,并对剩余特征进行了CLR变换。然后,我们执行了留一研究交叉验证,其中我们在除一项研究外的所有研究上训练了一个无惩罚的逻辑回归模型,并在每个保留的研究上评估模型的性能。对于在我们队列上训练并在外部队列上测试的物种水平模型,我们将每个嵌套模型在整个南非队列上重新训练,并分别对每个外部队列测试了十一个模型。对于每个外部队列,我们报告了所有十一个模型的auROC和auPR的平均值和标准差。最后,我们在每个外部研究内部使用物种水平微生物组数据执行了10折嵌套交叉验证。我们报告了总的auROC和auPR以及跨折的auROC和auPR的平均值和标准差。外部研究上的超参数优化和预处理步骤与我们的数据相同。为了评估模型是否优于随机分类器,我们进行了单侧Mann-Whitney U检验,评估预测分数是否对于正类高于负类。所有模型的预测值均列于表S8中。

结果

南非ESCC病例对照研究中的患者特征

我们在约翰内斯堡的索韦托招募了55名经组织学确诊为ESCC的成年患者。我们还招募了110名无任何癌症史且无吞咽困难症状的对照。在样本采集时,所有患者均未接受过针对ESCC的治疗,包括化疗、放疗或手术。有7例病例无法获得ESCC的组织学确认,因此被排除在分析之外。对照组在地理位置上与病例共处一地,所有样本一起处理。我们尽可能根据年龄(±5岁)、性别和地点对对照组与病例进行了频率匹配,并使用16S rRNA基因扩增子测序对其唾液微生物组进行了表征(方法)。ESCC患者年龄较大(双侧Mann-Whitney U检验p<0.001),并且饮酒(卡方检验p=0.029)、饮用热饮(p=0.010)和户外烹饪(p=0.030)的可能性较小(表S1)。ESCC组和对照组在性别、婚姻状况、居住地、吸烟、自我报告的HIV状态和糖尿病状态方面没有显著差异(表S1)。

ESCC的口腔微生物组与对照组可区分

为了研究ESCC患者和对照组之间整体微生物组的差异,我们首先测试了组内多样性(α多样性)是否在不同组之间存在差异。ESCC样本的α多样性显著降低(Shannon和Chao1指数的双侧Mann-Whitney U检验p=2×10⁻⁴和p=10⁻⁸;图1a和补充图2a)。我们观察到基于年龄、性别、吸烟、HIV状态或提取批次的Shannonα多样性没有差异(所有p>0.2),尽管饮用热饮与更高的α多样性相关(p=0.027)。在一个调整了所有可用临床和人口统计学协变量以及实验批次的逻辑回归中,Shannon多样性仍然与ESCC显著相关(p=0.009)。此外,我们发现当仅考虑扩增子序列变体(ASV)的存在与否时,ESCC患者的口腔微生物组与对照组的分离(未加权UniFrac,PERMANOVA p<0.0001;图1b),并且即使在调整所有可用协变量后,这种分离仍然显著(p<0.001)。然而,当使用丰度加权的微生物组距离(加权UniFrac,p=0.096;补充图2b)时,ESCC和对照组并未分别聚类。这表明低丰度ASV可能促进了ESCC与对照组之间的差异,而非群落水平的差异。为了评估低丰度ASV对ESCC与对照组之间差异的贡献,我们将数据子集化为仅包含平均丰度最低百分位数的ASV,并评估了病例-对照状态解释的方差(adonis R²)与百分位数阈值之间的关系(补充图2f)。最低丰度的ASV对病例和对照组之间的最大分离贡献最大,并且随着高丰度ASV的逐步包含,解释的组间方差逐渐减小(补充图2c-e)。

属和ASV水平的丰度与ESCC相关

我们接下来评估了特定属是否与ESCC显著相关,包括调整和不调整协变量(方法;未调整结果见表S4)。我们发现,二氧化碳嗜纤维菌属(Capnocytophaga)、劳特氏菌属(Lautropia)、蛛网菌属(Arachnia)、链球菌属(Streptococcus)、月形单胞菌属(Selenomonas)、纤毛菌属(Leptotrichia)和弯曲杆菌属(Campylobacter)在ESCC患者的唾液中显著升高(所有调整协变量后FDR校正p<0.05)。此外,产丝菌属(Filifactor)和拟杆菌属(Bacteroides)在ESCC口腔微生物组中减少(FDR校正p分别为0.003和0.01;图2a,表S4)。

在ASV水平分析细菌的差异丰度可以比属水平分析提供更详细的见解,因为微生物功能通常是物种特异性的。因此,我们研究了ESCC与单个ASV之间的关联,同时调整了协变量(方法)。共鉴定出五个ASV具有差异丰度(所有FDR校正p<0.05):ASV4873(注释为唾液普雷沃氏菌 P. salivae)、ASV3816(差异韦荣氏球菌 V. dispar)、ASV3722(米拉李劳特氏菌 L. mirabilis)和ASV5088(核梭杆菌 F. nucleatum)在ESCC口腔微生物组中升高,而ASV7524(Absconditabacteria sp.)在ESCC中减少(图2b,表S5)。

核梭杆菌(Fusobacterium nucleatum)是一种口腔共生菌,被认为可促进ESCC的发展,在部分ESCC病例中丰度较高,并与较差的临床结局相关⁴²⁻⁴³。如前所示,口腔ASV5088(核梭杆菌)丰度升高与ESCC口腔微生物组相关。我们进一步评估了ASV5088区分ESCC个体的能力,计算得其auROC为0.73,突显了其区分能力(补充图3)。然而,我们并未发现属水平的梭杆菌属(Fusobacterium)丰度与ESCC相关。因此,我们接下来研究了在ESCC和对照组之间,梭杆菌属内某些ASV是否更有可能以更高比例存在,即该属内某些ASV相对于其他ASV是否更为普遍。我们发现,相对于其他梭杆菌属ASV,ASV6145(牙周梭杆菌 Fusobacterium periodonticum)在ESCC中显著减少(p=0.003;调整了样本中该属丰度和ESCC风险因素)。此外,相对于其他梭杆菌物种,ASV5088(核梭杆菌)在ESCC中显著增加(p=0.01)(图2c,表S6)。核梭杆菌在ESCC病例的梭杆菌属中占优势,重申了其在该疾病中的潜在作用。

口腔微生物组能准确分类ESCC

利用口腔微生物组对ESCC状态进行分类的能力对于开发非侵入性诊断具有巨大潜力。因此,我们设计了逻辑回归模型,并检验了口腔微生物组是否可用于区分ESCC患者和对照组。作为基准,我们还测试了基于所有可用临床信息的模型。由于样本是分批处理的,我们在保留的批次上评估模型(留一批交叉验证),以限制可能的混杂效应⁴⁴⁻⁴⁵(方法)。模型超参数使用训练集(“嵌套”交叉验证)进行调整,没有来自测试集的信息泄漏。

使用临床和人口统计信息的模型获得了中等准确度,总体auROC为0.69(跨折平均值±标准差为0.72±0.16),总体精确率-召回率曲线下面积(auPR)为0.54(0.67±0.2;图3a;补充图4a)。使用ASV水平的口腔微生物组数据,我们生成了一个准确度显著更高的模型(总体auROC=0.96,跨折平均值±标准差0.95±0.046;auPR=0.92,0.91±0.11;DeLong检验 p=9.12×10⁻⁹ vs. 使用临床数据的模型)。我们还构建了一个物种水平的模型,其表现略逊于ASV水平模型(总体auROC=0.92,折间0.93±0.075;auPR=0.85,0.92±0.09;p=0.046 vs. ASV水平模型)。一个结合了临床和ASV水平口腔微生物组数据的模型并未比仅基于口腔微生物组数据的模型有所改进(总体auROC=0.96,折间0.95±0.058;auPR=0.93,0.92±0.09;p=0.72 vs. ASV水平模型)。这表明口腔微生物组组成可能能够以高准确度对ESCC进行分类,并且其信息内容涵盖了相关的临床和人口统计学特征。

我们使用SHapley Additive exPlanations(SHAP)值评估了每个特征对每个样本模型预测的重要性(图3b;补充图5)。对基于临床的预测器分析显示,年龄是最具预测性的特征之一,这与ESCC组年龄较大相对应(补充图5a)。此外,在基于微生物组的预测器中发现的前十个最具预测性的特征中,ASV5088(核梭杆菌)是唯一在ESCC患者中也被标记为显著差异丰富的分类群(补充图5b和图2)。有趣的是,同一属内的一些分类群具有强烈相反的信号:例如,模型评估中出现了四种韦荣氏球菌属(Veillonella)物种,其中两种与ESCC相关(ASV1169:非典型韦荣氏球菌 Veillonella atypica 和 ASV10234:微小韦荣氏球菌 Veillonella parvula),而该属的另外两个未鉴定ASV与对照组相关(ASV582和ASV11255)。此外,ASV505(唾液链球菌 Streptococcus salivarius)可预测ESCC,而ASV1707(副血链球菌 Streptococcus parasanguinis)与对照组相关。这些模式表明在ESCC中对口腔微生物群进行ASV水平分析的重要性,因为一个属内的不同微生物可能在口腔和疾病中发挥不同的作用。

基于口腔微生物组的ESCC模型可跨研究推广

在中国的ESCC高发地区进行了几项评估口腔微生物组与ESCC关系的研究⁸⁻¹⁴⁻¹⁹⁻³⁷⁻⁴¹。在我们确定的研究中,有三项研究提供了来自ESCC患者和非ESCC对照的公开唾液微生物组16S rRNA测序数据:一项包含41名个体(20名ESCC;Wang等人2019年),所有个体均患有牙周炎或牙龈炎(牙龈疾病)¹⁵⁻⁴⁶;一项包含90名个体(39名ESCC;Zhao等人2020年)¹⁸⁻⁴⁷;以及一项包含52名个体的研究,其中31名为早期ESCC患者,21名为对照³⁷⁻⁴⁸(Chen等人2024年)。Wang等人2019年和Zhao等人2020年的研究均在中国河南地区招募参与者,尽管是在不同的医院¹⁵⁻¹⁸,而Chen等人2024年的研究是在中国南京招募的参与者³⁷。所有研究均招募了之前未接受过ESCC治疗的个体,并使用16S rRNA基因的V3-V4区域对其唾液微生物组进行了分析。由于这三项研究与我们研究(使用V1-V2区域分析微生物组)之间的ASV不一致,我们只能评估我们基于物种水平的微生物组模型。

我们首先评估了该模型(在我们来自南非的队列上训练)是否能独立地推广到每个外部队列。我们发现该模型能很好地推广到Zhao等人2020年的研究(总体auROC=0.79,跨折平均值±标准差0.79±0.058;auPR=0.77,0.77±0.07;单侧Mann-Whitney U检验 p=2.87×10⁻⁷;方法),尽管推广到Wang等人2019年(招募了牙龈疾病患者)和Chen等人2024年(专注于早期ESCC患者)的效果不佳,后者auROC分别为0.56(折间0.55±0.059;auPR=0.60,0.60±0.07;p=0.16)和0.52(折间0.52±0.034;auPR=0.65,0.65±0.023;p=0.55)(图3c,补充图4b)。为了评估这种不佳的泛化性是否是由于外部研究中ESCC与对照组之间的分离程度较弱,我们在每个外部研究内部单独进行了10折嵌套交叉验证(补充图6)。我们发现,在Zhao等人2020年的研究中¹⁸,使用物种水平微生物组可以高度区分ESCC和对照组(总体auROC=0.88,折间0.94±0.067;auPR=0.86,0.94±0.063;p=3.2×10⁻¹⁰),在早期ESCC研究³⁷中也有相当的区分能力(总体auROC=0.68,折间0.64±0.23;auPR=0.76,0.81±0.13;p=0.015)。然而,在仅包含牙龈疾病患者的研究中¹⁵,口腔微生物组无法很好地区分ESCC(总体auROC=0.54,折间0.54±0.21;auPR=0.50,0.67±0.15;p=0.33),这解释了我们的模型对该特定研究泛化性差的原因。

最后,我们评估了更全局的基于微生物组诊断的潜力,检验了在除一项研究外的所有研究上训练的模型是否能推广到保留的队列。在这种留一研究交叉验证中,基于口腔微生物组的模型能够以一定准确度识别保留研究中的ESCC(auROC=0.64–0.81,auPR=0.70–0.84;所有p<0.05;图3d,补充图4c),表明ESCC可能存在跨地理区域的潜在可推广微生物组特征。为了研究哪些分类群对跨研究的预测贡献最大,我们确定了四个模型中具有最大平均逻辑回归系数的前30个分类群(补充图7)。值得注意的是,这30个分类群在所有模型中的系数方向一致。

讨论

在本研究中,我们通过16S rRNA基因测序,表征了来自南非的158名个体(包括48名确诊为ESCC的个体和110名健康对照)的口腔微生物组。我们检测到ESCC患者口腔微生物组与对照组相比存在差异,包括微生物α多样性显著降低。我们进一步发现,包括二氧化碳嗜纤维菌属、劳特氏菌属、蛛网菌属、链球菌属和月形单胞菌属在内的属与ESCC相关,此外还有特定的ASV,包括核梭杆菌、差异韦荣氏球菌和米拉李劳特氏菌。最后,我们证明了基于微生物组的模型可以跨地理上不同的队列对ESCC状态进行分类,表明其作为该疾病筛查工具的潜力。需要进行前瞻性研究,以评估口腔微生物组在疾病发作前是否独特,以及微生物组是否可用于跨癌症分期对疾病进行分类。

本研究中发现的许多与ESCC相关的细菌已知会促进口腔炎症和瘤变。例如,二氧化碳嗜纤维菌属已被证明可以侵入口腔鳞状细胞癌细胞并诱导上皮-间质转化⁴⁹⁻⁵⁰。月形单胞菌属物种通常与牙周病相关,已知会附着在牙龈上皮细胞上并触发炎症反应⁵¹⁻⁵²。链球菌属是口腔中最普遍的属,包括轻型链球菌(S. mitis)和咽峡炎链球菌(S. anginosus)等物种,已被涉及与口腔和上消化道癌症相关⁵³⁻⁵⁵。一项来自坦桑尼亚的研究分析了ESCC肿瘤相关微生物组,并报告了与我们口腔微生物组中发现相似的结果,包括月形单胞菌属、链球菌属和弯曲杆菌属的高丰度⁵⁶。

我们的发现也支持了之前涉及核梭杆菌在ESCC中的证据。有趣的是,一个被分配到核梭杆菌的单一ASV(ASV5088)能够很好地区分ESCC和对照组,auROC为0.73。需要在独立队列中进行进一步验证,以确定核梭杆菌的丰度,无论是单独还是与其他物种或菌株结合,是否可以通过qPCR等靶向检测方法作为ESCC的稳健生物标志物。已有研究表明核梭杆菌在ESCC肿瘤组织中富集,并且有证据表明该微生物可能侵入ESCC细胞并增强细胞生长,从而促进疾病进展⁴⁰⁻⁴²⁻⁴³。值得注意的是,我们发现,在梭杆菌属内,与属内其他物种相比,核梭杆菌在ESCC中倾向于以更高比例存在。相比之下,对照组口腔微生物组中牙周梭杆菌的比例显著更高。已知核梭杆菌和牙周梭杆菌都是活跃的入侵物种,因为它们能够独立侵入上皮宿主细胞,并且在核梭杆菌的情况下,能够颠覆宿主细胞功能⁵⁷⁻⁵⁹。基于这些证据,核梭杆菌可能在ESCC口腔微生物组中与牙周梭杆菌竞争时占据优势。

先前的研究已经确定,口腔健康不良(特别是牙齿脱落和缺乏定期口腔卫生)与ESCC风险较高相关⁶⁰⁻⁶³。参与口腔健康不良的微生物可能同样参与ESCC的炎症过程,这或许可以解释口腔健康不良与癌症之间的联系。一项关于食管腺癌(EAC)和ESCC的前瞻性研究发现,福赛斯坦纳菌(Treponema forsythia)与EAC以及牙龈卟啉单胞菌(Porphyromonas gingivalis)与ESCC之间存在关联⁹。这些微生物是牙周病原体“红色复合体”的成员,被描述为牙周炎的驱动因素⁶⁴。在我们的研究中,我们没有发现ESCC与任何红色复合体物种之间的关系。尽管我们没有关于参与者口腔健康的数据,但先前的研究表明,这些口腔微生物组的改变可能独立于口腔健康状况而存在。在一项关于巴雷特食管和早期EAC患者口腔微生物组的研究中¹¹,发现牙齿脱落与高级别不典型增生和早期EAC相关。然而,即使在调整牙齿脱落后,与高级别不典型增生和早期EAC相关的分类群仍然显著,表明牙齿脱落与疾病的关联可能通过口腔微生物组介导。口腔微生物组、口腔健康和ESCC风险之间的因果通路仍不明确。

饮酒和热饮消费是公认的ESCC风险因素,尽管我们未在我们的南非队列中发现这些关系。相反,热饮消费和饮酒在对照组中更常见。我们推测,这是因为ESCC与饮酒之间的关系可能更为复杂,并且取决于饮酒频率和摄入量,这些信息在我们的研究问卷中未收集。同样,热饮消费与ESCC之间的关系可能取决于饮料的温度,这也没有在我们的数据中收集。我们还怀疑可能存在反向因果关系的因素,即摄入酒精和热饮加剧了ESCC患者的症状,导致他们避免这些行为。

我们研究的一个优势是,我们能够利用南非及跨地理区域的口腔微生物组设计出预测ESCC的准确模型,即使非高准确度(最不准确模型的auROC为0.64)也发现了统计显著信号。通过交叉验证,我们证明基于微生物组的模型在使用已确立的临床风险因素识别南非ESCC患者方面远优于临床模型。此外,我们检查了ESCC的口腔微生物组特征是否可以推广到不同的地理区域。我们在保留研究上评估了物种水平的微生物组预测器,证明聚合模型能很好地推广到保留研究,包括一项招募了早期ESCC患者的研究。对所有聚合模型而言,促成ESCC预测的物种是一致的,并强化了我们在南非分析中的发现:链球菌属、二氧化碳嗜纤维菌属和韦荣氏球菌属物种与ESCC相关,而牙周梭杆菌始终与对照组相关。南非单独训练的模型在中国保留研究上表现较低,可以用地理效应(与口腔微生物组结构相关⁶⁵)以及提取试剂盒和测序方案的差异(可能也引入了研究特定的处理偏差⁶⁶⁻⁶⁸)来解释。然而,一个简单的聚合模型在不同队列(包括一项包含早期ESCC患者的研究)中表现相对良好,表明存在某种可推广的口腔微生物组特征,可独立于地理区域甚至在疾病早期阶段识别ESCC个体。这对于开发基于微生物组的诊断方法是有前景的。为了进一步建立地理泛化性,应在ESCC高发区的其他地区(如伊朗和东非¹⁻⁷⁰)评估模型。此外,虽然有证据表明唾液微生物组随时间推移比其他身体部位更稳定²¹,但未来的工作应专门确定基于唾液微生物组的ESCC诊断是否无论取样时间如何都能保持准确。

本研究存在一定的局限性。尽管没有每个参与者的分期数据,但大多数ESCC患者出现吞咽困难,可能是由于存在较大的肿瘤和晚期疾病。早期和晚期ESCC患者的口腔微生物组可能略有不同,尽管在我们的留一研究交叉验证设置中,模型在包含早期ESCC的外部研究和包含晚期ESCC(包括我们自己的)的其他研究之间显示出一定的泛化性。由于仅基于南非研究训练的微生物组模型无法很好地推广到包含早期ESCC个体的外部研究或另一项仅包含牙龈疾病个体的外部研究,因此需要进一步开展工作,以确保基于唾液微生物组的诊断能够在早期阶段区分ESCC,并且不受牙周病存在的影响。由于缺乏与外部研究相关的公开临床和人口统计数据,我们无法比较基于微生物组的模型与基于临床特征的模型的泛化性。此外,ESCC参与者和对照组应在年龄上更紧密匹配,并根据抗生素使用等因素进行排除,但由于参与者可用性有限,这无法实现。由于对照组未接受上消化道内镜检查,我们无法完全确定他们没有ESCC。然而,这是一个相对健康的队列,没有吞咽困难症状,因此我们的对照组中未检测到ESCC的可能性非常低。

总体而言,这些结果证明了口腔微生物组区分ESCC和对照组的潜力,并确定了与该疾病相关的特定细菌ASV。要将这些发现转化为在资源匮乏环境中基于口腔微生物组的ESCC筛查,需要在不同的地理区域、更大的样本量中,特别是在患有早期、可治愈ESCC的患者中进行验证验证。这样的检测可用于对患者进行上消化道内镜检查的分诊,这将在极高发病率地区产生重大的公共卫生影响。

【全文结束】

猜你喜欢
  • 人工智能与健康:变革现代医学的未来人工智能与健康:变革现代医学的未来
  • 人类微生物组计划与药品质量控制微生物学人类微生物组计划与药品质量控制微生物学
  • AAAAI新主席Carla Davis在2026年会议上概述新举措AAAAI新主席Carla Davis在2026年会议上概述新举措
  • 如何通过肠道细菌和饮食重新编程脂肪以燃烧更多能量如何通过肠道细菌和饮食重新编程脂肪以燃烧更多能量
  • 你的肠道模拟可能预测哪些益生菌会定植你的肠道模拟可能预测哪些益生菌会定植
  • 在脑脊液中发现多发性硬化症的新诊断标志物在脑脊液中发现多发性硬化症的新诊断标志物
  • 低纤维饮食的影响不止于消化,美国医生解释其对整体健康的危害低纤维饮食的影响不止于消化,美国医生解释其对整体健康的危害
  • 利用新型覆盖层天线与机器学习算法的高级脑卒中检测利用新型覆盖层天线与机器学习算法的高级脑卒中检测
  • 先驱研究者迪米特拉·斯孔德拉博士被任命为眼科学研究副主任 | 纽约大学朗格尼新闻先驱研究者迪米特拉·斯孔德拉博士被任命为眼科学研究副主任 | 纽约大学朗格尼新闻
  • 关于声称能平腹、舒缓消化和改善肤色的5美元食品的真相关于声称能平腹、舒缓消化和改善肤色的5美元食品的真相
热点资讯
全站热点
全站热文