PathogenFinder2是丹麦技术大学(DTU)的研究人员与多家国际合作伙伴共同开发的一款新AI工具,用于判断一种未知细菌是否具有与致病能力相关的遗传特征。该研究已发表在《生物信息学》上,这是全球生物信息学与计算生物学领域的顶级期刊之一。这项研究可能显著加强大流行防范。
“PathogenFinder2的目的不仅在于表征已知与疾病相关的细菌,还在于评估新细菌的潜在威胁,即使是在首次感染出现之前。这能让当局在预防疫情爆发方面拥有更好的机会,而不是仅仅被动应对。”DTU国家食品研究所基因组流行病学研究组负责人Frank Møller Aarestrup教授表示。
这款新AI工具是“全球病原体分析平台”(GPAP)的一部分,并作为免费在线服务向公众开放。
“PathogenFinder2可用于检测污水、健康人类和动物,在细菌造成首次感染之前就识别出具有致病潜力的菌株,从而为更早开发检测方法、疫苗和治疗方法提供基础。”在DTU国家食品研究所攻读博士期间完成PathogenFinder2项目的研究员Alfred Ferrer Florensa说。
为什么识别危险细菌很困难
我们周围的大多数细菌都是无害的,许多细菌通过帮助消化、保护皮肤或促进食品生产来支持人类健康。然而,一小部分细菌可能引起严重感染。
气候变化、生态系统扩张以及对微生物多样性的不断探索,意味着研究人员正在遇到比以往更多的细菌物种,其中许多没有先前的文献记载。因此,评估哪些细菌可能构成风险成为一个日益严峻的挑战。
传统上,判断一种细菌是否致病需要实验室实验,这些实验既缓慢又昂贵,且常常结果不一致。计算方法有助于加快这一过程,但大多数方法依赖于将新生物体与已知病原体进行比较,当没有近亲存在时,这种方法的有效性就会失效。
“不仅要准确预测与已知病原体相似的细菌威胁,还要为出现一种全新且未知的致病细菌做好准备,这一点至关重要。”Alfred Ferrer Florensa说。
PathogenFinder2的独特之处
PathogenFinder2采用了一种全新的策略。该模型不依赖与已知物种的相似性,而是使用蛋白质语言模型——一种基于数百万条蛋白质序列训练的高级AI系统。正如文本预测工具学习人类语言模式一样,这些模型学习蛋白质的语言,从而能够检测传统方法忽视的生物化学信号。
“PathogenFinder2是首批利用语言模型的巨大潜力来解释整个细菌基因组的模型之一。它的性能显著优于所有以前的模型,尤其是在遇到我们从未见过的细菌物种时。此外,它还为其预测提供了解释。”博士Alfred Ferrer Florensa说。
研究人员强调,该模型可以识别有趣的特征和潜在风险,但在得出任何最终结论之前,必须对结果进行进一步检验。
理解细菌看起来危险的原因
PathogenFinder2不仅能生成预测,还能突出显示对其评估影响最大的特定蛋白质。
这些蛋白质可能包括已知的毒力因子,如毒素或附着结构(帮助细菌附着在人体细胞上的特征),以及可能参与致病过程的完全未被表征的蛋白质。
这种可解释性为诊断学、疫苗靶点和感染机制等方面的研究提供了新途径,包括那些以前未与疾病关联的蛋白质。
细菌致病能力图谱
利用蛋白质语言模型表示全基因组,使研究人员能够构建出首个“细菌致病能力图谱”,该图谱展示了数千种细菌如何根据其与疾病相关的特征相互关联。
该图谱揭示了感染相似组织或共享代谢策略的细菌集群,为探索微生物进化和相互作用提供了新方法。
“细菌致病能力图谱首次提供了人类可能感染的所有致病细菌的概览。它揭示了规律,例如可以显示哪些细菌倾向于感染相同的身体部位,或者可能依赖相似的营养物质。这为我们研究细菌如何进化和相互作用提供了新的机会。”Alfred Ferrer Florensa说。
基于21,000个细菌基因组训练
研究人员收集了迄今为止规模最大的细菌基因组数据集,这些基因组具有已知的致病潜力或已知的非致病行为。
该数据集包含来自国际数据库的21,000多个细菌基因组,包括从人类感染中分离的细菌、健康人类微生物组、益生菌培养物、食品生产以及极端环境(如能在极热或极冷条件下生存的生物体)中的细菌。
这为模型区分有害和无害细菌提供了独特的基础,即使遇到以前未描述的物种也能有效识别。
【全文结束】

