超越高精度质谱:为何色谱保留时间必须在分析物鉴定中重获其位Beyond High-Accuracy Mass Spectrometry: Why Chromatographic Retention Time Must Reclaim Its Role in Analyte Identification | LCGC International

环球医讯 / 健康研究来源:www.chromatographyonline.com希腊 - 英语2026-10-09 13:11:58 - 阅读时长14分钟 - 6608字
本文探讨了代谢组学研究中代谢物鉴定的可靠性问题。尽管已有明确的鉴定指南,但实践中常将“注释”与“鉴定”混为一谈,仅凭质谱数据库匹配结果就声称“鉴定”,缺乏色谱等正交证据的支持。作者认为,色谱保留时间是一个被低估却反映分子理化性质的关键参数,与质谱数据结合使用能提供有力的验证,过滤掉不可能的候选物,是达到1级鉴定的基础。文章呼吁研究者系统性地利用保留时间、保留指数和预测模型,并遵循监管框架(如欧盟法规)中的联合标准,以提升代谢组学数据的可信度,防止错误在数据库和AI驱动的分析中被放大。
代谢组学代谢物生物标志物疾病诊断健康保留时间质谱
超越高精度质谱:为何色谱保留时间必须在分析物鉴定中重获其位

代谢组学(代谢表型分析或代谢分型)旨在编录和解释生物系统内的小分子含量,并研究浓度变化趋势,这些趋势反映了所研究细胞、器官或生物体的生化状态。在实践中,这意味着发现能区分不同样本或样本组的小分子代谢物(包括脂质)及其模式,例如揭示生理与病理状态之间的差异。最终,这些发现帮助科学家产生新知识,并理解其研究课题背后或扰动的生化机制。如果研究主题是疾病,这可以带来改进的诊断或预后;如果是运动生物化学研究,我们可以获得对能量消耗机制、身体补充机制、氧化应激机制等方面的新认识。对于植物,我们则关注植物保护机制以及植物和产品生长的过程。任何非靶向代谢组学实验的真正价值,并不取决于样本分析过程中检测到多少特征,而在于这些检测到的特征如何转化为可靠的代谢物身份,以及进一步有多少代谢物与生化现象相关。显然,没有可靠的鉴定,任何机制解释都只是推测,声称的生物标志物也仅仅是统计伪迹。

代谢物鉴定的定义是直截了当的。要声称一个化合物已被“鉴定”,其信号必须在预定义的容差范围内,与在相同条件下测量的真实标准品数据匹配。代谢组学标准倡议(MSI)[1]或脂质组学标准倡议(LSI)[2]等社区框架和指南,通过置信水平对此进行了规范。

1级鉴定保留给那些通过直接与标准品比较而确认的化合物:色谱保留时间、质荷比(m/z)和串联质谱(MS/MS)谱图。较低的置信水平对应推定结构或类别级别的注释(图1为示意图)。注释是给检测到的信号(例如,峰、特征)分配推定化学身份的过程,但并未达到最终确认。定义这些过程的方案和出版物被广泛引用,并且已经存在了十多年[3]。

尽管有这种明确的定义,但实践往往与原则严重背离。越来越多的证据,包括系统性的文献综述表明,在非靶向液相色谱-质谱(LC-MS)研究中,代谢物鉴定的报告常常缺乏足够的数据支持,并且有令人担忧的过度自信倾向[4]。仍然常见到化合物被描述为“已鉴定”,而实际上它们仅是基于精确质量的单一数据库匹配结果;有时,这种匹配会得到MS/MS谱图比较的支持,但完全没有色谱信息,也没有与标准品分析数据的比较。实际上,注释和鉴定被视为同义词,尽管现有指南明确区分了它们。这种术语使用上的模糊性侵蚀了透明度,使可重复性变得复杂,并可能误导读者,让他们以为所报告的代谢物是经过可靠鉴定的,而事实并非如此。

我们认为,液相色谱保留时间(tR)及相关色谱观测值的巨大潜力尚未被充分利用,它们可以提供关键的、正交的证据,并且能够、也应该与质谱数据一起使用。

当前状况

尽管仪器制造商、软件开发人员、数据库管理员以及整个代谢组学领域投入了大量资源,但鉴定步骤仍然是主要的瓶颈和持续的错误来源。相当一部分已发表的研究为其指定的标记物提供的证据不足,同时还有几篇论文存在错误注释[5]。更令人担忧的是,这些错误常常能通过同行评审,尤其是在那些并非主要关注代谢组学、可能缺乏专业编辑和审稿人的期刊中[6]。结果,错误的代谢物身份被载入公共记录,随后被当作事实引用,并进一步用于支持更新的研究或填充数据库。当前局面因计算和人工智能工具的快速发展而变得更加复杂。用于谱图匹配、计算机模拟碎裂和通路映射的自动化工作流程现已广泛可用,并且极具吸引力,尤其对非专业人士而言,因为它们似乎能提供大规模的快速鉴定。然而,这些工具的可靠性完全取决于支撑它们的数据和假设。当代谢物鉴定中的错误进入文献或数据库时,AI驱动的分析可能会复制并放大这些错误。

这种情况的科学后果绝非小事。基于薄弱支持的鉴定结果会扭曲通路分析,驱动脆弱的机制性叙述,并误导生物标志物发现工作。错误鉴定的代谢物被存入数据库,可能成为未来错误注释的源头。在大规模文本和数据挖掘(包括基于AI的文献分析)的时代,此类错误会传播得更快。如果我们允许这种代谢组学知识的“虚假现实”根深蒂固,那么生物标志物发现代谢组学的可信度将面临风险。

在最近的观点文章中,我们提供了失败注释的例子[6];其中相当一部分错误,只需检查建议注释的保留时间和物理化学性质即可避免。

质谱是代谢组学和脂质组学的核心,因为它提供了灵敏度、动态范围以及通过高分辨率测量和MS/MS碎裂产生结构信息的能力。然而,单独使用质谱很少足以进行明确鉴定。同分异构体种类在小分子空间中非常丰富;许多化合物共享相同的名义质量甚至相同的元素组成。在这种情况下,精确的质量和看似合理的MS/MS谱图可能仍会留下多个候选结构,这在同分异构脂肪酸或糖类的数量上就有明显的例子。此外,实验编译的LC-MS谱库通常不完整、质量参差不齐,并且通常在不同条件下采集,而在线数据库的很大一部分包含计算机模拟谱图。总之,盲目依赖基于单一MS¹采集的数据库匹配会增加错误风险。

这正是正交数据,特别是色谱保留时间,能够帮助筛选数据库命中结果的用武之地。保留时间在代谢物鉴定中的效用体现在多个层面。在最直接的层面,将样本中某个特征的保留时间与在同一系统中测量的真实标准品的保留时间进行匹配,提供了强有力的身份证据。当与匹配的MS和MS/MS数据结合时,这构成了MSI/LSI 1级鉴定的基础[2]。类似地,来自美国食品药品监督管理局(FDA)和欧盟(EU)的监管指南明确要求,在目标分析物鉴定的数字评分系统中,必须结合使用保留时间和MS谱图信息(EC 657/2002号决定,EU 808/2021法规)[7,8]。这些指南对要应用的匹配标准非常具体,并建议样本提取物中分析物的保留时间必须与相应校准标准品(或基质匹配/基质强化标准品)的保留时间匹配,容差为±0.1分钟或5%相对偏差,并且使用高分辨率质谱(HRMS)仪器时,“诊断离子”的质量偏差应小于5 ppm(图2)。

不幸的是,保留时间除了在峰检测和对齐步骤中,几乎没有被利用,而鉴定工作流程通常只利用自动化搜索引擎和MS数据库中的前体离子m/z值。事实是,保留时间并非一个随意值;它反映了分子的物理化学性质、其疏水性、极性以及在一组确定的色谱条件下与固定相和流动相的相互作用。保留时间提供了一个强大的(与MS正交的)描述符,可用于支持、改进或反驳源自质谱数据库搜索的候选鉴定。

系统地利用保留时间有助于解决代谢组学中一些更广泛的问题。即使没有参考标准品,保留顺序也能提供有关分析物分子性质的有用信息。这几十年来已是常识,现在只需在实践中应用。在同系物系列或脂质类别内,保留时间提供了一种内部逻辑,可用于评估注释的合理性。例如,在反相液相色谱(RPLC)中,人们预期较长的酰基链或更疏水的物质会洗脱得更晚;增加不饱和度通常会提前保留时间。偏离这些模式可能表明错误注释或意外化学性质,应引起进一步审查。例如,当候选物的预期极性或logP与其报告的保留时间不一致,或其洗脱行为与结构相关化合物不一致时,就会产生疑虑。

以一种更正式、结构化的方式,这些相关性可以通过保留指数或利用从分子结构估算tR的保留预测模型来阐述[9]。虽然此类模型并不完美且依赖于特定方法,但它们可以提供额外的证据层。例如,一个预测保留时间与观测值严重不兼容的提议分子结构,很可能是错误的。这种方法不需要跨实验室的相同保留时间,这并不现实。相反,重要的是保留顺序的一致性,并辅以使用适当的校准物和质量控制样品。

色谱数据并非万能药,它们本身并不能为代谢物鉴定提供决定性证据。保留时间可能会漂移,共洗脱在高度复杂的基质中仍然是一个持续的挑战。尽管如此,这些限制可以通过良好的分析实践来有效管理,包括使用内标、质量控制样品、改进的保留对齐策略、保留指数化以及方法的详尽记录。因此,报告色谱条件、关键标准品的保留时间和代表性色谱图,不应被视为可选的附加项,而应被视为一个透明的、投入了大量时间和资源的代谢组学研究的重要组成部分。简单的措施,例如使用一组合成定义的校准化合物来锚定保留行为,或者报告标准化的保留指数而非保留时间,可以提高实验室和仪器之间的可比性。

另一个好处是可能改进对反复出现的未知物的报告。

将保留时间整合到鉴定工作流程中,可以因特定原因带来改进。对于脂质和其他同系物系列,可以生成保留时间与链长或不饱和度关系的趋势图,作为诊断工具。最近,METLIN小分子保留时间(SMRT)数据集被引入,提供了最大的实验获取保留时间数据集,涵盖了超过80,000个分子[10]。此外,针对特定应用,已经开发了几个保留时间数据库,重点关注天然产物和代谢组学,包括Fiehn实验室保留时间库和RIKEN MSn及RT库(PRIMe)[11,12]。这些数据库为比较保留时间和洗脱顺序提供了有用的资源。我们要澄清的是,这类方法可能无法达到完美或精确计算实验保留时间。相反,它们可以反映一种思维方式,即把色谱数据视为有用的信息来源。将保留数据作为过滤器、评分项或机器学习模型的输入,整合到自动化流程中,可以使这些模型更加稳健,不易传播明显不合理的鉴定结果。

最后,另一个反复出现的问题是报告化学上不合理的化合物,例如复杂的合成药物、实验室洗涤剂或工业染料,这些物质在它们的出现极不可能的情况下被报告为差异代谢物。许多此类注释甚至经不起基本的合理性评估,即所提议的化合物是否可能存在于被分析的样本中。文献中记载的此类案例的例子在我们的近期观点文章中进行了讨论[6]。

结论

改进数据管理是代谢组学未来发展的核心。这种数据管理包括手动检查个别鉴定结果、系统地利用所有可用的实验证据,包括色谱、质谱以及(如果可用)离子淌度信息。包含保留时间、碰撞截面积(CCS值)、MS和MS/MS谱图的精选参考数据集,对于特定基质中的广泛代谢物和脂质面板来说尤其有价值。它们提供了一个具体的、经过实验验证的背景,可以据此评估新的注释。当这些资源在严格的质量保证协议下开发(考虑加合物模式、m/z容差、保留行为)时,它们就成为了提高代谢物鉴定可靠性的强大工具。总的来说,为了促进和巩固该领域,作者在设计实验、制定鉴定策略、报告实验和撰写稿件时,需要遵循已发布的指南和建议。审稿人和编辑需要坚持要求明确说明证据水平,并且鉴定主张必须有适当的真实数据支持,例如色谱和质谱数据。期刊可以通过使其作者须知与社区标准保持一致,并鼓励甚至要求明确说明鉴定置信度以及提供关键代谢物的原始或处理过的色谱数据,来提供帮助。

参考文献

  1. Fiehn, O.; et al. The Metabolomics Standards Initiative (MSI). Metabolomics 2007, 3, 175–178.
  2. Liebisch, G.; Vizcaíno, J. A.; Köfeler, H.; et al. Shorthand Notation for Lipid Structures Derived from Mass Spectrometry. J Lipid Res 2013, 54, 1523–1530.
  3. Sumner, L. W.; Amberg, A.; Barrett, D.; et al. Proposed Minimum Reporting Standards for Chemical Analysis: Chemical Analysis Working Group (CAWG) Metabolomics Standards Initiative (MSI). Metabolomics 2007, 3, 211–221.
  4. Kodra, D.; Pousinis, P.; Vorkas, P. A.; et al. Is Current Practice Adhering to Guidelines Proposed for Metabolite Identification in LC–MS Untargeted Metabolomics? A Meta-Analysis of the Literature. J Proteome Res 2022, 21, 590–598.
  5. Theodoridis, G.; Gika, H.; Goodacre, R.; et al. Ensuring Fact-Based Metabolite Identification in LC–MS-Based Metabolomics. Anal Chem 2023, 95, 3909–3916.
  6. Theodoridis, G.; Fiehn, O.; et al. What’s in a Name: Compound Annotations in Metabolomics Studies. Metabolomics 2026, 22, 22.
  7. European Commission. Commission Decision 2002/657/EC of 12 August 2002 Implementing Council Directive 96/23/EC Concerning the Performance of Analytical Methods and the Interpretation of Results. Off. J. Eur. Communities 2002, L221, 8–36.
  8. European Commission. Commission Implementing Regulation (EU) 2021/808 of 22 March 2021 on the Performance of Analytical Methods for Residues of Pharmacologically Active Substances Used in Food-Producing Animals and on the Interpretation of Results as Well as on the Methods to Be Used for Sampling and Repealing Decisions 2002/657/EC and 98/179/EC. Off. J. Eur. Union 2021, L180, 84–109.
  9. Stanstrup, J.; et al. PredRet: Prediction of Retention Time by Direct Mapping between Multiple Chromatographic Systems. Anal. Chem. 2015, 87, 9421–9428.
  10. Domingo-Almenara, X.; Guijas, C.; Billings, E.; et al. The METLIN Small Molecule Dataset for Machine Learning-Based Retention Time Prediction. Nat Commun 2019, 10, 5811.
  11. Kind, T.; Wohlgemuth, G.; Lee, D. Y.; Lu, Y.; Palazoglu, M.; Shahbaz, S.; Fiehn, O. FiehnLib: Mass Spectral and Retention Index Libraries for Metabolomics Based on Quadrupole and Time-of-Flight Gas Chromatography/Mass Spectrometry. Anal Chem 2009, 81, 10038–10048.
  12. Sawada, Y.; Nakabayashi, R.; Yamada, Y.; et al. RIKEN Tandem Mass Spectral Database (ReSpect) for Phytochemicals: A Plant-Specific MS/MS-Based Data Resource and Database. Phytochemistry 2012, 82, 38–45.

【全文结束】

猜你喜欢
  • 肯特大学B型脑膜炎疫苗接种大排长龙,因需求过高部分学生被拒之门外肯特大学B型脑膜炎疫苗接种大排长龙,因需求过高部分学生被拒之门外
  • 胃癌基金会奖励两项10万美元种子基金,用于推动新药和基因组研究胃癌基金会奖励两项10万美元种子基金,用于推动新药和基因组研究
  • 肯特大学报告“快速传播”病毒,脑膜炎疫情回顾肯特大学报告“快速传播”病毒,脑膜炎疫情回顾
  • 肯特大学宿舍学生将接种脑膜炎疫苗,斯特里廷称此次疫情“史无前例”肯特大学宿舍学生将接种脑膜炎疫苗,斯特里廷称此次疫情“史无前例”
  • 胎儿血液中“永久化学物质”含量可能高于此前认知——报告胎儿血液中“永久化学物质”含量可能高于此前认知——报告
  • 肠道菌群与心脏健康:肠道细菌与心脏病如此关联肠道菌群与心脏健康:肠道细菌与心脏病如此关联
  • 肥胖与炎症与全因及心血管死亡率的关联肥胖与炎症与全因及心血管死亡率的关联
  • 肿瘤学多模态人工智能的进展肿瘤学多模态人工智能的进展
  • 胃肠道微生物失衡,增加患病风险胃肠道微生物失衡,增加患病风险
  • 肯特郡侵袭性脑膜炎疫情致一名中学生与一名大学生死亡:另有11名青少年病重住院,受害者曾参加同一社交活动,卫生部门正努力控制病例浪潮肯特郡侵袭性脑膜炎疫情致一名中学生与一名大学生死亡:另有11名青少年病重住院,受害者曾参加同一社交活动,卫生部门正努力控制病例浪潮
热点资讯
全站热点
全站热文