摘要
背景:阿尔茨海默病的早期检测对于及时干预至关重要;然而,不同模态和数据集之间的诊断性能差异很大。最近的多模态人工智能模型取得了显著进展,但由于数据集、建模框架和报告质量的异质性,证据基础仍然分散。
目的:本系统综述旨在分析五年来多模态人工智能模型用于阿尔茨海默病诊断、预后和风险预测的研究。我们评估了数据集特征、模态组合、建模策略、性能指标和方法学局限性,并进一步讨论了现实世界的意义和转化路径。
方法:遵循PRISMA 2020指南,我们系统检索了PubMed、IEEE Xplore、Scopus、ACM Digital Library、Cochrane和arXiv,最终数据集检索截止日期为2025年11月15日。纳入应用多模态机器学习或深度学习于阿尔茨海默病、轻度认知障碍和痴呆结局的研究,排除使用单模态或缺乏足够方法学细节的研究。采用QUADAS-2评估偏倚风险。提取的性能结果在四大主要多模态数据集家族中进行了综合。
结果:共66项研究符合纳入标准。跨数据集,多模态模型一致优于单模态基线。基于阿尔茨海默病神经影像学倡议的诊断平均准确率为92.5%(标准差3.8%),而轻度认知障碍转化模型平均曲线下面积(AUC)为0.922(标准差0.045),几种融合架构报告AUC高于0.95。相比之下,英国生物样本库风险预测研究平均AUC为0.84(标准差0.056),反映了在大规模人群数据中的表现。痴呆银行言语语言研究平均AUC为0.813(标准差0.042),跨语言阿尔茨海默病检测准确率为77%(标准差6.5%)。自收集多模态数据集平均准确率约96%(标准差2.4%),但由于样本量小和单中心设计,其泛化性有限。
结论:本系统综述证明,通过整合互补的生物、临床和行为信息,多模态人工智能模型在阿尔茨海默病诊断、预后和风险预测方面一致优于单模态模型。与以往的综述不同,本综述提供了跨异质性临床、影像、遗传和语言数据集的统一综合,实现了建模策略和性能的跨域比较。然而,由于数据集构成、结局定义和验证的显著异质性以及普遍的偏倚风险,报告性能的泛化性受到限制。通过评估这些因素,本综述澄清了当前证据的稳健之处以及需要谨慎之处。研究结果强调了需要标准化的多模态基准、透明的评估方案和临床导向的模型设计,以实现可靠的现实世界部署。总体而言,这项工作将多模态人工智能不仅视为性能驱动工具,而且作为公平、可解释和可扩展的阿尔茨海默病诊断的转化框架,从而推动了该领域的发展。
试验注册:PROSPERO CRD420251241895
J Med Internet Res 2026;28:e85414
doi:10.2196/85414
关键词:阿尔茨海默病,神经退行性疾病;多模态数据集;机器学习;深度学习;多模态融合;计算机辅助诊断;早期诊断
引言
阿尔茨海默病是最常见的神经退行性疾病,也是全球痴呆症的主要原因。随着全球人口老龄化,阿尔茨海默病已成为21世纪最昂贵和最致命的疾病之一,给患者、家庭和医疗系统带来深重的情感、经济和护理负担。到2050年,阿尔茨海默病患者人数预计将从2020年的5500万增加到约1.39亿。阿尔茨海默病的进展包括临床前阶段、轻度认知障碍和症状阶段,症状严重程度不同。临床前阶段是干预的关键窗口,此时神经病理变化已开始,但临床症状大多不可检测。尽管在认识和筛查方面取得了进展,但全球高达75%的痴呆症病例仍未确诊,特别是在中低收入国家。这一持续的诊断差距凸显了对低成本、可扩展和准确的早期检测工具的需求,以实现及时干预并减缓疾病进展。
人工智能已成为改善阿尔茨海默病早期检测和管理的一种有前景的方法。通过系统整合和分析多模态数据,基于人工智能的诊断框架提供了强大的工具,以提高早期检测准确性并促进及时干预。最近的工作使用基于Transformer的模型整合影像、遗传和语言数据。结合磁共振成像或正电子发射断层扫描与临床特征和认知评估的多模态Transformer报告了改进的诊断准确性和可解释性。同时,GPT风格架构、BERT变体和领域自适应语言模型改进了与早期认知衰退相关的语言和语义标记的提取。自监督语音模型在从自发语音中检测轻度认知障碍和早期阿尔茨海默病方面也表现出色。这些进展共同反映了向统一、更可解释和临床可转化的多模态系统的转变,这些系统同时捕捉阿尔茨海默病的生物学和行为方面。
传统的机器学习、集成方法、深度学习和强化学习可以在单模态数据上表现良好,但临床诊断整合了结构和行为信息。因此,单模态人工智能可能与临床工作流程脱节,并遗漏互补信号,增加了模态特定过拟合和现实世界性能较差的风险。因此,最近的工作已转向多模态整合用于阿尔茨海默病诊断,然而许多研究强调增量准确性提升,而忽视了泛化性、可解释性和成本效益,这些对于采用至关重要。文献仍然分散:最近的综述通常分别涵盖多模态临床表型数据集和多模态语言认知障碍数据集,从而掩盖了跨模态的见解,例如影像和言语生物标志物如何共同改善早期检测。
最近的多模态方法已显著改善了阿尔茨海默病检测。然而,仍然缺乏一项全面的系统综述,该综述整合了临床和语言模态的证据、融合策略,并批判性地评估了方法学质量、数据集多样性和报告透明度。为解决这些空白,本综述研究了多模态模型如何应用于阿尔茨海默病诊断、预后和风险预测,并比较了2019年至2025年发表的不同模态组合和数据集家族的性能。我们还研究了建模和融合策略以及验证实践,并使用QUADAS-2评估了方法学质量和偏倚风险。此外,分析了公共数据集中的关键多模态组合与其诊断性能的关系,并对数据集进行了分类,以评估其适用于阿尔茨海默病研究和临床转化的程度。总体而言,本综述提供了多模态人工智能在阿尔茨海默病诊断中的全面综合,桥接了先前断开的研究流,并为未来模型开发和临床采用提供了实用指导。
方法
研究设计
本综述依据PRISMA 2020指南进行,检索程序遵循PRISMA-S报告,并采用Cochrane手册中概述的原则。这些方法用于系统识别和评估计算机辅助阿尔茨海默病诊断的研究,特别关注使用多模态临床表型数据集和多模态语言认知障碍数据集的研究。
研究来源和检索标准
我们制定并内部审查了独立的检索策略。我们我们手动检索了多个数据库,以识别人工智能驱动的阿尔茨海默病多模态诊断方法,而非使用集成的多数据库平台。由于本综述主要针对同行评审的计算文献中报告的方法学进展,我们未检索试验注册库(ClinicalTrials.gov、世界卫生组织国际临床试验注册平台)。我们也避免了使用经过验证或已发布的过滤器,而是通过试点筛选迭代地优化针对阿尔茨海默病或痴呆症、多模态数据和人工智能的定制受控词汇和自由文本词,以最大化灵敏度。
检索在以下数据库中进行:PubMed(447条记录;2019年1月1日至2025年11月13日)、Scopus(1086条记录;所有年份至2025年11月13日,过滤为PUBYEAR > 2018)、IEEE Xplore(2229条记录;2020年1月1日至2025年11月13日)、ACM Digital Library(2067条记录;2020年1月1日至2025年11月15日)、Cochrane Library(1061条记录;所有可用年份至2025年11月15日)和arXiv(1081条记录;所有可用年份至2025年11月15日)。我们包含了所有数据库的逐字检索字符串,并且由于arXiv不支持批量导出,我们在多媒体附录1中提供了一个arXiv检索Python脚本。
纳入标准
如果研究满足以下所有条件,则视为合格:(1)以阿尔茨海默病、轻度认知障碍或相关痴呆症为主要临床结局;(2)应用人工智能或机器学习方法进行计算机辅助诊断、分类或预测;(3)使用多模态数据,定义为至少两种不同模态的组合(例如,神经影像、临床表型、遗传学或语言特征);(4)报告了定量评估指标;(5)以英文撰写。
排除标准
如果研究满足以下任何条件,则排除:(1)仅使用单一成像模态、认知测试或生物标志物的单模态方法,没有任何多模态整合;(2)未报告性能指标或方法学细节不足的工作;(3)未涉及诊断、分类或预测的工作(例如,治疗反应、药物试验和生活方式干预);(4)重复发表或数据集重叠但没有提供额外方法学贡献的研究;(5)非英文出版物。
选择过程
研究选择过程遵循PRISMA 2020指南,并且方案已注册。最终检索更新于2025年11月进行。从数据库检索到的所有记录首先导入Zotero,在那里自动检测并删除重复项。
初步检索确定了7435条记录。去除3047条重复项后,剩余4388条记录进行标题和摘要筛选。在标题和摘要层面,有4021条记录明显不相关,252项研究因以下主要原因被排除:
- 关注与阿尔茨海默病诊断、分类或预测无关的结局(例如,药物试验、治疗反应、生活方式干预;n=140)。
- 使用单模态数据,无多模态整合(n=46)。
- 缺乏足够的方法学细节(n=47)。
最终,66项研究被纳入系统综合,且所有研究均成功检索(未检索到的报告=0)。
人工智能辅助阿尔茨海默病诊断概述
人工智能辅助阿尔茨海默病诊断的工作流程包括三个阶段,如图1所示。初始阶段涉及全面的数据采集,从多种模态收集信息,包括神经影像、生物标志物、遗传学和言语或行为信号。第二阶段涉及特征提取和模型开发,随后进行可解释性分析,以确保人工智能模型能够有效支持临床决策。
图1:阿尔茨海默病诊断人工智能流程概述。 多模态输入经过预处理和特征提取,然后进行模型训练以执行分类或回归任务。模型可解释性支持解释和性能评估。AD:阿尔茨海默病;AI:人工智能;LIME:局部可解释模型无关解释;SHAP:沙普利加性解释;XAI:可解释人工智能。
性能评估指标
为确保阿尔茨海默病计算机辅助诊断模型的临床适用性和科学严谨性,使用多种定量指标系统评估其性能至关重要。我们已在多媒体附录2中总结了所有性能评估指标。
偏倚风险和质量评估
我们使用QUADAS-2评估方法学质量,评估四个领域的偏倚风险。患者选择引起了主要关注:61%的结局由于报告不佳或非代表性抽样而被评为高风险。对于指标测试,76%为不清楚风险,因为程序和决策阈值描述不足,20%为高风险。参考标准方面,76%由于方法学细节有限而被评为不清楚风险,没有高风险评级。流程和时间的不确定性最大:85%由于缺乏测试间隔和参与者流程的信息而被评为不清楚。图2总结了领域层面的风险分布;多媒体附录3报告了研究层面的评估。
图2:QUADAS-2图在纳入的66项研究中的总结。 QUADAS-2:修订版诊断准确性研究质量评估工具。
鉴于关键领域频繁出现不清楚和高风险,我们谨慎解释诊断性能,尤其是在没有外部验证或明确定义的参考标准的情况下。未来的基准测试应强调透明报告、预设阈值和多中心评估,以减少偏倚并提高可重复性。
结果
概述
在完成研究选择后(完整选择过程总结在PRISMA 2020流程图,图3中),我们首先总结纳入文献的总体概况,以背景化后续的综合分析。图4提供了纳入研究中建模方法的时间趋势(2019-2025年),说明方法论焦点如何随时间变化,并为证据基础的解释提供信息。
图3:PRISMA流程图。 AD:阿尔茨海默病;PRISMA:系统综述和荟萃分析首选报告项目。
图4:用于阿尔茨海默病诊断的机器学习方法的时间趋势(2019-2025年)。 AD:阿尔茨海默病。
单模态
概述
如果读者已经熟悉传统机器学习和深度学习方法,可以跳过本节,直接进入下一节,该节聚焦于阿尔茨海默病诊断的多模态数据整合。这些基线方法的简要概述在多媒体附录4中提供,该附录还包含对强化学习的总结。由于大多数强化学习研究涉及顺序决策任务而非直接诊断建模,其方法学细节在多媒体附录4中呈现,以保持正文中对多模态诊断框架的关注。
深度学习
与传统机器学习相比,深度学习能够进行层次化特征提取,捕获高维数据中的复杂模式。因此,它被广泛用于处理和整合与阿尔茨海默病相关的多模态输入,包括神经影像、临床评分、遗传学和言语。关键方法和发现总结如下。
循环神经网络对于建模纵向临床记录和言语信号等序列数据有效,但容易在长序列中发生梯度消失。长短期记忆网络通过门控记忆机制解决了这一限制,实现了更稳定的训练并改善了长期依赖关系的捕获。因此,长短期记忆模型已广泛应用于阿尔茨海默病研究,用于分析时间和序列模态。
Transformer模型利用注意力机制,根据输入特征的相对重要性动态分配不同权重。Transformer的每一层由多个注意力头组成,允许模型通过关注不同方面来捕获多样化的特征表示。Transformer模型使用注意力机制对输入特征进行加权,并通过多头注意力捕获多样化的表示,从而实现高效和可扩展的训练。由于这些优势,它们已被广泛采用于阿尔茨海默病诊断和多模态学习,其编码器-解码器架构有助于有效整合异构数据源。
集成学习
集成学习通过组合多个基模型来提高泛化能力和鲁棒性,包括Bagging和Boosting方法,如AdaBoost、XGBoost和LightGBM,并已广泛应用于阿尔茨海默病检测和进展预测。然而,集成模型可能会引入冗余特征,在小数据集上提供有限的增益,并产生更高的计算成本,这可能会限制实时或资源受限的部署。
单模态总结
传统的单模态机器学习方法可以在阿尔茨海默病相关任务中实现高性能;然而,它们受到几个固有局限性的制约:
首先,关于信息完整性,仅结构MRI对功能和分子变化的敏感性有限,无法完全捕捉与阿尔茨海默病相关的认知和行为改变。将MRI与PET、神经心理学测试、言语、脑电图以及遗传或生物标志物数据相结合,可以为疾病进展和患者异质性提供更完整、多维度的视图。
其次,关于模型鲁棒性,在多模态数据中,尽管进行了去噪,一个模态中的残余噪声可能仍然存在,但其他模态可以提供互补信号来提高鲁棒性。利用多感官风格整合,多模态模型更好地反映生物认知,并可以产生更可靠的决策。
第三,在跨模态学习中,Transformer架构使用跨模态注意力来学习模态之间的关联。一些研究将其应用于弱监督或跨模态引导的设置中,使用一种模态来约束或指导另一种模态中的表示学习。
第四,在现实世界决策中,多模态学习更好地匹配了整合多种信息来源的现实世界诊断。使用多样化的模态使模型与临床工作流程对齐,并提高了在实践中的转化潜力。
因此,本综述分析了多模态模型在计算机辅助阿尔茨海默病诊断中的方法学优势和局限性,重点关注数据集分组和分类选择如何影响评估。通过对数据集进行分类,我们能够在统一设置下进行模型比较,从而更直接地评估泛化性和跨数据集稳定性。
多模态数据
多模态数据集概述
高质量数据在训练用于计算机辅助诊断和检测的人工智能模型中发挥着关键作用。稳健的数据集不仅增强模型的泛化能力,还有助于减轻过拟合风险。用于阿尔茨海默病人工智能辅助诊断的常用数据集大致可分为两类。第一类是多模态临床表型数据集,如阿尔茨海默病神经影像学倡议、英国生物样本库和开放获取影像学研究系列,专注于神经影像模态,包括MRI、功能MRI、遗传数据和电子健康记录。第二类是多模态认知-语言行为数据集,侧重于序列数据模态,包括音频、视频和转录语言数据,如Pitt语料库和阿尔茨海默病自发言语识别挑战。每种数据集类型都提供了独特的特征,有助于全面建模阿尔茨海默病的进展和诊断。常用的数据集及其人口统计信息和相关模态总结在表1中。
表1:常用数据集。(表格内容从略,包含UK Biobank、ADNI、OASIS等多个数据集的人口统计、模态和链接信息)
为了更好地理解当前的研究趋势,本文回顾了过去五年关于多模态人工智能模型用于阿尔茨海默病诊断的研究。文献按数据集类型分类。(1)多模态临床表型数据集:ADNI在该类别中占主导地位,用于约80%的研究,而其他数据集如UK Biobank、OASIS、国家阿尔茨海默病协调中心、弗雷明汉心脏研究和澳大利亚影像、生物标志物和生活方式研究占剩余的20%,主要用于补充分析或外部验证。(2)多模态认知-语言行为数据集:ADReSS系列被最广泛使用,约占研究的70%。其余30%的研究使用的数据集通常用于补充分析或基准测试。
多模态临床表型数据集
多模态临床表型数据集整合了MRI、PET或弥散张量成像、来自血液、脑脊液或基因组学的生物标志物,以及标准化的认知评估。本综述总结了代表性资源,突出了它们的模态、显著特征和对诊断建模的贡献(表2)。
表2:多模态临床表型数据集相关论文。(表格内容从略,详细列出了各项研究的数据集、模型类型、任务类型、模态、结果、验证方法、结果和局限性)
UK Biobank数据集
UK Biobank支持人群水平的关联研究和早期风险建模。它已广泛用于阿尔茨海默病诊断研究,包括以下值得注意的研究:最近的基于UK Biobank的研究应用了多样化的多模态机器学习和深度学习方法进行阿尔茨海默病风险预测和诊断,整合了神经影像、遗传、临床和生活方式数据。这些模型通常达到中等至高的性能(AUC约0.77-0.90),并显示出比传统评估方法更好的诊断效用。几项研究进一步强调了遗传和激素因素在风险分层中的重要性。此外,可解释和半监督框架增强了模型在人群水平分析中的可解释性和可扩展性,促进了临床相关的表型分析和疾病监测。
本节描述了UK Biobank中多模态模型的实施。如分析和表2所示,UK Biobank数据支持阿尔茨海默病诊断和风险预测,但局限性仍然存在:类别不平衡可能使训练产生偏差,以及需要外部验证来确认超越UK Biobank队列的泛化性。
ADNI数据集
ADNI提供了丰富多样的人口统计信息、多模态数据和临床评估。由于其全面的范围和纵向设计,它已成为阿尔茨海默病计算机辅助诊断中最广泛采用的基准数据集之一。以下研究例证了其使用:最近的基于ADNI的研究开发了广泛的多模态和深度学习框架,整合神经影像、遗传、认知和临床数据,用于阿尔茨海默病诊断和轻度认知障碍到阿尔茨海默病的进展预测。基于注意力的、多任务、集成和时间-事件模型能够准确定位疾病相关区域,改善预后建模,并通过可解释人工智能技术(如SHAP和反事实分析)增强可解释性。几种方法进一步整合了强化学习、半监督学习和数据增强,以提高在异质性和不平衡数据集中的鲁棒性和泛化性。这些模型通常达到高诊断和预后性能,一些模型表现出强大的外部验证和临床相关性。尽管如此,现有的综述和基准研究已强调了持续的局限性,包括数据集偏倚、不一致的评估协议和有限的多中心验证,强调了对标准化和可重复的多模态框架的需求。
虽然ADNI为阿尔茨海默病研究提供了全面标准化的多模态资源并支持稳健的模型性能,但仍存在一些局限性。这些包括类别不平衡、种族多样化人群的代表性不足以及有限的外部验证,这可能会使模型训练产生偏差并限制跨临床环境的泛化性。
自收集数据集
虽然公共数据集如ADNI提供了标准化的基准,但自收集数据集能够更灵活地获取目标模态。代表性研究包括以下内容:基于自收集数据集的研究探索了多样化的多模态融合策略。基于脑电图和局部场电位的模型,以及混合MRI-PET-生物标志物框架,展示了高诊断和分期准确性,并支持可解释的风险映射。同时,来自手写、眼动追踪、虚拟现实和运动捕捉的行为和数字生物标志物已实现非侵入性和低成本的筛查,具有强大的分类性能。大规模的真实世界健康记录和混合深度学习模型进一步促进了人群水平的风险预测和血管认知障碍评估,实现了AUC值超过0.90的稳健性能。总体而言,自收集数据集通过实现灵活的模态整合和新颖的生物标志物发现,扩展了多模态阿尔茨海默病研究的范围,同时仍然受到样本量有限和异质采集协议的限制。
自收集数据集具有独特优势,包括目标模态获取、新颖的生物标志物发现(如microRNA、局部场电位和手写)以及增强的现实世界临床效用。然而,自收集数据集通常样本量有限,这增加了对过拟合的易感性,并损害了跨不同人群的泛化性。
多模态语言认知障碍数据集
除了多模态临床表型数据集,多模态语言认知障碍数据集代表了同样重要的研究资源。这些数据集提供了一种非侵入性和经济高效的方法来检测认知衰退,特别是在传统神经影像或生物标志物数据可能产生不确定结果的早期或细微损伤识别中尤其有价值。捕捉自发或半结构化言语和语言模式推动了人工智能在言语数据中的发展。最近的工作如表3所示。
表3:多模态语言认知障碍数据集相关论文。(表格内容从略,详细列出了各项研究的数据集、模型类型、任务类型、模态、结果、验证方法、结果和局限性)
最近的研究表明,使用基于Transformer的架构对言语和文本进行多模态融合显著提高了阿尔茨海默病检测性能,在ADReSS和ADReSSo数据集上F1分数超过0.90。语言特征工程和可解释语言模型进一步提高了分类准确性,使用紧凑的词性特征实现了高达92.2%的准确率和0.955的F1分数。基于语言无关和迁移学习的跨语言方法实现了中等程度的泛化性,在英语-希腊语迁移设置中准确率在69%到73.9%之间。为支持现实世界部署,轻量级和层次化模型以降低的计算成本实现了约80%的准确率。此外,数据增强和集成策略提高了低资源场景下的鲁棒性,产生了5%-7%的F1分数增益和竞争力的挑战表现(准确率86.69%)。
基于所有多模态数据集的总结与定量分析
表2和表3总结了根据Cochrane手册提取的两大主要多模态数据集类型中的最新模型。完整的QUADAS-2表格可在多媒体附录5中找到。基于这些结果,以下定量综合比较了所有多模态数据集中的性能趋势。在四大主要数据集类别中,模态选择和模型性能显示出清晰的数据集依赖模式,如表4所示。UK Biobank研究主要结合MRI、临床变量和遗传特征,2项诊断研究报告平均准确率为71.4%,4项风险预测研究达到平均AUC 0.84。ADNI研究使用最全面的模态整合,3项诊断研究平均准确率为92.5%,3项轻度认知障碍转化研究平均AUC 0.922,风险预测研究平均AUC 0.81;这些任务共同实现了最强结果,融合模型经常报告AUC值超过0.95。DementiaBank研究在根本上不同,专注于言语和语言模态;9项诊断研究报告平均AUC 0.813,5项跨语言阿尔茨海默病检测研究显示平均准确率77%,其中Transformer架构一致优于经典方法,像BERT+DeiT、BERT+ViT和RoBERTa+DNN等模型显示出超过0.90的F1分数。自收集数据集通常更小且更异质;3项诊断研究报告平均准确率96%,轻量级模型如EEGNet或基于ViT的混合模型在应用于脑电图或结构MRI时表现出强大的预测能力。
表4:多模态人工智能辅助阿尔茨海默病诊断中代表性模态组合和顶级性能模型总结。(表格内容从略,总结了UK Biobank、ADNI、Dementia Bank和自收集数据集在不同任务中的计数、平均性能、最佳性能模态和相关文章)
为了解释这些结果并限制指标膨胀,请注意纯粹的内部交叉验证往往会高估性能:AUC通常比外部验证高约5-15个百分点。小的或严格控制的数据集报告的准确率比大型、异质队列高约10%-20%。严重的类别不平衡可以进一步提高准确率,同时降低F1分数或敏感性;如果不进行校正,不平衡可能会使结果膨胀约5%-12%。横截面模型通常在单我们继续翻译。从QUADAS-2的结论部分开始,提供完整的翻译,并以【全文结束】结尾。
完整翻译如下:
横截面模型通常在单时间点评估中得分更高,而纵向设计通常产生较低但更稳定的估计,这些估计对于随访和临床使用更具参考价值。
这些发现应在显著的异质性和偏倚风险的背景下进行解释。跨数据集,样本构成、任务定义和评估程序的差异限制了性能指标的直接比较。QUADAS-2还表明,在患者选择、参考标准和流程或时间方面,存在频繁的不清楚和高风险,尤其是在仅使用内部验证或选择性样本的研究中。因此,报告的指标很可能代表上限估计,而非预期的现实世界性能,并且明显的增益通常反映的是数据集特定的效应,而非可推广的模型优越性。
总体而言,证据表明,模态有效性在不同数据集间差异显著,Transformer模型在言语-语言任务中带来最高的增益,而像UK Biobank和ADNI这样的大型临床表型数据集仍然主要依赖传统的机器学习或定制融合框架,而非现代的跨模态Transformer。这一差距突显了一个机会,即为大型、异质性临床数据集开发基于Transformer的多模态整合方法。
多模态融合分类学
一个结构化的多模态融合分类法阐明了不同整合策略在数据集中的性能(表2和表3)。共有四种主要范式被常用:早期、中期、晚期和基于注意力或图神经网络的融合。
早期融合将低层特征连接起来,对于对齐的模态如MRI+PET表现良好,通常在ADNI研究中实现AUC>0.95,但对缺失数据和特征尺度异质性敏感。中期融合结合来自模态特定编码器的潜在表示,对于像MRI+言语或脑电图+临床数据这样的异质性输入有效,正如基于ADReSS的模型的高性能所证明的那样,尽管在小数据集中可能不稳定。晚期融合聚合模型输出,对缺失模态具有鲁棒性,在像UK Biobank这样的大型数据集中表现良好,但未能充分利用细粒度的跨模态交互。
跨范式,有限的模态可用性和高获取成本仍然是关键挑战,强调了自适应和临床可行的融合策略的必要性。
讨论
主要发现
本综述综合了跨不同数据集家族(包括临床表型和认知-语言数据集)的阿尔茨海默病多模态人工智能研究。多模态融合通常优于单模态基线,但这种增益依赖于数据集,应谨慎解释。在精心策划的队列和受限的言语基准中的强性能可能无法推广到基于人群或多中心的环境中。QUADAS-2还表明跨领域存在频繁的偏倚风险和不清晰的报告,这可能会夸大指标并限制可比性。因此,除非有外部验证和透明报告的支持,否则标题性的准确率和AUC应被视为上限估计。
挑战与未来方向
近年来,多模态模型在阿尔茨海默病的计算机辅助诊断和风险预测中显示出巨大的潜力。虽然这些方法已取得显著成功,但仍存在一些值得仔细审视的挑战。在本节中,本系统综述总结了现有研究中发现的常见局限性,并提出了未来研究的方向,以推动该领域的发展。
临床与转化意义
多模态人工智能可以通过几种临床途径支持阿尔茨海默病诊断。在记忆门诊,结合MRI、认知评分和血液生物标志物的模型可以对转诊患者进行分诊,优先考虑那些需要专家复查或PET的患者。在初级保健中,基于言语的模型和常规临床特征模型可以嵌入到问诊中,以标记早期认知变化。在放射科,MRI-临床融合可以作为第二阅片者,减少观察者间变异,并支持经验较少的临床医生。在影像或专家资源有限的地方,言语、数字问卷和基本临床数据可以实现基于远程医疗的筛查和随访。在人群层面,这些模型可以支持风险分层和有针对性的监测。为了实现现实世界部署,研究应优先考虑外部多中心验证、与电子健康记录的整合,以及评估监管可行性、成本效益和临床影响。
伦理与监管影响
部署多模态人工智能用于阿尔茨海默病诊断需要伦理和监管保障。由于数据集通常结合影像、临床记录、基因组学和言语,它们受到严格的隐私法规(如欧盟的通用数据保护条例、美国的健康保险流通与责任法案)的约束,需要明确的知情同意、数据最小化和安全处理,对于言语和基因组数据等敏感模态,复杂性更高。临床部署也受到医疗人工智能治理框架(如欧盟人工智能法案、美国食品药品监督管理局软件作为医疗设备指南和英国药品和健康产品管理局良好机器学习实践)的影响,这些框架强调透明度、风险管理和部署后监测。公平性至关重要,因为人口统计不平衡可能导致在不同年龄、种族和语言群体中产生不均衡的性能。可解释性(如影像注意力图和语言显著性)支持临床问责制,并与可解释性期望保持一致。未来的工作应整合隐私保护方法、偏倚审计和符合监管要求的验证流程,以实现负责任的临床整合。
数据隐私与数据共享限制
获取多模态阿尔茨海默病数据仍然受到隐私法规和伦理约束的严重限制,这限制了数据共享和外部验证。这限制了用于稳健外部验证和泛化性所需的全面数据集的共享和使用。
联邦学习提供了一种技术上可行的隐私保护解决方案;然而,数据格式和机构基础设施的差异仍然阻碍其大规模部署。例如,Meerza等人开创了联邦学习在阿尔茨海默病言语诊断中的应用,使用梅尔频率倒谱系数和停顿特征,在通过q-FedAvg/q-FedSGD优化确保隐私的同时,保持了模型性能。Nambiar在ADReSS数据集上验证了一个ALBERT+BiLSTM混合模型,在不损害数据机密性的情况下实现了强性能。同时,利用诸如ADNI、UK Biobank和OASIS等公开数据集的跨机构合作,在遵守严格隐私标准的同时,实现了更丰富的外部验证。
尽管结果令人鼓舞,但联邦学习仍然缺乏统一的协议和可互操作的平台。这限制了跨中心的重复性,并削弱了临床可信度。国际合作也仍然受到监管差异的制约。未来的工作应优先考虑采用标准化协议和隐私保护方法的统一联邦框架,以实现安全的全球数据协作。
由于大多数数据集缺乏每个参与者的完全匹配模态,多模态融合通常依赖于表示级或人群级整合,而非早期融合。早期融合需要配对样本,因此跨数据集不可行。相比之下,晚期融合和嵌入级整合可以分别训练单模态模型,并通过元学习器、跨模态Transformer或概率集成将它们组合起来。域适应、迁移学习和协调也可以将异质队列在人群水平上组合起来,以提高泛化性。一个标准化的基准可以通过定义共享的预处理、标签分类法和评估指标来进一步支持这一点,即使在没有受试者级别配对的情况下,也能实现有意义的比较或表示阶段融合。
数据不平衡
严重的类别不平衡仍然是一个主要障碍,使训练偏向于多数类,并夸大准确率,同时掩盖了对早期疾病的低敏感性。此外,像UK Biobank这样的数据集主要由欧洲白人血统主导,限制了跨种族和民族多样化人群的泛化性。解决这一问题需要技术缓解措施和积极招募代表性不足的群体,以使模型更好地反映人群异质性。
研究人员已经应用了数据层面的干预措施,如基于生成对抗网络的增强、扩散模型和重采样;算法层面的解决方案,包括代价敏感、损失聚焦、集成和类别加权训练方案;以及评估层面的补救措施,以减轻偏见。
当前方法经常引入新的挑战,如过拟合或在少数类中表现不足。此外,增加多样性的努力仍然不足。未来的方向应侧重于新颖的自适应重采样方法、用于创建合成少数类数据的生成方法,以及专门的努力来纳入和描述代表性不足的人群,以确保在不同人群中公平和稳健的临床适用性。
缺乏标准化和纵向数据
跨数据集,采集协议和诊断标准的差异限制了影像、认知和生物标志物结果的可比性。纵向证据也受到限制:即使在像ADNI这样相对标准化的资源中,有限的长期随访也阻碍了对疾病进展时间动态的建模。
未来的工作应标准化跨纵向研究的关键采集要素和诊断标准,并加强机构间的协调。在此基础上,一个涵盖影像、临床、生物标志物、行为和语言模态的多模态基准将实现跨数据集验证,提高可比性,并支持对新模型的可重复评估。这些步骤将加强时间建模,并为临床转化提供更可靠的证据。
数据集特定局限性
数据不平衡在许多阿尔茨海默病数据集中普遍存在,但这一问题的性质在不同队列间差异很大。因此,本综述概述了常用阿尔茨海默病队列和语料库的数据集特定局限性。
- ADNI: 参与者通常更健康,合并症更少,年龄范围受限(55-90岁),限制了代表性。跨中心的协议差异和不断发展的诊断标准引入了异质性,而频繁依赖子集阻碍了可比性。
- UK Biobank: 痴呆结局主要来自健康记录,导致潜在的误分类和延迟确定。参与者表现出强烈的志愿者偏倚,PET或脑脊液生物标志物仅限于一小部分,限制了多模态分析。
- OASIS: 提供开放获取的神经影像数据,但AD/MCI样本量相对较小,模态覆盖不一致。有限的纵向深度和跨扫描仪变异性进一步降低了可重复性。
- NACC: 数据来自多个中心,具有异质性的招募和诊断协议,使得协调具有挑战性。该队列是基于临床而非基于人群的代表性,且生物标志物模态缺失常见。
- AIBL: 虽然质量高,但比ADNI和NACC小,通常仅用于验证。区域招募和协议差异降低了种族多样性和跨队列可比性。
- Pitt语料库: 这是最广泛使用的言语数据集,但仍然较小且不平衡。任务受到限制,限制了生态效度,跨语言泛化性差。
- ADReSS系列: ADReSS基准提供了标准化的言语语料库,但规模适中,仅限于英语。狭窄的任务设计和小的训练分区引发了对过拟合和有限外部效度的担忧。
- 自收集队列: 本地收集的数据集通常涉及小的、单中心样本,具有异质性的采集协议。缺失模态、有限的随访和选择偏倚进一步限制了它们的泛化性。
数据集挑战加上不具代表性的队列、不完整的模态和较差的多中心一致性,限制了阿尔茨海默病诊断中模型的鲁棒性和跨数据集泛化性。未来的工作应改善数据协调和标准化,启用更实用的共享机制,并在可行的情况下采用跨队列验证。加强数据质量和可访问性对于将多模态人工智能方法转化为临床使用至关重要。
模型可解释性与可解释性
多模态机器学习模型在临床阿尔茨海默病诊断中的一个主要局限性是可解释性和透明度有限。许多高性能模型对其决策过程提供的洞察不足,这可能阻碍临床采用并降低最终用户的信心。
已经为模型可解释性做出的努力包括设计固有的透明模型。例如,一些研究展示了新兴的可解释性策略,包括生成可解释报告的混合神经符号模型,以及事后方法如SHAP、LIME、基于梯度的显著性和图掩码技术,这些技术共同增强了多模态阿尔茨海默病诊断的透明度。
当前的可解释性方法通常无法产生临床医生可以可靠使用的解释。未来的工作应优先考虑临床基础的可解释性,包括交互式可视化和简洁的、与工作流程一致的自然语言总结。将深度学习与结构化推理相结合的混合设计可以通过使决策逻辑明确来进一步提高透明度。对于部署,模型还应报告预测不确定性,并证明与临床系统和监管要求的兼容性。
除了技术进展,纳入患者和公众参与可以改善阿尔茨海默病的多模态人工智能开发。患者和护理人员可以帮助塑造评估和结果沟通,而不仅仅是作为最终用户,使解释与患者优先事项保持一致,并解决透明度和公平性问题。因此,更早地将患者和公众参与纳入模型设计,可能有助于开发更可解释和临床可用的诊断工具。
异质多视图学习问题
跨研究整合数据具有挑战性,因为单一数据集很少覆盖所有模态,迫使诸如ADNI与UK Biobank等组合。然而,队列、成像协议和认知评估框架的差异造成了显著的异质性,限制了直接合并和可比性。
这种异质性阻碍了构建能够在非重叠队列中泛化的统一模型,因此单数据集模型通常无法在域外应用。因此,需要能够容忍缺失或不一致模态的平台无关方法。提出的解决方案包括共享潜在空间学习、多分支网络和专家混合架构,以支持部分融合和跨数据集适应,但大多数仍然假设强跨域对齐,或者在域偏移下需要大量重新训练。
尽管最近取得了进展,但多模态方法通常假设严格的跨域对齐,并且在域偏移或缺失模态下需要大量重新训练。未来的工作应开发鲁棒的、平台无关的框架,能够适应变化的模态可用性和分布偏移,同时性能损失最小,并推进表示学习,以从异质数据中推导出稳定的联合嵌入。
不确定性量化与临床适用性
尽管多模态阿尔茨海默病模型已经取得进展,但大多数研究仍然省略了不确定性量化。模型通常提供确定性输出,而不传达可靠性,尽管临床医生依赖不确定性来指导管理和治疗决策。未来的工作应将不确定性度量嵌入到诊断模型中,以更好地满足临床需求,提高可解释性、可靠性和现实世界采用率。
多模态人工智能建模中的数据泄露风险
另一个局限性是数据泄露,它可能夸大性能。常见形式包括受试者级别的泄露(同一参与者的样本同时出现在训练集和测试集中)、MRI切片和补丁模型中的补丁级重叠,以及言语数据集中当多个片段来自同一个人时的转录或话语级泄露。许多研究没有报告是否实施了参与者独立的划分。因此,更清晰的划分报告和严格的参与者级别交叉验证对于确保现实世界的泛化性至关重要。
结论
本综述综合了跨临床、神经影像、遗传和语言数据的多模态人工智能方法用于阿尔茨海默病诊断的证据,系统比较了跨异质数据集的建模策略、验证实践和性能趋势。与以往模态特定的综述相比,研究结果表明多模态模型通常优于单模态方法,尽管性能随数据集特征、模态可用性和跨源对齐程度而显著变化。高准确率通常在精心策划或内部验证的队列中报告,而基于人群和外部验证的研究产生更适度但临床更现实的结果,反映了显著的异质性和偏倚风险。
尽管存在这些局限性,但证据表明多模态人工智能捕获了与阿尔茨海默病相关的互补生物学和行为信号,为诊断和风险预测提供了明确优势。基于Transformer的架构和言语或行为衍生的模态显示出可扩展和非侵入性早期检测的前景。然而,有意义的临床转化将需要协调一致的基准测试、透明的报告和严格的外部验证。总体而言,本综述通过在其方法学约束背景下对性能增益进行情境化,并概述了开发鲁棒、可解释和可泛化的多模态人工智能系统的实践方向,推动了该领域的发展。这些见解支持将人工智能负责任地整合到现实世界的痴呆筛查、风险预测和早期干预策略中。
致谢
作者声明在研究及撰写过程中使用了生成式人工智能。根据GAIDeT分类法,校对和编辑任务在完全人工监督下委托给了生成式人工智能工具。使用的生成式人工智能工具是ChatGPT-5.2。最终稿件的责任完全由作者承担。声明提交方:JMIR Publications。我们使用ChatGPT-5.2对摘要和结论部分进行了语法检查。
资金
这项工作未获得任何特定的财务或非财务支持。没有任何资助方或赞助方在综述设计、数据收集、分析或解释、本文撰写或提交发表的决定中发挥任何作用。
数据可用性
本系统综述未生成任何新的数据集。本系统综述中提取和分析的所有数据均来自纳入综述的公开可用出版物。未使用任何其他未发表或专有数据。
利益冲突
无。
多媒体附录1-6及参考文献(内容从略)
【全文结束】

