人工智能支持儿童神经发育障碍诊断:一项伞状综述Frontiers | Artificial intelligence support for diagnosis of neurodevelopmental disorders during childhood: an umbrella review

环球医讯 / AI与医疗健康来源:www.frontiersin.org西班牙 - 英语2026-09-08 14:26:43 - 阅读时长26分钟 - 12540字
本伞状综述系统总结了64项系统综述和荟萃分析,评估人工智能在儿童神经发育障碍诊断中的应用效果。结果显示,人工智能模型在自闭症谱系障碍和注意缺陷多动障碍的诊断中表现出较高准确性(66%–99%),但多数研究的方法学质量较低(80%为极低质量),存在缺乏外部验证、数据标准化不足等问题。未来需加强方法学严谨性和临床验证。
人工智能儿童神经发育障碍诊断健康早期筛查自闭症多动症智力残疾学习障碍生物标志物
人工智能支持儿童神经发育障碍诊断:一项伞状综述

摘要

引言: 对神经发育障碍更早期诊断的需求日益增长,推动了人工智能作为临床决策辅助工具的批判性评估。

方法: 本伞状综述旨在综合系统综述和荟萃分析中关于使用人工智能诊断儿童神经发育障碍的证据,涵盖自闭症谱系障碍、注意缺陷多动障碍、智力残疾、沟通障碍、发育性协调障碍和特定学习障碍。在Web of Science、PsycINFO和PubMed中进行了系统检索,涵盖2015年1月至2025年8月发表的所有语言的研究。

结果: 在识别的148篇文献中,根据预定义的纳入和排除标准,共纳入64项研究。自闭症谱系障碍(n=31)和注意缺陷多动障碍(n=14)是应用人工智能进行诊断的最常见疾病。在较小程度上,也应用于特定学习障碍(n=5)和其他发育障碍(智力残疾和沟通障碍,与其他诊断共同处理,n=9)。最常用的人工智能模型是机器学习(支持向量机和人工神经网络),尤其是深度学习(如卷积神经网络)。这些模型应用于多种数据类型,如神经影像学(n=59项研究)、电生理学(n=19)、临床/社会人口学(n=15)以及运动/传感器数据(n=11)。总体而言,这些人工智能模型的诊断准确率从66%(基于头部/面部/眼动)到99%(基于神经影像、语音、运动和传感器)不等。然而,根据AMSTAR-2标准,大多数研究的方法学质量被评为极低(80%),仅5%的研究达到高质量水平(聚焦于自闭症谱系障碍和注意缺陷多动障碍)。

结论: 人工智能在支持神经发育障碍的生物标志物识别和诊断方面显示出巨大潜力。然而,未来的临床实施仍需方法学上严谨的研究,以解决当前的局限性:缺乏外部验证、数据收集和模型开发缺乏标准化,以及报告不一致。

系统综述注册: 标识符CRD420251110825。

1 引言

在临床和医疗环境中,早期诊断神经发育障碍面临着相当大的临床挑战。特别是,卫生专业人员在依据DSM-5-TR或ICD-11等参考手册进行诊断和鉴别诊断时所面临的挑战,主要分为以下四大类。一方面,专业人员面临着症状和障碍的重叠问题,例如注意缺陷多动障碍、自闭症谱系障碍、全面发育迟缓和沟通障碍可能共享临床表现,这在学龄前阶段尤为常见,可能使区分变得困难。与此相关,卫生专业人员还必须处理疾病之间的高共病性,即潜在疾病共现,使精确识别每种临床状况变得复杂。诊断神经发育状况时需考虑的另一个方面是疾病症状演变的可变性,这意味着某些症状可能随时间隐藏甚至消失和出现,因此需要定期纵向评估。最后,获取服务、父母教育水平和社会经济环境等外部因素可能对神经发育障碍的检测和调节至关重要,这可能根据这些背景因素在诊断、管理和预后方面产生不平等。因此,这些神经发育状况的诊断和鉴别诊断为卫生专业人员带来了重大挑战,受到症状异质性、症状重叠和外部因素(如社会和环境因素)的影响。

在此背景下,人工智能已成为一种有前景的工具,可以提高诊断准确性并促进临床和研究环境中的筛查。例如,谷歌最近开发了一种名为MedGemma的新人工智能模型,专门创建和训练用于理解和推理医学文本和图像,可以促进诊断、报告、诊断测试解释和医疗记录分析等方面。MedGemma以开源许可模式发布,可能有助于医疗中心和研究人员根据特定需求调整和微调这一人工智能工具。这种适应性包括处理敏感临床数据环境中的隐私等问题,这可能导致这些日益可及的工具的使用显著增加。

然而,尽管对这些新兴工具持乐观态度,但由于使用的人工智能模型多样性及其相关的有效性问题,有必要进行更新的系统分析,以回顾迄今为止积累的知识,解决该领域应用的人工智能模型的实际有用性和当前局限性。

鉴于上述情况,本伞状综述是首个全面综合系统综述和荟萃分析,关于人工智能模型在所有特定神经发育障碍诊断中的应用。为此,本伞状综述特别关注12岁以下的儿科人群。选择这一年龄范围是为了优先考虑最需要诊断支持的关键发育窗口。流行病学证据表明,神经发育障碍的发病高峰约为5-6岁,61.5%的病例在14岁之前出现。通过将范围限制在12岁,本综述涵盖了关键阶段:早期识别发育迟缓(如自闭症谱系障碍、脑瘫)在前3-4年,以及学龄期障碍(如注意缺陷多动障碍、特定学习障碍)的诊断,这些通常最常在6-9岁被识别。因此,关注这一时期在临床上是至关重要的,因为指南强调筛查和干预在神经可塑性最大化的这些阶段效果最佳。

鉴于这些诊断复杂性以及人工智能技术的快速演变,有必要进行全面的综合,以检查人工智能在所有神经发育障碍中的应用,以支持临床决策。

2 材料与方法

2.1 设计与纳入标准

本伞状综述遵循系统综述综述首选报告条目、系统综述和荟萃分析首选报告条目以及乔安娜布里格斯研究所方法学工作组的建议。根据PICO要素,本伞状综述设定了以下内容:

  • 人群:患有神经发育障碍的儿童。
  • 干预:任何用于诊断、诊断准确性、筛查、检测、风险评估和/或预测目的的人工智能模型。
  • 对照:传统方法与基于人工智能的模型。
  • 结局:任何数据类型(遗传/分子、神经影像学、电生理学、神经心理学、社会人口学、临床、行为数据等)。

我们根据以下纳入和排除标准筛选初始文献库中的研究:

2.1.1 纳入标准

  • 临床条件:任何神经发育障碍。
  • 年龄:儿童(12岁以下)。
  • 方法与技术:任何人工智能模型。
  • 文章/文献类型:系统综述和/或荟萃分析。

2.1.2 排除标准

  • 临床条件:神经发育障碍以外的神经系统疾病或精神障碍。
  • 年龄:12岁以上(青少年和成人人群)。
  • 方法与技术:非基于人工智能的模型。
  • 文章/文献类型:系统综述和/或荟萃分析以外的研究类型,如原始研究、叙述性文献、批判性综述、理论综述等。

2.2 检索策略与数据来源

首先,在PROSPERO中检查了该主题正在进行或已发表的系统综述,在53个结果中,没有研究涵盖与本伞状综述相同的目的或相同的人群。因此,本伞状综述已在PROSPERO(2025年7月24日)注册,其中记录了整个检索和筛选过程(PROSPERO ID CRD420251110825)。

在PubMed/MEDLINE、PsycINFO和Web of Science中进行了全面的文献检索。选择这一特定组合是为了确保儿科健康、行为科学和计算应用之间交叉领域的最佳覆盖,遵循系统综述中最大化召回率的方法学建议。PubMed被纳入作为核心生物医学资源,以获取儿科人群的高质量临床和观察性研究。PsycINFO用于处理行为、认知和心理健康维度,这些在纯生物医学索引中常常代表性不足。最后,检索了Web of Science以拓宽跨学科领域的范围,包括医学信息学,并利用引文追踪,这比单独使用MEDLINE显著增加了相关研究的检索。检索旨在获得同时涉及人工智能(根据多种模型)和神经发育障碍诊断/预测的研究,将以下检索字符串与MeSH受控词汇相结合:

(“人工智能”或“机器学习”或“深度学习”或“神经网络”或“AI”)和(“神经发育障碍”或“自闭症谱系障碍”或“ADHD”或“智力残疾”或“沟通障碍”或“语言障碍”或“发育性协调障碍”或“特定学习障碍”)和(“诊断”或“预测”或“预测建模”或“早期检测”或“诊断准确性”或“风险评估”或“筛查”)。

2.2.1 检索策略中应用的过滤器

  • 文章/文献类型,根据每个数据库的可能性:Web of Science(综述文章);PubMed(荟萃分析和系统综述);PsycINFO(0个结果后不适用)。
  • 出版日期/年份:近10年,2015年至2025年。
  • 无语言限制。

最后一次检索于2025年8月进行。然后去除重复项,筛选标题和摘要,随后进行全文审查。筛选和选择过程使用Covidence在线应用程序由两位独立评审员进行,差异通过共识解决。

2.3 数据提取与综合

在最终选定研究后,两位作者独立进行数据提取,主要数据提取由一位作者负责,随后由另一位作者完成、修订和验证,直至达成共识。虽然Covidence工具允许这样做,但鉴于该平台灵活性的限制,我们选择将数据记录在外部电子表格中,用于其余分析。

对于每项纳入的研究,收集了出版国家、所涉及的疾病、应用的人工智能模型类型和数据来源、诊断效能指标、强调的局限性以及每项研究的主要结论等信息。

2.3.1 处理重叠的原始研究

鉴于伞状综述综合了可能包含重叠原始研究的系统综述,我们采用了以下方法以尽量减少任何偏倚。首先,我们通过识别在多项纳入综述中引用的原始研究来记录重叠程度。其次,在综合定量结果时,我们优先选择样本量最大、出版日期最近的荟萃分析,以减少冗余。第三,对于定性综合,我们关注各综述之间趋同的结论,而不是汇总单个效应量,从而最大限度地减少重复计数研究的影响。

2.4 方法学质量与偏倚风险评估

本伞状综述纳入的研究对其方法学质量进行了批判性评估。由两位作者独立进行双重评估,任何差异通过共识解决。使用“评估系统综述的方法学工具”第二版进行批判性评估。该更新版本包含16个项目,其中7个是关键项目(项目2、4、7、9、11、13和15)。要达到“高”质量评级,研究必须没有关键缺陷且少于两个非关键弱点;“中等”质量要求无关键弱点;“低”质量仅有一个关键弱点;“极低”质量意味着超过一个关键弱点。

对于本伞状综述,AMSTAR-2调整如下:项目(1)关于PICO要素,字母I将指诊断/预测工具而非干预措施;项目(3),非关键,未考虑,因为它涉及不同的研究设计(随机和/或非随机试验),在本伞状综述中不适用;项目(7)编码为“是”,如果排除研究的原因在文本或PRISMA流程图中得到澄清。

3 结果

3.1 研究选择

选择过程的流程详见PRISMA流程图。共识别出148项研究,其中64项系统综述和/或荟萃分析在应用纳入和排除标准后纳入。16项研究因以下原因被排除:一项研究未涉及诊断方法或工具,十三项研究采用了错误的研究设计(非系统综述或荟萃分析),两项研究包含了不合适的患者人群。虽然大多数文章以英文发表,但有两篇文章以西班牙语发表,另一篇以中文发表。当纳入的研究中也存在神经发育障碍以外的临床状况时,本研究未对其进行审查。

3.2 数据提取与结果总结

3.2.1 出版时间演变

如图2所示,自2017年以来,关于人工智能在神经发育障碍诊断中应用的系统综述和荟萃分析数量显著增加。从2021年开始,发表的研究数量显著增加,直至2024年达到峰值。

3.2.2 出版地理分布

如图3所示,大多数纳入的研究来自美国、中国、英国、印度和韩国等国家,表明研究集中在技术资源更丰富、人工智能发展更先进的地区。然而,这也显示了其他欧洲国家、拉丁美洲和其他地区的参与日益增加,尽管比例较小,反映出兴趣不仅增长,而且日益全球化。

3.2.3 研究中涉及的神经发育障碍

尽管神经发育障碍种类繁多,但在详细检查纳入的研究后,53%的64篇系统综述和/或荟萃分析聚焦于自闭症谱系障碍(n=31),其次是注意缺陷多动障碍(24%,n=14)。接下来是各种神经发育障碍(15%,n=9)。8%的研究涉及特定学习障碍(n=5)。因此,我们可以看到,虽然存在主要研究的障碍(自闭症谱系障碍和注意缺陷多动障碍),但所研究的障碍也存在很大差异。

3.2.4 人工智能模型与使用的数据类型

已使用各种人工智能模型来解释不同类型的数据,以改善诊断。因此,分析这种使用方式对于更好地理解人工智能在分析研究中的功能和效果至关重要,其中揭示了一致的模式。

传统的机器学习模型,如SVM、随机森林、k-NN和决策树,主要应用于神经影像数据,尽管它们在脑电图/脑磁图分析、语音数据、传感器捕获的运动数据以及较小程度上的临床、社会人口学和面部信息中也有相关应用。

深度学习模型,特别是卷积和循环神经网络,在神经影像处理、脑电图信号以及语音和运动分析中显示出明显的扩展,从而能够解决复杂和多维问题。

然而,最近先进架构如Transformer和图神经网络的兴起在处理神经影像和文本数据方面尤为显著,尽管它们仍不如传统模型常见。此外,混合和数据融合方法已成为结合多种信息源的有前景的替代方案,表明朝着更集成和稳健模型的发展趋势。

这些结果反映了模型复杂性与所用数据复杂性和多模态性之间的明确关联,强调了需要朝着允许在临床环境中更大程度整合和可解释性的方法论迈进。这一模式表明,神经发育中的人工智能创新不仅仅是数量上的,而是对当前生物标志物多维性质的必要回应。

3.2.5 诊断效能综合

本伞状综述也检查了哪些人工智能模型在神经发育障碍诊断中最有效。

在自闭症谱系障碍的情况下,31项近期研究已证实使用多种人工智能模型具有高诊断效能。然而,如果参考特定模型,我们可以看到这种效能特别高,特别是在机器学习模型(SVM、随机森林和k-NN)、深度学习(CNN和自编码器)以及较小程度上的Transformer型模型中。在神经影像和电生理学分析中,准确性通常超过90%,而在不同领域的多模态数据(面部表情、注视追踪、眼动追踪和头部姿态估计)中,准确性水平较低(66%)。然而,方法学异质性和缺乏标准化限制了这些发现在临床上的推广。

对于注意缺陷多动障碍,纳入了14项研究,定量分析中平均效能范围从80%到92%,在定性综述中则稍低或仅为“有前景”。传统模型显示出最高的有效性,而深度学习模型则次之,没有Transformer型模型有效性的证据。最常用的模型包括SVM、决策树、随机森林以及非传统方法,如模糊逻辑或进化算法,主要应用于神经影像、脑电图以及临床或行为数据。然而,样本和方法学程序的变异性使比较和临床适用性变得困难。

对于特定学习障碍,尽管研究数量较少(n=5),但结果一致。特别是,报告了中度效能,基于SVM、k-NN、ANN和深度学习的模型准确性水平在70%到88%之间,尽管临床验证仍处于早期阶段。

3.2.6 纳入研究中识别的人工智能模型局限性

无论结果如何,反思纳入研究中遇到的局限性对于分析将数据外推和推广到其他环境的便利性非常重要。对纳入的系统综述和荟萃分析的批判性分析指出了几个反复出现的局限性,这些局限性阻碍了人工智能模型在神经发育障碍诊断中的临床转化和稳健性。缺乏外部验证是最常被识别的障碍,在32篇文章中被指出,其次是数据收集、模型开发和报告实践标准化的需要(31篇文章)。小样本量、低人群多样性(26项研究)以及方法和指标的异质性(21项研究)也被广泛识别,反映了在普遍性和研究间可比性方面的持续挑战。

此外,23%的研究强调了模型偏倚和过拟合的风险,这通常与不足的验证方案和对单中心数据集的依赖有关。此外,12项研究讨论了伦理和监管问题,强调了透明度、可解释性和监管监督在未来发展中的重要性。

总体而言,这些结果表明,尽管技术进步且人工智能模型的诊断性能看似有前景,但该领域仍面临方法学异质性、缺乏大型多样化数据库、缺乏外部和前瞻性验证以及伦理和监管问题等方面的挑战。

3.2.7 纳入研究的方法学质量或偏倚风险评估

使用AMSTAR-2工具对纳入的研究进行批判性评估后,根据该工具的标准化标准,大多数被评为极低(80%)或低(14%)。值得注意的是,AMSTAR-2评级反映了对特定方法学报告标准的遵守情况,而不是对特定研究科学价值的总体判断。从这个意义上说,“极低”评级表明在方案注册、全面检索策略或偏倚风险评估等领域存在一个以上关键缺陷——这在快速发展的领域如人工智能诊断中常见,因为报告标准尚在建立中。相比之下,仅1%达到中等水平,5%获得高质量水平。所有方法学质量较好的研究都分析了注意缺陷多动障碍和/或自闭症谱系障碍,这些研究既在单独研究中专门检查了这些情况,也与其他神经发育和精神障碍一起进行了联合检查。

关键领域的详细分析揭示了系统性的透明度和严谨性缺陷。最普遍的缺陷是缺乏预先注册的方案(项目2),81.3%的综述未能在实施前建立明确的方法,这显著增加了选择性报告风险。此外,研究选择方面的透明度显著受损:73.4%的综述未提供排除研究的清单及理由(项目7),这是可重复性的关键要求。

关于证据评估,65.6%的作者未能使用令人满意的技术评估单个研究中的偏倚风险(项目9),因此,82.8%的作者在解释或讨论其结果时未考虑这一风险(项目13)。虽然检索策略(项目4)表现稍好,但仅7.8%是全面的,大多数(54.7%)因遗漏灰色文献或试验注册而被评为“部分”。最后,由于大多数纳入综述的定性性质,统计组合和发表偏倚影响项目(11和15)在很大程度上不适用。这一质量评估表明,人工智能对神经发育障碍的影响目前受到程序严谨性的限制。方案注册(81.3%)和缺乏透明度(73.4%)的普遍缺陷表明,该领域必须优先考虑方法学稳健性,而不仅仅是提高算法准确性。

4 讨论

本伞状综述首次综合了人工智能在儿童神经发育障碍诊断中应用的当前最新技术,评估了进展、挑战、局限性和在实际临床环境中整合的潜力。在本伞状综述中,我们检查了64项系统综述和荟萃分析,以获得对迄今为止证据体系的全面准确概述。

研究结果揭示了基于人工智能模型的开发和应用取得了显著进展,特别是在自闭症谱系障碍和注意缺陷多动障碍的诊断方面。在这方面,机器学习算法、深度学习技术和多模态数据融合(整合来自不同来源的信息,如神经影像、音频记录、行为指标和临床问卷)的结合已被证明能够达到高水平的诊断准确性。然而,如Iyortsuun等人和Ding等人所指出的,相当大的方法学异质性、研究设计的变异性以及缺乏广泛的临床验证构成了阻碍这些进展立即转化为临床实践的主要障碍。此外,本伞状综述中检查的大多数系统综述和荟萃分析显示出极低的方法学质量,尽管最严谨的研究集中在自闭症谱系障碍和注意缺陷多动障碍,但仍需进一步研究以就该神经发育状况做出科学和临床相关决策。

尽管监督学习模型,如支持向量机和卷积神经网络,在神经影像和脑电图信号分析中占主导地位,但评估架构选择和超参数优化至关重要,而这在综述文献中常常被忽视。无监督学习范式,如聚类或主成分分析的应用,已成为识别神经发育障碍症状异质性内生物类型的必要替代方案。然而,这些模型的计算效率仍然是一个未被充分报道的挑战,影响其在实时临床环境中的可行性。

此外,人工智能辅助诊断面临着高维数据固有的非线性挑战,例如通过功能磁共振成像或运动传感器获得的数据。为了应对这些复杂性,必须整合能够克服传统方法局限性的最新方法。在这方面,傅里叶注意力机制,特别是频率-通道注意力因子分解和小波注意力模型的整合,为捕捉神经生理生物标志物数据中的复杂时空依赖性提供了巨大潜力。这些先进架构允许对信号特征进行更稳健的分解,增强模型对抗噪声和生物变异性的能力。

针对这些局限性,该领域正朝着使用生成式人工智能的方向快速发展。大型语言模型,如MedGemma,已展现出推理复杂医学文本和临床记录的能力日益增强。同时,生成对抗网络已成为通过合成样本增强来缓解数据稀缺的重要工具。在此背景下,最近Wang等人提出的F-GAN-NTD模型的有效性尤为突出。该模型将生成网络与非负张量分解理论相结合,以从复杂数据中提取非线性特征,显示出在分类和恢复不完整数据方面相比传统方法的显著改进。近期研究表明,这些技术不仅支持诊断,还能更深入地理解潜在的病理生理机制。

同时,必须认识到当前在寻找具有足够敏感性和特异性的生物标志物以支持不同神经发育障碍诊断方面的局限性,正如Srivastava等人、Hanly等人和Cortese等人所指出的。从这个意义上说,科学共识表明,迄今为止,尚无生物标志物可以替代临床医生(临床心理学家或精神科医生)的专业评估,这仍然是确认诊断和确保未来临床决策有效性的关键。这个问题在自闭症谱系障碍病例中尤为突出,神经影像学——人工智能诊断研究中经常分析的数据来源之一——虽然提供了有前景的进展,但仍然存在明显局限性。具体来说,近期文献,如Schielen等人的综述,强调包括样本异质性、模型有限泛化性以及基于神经影像学方法的中等准确性在内的因素,使得该技术无法可靠地单独替代专业临床判断。因此,基于人工智能的工具的整合应被视为对跨学科临床评估的有价值补充,而非替代。

关于本伞状综述中人工智能显示出更高诊断效能的另一种障碍——注意缺陷多动障碍,已观察到当它与其他神经发育障碍共存时,其诊断呈现出特殊挑战。在这方面,Gionet等人强调了当注意缺陷多动障碍与癫痫共病时诊断的具体困难。同样,观察性研究,如Perera等人的研究,强调在智力残疾共病病例中额外的诊断挑战。这些发现表明需要确定人工智能模型在多大程度上有助于克服这些复杂的诊断障碍,从而提高共病识别的准确性和速度。

如前所述,通常使神经发育障碍诊断复杂化的主要挑战包括:(1)不同临床状况症状的重叠;(2)模糊诊断边界的高共病性;以及(3)症状进展和对干预反应中的异质性。在这个意义上,人工智能模型已显示出巨大潜力,可以部分解决这些局限性,例如通过能够识别异质数据集中的复杂模式或将临床、神经认知和行为变量整合到单个预测模型中的算法。然而,假设这类人工智能技术将为应对这些挑战提供最终解决方案,将有可能陷入乐观偏差。因此,有必要在大型、多样化和代表性人群中评估人工智能模型的稳健性,并解决关于透明度、可解释性以及其负责任实施不可或缺的伦理考量的问题。有趣的是,人工智能模型在从维度(而非单纯的分类)角度研究神经发育障碍时可能非常有效和高效,通过全面整合多模态数据。

总体而言,这些结果提供了“效能悖论”的证据,即人工智能模型的技术卓越性与它们在现实世界中的影响缺乏之间存在差距,鉴于其对临床实践和未来研究方向的影响,值得进一步审查。一方面,从临床角度来看,人工智能模型中的这种悖论表明,临床医生应谨慎解释人工智能辅助诊断输出,认识到研究中报告的高准确性可能无法直接转化为其患者人群,特别是那些具有非典型表现、共病性或来自代表性不足人群的患者。因此,人工智能工具应定位为需要临床医生监督的决策支持系统,而非自主诊断仪器。另一方面,从研究角度来看,这种悖论凸显了迫切需要将评估范式从内部准确性指标转向外部有效性指标,包括跨多个地点的性能、随时间变化的稳定性以及跨人口亚组的一致性。未来的研究应优先报告不仅敏感性和特异性,还有校准指标、亚组分析和失败模式特征。解决这一悖论对于建立临床医生信任和实现人工智能模型在神经发育评估工作流程中有意义的整合至关重要。

因此,本伞状综述的发现表明,在临床诊断过程中,人工智能应被理解为辅助工具而非替代工具。其在临床环境中的真正采纳将取决于克服已识别的方法学挑战、实施标准化协议、确保模型的外部有效性以及促进不仅解决数据保护问题还解决算法决策可解释性的监管框架。只有通过这种基于经验证据和清晰战略愿景的平衡方法,才可能将人工智能有效整合到现实临床实践中的神经发育障碍诊断中。

4.1 局限性

尽管我们讨论了纳入研究中发现的局限性,但强调本伞状综述的主要局限性也是相关的,因为尽管努力系统化分析,并且部分原因在于此,以下几点应考虑:

  • 由于排除了非索引文献,可能存在偏倚,因为本伞状综述仅纳入了索引在文献数据库中的系统综述和荟萃分析。因此,可能近期的、相关的非索引研究未被检查。然而,本伞状综述未施加语言限制以最小化发表偏倚,并纳入了三篇非英语(中文和西班牙语)的研究,但排除非索引文献可能过滤掉了其他相关的区域研究。
  • 纳入的系统综述和荟萃分析在人群、人工智能模型和不同结局方面的异质性,使结果的综合和解释变得复杂。
  • 跨系统综述的重叠原始研究导致数据重复计数和汇总估计的潜在偏倚。因此,处理重叠的方法通常报告不完整或应用不一致。我们承认,在伞状综述中完全消除重叠是不可行的;然而,本伞状综述遵循的方法与既定的方法学指南一致,并确保了这种局限性的透明报告。
  • 方法学质量评估:使用标准化工具来衡量研究的方法学质量,由于缺乏适当金标准,可能过度报告质量缺陷。在这个意义上,例如,在本伞状综述中,仅12项研究(18.8%)包含关于系统综述/荟萃分析先前方案的明确声明,并且由于项目2是关键,相应研究的质量至少被认为“低”,尽管其余项目令人满意。然而,这些发现应理解为,AMSTAR-2最初是为干预性综述设计的,可能施加强制性标准,这些标准在诊断准确性研究中难以达到,特别是在新兴技术领域。尽管如此,方法学差距的普遍存在强调了随着该领域进一步发展,需要改进报告实践。
  • 关于性能指标和模型稳健性的解释:尽管已报道某些模态的准确性高达99%,但应谨慎解释这些结果。特别是,23%的纳入研究明确警告了过拟合和数据集偏倚的风险。此外,我们的分析揭示了当前文献中普遍缺乏模型稳健性评估。大多数研究专注于内部性能,而未验证跨不同人群或外部中心的稳定性。因此,我们强烈建议未来研究将模型稳健性作为强制性评估维度,以区分真正的临床效用和在有限数据集中的模式记忆。

5 结论

本伞状综述证实了人们对人工智能如何支持和促进神经发育障碍生物标志物识别及诊断的兴趣日益增长。

特别是,使用人工智能模型促进和加速神经发育障碍诊断方面具有相当大的潜力,对自闭症谱系障碍的结果尤其有希望,这是迄今为止研究诊断可能性最多的神经发育障碍。此外,该障碍在使用多种人工智能模型(如机器学习、深度学习和Transformer)方面全球效能最高。

然而,我们不应忽视,将人工智能模型有效应用于临床活动需要克服当前科学文献中持续存在的方法学、伦理和监管挑战,这对于从概念验证研究推进到真正的临床实用性至关重要。

为了实现临床转化,人工智能模型必须通过结构化的转化路径,从概念验证演示发展到标准化实施协议,具体如下:

5.1 多中心前瞻性验证

未来的研究应优先考虑在具有地理和人口统计学多样性的地点进行外部验证,采用反映真实世界临床工作流程的前瞻性设计,而非回顾性方便样本。Collins等人指出,为了改善这种外部验证,必须在“代表模型实施目标人群的数据集”上进行,认识到医疗保健提供、患者人口统计学和当地实践的差异自然会跨环境影响模型性能。重要的是,使用“仅是方便获得的”现有数据提供了关于真实预测准确性的有限且常常误导的信息。

5.2 开放和标准化的数据集

建立可公开访问、精心策划的神经发育障碍基准数据集——类似于其他医学影像领域的倡议——将能够直接比较人工智能模型并加速方法学进展。当前文献强调,使用私有数据集阻碍了可重复性研究并使模型比较困难,推荐标准化协议和通用数据存储库。来自该领域的成功例子证明了这种方法的可行性:ABIDE联盟提供了多中心功能磁共振成像数据,已成为自闭症谱系障碍中大多数机器学习研究的基石,而协调的神经影像队列已使全生命周期规范脑结构曲线的生成成为可能。数据的效用将取决于其完整性和稳健性,以及在所有样本中使用相似指标。可重复性框架如NeuroMark进一步展示了标准化功能和结构模板如何能够跨疾病和数据集进行有效比较。

5.3 标准化报告指南

开发和采用针对神经发育障碍诊断研究的AI特定报告标准,建立在现有框架如STARD-AI和TRIPOD-AI的基础上,将改进透明度并促进荟萃分析综合。

5.4 监管认证

与监管机构接触,以建立人工智能诊断工具批准的清晰路径,包括部署后持续性能监控的要求。

5.5 临床医生-AI协作框架

设计人在回路系统,其中人工智能输出作为决策支持,并配备可解释性功能,使临床医生能够理解和验证算法推荐。正如DECIDE-AI指导小组所强调的,基于人工智能的临床系统应专注于其“增强而非替代人类智能的潜力”,认识到临床医生仍然对其决策负责,不能期望他们在不理解其基础的情况下遵循所有算法推荐。

总之,这一不断发展的技术可以帮助临床医生提高神经发育障碍诊断过程的准确性和效率,对这些障碍的早期检测对于优化临床预后和有效改善患者生活质量至关重要。

声明

数据可用性声明

本研究中呈现的原始贡献包含在文章/补充材料中。进一步查询可直接联系通讯作者。

作者贡献

AA-G:调查,可视化,数据管理,概念化,方法论,写作-初稿,软件,形式分析,资源,写作-审阅与编辑。EF-J:调查,资金获取,验证,写作-初稿,写作-审阅与编辑,方法论,监督,形式分析,概念化,软件。

资金

作者声明未收到此项工作及/或其出版的财务支持。

利益冲突

作者声明此项工作是在没有任何可能被解释为潜在利益冲突的商业或财务关系的情况下进行的。

作者EF-J声明在提交时是Frontiers编辑委员会成员。这对同行评审过程和最终决定没有影响。

生成式人工智能声明

作者声明在创建本稿件时未使用生成式人工智能。

本文中附带的任何替代文本均由Frontiers在人工智能的支持下生成,并已尽合理努力确保准确性,包括在可能的情况下由作者进行审查。如果您发现任何问题,请与我们联系。

出版商注

本文中所有陈述仅代表作者本人,不一定代表其附属组织、出版商、编辑和审稿人的观点。本文中可能被评估的任何产品或制造商可能提出的任何声明,均未得到出版商的保证或认可。

补充材料

本文的补充材料可在以下网址找到:

关键词

人工智能,儿童期,诊断,神经发育障碍,伞状综述

引用

Alberca-González A and Fernández-Jiménez E (2026) 人工智能支持儿童神经发育障碍诊断:一项伞状综述。Front. Psychiatry 17:1697185. doi: 10.3389/fpsyt.2026.1697185

收到日期 2025年9月1日

修订日期 2026年2月3日

接受日期 2026年2月19日

出版日期 2026年3月18日

卷号 17 - 2026

编辑 Fernando Moreira,葡萄牙波尔图大学

审稿人 Fengqin Wang,中国湖北师范大学;Syed Taimoor Hussain Shah,意大利都灵理工大学

版权 © 2026 Alberca-González和Fernández-Jiménez。

这是一篇开放获取文章,根据知识共享署名许可协议的条款分发。允许在其他论坛使用、分发或复制,前提是注明原作者和版权所有者,并引用本期刊的原始出版物,符合公认的学术规范。不允许不符合这些条款的任何使用、分发或复制。

通讯 Eduardo Fernández-Jiménez, eduardo.fernandez@universidadeuropea.es

免责声明 本文中所有陈述仅代表作者本人,不一定代表其附属组织、出版商、编辑和审稿人的观点。本文中可能被评估的任何产品或制造商可能提出的任何声明,均未得到出版商的保证或认可。

【全文结束】

猜你喜欢
  • 咖啡可能塑造肠道细菌并影响情绪和压力咖啡可能塑造肠道细菌并影响情绪和压力
  • 临床医生应了解的阿尔茨海默病治疗知识——与马克·阿格罗宁医学博士对话临床医生应了解的阿尔茨海默病治疗知识——与马克·阿格罗宁医学博士对话
  • 科学家以前所未有的细节绘制衰老大脑图谱,揭示阿尔茨海默病等线索科学家以前所未有的细节绘制衰老大脑图谱,揭示阿尔茨海默病等线索
  • 全谷物黑麦改变肠道细菌并降低肥胖试验中的炎症全谷物黑麦改变肠道细菌并降低肥胖试验中的炎症
  • AI能治愈疾病但仍构成威胁:山姆·奥特曼承诺投入10亿美元推动问题解决AI能治愈疾病但仍构成威胁:山姆·奥特曼承诺投入10亿美元推动问题解决
  • 基督医院开发的人工智能帮助医生检测心脏病发作基督医院开发的人工智能帮助医生检测心脏病发作
  • AI工具追踪面部衰老,帮助医生评估癌症风险AI工具追踪面部衰老,帮助医生评估癌症风险
  • 一项简单的血液检测可能早期发现阿尔茨海默病一项简单的血液检测可能早期发现阿尔茨海默病
  • Lunchbox因健康问题获得改变人生的惊喜Lunchbox因健康问题获得改变人生的惊喜
  • 新疗法针对有缺陷的遗传性心脏信号新疗法针对有缺陷的遗传性心脏信号
热点资讯
全站热点
全站热文