人工智能(AI)正日益被探索作为支持临床决策的工具,但其在儿科诊断中的实际表现仍不明确。如今,《儿科研究》(Pediatric Investigation)杂志发表的一项使用真实临床案例的研究报告显示,先进的AI模型在诊断准确性方面表现优于临床医生,特别是在罕见病诊断上,而人机结合的方法则取得了最高的总体成功率。这些发现突显了AI作为提高诊断精度和改善患者预后的补充工具的潜力。
儿科护理中的准确诊断可能特别具有挑战性,尤其是当罕见病表现为细微或重叠症状时。诊断的早期不确定性可能会延误治疗并增加并发症风险。尽管人工智能(AI)在医疗保健领域已显示出潜力,但大多数先前研究依赖于简化或精心挑选的案例,而非真实世界临床数据。这导致我们对大型语言模型在日常临床环境中的表现理解存在重要空白,在这些环境中,决策往往基于有限的信息做出。
在此背景下,由西班牙巴塞罗那圣胡安德迪奥斯医院(Hospital Sant Joan de Déu)的克里斯蒂安·劳内斯(Cristian Launes)博士领导的研究团队,使用真实的儿科临床案例评估了AI模型的性能。该研究于2026年3月25日发表在《儿科研究》(Pediatric Investigation)杂志上,比较了四种高级语言模型与78名儿科医生在50个病例中的表现,这些病例包括常见疾病和罕见病。
劳内斯博士是巴塞罗那圣胡安德迪奥斯医院的临床教授和儿科医生,专长于儿科传染病,特别是呼吸道病毒。他的专业知识包括呼吸道病毒感染、儿科流行病学和传染病研究。
为了反映真实的临床实践,研究人员使用基于前72小时就诊情况的患者摘要。每个病例被多次评估,以检查诊断准确性和一致性。性能评估基于正确诊断是否出现在最高预测或前五项建议中。
结果显示,最先进的AI模型在总体诊断准确性方面超过了临床医生。这一优势在罕见病病例中尤为明显,AI系统更有可能识别出临床医生最初错过的正确诊断。然而,临床医生在某些复杂或依赖情境的场景中表现出优势,突显了人类和AI在诊断推理方法上的差异。
重要的是,该研究并未评估实时的、交互式的"人机结合"诊断工作流程。相反,研究人员使用预先指定的"联合"方法估计了潜在的互补性,询问正确诊断是否出现在临床医生或模型运行的前五项列表中。根据这一估计,表现最佳的组合达到了94.3%的前五项联合准确率,这表明临床医生和AI可能在困难病例中,特别是在罕见病中,提供不同的正确假设。"我们的结果表明,AI可以作为临床医生监督下的第二意见进行评估,特别是在涉及罕见病的困难病例中,"劳内斯博士说。"与其取代临床医生,这些工具可能有助于拓宽鉴别诊断范围,降低漏诊可能性——前提是输出结果在强有力的监督框架内得到批判性解释。"
从治理角度看,医疗诊断决策支持系统在欧盟AI法案下通常被视为高风险应用。这一分类意味着对风险管理、数据治理、透明度、人工监督和网络安全的期望。作者强调,任何临床使用都应保持为辅助性质,具有明确的责任、监控和保障措施,以解决变异性及误导性输出的风险。
研究人员还观察到,额外的临床信息提高了两组的诊断性能。当包含更多详细数据(如实验室或影像结果)时,准确性提高。这一发现强调了持续临床评估的重要性,并表明AI系统在整合到不断发展的信息丰富的工作流程中时可能最为有效。
"数据质量与诊断性能之间的互动至关重要。AI系统在作为连续临床过程的一部分时表现最佳,其中临床医生迭代地收集、验证和整理不断发展的临床情况以输入模型,并进行持续重新评估和人工监督——而不是一次性输入输出工具。"
巴塞罗那圣胡安德迪奥斯医院的克里斯蒂安·劳内斯博士
这些发现突显了AI辅助工具支持更早、更准确诊断的潜力,特别是对于专业知识可能有限的罕见病。从长远来看,将AI整合到临床工作流程中可以实现更协作和数据驱动的决策,同时鼓励临床医生、工程师和政策制定者之间更紧密的合作。
总体而言,这项研究表明,先进的AI模型可以在某些儿科诊断任务中优于临床医生,特别是对于罕见病症,而在与人类专业知识结合使用时取得最大效益。尽管响应变异性及适当监督需求等挑战依然存在,但这些发现指向AI在儿科医疗保健中作为支持工具的光明前景。
【全文结束】

