主要新研究发现AI在急诊诊断中表现优于医生——但有个陷阱A major new study found AI outperformed doctors in ER diagnosis — but there’s a catch

环球医讯 / AI与医疗健康来源:www.yahoo.com美国 - 英语2026-08-18 22:42:21 - 阅读时长7分钟 - 3125字
一项发表在《科学》杂志上的重大新研究表明,先进的人工智能程序在诊断急诊患者时通常优于人类医生,特别是在处理现实世界中的急诊病例时,AI模型在患者初次分诊时能准确诊断67%的病例,而人类医生仅为50-55%;但研究人员强调,这并不意味着应该用AI取代医生,而是应该将AI作为医生的辅助工具,并通过严格的临床试验来验证其安全性和有效性,同时警告不要过度解读研究结果,避免某些"AI医生"公司以此为理由削减人类医疗人员,导致医疗质量下降和患者安全风险增加,研究人员建议AI应在高风险情况下提供第二意见或协助处理特定紧急情况,但绝不应自主诊断和管理治疗。
AI辅助急诊诊断医生医疗安全临床试验急诊室医疗保健AI诊断局限性急诊分诊医疗决策
主要新研究发现AI在急诊诊断中表现优于医生——但有个陷阱

当我想到英雄般的医生时,我想到的是医院里那些面对症状古怪或模糊的患者,能够及时做出正确诊断的医生。这几乎是每一部医疗题材电视剧的基础,从《豪斯医生》到《匹兹堡》。正是这种神秘感使医生成为社会中最受尊敬的专业人士之一。

但如果有台机器能够同样甚至更好地做出诊断,我们在这个现实世界中该如何应对呢?

这个问题正变得越来越紧迫。根据发表在《科学》杂志上的一项重大新研究,先进的人工智能程序在诊断寻求紧急医疗护理的人群时通常优于人类医生。

人工智能无论好坏,已经成为现代医学的一部分。不同的程序被用于从整理医生笔记到识别有前景的新药研发候选者等各个方面。《科学》杂志研究的作者将他们的发现描述为强有力的证据,表明AI在急诊室中也可能很有价值——只要它在特定用途上经过临床试验的全面验证。

为了避免炒作超越科学,作者特别指出,他们担心自己的研究会被引用来证明用人软件程序取代人类医生的合理性:"我对这些结果可能被如何使用有点不安,"贝斯以色列女执事医疗中心的内科医生兼医学教育者、该研究的合著者亚当·罗德曼博士说。他们警告不要对研究结果采取如此简单的解读。

"没有人应该看到这个就认为我们不需要医生了,"罗德曼在与记者的通话中说。

同时,研究人员确实认为,AI已经达到了可以在某些情况下真正成为医生帮手的程度——尤其是在急诊室,医生经常需要处理不完善的信息。他们呼吁进行临床试验,以正确评估在这些任务中使用AI的安全性和有效性,作为人类医生的第二双虚拟眼睛,可以为医生提供判断依据,或者在他们遇到超出自身经验或专业知识的病例时提供帮助。

他们表示,只要我们认识到AI的局限性,并将其与人类医生结合使用,而不是作为替代品,AI显然可以成为医疗保健的积极力量。

"我们正在见证一项将重塑医学的真正深刻的技术变革,"哈佛医学院研究医疗决策机器学习和统计建模的阿琼·曼赖说。

AI在急诊诊断中表现优于人类医生

研究人员评估了OpenAI的o1推理模型,这是一种比ChatGPT更为专业的人工智能程序。它工作更为审慎,并强调内部逻辑。他们让该程序进行了几项实验,评估其在模拟和历史病例中的准确性,这些病例曾被用于医学培训以测试医生的批判性思维,以及来自贝斯以色列医院的真实世界急诊病例。然后,该研究将o1模型的表现与人类医生、ChatGPT以及使用ChatGPT的人类医生进行了比较。

评估培训案例使研究人员能够将o1的表现与大量人类医生测试的现有数据进行比较。在这些不同场景中,AI始终优于这些医生,并在研究的大多数病例中提供了正确的诊断或对患者管理有帮助的方案。

评估来自真实世界急诊病例的原始电子健康记录数据时,AI的准确性尤其令人印象深刻。这最接近急诊医生经常必须面对的混乱现实:他们面对的是急需快速治疗的患者,而他们所掌握的信息往往是不完整且未经筛选的,甚至可能几乎没有多少信息。在审查这些病例时,o1模型在患者初次分诊时能准确或接近准确地诊断67%的病例(相比之下,两名作为对照的人类专家医生分别为50%和55%);当患者准备入院时,这一比例上升到81%(而人类医生分别为70%和79%)。

"我们可以肯定地说……推理模型可以满足在人类表现最高水平上进行诊断推理的标准,"罗德曼告诉记者。

我咨询的两位与该研究无关的专家——加州大学旧金山分校的桑杰·巴苏博士和斯坦福大学的尼加姆·沙阿——称赞了研究的严谨性,但也指出了其局限性。所研究的现有培训案例专门用于评估医生的准确性,因此可能夸大了模型在现实世界中的表现。在一项包括"不可遗漏"诊断的案例研究实验中(当患者面临严重伤害或死亡风险时),AI模型的表现并不比ChatGPT或人类医生更好。

即使是与真实生活条件最接近的急诊室发现,也是对现有病例的回顾性审查;该模型实际上并未被要求实时诊断或管理患者。

因此,正如《科学》研究的作者所认为的,下一步不应立即将OpenAI的模型用于全国医院的急诊分诊。相反,他们呼吁进行临床试验,以在真实世界条件下评估模型的表现——包括准确性和安全性。

"医学关乎重大风险……我们有办法减轻这些风险。它们被称为临床试验,"罗德曼告诉记者。"这些结果支持的是一个稳健而雄心勃勃的研究议程。"

AI对医生可能有价值——但患者应谨慎

目前,尤其是医学领域,AI的炒作很高。在听作者讨论他们的发现时,让我印象深刻的是他们自己意识到,他们的研究可能被用作削减人类医疗人员的理由——这可能会给患者带来风险。

"有很多这些所谓的'AI医生'公司试图将医生排除在诊疗流程之外或仅提供最低限度的临床监督,"罗德曼说。"作为研究的主要作者之一,我认为这些结果并不支持这种做法。"

作者强调,根据他们的结果,他们设想急诊室中的AI模型应由真正的医生监督。做出诊断只是治疗患者的一部分;还包括制定治疗计划、监测病情发展——以及人文因素。"人类希望人类引导他们度过生死攸关的决定,"曼赖说。

巴苏和沙阿表示,基于迄今为止的集体研究,他们支持在急诊室中对AI进行明确定义的使用。当患者转交给另一位临床医生时,它可以提供第二意见,或针对特定高风险情况(如患者出现败血症感染或中风症状)提供意见,而这些情况时间至关重要。它还可以减少医生的文书工作,这在《匹兹堡》最新一季中有所体现。沙阿指出,事先授权、文档和调度是AI可以提供帮助的明显领域。

但巴苏表示,AI模型绝对不应被部署用于自主诊断和管理治疗。

个人也应谨慎使用AI进行医疗决策。其他关于AI诊断的研究发现了令人担忧的结果,特别是对于面向消费者的模型如ChatGPT。今年早些时候发表在《自然·医学》上的一篇论文评估了ChatGPT在面对从非紧急到紧急的各种情况时的表现,发现该模型在52%的病例中低估了患者病情的严重性;那些濒临糖尿病休克或呼吸衰竭的患者反而被建议进行24或48小时的监测。该模型反复未能识别出自杀意念的明确迹象。

正如沙阿对我说的,《科学》论文代表了使用AI进行诊断的"上限",而《自然·医学》论文则代表了"下限"。这两项研究表明,我们在考虑AI用于临床决策时需要多么精确:虽然更复杂的o1模型在《科学》研究中对精心挑选的病例表现出色,但由同一家公司OpenAI开发的面向消费者的ChatGPT在另一篇论文中表现不佳。

"两者都可以为真,"巴苏对我说。"两者都是。"

在与记者的通话中,曼赖描述了"绿色"(低风险)场景和"红色"(高风险)情况。在"绿色"场景中,AI即使对普通人也可能真正有帮助;而在"红色"情况下,你应该始终寻求医疗专业人士的帮助。例如,"绿色"使用场景可以是询问模型关于有助于控制高血压的饮食,或可以缓解最近背部受伤的拉伸运动。应该将其视为生活方式建议,而非严格的临床指导。

另一方面,"红色"使用场景则涉及具有生死后果的严重医疗情况:例如胸痛,这是直接去看医生或医院的原因,而不是咨询ChatGPT。

我们正越来越接近解锁这些强大程序改善医疗保健的惊人潜力,将曾经只是科幻小说的内容变为现实。但即使是这些处于前沿的研究人员也同意,我们需要谨慎行事——并将真正的专家,即医生,保留在诊疗循环中。

【全文结束】

猜你喜欢
  • 临床医生选择AI医疗影像解决方案的权威指南临床医生选择AI医疗影像解决方案的权威指南
  • 专家观点 患者不应过度信任专家观点 患者不应过度信任
  • 为什么Mount Nittany Health选择独立实施Epic系统为什么Mount Nittany Health选择独立实施Epic系统
  • 为何数百万人仍冒险使用AI医疗建议 尽管信任度持续下降为何数百万人仍冒险使用AI医疗建议 尽管信任度持续下降
  • 专家警告常见食物和补充剂可能干扰药物效果专家警告常见食物和补充剂可能干扰药物效果
  • 临床医生需要了解的阿尔茨海默病生物标志物知识临床医生需要了解的阿尔茨海默病生物标志物知识
  • 专家警告AI医疗建议可能缺失关键临床背景专家警告AI医疗建议可能缺失关键临床背景
  • 为什么人工智能尚未解决医疗保健的最大难题为什么人工智能尚未解决医疗保健的最大难题
  • 专项干预措施可帮助改善痴呆症患者的急诊护理结果,文章发现专项干预措施可帮助改善痴呆症患者的急诊护理结果,文章发现
  • 一场可能扼杀明日良药的诉讼 | 读者来稿一场可能扼杀明日良药的诉讼 | 读者来稿
热点资讯
全站热点
全站热文