新研究发现AI在急诊诊断上表现优于人类医生——但有个前提A new study found AI’s medical diagnoses were better than human doctors — but there’s a catch | Vox

环球医讯 / AI与医疗健康来源:www.vox.com美国 - 英语2026-08-21 04:01:06 - 阅读时长7分钟 - 3149字
一项发表在《科学》杂志上的重大研究表明,OpenAI的o1推理模型在急诊诊断方面表现优于人类医生,在真实急诊案例中准确率达67%-81%。然而,研究作者明确警告不要用人机替代医生,并强调AI应作为医生的辅助工具而非替代品。研究呼吁进行严格临床试验评估AI在真实医疗环境中的安全性,同时指出面向消费者的AI模型在医疗诊断中存在严重缺陷,可能低估52%病例的严重性,对患者安全构成潜在风险。
AI急诊诊断医生急诊室急诊分诊临床试验医疗安全AI医疗辅助医疗保健患者健康诊断准确性医疗决策
新研究发现AI在急诊诊断上表现优于人类医生——但有个前提

当我想到英雄般的医生时,我脑海中浮现的是医院里那位面对症状怪异或模糊的患者,却能及时做出正确诊断的医生。这几乎是每一部医疗题材电视剧的基础,从《豪斯医生》到《匹兹堡》,莫不如此。正是这种神秘感让医生成为了社会中最受尊敬的专业人士之一。

但如果一台机器能够同样出色,甚至更好地做出这种诊断呢?在现实世界中,我们该如何应对这种情况?

这个问题正变得越来越紧迫。根据《科学》杂志发表的一项重大新研究,当诊断寻求紧急医疗护理的患者时,先进的人工智能程序往往表现优于人类医生。

人工智能已经(无论好坏)成为现代医学的一部分。不同的程序被用于从整理医生笔记到识别有前景的新药物候选者等各种任务。《科学》杂志研究的作者将他们的发现描述为强有力的证据,表明人工智能在急诊室也可能很有价值——前提是它在特定用途的临床试验中得到充分验证。

为了避免炒作超过科学事实,作者特别指出,他们担心自己的研究会被引用以证明用软件程序替代人类医生的合理性:"我对这些结果可能被如何使用感到有些不安,"贝斯以色列女执事医疗中心的内科医生兼医学教育家、该研究的合著者亚当·罗德曼博士说。他们警告不要对他们的发现采取如此简单的看法。

"没有人应该看到这一点就说我们不需要医生,"罗德曼在与记者的电话会议中说。

同时,研究人员确实认为,人工智能已经达到了可以在某些情况下成为医生真正助手的阶段——尤其是在急诊室,医生经常需要在信息不完善的情况下做出判断。他们呼吁进行临床试验,以适当评估在这些任务中使用人工智能的安全性和有效性,使其成为人类医生的第二双虚拟眼睛,可以作为医生的直觉检查,或者在他们遇到超出自己经验或专业知识的病例时提供帮助。

他们表示,人工智能显然可以在医疗保健领域发挥积极作用——只要我们认识到它的局限性,并将其与人类医生结合使用,而不是作为人类医生的替代品。

"我们正在见证一项真正深刻的技术变革,这将重塑医学,"哈佛医学院研究医疗决策的机器学习和统计建模的阿伦·曼雷说。

人工智能在急诊诊断方面表现优于人类医生

研究人员评估了OpenAI的o1推理模型,这是一种比ChatGPT更专业的AI程序。它运行更为深思熟虑,强调内部逻辑。他们通过多个实验测试了该程序,在模拟病例和用于医疗培训以测试医生批判性思维的历史病例中评估其准确性,还包括来自贝斯以色列医院的真实急诊案例。然后,研究将o1模型的表现与人类医生、ChatGPT以及使用ChatGPT的人类医生进行了比较。

评估培训案例使研究人员能够将o1的表现与参加相同测试的人类医生的大量现有数据进行比较。在这些不同场景中,人工智能始终表现优于这些医生,并在研究的绝大多数病例中提供了正确的诊断或对患者管理有帮助的计划。

但它在评估来自真实世界急诊案例的原始电子健康记录数据时的准确性尤为令人印象深刻。这最接近急诊医生经常必须面对的混乱现实:他们面对的是急需快速治疗的患者,且往往只有不完整或未经筛选的信息。在审查这些案例时,o1模型在患者初次分诊时能够准确或接近准确诊断的比例达到67%(而与之比较的两位专家医生分别为50%和55%);当患者准备入院时,这一比例上升到81%(而人类医生为70%和79%)。

"我们可以肯定地说……推理模型能够满足在人类表现最高水平上进行诊断推理的标准,"罗德曼告诉记者。

我咨询的两位与该研究无关的专家——加州大学旧金山分校的桑杰·巴苏博士和斯坦福大学的尼加姆·沙阿——称赞了其严谨性,但也指出了其局限性。研究中使用的现有培训案例是专门为了评估医生准确性而策划的,因此可能会夸大模型在现实世界中的表现。在包括一系列"不能遗漏"的诊断(当患者面临严重伤害或死亡风险时)的案例研究实验中,AI模型的表现并不比ChatGPT或人类医生更好。

即使是那些最接近评估o1模型在真实生活条件下表现的急诊室发现,也只是对现有病例的回顾性审查;该模型实际上并没有被要求实时诊断或管理患者。

因此,正如《科学》研究的作者所指出的,下一步不应该立即将OpenAI的模型投入全国医院的急诊分诊中。相反,他们呼吁进行临床试验,以在真实世界条件下评估该模型的表现——包括准确性和安全性。

"医学关乎重大风险……而我们有方法可以减轻这些风险。它们被称为临床试验,"罗德曼告诉记者。"这些结果支持的是一项稳健而雄心勃勃的研究议程。"

人工智能对医生可能很有价值——但患者应保持谨慎

目前,尤其是医学领域的人工智能炒作正盛。在听取作者讨论他们的发现时,让我印象深刻的是他们自己意识到他们的研究可能被用作削减人类医疗劳动力的正当理由——以及这可能给患者带来的风险。

"现在有很多所谓的'AI医生'公司,试图将医生排除在外或仅提供最低限度的临床监督,"罗德曼说。"作为该研究的资深作者之一,我认为这些结果并不支持这种做法。"

作者强调,根据他们的结果,他们设想急诊室中的人工智能模型应该由真正的医生监督。做出诊断只是治疗患者的一部分;还包括制定治疗计划、监测病情发展——以及人性化的关怀。"人类希望由人类来引导他们做出生死攸关的决定,"曼雷说。

巴苏和沙阿表示,基于迄今为止的集体研究,他们支持在急诊室中对人工智能进行明确定义的有限应用。当患者转交给另一位临床医生时,它可以提供第二意见,或者在时间至关重要的特定高风险情况下(例如患者出现败血症感染或中风症状)提供建议。它还可以减少医生的文书工作,这一应用场景在《匹兹堡》最新一季中有所体现。沙阿指出,预先授权、文档记录和排班是人工智能可以明显帮助的领域。

巴苏表示,与此同时,人工智能模型绝对不应被用于自主诊断和管理治疗。

个人在使用人工智能做出医疗决策时也应保持谨慎。其他关于AI诊断的研究发现了令人担忧的结果,尤其是面向消费者的模型如ChatGPT。今年早些时候发表在《自然医学》杂志上的一篇论文评估了ChatGPT在面对从非紧急到紧急的各种情况时的表现,发现该模型在52%的案例中低估了患者病情的严重性;那些濒临糖尿病休克或呼吸衰竭的患者反而被建议进行24或48小时的监测。该模型多次未能识别出明显的自杀意念迹象。

正如沙阿对我说的,《科学》论文代表了使用AI进行诊断的"天花板",而《自然医学》论文则代表了"地板"。这两项研究显示了我们在考虑AI用于临床决策时需要多么精确:虽然更复杂的o1模型在《科学》研究中对精选案例的评估表现良好,但面向消费者的ChatGPT——由同一家公司OpenAI开发——在另一篇论文中的表现却不佳。

"两者都可以是真实的,"巴苏对我说。"它们都是。"

在与记者的电话会议中,曼雷描述了AI可能真正有帮助的"绿色"(低风险)场景,即使是外行也能受益,以及你应该始终让医疗专业人员参与的"红色"(高风险)案例。例如,绿色应用可以是向模型询问有助于控制高血压的饮食或缓解最近背部损伤的拉伸运动。将其视为生活方式建议而非严格的临床指导。

相反,红色应用将涉及具有生死后果的严重医疗情况:以胸痛为例(众多可能例子中的一个),应该直接去看医生或去医院,而不是咨询ChatGPT。

我们正越来越接近释放这些强大程序改善医疗保健的惊人潜力,将曾经的科幻变成现实。但即使是这些站在前沿的研究人员也同意,我们需要谨慎行事——并将真正的专家,即医生,纳入决策过程。

【全文结束】

猜你喜欢
  • 新型AI工具可在"沉默杀手"发病前五年进行检测新型AI工具可在"沉默杀手"发病前五年进行检测
  • 新型AI工具可提前至少五年预测心力衰竭新型AI工具可提前至少五年预测心力衰竭
  • 斯威夫特·卡伦特医生亮相医疗研究纪录片斯威夫特·卡伦特医生亮相医疗研究纪录片
  • 新型AI算法突破医疗影像诊断准确率瓶颈新型AI算法突破医疗影像诊断准确率瓶颈
  • 新图谱以前所未有的方式揭示人体隐藏细节新图谱以前所未有的方式揭示人体隐藏细节
  • 新型AI模型在临床推理与诊断方面超越医生新型AI模型在临床推理与诊断方面超越医生
  • 数字健康市场2026:人工智能、远程医疗与医疗创新数字健康市场2026:人工智能、远程医疗与医疗创新
  • 新CAR-T细胞疗法或使部分癌症患者免于化疗新CAR-T细胞疗法或使部分癌症患者免于化疗
  • 新型AI工具可在心脏病发作前五年进行精准预测新型AI工具可在心脏病发作前五年进行精准预测
  • 新患者洞察揭示罕见癫痫护理机遇新患者洞察揭示罕见癫痫护理机遇
热点资讯
全站热点
全站热文