哈佛新研究显示AI在急诊室任务中表现优于医生AI Outperforms Doctors in Emergency Room Tasks, New Harvard Study Shows | Harvard Magazine

环球医讯 / AI与医疗健康来源:www.harvardmagazine.com美国 - 英语2026-08-19 22:21:00 - 阅读时长5分钟 - 2466字
哈佛大学主导的一项最新研究显示,OpenAI的"o1 preview"人工智能模型在急诊室分诊、诊断和病例管理等关键任务中表现超过人类医生。该研究发表在《科学》杂志上,评估了AI在76个急诊病例中的表现,发现在初步分诊阶段AI尤其出色,能够处理罕见疾病和复杂病例。研究人员认为AI不应取代医生,而应作为辅助工具,帮助医生做出更好决策,但强调需要进行严格的临床试验来确定最佳应用方式,同时指出当前研究仅基于文本输入,实际医疗场景中医生还需处理X光片、生理信号等多维度信息。
医疗AI临床诊断急诊分诊罕见病临床推理管理推理病例管理医生患者护理电子健康记录临床试验第二诊疗意见
哈佛新研究显示AI在急诊室任务中表现优于医生

一项由哈佛大学领导的研究发现,一种先进的AI代理在一系列评估临床环境中正确诊断患者疾病能力的严格测试中,表现超过了人类医生。OpenAI的"o1 preview"是该公司首个具备逐步推理能力的模型,证明它能够在真实世界的急诊室中进行分诊、推荐适当的诊断测试,并执行病例管理任务,其水平已经达到甚至超过了训练有素的人类医生。

由哈佛研究人员领导、斯坦福大学合作者参与的这项研究今天发表在《科学》杂志上。作者表示,这项技术迫切需要进行对照试验,以确定如何最有效地部署它。

研究人员对o1 preview进行了多项不同的复杂测试。他们要求这个大型语言模型(LLM)得出患者诊断并制定测试计划。他们评估了LLM在临床推理方面的技能,与专家和普通医生进行了比较。在真实的临床环境中,他们在波士顿一家医院对76个急诊室病例在三个阶段评估了LLM的表现:到达时的初步分诊、首次接触医生时以及入住医疗楼层或重症监护室时。

评估由两名医生进行,他们不知道急诊评估是由AI模型还是由两名专家主治医生做出的。这些评审者发现,o1 preview在每个阶段的表现都达到或超过了专家的人类表现。研究表明,AI在初始分诊阶段(即信息最少的阶段)特别擅长做出评估。

在其他测试中,AI模型在涉及罕见疾病和复杂病例的诊断方面表现尤为出色。例如,AI在一个评估中表现出色,该评估涉及马萨诸塞州总医院的真实案例,这些案例曾发表在《新英格兰医学杂志》上。研究的高级合著者Arjun Manrai在4月29日通过Zoom对记者说:"这些病例通常非常具有挑战性,它们...充满了深奥或分散注意力的内容,...涵盖了医学的许多不同领域。"

Manrai说,AI与人类专家在这些病例中的表现对比"真的让很多人感到震惊"。

参与这项研究的哈佛格里芬文理研究生院和哈佛医学院博士生Thomas Buckley补充说,结果表明o1 preview在这组自1959年以来一直被用作评估计算机诊断能力基准的挑战性病例上,已经达到了近乎最佳的诊断水平。

研究发现,在涉及医生所称的"管理推理"的任务上,从抗生素使用建议到如何处理护理目标(包括临终对话),o1 preview显著超越了之前的AI模型,也超过了使用常规辅助工具(如最新版Google搜索)的人类。

贝斯以色列女执事医疗中心的临床研究员Peter Brodeur解释说:"管理推理可能比诊断推理更复杂的任务。它不仅需要考虑病例的客观特征,还需要考虑主观因素:你所处的环境和情况,因此,推理模型在这些任务上的表现明显优于人类和ChatGPT-4,这可能并不令人意外。"

但Manrai强调,团队的研究结果并不意味着"AI取代医生,尽管一些[销售基于AI的医疗]公司可能会这么说。"

Manrai说:"我认为这意味着我们正在见证一项将重塑医学的真正深刻的技术变革,我们需要现在就评估这项技术,并严格进行前瞻性临床试验。"

Manrai还指出了一些重要的注意事项。他说,这项研究完全基于文本输入,这是语言模型擅长的领域。但执业医生正在评估许多其他形式的信息:"他们必须倾听患者,必须查看胸部X光片、影像研究,并且必须在日常临床决策中使用大量其他类型的数据——生理信号、心电图等。"

Manrai指出,该团队正在进行"平行研究……研究这些模型在图像和其他类型信号上的表现",并且正在看到快速改善的结果。尽管如此,他设想AI模型将与医生合作,帮助他们做出更好的决策。他说:"AI模型可能会出错",它们"可能会阿谀奉承","但它们也正在提供真正的价值,帮助患者和医生。"

该研究的高级合著者、哈佛医学院助理教授、负责领导学校将AI整合到课程中的工作组的Adam Rodman说,这项研究明确表明,AI的推理模型能够达到人类表现最高水平的诊断标准。

Rodman还担任贝斯以色列女执事医疗中心Shapiro教育与研究中心的AI项目主管,他表示,研究结果表明,这类模型至少在两个方面可能对医生特别有用。一是在急诊室进行分诊,患者有时会出现不确定的症状,通常伴随着大量混乱的电子健康记录数据,其中充满了随机噪声。

Rodman说:"你可以很容易想象,一个被动运行电子健康记录的系统,如果能够在诊断错误或错失诊断机会发生之前识别出来,可能会提高质量。"

Rodman说,AI的另一个用途是"寻求第二意见的想法。我们知道,医生从人类同事那里获得第二意见通常会改善护理。"在2025年——对于这项快速发展的技术来说已经是很久以前——爱思唯尔的一项研究发现,20%的临床医生已经在咨询大型语言模型以获取第二意见,这个数字肯定已经增长。

Rodman预测,"将有一部分任务人类做得更好,一部分任务AI系统始终表现更好,然后是一些需要某种程度增强或团队合作的任务。作为研究人员,我事先不知道那会是什么。"

Rodman总结道:"我不希望发生的是,"他所谓的"AI医生公司"试图将医生排除在外或最小化临床监督。"Rodman说:"我不认为这些结果支持这一点。这些结果支持的是一个强大而雄心勃勃的研究议程,试图找出我们如何使用这些技术来改善患者的生活。"

Manrai也认为,没有什么能取代人类接触的力量。他说:"最终,我认为人类希望人类引导他们度过生死攸关的决定,引导他们度过挑战性治疗",讨论影响"他们生活质量或他们如何与孩子玩耍以及他们能做什么工作"的决定。

相反,这些进步是关于拥有"更好的工具来帮助我们。"

【全文结束】

猜你喜欢
  • 千亿级女性健康市场推动子宫内膜异位症诊疗新焦点千亿级女性健康市场推动子宫内膜异位症诊疗新焦点
  • 医院与聊天机器人:AI如何重塑尼日利亚的医疗咨询医院与聊天机器人:AI如何重塑尼日利亚的医疗咨询
  • 南安普顿计划新建大型医学研究中心南安普顿计划新建大型医学研究中心
  • 协和医疗集团与DocAssistant合作开发AI文档技术协和医疗集团与DocAssistant合作开发AI文档技术
  • 呼叫AI医生:当诊断变得复杂时,机器如今已胜过医生呼叫AI医生:当诊断变得复杂时,机器如今已胜过医生
  • 医疗设备制造商在集成人工智能前必须了解的七件事医疗设备制造商在集成人工智能前必须了解的七件事
  • 医院变身为祖父母的紧急"酒店"。"您能留他几天吗?"——让医生不寒而栗的问题医院变身为祖父母的紧急"酒店"。"您能留他几天吗?"——让医生不寒而栗的问题
  • 医疗科技行业是否忽视了经过验证的深度学习医学AI模型而过分关注未经充分验证的大语言模型和生成式AI医疗科技行业是否忽视了经过验证的深度学习医学AI模型而过分关注未经充分验证的大语言模型和生成式AI
  • 医疗系统中实施人工智能的关键挑战与成功因素,特别是在临床决策与患者护理方面医疗系统中实施人工智能的关键挑战与成功因素,特别是在临床决策与患者护理方面
  • 含有海藻成分的微小贴片正帮助康涅狄格大学收集人体数据 原因如下含有海藻成分的微小贴片正帮助康涅狄格大学收集人体数据 原因如下
热点资讯
全站热点
全站热文