哈佛大学研究显示AI急诊诊断准确率超过两位人类医生In Harvard study, AI offered more accurate emergency room diagnoses than two human doctors

环球医讯 / AI与医疗健康来源:www.yahoo.com美国 - 英语2026-08-19 22:06:52 - 阅读时长3分钟 - 1278字
哈佛大学医学院和贝斯以色列女执事医疗中心的研究团队在《科学》杂志发表了一项研究,表明在急诊室诊断场景中,OpenAI的o1模型在67%的分诊病例中提供了准确或接近准确的诊断,而两位内科主治医生的准确率分别为55%和50%,但也有专家指出该研究存在局限性,如比较对象是内科医生而非急诊科医生,且AI诊断缺乏问责框架,同时研究仅测试了模型处理文本信息的能力,未能评估其对非文本输入的推理能力。
AI急诊诊断诊断准确率人类医生急诊分诊电子病历大语言模型AI诊断问责框架前瞻性试验哈佛医学院研究急诊医生
哈佛大学研究显示AI急诊诊断准确率超过两位人类医生

一项新研究考察了大语言模型在各种医疗场景中的表现,包括真实的急诊室病例——在至少一种模型中,其准确性似乎超过了人类医生。

该研究本周发表在《科学》杂志上,由哈佛医学院和贝斯以色列女执事医疗中心的医生和计算机科学家组成的研究团队主导。研究人员表示,他们进行了多种实验来衡量OpenAI的模型与人类医生的比较。

在一个实验中,研究人员关注了76名进入贝斯以色列急诊室的患者,将两位内科主治医生提供的诊断与OpenAI的o1和4o模型生成的诊断进行了比较。这些诊断由另外两位不了解哪些诊断来自人类、哪些来自AI的主治医生进行评估。

研究称:"在每个诊断环节,o1的表现要么略优于两位主治医生和4o,要么与之持平",并补充说这些差异"在第一个诊断环节(初始急诊分诊)中尤为明显,此时关于患者的信息最少,做出正确决策的紧迫性最高。"

在哈佛医学院关于该研究的新闻稿中,研究人员强调他们"完全没有预处理数据"——AI模型获得的信息与每次诊断时电子病历中可用的信息相同。

基于这些信息,o1模型在67%的分诊病例中提供了"准确或非常接近的诊断",而一位医生在55%的情况下提供了准确或接近的诊断,另一位医生的准确率为50%。

哈佛医学院AI实验室负责人、该研究的主要作者之一Arjun Manrai在新闻稿中表示:"我们针对几乎所有基准测试了AI模型,它超越了先前的模型和我们的医生基准。"

需要明确的是,该研究并未声称AI已准备好在急诊室做出真正的生死攸关的决策。相反,它指出这些发现显示"迫切需要进行前瞻性试验,以在真实世界患者护理环境中评估这些技术。"

研究人员还指出,他们只研究了模型在提供基于文本的信息时的表现,而"现有研究表明,当前的基础模型在推理非文本输入方面更为有限。"

同样是该研究主要作者之一的贝斯以色列医生Adam Rodman警告《卫报》,目前"没有关于AI诊断的正式问责框架",患者仍然"希望人类在生死决策中引导他们[并]在艰难的治疗决策中引导他们。"

在关于该研究的一篇博文中,急诊医生Kristen Panthagani表示,这是一项"导致了一些过度炒作标题的有趣AI研究",特别是因为它比较的是AI诊断与内科医生的诊断,而非急诊科医生的诊断。

Panthagani说:"如果我们打算将AI工具与医生的临床能力进行比较,我们应该首先与实际从事该专业的医生进行比较。我不会惊讶于LLM能在神经外科委员会考试中击败皮肤科医生,[但这]不是特别有用的信息。"

她还指出:"作为一名首次接诊患者的急诊医生,我的主要目标不是猜测你的最终诊断。我的主要目标是确定你是否患有可能致命的疾病。"

本文和标题已更新,以反映研究中的诊断来自内科主治医生,并包含Kristen Panthagani的评论。

【全文结束】

猜你喜欢
  • 医生如何检测心律失常?揭示诊断过程医生如何检测心律失常?揭示诊断过程
  • 利夫医院宣布在伊斯坦布尔设立专科卒中中心利夫医院宣布在伊斯坦布尔设立专科卒中中心
  • 医学研究类型 - 系统评价医学研究类型 - 系统评价
  • 医学的未来:AI在医学影像诊断中的应用医学的未来:AI在医学影像诊断中的应用
  • 医院向员工征集人工智能改善医疗服务方案医院向员工征集人工智能改善医疗服务方案
  • 医疗行业CIO视人工智能整合为竞争必要条件医疗行业CIO视人工智能整合为竞争必要条件
  • 医生在岗——还是AI在岗?医生在岗——还是AI在岗?
  • 医疗AI工具安全检查滞后 临床应用准备不足:研究显示医疗AI工具安全检查滞后 临床应用准备不足:研究显示
  • 医疗科技行业是否忽视了经过验证的深度学习医学AI模型而过分关注未经充分验证的大语言模型和生成式AI医疗科技行业是否忽视了经过验证的深度学习医学AI模型而过分关注未经充分验证的大语言模型和生成式AI
  • 医疗健康领域中真正的AI差距并非智能医疗健康领域中真正的AI差距并非智能
热点资讯
全站热点
全站热文