哈佛大学急诊分诊诊断试验显示AI表现优于医生AI outperforms doctors in Harvard trial of emergency triage diagnoses | AI (artificial intelligence) | The Guardian

环球医讯 / AI与医疗健康来源:www.theguardian.com美国 - 英语2026-08-19 22:06:48 - 阅读时长4分钟 - 1727字
哈佛大学进行的一项突破性研究显示,在急诊分诊诊断中,AI系统的表现超过了人类医生,特别是在需要快速决策且信息有限的情况下。研究发表在《科学》杂志上,表明大型语言模型已超越大多数临床推理基准。尽管AI在诊断准确率上领先,但研究人员强调AI不会取代医生,而是将形成"医生、患者和人工智能系统"的三元护理模式,共同重塑未来医疗。该研究测试了76名急诊患者案例,AI在67%的案例中准确诊断,而人类医生仅为50%-55%,凸显了AI在医疗决策支持方面的潜力与挑战。
AI医疗急诊分诊诊断准确率临床推理大型语言模型辅助诊断临床决策医疗责任急诊医生急诊医学医疗安全
哈佛大学急诊分诊诊断试验显示AI表现优于医生

从《急诊室的故事》中的乔治·克鲁尼到《匹兹堡》中的诺亚·怀利,急诊科医生长期以来一直是广受欢迎的英雄。但或许很快就是他们脱下手术服的时候了?

一项具有突破性的哈佛大学研究发现,在高压的急诊医学分诊中,AI系统的表现超过了人类医生,在人们刚被紧急送往医院的生死攸关时刻,AI的诊断更为准确。

独立专家将这些结果描述为AI临床推理能力的"真正进步",该结果来自于一项测试数百名医生与AI反应的试验。

作者表示,发表在《科学》杂志上的结果显示,大型语言模型(LLMs)"已经超越了大多数临床推理的基准"。

其中一项实验聚焦于76名抵达波士顿一家医院急诊室的患者。AI和一对人类医生各自被给予相同的标准化电子健康记录进行阅读——通常包括生命体征数据、人口统计信息以及护士关于患者就诊原因的几句话。AI在67%的案例中识别出了准确或非常接近的诊断,超过了人类医生50%-55%的正确率。

研究表明,在需要快速决策且信息最少的分诊情况下,AI的优势尤为明显。当提供更多细节时,AI(OpenAI的o1推理模型)的诊断准确率上升到82%,而专家人类的准确率为70-79%,尽管这种差异在统计上并不显著。

当被要求提供长期治疗计划(如提供抗生素方案或规划临终过程)时,AI也优于更大群体的人类医生。AI和46名医生被要求检查五个临床案例研究,计算机制定的计划明显更好,得分为89%,而使用常规资源(如搜索引擎)的人类得分为34%。

但研究人员表示,急诊医生的职业生涯尚未结束。该研究仅测试了人类与AI在可通过文本传达的患者数据上的表现。AI对患者痛苦程度和视觉外观等信号的解读并未经过测试。这意味着AI的表现更像是基于纸质文件提供第二意见的临床医生。

"我不认为我们的发现意味着AI将取代医生,"哈佛医学院AI实验室负责人、该研究的主要作者之一阿琼·曼赖(Arjun Manrai)说,"但我认为这确实意味着我们正在见证一项将重塑医学的真正深刻的技术变革。"

该研究在波士顿贝斯以色列女执事医疗中心进行,另一位主要作者、该中心的医生亚当·罗德曼(Adam Rodman)博士表示,AI大型语言模型是"数十年来最具影响力的技术之一"。他表示,在未来十年,AI不会取代医生,而是将以新的"三元护理模式"加入医生行列……即医生、患者和人工智能系统。

在哈佛研究的一个案例中,一名患者出现肺部血栓和症状恶化。人类医生认为抗凝剂失效,但AI注意到了人类没有注意到的情况:患者的狼疮病史可能导致肺部炎症。事实证明AI是正确的。

根据上个月发布的一项研究,近五分之一的美国医生已经在使用AI辅助诊断。根据英国皇家医师学会最近的一项调查,在英国,16%的医生每天使用该技术,另有15%每周使用,"临床决策"是最常见的用途之一。

英国医生最大的担忧是AI错误和责任风险。数十亿美元正在投入AI医疗保健公司,但关于AI错误后果的问题仍然存在。

"目前还没有正式的责任框架,"罗德曼说,他还强调,患者最终"希望人类在生死决策中引导他们[并且]在艰难的治疗决策中引导他们"。

爱丁堡大学医学信息学中心联合主任尤恩·哈里森(Ewen Harrison)教授表示,这项研究很重要,表明"这些系统不再只是通过医学考试或解决人工测试案例。它们开始成为临床医生有用的第二意见工具,特别是当需要考虑更广泛的可能诊断并避免遗漏重要事项时。"

谢菲尔德大学数理科学学院助理教授魏星(Wei Xing)博士表示,其他一些发现表明,医生可能会无意识地遵循AI的答案,而不是独立思考。

"随着AI在临床环境中更常规地使用,这种趋势可能会变得更加显著,"他说。他还强调了关于AI对哪些患者诊断效果较差以及是否在老年患者或非英语使用者身上表现更差的信息缺乏。

他说:"这并不能证明AI适合常规临床使用,也不能证明公众应该将免费可用的AI工具作为医疗建议的替代品。"

【全文结束】

猜你喜欢
  • 医疗领域人工智能应用引发新担忧医疗领域人工智能应用引发新担忧
  • 医疗科技行业是否忽视了经过验证的深度学习医学AI模型而过分关注未经充分验证的大语言模型和生成式AI医疗科技行业是否忽视了经过验证的深度学习医学AI模型而过分关注未经充分验证的大语言模型和生成式AI
  • 医疗系统在AI时代掌握"减法"艺术医疗系统在AI时代掌握"减法"艺术
  • 南瓜籽生物完成2000万美元A轮融资 解锁生物学最有价值的隐藏数据层南瓜籽生物完成2000万美元A轮融资 解锁生物学最有价值的隐藏数据层
  • 含人工智能的医疗设备——欧盟医疗器械法规与人工智能法案下制造商/提供商及用户/部署者的角色与责任解析含人工智能的医疗设备——欧盟医疗器械法规与人工智能法案下制造商/提供商及用户/部署者的角色与责任解析
  • 千亿级女性健康市场推动子宫内膜异位症诊疗新焦点千亿级女性健康市场推动子宫内膜异位症诊疗新焦点
  • 医疗行业CIO视人工智能整合为竞争必要条件医疗行业CIO视人工智能整合为竞争必要条件
  • 医院希望AI能减轻职业倦怠,而医护人员则要求提高人员配置标准医院希望AI能减轻职业倦怠,而医护人员则要求提高人员配置标准
  • 南佛罗里达大学新研究测试AI能否可靠预测免疫反应南佛罗里达大学新研究测试AI能否可靠预测免疫反应
  • 医疗设备制造商在集成人工智能前必须了解的七件事医疗设备制造商在集成人工智能前必须了解的七件事
热点资讯
全站热点
全站热文