呼叫AI医生:当诊断变得复杂时,机器如今已胜过医生Paging Dr. AI: machines now beat doctors where diagnosis gets messy

环球医讯 / AI与医疗健康来源:www.ynetnews.com美国 - 英语2026-08-19 22:06:18 - 阅读时长7分钟 - 3069字
哈佛大学最新研究发现,OpenAI的o1模型在急诊分诊和临床管理方面表现优于医生,特别是在处理复杂诊断时。研究显示,该AI模型在急诊分诊阶段的准确率为67%,而医生的准确率分别为55%和50%;在患者转入内科病房时,模型准确率达到81.6%,医生则为78.9%和69.7%。研究者强调,结果并不证明AI已准备好用于常规临床实践,而应作为医生的第二意见。该研究发表在《科学》杂志上,引发了关于AI在医疗领域应用前景的广泛讨论。以色列卫生部也在此时首次批准了用于精神科分诊的AI工具。
医疗AIAI辅助诊断医生诊断急诊分诊诊断准确率临床决策治疗管理第二诊疗意见精神科分诊临床诊疗医生辅助工具医疗质量临床研究
呼叫AI医生:当诊断变得复杂时,机器如今已胜过医生

一名肺部出现血栓的患者来到急诊室。他的病情有所改善,然后突然恶化。医疗团队怀疑治疗失败了。

此时,人工智能介入:在扫描了他的病历后,它提出了一个完全不同的理论:该患者有红斑狼疮病史,这是一种可能导致心肌炎的自身免疫性疾病,根据该模型,这解释了病情的恶化。事实证明,这一理论是正确的。

AI辅助分诊与医生诊断之间的差距是一致且显著的。(图片:Shutterstock)

这不是来自医疗剧的虚构场景。不久前,这一幕就发生在波士顿贝斯以色列女执事医疗中心的急诊室。近日发表在著名期刊《科学》上的一项新研究指出,这类案例可能很快就会成为常态,而且研究发现AI模型的优势非常明显。

六项实验,一个结果

由哈佛大学和贝斯以色列女执事医疗中心的研究人员与斯坦福大学研究人员合作开展的这项研究,并非依赖单一测试。研究人员进行了六项独立实验,将OpenAI的o1模型——一种新一代"思维链"推理模型,能在得出结论前逐步推理——与数百名不同培训水平和经验的医生(包括住院医师、专科医生和全科医生)进行对比。在每项实验中,模型都无一例外地胜过人类。

最具意义的实验,也是最接近真实临床实践的实验,使用了贝斯以色列急诊室的76个真实案例。该模型和两名专科医生收到完全相同的数据:电子病历、生命体征和接诊护士撰写的几句话。另外两名医生对结果进行了评分,他们并不知道每个诊断的来源。

差距是一致且显著的。在分诊阶段,当信息最少且压力最大时,该模型在67%的病例中识别出正确或非常接近的诊断。第一位医生的准确率为55%,第二位为50%。随着更多信息的获取,所有人的准确率都有所提高。但差距依然存在:当患者被收治到内科病房时,模型的准确率达到81.6%,而医生的准确率分别为78.9%和69.7%。

哈佛医学院的亚当·罗德曼博士表示:"这对我来说是最大的结论。它能处理真实急诊室的混乱数据。它适用于真实世界的诊断。"罗德曼博士领导着将AI整合到课程中的工作组,并负责贝斯以色列女执事医疗中心沙皮罗中心的AI项目。

它听起来也像医生

一个重要的方法论细节表明,AI与人类医生之间的界限已经变得多么模糊。对诊断进行评分的医生被要求猜测每个答案是由人类医生还是AI撰写的。一位医生在83.6%的病例中无法确定,而另一位在94.4%的病例中无法确定。换句话说,AI不仅更准确,而且听起来也像医生。

自20世纪50年代以来,发表在《新英格兰医学杂志》上的复杂病例讨论一直被用作评估计算机诊断系统的基准。这些是真实的患者病例,涵盖了数十个医学领域的误导性和干扰性细节。

哈佛医学院生物医学信息学副教授、该研究的主要负责人之一阿俊·曼莱教授表示:"AI与人类专家在这些病例上的表现对比让许多人感到震惊。"

人工智能正成为医学的自然组成部分。(图片:Shutterstock)

在2021年至2024年的143个病例中,该模型在78.3%的病例中包含了正确诊断。当标准扩大到包括"非常接近"的诊断时,准确率上升至97.9%。在与GPT-4对70个病例的直接比较中,o1以88.6%对72.9%的优势胜过其前身。

参与该研究的哈佛医学院博士生托马斯·巴克利表示,结果表明o1正在接近这些挑战性病例的最佳诊断水平,这些病例自1959年以来一直被用于测试计算机诊断能力。

治疗管理中的显著差距

该研究最令人惊讶的发现与诊断无关,而是医生所说的"管理推理",即诊断后的临床决策:应该进行哪些检查、抗生素使用建议以及如何讨论临终关怀。在25位专家开发的五个复杂场景中,AI模型的中位得分为89%。使用常规资源(包括最新谷歌搜索)的医生得分仅为34%。

参与该研究的贝斯以色列医疗中心亚专科研究员彼得·布罗多尔博士表示:"管理推理可能比诊断推理更复杂。它不仅需要考虑病例的客观特征,还需要考虑主观因素:你所处的环境和情况,因此,推理模型表现明显更好可能并不令人惊讶。"

研究人员谨慎地强调了该研究未涉及的内容以及模型仍然无法做到的事情。所有实验仅基于文本输入。在实践中,临床医学充满了非文本数据:X光片、心电图、生理测量,甚至患者看起来、听起来和感觉如何。

曼莱表示:"医生必须倾听患者,查看胸部X光片,分析心电图和超声心动图。他们在日常临床决策中使用多种不同类型的数据。"他表示,他的团队正在进行"关于这些模型在图像上表现的平行研究",并看到了快速改进,但数据尚未公布。

未参与该研究的谢菲尔德大学讲师魏星博士补充了一个重要警告:该研究未分析模型对哪些患者的诊断不够准确,例如老年患者或不说英语的患者。他还警告说,医生可能会开始依赖AI答案而不是独立思考,"随着AI在临床环境中更常规地使用,这种趋势可能会变得更加显著,"他告诉《卫报》。

他总结道:"它并未证明AI适合常规临床使用,也不表明公众应该将免费可用的AI工具作为医疗建议的替代品。"

不要将医生排除在外

曼莱和罗德曼强调,研究结果并不支持取代医生。曼莱表示:"归根结底,人们希望有人类引导他们做出生死攸关的决定,引导他们做出复杂的治疗决定,与他们讨论他们的生活质量。"

罗德曼表示,他不希望看到"医疗AI"公司试图减少医生的临床参与。"我们的研究结果并不支持这一点,"他说。"它们支持的是一个雄心勃勃的研究议程。"

相反,研究人员指出了AI已经可以帮助医生的两个领域。首先是急诊分诊,患者带着不明确的症状和混乱的病历来到这里。罗德曼表示:"你可以很容易地想象,如果一个被动运行电子健康记录的系统能够在诊断错误或诊断机会错失之前识别出来,它可能会如何提高质量。"

另一种用途是作为第二意见。"我们知道,医生从人类同事那里获得第二意见通常会改善护理。AI可以充当这种工具。"

AI模型可提供第二意见。(图片:以色列急诊室,ChameleonsEye / Shutterstock)

未参与该研究的纽约西奈山医院系统首席临床官大卫·赖希博士告诉NPR,关键的开放性问题不是技术是否准确,而是如何将其整合到临床工作流程中,"以改善护理的方式"。"这项研究是一个完美的行动号召,"他说。

罗德曼和曼莱呼吁进行额外的对照研究,以确定该技术如何影响实际患者结果。曼莱表示:"我们正在见证一项将重塑医学的真正深刻的技术变革,"他敦促在该技术成为常规护理的一部分之前,在对照临床试验中进行测试。

从以色列的角度来看,这项美国研究也恰逢其时。就在几天前,以色列卫生部首次批准使用AI工具进行精神科分诊:LIV,这是一个由以色列初创公司Mentaily开发的系统,该公司源自谢巴医疗中心的ARC创新部门。

该系统中,一个虚拟形象与患者进行类似初步精神科访谈的对话,在涉及385名患者的两项临床研究中,与精神科医生的评估达成约90%的一致性,对高风险状况的识别率达到约96%。

谢巴医疗中心精神病学部门副主任、该风险投资的创始人之一阿萨夫·卡斯皮博士表示:"目标不是取代治疗师,而是增强他们的能力。"

目前,该以色列系统被用作医生的辅助工具。

【全文结束】

猜你喜欢
  • 医疗技术中的AI管理:从创新到合规医疗技术中的AI管理:从创新到合规
  • 南安普顿计划建设大型新医学研究枢纽南安普顿计划建设大型新医学研究枢纽
  • 医院变身为祖父母的紧急"酒店"。"您能留他几天吗?"——让医生不寒而栗的问题医院变身为祖父母的紧急"酒店"。"您能留他几天吗?"——让医生不寒而栗的问题
  • 医疗系统中实施人工智能的关键挑战与成功因素,特别是在临床决策与患者护理方面医疗系统中实施人工智能的关键挑战与成功因素,特别是在临床决策与患者护理方面
  • 千亿级女性健康市场推动子宫内膜异位症诊疗新焦点千亿级女性健康市场推动子宫内膜异位症诊疗新焦点
  • 南瓜籽生物完成2000万美元A轮融资 解锁生物学最有价值的隐藏数据层南瓜籽生物完成2000万美元A轮融资 解锁生物学最有价值的隐藏数据层
  • 协和医疗集团与DocAssistant合作开发AI文档技术协和医疗集团与DocAssistant合作开发AI文档技术
  • 医疗行业CIO视人工智能整合为竞争必要条件医疗行业CIO视人工智能整合为竞争必要条件
  • 医疗领域的AI代理旨在为医生争取宝贵时间医疗领域的AI代理旨在为医生争取宝贵时间
  • 医院向员工征集人工智能改善医疗服务方案医院向员工征集人工智能改善医疗服务方案
热点资讯
全站热点
全站热文