人工智能能否帮助医生避免漏诊Can AI Save Doctors From Missed Diagnoses?

环球医讯 / AI与医疗健康来源:www.medscape.com美国 - 英语2026-07-19 23:20:41 - 阅读时长8分钟 - 3609字
本文探讨了人工智能在医疗诊断中的应用潜力,特别是如何帮助医生识别可能的漏诊情况。文章介绍了一项发表在《美国医学会杂志网络开放》上的研究,该研究评估了多种大型语言模型识别急诊患者漏诊机会的能力。研究结果显示,虽然这些模型具有一定的敏感性,但假阳性率较高,可能引发"警报疲劳"。作者指出,随着AI技术的快速发展,未来AI辅助诊断系统可能会成为医疗标准流程的一部分,甚至不使用AI辅助可能被视为医疗疏忽。当前最佳模型Claude Sonnet 4在急诊患者队列中表现最佳,但仍有约39个假阳性案例,这使得临床医生可能对其产生不信任。作者还讨论了LLM在医疗应用中的深层担忧,包括对提示词的依赖性和输出的随机性问题。
人工智能医学漏诊警报疲劳大型语言模型急诊科患者预后诊断漏诊机会假阳性率
人工智能能否帮助医生避免漏诊

[本文字稿已为清晰度进行编辑。]

欢迎来到《影响力因子》,这是您每周获取新医学研究评论的栏目。我是来自耶鲁医学院的F. Perry Wilson医学博士。

临床医学中有一个被广泛描述的概念,称为"警报疲劳"。这是一种真实的神经学过程,在充斥大量警报和提醒的环境中,大脑开始对这些警报充耳不闻。试想一下重症监护室(ICU)的场景:呼吸机因呼气末正压(PEEP)过高而不断发出警报,静脉输液架因管路扭曲而发出提示音,遥测监护仪因快速心房颤动而闪烁。在这样的背景噪音中,真正重要的警报可能会被忽略。

将人工智能整合到医学中的一个挑战是避免发出过多警报,导致医护人员开始忽略这些警报,即使警报是正确的。这意味着AI系统的基本要求不仅仅是准确性。要使AI系统有用,它不仅要准确,还必须能够有意义地改变医护人员的行为——而这种行为改变必须能够实质性地改善患者预后。

这实际上是一个相当高的要求。但当我思考警报、提醒、提示和AI时,我想起了在我的医学生涯中,有那么几次我真心感激临床工作流程被中断的时刻。有几次,电子健康记录中弹出某些信息,我会说:"天哪,我差点漏掉了这个。"可能是关键的药物相互作用,可能是过敏发现,也可能是关于异常实验室值的警报。在医疗实践中,这些我称之为"天哪"时刻,有一个更专业的名称——"诊断漏诊机会"。这可能是AI不仅有用而且会被欢迎的领域。一项新研究刚刚发表,试图评估AI捕捉这些"天哪"时刻的能力。

我想向您介绍这项发表在《美国医学会杂志网络开放》上的研究。它评估了多种大型语言模型(LLMs)正确识别存在漏诊机会的患者情况的能力。这立即引出了一个问题:如何确定哪些患者存在漏诊机会?作者在这方面相当聪明。

他们确定了两组在急诊科(ED)就诊的患者。一组是在急诊科就诊并出院,但在接下来72小时内再次就诊的患者。另一组是在急诊科就诊评估后入院,但在接下来24小时内需要转入重症监护室(ICU)的患者。

在这两种情况下,您可能会认为最初存在某些医护人员可能漏掉的情况。如果AI在这种情况下能够不漏诊,那么这可能是AI温和提醒医护人员考虑诊断X或治疗Y的场景,而医护人员会感激而非愤怒。

现在我知道您在想什么。并非所有在急诊科就诊、出院并在接下来72小时内返回的患者都存在某种漏诊情况。因此,这项研究的第一步是由医护人员手动评估每个案例,尝试确定在初次就诊时是否存在某些情况,如果被发现,可能会导致不同的结果。

例如,在一个案例中,一名患者入院后24小时内被转入ICU。在初次就诊于急诊科时,患者存在大阴离子间隙、血糖升高和酸中毒。然而,急诊科未诊断出糖尿病酮症酸中毒。如果能实时发现这一点,可能会显著改变临床病程。相比之下,一名患者仅表现为腰痛,没有其他令人担忧的症状,急诊科将其出院。该患者在接下来的几天内再次就诊,发现疑似硬膜外脓肿。尽管这显然是一个不良结果,但在初次急诊就诊时没有迹象怀疑该诊断或提示需要更高级的检查。没有发热、白细胞计数未升高、无定位性神经症状。因此,这不应被归类为真正的漏诊。

总体而言,在288个案例中,作者确定了39个(约13.5%)存在有意义的诊断机会的情况,这些机会可能会改变临床结果。我们将此作为真实情况。

这就是有趣的地方,因为我们可以将所有这些数据——包括急诊就诊记录——提供给各种大型语言模型,并简单地询问:这里是否遗漏了什么?是或否?我们还可以询问:这里遗漏了什么的可能性有多大?将其放在一个频谱上,以百分比表示。由于它们是大型语言模型,我们还可以询问这里遗漏了什么?

研究人员正是这样做的。他们将这些数据提供给多个模型,包括Claude Sonnet 4、Claude Sonnet 4.6、Claude Opus 4.6、Gemini 3 Pro、GPT-5和GPT-5 mini。

我们可以从输出中看到一些有趣的分析。首先,我们可以说:在那些确实存在漏诊机会的少数患者中,大型语言模型检测到问题的频率有多高?这是大型语言模型对误诊的敏感性。您可以看到性能范围,其中Claude Sonnet 4表现最佳,GPT-5 mini表现最差。

但敏感性是一把双刃剑。一般来说,在诊断测试中,更敏感的测试——虽然能更好地捕捉到相关案例——也会倾向于引入大量不相关的案例。换句话说,高敏感性模型往往具有高假阳性率——或者说,低特异性。这是经典的敏感性-特异性权衡,有趣的是,我们在所有模型中都看到了类似的情况。最敏感的模型Claude Sonnet 4,也是特异性最低的模型之一,反之亦然。

您可以使用受试者工作特征曲线下面积将敏感性和特异性组合成一个综合指标,这基本上可以全面了解这个诊断测试的效果如何,您可以在这里看到结果,Claude Sonnet 4在出院患者队列中表现最佳。

因此,我们至少有一些证据表明,当这些模型获得与急诊科医生相同的数据时,它们有可能标记出需要再次检查的患者。您可以想象在临床上实施这一点:当医生试图从急诊科出院一名患者时,大型语言模型弹出并说:"嘿,医生,您确定吗?您考虑过这名患者的糖尿病酮症酸中毒吗?"

当然,这才是关键所在,因为当弹出提示且正确,而您没有考虑糖尿病酮症酸中毒时,您会非常感激。但如果它频繁弹出,特别是当它弹出并告诉您患者存在实际上不存在的问题时,人类的自然反应是立即忽略该弹出提示。假阳性往往会破坏对医疗AI系统的信任。这里有一个略显阴暗的真理:假阳性对医疗AI信任的破坏如此之大,以至于漏掉阳性案例比标记假阳性更好。当AI介入轻拍您的肩膀时,它最好是对的。

因此,我认为检查这类系统的最佳方法是想象它们在几次急诊班次中如何工作。假设您是一名急诊医护人员,您将出院100名患者。为了使这个例子具体化,我将使用曲线下面积表现最佳的模型,即Claude Sonnet 4。使用这个最佳模型,在这100名患者中,当您输入出院医嘱时,大约48名患者会弹出提示,说:"嘿,医生,您考虑过X吗?"其中,大约9名是正确的。您会拍着脑袋说:"哦不,我没有考虑过X,您是对的,这名患者需要住院。"其余(约39名)将是假阳性。您会嘲笑这个愚蠢的AI,说:"不,不,他们没事,我还是要出院他们。"几天后,大约有2名患者会回到急诊科,而即使是大型语言模型也没有警告您。

临床实践中会接受这样的系统吗?我的直觉是否定的,以这样的数字来看不会。但这是AI的另一个真理:如果您不喜欢模型的性能,等几周再回来。由于这类文献的发表时间线,这些模型在2026年初的前沿系统(GPT-5、Gemini 3 Pro和Claude Opus 4.6)上的表现达到了顶峰——最后一次使用是在2026年3月。我们现在有几个这些模型的后续版本,可能会表现得更好。

我确实对以这种方式使用大型语言模型有一些深层次的担忧。大型语言模型让我感到不安,因为它们依赖于提示词(prompt),而作者们费尽心思优化他们的提示词以获得他们想要的确切输出。

但对初始条件如此敏感可能会带来问题。毕竟,我们从《侏罗纪公园》中学到了这一点。大型语言模型的输出也是随机的,也就是说,给定相同的输入,它们并不总是生成相同的输出。而在医疗护理中,这种变异性感觉有问题,即使我无法确切指出为什么应该如此。不过,很明显作者也担心这一点,因为在补充材料中,他们指出他们将所用模型的"温度"设置为零。这实际上最小化了模型输出的随机性,但这也带来了代价:当旋钮调到最低时,模型每次都只返回其最可能的答案,因此您失去了对其权衡的各种可能性范围的任何感知。如果这个答案碰巧是错的,它会自信且一致地错误,没有任何变化来提醒您可能值得再看一眼。事实上,其他关于大型语言模型在医学中使用的研究所发现,降低"温度"会增加可重复性但降低准确性。

这些模型是否已经准备好整合到电子健康记录中,以减少或消除医学中的"天哪"时刻?我们可能还没有达到那个地步,但我非常有信心我们会达到。鉴于这些模型的改进速度,我预计AI对临床护理的综述将成为常态。事实上,未来可能会出现这样的情况:不提供AI对临床护理的综述甚至可能被视为医疗疏忽。

我想起了那句古老的诅咒:愿你生活在有趣的时代。

F. Perry Wilson医学博士、医学科学硕士是耶鲁医学院医学和公共卫生副教授,也是耶鲁临床和转化研究加速器的主任。他的科学传播工作可以在《赫芬顿邮报》、NPR和Medscape上找到。他在@fperrywilson发布内容,他的书《医学如何运作及何时不运作》现已出版。

【全文结束】

猜你喜欢
  • 人工智能在医疗保健中的应用:通过应用程序增强诊断和治疗人工智能在医疗保健中的应用:通过应用程序增强诊断和治疗
  • NHS应用引入AI分诊功能作为100亿英镑技术改革的一部分NHS应用引入AI分诊功能作为100亿英镑技术改革的一部分
  • 人工智能如何变革医疗健康:医学影像、诊断与预测性患者护理人工智能如何变革医疗健康:医学影像、诊断与预测性患者护理
  • 人工智能在医疗保健中的应用人工智能在医疗保健中的应用
  • 一次勒索软件攻击如何导致100家医院离线一次勒索软件攻击如何导致100家医院离线
  • NHS加速人工智能部署以减少等待时间并为数百万患者改善护理NHS加速人工智能部署以减少等待时间并为数百万患者改善护理
  • 中欧地区热浪肆虐 瑞士丹麦捷克共和国气温破历史纪录中欧地区热浪肆虐 瑞士丹麦捷克共和国气温破历史纪录
  • NHS应用程序将利用人工智能确定最适合患者的医疗服务NHS应用程序将利用人工智能确定最适合患者的医疗服务
  • NHS加速AI部署以缩短等待时间并改善患者护理NHS加速AI部署以缩短等待时间并改善患者护理
  • 人工智能与机器学习在疾病诊断中的应用人工智能与机器学习在疾病诊断中的应用
热点资讯
全站热点
全站热文