语言模型作为急诊室决策支持工具Language Models as Emergency Room Decision Support

环球医讯 / AI与医疗健康来源:www.medscape.com美国 - 英语2026-10-09 07:57:51 - 阅读时长4分钟 - 1859字
最新发表在《科学》杂志的研究表明,大型语言模型在急诊室诊断决策方面已达到甚至超越医生水平,尤其在信息有限的紧急情况下表现更为突出;美国研究团队测试了OpenAI系列模型在真实急诊场景中的应用,发现AI在急诊室接诊点决策上具有显著优势,但多位国际专家指出研究存在仅限文本分析的局限性,强调AI应作为结构化的第二意见工具而非替代品,其临床价值最终需通过真实世界试验验证,包括减少误诊、缩短等待时间和改善患者结果等关键指标。
健康医疗人工智能大型语言模型急诊室临床决策诊断鉴别诊断分诊医生
语言模型作为急诊室决策支持工具

最近发表在《科学》杂志上的一项研究表明,大型语言模型(LLMs)在诊断能力上至少与医生相当。由波士顿贝斯以色列女执事医疗中心住院医师Peter Brodeur博士领导的美国研究团队报告称,在时间紧迫、临床医生必须在有限患者信息下做出决策的情况下,人工智能与医疗专业人员之间的差异最为显著。

Brodeur及其团队评估了OpenAI o1、OpenAI o1-preview和GPT-4o等语言模型的能力。在研究的第一部分,他们使用了主要用于教育和培训的案例目录和数据集:这些包括《新英格兰医学杂志》的诊断报告,以及源自美国内科医师学会播客的案例研究。他们还整合了1994年一项评估计算机辅助诊断系统的"里程碑"研究中的案例简述,以及2021年发表在《美国医学会杂志》上的一项研究。

研究人员要求LLMs描述临床案例,生成并优先排序鉴别诊断,推荐并解释诊断测试,并证明其决策的合理性。他们的回答与原始治疗计划进行了比较,并由两名医生独立评估;当两名医生意见不一致时,他们讨论该案例或由第三位评审员做出最终决定。

急诊分诊性能

在研究的第二部分,研究人员向LLMs和两名医生提供了来自美国急诊室的真实、非结构化数据。可用信息因案例而异——有时是症状和生命体征,有时是病史。有些案例涉及新到达急诊室的患者,而其他案例则是现有患者。利用手头的信息,临床医生和模型确定了从初次急诊室就诊到ICU收治的各个护理点的适当行动方案。然后,研究的两位内科医生作者通过盲审评估了这些回答。

尽管测试的语言模型并不总是提供完全正确的诊断,但它们的输出在大多数情况下被认为至少是有帮助的。大多数建议的测试也被认为是适当的。在当前研究中,测试的模型在急诊室各个接触点的诊断表现和决策方面也优于医疗专业人员。AI的优势在第一个接触点,即急诊室收治时尤为明显。

慕尼黑路德维希-马克西米利安大学人工智能数学基础讲席教授Gitta Kutyniok向科学媒体中心评论研究结果时表示:"总体而言,该研究在方法论上比早期许多AI基准研究更为严谨。它结合了不同临床任务与人类基线、部分盲审评估以及真实急诊室案例。这大大提高了研究的有效性。它令人信服地证明,现代语言模型现在可以在基于文本的医疗诊断任务中达到非常高的性能水平。"

仅限文本的研究限制

德国埃森大学医院诊断与介入放射学和神经放射学研究所人工智能医学研究组组长、高级主治医师Felix Nensa也确认该研究在方法论上是合理的。然而,Nensa认为其实际意义有限,因为测试的模型——OpenAI o1-preview和OpenAI o1——已经在2025年初被o3取代。此外,对于临床任务,越来越多地使用基于代理的系统,这些系统可以访问专业知识数据库,通常远优于纯语言模型。"将研究仅限于基于文本的查询也不够全面。现代模型是多模态操作的;它们特别能够处理图像和视频。这在医学问题上会产生重大差异,"Nensa强调。因此,此类基准测试的实际效用仍然有限。

德国莱比锡大学计算机辅助手术创新中心技术总监Thomas Neumuth也看到了弱点:"一些子实验仅使用了五到六个案例,而'对或错'的评估取决于医学判断。此外,只测试了文本,而不是日常临床实践中实际发生的情况。"因此,Neumuth认为结果只能部分适用。"在日常临床实践中,发生的事情远不止阅读文本:医生观察患者是否显得焦躁不安,听他们的呼吸,看X光片,并提出后续问题。所有这些在研究中都完全缺失,因为模型只获得完全记录的案例。"Neumuth还认为,在三个固定点提供第二意见的任务并不能准确反映真实的急诊室。毕竟,主要重点是快速分诊。

临床医生与AI协作

Kutyniok强调,目前将医生与AI配对被视为最有前途的途径——但前提是这种协作经过精心设计。仅仅合作本身并不会自动改善结果:如果临床医生不加批判地接受AI建议,就会产生自动化偏见。"只有当他们将AI用作结构化的第二意见时,质量最终才能提高,"Kutyniok补充道。

Neumuth强调,AI系统是否真正有帮助无法通过无休止的新桌面测试来确定,而只能通过真实的临床试验。这些试验应该衡量真正重要的指标:减少误诊、缩短等待时间和改善患者结果。并且需要在使用过程中进行持续监测,类似于对新批准药物所做的那样。

本文由Medscape德语版翻译而来。

【全文结束】

猜你喜欢
  • 老年痴呆症血液标志物也可能对心脏和肾脏疾病有用老年痴呆症血液标志物也可能对心脏和肾脏疾病有用
  • 美国需要两种医生,印裔美国人应予以关注美国需要两种医生,印裔美国人应予以关注
  • 肿瘤学中的大型语言模型:潜力遭遇基础设施问题肿瘤学中的大型语言模型:潜力遭遇基础设施问题
  • 肯塔基州需数千名新医生。立法旨在解决农村医疗保健问题肯塔基州需数千名新医生。立法旨在解决农村医疗保健问题
  • 胖猫?减肥药或将惠及你的超重宠物胖猫?减肥药或将惠及你的超重宠物
  • 肿瘤学中人工智能的演变:对试验、工作流程和结果的影响肿瘤学中人工智能的演变:对试验、工作流程和结果的影响
  • 翻译AI在医疗和生物医学中的应用:巨大挑战与STAR机遇翻译AI在医疗和生物医学中的应用:巨大挑战与STAR机遇
  • 肠道健康临床试验:为何你的微生物组可能在2030年前治愈疾病肠道健康临床试验:为何你的微生物组可能在2030年前治愈疾病
  • 耗资2500万英镑的社区诊断中心开放耗资2500万英镑的社区诊断中心开放
  • 肠道检查:7天腹胀消除挑战,助你实现卓越消化与肠道健康肠道检查:7天腹胀消除挑战,助你实现卓越消化与肠道健康
热点资讯
全站热点
全站热文