从《急诊室的故事》中的乔治·克鲁尼到《匹兹堡》中的诺亚·怀利,急诊科医生长期以来一直是广受欢迎的英雄。但或许很快就是他们脱下手术服的时候了?
一项具有突破性的哈佛大学研究发现,在高压的急诊医学分诊中,AI系统的表现超过了人类医生,在人们刚被紧急送往医院的生死攸关时刻,AI的诊断更为准确。
独立专家将这些结果描述为AI临床推理能力的"真正进步",该结果来自于一项测试数百名医生与AI反应的试验。
作者表示,发表在《科学》杂志上的结果显示,大型语言模型(LLMs)"已经超越了大多数临床推理的基准"。
其中一项实验聚焦于76名抵达波士顿一家医院急诊室的患者。AI和一对人类医生各自被给予相同的标准化电子健康记录进行阅读——通常包括生命体征数据、人口统计信息以及护士关于患者就诊原因的几句话。AI在67%的案例中识别出了准确或非常接近的诊断,超过了人类医生50%-55%的正确率。
研究表明,在需要快速决策且信息最少的分诊情况下,AI的优势尤为明显。当提供更多细节时,AI(OpenAI的o1推理模型)的诊断准确率上升到82%,而专家人类的准确率为70-79%,尽管这种差异在统计上并不显著。
当被要求提供长期治疗计划(如提供抗生素方案或规划临终过程)时,AI也优于更大群体的人类医生。AI和46名医生被要求检查五个临床案例研究,计算机制定的计划明显更好,得分为89%,而使用常规资源(如搜索引擎)的人类得分为34%。
但研究人员表示,急诊医生的职业生涯尚未结束。该研究仅测试了人类与AI在可通过文本传达的患者数据上的表现。AI对患者痛苦程度和视觉外观等信号的解读并未经过测试。这意味着AI的表现更像是基于纸质文件提供第二意见的临床医生。
"我不认为我们的发现意味着AI将取代医生,"哈佛医学院AI实验室负责人、该研究的主要作者之一阿琼·曼赖(Arjun Manrai)说,"但我认为这确实意味着我们正在见证一项将重塑医学的真正深刻的技术变革。"
该研究在波士顿贝斯以色列女执事医疗中心进行,另一位主要作者、该中心的医生亚当·罗德曼(Adam Rodman)博士表示,AI大型语言模型是"数十年来最具影响力的技术之一"。他表示,在未来十年,AI不会取代医生,而是将以新的"三元护理模式"加入医生行列……即医生、患者和人工智能系统。
在哈佛研究的一个案例中,一名患者出现肺部血栓和症状恶化。人类医生认为抗凝剂失效,但AI注意到了人类没有注意到的情况:患者的狼疮病史可能导致肺部炎症。事实证明AI是正确的。
根据上个月发布的一项研究,近五分之一的美国医生已经在使用AI辅助诊断。根据英国皇家医师学会最近的一项调查,在英国,16%的医生每天使用该技术,另有15%每周使用,"临床决策"是最常见的用途之一。
英国医生最大的担忧是AI错误和责任风险。数十亿美元正在投入AI医疗保健公司,但关于AI错误后果的问题仍然存在。
"目前还没有正式的责任框架,"罗德曼说,他还强调,患者最终"希望人类在生死决策中引导他们[并且]在艰难的治疗决策中引导他们"。
爱丁堡大学医学信息学中心联合主任尤恩·哈里森(Ewen Harrison)教授表示,这项研究很重要,表明"这些系统不再只是通过医学考试或解决人工测试案例。它们开始成为临床医生有用的第二意见工具,特别是当需要考虑更广泛的可能诊断并避免遗漏重要事项时。"
谢菲尔德大学数理科学学院助理教授魏星(Wei Xing)博士表示,其他一些发现表明,医生可能会无意识地遵循AI的答案,而不是独立思考。
"随着AI在临床环境中更常规地使用,这种趋势可能会变得更加显著,"他说。他还强调了关于AI对哪些患者诊断效果较差以及是否在老年患者或非英语使用者身上表现更差的信息缺乏。
他说:"这并不能证明AI适合常规临床使用,也不能证明公众应该将免费可用的AI工具作为医疗建议的替代品。"
【全文结束】

