最近的一项研究表明,人工智能系统在广泛的医学推理测试中表现优于医生,包括基于真实记录的混乱急诊科病例。
这一结果将医疗人工智能从考试成功推向更严峻的问题:能否在医院环境中进行安全测试。
AI有效处理混乱记录
在76份急诊科记录中,该模型面对的是零散的笔记、缺失的细节以及在确诊前做出的早期决策。
哈佛医学院医学数据研究助理教授Arjun K. Manrai通过比较急诊科记录与医生答案,确定了AI系统的优势所在。这种优势甚至持续到患者进入更清晰的住院阶段之前。早期的不确定性——而非经过整理的教科书案例——成为无法忽视的关键压力点。
AI早期表现优于医生
在急诊分诊环节——即急诊护理的首个筛选步骤——该模型在67.1%的病例中给出了精确或非常接近的诊断。随着急诊医生收集更多信息,准确率上升至72.4%,入院时达到81.6%。
主治医生(负责监督患者护理的医生)在获取更多事实后表现也会提升,但其早期得分始终低于AI。这一差距使护理最初的几分钟成为最具说服力的对比环节。
传统考试已不再适用
自1959年以来,书面诊断案例一直是医生和计算机科学家设定医疗AI基准的工具,即用于比较系统的标准测试。随着新型模型在旧考试中接近满分,多项选择题得分逐渐失去意义。
“我们过去用多项选择题评估模型;现在它们持续接近100%的得分,我们无法再追踪进展,因为已经触及上限,”该研究主要作者之一Peter G. Brodeur博士表示。近乎完美的分数迫使研究人员测试当真实病历仍保持混乱状态时,成功表现是否依然成立。
AI提供诊断建议与步骤
这些分数由大型语言模型生成——一种通过分析海量数据集中的模式来生成文本的软件。该系统来自OpenAI的o1系列,这是经过逐步医学推理测试的模型家族。
它不仅选择单一答案,还列出可能的诊断并建议后续护理步骤。这项更广泛的任务使测试更接近医生的日常工作,尽管仍局限于书面信息。
真实健康记录存在混乱
波士顿教学医院贝斯以色列女执事医疗中心(BIDMC)的记录在模型分析前未经清理。真实的电子健康记录——存储患者护理细节的数字文件——通常混杂着旧笔记、重复条目和缺失线索。
“我们完全没有预处理数据,”BIDMC临床研究员Adam Rodman博士表示。混乱的输入至关重要,因为细微的遗漏可能改变哪个诊断显得足够紧急而需要优先处理。
AI诊断可能带来的风险
即使主要诊断正确,当系统要求进行不必要的额外检查时,仍可能使护理偏离正轨。额外的扫描、血液检测或手术可能引发误报、延误、成本增加和身体风险。
“模型可能给出正确的首要诊断,但也建议不必要的检测,使患者面临伤害风险,”Brodeur指出。因此,安全性取决于整个建议方案——而不仅仅是诊断列表上的第一个名称。
医生仍能观察更多细节
临床护理不仅依赖文本,而本次测试未衡量医生注意到的所有细节。声音、呼吸努力、姿势、影像、家属担忧和床边变化都可能在笔记跟上前指导决策。
当前的基础模型——为多项任务训练的广泛AI系统——在声音和影像承载关键线索时仍面临更大挑战。这一边界使该结果无法成为支持用人工智能取代床边临床医生的论据。
AI与医生直接对比
人类对比使团队工作更具说服力,因为该模型不仅与旧软件竞争。数百名医生在病例挑战、管理计划、概率评估和急诊科第二意见方面提供了比较基准。
在BIDMC真实记录测试中,评审人员被蒙蔽——即不知诊断来自人类还是模型。这种设计减少了偏见,但无法证明该工具是否改善实际患者护理。
医疗AI的未来
强劲的基准测试分数如今为医院、监管机构、开发者和需要证据的患者带来了实际问题。前瞻性临床试验将测试AI辅助是否在真实就诊中改变患者治疗结果。
“我们让AI模型几乎经受了所有基准测试,它在先前模型和医生基线表现上都实现了超越,”Manrai表示。这种性能水平要求测试系统在真实护理中的行为——其中延误、过度检测、遗漏线索和错误自信都可能影响患者结果。
对医学的启示并非机器将取代医生,而是书面第二意见可能很快成为可测试的工具。安全使用将要求医生、工程师和患者同时评估准确性、伤害风险、速度、成本和信任度。
该研究发表在《科学》杂志上。
【全文结束】

