一位患者因肺栓塞(一种移动至肺部的血栓)来到医院就诊。在症状最初有所改善后,病情却开始恶化。医疗团队怀疑药物治疗效果不佳。
此时,人工智能——带着自己的理论——登场了。
该系统已扫描了医疗记录,并怀疑患者可能有狼疮病史,这是一种可能导致心脏炎症的自身免疫性疾病,或许能解释患者真正的问题所在。
事实证明,AI模型是正确的。
根据周四发表在《科学》(Science)杂志上的一项研究,这类场景可能在不久的将来成为现实。
哈佛医学院(Harvard Medical School)和贝斯以色列女执事医疗中心(Beth Israel Deaconess Medical Center)的研究人员发现,OpenAI开发的一款AI推理模型在诊断患者和制定护理管理决策方面表现出色。该模型的表现与医生相当,甚至常常优于医生和早期AI模型GPT-4。
研究团队进行了一系列实验来测试该AI模型的临床判断能力——包括实际案例,例如那位曾在波士顿贝斯以色列医疗中心急诊科接受过治疗的狼疮患者。
研究小组评估了该AI模型在三个不同时间点提供准确诊断的能力,从急诊科分诊阶段到入院期间。
总体而言,AI的表现超过了两名经验丰富的内科医生——而且仅依靠电子健康记录和当时医生所能获得的有限信息就做到了这一点。
"对我来说,这是最重要的结论——它能够处理急诊科混乱的真实世界数据,"贝斯以色列医疗中心的临床研究员、该研究作者之一亚当·罗德曼(Adam Rodman)博士说,"它能够在现实世界中进行诊断。"
该研究的其他部分聚焦于发表在《新英格兰医学杂志》(New England Journal of Medicine)上的病例报告和临床简报,以评估AI模型是否能够达到公认的"基准"并解决棘手的诊断问题。
"该模型的表现超过了我们庞大的医师基线,"哈佛医学院生物医学信息学助理教授、该研究参与者拉吉·曼雷(Raj Manrai)说。
作者强调,AI仅依靠文本信息,而在现实生活中,临床医生在诊断和治疗患者时需要关注许多其他输入,如图像、声音和非语言线索。
尽管如此,这项工作展示了该技术在过去几年中取得的巨大进步。早期版本的大语言模型在处理不确定性以及生成可能解释症状的条件列表(即鉴别诊断)时表现不佳。
"这篇论文完美地总结了事物改善的程度,"纽约西奈山医疗系统(Mount Sinai Health System)首席临床官大卫·赖希(David Reich)博士说,他没有参与这项研究。
"你拥有某种相当准确的东西,可能已经准备好投入实际应用,"他说,"现在的问题是如何以真正改善护理的方式将其引入临床工作流程。"
毕竟,得出某个棘手的最终诊断——AI模型擅长的事情——并不一定反映"真实临床医学"中事情的发展方式,赖希说,在真实临床医学中,"结果更加微妙,可能也更加多样化。"
而且,急诊科只是患者全部医疗护理的一小部分。罗德曼承认,如果团队提供了在医院住院一个月的患者记录,AI可能不会表现得如此"令人印象深刻"。
曼雷表示,参与这项新研究的人员都不认为研究结果支持用AI取代医生,"尽管一些公司可能会这么说,也可能会这样利用这些结果。"
"我认为这意味着我们正在见证一项将重塑医学的真正深刻的技术变革,"他补充道。
但研究结果确实表明,AI模型需要以严格的方式进行测试,理想情况下应通过前瞻性试验来更确定地了解该技术最终如何影响临床实践。
"设计这些试验是一个非常具有挑战性的过程,"赖希说,"但这项研究是一个完美的行动号召。"
更正 2026年5月1日
先前的标题错误地表示AI优于急诊科医生。事实上,该研究将AI与内科医生进行了比较。
【全文结束】

