急诊室给予OpenAI的o1的诊断测试比医学考试题目要困难得多。
在一项使用真实医院就诊患者记录的盲测研究中,该AI系统诊断急诊病例的准确率高于两名主治医师。哈佛医学院和贝斯以色列女执事医疗中心的研究人员在《科学》杂志上发表的这一发现表明,医学AI测试正开始接近真实护理中的复杂情况。
对于医院、研究人员和监管机构而言,这项研究提出了一个更大的问题:当安全、检测决策和临床判断仍然决定患者治疗走向时,诊断准确性应占多大比重?
研究人员未预料到的结果
该研究的高级作者之一、哈佛医学院贝斯以色列女执事医疗中心医学助理教授亚当·罗德曼(Adam Rodman)在进行急诊室实验时期望值很低。
罗德曼说:"我以为这会是一个有趣的实验,但效果不会太好。结果完全出乎意料。"
这项急诊室实验包含了来自贝斯以色列女执事医疗中心的76个病例,将OpenAI的o1与GPT-4o以及医生基线进行比较。最大的差距出现在护理的最早阶段。在初始分诊时,当患者信息最为有限的情况下,o1在67.1%的病例中识别出精确或非常接近的诊断。而医生的得分分别为55.3%和50%。
该系统在急诊过程后期也保持领先,包括医生接触后以及入院至医疗病房或重症监护室阶段。
真实记录,真实不确定性
该研究的急诊部分摒弃了经过修饰的医学案例研究,将模型测试得更接近医院中诊断的实际展开方式。
该研究的共同第一作者托马斯·巴克利(Thomas Buckley)表示:"为了更好地了解现实世界的表现,我们需要在患者病程早期、临床数据稀少时测试性能。"
急诊科病例直接取自电子健康记录,哈佛方面表示,团队在将数据输入模型之前没有进行预处理。AI必须处理不完整、非结构化的患者信息,这些信息与临床医生仍在试图弄清楚发生了什么的早期时刻相同。
AI医生并非绿灯通行
研究人员并不主张AI应该独立诊断患者。《科学》论文指出,这些发现为前瞻性临床试验提供了依据,同时需要更多研究探讨临床医生和AI系统如何在真实护理环境中协同工作。
诊断准确性只是急诊护理的一部分。医生仍需权衡风险、安排检测、决定患者是否应入院,并对记录中可能永远不会清晰显示的细节做出反应。
该研究的共同第一作者、哈佛医学院贝斯以色列女执事医疗中心医学临床研究员彼得·布罗多尔(Peter Brodeur)表示:"模型可能会正确得出主要诊断,但也可能建议不必要的检测,使患者面临风险。在评估性能和安全性时,人类应该是最终的基准。"
下一步测试将是像o1这样的系统在医生使用时能否改善护理,而不仅仅是能否在诊断评分卡上击败医生。
研究人员发现,AI能够在医生之前很早检测到许多胰腺癌的早期病例。
【全文结束】

