一篇新研究调查了人工智能在急诊室环境中的表现,发现它在诊断患者方面超过了医生。
这项周四发表在《科学》(Science)杂志上的研究评估了OpenAI于2024年发布的o1模型。该模型是一种专注于推理的人工智能,特别设计用于解决复杂的结构化问题。这使得它与像ChatGPT这样的聊天机器人有很大不同,后者是OpenAI设计的通用型AI。
尽管研究结果积极,但研究人员强调了研究的局限性,并担忧他们的结果可能被他人用来建议用AI取代医生。贝斯以色列女执事医疗中心(Beth Israel Deaconess Medical Center)的内科医生和医学教育家、该研究的合著者亚当·罗德曼(Adam Rodman)博士表示,他对"这些结果可能被如何使用感到有点不安"。
研究发现了什么?
研究团队以不同方式测试了该模型。第一种方式是针对精选的医学培训案例进行测试。这些案例专门设计用来测试医生的诊断思维,就像医生在学校参加的考试一样。
在这些测试中,AI模型在这些场景中始终表现更优。但AI真正表现出色的测试是使用历史真实世界急诊病例。
在这项测试中,研究人员从贝斯以色列女执事医疗中心提取了患者病例,以尽可能接近真实条件。研究人员指出,他们给AI提供了原始电子健康记录数据,这些数据被描述为"混乱的",类似于实际医生遇到的情况。
研究团队在两个不同的时间点测试了数据:当患者到达分诊处时,以及当患者准备入院时。在第一次测试中,AI正确诊断的几率为67%,而与之对比的两位人类医生分别为50%和55%。当患者准备入院时,AI的诊断准确率上升到81%,而人类医生分别为70%和79%。
尽管测试不是在医院就诊期间进行的,但研究人员发现AI在做出诊断方面是有效的。
根据Vox的报道,罗德曼说:"我们可以明确地说……推理模型能够达到人类表现最高水平的诊断推理标准。"
ChatGPT仍然不是医生
虽然为医疗领域开发的特定模型在测试中表现良好,但这并不意味着ChatGPT或其他大型语言模型可以替代普通医生。这是研究人员特别指出的一点。
罗德曼说:"没有人应该看到这个就说我们不需要医生了。"
今年2月发表在《自然医学》(Nature Medicine)杂志上的一项先前研究发现,ChatGPT在52%的案例中低估了患者病情的严重程度。
为了测试这一点,研究人员给聊天机器人提供了一系列医疗场景,从非紧急到医疗紧急情况,并评估了其评估表现。在AI未能注意到诊断严重性的一个例子中,该机器人告诉一个濒临糖尿病休克或呼吸衰竭的患者只需自行监测,而不是寻求即时治疗。它还反复未能察觉到明显的自杀意念迹象。
周四发表这项研究的作者要求,在任何医院部署更多AI之前,应将其研究用于测试AI在现实世界条件下表现的临床试验。
作者写道:"我们的发现表明迫切需要进行前瞻性试验,以评估这些技术在现实患者护理环境中的应用。"
【全文结束】

