两项研究表明,专门的健康大语言模型在一系列诊断和治疗决策方面达到或超越了医生的水平,这表明这些专业健康AI模型正越来越接近展现临床价值。
由德国研究人员开发的Mira在胰腺癌和肺炎等疾病的分析中表现优于医生,而谷歌的Amie则产生了比人类更精确的治疗方案和检查计划,相关结果已于周三发表在《自然》杂志上。
研究表明,专业健康AI工具可以提供比通用消费者AI模型更好的医疗建议。但这些工具的发明者和独立专家警告称,测试是在受控模拟环境中进行的,并不意味着这些工具已准备好用于实际临床应用。
"我们正在预览AI如何改变医学的前景,"德累斯顿工业大学和海德堡大学学术团队共同开发Mira的Jakob Kather表示。
"我认为AI系统类似于飞机上的自动驾驶系统。这些系统可以通过接管常规任务来支持和减轻医疗专业人员的负担,但最终责任始终由医生承担,"他补充道。
Mira从电子健康记录系统中获取患者数据,可以从超过85,000个选项中进行选择,包括下达诊断测试指令、开处方药和安排医疗程序。研究人员使用来自500多个急诊科临床病例的信息对其进行了测试,这些信息通过与扮演患者的AI代理的聊天传递给它。
据《自然》论文显示,Mira在包括阑尾炎和肺栓塞在内的八种疾病诊断准确率达到87.1%,相比之下,跨专业的六名医生组成的专家组的准确率为78.1%。
Amie使用谷歌的Gemini AI模型来响应由扮演患者的演员提供的数据。科学家们将Amie与21名初级保健医生在100个多次就诊的病例场景中进行了测试,这些场景基于当前英国临床实践指南和药物推荐。
科学家们发现,Amie在患者管理推理能力方面与真实医生相当,并且其计划与指南的契合度比医生更高。在困难病例中,它在药物方面的推理能力超过了人类专业人士。
两项AI模型都有局限性,它们的发明者承认了这一点。研究人员表示,Mira仍然对"少量但非零"比例的患者提出了"偏离最佳实践"的治疗建议。
他们补充说,AI代理提供的病例信息可能"比急诊室患者的真实言语更加结构化",遗漏和不一致的情况更少。
Amie的研究代表了一个"里程碑",但AI工具的开发者表示,无论是病例组合还是基于文本的患者场景都不能代表真实的临床环境。
科学家们表示,Amie展示了"有希望的能力",但"尚未准备好用于实际应用",需要做更多工作来解决潜在的推理错误等问题。
未参与这些研究的研究人员赞扬了研究的严谨性,但也重申了这两项研究都是基于对患者进行的严格控制的模拟。
"这与日常医疗中混乱、复杂的人类世界有一定距离,"牛津大学医学社会学教授Catherine Pope表示。
爱丁堡大学健康信息学和数据科学首席教授Julie Jacko表示,AI模型优越性的许多报道实例反映了它们提供的"计划的精确性和完整性",而不是显示"临床正确性的明显差异"。
Jacko表示:"总体而言,这是一项强有力的实验研究,是一个有意义的进步,但它展示的是针对结构化标准的表现,而非完全捕捉真实临床决策的复杂性。"
谢菲尔德大学数学与物理科学学院助理教授Wei Xing表示,鉴于在某一基准测试中通用AI模型得分相似,"关于Amie的优势究竟来自何处也存在问题"。
他表示:"这表明Amie的优势可能更多地反映了AI模型的快速总体进步,而非围绕它构建的特定系统。"
【全文结束】

