哈佛大学最新研究发现,先进人工智能模型在诊断患者时已能超越医生,特别是在高压的急诊室(ER)场景中。研究人员将OpenAI的先进o1语言模型与数百名医生在多个诊断环节进行直接较量,发现该AI在诊断病情和规划临床管理方面 consistently 超越人类医生。
这项发表于《科学》期刊的新研究,将贝斯以色列女执事医疗中心急诊室的76个临床案例提供给OpenAI的o1模型和两位专家主治医师。研究发现,o1在多项任务中表现达到或显著优于人类专家:
初始分诊:当信息量最少时,o1在67.1%的案例中识别出精确或高度接近的诊断,而两位医生的准确率分别为55.3%和50%。
急诊评估:随着医生初始评估中患者信息的增加,该模型的准确率提升至72.4%,而两位医生分别为61.8%和52.6%。
住院诊断:在最终阶段(患者转入医疗病房或重症监护室时),o1准确率达81.6%,再次超越两位医生的78.9%和69.7%。
研究还发现,当要求提供治疗方案(如开具抗生素或规划临终决策)时,AI具有明确优势。在五项案例研究中,AI的中位数得分达89%,大幅超越使用常规资源(约34%)和GPT-4(41%)的医生。
研究人员表示:"尽管将AI应用于临床决策支持有时被视为高风险行为,但更广泛使用这些工具可能有助于减轻诊断错误、延误及资源获取不足带来的人力与经济成本。"
"我们的发现表明,大语言模型(LLMs)现已超越多数临床推理基准,迫切需要开展人机交互研究和前瞻性临床试验,以严格评估AI系统改善临床实践和患者预后的潜力。"他们补充道。
不过研究人员也警告,临床医学涉及大量非文本输入,如患者身体痛苦程度或医学影像解读。这意味着未来研究需重点评估人类与机器如何有效协作。
研究首席作者之一阿琼·马奈在《卫报》声明中指出:"我认为研究结果并不意味着AI将取代医生,但它确实意味着我们正见证一项将重塑医学的深刻技术变革。"
【全文结束】

