根据周四发表在《科学》杂志上的一项研究结果,能够"推理"的人工智能现在已经能够诊断现实生活中的医疗案例,表现与医生相当甚至更优。
研究人员使用之前未知的临床案例来测试OpenAI的推理模型o1,将其与该公司的旧模型GPT-4以及医生和医学生进行对比。
在一系列实验中,o1模型通常显著优于GPT-4的诊断能力,甚至胜过医生。当使用波士顿一家医院随机急诊科病例的电子健康记录进行测试时,o1模型在初步分诊时的诊断准确率超过三分之二。而两名专家主治医生的正确诊断率约为一半。
加州大学旧金山分校医学院教授兼主席Robert Wachter博士将这项研究结果描述为"重要",并表示现在可以"毫无疑问"地认为,现代人工智能在识别正确诊断和下一步措施方面将优于旧版大型语言模型和医生。他并未参与这项研究。
然而,著有《巨变:人工智能如何改变医疗保健及其对未来的意义》一书的Wachter补充说,在人工智能全面应用于临床实践之前,还需要进行更多研究。
Wachter在一封电子邮件中写道:"问题是这项研究在多大程度上真实反映了现实生活,答案是中等程度良好但不完美。"
正如研究作者所承认的,实验仅限于文本输入,不包括医生通常用于诊断的视觉和听觉线索。这些可能包括患者的痛苦程度和医学影像。
Wachter表示:"通用人工智能可能开始整合这些输入,但目前,对书面且通常人为'干净'的临床案例场景的测试与进入急诊室处理混乱情况并不相同。看看《匹兹堡》就知道了。"
Mount Sinai泌尿科讲师Ashwin Ramaswamy博士曾研究过人工智能回应消费者健康咨询的能力,他对该研究也表达了类似的回应。
尽管他称赞了研究的设计,但Ramaswamy指出,人工智能推理所依据的临床信息是由人类收集、筛选和记录的。在现实生活中,患者可能害怕、醉酒或病情正在恶化,这些都是医生在诊断时面临的挑战。
Ramaswamy在电子邮件中表示:"这很有价值,它显示了技术的进步使其表现如此出色,但它跳过了'当医生'工作的核心部分。"
他还希望了解医生和大型语言模型所犯错误的具体细节。如果模型犯的是可以理解的接近正确但有偏差的错误,那与危险且无法解释的错误是不同的。
在Ramaswamy自己最近对ChatGPT Health的评估中,他和同事的研究发现人工智能的失败模式可能是"参差不齐"的。换句话说,人工智能在诊断罕见、困难的疾病时可能表现出色,但仍可能错过临床上显而易见的问题。这项研究作为同行评审的提前发表论文发表在《自然医学》上。
Ramaswamy表示,这项新研究加强了将人工智能用作"受监督的面向临床医生的第二意见工具"的理由。
事实上,基于他们的发现,研究作者强调迫切需要进行更多研究和前瞻性临床试验,以确定人工智能系统如何改善临床实践和患者预后。
"大型语言模型的快速进步对临床医学的科学和实践具有重大意义,"作者写道,其中许多人任职于进行该研究的波士顿贝斯以色列女执事医疗中心。
另一篇同期发表在《科学》杂志上的相关文章由澳大利亚阿德莱德弗林德斯健康与医学研究所的两位专家撰写,他们虽未参与该研究,但也同意其紧迫性。他们还反对用人工智能替代医生,而是设想一种提供监督、情境判断和问责的合作模式。
专家们写道:"如果没有经过充分验证的有效性、公平性和安全性,许多人工智能系统仍将不足以用于临床使用。"
【全文结束】

