人工智能展示诊断能力之际 科学家反思未来发展路径As AI shows off diagnostic chops, scientists reckon with the way forward

环球医讯 / AI与医疗健康来源:www.bostonglobe.com美国 - 英语2026-08-19 01:14:45 - 阅读时长6分钟 - 2700字
哈佛医学院等机构科学家在《科学》杂志发表研究,证实大语言模型在模拟诊断测试中超越医生表现,但强调该成果不能证明AI适用于真实临床场景。研究团队通过波士顿急诊科76例真实病例测试显示,AI在信息有限的分诊阶段诊断准确率高于医生,但随着医疗信息完善,人机差距逐渐缩小。多位临床AI研究者警告企业可能断章取义推广技术,呼吁开展前瞻性临床试验验证AI在真实诊疗环境中的安全性和有效性,同时指出文本型大语言模型无法处理医患沟通、影像判读等关键临床环节,必须谨慎应对技术迭代与医疗安全的平衡问题。
医疗诊断临床人工智能大语言模型患者安全临床推理急诊科电子病历前瞻性临床试验人机协同诊疗临床决策支持
人工智能展示诊断能力之际 科学家反思未来发展路径

当一篇论文登上《科学》杂志时,往往标志着许多研究者职业生涯的高光时刻。但对于内科医生兼临床人工智能研究者亚当·罗德曼来说,这同时也带来些许困扰。本周四,罗德曼及其团队发表了一系列实验成果,其中包括利用波士顿急诊科真实数据的测试,证明OpenAI的大语言模型在基于病例的诊断和临床推理评估中表现优于医生。作为论文资深作者之一,罗德曼表示,这项研究是对1959年《科学》杂志提出挑战的回应——当年论文曾阐述"如何判定临床决策支持系统能否超越人类进行诊断","如今它们确实做到了"。

然而,随着聊天机器人等生成式AI工具在患者和临床医生中大肆营销,罗德曼担忧这些基于模拟病例和历史数据的科学实验会被曲解为AI治疗真实患者的安全有效证据。"我担心自己的研究初衷——并非取代医生,也不是让患者放弃就医转而咨询聊天机器人;我的目标是运用新技术提升医疗服务——将被资金雄厚的企业利用,这些企业试图跳过医疗中某些必不可少的安全环节,"这位贝斯以色列女执事医疗中心医学助理教授兼谷歌访问研究员坦言,"你能理解我的顾虑。"其他临床AI研究者对实验结果持更谨慎态度,同样表达了这种担忧。

自2022年面向消费者的大型语言模型兴起以来,研究者们纷纷用各类诊断测试检验其能力:医师执照多选题考试、《新英格兰医学杂志》发布的疑难病例研究。哈佛医学院生物医学信息学助理教授、论文资深作者阿琼·马纳赖指出,模型在多数测试中表现良好,但常缺乏与大规模医师群体的对比。他们此次在《科学》论文中详述的实验,旨在通过测试OpenAI 2024年推出的o1-preview模型(新一代"推理型"模型代表)填补这一空白。

"我们竭尽全力向模型抛出各种挑战,"马纳赖说。研究团队复现了多项测试,部分此前已在GPT-4上进行,通过数十名医师的表现作为基准来衡量临床推理能力。多数实验将结构化病例"喂给"大语言模型,但研究团队采取创新方法:要求模型处理贝斯以色列医疗中心急诊科76例随机真实病例的混乱数据。

急诊科医师和患者从未与AI互动。但患者就诊后,"我们直接从电子病历复制粘贴原始文本,不做任何数据整理,包括随机噪声,"论文共同第一作者、贝斯以色列医疗中心内科住院医师彼得·布罗德说,"将这些数据展示给模型和两名内科医生,并要求他们在患者急诊就诊的三个关键节点提供诊断的第二意见。"

在分诊阶段(病历信息有限时),大语言模型识别正确或高度接近诊断的能力优于两名医师;获得全部急诊数据后,AI仍保持优势;直到患者即将住院(信息最完备时),人机诊断得分才最终趋近。例如有患者因抗凝治疗后病情恶化的肺栓塞就诊,事后复盘的两名医师最初怀疑药物失效,而模型却聚焦患者狼疮病史,推测这可能是血栓与其他症状的共同病因——最终确诊为狼疮性胸膜炎(自身免疫疾病引发的心肺炎症)。

论文其他实验(测试o1-preview在临床推理、管理推理和诊断推理方面的文档能力)同样显示,模型表现优于数十乃至数百名临床医师的平均分。"简言之,模型超越了我们庞大的医师基线,"马纳赖表示。

然而,作者及外部专家均强调,这些结果远非支持AI用于临床护理的证据。文本提示的诊断推理与真实医疗实践之间仍存在巨大鸿沟,研究者对发现的可靠性表示担忧。纽约大学AI研究员埃里克·奥尔曼警告,此类高调论文的风险在于"所有人会说'看啊,《科学》杂志证明急诊科语言模型已可直接用于患者',而本文根本未展示类似结论。"

诊断仅是医生工作的微小部分,且未必是首要任务:急诊科注重分诊和即时症状管理,初级保健关注慢性病追踪治疗。研究者常聚焦LLM诊断准确率,因其相对易于测试。马纳赖指出:"现实中,医生与患者交谈、提供建议、倾听诉求、解读影像和心电图,并整合所有信息引导患者做出艰难决策。"作者承认,文本型大语言模型无法处理医生用于诊疗的大量信息。斯坦福大学生物医学数据科学助理教授艾米丽·阿尔森泽说:"真实临床中,医生观察患者即可形成病情严重程度的整体判断",这些视觉信息可能缩小人机表现差距。

临床AI研究者还指出研究方法可能削弱结论:模型表现基于经验丰富的临床医生主观评分,包括何为"高度接近"的诊断标准。阿尔森泽认为"结果在一定程度上被医生对优质鉴别诊断的主观判断所掩盖"。奥尔曼指出,由资深作者提供评分的客观性存疑,罗德曼称此批评"合理"。研究虽包含医师基线,但对比组规模较小——急诊实验仅两名医师提供诊断分数,"实际上一名医师的低分拉大了差距",奥尔曼指出。罗德曼则为对比方法辩护,强调急诊医学并非以诊断准确率为首要目标。

临床AI研究者最终达成共识:大语言模型的诊断表现指向一个方向——必须在前瞻性临床试验中测试AI,特别是观察其与医生协同工作时的表现。布罗德说:"尽管模拟场景中表现强劲,我们如何在真实临床环境中实现人机优势最大化?这才是未来几年的核心目标。"阿尔森泽补充,这意味着让LLM接触患者不完整信息、文本以外的数据输入,以及临床实践中常见的各类患者。

此类试验需精心设计以保障患者安全,尤其当LLM必然犯错时。同时需直面关键问题:AI何时、如何最可能影响患者诊疗和结局?《科学》实验中作为基线的医师主要来自马萨诸塞州和加利福尼亚州大型学术医疗中心的内科医生和全科医生。罗德曼认为,若与专科医生对比或在专科场景中测试,"表现很可能不同"。

然而实施难度巨大。"科技行业常不愿开展涉及五万人、为期一两年的研究,"奥尔曼坦言,"一两年后技术早已迭代。"但该领域正在推进:OpenAI与内罗毕初级保健诊所网络Penda Health去年发布了前瞻性研究预印本,显示AI辅助可减少治疗错误;巴基斯坦随机试验证明AI能提升医生诊断推理能力。《科学》论文研究团队更已推进至新阶段——今年3月,罗德曼、布罗德等人在预印本平台发表谷歌对话式临床代理AMIE在初级保健中的前瞻性研究结果,奥尔曼称其"现象级:这正是我们需要的"。

"我绝非言行不一,"罗德曼强调,"我做完实验后,立即开展了临床试验。"

【全文结束】

猜你喜欢
    热点资讯
    全站热点
    全站热文