医学AI实施的悖论The Paradox of Medical AI Implementation - by Eric Topol

环球医讯 / AI与医疗健康来源:erictopol.substack.com美国 - 英语2026-08-19 14:44:21 - 阅读时长10分钟 - 4628字
本文深入剖析了医学AI实施中的核心悖论:尽管深度学习AI在医学影像领域已有十余年研究积累,如视网膜图像分析可预测多种疾病、胰腺癌早期检测等技术已通过严格验证,却未被纳入常规医疗实践;与此同时,生成式AI虽缺乏真实世界证据支持,却已被数千万美国人和大量医生广泛用于医疗决策,揭示了"已验证但未实施"与"未验证但已广泛使用"之间的矛盾,作者呼吁在已证实有效的领域加速AI应用,同时开展必要临床试验以验证其在关键医疗决策中的实际效果,解决这一阻碍医疗AI发展的核心矛盾。
医学AI医学影像AI生成式AI大型语言模型疾病风险预测疾病早筛医疗诊断AI辅助诊疗健康评估临床试验医疗实践高性能医学
医学AI实施的悖论

2012年,随着赢得ImageNet挑战赛的卷积神经网络(AlexNet)的出现,深度学习AI时代正式开启。当时的图像都是日常物品、动物和场景,与健康和医学无关。七年前,我在《自然·医学》杂志上发表了一篇题为"高性能医学"的综述,总结了AI在解读医学图像方面的显著进展。如今,几乎所有类型的医学图像都已通过AI进行了广泛评估,包括X光片、CT、MRI、超声波、病理切片、皮肤异常、心电图、内窥镜和视网膜照片。

几周前,我在《真相基础》中以及随后在《柳叶刀》上撰文,介绍了三种应应用于每次乳腺X光检查的AI工具,这些工具基于一项对超过10万名女性的大型随机试验以及最近获得的两项FDA批准。已有4项关于结肠镜检查的随机试验一致且综合地证明,与没有AI辅助的胃肠病学家相比,AI辅助在检测腺瘤性息肉方面具有显著优势,但这些技术仍未纳入标准医疗实践。

在本期《真相基础》中,我将回顾深度学习时代(Transformer模型之前的深度学习)的AI应用与当代大型语言模型(LLMs),即生成式AI(Transformer模型的产物,尽管仍属于深度学习的一种形式)之间的鲜明而矛盾的对比,后者因2022年底ChatGPT的发布而广为人知。

深度学习时代的医学AI

从2018年开始,我们注意到当AI"看到"视网膜眼底照片或光学相干断层扫描(OCT)时,其中包含的信息远超眼科医生所能检测到的。这让我们认识到,通过对数十万至数百万张图像的监督学习可以产生"超人视力"。随后发表了多篇关于视网膜图像AI的论文,支持视网膜图像作为通往人体几乎每个器官的门户,甚至可以在症状出现前多年预测帕金森病和阿尔茨海默病的风险。这些研究都是基于单一深度学习模型,探究图像预测特定疾病的能力。我在2023年就此做了一场TED演讲。

几年前,Pearse Keane及其同事发表了首个视网膜基础模型,这是一个拥有多种下游任务的通用数据集,称为RETFound(基于160万张图像),展示了其对心脏病、中风、青光眼和帕金森病的预测能力。本周,一项新的视网膜图像基础模型(Reti-Pioneer)发表,基于10多万张照片,将甲状腺疾病、痛风和骨质疏松症添加到已建立的疾病列表中,包括先前确定的2型糖尿病、高血压和高脂血症,用于风险水平判定(见图示总结)。

谁会想到一张视网膜图像竟然如此丰富?!

大多数人每年或每隔一年会进行一次眼部检查,通常包括视网膜照片。超过一半的美国人去年进行了眼部检查,即超过1亿人。然而,已发表的关于视网膜"超人视力"的非凡进展,却未被纳入常规医疗实践!

尽管视网膜AI尚未普遍应用,但至少有4家公司已着手为患者提供特定结果,尽管在美国使用有限。Optain提供心血管风险评估,Toku Eyes提供慢性肾病风险和生物年龄评估,Mediwhale提供心血管和肾脏风险评估,而i-Cognitio Sciences(总部位于香港)则提供阿尔茨海默病风险评估。尽管各种疾病风险的准确性并非100%(=接收者操作特征曲线下面积,AUROC为1.0),但这些信息可以以名义成本(1美元)或免费提供给所有进行眼部检查的人,覆盖15多种疾病。但由于缺乏实施这一庞大工作和证据的协调机制,以及报销等问题,这些技术未能推广。这是一种可以且应该轻松应用于每张视网膜图像的软件,有朝一日应成为我们使用智能手机自动捕捉眼底并读取结果的"医疗自拍"的一部分。

上周发表的一项AI检测胰腺癌的研究显示,该AI能在放射科医生之前3年检测到导管腺癌(PDA)(中位提前间隔475天),而AI对隐匿性PDA的检测率几乎翻倍(分别为73%和39%)。该多中心研究还进行了外部验证。昨天,FDA批准了一种用于胰腺癌的实验性药物,结果非常令人鼓舞。那么,我们是否应该能够使用AI在临床发现之前检测胰腺癌呢?

在中国,通过胸部和腹部CT进行胰腺癌AI检测正变得常规化,他们使用经过验证的AI工具PANDA。也就是说,即使扫描是为其他目的而进行的,AI也会自动用于检测。这就是现在被称为"机会主义AI"的本质。示意图展示了几个例子。

这张示意图是在ChatGPT Images 2.0的帮助下制作的

我已将错失的影像学机会总结在表格中。就在几周前,我在《真相基础》中写道,可以通过低分辨率胸部CT的AI分析获得"胸腺健康评分"。这可以获取关于免疫系统健康的关键信息,而这些信息是临床上无法获得的。由于未能将经过验证的AI检测方法纳入我们的医学扫描,我们正在错失大量有价值的医疗信息。这甚至不包括心电图、病理切片和许多其他类型的医学图像中我们尚未通过AI提取的信息。

大型语言模型时代的医学AI

在《自然·医学》4月刊中,编辑们发表了这篇呼吁证据的文章。这让我想起了电影《甜心先生》中Cuba Gooding的著名台词"Show me the money"(给我看看钱)。

与医学图像AI相比,医学领域生成式AI的证据却十分匮乏,后者已进行了许多随机试验和前瞻性评估并有外部验证。但这并未阻止公众或医生使用AI聊天机器人和大型语言模型。根据多项调查,12%的成年人每天使用AI聊天机器人,约4000万人,而在过去一年中使用聊天机器人获取健康信息的比例估计在32%至73%之间。根据2026年3月美国医学会对1700名医生的最新调查,72%的医生至少在一个用例中使用生成式AI,35%用于直接患者护理,即非行政性的决策。图表将这一比例外推至约100万名医生。

这张简单图表是用ChatGPT Images 2.0制作的

下图显示了到2026年底医生使用AI的预期(基于AMA调查)。你可以看到预期与当前使用情况大相径庭!请注意诊断辅助的计划。

对于基于AI的决策支持,例如医生进行诊断或对患者进行最佳管理,证据是什么?我们实际上没有任何"真实世界"的数据。本周在《科学》杂志上,多项(6项)实验评估了2种大型语言模型(OpenAI的o1和ChatGPT 4)以及医生对病例简报的表现,支持了改进推理的潜力,并在模拟真实世界急诊室决策的3个接触点中,与2名医生相比,o1改善了初始分诊决策。大多数出版物使用病例研究、模拟和演员作为患者。这很难代表医学实践混乱的现实世界。

在患者方面,同样存在证据不足的问题。一个有限的例外是一项针对100名成年患者的小型前瞻性单臂研究(已发表预印本),比较了模型(AIME)与初级保健医生在鉴别诊断和管理计划方面的表现,结果显示两者相当。一项关于ChatGPT Health帮助将患者(模拟)分诊为留在家中还是前往急诊室的研究对AI表现不佳,AI对真实紧急情况(如糖尿病酮症酸中毒或即将发生的呼吸衰竭)存在许多明显的分诊错误。

在一项将LLM辅助患者与10种医疗"场景(非真实世界)"进行比较的随机试验中,患者表现不佳,结论是"我们建议在医疗保健公开部署前进行系统的人类用户测试,以评估交互能力。"

有少数例外表明缺乏真实世界评估,包括《自然·健康》上发表的关于在肯尼亚16家初级保健诊所使用LLM的论文,以及一项眼科护理的单中心随机试验。后者发现使用AI的眼科医生诊断率更高(92.2%),而未使用AI的医生诊断率为75.4%。

总之,几乎没有证据表明LLM对患者或医生的健康结果有益。这并不是说生成式AI没有帮助。它为行政工作提供了强有力的支持,例如为医生总结病历、为患者审查检验结果、为临床医生和患者提供相关出版物,或帮助医生进行预先授权和患者解决计费问题。AI聊天机器人正在帮助患者为就诊做准备,理解他们的诊断和处方。

但回到《自然·医学》要求提供证据的呼吁,我们需要这些证据。要让LLM帮助医生做出关键诊断或治疗决策,需要进行前瞻性研究,最好是随机的,但至少要严格且大规模,并对健康结果进行独立裁决。对于公众而言,我们如何知道输入所有数据会导致正确的诊断或治疗?本周我们了解到,向AI报告的症状质量与向医生报告的症状质量相比存在缺陷。患者使用生成式AI的益处与潜在危害相比如何?

总结

我已经回顾了一个主要悖论:用于医学图像的AI已有十多年广泛研究,却"未被实施"。无论是乳腺X光检查、CT扫描、视网膜图像还是结肠镜检查,所有这些都经过了广泛研究,它们在提高医学准确性和风险评估方面的价值正在被忽视,基本上被无视。

另一方面,数千万美国人正在使用AI聊天机器人为医疗提供支持,相当比例的医生也是如此。使用AI有很多容易支持的理由,因为它代表了网络/谷歌搜索的延伸,只是响应更具针对性和深度,不属于监管范围。但当涉及到做出诊断或提供治疗计划时,需要有证据证明LLM正在提高准确性和结果。

我们已经看到多项研究(同样不是真实世界)显示,AI在各种任务中的表现优于"与AI一起工作"的医生,包括本周《科学》杂志的新论文,表明我们甚至还不知道AI部署的最佳方式("人机协作"问题)。正如Raj Manrai在他对《科学》论文的出色解释线程中所写,作为该论文的高级合著者之一:"我们的结果实际上呼吁什么?前瞻性临床试验。卫生系统现在投资基础设施。跟踪不仅诊断准确性,还有安全性、效率和成本的监测框架。科学已经达到了一个可以证明试验合理性的阶段。"没有这些,我们无法实现依靠生成式AI进行关键决策的高性能医学。

一个难点是,不幸的是,当同行评审论文发表时,所评估的模型已经过时(例如o1是纯文本的,而GPT5.5是多模态的,才是当前标准)。这可能会给AI支持者提供借口,称AI性能不理想是因为模型薄弱和过时。然而,现实是需要证明它。快速作为预印本发表。

我们才刚刚进入医学领域的LLM时代几年。Waymo始于2009年,经过15多年严格、迭代的工作,才显示出其在结果方面的真正超人表现,与人类驾驶员相比,严重事故减少了90%以上。让我们解决医学AI实施的这一悖论。这是一个双重且重大的任务:在已证明有效的领域加强医学AI的使用,并进行必要的临床试验,以证明在关键证据缺失领域的广泛采用是合理的。

注:本文由我本人撰写,未使用AI。有两张图片是在AI帮助下制作的,如文中所述。我与本文内容无利益冲突。

非常感谢《真相基础》的订阅者(超过20.5万人),他们来自美国各州和212个国家。您订阅这些免费文章和播客使我的工作变得有价值。如果您还不是订阅者,请加入!

如果您觉得这篇文章有趣,请分享!

付费订阅是自愿的,所有收益都用于支持Scripps研究所。付费订阅允许发布评论和提问,我会尽力回复。请随时发表评论并提供反馈。告诉我您希望看到哪些主题。

非常感谢那些做出贡献的人——他们极大地帮助资助了我们过去两年的暑期实习项目。这使我们能够接纳并支持2026年即将到来的创纪录的51名暑期实习生!这些是从数千名申请者中选出的高中生、大学生和医学生。如果没有来自《真相基础》的资金,我们无法开展这个扩大的项目。

对于那些对延长健康寿命感兴趣的人,本周我的NPR节目片段...

【全文结束】

猜你喜欢
    热点资讯
    全站热点
    全站热文