James Zou | 斯坦福大学生物医学数据科学副教授,美国加利福尼亚州
引用:EMJ. 2026;11[1]:28-31.
你是何时开始对将人工智能应用于临床研究产生兴趣的?
我已在人工智能与生物医学的交叉领域工作了大约15年,从博士阶段就开始了。最初的工作主要是利用AI推动生物医学发现。2016年我来到美国加州斯坦福大学后,便开始更多地从事AI在临床研究中的应用。
你的工作涵盖临床预测、基因组学和大规模AI模型。纵观当前领域,与你最初进入医疗AI时相比,最大的变化是什么?
我认为最大的变化是,我们不再把AI仅仅看作一种工具,而是更多地视其为一种智能体或“协同科学家”。过去我们是从医学或医疗中的具体问题出发,再去应用或开发AI工具来解决它。但过去两年里,由语言模型和AI智能体驱动的、更自主的AI系统涌现了出来。由于这些智能体更加自主,它们能够开始自己提出研究问题,不需要等我们来定义问题,甚至可以自主生成假设并创建自己的工具。
从临床医生的角度来看,例如在皮肤科诊断黑色素瘤时,如果AI给出了结论,临床医生仍然需要复核。你认为这种复核始终必要吗?还是在不久的将来我们可以完全放手?
目前,人类专家和临床医生仍然需要对AI系统作出最终判断和监督——并非每一步都需要,但关键决策(如最终诊断或治疗方案)仍需把关。我认为这种监督仍是必要的。
有研究表明AI可以比临床医生犯更少的错误。那我们为什么还需要复核AI的决策?
AI仍是一项相对新兴的技术。算法在它被训练时所基于的特定数据和医院中可能表现很好、非常可靠,但如果应用到新的诊所或不同患者群体中,模型的表现仍然存在不确定性。它们可能非常稳健,但也有出错的可能。正是由于这种不确定性,至少目前让人类专家参与评估仍然是有意义的。
在Trial Pathfinder项目中,你展示了入组标准对试验入组率和普适性的显著影响。那项研究中最让你意外的发现是什么?
一个有趣的发现是,我们实际上可以放宽入组标准。许多现有的决定哪些患者可以参与临床试验的标准相当严格,甚至可能过于严格。在我们的论文中,我们证明可以在很大程度上放宽其中一些标准,从而使更多样化、更庞大的患者群体入组,包括更多女性、少数族裔和老年患者。尽管我们适度放宽了标准,但发现安全性仍然可以维持,并没有导致更多的不良事件。
你认为这种方法会在临床试验中得到更广泛的应用吗?
是的。自我们的研究以来,人们越来越认识到临床试验往往过于狭隘和限制。药品开发商、制药公司以及FDA和EMA等监管机构正在加大努力,使临床试验人群更加多样化。
你的工作严重依赖真实世界临床数据。使用真实世界数据来指导试验设计和临床决策,最大的机遇和局限是什么?
利用真实世界数据有诸多机遇。我特别感兴趣的一个领域是,利用它创建数字孪生或合成模拟临床试验。真实世界数据非常多样化,并且与医疗记录相关联,因此我们知道结局。我们可以通过计算生成数字或“电子”队列,这些队列能镜像出不同类型临床试验中的患者。这更快捷,且能提供有价值的见解。它不能完全取代实际临床试验,但有助于我们更高效地设计试验并使其更具包容性。
一个局限性是,与经过整理的临床试验数据相比,真实世界数据往往杂乱且噪声大。电子健康记录经常包含缺失信息,并且记录什么、不记录什么存在偏差。我们需要计算和统计方法来处理这些数据偏差。
人们对AI在医学中的应用既兴奋又沮丧。我们在哪些方面真正取得了进展,又在哪些方面陷入了困境?
我们发表了一项研究,调查了FDA批准了多少款AI医疗设备。目前已有超过1000款AI医疗设备通过了监管审批。这显示了显著的技术进步。我们拥有覆盖多种成像模式和适应症的经FDA审查的AI驱动设备。
我们陷入困境的地方在于部署。当我们查看那1000款经FDA批准的设备,并通过保险报销数据衡量其采用率时,发现只有少数设备被广泛部署。一个主要瓶颈是经济学:如何为AI算法报销?如何量化其价值?头版指标往往依赖背景。你在斯坦福这样的受控环境中可能看到出色的表现,但在乡村诊所或其他国家,结果可能不同。公司需要一个可持续的财务模式。部署的经济学仍然是一个关键挑战。
公平性和偏见是临床AI的核心议题。近年来相关讨论是否更加成熟了?
公平性和偏见至关重要,尤其是在AI系统做出诊断等重要决策时。我们需要这些模型稳健,并在不同人群和环境中都能良好工作。偏见和公平性是稳健性的组成部分。我认为我们在如何严格评估模型、跨不同地点和分布测试模型方面取得了显著进展。现在有了更高的认识和更好的技术来评估和缓解潜在的偏见。
临床医生如何判断一个AI系统可能不适用于他们的患者群体?
供应商需要提供透明的统计数据。例如,如果一个用于皮肤科的AI系统主要基于欧洲人群训练,这一点应明确说明。其他地区的临床医生随后可以决定进行额外测试,以确保算法在不同肤色或人群上表现良好。
当医疗系统采用AI工具时,除了头版性能指标外,还应关注什么?
头版指标往往依赖背景。你在斯坦福这样的受控环境中可能看到出色表现,但在乡村诊所或其他国家结果可能不同。医疗系统不应只看指标本身,还应关注指标产生时的背景。他们需要询问该背景是否可推广到自己的环境。
如今的临床医生是否具备足够的知识来确保AI工具的安全使用?
教育进程仍在进行中。市场上有很多AI系统,同时也存在大量噪音。我们需要更多经验以及更好的支持来帮助临床医生正确评估和使用这些AI设备。
展望未来,你的研究下一步将走向何方?
我们很幸运,几个研究项目已通过FDA审批。例如,我们开发了一种算法,用于从超声视频中诊断心血管疾病。它经过临床试验评估、获得FDA批准,目前正在部署中。展望未来,我们对利用消费者可用的可穿戴设备预测健康状况和疾病感到兴奋。在最近的一篇论文中,我们展示了通过分析一晚的睡眠记录,我们的AI模型可以预测超过100种不同的疾病。参与睡眠门诊的患者与他们的医疗记录相关联,因此我们知道他们未来会发展出哪些疾病。该模型成功预测了130种不同的疾病,包括心血管疾病、痴呆症、慢性肾病和中风。这显示了即使是单晚睡眠数据也具备的潜在价值。
【全文结束】

