人工智能赋能医疗设备的临床证据与FDA召回分析Clinical Evidence and FDA Recalls of Artificial Intelligence–Enabled Medical Devices | Health Care Safety | JAMA Network Open | JAMA Network

环球医讯 / AI与医疗健康来源:jamanetwork.com美国 - 英语2026-07-26 15:09:24 - 阅读时长18分钟 - 8971字
本研究分析了903款FDA授权的人工智能赋能医疗设备,发现缺乏临床性能研究信息的设备召回风险更高;使用相关问题最常触发召回,凸显AI系统独特安全挑战。研究还表明,设备特征与上市后证据共同决定安全状况,建立统一监测框架可增强安全信号检测。这些发现强调了加强AI设备临床验证和上市后监管的重要性,为谨慎推进AI医疗应用提供了实证依据。
AI赋能医疗设备临床证据FDA召回临床性能研究上市后监测使用相关问题安全信号检测
人工智能赋能医疗设备的临床证据与FDA召回分析

关键点

问题

哪些人工智能(AI)赋能医疗设备的特性(如临床性能研究的可用性及上市后问题性质)与召回风险相关?

发现

本对903款医疗设备的队列研究发现,缺乏支持性临床研究信息的设备比有此类证据支持的设备更可能被召回。与使用相关的偏差最常触发召回,凸显了AI系统的独特安全挑战。

意义

这些发现表明,设备特征和上市后证据共同决定此类设备的安全状况,建立统一的监测框架可增强安全信号检测。

摘要

重要性

人工智能(AI)赋能医疗设备带来了与算法复杂性和性能演变相关的新安全挑战。识别影响召回的设备特性对谨慎推进临床应用和建议加强监测至关重要。

目的

检验假设:在批准时缺乏充分临床证据的AI赋能医疗设备具有更高的召回风险。

设计、环境和参与者

这项回顾性队列研究包括1995年8月11日至2024年8月31日期间获得美国食品药品监督管理局(FDA)授权的AI赋能医疗设备。从FDA授权到召回或截至2024年8月31日的行政审查截止期间评估设备。不良事件报告从FDA制造商和用户设施设备体验(MAUDE)数据库和使用医疗设备协调研究和证据上市后监测(CORE-MD PMS)工具获取。报告使用国际医疗器械监管论坛(IMDRF)代码映射,以总结设备相关问题。

暴露

设备特性及设备问题的发生。

主要结果和测量指标

主要结局是从FDA授权到召回的时间。使用贝叶斯威布尔生存模型与正则化马蹄先验分析召回时间。通过贝叶斯模型得出的危险比(HR)和95%可信区间(CrI)量化关联性。

结果

在903款AI赋能医疗设备中,43款(4.8%)被召回,中位数(IQR)间隔为458(263-1092)天。与已发表临床研究的设备相比,临床研究信息缺失的设备召回风险更高(HR,1.39;95% CrI,0.84-3.52)。被CORE-MD PMS工具标记的设备(HR,4.28;95% CrI,1.01-13.10)或两个数据库均标记的设备(HR,2.77;95% CrI,0.87-14.28)具有更高的召回风险。IMDRF代码显示,与温度相关的问题(发生于9起召回中的1起;HR,0.45;95% CrI,0.03-1.26)和标签问题(发生于9起召回中的2起;HR,0.55;95% CrI,0.06-1.37)与较低的召回风险相关。AI赋能设备使用不当(31款设备中的12款)也与较高的召回风险相关(HR,3.33;95% CrI,0.97-10.71)。

结论和相关性

在本项对903款FDA授权AI赋能医疗设备的研究中,支持性临床研究信息缺失与召回可能性增加相关;存在使用相关问题的设备也与较高的召回风险相关。这些发现突显了对AI赋能设备进行严格临床验证和加强上市后监管的重要性。

引言

人工智能(AI)赋能医疗设备为临床实践提供了新可能性,但其应用引发了关于支持其使用的临床证据透明度和稳健性的担忧。事实上,许多设备在未经临床验证的情况下获得监管授权。最近一项对FDA批准的AI赋能医疗设备的横断面评估发现,仅有一半设备报告了公开的临床性能研究,且这些研究往往缺乏足够的信息来评估其普遍适用性。

未经公开证据支持的AI赋能医疗设备可能更可能因批准前验证不足而被撤出市场。2021年的一项研究发现,对于FDA批准的高风险医疗设备,大多数召回涉及通过510(k)途径批准的设备。如果证实通过更快或不太严格途径批准的设备可能更容易出现上市后问题,这将支持在获得稳健证据之前限制新AI赋能医疗设备的广泛临床应用,转而采用加强监测的受控市场引入方式。

FDA制造商和用户设施设备体验(MAUDE)数据库提交的不良事件报告是上市后监测的关键来源,包括来自强制性(例如制造商)和自愿性(例如医疗保健专业人员)报告者的报告。此外,现场安全通知(FSNs)是制造商关于纠正措施的通信,发布在国家监管机构的网站上,并根据当前欧洲医疗器械法规强制要求。FSNs可能解决从轻微问题(例如标签错误)到更严重安全问题(例如算法故障)的各种问题。它们共同提供互补的上市后证据,描述多样化的设备级问题。

先前一项研究使用线性概率模型确定了监管提交特性与召回风险之间的关联,而另一项研究发现未经报告验证的设备召回频率更高,使用了逻辑回归。然而,上市后安全问题对设备召回的影响仍不清楚,且尚无研究在此背景下应用贝叶斯方法。

因此,我们检验了假设:在批准时有限或缺乏支持性临床证据的AI赋能医疗设备将具有更高的召回风险。为此,我们检查了:(1)临床性能研究的可用性是否与召回时间相关;(2)哪些上市后安全问题与召回的关联幅度最大;(3)贝叶斯方法是否有助于表征与设备召回相关的因素。

方法

研究设计和数据来源

这项回顾性队列研究包括1995年11月8日至2024年8月31日期间FDA批准的所有AI赋能医疗设备。从FDA MAUDE数据库和使用医疗设备协调研究和证据上市后监测(CORE-MD PMS)工具提取截至2024年8月31日发布的上市后报告。研究和表现符合加强流行病学观察性研究报告(STROBE)报告指南。本研究分析了公开可用的上市后医疗器械报告数据,不涉及对个体的干预、互动或可识别的私人信息。因此,根据美国共同规则45 CFR 46.102(e),它不构成人类参与者研究;不需要知情同意和机构审查委员会批准。

AI赋能医疗设备的定义和特性

当前分析基于先前定义的AI赋能医疗设备样本,这些设备已获得FDA批准用于临床使用,并在FDA网站上列出,时间从注册建立之日起至2024年8月31日。这些设备包括植入式设备、基于硬件的系统、成像和诊断平台以及仅软件的医疗设备,是一个广泛且异质的设备组,包含或由AI软件组成。未应用额外选择标准。所有信息均从在线来源提取,从FDA网站下载摘要报告。我们收集了每台设备的详细描述信息,包括任何性能指标和报告的临床评估,并将这些细节的不可用性也视为分析变量。

FDA MAUDE数据库报告的不良事件

MAUDE数据库提供来自美国的上市后安全数据,代表最大的医疗器械市场。由于MAUDE包含来自医疗器械用户的报告,相关文件被下载并合并以创建一个包含截至2024年8月31日发布的所有报告的统一数据库。使用制造商和其设备的名称检索记录,并使用FDA问题代码和国际医疗器械监管论坛(IMDRF)代码进行分类,特别是关于医疗器械问题的附录A。考虑了顶层的27个类别(从A01到A27),以捕获主要设备问题,包括特别指代软件相关问题(编写的程序或AI系统)的类别A11(见补充1中的eTable 1)。这一过程得益于这些代码之间映射的公开可用性,如补充1中的eAppendix 1所述。为每个IMDRF代码创建了二元变量(A01 [MAUDE]至A27 [MAUDE]),以指示该问题是否已为每台设备报告。

现场安全通知(FSNs)的检索和分析

使用CORE-MD PMS网络抓取工具从18个国家监管机构网站提取并生成结构化数据库(CORE-DB),包括:克罗地亚、捷克共和国、丹麦、爱沙尼亚、法国、德国、希腊、爱尔兰、意大利、拉脱维亚、荷兰、波兰、葡萄牙、斯洛文尼亚、西班牙、瑞典、瑞士和英国。FSN一词指这些官方网站上可用的集体安全信息。

我们关注截至2024年8月31日发布的FSNs。使用所有AI赋能设备的制造商和设备名称查询CORE-DB并检索任何相关FSNs。识别并删除重复的FSNs;更多详情见补充1中的eAppendix 2。然后根据IMDRF代码对唯一FSNs进行编码(补充1中的eTable 1)。分类由2名调查员(Y.R.和Y.Z.)独立进行,可能的差异通过讨论解决。

为每个IMDRF代码创建二元变量(A01 [COREDB]至A27 [COREDB]),以指示该问题是否已为每台设备报告。然后将这些变量与另一变量(Axx [MAUDE])结合,构建一组统一的二元变量(A01至A27),如果任一来源等于1则编码为1,否则编码为0。为缓解潜在稀疏性,仅包含在两个类别(缺失或存在)中都有超过5个观察值的变量。此外,引入了一个分类变量(上市后数据库)以指示信号来源:两者(如果两个来源都报告了该设备)、CORE-DB、MAUDE和无。

统计分析

分析单位是个别AI赋能医疗设备。描述性统计用于总结设备特性和召回频率。主要结局是从FDA授权到召回的时间,如果未发生召回,则在研究结束日期(2024年8月31日)对设备进行审查。设备特性以及指示相应设备问题发生的二元变量(Axx)被视为独立暴露。

使用贝叶斯威布尔比例风险模型与正则化马蹄先验评估与召回时间的关联,以考虑稀疏事件和多个协变量。设tᵢ≥₀表示设备i的观察随访时间,其中i=1,…,n,并设xᵢ表示相应的D个暴露向量。设备i在时间t的危险函数指定为:

[公式省略]

其中α>0是威布尔形状参数,λ₀>0是基线尺度参数,β₀是截距,β=(β,…β_D)表示D个回归系数的向量。表示设备i在时间t前召回概率的累积发生函数计算如下:

Fᵢ(t)=1−exp(−λ₀⁻ᵅtᵅ×exp(ηᵢ))

为了完成贝叶斯模型的规格,假设弱信息正态先验,计算为:

[公式省略]

对于回归系数β,鉴于预期的稀疏性,采用了正则化马蹄先验,这是一种保留信号同时收缩噪声的全局-局部收缩先验。该先验层次定义为:

[公式省略]

其中λⱼ表示局部收缩参数,τ是全局收缩参数,c是限制大系数幅度的板比例参数。对c的先验选择反映了弱信息先验。全局尺度τ₀基于对相关暴露预期数量的先验猜测p₀定义为:

[公式省略]

为确定p₀的合适值,评估了拟合优度指数,如广泛适用信息准则和对数伪边际似然,针对p₀=5、p₀=10和p₀=15。我们观察到不同p₀值之间模型性能的差异极小。因此,选择更简约的模型(p₀=5)用于所有后续分析。

统计分析在2025年5月至2026年3月之间进行。分析使用R接口rstan(R版本4.3.3 [R Project for Statistical Computing])通过Stan进行。该模型在Stan中运行55,000次迭代,丢弃前5,000次作为热身。应用10的薄化间隔产生了5,000个后验样本。后验回归系数被指数化以获得危险比(HR)的后验分布。点估计使用后验中位数进行汇总,95%可信区间(CrI)定义为指数化后验样本的2.5th和97.5th百分位数。保护效应的证据定义为HR低于1的后验概率至少为80%(即至少80%的指数化后验样本小于1),而风险增加定义为HR高于1的后验概率至少为80%(即至少80%的指数化后验样本大于1)。

结果

对于总计903款设备,确定了39款设备(4.3%)的179个唯一FSNs,而903款AI赋能设备中有43款(4.8%)已被召回。从批准到召回的中位数(IQR)时间为458(263-1092)天(约15[9-36]个月)。图1提供了本研究结合数据集和合并数据的概述。

CORE-DB的FSNs分析

在2024年8月31日前发布的909个匹配FSNs中,686个在去除那些不涉及设备本身(例如仅与配件相关)的报告后被视为相关。去除重复报告后,有179个唯一FSNs(补充2中的eFigure)。通过Cohen κ评估的独立评估者之间的一致性为0.80,确认了根据IMDRF代码对FSNs分类的一致性。

探索性分析

表1报告了FDA授权AI赋能医疗设备的特性。观察到较高的召回率用于植入式AI赋能设备(6个植入式;2个被召回[33.3%])、无临床性能研究的设备(218台设备;17个被召回[7.8%])、归类为软件-设备组合的设备(239台设备;29个被召回[12.1%])以及被MAUDE和CORE-DB标记的设备(16台设备;8个被召回[50.0%])。这些模式可能表明可能的风险因素;但由于样本量小,应谨慎解释。表2总结了二元变量(Axx),针对每个代码呈现召回和未召回设备的数量和百分比,仅限于在两个类别中都有超过5个观察值的代码(27个代码中的20个)。最常报告的AI赋能设备问题是与使用相关或未能按制造商预期使用软件(IMDRF代码A23;引用12个被召回设备,对应903个设备的1.3%)、软件操作问题(IMDRF代码A11;引用11个设备,对应903个设备的1.2%)以及设备输出或结果偏离预期的问题(A09;引用10个设备,对应903个设备的1.1%)。

后验推断和参数解释

图2展示了每个协变量的后验HR与95% CrI。几个特性与更高的召回风险相关。软件-设备组合显示出最大的关联幅度(HR,4.45;95% CrI,1.92-10.66)。仅被CORE-DB标记的设备(HR,4.28;95% CrI,1.01-13.10)或被两个数据库标记的设备(HR,2.77;95% CrI,0.87-14.28)也表现出较高的召回风险。不符合第三方审查资格(HR,1.67;95% CrI,0.86-5.05)、放射学面板(HR,1.52;95% CrI,0.84-5.20)以及临床性能研究信息缺失(HR,1.39;95% CrI,0.84-3.52)同样与更高的召回风险相关。相比之下,不符合摘要故障报告资格与较低的召回风险相关(HR,0.48;95% CrI,0.13-1.09)。关于报告的软件-设备问题,与A10(温度;HR,0.45;95% CrI,0.03-1.26)和A21(标签;HR,0.55;95% CrI,0.06-1.37)相关的问题与较低的召回风险相关(但它们分别仅被1个和2个被召回设备报告),而A23(使用;HR,3.33;95% CrI,0.97-10.71)和A26(信息不足;HR,3.09;95% CrI,0.90-12.87)问题与较高的召回风险相关。

基于场景的估计累积召回风险分析

为提供结果的实际解释,计算了基线设备的累积召回概率。它被定义为代表我们数据集中典型场景:一种非植入式放射学AI赋能医疗设备,由北美申请人提交,开发为组合软件-设备系统,符合医学数字成像和通信要求,无任何FDA决策摘要,不符合第三方审查资格,无开发研究,且符合摘要故障报告。

表3报告了不同时间点基线配置文件的估计累积召回发生率,按协变量、临床性能研究和上市后数据库以及被确定为显著暴露的问题类型分层(图2)。当两个数据库中均未识别安全信号时,累积召回风险保持较低,仅随时间有小幅预期增加。在缺乏临床性能研究的情况下,概率从30天的0.42%(95% CrI,0.10%-1.67%)上升到365天的4.91%(95% CrI,1.63%-16.81%),而在信息缺失时为5.40%(95% CrI,1.62%-19.16%),而存在临床性能研究时为3.69%(95% CrI,1.15%-12.67%)。问题类型和信号源之间出现了显著差异。对于使用问题(A23),特别是当在两个数据库或仅在CORE-DB中报告时,观察到最高风险;当A23由CORE-DB报告且未进行临床研究时,累积召回概率从30天的5.34%(95% CrI,0.77%-29.32%)上升到365天的48.80%(95% CrI,9.83%-98.26%),在临床研究信息缺失情况下达到52.64%(95% CrI,10.38%-99.27%)。特别在365天时宽泛的可信区间反映了显著的不确定性,可能由于信息有限和在较长随访时间的外推增加。相比之下,当仅在MAUDE中报告温度问题(A10)且存在临床研究时,观察到最低风险,365天内从0.14%(95% CrI,0.01%-1.06%)适度增加到1.69%(95% CrI,0.08%-10.35%)。这些发现表明,临床证据可以减轻召回风险,即使在高影响问题类别中也是如此。

讨论

在这项队列研究中,我们发现很少有获批的AI赋能医疗设备被正式撤出市场。然而,我们的发现表明,它们的特性、监管属性和上市后证据如何影响自愿召回的风险。

临床性能研究的重要性

该模型确定临床性能研究信息缺失是与AI赋能医疗设备召回风险增加相关的最重要因素之一。稳健和具有代表性的临床验证对确保AI赋能医疗设备的有效性和安全性至关重要,因为不足或不具代表性的验证可能引入偏差并限制现实世界中的普遍适用性。我们的发现表明,当前的上市前评估框架可能无法完全捕捉现实世界临床变异性。尽管这一局限性并非AI赋能设备独有,但其数据驱动和依赖于上下文的性质可能会放大验证不足的后果,强调了需要更严格和透明的临床性能评估。

问题类型与召回风险的关联

据我们所知,先前没有研究系统地探索根据IMDRF代码分类的设备问题与召回风险之间的关联。尽管这些代码普遍适用于医疗器械,但特定问题的相对重要性可能因设备类型而异。例如,电池和软件相关故障在植入式起搏器和除颤器中占主导地位,而制造和包装相关问题在全膝关节植入物中更为常见。相比之下,我们对AI赋能医疗设备的分析发现,与使用相关的问题和信息不足与较高的召回风险相关。使用相关问题可能在设备部署在与原始设置不同的情况下时出现;如果没有稳健的普遍适用性证据,安全性和有效性都可能受到影响。信息不足可能掩盖了未准确描述和解决的高风险故障,而有针对性的上市后监测可以更早地检测安全信号。

值得注意的是,通过CORE-DB单独或也通过MAUDE识别的安全问题与较高的召回风险相关。这一发现可能反映了报告机制的差异。MAUDE包含来自不同最终用户的不良事件报告,而CORE-DB捕获制造商发布的FSNs,突显了整合多个上市后数据源的价值。

贝叶斯建模框架用于安全信号检测

先前工作使用多变量逻辑回归分析了任何召回的几率,而我们应用贝叶斯时间-事件框架来建模召回时间。具体而言,采用了正则化马蹄先验以实现自动变量选择和连续收缩,使模型能够从30多个候选变量中识别最重要因素,同时防止过拟合。尽管数据集规模有限,但这种不确定性感知方法确保了稳健的推断和召回风险随时间的可靠估计,突显了贝叶斯模型在AI赋能医疗设备上市后评估中的价值。

监管监督在召回风险中的作用

该模型确定几个与FDA监管程序相关的变量与召回风险相关。不符合第三方审查资格的设备表现出较高的召回风险,这可能归因于较高的固有风险;具有高风险档案或需要De Novo提交的设备被排除在第三方审查之外,必须直接提交给FDA进行评估。此外,不符合摘要故障报告资格的设备与较低的召回风险相关,可能反映了更强的证据要求。增强的监管监督和更受控的测试条件可以减少实际使用中设备的性能问题,从而减少召回。

局限性

本研究有几个局限性。首先,为识别获批的AI赋能设备,我们仅使用FDA网站上可用的列表,因此该研究可能反映美国监管环境特有的特性。如果其他监管机构提供类似信息,该模型可应用于其数据集。其次,由于数据量有限以及暴露的稀疏性,限制了建模高阶效应的可行性,因此未分析暴露之间的交互作用。第三,所分析的AI赋能医疗设备涵盖了广泛的软件算法。虽然我们考虑了医疗专业领域的差异,但其他因素如数据输入类型、预期功能或风险等级也可能影响召回风险,值得进一步调查。

结论

在这项对903款FDA授权AI赋能医疗设备的回顾性队列研究中,支持性临床研究的公开信息缺失与较高的召回风险相关。上市后数据显示,召回更常与使用相关问题而非温度或标签问题相关,突显了AI系统的独特安全挑战。总体而言,设备特性和上市后证据共同决定安全状况。统一的监测框架可以增强安全信号的早期检测,未来工作应包括多司法管辖区分析和时间-召回建模,以捕捉不断演变的安全风险。

文章信息

接受发表: 2026年4月14日。

发表: 2026年6月11日。doi:10.1001/jamanetworkopen.2026.17920

开放获取: 本文是在CC-BY许可条款下分发的开放获取文章。© 2026 Ren Y等人。JAMA Network Open。

通讯作者: Enrico G. Caiani, MSc, PhD, 电子、信息和生物工程系,米兰理工大学,意大利米兰20133 Leonardo Da Vinci广场32号(enrico.caiani@polimi.it)。

作者贡献: Ren博士完全获取研究中的所有数据,并对数据的完整性和数据分析的准确性负责。

概念与设计: Ren, Siontis, Caiani。

数据获取、分析或解释: Ren, Zheng, Windecker, Fraser, Siontis, Caiani。

手稿起草: Ren, Siontis。

重要智力内容的手稿关键审阅: Ren, Zheng, Windecker, Fraser, Siontis, Caiani。

统计分析: Ren, Zheng, Siontis, Caiani。

行政、技术或材料支持: Ren, Caiani。

监督: Siontis, Caiani。

利益冲突披露: Caiani博士报告称,除提交的工作外,从Daiichi Sankyo、Univers Formazione Srl和Dynamicom Education获得个人费用,并从欧洲心脏病学会获得非财务支持。未报告其他披露。

资金/支持: Caiani博士和Ren博士承认获得欧盟地平线2020研究和创新计划(赠款协议No. 965246)的资金,用于CORE-MD PMS工具的初始开发。本特定研究由意大利卫生部(Bando Ricerca Finalizzata 2021:赠款编号RF-2021-12374708和C.U.P. E43C22000980001)资助。

资助者/赞助商的作用: 两个资助者在研究设计和实施、数据收集、管理、分析和解释;手稿准备、审阅或批准;以及提交手稿发表的决定中均无作用。

数据共享声明: 见补充2。

【全文结束】

猜你喜欢
  • 将洞察转化为影响:定义医疗AI新标准将洞察转化为影响:定义医疗AI新标准
  • FDA草案指南如何塑造AI医疗设备安全性FDA草案指南如何塑造AI医疗设备安全性
  • 将生成式人工智能整合到医学教育中:保护临床推理的框架将生成式人工智能整合到医学教育中:保护临床推理的框架
  • 医学:领先的大型语言模型明显胜过专业的小型语言模型医学:领先的大型语言模型明显胜过专业的小型语言模型
  • 将讨论人工智能技术在医疗保健领域的应用将讨论人工智能技术在医疗保健领域的应用
  • 医疗领域的AI 当AI给出错误医疗建议时谁该负责医疗领域的AI 当AI给出错误医疗建议时谁该负责
  • FDA草案指南如何塑造AI医疗设备安全FDA草案指南如何塑造AI医疗设备安全
  • 人工智能在医疗保健中的应用:诊断、治疗和临床决策的现状与未来人工智能在医疗保健中的应用:诊断、治疗和临床决策的现状与未来
  • LMU放射科获得欧盟首个确保质量的医学影像AI应用认证LMU放射科获得欧盟首个确保质量的医学影像AI应用认证
  • 医学领域:领先的大语言模型明显优于专业小型语言模型医学领域:领先的大语言模型明显优于专业小型语言模型
热点资讯
全站热点
全站热文