用于癌症检测等的AI模型是通过患者健康数据进行训练的。即使仅仅是个人数据已被纳入模型这一信息落入错误之手,也可能对相关人员产生负面影响。现在,一个研究团队在《自然》杂志上发表研究指出,通过适当方法,可以从这些模型中更有效地提取出这些敏感信息,其效果远超以往认知。
慕尼黑工业大学(TUM)、伦敦帝国理工学院和哈索·普拉特纳研究所(HPI)的研究人员发现,关于AI模型安全性的现有评估存在误导性。在专业术语中,能够确定某个人的数据是否已被纳入模型的攻击被称为"成员推断攻击"(Membership Inference Attacks, MIAs)。迄今为止,常规的医疗AI模型被认为在很大程度上能够抵御MIAs。
"遗憾的是,相关测试一直只评估了对所有患者的平均风险。我们首次关注了针对个别患者的风险——这展现出了截然不同的图景,"该研究的第一作者、TUM科学家莫里茨·克诺勒(Moritz Knolle)表示。虽然对于数据集的大部分内容,这些攻击都未能成功,但某些患者的数据却能以接近100%的概率被关联到模型中。"这绝非可以忽视的风险。健康数据高度敏感,"TUM医学人工智能与计算机科学教授、该研究的共同通讯作者丹尼尔·吕克特(Daniel Rückert)教授表示。他与哈索·普拉特纳研究所的乔治·凯西斯(Georg Kaissis)教授共同担任该研究的最后作者。
考虑不同数据类型
研究人员对基于七个成熟医学数据集的模型进行了攻击测试。这些模型的基础分别是不同的数据类型,如影像数据、心电图或电子病历。"攻击者执行MIA需要三样东西,"哈索·普拉特纳研究所数字健康:以人为本的变革性AI教授乔治·凯西斯解释道:"首先,需要访问要攻击的AI模型,例如通过医院网络;其次,需要访问一个想确认是否已纳入模型的数据点,这可能来自黑客攻击获取的数据;第三,需要自己的AI基础设施——运行基于相同数据类型模型的计算机。"
例如,可以利用这种设置攻击一个从血液检测结果推断癌症免疫治疗成功概率的AI模型。血液检测结果本身并不表明患病情况。但如果攻击者能够证明某数据点已被纳入模型,则可以更确定地判断该患者曾经或现在患有癌症。
对受影响者的可能后果
此类数字攻击可能带来严重的现实后果,克诺勒用一个虚构案例说明:"假设您曾因癌症接受治疗,并为研究提供了您的数据,"这位医学信息学家表示。"几年后——癌症未再复发——您想购买私人补充保险。然而,攻击者已发现您的数据曾用于肿瘤分析模型的训练。这一信息通过第三方数据分析或相应风险概况传递给保险公司。您随后被归类为高风险患者,需支付相应高额保费——且可能永远不知道原因。"
当被攻击的个体属于数据集中代表性不足的群体时,MIAs尤其容易成功。这可能涉及影像中特定的器官特征,也可能是少数群体的数据。"这尤为严重,因为AI在医学中的歧视问题同样存在,例如某些模型在面对属于少数群体的患者时,预测准确性较低,"丹尼尔·吕克特表示。
高性能模型尤其受影响
研究人员发现,模型越大越复杂,攻击成功率越高。研究人员认为,这表明如果没有相应对策,未来几年问题可能会显著加剧。
因此,他们建议在发布新模型前,应始终在个体层面评估其风险。其他对策包括严格控制对AI模型的访问。"目前已有有效的MIAs防护措施,可在模型训练过程中直接应用。例如,在'差分隐私'技术中,会在训练数据中加入微小变化,这些变化不会干扰模型的计算,但会显著增加执行MIA的难度,"乔治·凯西斯表示。
出版物
Knolle, M.A., Menten, M.J., Jungmann, F. et al. Disparate privacy risks from medical AI. Nature (2026). DOI:10.1038/s41586-026-10688-0
更多信息和链接
- 丹尼尔·吕克特教授担任TUM医学院和健康学院"医疗与医学人工智能"讲席教授,同时也是TUM计算、信息与技术学院、慕尼黑数据科学研究所(MDSI)和慕尼黑机器学习中心(MCML)的成员。
联系方式
莫里茨·克诺勒
慕尼黑工业大学
医疗与医学人工智能讲席教授
电话:+49 89 4140 8587
邮箱:moritz.knolle@tum.de
丹尼尔·吕克特教授
慕尼黑工业大学
医疗与医学人工智能讲席教授
电话:+49 89 4140 8587
邮箱:daniel.rueckert@tum.de
乔治·凯西斯教授
哈索·普拉特纳研究所
数字健康:以人为本的变革性AI专业领域
电话:+49 331 5509-586
邮箱:georg.kaissis@hpi.de
【全文结束】

