安全处理医疗数据:AnoMed进入第二轮Sicherer Umgang mit medizinischen Daten: AnoMed geht in die zweite Runde | heise online

环球医讯 / AI与医疗健康来源:www.heise.de德国 - 德语2026-08-28 06:51:57 - 阅读时长6分钟 - 2833字
AnoMed项目进入第二阶段,旨在安全利用医疗数据用于研究与AI开发,同时保护患者隐私。项目涉及多种隐私增强技术,如差分隐私、联邦学习、同态加密等,但面临计算成本高、实际应用不足等挑战。德国联邦研究部资助约4600万欧元,在吕贝克大学新建AI计算中心,并推进多个子项目,包括攻击模拟、生物特征匿名化、合成数据生成等。专家强调隐私保护对民主社会的重要性,并指出当前匿名化方法仍需改进。
健康数据隐私保护匿名化医疗研究AI开发数据安全差分隐私联邦学习合成数据医疗应用
安全处理医疗数据:AnoMed进入第二轮

“经典的匿名化方法未能奏效,”AnoMed项目负责人Esfandiar Mohammadi教授在柏林的一次活动中表示。该项目旨在利用健康数据进行研究与AI开发,同时不危及患者的隐私。在启动“AnoMed 2”的会议上,参与团队展示了如何实现这一目标。该项目由德国联邦研究、技术与航天部(BMFTR)资助。

对于Mohammadi而言,这不仅是一个技术问题,更是一个社会问题。“隐私不仅关乎个人,还关乎自由民主,”他对heise online说。“如果我们都变成透明人,某些公司或政府掌握了每个人的完美人格画像,他们就能有针对性地操纵大量选民。”因此,研究必须立即介入,开发出既能利用特别敏感数据又不影响或危及患者隐私的方法。

外部批判性视角:实践中的匿名化

然而,柏林夏里特医院的Fabian Prasser教授在演讲中指出,研究距离真正应用于医疗实践还有多远。Prasser从事健康数据用于医学研究已超过十年,他得出了一个令人沮丧的中期结论:尽管经过数十年的研究、大量的文献和众多会议,隐私增强技术(PETs)至今几乎没有进入日常生活。“有太多想法,但看看实际使用的是什么,那只是所有科学方法中的一小部分,”Prasser说。

他给出的原因不是研究质量不足,而是结构性障碍:高昂的基础设施成本、数据生产机构(如医院)缺乏专业知识、法律不确定性以及许多方法灵活性有限。数据提供机构往往无法获得足够的直接收益来抵消这些投入。

此外,还有一个AnoMed联盟正在努力解决的核心方法论问题:匿名化总是以牺牲信息量为代价来换取数据保护。Prasser用一个来自新冠危机的具体例子说明了这一点:他的团队匿名发布了患者登记数据。结果显示,根据匿名数据计算的病死率与实际值偏差高达10%,这对于许多临床问题来说是不可接受的。另一项关于医学研究结果可重复性的研究证实,所有测试的匿名化方法都无法完全复制原始研究的所有结果。

目前,匿名化在可行性检查、探索性分析、假设生成、软件测试以及作为AI模型训练补充方面效果良好,但对于具有明确证据要求的初级临床研究,它不能替代原始数据。Prasser认为解决方案在于分级数据使用,结合不同的访问层级——他以医学信息学倡议为例,阐述了联邦分析、差分隐私和假名化如何相互配合。

未来,Prasser寄希望于欧洲健康数据空间(EHDS)和安全处理环境,让研究人员不再获取数据,而是获得对数据基础设施的受保护访问。“这在EHDS中扮演如此突出的角色,也说明了其他方法在实践中面临的障碍。”

2900万欧元用于新建AI计算中心

AnoMed的目标也关乎基础设施。吕贝克大学在项目框架内新建了一个AI计算中心,未来将提供更强的算力支持研究。联邦研究部拨款2900万欧元用于建设。在约400平方米的空间内,将基于最新的水冷NVIDIA服务器构建一个GPU集群,预计计算能力超过3000 PetaFlops,足以在最高安全条件下训练非常大的AI模型。

数字主权

作为公共机构,该计算中心将使医院等合作伙伴能够在本地处理敏感数据以进行研究,而无需依赖商业云服务。“本着数字主权的精神,我们正在建设一个足够大的计算中心,以运行代理系统并进行机器学习研究,”Mohammadi对heise online解释道。“我们将为我们的研究和研究合作伙伴(如医院)提供本地服务。与大型云提供商相比,我们的义务是明确的:我们是一个公共机构,负有推进公共研究的使命。”

连同第一和第二阶段的研究项目,BMFTR为AnoMed研究中心总共提供了约4600万欧元的资金。

众多项目

在第二阶段资助中,许多项目将继续推进,涵盖从密码学基础到具体医疗应用领域。其中展示了在AnoMed 1中开发的算法“DP-Hype”,这是一种超参数搜索,能够以隐私保护和联邦方式运行。其特殊之处在于底层的密码学协议:客户端可以本地执行所有计算,然后仅聚合统计数据。在AnoMed 2中,DP-Hype将被集成到联邦学习开源框架“Flower”中,以便该方法更易于使用。

然而,想要训练模型的人不仅要控制其参数,还必须保护数据本身。为此,AnoMed同时采取两条路径:一方面,要实现对加密数据的直接机器学习。完全同态加密被认为是黄金标准,但日常计算成本仍然过高,因此该项目正在研究替代密码学方法。另一方面,敏感材料不应以原始形式传递:合成数据应反映敏感原始数据的特征,而不允许追溯到个人。同时,团队正在开发针对这些合成方法的定向攻击,以便在他人发现漏洞之前找到弱点。

识别人群

这种威胁有多现实,吕贝克大学的另一名研究员Jorge Andresen的工作展示了这一点。通过一个包含400万条记录的模拟健康数据集,他证明可以从聚合统计数据中重建个体数据集,从而从看似匿名的总人口中识别出特定人群。与此相关的是与联邦药品和医疗器械研究所的合作,该所在健康研究数据中心存储高度敏感的账单数据,并希望未来测试更稳健的安全数据共享方式。

因此,MammothDP项目将差分隐私、常数时间实现、可信执行环境和基于角色的访问控制结合成一个整体保护系统。Thomas Eisenbarth教授领导的团队还在研究AI系统如何通过错误注入(例如通过Rowhammer安全漏洞或电压毛刺)或微架构侧信道攻击而变得脆弱。

安全并非始于算法,而是始于芯片。德国人工智能研究中心则致力于对输入数据进行预处理,使分类器运行更可靠。在医疗应用方面,重点聚焦于生成模型用于合成心电图数据,特别是针对房颤。

图像匿名化

真正的匿名化(即隐私保护)有多复杂,吕贝克大学神经与生物信息学研究所Thomas Martinetz教授的项目也展示了这一点。该团队致力于处理面部图像,使其不再允许推断性别,同时变化不可见。“改变单个像素很容易。挑战在于全面移除敏感信息,同时尽可能保留其他所有内容,以便数据仍可用于研究,”Martinetz说。

所有技术项目都伴随着法律和监管分析以及用户对匿名化健康统计数据的接受度研究。因为新方法最终是否会被采纳,与它们是否有效同样重要。

用于科学传播的棋盘游戏

数据保护和隐私并非仅限于专业会议的话题,AnoMed环境中的另一项举措表明这一点。国际知名的隐私研究员Sebastian Meiser博士已经开发了学习棋盘游戏“AI中的线索追踪——对神经网络的隐私攻击”,该游戏也可在线玩。现在,第二个游戏即将推出,涉及数学概念“差分隐私”背后的原理。该游戏基于随机响应技术,每位参与者抽取一张人物卡,上面有虚构的属性,如职业、爱好或是否打鼾。

当回答问题时,玩家首先决定愿意放弃多少隐私,然后从一叠具有特定ε值的卡片中抽取一张。ε值越小,从答案中推断出的信息越少。ε值越大,透露的信息越多。最后,所有参与者尝试根据收集到的答案去匿名化同桌玩家。

(Marie-Claire Koch / mack)

【全文结束】

猜你喜欢
  • 健康科技公司数据泄露事件曝光340万患者记录健康科技公司数据泄露事件曝光340万患者记录
  • 俄勒冈医院政策大幅削减医疗债务俄勒冈医院政策大幅削减医疗债务
  • WVU Medicine借助Abridge AI临床笔记平台惠及患者与医生WVU Medicine借助Abridge AI临床笔记平台惠及患者与医生
  • 健康习惯仍是使用GLP-1药物的关键健康习惯仍是使用GLP-1药物的关键
  • 健康差异是当今非裔美国人面临的最大问题健康差异是当今非裔美国人面临的最大问题
  • 健康科技革命:人工智能、数据科学与数字疗法融合健康科技革命:人工智能、数据科学与数字疗法融合
  • 人工智能未来如何帮助NHS更顺畅运行人工智能未来如何帮助NHS更顺畅运行
  • 全球干细胞医疗美学监管格局:挑战、比较与协调路径全球干细胞医疗美学监管格局:挑战、比较与协调路径
  • AI与医疗设备网络安全:好与坏AI与医疗设备网络安全:好与坏
  • MSSU健康科学峰会聚焦医疗保健新技术MSSU健康科学峰会聚焦医疗保健新技术
热点资讯
全站热点
全站热文