说这话让我毫无愉悦感,但帕特丽夏·海史密斯(Patricia Highsmith)笔下《天才雷普利先生》中那个善变而狡猾的诈骗主角,如今已不再需要天赋了。生成式AI的进步——能够轻松制作任何人的可信视频、无法区分的语音克隆以及其他以假乱真的伪造品——已经让骗术失去了所有艺术性。
纽约西奈山伊坎医学院团队领导的一项新研究,对“深度伪造”医疗证据的威胁提出了令人不安的警惕。研究人员让一组来自六个国家的17名执业放射科医生进行测试,要求他们从264张不同的图像中区分真实X光片与AI生成的模拟品。结果并不令人放心。
“我们的研究表明,这些深度伪造X光片足以欺骗放射科医生——他们是最高级别的医学影像专家,”该研究的主要作者、医学博士、伊坎医学院博士后研究员米卡埃尔·托德曼(Mickael Tordjman)博士在一份新闻稿中表示,“即使他们知道存在AI生成的图像。”在后续测试中,AI伪造品甚至骗过了用于生成它们的同一个多模态大语言模型:OpenAI的ChatGPT-4o。
伪造的震颤
托德曼之所以开展这个项目,是出于对患者、医生以及无数其他无辜旁观者所面临风险的真正担忧。他说,可信的AI生成医学影像“为欺诈性诉讼创造了高风险漏洞,例如,如果伪造的骨折与真实骨折无法区分的话。”这个问题已经引起了法律专家的关注,他们试图保护陪审团免受类似AI伪造品的影响。
“还存在重大的网络安全风险,”托德曼补充道,“如果黑客入侵医院网络,注入合成图像以操纵患者诊断或造成广泛的临床混乱。”托德曼团队测试的17名志愿放射科医生接触了两种不同的数据集,该研究于周二发表在《放射学》期刊上。第一个测试要求志愿者查看154张静态X光片,其中一半是真实放射照片,一半是ChatGPT-4o生成的伪造品(各77张)。第二个测试利用了一种专门训练的扩散模型AI,名为RoentGen,能够生成可信的胸部X光片,显示心脏和肺部等器官;志愿者被要求对110张图像(55张真实,55张伪造)进行辨别。
知道数据集中包含AI图像的放射科医生,比那些在不知情的情况下接触图像的医生表现更好,但仍然不够理想。这些志愿者的平均准确率为75%,而后一组仅为41%。17名放射科医生的专业经验年限各不相同(从0年到40年),在ChatGPT生成的图像上准确率从58%到92%不等,在RoentGen生成的胸部X光片上从62%到78%不等。年龄和经验似乎不是影响准确率的因素,但出于某种原因,肌肉骨骼放射科医生在识别假图方面明显优于其他亚专科医生。
活人的游戏(以及聊天机器人的)
托德曼和他的团队还对四个多模态大语言模型进行了测试:ChatGPT-4o、ChatGPT-5、谷歌的Gemini 2.5 Pro和Meta的Llama 4 Maverick。这些机器人的表现比人类略差,在GPT-4o生成的伪造品上准确率约为57%到85%(对ChatGPT-4o本身来说,这尤其尴尬)。在RoentGen生成的合成胸部X光片上,大语言模型的识别准确率差异稍大,从52%到89%不等。
托德曼希望未来的工作能在这些发现的基础上建立教育数据集和检测工具。“深度伪造的医学图像往往看起来过于完美,”他指出,“骨骼过于光滑,脊柱异常笔直,肺部过于对称,血管图案过于均匀,骨折显得异常干净和一致。”你可以亲自测试一下(测试链接已删除)。但不要因为分数低而自责。正如一位对骗子和自我欺骗颇有了解的人曾经说过的:“生活是一场漫长的理解失败。”
【全文结束】

