无论是放射科医生还是多模态大语言模型,都难以轻易区分人工智能生成的“深度伪造”X光片与真实X光片。根据今天发表在《放射学》(北美放射学会期刊)上的一项研究,这一发现凸显了AI生成X光片带来的潜在风险,以及开发工具和培训以保护医学影像完整性、帮助医疗专业人员检测深度伪造的必要性。
“深度伪造”一词指的是看似真实但由AI创建或篡改的视频、照片、图像或音频记录。
“我们的研究表明,这些深度伪造X光片逼真到足以欺骗放射科医生——即使他们是最训练有素的医学影像专家,并且知道存在AI生成的图像。这造成了欺诈性诉讼的高风险漏洞,例如,伪造的骨折可能与真实骨折无法区分。此外,如果黑客能够侵入医院网络并注入合成图像以操纵患者诊断,或通过破坏数字医疗记录的基本可靠性来引发大规模临床混乱,则存在重大的网络安全风险。”
——Mickael Tordjman博士,研究首席作者,西奈山伊坎医学院博士后研究员,纽约
这项回顾性研究共有来自六个国家(美国、法国、德国、土耳其、英国和阿拉伯联合酋长国)12个不同中心的17名放射科医生参与。他们的专业经验从0到40年不等。研究中的264张X光片中,一半是真实的,另一半由AI生成。放射科医生在两组不同的图像集上进行评估,数据集之间没有重叠。第一组数据集包括真实的和ChatGPT生成的多解剖区域图像。第二组数据集包括胸部X光片——一半真实,另一半由RoentGen生成,RoentGen是斯坦福医学研究人员开发的一个开源生成式AI扩散模型。
当放射科医生读者不知道研究的真实目的,但在对每张ChatGPT图像的技术质量进行评分后被问及是否注意到任何异常时,只有41%的人自发识别出AI生成的图像。在被告知数据集中包含合成图像后,放射科医生区分真实和合成X光片的平均准确率为75%。
放射科医生个体准确检测ChatGPT生成图像的表现从58%到92%不等。同样,四个多模态大语言模型——GPT-4o(OpenAI)、GPT-5(OpenAI)、Gemini 2.5 Pro(Google)和Llama 4 Maverick(Meta)——的准确率从57%到85%不等。即使是用于创建深度伪造的ChatGPT-4o模型也无法准确检测出所有图像,尽管它比谷歌和Meta的大语言模型识别出更多的图像,差距相当大。
放射科医生检测RoentGen合成胸部X光片的准确率从62%到78%不等,而大语言模型的表现从52%到89%不等。
研究没有发现放射科医生的经验年限与检测合成X光片准确性之间存在相关性。然而,肌肉骨骼放射科医生比其他放射科亚专科医生表现出显著更高的准确性。
研究确定了合成X光片的常见特征。
“深度伪造的医学图像往往看起来过于完美,”Tordjman博士说。“骨骼过于光滑,脊柱异常笔直,肺部过度对称,血管图案过于均匀,骨折线看起来异常干净且一致,通常只限于骨头的一侧。”
推荐的解决方案包括实施先进的数字防护措施,以清晰区分真实和伪造图像并帮助防止篡改,例如在图像中嵌入不可见水印以直接嵌入所有权或身份数据,以及在图像捕获时自动附加与技师关联的加密签名。
“我们可能只看到了冰山一角,”Tordjman博士说。“这一演变中合乎逻辑的下一步是AI生成合成3D图像,如CT和MRI。现在建立教育数据集和检测工具至关重要。”
研究作者已发布了一个策展过的深度伪造数据集,并附有互动测验,用于教育目的。
来源:北美放射学会
期刊参考文献:Tordjman, M., et al. (2026). The Rise of Deepfake Medical Imaging: Radiologists’ Diagnostic Accuracy in Detecting ChatGPT-generated Radiographs. Radiology. DOI: 10.1148/radiol.252094.
【全文结束】

