人工智能(AI)正在迅速改变医疗保健领域。AI系统如今能够从视网膜照片中检测糖尿病眼病,并分析CT图像以发现早期肺癌和中风的迹象。目前,在全国乃至全世界的医院中,专门的算法正在默默地协助医生,优先处理紧急扫描,并标记出可能被忽略的细微异常。这些专门的AI工具——通常在数百万张精确分类的医学图像上训练——正越来越多地融入实际临床实践中。
与此同时,另一种形式的AI吸引了公众的注意:大型语言模型(LLM)。这些广泛可用的系统,例如ChatGPT和Claude,能够同时分析文本和图像。理论上,这些能力应该使它们非常适合医疗任务,但通用AI平台在医学诊断方面是否可靠呢?
由纽约理工学院(New York Institute of Technology)骨科学院副教授Milan Toma博士领导的一项新研究给出了否定答案。正如学术期刊《Algorithms》所报道的,Toma及其合著者——包括NYITCOM高级开发安全运维工程师Mihir Matalia和医学生Sungjoon Hong——测试了世界上一些最先进的多模态LLM(GPT-5、Gemini 3 Pro、Llama 4 Maverick、Grok4和Claude Opus 4.5 Extended)的可靠性。
研究人员向每个AI模型提供了相同的CT脑部扫描图像,该图像显示明确的颅内病变。然后,他们要求这些模型像放射科医生一样分析图像——识别所使用的成像技术、病变在大脑中的位置、主要诊断、关键特征以及可能的替代诊断。总体而言,研究结果显示,AI模型在基本诊断方面的错误率达到20%,并且在解释和评估方面存在令人担忧的变异性。
起初,这些模型给出了有希望的结果:五个模型都正确地将图像识别为CT脑部扫描。其中四个模型还发现了一个关键发现:左侧大脑中动脉附近的缺血性中风。然而,有一个模型犯了一个基本错误,错误地将中风归类为大脑对侧的出血。在真实的临床环境中,这种错误可能严重损害患者的健康,因为缺血性中风和出血性中风需要不同的治疗方法。
即使在得出正确诊断的四个AI模型中,它们的解释也大相径庭。一些模型对中风首次发生的时间给出了不同的解释;其他模型则在替代诊断、受影响的额外大脑区域以及钙化问题上存在分歧。研究人员随后引入了一个新颖的环节:他们要求每个AI模型对其他模型的诊断解释进行评分。这种交叉评估暴露了更多的不一致性,一些模型评分比其他模型更严苛。其中一个模型甚至认为这些发现显示的是慢性脑部异常,而非急性中风,并因此系统性地扣减了其他模型的分数。
近年来,Toma已经发表了30多篇关于AI在医学诊断和医疗保健领域的同行评审研究,以及两本相关主题的书籍。
“我们的研究凸显了AI领域的一个关键区别。大多数成功的医学AI工具是特定任务的算法,它们在大量标记的医学图像数据集上训练,并针对非常具体的诊断任务进行了验证。然而,大型语言模型并非为诊断而优化——它们是为语言和对话而构建的。因此,它们生成看似权威的解释,即使其底层解释是错误的或不一致的。”——Milan Toma博士,纽约理工学院骨科学院副教授
Toma和他的合著者得出结论,未来医疗AI的发展很可能会结合专门的诊断系统和语言模型。然而,尽管LLM可能对临床文档、总结报告或与患者沟通有用,但医学专家的监督在所有诊断解释中仍是不可妥协的。
来源:纽约理工学院(New York Institute of Technology)
期刊参考文献:Hong, S., et al. (2026). Chatting Ain’t Diagnosing: Diagnostic Variability and Fundamental Errors in Multimodal LLM Interpretation in Radiology. Algorithms. DOI: 10.3390/a19030170.
【全文结束】

