研究揭示大型语言模型在医疗诊断中的局限性Study reveals limitations of large language models in medical diagnostics

环球医讯 / AI与医疗健康来源:www.news-medical.net美国 - 英语2026-09-24 16:58:41 - 阅读时长4分钟 - 1627字
一项由纽约理工学院领导的新研究表明,虽然通用大型语言模型(如GPT-5、Gemini 3 Pro等)在分析CT脑部扫描时能给出看似权威的回答,但存在20%的基本诊断错误率,且不同模型间的解释差异显著。研究强调,这些模型并非为医学诊断优化,而是为语言和对话构建的,因此其诊断可靠性需谨慎对待。未来医疗AI应结合专用诊断系统与语言模型,但任何诊断解释都必须在医学专家监督下进行。
健康医疗诊断人工智能局限性大型语言模型误诊缺血性中风出血性中风临床监督医学影像
研究揭示大型语言模型在医疗诊断中的局限性

人工智能(AI)正在迅速改变医疗保健领域。AI系统如今能够从视网膜照片中检测糖尿病眼病,并分析CT图像以发现早期肺癌和中风的迹象。目前,在全国乃至全世界的医院中,专门的算法正在默默地协助医生,优先处理紧急扫描,并标记出可能被忽略的细微异常。这些专门的AI工具——通常在数百万张精确分类的医学图像上训练——正越来越多地融入实际临床实践中。

与此同时,另一种形式的AI吸引了公众的注意:大型语言模型(LLM)。这些广泛可用的系统,例如ChatGPT和Claude,能够同时分析文本和图像。理论上,这些能力应该使它们非常适合医疗任务,但通用AI平台在医学诊断方面是否可靠呢?

由纽约理工学院(New York Institute of Technology)骨科学院副教授Milan Toma博士领导的一项新研究给出了否定答案。正如学术期刊《Algorithms》所报道的,Toma及其合著者——包括NYITCOM高级开发安全运维工程师Mihir Matalia和医学生Sungjoon Hong——测试了世界上一些最先进的多模态LLM(GPT-5、Gemini 3 Pro、Llama 4 Maverick、Grok4和Claude Opus 4.5 Extended)的可靠性。

研究人员向每个AI模型提供了相同的CT脑部扫描图像,该图像显示明确的颅内病变。然后,他们要求这些模型像放射科医生一样分析图像——识别所使用的成像技术、病变在大脑中的位置、主要诊断、关键特征以及可能的替代诊断。总体而言,研究结果显示,AI模型在基本诊断方面的错误率达到20%,并且在解释和评估方面存在令人担忧的变异性。

起初,这些模型给出了有希望的结果:五个模型都正确地将图像识别为CT脑部扫描。其中四个模型还发现了一个关键发现:左侧大脑中动脉附近的缺血性中风。然而,有一个模型犯了一个基本错误,错误地将中风归类为大脑对侧的出血。在真实的临床环境中,这种错误可能严重损害患者的健康,因为缺血性中风和出血性中风需要不同的治疗方法。

即使在得出正确诊断的四个AI模型中,它们的解释也大相径庭。一些模型对中风首次发生的时间给出了不同的解释;其他模型则在替代诊断、受影响的额外大脑区域以及钙化问题上存在分歧。研究人员随后引入了一个新颖的环节:他们要求每个AI模型对其他模型的诊断解释进行评分。这种交叉评估暴露了更多的不一致性,一些模型评分比其他模型更严苛。其中一个模型甚至认为这些发现显示的是慢性脑部异常,而非急性中风,并因此系统性地扣减了其他模型的分数。

近年来,Toma已经发表了30多篇关于AI在医学诊断和医疗保健领域的同行评审研究,以及两本相关主题的书籍。

“我们的研究凸显了AI领域的一个关键区别。大多数成功的医学AI工具是特定任务的算法,它们在大量标记的医学图像数据集上训练,并针对非常具体的诊断任务进行了验证。然而,大型语言模型并非为诊断而优化——它们是为语言和对话而构建的。因此,它们生成看似权威的解释,即使其底层解释是错误的或不一致的。”——Milan Toma博士,纽约理工学院骨科学院副教授

Toma和他的合著者得出结论,未来医疗AI的发展很可能会结合专门的诊断系统和语言模型。然而,尽管LLM可能对临床文档、总结报告或与患者沟通有用,但医学专家的监督在所有诊断解释中仍是不可妥协的。

来源:纽约理工学院(New York Institute of Technology)

期刊参考文献:Hong, S., et al. (2026). Chatting Ain’t Diagnosing: Diagnostic Variability and Fundamental Errors in Multimodal LLM Interpretation in Radiology. Algorithms. DOI: 10.3390/a19030170.

【全文结束】

猜你喜欢
  • 研究人员在美国农村地区发现令人担忧的阿尔茨海默病模式研究人员在美国农村地区发现令人担忧的阿尔茨海默病模式
  • 研究发现这些爱好可将阿尔茨海默病推迟最多5年研究发现这些爱好可将阿尔茨海默病推迟最多5年
  • 研究发现基于人工智能的心电图分析在识别闭塞性心肌梗死方面具有更高准确性研究发现基于人工智能的心电图分析在识别闭塞性心肌梗死方面具有更高准确性
  • 研究人员称人工智能预测阿尔茨海默病准确率接近93%研究人员称人工智能预测阿尔茨海默病准确率接近93%
  • 研究人员开发DNA适配体检测阿尔茨海默病生物标志物研究人员开发DNA适配体检测阿尔茨海默病生物标志物
  • 研究人员发现居住在城市与中风风险降低有关研究人员发现居住在城市与中风风险降低有关
  • 研究发现,对NHS技术和人工智能的支持分布不均研究发现,对NHS技术和人工智能的支持分布不均
  • 研究人员获得最高2200万美元资助测试延缓衰老药物研究人员获得最高2200万美元资助测试延缓衰老药物
  • 研究发现保险繁文缛节延误关键心力衰竭药物处方研究发现保险繁文缛节延误关键心力衰竭药物处方
  • 研究发现:阿尔茨海默病受益者从联邦医疗保险优势计划风险调整模型中获益研究发现:阿尔茨海默病受益者从联邦医疗保险优势计划风险调整模型中获益
热点资讯
全站热点
全站热文