研究显示,AI聊天机器人在医疗诊断中漏诊超过一半AI Chatbots Miss More Than Half of Medical Diagnoses, Study Finds - CNET

环球医讯 / AI与医疗健康来源:www.cnet.com英国 - 英语2026-09-24 17:26:51 - 阅读时长2分钟 - 766字
最新发表在《自然医学》杂志上的一项研究显示,AI聊天机器人在医疗诊断场景中表现不佳。当1298名英国参与者使用ChatGPT或Meta的Llama 3等大型语言模型寻求医疗建议时,模型正确识别病情的比例低于34.5%,且在初始诊断后仅有44.2%的情况能提供正确的后续步骤。尽管这些模型在医学知识基准测试中得分已接近通过美国医师资格考试的水平,但用户在提问时往往信息不完整,导致诊断准确率大幅下降。研究表明,用户与聊天机器人进行更多对话并不会提高获得正确诊断的概率。OpenAI的调查也显示,60%的美国成年人使用AI获取健康信息,但该研究提醒公众,不应依赖聊天机器人提供严肃的医疗指导。
AI聊天机器人医疗诊断漏诊健康建议大型语言模型病情识别信息不足错误回答后续步骤健康信息医疗指导咨询医生
研究显示,AI聊天机器人在医疗诊断中漏诊超过一半

虽然聊天机器人和大型语言模型可以回答许多日常问题,但根据科学期刊《自然医学》的一项新研究,它们不应成为你寻求医疗建议的首选。

研究中,1298名英国参与者被要求使用诸如ChatGPT或Meta的Llama 3等大型语言模型来获取医疗建议。按照这种方式使用时,LLM正确识别病情的比例低于34.5%。

LLM在研究中的表现

研究承认,LLM在医学知识基准测试中获得的分数已相当于通过美国医师资格考试的水平,且由LLM生成的临床文档“被评为与医生书写的文档质量相当甚至更好”。然而,当研究参与者试图通过向LLM提问来获得同样结果时,却未能成功,这暴露了一个问题。研究发现,这是因为用户往往没有提供足够的信息。在30个抽样互动中,有16个的初始消息仅包含部分信息。

研究指出:“在两例案例中,LLM最初给出了正确回答,但在用户添加更多细节后,又加入了新的错误回答。”这表明与聊天机器人进行更多对话并不能提高获得正确医疗诊断的概率。在初次诊断后,LLM仅44.2%的时间向用户提供了正确的后续步骤。

人们使用聊天机器人寻求医疗建议的频率如何?

根据ChatGPT母公司OpenAI的一项调查,五分之三的美国成年人表示使用AI来获取健康信息。“他们正在使用AI来获取初次感到不适时的信息,咨询AI为就诊做准备,并利用AI更好地理解患者的指示和建议。”OpenAI表示。

尽管ChatGPT网站上有一个小免责声明写着“ChatGPT可能会出错。请检查重要信息”,但许多人仍把聊天机器人的话当作事实。

这项研究提醒我们,不应依赖ChatGPT及类似聊天机器人提供医疗指导,尤其是在严肃的情况下。

本文所含信息仅供教育和参考目的,不构成健康或医疗建议。如有任何关于健康状况或健康目标的问题,请务必咨询医生或其他合格的健康服务提供者。

【全文结束】

猜你喜欢
  • 拉纳克郡婴儿死于罕见病,母亲称探访墓地“太痛苦”拉纳克郡婴儿死于罕见病,母亲称探访墓地“太痛苦”
  • 每位诊所管理者应了解的关于医疗实践中人工智能的10件事每位诊所管理者应了解的关于医疗实践中人工智能的10件事
  • 晨间连线:是否应该使用AI获取医疗建议?第四部分晨间连线:是否应该使用AI获取医疗建议?第四部分
  • 研究揭示大型语言模型在医疗诊断中的局限性研究揭示大型语言模型在医疗诊断中的局限性
  • OpenAI在诉讼称ChatGPT建议导致男子住院一天后推出健康机器人OpenAI在诉讼称ChatGPT建议导致男子住院一天后推出健康机器人
  • 全国调查显示,十分之一的急诊医生正在离开加拿大急诊室全国调查显示,十分之一的急诊医生正在离开加拿大急诊室
  • 深度伪造X光片瞒过放射科医生和AI,凸显滥用风险深度伪造X光片瞒过放射科医生和AI,凸显滥用风险
  • 研究揭示人工智能医疗分诊中的盲点研究揭示人工智能医疗分诊中的盲点
  • 皇家德文郡试点评估急诊科AI抄录技术皇家德文郡试点评估急诊科AI抄录技术
  • 深度伪造X光片可欺骗放射科医生和AI系统深度伪造X光片可欺骗放射科医生和AI系统
热点资讯
全站热点
全站热文