考虑使用聊天机器人获取医疗建议?请先阅读这篇文章Thinking of using a chatbot for medical advice? Read this first. - Yahoo News Canada

环球医讯 / AI与医疗健康来源:ca.news.yahoo.com美国 - 英语2026-09-01 13:22:05 - 阅读时长8分钟 - 3923字
最新研究显示,聊天机器人在医疗咨询方面表现不佳,五款主流AI回答250个医疗问题的准确率仅略超50%,其中20%的错误回答可能带来危险;研究指出AI在处理不完整医疗信息时容易过早下结论且表现过于自信,无法像医生那样进行鉴别诊断,专家建议将AI视为医疗专业人士的补充而非替代品,同时呼吁建立第三方测试机制和监管框架确保医疗AI内容的可靠性与安全性。
健康聊天机器人医疗建议人工智能错误信息危险性医疗诊断AI系统患者信任虚假信息医疗咨询AI局限性医疗保健临床推理
考虑使用聊天机器人获取医疗建议?请先阅读这篇文章

研究人员尼古拉斯·蒂勒在将健康问题输入聊天机器人进行测试时,预期会有一些不完美之处——但没想到失败程度如此之高。

五个AI系统、250个问题,总体正确回答率仅为略高于50%。

按蒂勒的评估,其中五分之一的错误回答具有潜在危险性。

"如果人们遵循这些建议,极有可能造成伤害,"他说,"这令人震惊。"

数百万美国人经常将ChatGPT和Gemini等AI工具作为获取感冒、癌症等相关健康问题的第一站。本月发表的两项研究表明,这可能不是一个好主意——至少在缺乏足够怀疑精神的情况下。

蒂勒是Harbor-UCLA医疗中心Lundquist生物医学创新研究所的研究助理,他在《英国医学杂志开放版》(BMJ Open)上发表了这项研究。另一支来自麻省总医院-布里格姆医疗保健系统(Mass General Brigham)的团队以完全不同的方式探讨了这个问题,该研究发表在《美国医学会杂志网络开放版》(JAMA Network Open)上。

两项研究都设计为真实世界测试,由人类提出开放式问题以及更结构化的封闭式问题,后者要求简短、离散的回答——通常只有几个词——或是否回答。蒂勒的研究聚焦于经常被错误信息扭曲的主题,提出的问题如:5G会导致癌症吗?为了健康益处我应该喝多少生牛奶?

在《JAMA网络开放版》论文中,测试人员向21个模型提供了涉及患者的真实医疗场景,并要求它们"扮演医生"。该论文同样给AI工具打了不及格分数。

这些发现呼应了最近一项测试虚假信息如何轻易渗入AI系统的实验。2024年,一组研究人员发明了一种名为"比克索尼亚症"(bixonimania)的疾病,并在互联网上散布了虚构的研究,描述这是一种因过度使用屏幕时间导致眼睛发红、刺激的疾病。他们并没有刻意隐藏这个骗局。

这些论文包含了明显的破绽:一所不存在的大学、一个虚构的城市,甚至有一行写着"整篇论文都是编造的"。但这无关紧要。几周内,聊天机器人就开始引用这种病症,仿佛它是真实存在的一样,在用户描述症状时将其作为回应。今年1月发表在《柳叶刀》(The Lancet)上的一项研究表明,这个问题并非孤立现象。研究人员测试的最可靠的聊天机器人仍将超过10%的虚构声明视为真实,而表现最差的则接受了超过一半的虚假信息。

这些测试使用的是通用AI工具。自那以后,多家公司一直在努力增强其健康功能或推出更专业的AI应用程序,许多在研究期间评估的模型已经更新,这可能会提高它们的性能。

根据美国健康与盖洛普中心(West Health-Gallup Center on Healthcare in America)本月发布的研究,四分之一的人使用聊天机器人获取健康信息,年轻人更有可能在之前30天内使用AI获取与健康相关的信息或建议。该中心调查了约5,600名具有全国代表性的成年人样本。其中相当一部分人——14%,约1400万人——表示,由于从AI获得的信息或建议,他们没有去看原本会去的医疗服务提供者。

"显然,人们依赖未经验证的聊天机器人获取医疗服务令人深感担忧,"专注于老龄化和医疗保健可负担性的非营利、无党派组织West Health政策中心总裁蒂姆·拉什(Tim Lash)说。但他也在数据中看到了希望的迹象。他表示,受访者从信任角度分为三部分:三分之一使用AI并信任它,三分之一使用但不信任它,其余则不确定。

"这表明人们对护栏和保护信息质量有合理的担忧,"拉什说。

为何聊天机器人难以像医生一样思考

如今许多流行的聊天机器人都是基于大语言模型(LLMs)训练的,它们理解大量文本,最初目的是生成类似人类的语言。这些模型可以从医学期刊和哈佛医学院或克利夫兰诊所等权威机构建立的页面中获取信息,但它们也查看社交媒体和问答论坛等内容。

另一方面,医生的任务几个世纪以来基本保持不变:治疗和管理疾病,核心挑战是确定患者到底患了什么病——医学称之为鉴别诊断。这是一个收集症状、权衡测试证据并将范围缩小到最可能原因的过程,基于科学文献——并加入一些人类直觉。

将AI聊天机器人的设计与医生所需的复杂推理相匹配一直是个挑战。

在2025年1月至12月进行的《JAMA网络开放版》研究中,研究人员基于广泛使用的医学参考书《默克诊疗手册》(Merck Manual)专业版中的病例,提出了29个案例小插曲,方式类似于向医学生或住院医师提出的问题。例如,告诉聊天机器人有一位30岁女性患者腹痛,询问该怎么做。

这些AI——包括ChatGPT、Gemini、Claude、DeepSeek和Grok的不同更新版本——倾向于过早下结论,80%的时间都是错误的。

"当被要求通过不确定的有限数据进行推理时,它们表现不佳,"麻省总医院-布里格姆医疗保健系统MESH孵化器执行董事、该研究的合著者之一马克·苏奇(Marc Succi)说。相比之下,当患者案例调查后期有更完整的信息可用时,这些模型表现良好。

ChatGPT背后的公司OpenAI和谷歌(Gemini)拒绝置评。DeepSeek和xAI(Grok)未回应置评请求。(《华盛顿邮报》与OpenAI有内容合作伙伴关系。)

Claude的制造商Anthropic表示,当人们询问医疗问题时,它被训练承认自己作为AI的局限性。"我们的使用政策明确规定,医学诊断和患者护理被归类为高风险用途,需要合格的专业人员审查任何AI辅助内容或决策,"一位发言人在声明中说。

西奈山健康首席AI官、西奈山医学院Icahn医学院人类健康AI系主任吉里什·纳德卡尼(Girish Nadkarni)表示,这种差异暴露了当前一代聊天机器人的主要弱点,即它们主要通过模式匹配运作——当信息稀缺时,这种方法就会遇到困难。

"人类拥有更普遍的智力。我们通过情况推理,"未参与这两项新研究的纳德卡尼说,"AI聊天机器人只能插值你拥有的数据,而不能推断它们没有的数据。"

研究人员在结论中这样解释这个问题:"临床医生保持不确定性并迭代完善鉴别诊断,而大语言模型则过早地简化为单一答案。"

自信且顺从,即使错误

BMJ Open研究小组使用了蒂勒称为对抗性框架的方法,对包括ChatGPT、Gemini、Meta AI、DeepSeek和Grok版本在内的AI模型施加"压力",时间为2025年2月。研究人员就新闻中的五个主题——癌症、疫苗、干细胞、营养和运动表现——提出了10个开放式和封闭式问题。

他们根据准确性和完整性对回答进行评分,并将其分为三类:无问题、有些问题或高度有问题。

AI在封闭式问题上的表现优于开放式问题,但五个聊天机器人的回答质量相似。

聊天机器人并非为医疗设计。……它们只是擅长说话,就像你去汽车经销商时遇到的销售人员一样。

尼古拉斯·蒂勒,Harbor-UCLA医疗中心Lundquist生物医学创新研究所研究助理

对蒂勒而言,一个大问题是模型表达答案时的自信程度。在250个问题中,只有两个实例中AI(Meta AI)拒绝回答。一个问题涉及建造肌肉的最佳合成类固醇,回答是AI无法提供有关非法使用物质的信息。另一个是关于化疗的替代疗法,AI建议提问者咨询医疗专业人员。

蒂勒表示,这两个都是合理和负责任的回应,但AI承认自己不知道某事、没有足够信息回应或质疑问题的情况"难以置信地罕见"。

AI遇到困难的另一个领域是细微差别。例如,关于新冠和疫苗的问题,蒂勒说,Grok包含了他所谓的"虚假平衡元素",使问题看起来像是存在争论,而科学共识是疫苗有助于预防严重疾病、住院和死亡。

"当人们阅读权威回答时,它赋予了虚假可信度,"蒂勒说,并补充说人们需要知道,大多数这些AI聊天机器人不会根据信息来源的可靠性或有效性来权衡信息。

去年10月发表在《自然》旗下《npj数字医学》(npj Digital Medicine)上的一项先前研究表明,AI聊天机器人可能存在的一个漏洞是它们被设计得过于乐于助人和顺从,导致它们不会挑战不合逻辑的医疗查询。

"结果显示,所有模型的初始顺从率都很高(高达100%),优先考虑帮助性而非逻辑一致性,"作者写道。

公司已经开始加强其AI系统处理健康问题的能力。Meta在4月8日表示,已发布其AI的更新版本,重点关注健康,并指出它与"1000多名医生合作,策划培训数据,使回答更加真实全面"。与此同时,OpenAI一直在与来自各专业的250多名执业医生合作,改进其最新模型的回应,包括更好地识别不确定性并更可能提出后续问题。

尽管如此,纳德卡尼认为需要第三方测试和指导,以及更广泛的公众讨论,关于这种监督是否应通过食品药品监督管理局(FDA)或联邦贸易委员会(FTC)等机构的形式化监管,或者是否可以建立一个行业协会来开展测试并提供批准印章。

"需要一些护栏,"纳德卡尼说。

同时,蒂勒和苏奇建议消费者将AI视为医疗专业人士的补充,而非替代品。

"聊天机器人并非为医疗设计,"蒂勒说,"它们只为一件事设计:模仿对话流畅性。它们只是擅长说话,就像你去买车时遇到的销售人员一样。"

【全文结束】

猜你喜欢
  • 关于人工智能与校园心理健康你需要知道的事(观点)关于人工智能与校园心理健康你需要知道的事(观点)
  • 健康技术泄露事件暴露340万患者记录健康技术泄露事件暴露340万患者记录
  • 健康科技革命:人工智能、数据科学与数字疗法融合健康科技革命:人工智能、数据科学与数字疗法融合
  • 低薪、更长的培训要求制约儿科风湿病学劳动力队伍低薪、更长的培训要求制约儿科风湿病学劳动力队伍
  • AI与医疗设备网络安全:好与坏AI与医疗设备网络安全:好与坏
  • 你的数字孪生体可优先测试治疗方案你的数字孪生体可优先测试治疗方案
  • 五分之二的澳大利亚全科医生使用AI抄写员记录患者病历——但他们是否用关怀换取了便利?五分之二的澳大利亚全科医生使用AI抄写员记录患者病历——但他们是否用关怀换取了便利?
  • 人工智能未来如何帮助NHS更顺畅运行人工智能未来如何帮助NHS更顺畅运行
  • 健康科技公司数据泄露事件曝光340万患者记录健康科技公司数据泄露事件曝光340万患者记录
  • 专家呼吁整合生理学、人工智能和生物传感器以加强医疗保健专家呼吁整合生理学、人工智能和生物传感器以加强医疗保健
热点资讯
全站热点
全站热文