要点
- 每周有超过4000万用户依赖ChatGPT健康功能获取医疗建议。
- 研究发现,ChatGPT健康功能未能始终如一地标记自杀风险,并遗漏了一些紧急情况。
- 它在处理教科书式的急诊情况时能给出良好建议,但在复杂或危重病例中表现不佳。
每周有超过4000万人使用OpenAI的ChatGPT健康功能来获取健康信息和建议,因此科学家决定对其进行严格测试,以评估其建议的可靠性。科学家们提出了一系列问题,范围从非常轻微、低风险的情景到极高风险的情况。研究团队与该工具进行了960次交互。
这项发表在《自然医学》上的研究,是自2026年1月该基于大型语言模型的工具推出以来,首次进行的独立安全评估。
最差且有时危险的后果
大量年轻人和无保险成年人转向AI聊天机器人寻求心理健康建议。根据凯撒家庭基金会的研究,在过去一年中,约有十分之三的18至29岁人群曾使用AI获取关于心理健康或情绪健康的信息,相比之下,30至49岁成年人中这一比例为约五分之一(18%)。
ChatGPT健康功能未能始终如一地触发自杀风险警报。ChatGPT的设计初衷是在高风险情况下引导人们拨打988和危机生命线电话。因自杀失去孩子的父母正试图追究OpenAI等公司的责任。据国家公共广播电台报道,在一桩令人震惊的案件中,一名聊天机器人劝阻一名青少年男孩向父母寻求帮助,甚至主动为他写好了遗书,根据他的父亲马修·雷恩在参议院关于AI聊天机器人危害的听证会上的证词。
该工具还未能识别出医生认为属于紧急情况的其他健康场景。
“大型语言模型已成为患者获取医疗建议的第一站——但在2026年,它们在临床极端情况下最不安全,此时判断力决定了是错过紧急情况还是引发不必要的恐慌,”哈佛医学院生物医学信息学系主任艾萨克·S·科汉博士在Mount Sinai的新闻稿中表示。“当数百万人使用AI系统来决定是否需要紧急护理时,风险极高。独立评估应成为常规,而非可选项。”
最佳结果
ChatGPT健康功能在处理教科书式的急诊情况(如过敏反应和中风)时能提供可靠建议。人们可能会在使用该工具作为初步意见后,再预约全科医生或专科医生。
如何提出好问题?
假设你出现严重胃痛。ChatGPT健康功能可能会将其视为消化不良。但根据《纽约时报》的一篇报道,如果你提供更具体的信息,比如疼痛位置、严重程度和持续时间,它可能会给出不同的答案,例如胆结石。
这些AI工具的新版本将会推出,但就目前而言,它们并不比在谷歌上搜索好多少。
【全文结束】

