本文讨论自杀话题。如果您或您认识的人有自杀念头,请拨打自杀与危机生命热线988或1-800-273-TALK(8255)。
人工智能一直被誉为医疗保健领域的福音,但一项新研究揭示了其在提供医疗建议方面的潜在缺陷。
2026年1月,OpenAI推出了ChatGPT Health,这是广受欢迎的聊天机器人工具的医疗专用版。该公司将该工具宣传为“一种专属体验,安全地将您的健康信息与ChatGPT的智能结合在一起,帮助您更知情、更有准备、更有信心地管理健康”。
但西奈山伊坎医学院的研究人员发现,该工具未能对“相当数量”的严重医疗案例推荐急诊护理。这项于2月23日发表在《自然医学》杂志上的研究旨在探索ChatGPT Health(据报告每天约有4000万用户)如何处理人们询问是否应寻求急诊护理的情况。
“目前,没有任何独立机构在这些产品面向公众之前对其进行评估,”主要作者、纽约市西奈山伊坎医学院泌尿外科讲师阿什温·拉马斯瓦米博士告诉Fox News Digital。“我们不会接受药物或医疗设备缺乏评估,对于数千万人用于做出健康决策的产品,我们也不应接受。”
研究团队创建了涉及21个医学专业的60个临床情景,从轻微病症到真正的医疗紧急情况不等。然后由三名独立医生根据56个医学学会发表的临床实践指南为每种情况指定适当的紧急程度。研究人员与ChatGPT Health进行了960次交互,观察该工具如何回应,并考虑了性别、种族、护理障碍和“社会动态”等因素。
虽然“明确的紧急情况”如中风或严重过敏通常处理得当,但研究人员发现该工具对许多紧急医疗问题进行了“低估分诊”。例如,在一个哮喘场景中,系统承认患者出现了呼吸衰竭的早期迹象,但仍建议等待而非寻求急诊护理。
“ChatGPT Health在中度严重情况下表现良好,但在两端均失败——而这些正是正确判断最为关键的情况,”拉马斯瓦米告诉Fox News Digital。“它对超过一半的真正紧急情况低估了分诊,而对大约三分之二的临床指南建议居家处理的轻微情况进行了高估。”
低估分诊可能危及生命,而高估分诊则可能使急诊科不堪重负,延误真正需要护理的患者。研究人员还发现了自杀风险警报的不一致性:在某些较低风险场景下它提示用户拨打988自杀与危机生命热线,而在另一些场景下,即使患者讨论自杀意念时它也没有提出该建议。
“自杀防护栏的失效是最令人震惊的,”研究合著者、西奈山医疗系统首席AI官吉里什·N·纳德卡尼博士告诉Fox News Digital。ChatGPT Health旨在当有人描述自伤想法时显示危机干预横幅。研究人员测试了一位27岁的患者,他说自己一直在考虑服用大量药物。“当他单独描述症状时,横幅100%出现。然后我们添加了正常实验室结果后——同一患者,同一措辞,同一严重程度——横幅消失了。”纳德卡尼说,“一个在一种情境下完美运行、在几乎相同情境下完全失效的安全功能……是一个根本性的安全问题。”
研究人员还对社会影响方面感到惊讶。“当场景中的家庭成员说‘没什么大不了的’——这在现实生活中经常发生——系统低估患者症状的可能性增加了近12倍,”纳德卡尼说。“每个人都有配偶或父母告诉他们反应过度了。在潜在的紧急情况下,AI不应该附和他们的说法。”
Fox News Digital已联系ChatGPT的创建者OpenAI寻求评论。
福克斯新闻高级医学分析员马克·西格尔博士称这项新研究“很重要”。“它强化了一个原则:虽然大语言模型可以对明确的紧急情况进行分诊,但在处理细微差别的情况时困难得多,”未参与该研究的西格尔告诉Fox News Digital。“这正是医生和临床判断发挥作用的地方——了解患者病史的细微差别,以及他们报告症状和对待健康的方式。”ChatGPT和其他大语言模型可以成为有用的工具,但“不应被用于提供医疗指导”。“机器学习和持续数据输入可以提供帮助,但永远无法弥补根本性问题——需要人类判断来决定某事是否真正紧急。”
德克萨斯州的急诊医生和AI专家哈维·卡斯特罗博士也强调了这项研究的重要性,称其“正是我们需要的独立安全评估”。“创新速度很快。监管必须同样迅速,”未参与该研究的卡斯特罗告诉Fox News Digital。“在医疗保健中,最危险的错误发生在极端情况下——当某件事看起来轻微但实际上灾难性时。这正是临床判断最为关键的地方,也是AI必须接受压力测试的地方。”
研究人员承认研究设计存在一些潜在局限性。“我们使用了医生编写的临床情景而非真实的患者对话,并且在单一时间点进行测试——这些系统频繁更新,因此性能可能会改变,”拉马斯瓦米告诉Fox News Digital。此外,大多数漏诊的紧急情况发生在危险取决于病情随时间变化的情境中。目前尚不清楚急性医疗紧急情况是否会出现同样的问题。由于系统必须选择单一的固定紧急程度类别,这些测试可能无法反映它在来回对话中可能给出的更细微的建议。同时,该研究的规模不足以可靠地检测推荐建议因种族或性别而出现的微小差异。“我们需要持续审计,而非一次性研究,”卡斯特罗指出,“这些系统频繁更新,因此评估必须持续进行。”
研究人员强调了针对严重问题寻求即时护理的重要性。“如果感觉某件事严重不对劲——胸痛、呼吸困难、严重过敏反应、自伤想法——请去急诊科或拨打988,”拉马斯瓦米建议。“不要等待AI告诉你没事。”研究人员表示,他们支持使用AI改善医疗保健可及性,并且进行这项研究并非为了“拆解技术”。“这些工具在正确的事情上确实有用——理解你已经收到的诊断、查找你的药物及其副作用、或在简短就诊后获得未完全解答的问题的答案,”拉马斯瓦米说。“这与判断你是否需要急诊护理是完全不同的使用场景。将它们视为医生的补充,而非替代品。”
卡斯特罗也认为AI健康工具的好处应与其风险权衡。“AI健康工具可以增加可及性、减少不必要的就诊、赋予患者信息权。它们本身并非不安全,但在临床判断方面还不是替代品。”“这项研究并不意味着我们放弃医疗保健领域的AI,”他继续说道。“它意味着我们要使其成熟。独立测试和更强的防护栏将决定AI是成为安全网还是负担。”
【全文结束】

