ChatGPT Health——OpenAI新推出的专注于健康的聊天机器人——根据上周发表在《自然医学》杂志上的一项研究,经常低估医疗紧急情况的严重程度。
在这项研究中,研究人员测试了ChatGPT Health基于真实场景对医疗案例进行分诊(即评估严重程度)的能力。
此前的研究表明,ChatGPT可以通过医学考试,并且近三分之二的医生报告称在2024年使用了某种形式的人工智能。但其他研究也显示,包括ChatGPT在内的聊天机器人并不能提供可靠的医疗建议。
ChatGPT Health与OpenAI的通用ChatGPT聊天机器人是分开的。该程序是免费的,但用户必须专门注册才能使用健康程序,目前该程序有等待列表。OpenAI表示,ChatGPT Health使用更安全的平台,用户可以安全地上传个人医疗信息。
据OpenAI称,全球超过4000万人使用ChatGPT回答医疗保健问题,每周近200万条ChatGPT消息涉及保险。在其网站上对ChatGPT Health的详细描述中,OpenAI表示它“不适用于诊断或治疗”。
在研究中,研究人员向ChatGPT Health输入了60个医疗场景。然后将聊天机器人的回应与三位医生的回应进行了比较,这三位医生也审查了这些场景,并根据医疗指南和临床专业知识对每个场景进行了分诊。
每个场景有16个变体,改变了包括患者种族或性别在内的因素。这些变体旨在“产生完全相同的结果”,主要研究作者、纽约市西奈山医院泌尿科讲师阿什温·拉马斯瓦米博士说。这意味着涉及男性的紧急病例如果患者是女性,仍应被归类为紧急情况。研究没有发现基于人口统计学变化的结果有显著差异。
研究人员发现,ChatGPT Health对51.6%的急诊病例“分诊不足”。也就是说,机器人没有建议患者去急诊室,而是建议在24到48小时内看医生。
这些紧急情况包括患有危及生命的糖尿病并发症——糖尿病酮症酸中毒的患者,以及出现呼吸衰竭的患者。如果不治疗,两者都会导致死亡。
拉马斯瓦米说:“任何医生,任何接受过任何程度培训的人都会说,那个患者需要去急诊科。”
他说,在即将发生呼吸衰竭等案例中,机器人似乎在“等待紧急情况变得不容忽视”后才建议去急诊室。
研究发现,像中风这样具有明确症状的紧急情况,被正确分诊的概率为100%。
OpenAI的一位发言人表示,公司欢迎对人工智能在医疗保健中应用的研究,但称这项新研究并未反映ChatGPT Health的典型使用方式或设计功能。发言人表示,该聊天机器人旨在让人们提出后续问题,以便在医疗情况下提供更多背景信息,而不是对医疗场景给出单一回应。
发言人表示,ChatGPT Health目前只对有限数量的用户开放,OpenAI仍在努力改进模型的安全性和可靠性,然后才会更广泛地提供该聊天机器人。
与研究中的人类医生相比,该聊天机器人还对64.8%的非紧急病例进行了“过度分诊”,在没有必要的情况下建议预约医生。机器人建议一位喉咙痛三天的患者在24到48小时内看医生,而居家护理就足够了。
拉马斯瓦米说:“对我来说,它为何在某些领域做出推荐而在其他领域不做出推荐,没有逻辑可言。”
在自杀意念或自残场景中,机器人的回应也不一致。
当用户表达自杀意图时,ChatGPT本应引导用户联系988(自杀与危机热线)。OpenAI发言人表示,ChatGPT Health的工作方式相同。然而,在这项研究中,ChatGPT Health却在不需要时引导用户联系988,而在必要时却没有引导。
【全文结束】

