人工智能驱动的聊天机器人在诊断某些疾病方面表现越来越出色,即使这些疾病很复杂。但当涉及到诊断后的治疗和护理指导时,聊天机器人的表现如何呢?例如,患者应在手术前多久停止服用处方抗凝血药物?如果患者过去对类似药物有不良反应,其治疗方案是否应有所改变?
这类问题没有教科书式的对错答案——这需要医生运用他们的判断力。
斯坦福大学医学院医学助理教授Jonathan H. Chen博士及其研究团队正在探索聊天机器人(一种大型语言模型,LLM)是否能有效回答此类细致问题,以及得到聊天机器人支持的医生是否表现更好。
结果表明,答案是肯定的。研究团队测试了聊天机器人在面对各种临床十字路口时的表现。单独使用的聊天机器人表现优于仅能访问互联网搜索和医学参考的医生,但当美国多个地区和机构的医生配备自己的LLM时,他们能够跟上聊天机器人的水平。
Chen说:"多年来我一直认为,人机结合将比单独使用任何一方表现更好。我认为这项研究促使我们更批判性地思考,并问自己,'计算机擅长什么?人类擅长什么?'我们可能需要重新思考在哪些地方使用和结合这些技能,以及为哪些任务招募AI。"
详细介绍这些结果的研究论文发表在《自然医学》杂志上。Chen和哈佛大学助理教授Adam Rodman博士是该研究的共同资深作者。博士后学者Ethan Goh博士和Robert Gallo博士是共同第一作者。
2024年10月,Chen和Goh领导的一个团队进行了一项研究,该研究发表在《JAMA Network Open》杂志上,测试了聊天机器人在诊断疾病时的表现,发现其准确性高于医生,即使医生使用聊天机器人也是如此。
当前这篇论文深入研究了医学中更复杂的一面,评估聊天机器人和医生在"临床管理推理"类别问题上的表现。
Goh解释了两者的区别:想象你在使用手机上的地图应用程序来引导你到达某个目的地。使用LLM来诊断疾病有点像使用地图来确定正确的位置。而你如何到达那里则是管理推理部分——你是因为交通拥堵而走小路吗?还是保持原路,车流缓慢前行?或者等待希望道路畅通?
在医疗环境中,这些决策可能会变得棘手。假设一名医生偶然发现一名住院患者肺部上部有一个相当大的肿块。下一步该怎么做?
医生(或聊天机器人)应该认识到,肺部上叶的大结节从统计学上讲有很高的全身扩散可能性。医生可以立即对该肿块进行活检,安排稍后的手术,或进行影像学检查以尝试了解更多信息。
确定哪种方法最适合患者取决于大量细节,首先是患者的已知偏好。
患者是否不愿接受侵入性手术?患者病史是否显示未能按时复诊?医院的医疗系统在组织随访预约方面是否可靠?转诊情况如何?Chen说,这些类型的背景因素至关重要。
研究团队设计了一项试验,研究三组的临床管理推理表现:单独使用的聊天机器人、46名有聊天机器人支持的医生,以及46名仅能访问互联网搜索和医学参考的医生。他们选择了五个匿名患者病例,并将其提供给聊天机器人和医生,所有医生都提供了书面回应,详细说明他们在每种情况下会做什么、为什么以及在做决定时考虑了什么。
此外,研究人员召集了一组经委员会认证的医生,创建了一个评分标准,用于确定医疗判断或决策是否被适当评估。然后根据该标准对决策进行评分。
令团队惊讶的是,聊天机器人表现优于仅能访问互联网和医学参考的医生,在评分标准上勾选了更多项目。但与聊天机器人配对的医生表现与单独使用的聊天机器人一样好。
Chen和其他人跟进这一发现。仅仅指示临床医生使用AI是不够的——成功的协作取决于工具如何整合到医疗工作流程中。换句话说,谁应该先来?医生是否应该先评估病例,然后咨询AI获取第二意见?还是AI应该先给出初步意见?
在发表在《npj Digital Medicine》杂志上的一篇论文中,研究团队详细介绍了70名医生与AI代理合作的随机对照试验结果,该AI代理评估了一组医疗病例。团队发现,当AI在医生提供评估后评估病例时,AI往往倾向于支持医生的意见,尽管它被指示独立推理。
事实证明,获胜的方法是并行分析:医生和AI同时评估病例,然后AI工具创建一个总结,分析两种观点、相似之处以及差异所在。
"基本思想是研究如何重新设计AI系统的操作以支持医生和AI之间更深入的协作,将AI的使用从与工具交互转变为与临床队友协作,"斯坦福医学院医学生、这项研究的主要作者Selin Everett说。
聊天机器人与医生合作提升表现的确切原因尚待讨论。使用LLM是否迫使医生更仔细地思考病例?还是LLM提供了医生自己想不到的指导?Chen说,这是未来探索的方向。
聊天机器人和与聊天机器人配对的医生取得的积极成果引发了一个一直很受欢迎的问题:AI医生即将来临吗?
"也许这对AI有利,"Chen说。但研究结果表明,医生可能更愿意欢迎聊天机器人助手,而不是取代医生。
"这并不意味着患者应该跳过医生直接去找聊天机器人。不要这样做,"他说。"有很多好的信息,但也有很多不好的信息。我们都需要培养的技能是辨别什么是可信的,什么不是。现在这比以往任何时候都更重要。"
来自VA Palo Alto Health Care System、Beth Israel Deaconess Medical Center、哈佛大学、明尼苏达大学、弗吉尼亚大学、微软和凯撒医疗的研究人员为这项工作做出了贡献。
【全文结束】

