新研究揭示,大型语言模型在诊断准确性上优于医生,但需要战略性整合才能增强临床决策,而非取代人类专业知识。
研究:《大型语言模型对诊断推理的影响:一项随机临床试验》。图片来源:Shutterstock AI / Shutterstock.com
在最近发表于《JAMA Network Open》的一项研究中,研究人员调查了与使用标准诊断资源相比,大型语言模型(LLM)是否能增强医生的诊断推理能力。结果发现,LLM单独使用时表现优于使用LLM进行病例诊断的医生群体。
人工智能如何改善临床诊断?
诊断错误可能源于系统性和认知问题,对患者造成严重伤害。因此,提高诊断准确性需要解决临床推理中的认知挑战。然而,反思实践、教育项目和决策支持工具等常见方法并未有效提高诊断准确性。
人工智能(尤其是LLM)的最新进展通过模拟人类推理和回应,提供了有前景的支持。LLM还能处理复杂医疗案例,协助临床决策,同时以共情方式与用户互动。
目前,LLM在医疗保健中的应用主要是补充性的,以增强人类专业知识。考虑到医疗专业人士在临床环境中使用LLM所接受的培训和整合有限,了解LLM在临床环境中的应用对患者护理的影响至关重要。
关于研究
在本研究中,研究人员采用随机单盲设计,评估了使用LLM或传统资源的医生在诊断推理能力方面的表现。研究招募了从事家庭医学、急诊医学或内科的医生,所有会议均在现场或远程进行。
医生们被给予一小时时间,通过调查工具处理六个中等复杂度的临床病例。干预组的参与者可以使用LLM工具ChatGPT Plus和GPT-4,而对照组的参与者仅使用传统资源。
临床病例包括详细的病史、检查结果和检验数据。病例的审查和选择遵循严格标准,由四位医生参与,所选病例涵盖多种医疗状况,并排除了简单和极罕见的病例。
结构化反思被用作传统评估工具,要求参与者列出最可能的鉴别诊断,解释支持性和反对性因素,选择最可能的诊断并提出进一步治疗步骤。回答根据最终诊断的准确性以及诊断推理进行评分。
LLM的客观诊断性能通过标准化提示进行评估,重复三次以确保一致性。然后通过为正确的推理和诊断合理性分配分数来对回答进行评分。
还使用混合效应模型进行统计分析以解释参与者内部变异,而对时间指标和诊断性能则应用了线性模型和逻辑模型。
研究结果
与医生使用传统资源相比,医生使用LLM并未改善复杂病例的诊断推理。然而,LLM单独使用时在诊断病例方面显著优于医生。
这些发现在不同医生经验水平中一致,表明仅提供LLM访问权限不太可能增强诊断推理。
两组在病例解决评估方面未观察到显著差异。然而,需要更大样本量的进一步研究来确定使用LLM是否能提高效率。
LLM单独表现优于两个人类群体,这一结果与针对其他LLM技术的类似研究结果相似。LLM优越的独立性能归因于对提示表述的敏感性,这强调了提示策略在最大化LLM效用中的重要性。
结论
LLM在高效诊断推理方面显示出巨大潜力。尽管本研究中的LLM成功提供了诊断,但这些结果不应被解释为LLM可以在没有临床医生监督的情况下提供诊断。
“随着人工智能研究的进展并接近临床整合,使用最现实和临床相关的评估方法与指标来可靠地衡量诊断性能将变得更加重要。”
将LLM整合到临床实践中需要有效的策略来设计结构化提示,并培训医生使用详细提示,这可以优化医生与LLM协作在诊断中的表现。尽管如此,利用LLM增强诊断推理涉及将这些工具作为临床决策过程中医生专业知识的补充,而非替代。
期刊参考:
Goh, E., Gallo, R., Hom, J., 等 (2024). 大型语言模型对诊断推理的影响:一项随机临床试验。《JAMA Network Open》7(10); e2440969–e2440969. doi:10.1001/jamanetworkopen.2024.40969.
【全文结束】

