大型语言模型能够识别临床记录中的判断性语言,但模型设置对准确性起着关键作用。
"成瘾者"、"不遵医嘱"、"治疗失败"和"肥胖者"是医疗记录中可能出现的带有污名化语言的例子。在乔治梅森大学公共卫生学院,研究人员正在探索人工智能(AI)是否能在这些语言影响患者护理之前,帮助识别临床记录中的这类语言。
护士科学家蒂努·泽维尔(Teenu Xavier)及其同事发现,大型语言模型(LLMs)在识别临床文档中的污名化语言方面显示出潜力,但其性能高度依赖于模型的设置。模型大小、温度设置、提示策略甚至记录类型都可能对结果产生重大影响。
在所有测试的模型中,有一个发现是一致的:提供污名化语言的示例可以提高准确性。
"仅仅选择一个LLM用于临床记录是不够的,"护理学院助理教授泽维尔说,"在这些工具能够在医疗环境中可靠使用之前,必须仔细注意设置和提示。"
《使用大型语言模型检测污名化语言:注意设置》发表在《JAMIA Open》期刊上。
为什么这很重要?
临床文档中使用污名化语言会强化偏见并影响患者未来的护理。AI工具可能有助于识别这类语言,促进更公平的护理,并提高患者的信任度和体验。
"经过优化用于识别污名化语言的预训练模型,可以帮助实现更及时的干预和文档流程的修改,"泽维尔说,"我们的研究强调了医疗专业人员和AI开发者之间持续合作的必要性,以创建改善沟通、减少偏见并提高整体患者体验的工具。"
详细研究结果是什么?
- 训练了大量数据的最大LLM在预测"污名化"语言方面表现最好(94%),但在正确预测"非污名化"语言方面表现最差(47%)。
- 最小的LLM在正确预测"非污名化"语言方面表现最好(99.7%),但在正确预测"污名化"语言方面表现最差(2%)。
- 当研究人员向LLM提供污名化语言的示例时,所有模型的准确性都提高了。
- 急诊医生记录在"污名化"或"非污名化"分类方面的准确率最高(69%),而护理计划记录的准确率最低(56%)。误分类通常出现在长而临床信息密集的记录中,模型会将对复杂疾病或不良事件的中性描述误认为是判断性语言。
- 较大的模型在较低温度(LLM在进行分类时输出的可预测性或随机性)下表现最佳,而较小的模型在较高温度下表现更好,这意味着模型在解释时承担了更多的风险。
出版详情
Teenu Xavier等,《使用大型语言模型检测污名化语言:注意设置》,《JAMIA Open》(2026)。DOI: 10.1093/jamiaopen/ooag037
期刊信息:JAMIA Open
关键医学概念:大型语言模型、人工智能
临床类别:辅助医疗
提供方:乔治梅森大学
【全文结束】

