摘要
目标 本研究旨在利用微调后的FLAN-T5-Large、BERT、RoBERTa和Gemma-2-2B模型,识别非结构化临床笔记中的社会隔离和社会支持实例。
材料与方法 使用包含社会背景线索的标注临床笔记片段来微调每个模型。通过准确率、精确率、召回率和宏F1分数评估性能。使用结构化提示来指导模型执行分类任务并减少过度泛化。跨模型的性能比较评估了敏感性、稳健性和假阳性减少情况。
结果 FLAN-T5-Large取得了最高性能,宏F1分数为0.92±0.04,显示出各类别的平衡结果:社会隔离(F1 = 0.91±0.03)、无社会隔离(F1 = 0.94±0.05)和社会支持(F1 = 0.90±0.04)。Gemma-2-2B产生了可比结果,宏F1分数为0.89±0.10。BERT和RoBERTa分别取得了较低的宏F1分数0.77±0.17和0.80±0.21,且在不同类别间表现不一致。
讨论 本工作的主要贡献是精确识别与社会联系相关的多个概念。通过整合真实阳性与假阳性的标注示例,包括否定表达和语境模糊的术语,模型能够更好地将相关社会背景线索与噪声区分开来。同时训练社会隔离和社会支持提供了用于比较分析和患者分层的双重框架。
结论 基于Transformer的NLP模型,特别是FLAN-T5-Large,展示了识别临床文本中社会隔离和社会支持的潜力。这些发现支持使用生成式AI技术从电子健康记录(EHRs)中增强社会隔离的检测,推动情境感知的医疗保健分析。
通俗摘要 强大的社会联系可以帮助人们延长寿命,而感到孤立则会增加严重健康问题的风险。关于某人是否社会孤立的信号并未被记录在其电子健康记录中,而是隐藏在作为医疗保健访问一部分创建的临床笔记中。由于这些笔记冗长且复杂,手动审查它们以寻找社会联系是不可能的。因此,使用称为大型语言模型(LLMs)的先进人工智能模型来自动生成查找临床笔记中社会孤立或社会支持的信号。为了训练LLMs检测这些信号,我们首先为三种情景创建了大量示例:社会孤立、社会支持以及示例包含"孤立"一词但与社会联系无关的情况。这些示例帮助LLMs理解每种情景的示例模式。我们训练了三个LLMs,FLAN-T5、BERT和Gemma。其中,FLAN-T5-Large表现更好,在不同患者群体中取得了准确且一致的结果。这种自动化方法可以帮助医疗保健系统识别可能缺乏社会支持的患者,更新其健康记录并将他们引导至可以帮助他们的服务,最终改善患者护理。
利益冲突声明
作者声明无利益冲突。
作者声明
我确认已遵守所有相关伦理准则,并获得了必要的IRB和/或伦理委员会批准。
是
提供本研究批准或豁免的IRB/监督机构的详细信息如下:
田纳西大学健康科学中心IRB已批准本工作。
我确认已获得所有必要的患者/参与者同意,并已归档适当的机构表格,且任何包含的患者/参与者/样本标识符对研究组外的任何人(例如,医院工作人员、患者或参与者本人)都是未知的,因此无法用于识别个人。
是
我理解所有临床试验和任何其他前瞻性干预研究必须在ICMJE批准的注册处(如ClinicalTrials.gov)进行注册。我确认稿件中报告的任何此类研究均已注册,并提供了试验注册ID(注意:如果发布的是事后注册的前瞻性研究,请在试验ID字段中提供解释为何研究未提前注册的声明)。
是
我已遵循所有适当的研究报告指南,如任何相关的EQUATOR Network研究报告清单和其他相关材料(如适用)。
是
【全文结束】

