实施科学中的理论、模型与框架在评估质量改进举措中的应用:范围综述Mapping Theories, Models and Frameworks from implementation science for evaluating quality improvement initiatives: a scoping review | BMJ Quality & Safety

环球医讯 / 健康研究来源:qualitysafety.bmj.com美国 - 英语2026-07-25 13:58:57 - 阅读时长19分钟 - 9102字
本范围综述研究分析了实施科学中的理论、模型与框架(TMFS)如何用于评估医疗质量改进(QI)计划。研究筛选了1824篇文献,最终纳入80项研究,识别出23种独特的TMFS,其中最常用的是RE-AIM框架(27%)和实施研究综合框架(CFIR)(20%)。虽然94%的研究使用TMFS指导数据收集或分析,但仅43%明确测试了构念关系或因果路径。结果表明,TMFS在概念清晰度和结构方面表现良好,但在公平性和社会文化响应方面有限。研究结论指出,单一TMF无法涵盖所有评估功能,需要采用整合方法结合互补TMFS来检查背景、改进机制和结果,特别是在前瞻性地将公平性等构念纳入研究设计和评估中,以增强可重复性并改善结果在不同环境中的可转移性。
医疗保健质量改进QI举措评估实施科学理论模型与框架RE-AIM框架CFIR框架公平性评估医疗保健实施结果
实施科学中的理论、模型与框架在评估质量改进举措中的应用:范围综述

摘要

背景

改进科学已为医疗保健中质量改进(QI)的应用提供了方法论和理论基础。然而,关于QI评估严谨性的担忧仍然存在。实施科学中的理论、模型和框架(TMFS)支持循证实践的应用,但它们在指导QI举措评估方面的使用尚未得到充分表征。

目标

确定哪些实施科学TMFS已被用于评估医疗保健中的QI举措,评估这些TMFS在评估研究中的应用方式,并比较TMFS的内在方法学属性。

方法

我们按照Arksey和O'Malley的框架进行了范围综述。符合条件的研究发表于2010年至2025年间,使用至少一种TMF评估QI举措。通过PubMed、Scopus和Web of Science搜索同行评审文献。灰色文献通过针对性的谷歌搜索获取。TMFS根据其在每项研究中的应用在文章层面进行评估,并根据其内在方法学属性在TMF层面进行评估。

结果

在筛选的1824篇文献中,纳入80项研究。识别出23种独特的TMFS。其中,最常用的TMFS是Reach、Effectiveness、 Adoption、Implementation和Maintenance框架(27%)和实施研究综合框架(CFIR)(20%)。尽管94%的研究使用TMFS指导数据收集或分析,但只有43%明确测试了构念关系或因果路径。TMFS在概念清晰度和结构方面表现出色,但在公平性和社会文化响应方面有限。

结论

TMFS在QI举措评估中的应用具有异质性。没有单一TMF能够涵盖评估功能的全部范围。更严格的评估需要采用整合方法,结合互补的TMFS来检查背景、改进机制和结果。在研究设计和评估中前瞻性地将TMF构念(特别是公平性)操作化,对于加强可重复性并改善不同环境中发现的可转移性至关重要。

介绍

改进科学已发展成为一个旨在支持质量改进(QI)的方法论和理论基础及其在医疗保健中应用的领域。明确阐述内容理论被定义为QI举措设计、执行和评估的基础。此外,时间序列数据分析,如运行图表和统计过程控制图表(SPC),被广泛用于评估随时间变化并区分随机和非随机变异。然而,对SPC方法学标准的可变遵守增加了将观察到的变化归因于干预的偏见风险。

鉴于观察到的结果也可能受到QI举措实施的组织条件的影响,诸如理解质量成功模型(MUSIQ)等背景评估工具通过概述作为QI成功预测因素的背景决定因素,扩展了QI评估的范围。这些背景决定因素的纳入将QI评估的范围从测量随时间的绩效变化扩展到检查影响改进结果的机制、背景元素和行为决定因素。然而,关于传统QI评估方法的方法论严谨性问题,特别是其在归因因果关系方面的能力有限,促使人们呼吁采用更严格的评估方法。

与实验设计相比,QI工作面临实质性的方法论和概念挑战,因为QI努力涉及迭代、适应性和对背景敏感的复杂干预。此外,QI工作通常针对超出临床工作流程的动态组织和系统级过程,从而促进医疗保健交付和临床结果的改进。

尽管引入了诸如质量改进报告卓越标准(SQUIRE)指南等报告标准,以标准化和提高QI结果传播的透明度,但这些工具并未提供关于如何评估QI举措的全面指导。因此,许多QI研究继续未能充分记录干预措施被采纳和适应的程度,以及结果是否可以合理地归因于改进工作。

同时,实施科学已发展成为一个互补但又不同的学科,专注于评估连接证据生成和常规实践的努力。实施科学旨在了解循证实践如何融入现实世界环境的过程。这一努力的核心是使用理论、模型和框架(TMFS),它们为识别实施障碍和促进因素、理论化因果路径以及指导实施策略的评估提供了结构化方法。

由于QI干预通过实践变化实施,其效果不仅取决于干预本身的内容,还取决于其实施机制。实施科学TMFS提供了评估这些实施过程及其如何影响改进结果的结构化方法。通过支持对干预设计和交付、实施保真度、背景影响和实施结果的更系统评估,这些TMFS可用于评估QI举措的有效性,加强因果推断并提高研究结果的外部有效性。

在一项对大型基于实践研究网络的99个项目进行的12年回顾中,只有30%包含了实施和改进科学的要素。其中,46%报告没有理论框架。因此,尚不清楚哪些实施科学TMFS已被用于评估QI举措,以及它们在多大程度上被用于评估过程和结果的变化。

为了解决这一差距,本范围综述旨在识别在过去15年中用于评估QI举措的实施科学TMFS,评估其应用情况,并综合这些TMFS的方法学属性。目标是指导开发逐步评估方法,指导选择互补的TMFS,以增强QI评估研究的方法学严谨性。

方法

本范围综述按照Arksey和O'Malley提出的方法论框架进行,并根据系统综述和荟萃分析的首选报告项目扩展版(PRISMA-ScR)报告。研究方案于2025年6月30日在开放科学框架注册库注册(osf.io/wtua7)。

文献检索问题

本综述旨在解决以下问题:哪些实施科学TMFS已被用于评估QI举措,这些TMFS在评估研究中如何应用,以及哪些方法学属性和评估功能表征每个TMF?

使用问题、人群、变更和结果框架制定了文献检索问题。我们试图解决TMFS应用于QI举措评估的综合缺乏以及对这些TMFS如何被操作化以评估QI举措的有限比较理解。

信息来源和检索策略

我们在2025年7月27日对PubMed、Scopus和Web of Science进行了同行评审文献搜索。针对数据库的特定检索字符串围绕综述的三个核心概念支柱开发:(1)QI举措,(2)实施科学TMFS和(3)评估功能。检索术语经过与图书管理员的迭代开发,并使用已知TMFS的种子集进行验证,以确保检索到相关基础TMFS。灰色文献搜索使用针对谷歌搜索引擎的定制检索策略以及对医疗机构改进研究所来源的定向搜索进行。

纳入标准和文章选择

符合条件的来源包括2010年至2025年发表的以英语或西班牙语发表的同行评审期刊经验研究,旨在捕获实施科学TMFS开发和传播的时期。我们纳入西班牙语文章以增加对西班牙语医疗系统的QI评估的覆盖范围,特别是拉丁美洲的评估可能以当地语言发表。如果文章报告了在医疗保健环境中进行的QI举措评估并提到至少一个实施结果以支持QI举措的评估,则将其纳入。

基于核心组件指南,QI举措被定义为包含以下所有元素的项目:(1)可衡量的改进目标,(2)明确的内容理论,(3)定义的测量策略,以及(4)基于适应性学习原则的执行理论,如在使用Plan-Do-Study-Act循环或等效改进科学方法的迭代测试和设计适应中所证明的。符合条件的研究还必须展示TMF的至少一个评估功能,特别是通过使用TMF:(1)指导数据收集和/或数据分析,(2)解释变化机制或(3)指定构念之间的关系。

如果研究未报告基于医疗保健的QI举措、缺乏命名的TMF、非经验性质(例如社论和评论)、未描述评估或评估策略、在2010年之前发表或未以全文形式提供,或未以英语或西班牙语发表,则将其排除。

所有引文都导入Covidence,其中自动去重被进行。三位评审员(KAA-B、TNT和PC)独立筛选标题和摘要,采用盲法,屏蔽作者姓名、隶属关系和期刊信息。对10项研究进行了试点筛选,以评估评审员间的可靠性。评审员对之间的Cohen's kappa范围从0.61到0.81,表明评审员之间存在实质性到几乎完美的协议。

全文筛选由相同评审员独立进行,去除盲法。纳入决定基于干预是否满足被视为QI举措的每个标准,TMF是否作为QI举措评估的一部分应用,以及TMF是否服务于三个预定义评估功能中的至少一个。评审员冲突通过讨论和多数投票解决。复杂案例在决策日志中记录并由主要研究者(PB和JA)验证。

数据提取和管理

提取的变量包括一般研究特征(例如作者、年份、国家、研究设计、QI干预描述和评估阶段),以及应用的TMF(s)的具体细节(例如名称和分类)。TMFS根据Nilsen和Wang等提出的分类法进行分类,包括:决定因素框架、过程模型、评估框架、经典理论、策略框架或测量框架。每个TMF的评估功能在三个领域上按1-3分进行评估(1=差;2=中等;3=好):(1)是否指导数据收集和/或数据分析,(2)是否解释变化机制或(3)是否指定构念之间的关系。

根据实施理论比较和选择工具(T-CaST)的六项内容收集了有关TMF可用性和可测试性的额外数据。这些项目用于评估在每项纳入文章中报告和应用的TMF,特别是TMF是否:(1)提出了可测试的假设;(2)提供了对所提议关系的有意义、表面效度的解释;(3)包括相关的实施构念(例如自我效能、组织氛围);(4)呈现了一个清晰有用的图表,描绘构念及其关系;(5)提供了在实践中促进实施的方法;以及(6)解释了所包含的构念如何影响实施和/或彼此影响。为标准化评审组件的评分,我们将原始T-CaST 0-2响应选项线性重新缩放到1-3分(1=差,2=中等,3=好),保留评级的序数解释。

使用QI最小质量标准集(QI-MQCS)评估纳入研究的报告质量,该集评估16个领域,包括问题描述、背景、干预理由、实施策略、结果和可持续性。根据既定阈值,满足至少14个标准的研究被分类为高质量。

综合分两个连续阶段进行。首先,我们使用描述性综合来映射用于支持QI评估的实施科学TMFS的频率和类型。对于纳入文章中应用的每个TMF,我们还使用3-9分的加性评分总结了在三个领域中代表的评估功能。在第二阶段,我们在TMF层面应用系统评估和选择实施科学TMFS(SELECT-IT)元框架,以根据其内在属性比较通过范围综述识别的TMFS。

对于在提取阶段识别的每个独特TMF,完成了一个SELECT-IT工作表。每个TMF在五个概念领域上按1-3分进行评分:(1)清晰度和结构,(2)科学强度和证据,(3)适用性和可用性,(4)公平性和社会文化响应性,以及(5)系统和合作伙伴整合。此过程为TMFS的比较综合提供了基础,以识别和比较其方法学属性和评估功能。

结果

检索结果

总共识别了3872份文件,其中Scopus(n=1380)、PubMed(n=1393)和Web of Science(n=1099),另外从灰色文献中获取了76篇文章。在去除重复项(n=2124)后,筛选了1824篇文章的标题和摘要。随后,寻求获取572篇文章,其中553篇被评估全文资格。根据资格标准,排除了473篇文章,最常见的是因为处于方案阶段(n=111)或缺乏适应性执行理论(n=104)。80项研究符合纳入标准并被纳入综述。

纳入研究的特征

大多数纳入研究发表于2022年至2025年之间(n=48;60%),其次是2018年至2021年之间发表的29项(36%),仅有3项(4%)发表于2012年至2017年之间。这种时间分布反映了过去十年中改进科学和实施科学方法论融合的增长,2021年后加速明显。大多数研究在高收入国家进行,主要是美国(n=41,51%),其次是加拿大(n=10,12%)、澳大利亚(n=6,7%)和英国(n=5,6%),低收入和中等收入国家的代表性有限(n=8,10%)。

在研究设计方面,混合方法方法占主导地位(n=24,30%),其次是QI研究(n=23,29%)和有效性-实施混合设计(n=15,19%)。大多数研究未指定报告指南(n=48,60%)。在指定的研究中,SQUIRE/SQUIRE 2.0指南最常被引用(n=19,23%),其次是定性研究综合标准(CRQR)(n=6,8%)和实施研究报告标准(n=5,6%)。几乎所有研究都评估了实施阶段(n=63,79%),一项仅关注可持续性(1%),16项(20%)同时考察了这两个阶段。

用于评估QI举措的实施科学TMFS

识别出23种不同的实施科学TMFS。最常应用的是Reach、Effectiveness、 Adoption、Implementation和Maintenance(RE-AIM)框架(n=26,27%),实施研究综合框架(CFIR)(n=19,20%),实施研究结果(n=6,6%)以及促进卫生服务中研究实施(PARIHS)框架/集成促进卫生服务中研究实施(i-PARIHS)(n=6,6%)。

其他常见TMFS包括规范化过程理论(NPT)(n=5,5%)和知识到行动(KTA)框架(n=4,4%)。剩余的17种TMFS占所用TMFS的29%。在研究中,TMFS并不相互排斥;14%的研究(n=11)同时应用了两种或多种TMFS,最常见的是RE-AIM和CFIR或RE-AIM和PARIHS。只有两项研究使用了三种TMFS,分别结合了CFIR、专家推荐实施变更(ERIC)和RE-AIM,以及KTA、动态可持续性框架(DSF)和RE-AIM。

TMF使用随时间的趋势

TMF使用模式随着时间的推移而演变,决定因素框架和过程模型在早期阶段占主导地位,而评估框架和实施理论在2021年后显著增加。这表明方法论多样性增加以及实施科学在QI评估中的更大整合。

2012年至2017年间,所有四项识别研究中仅使用了三种TMFS:RE-AIM、PARIHS和主动实施框架(AIF)。相比之下,到2021年,已有超过11种不同的TMFS在使用。决定因素框架(例如CFIR、理论领域框架、PARIHS/i-PARIHS)仍然是最常用的,提供结构化手段来识别背景障碍和促进因素。过程模型(例如RE-AIM、复制有效计划、KTA、质量实施框架、动态适应过程)在2017年后扩展,应用于跟踪实施阶段。评估框架(例如实施研究结果、ERIC、框架报告对循证实施策略的适应和修改(FRAME-IS)/修改和适应框架(FRAME))在2021年后更频繁地使用。

纳入研究中TMFS的评估功能

对每篇纳入文章在文章层面的评分报告在补充文件7中。尽管94%的研究使用TMFS指导数据收集或分析,但只有43%明确测试了构念关系或因果路径。在1到3的量表上,TMF的平均评分分别为2.87分用于告知数据收集和/或分析,2.86分用于解释变化机制,2.40分用于指定构念之间的关系。

在TMF层面,CFIR在评估功能方面表现出一致的高分,平均评分分别为2.84分用于指导数据收集和/或分析,2.84分用于解释变化机制,2.47分用于指定构念之间的关系。RE-AIM在解释变化机制方面显示出相对较低的评分,为2.81分,在指定构念关系方面为2.42分。AIF在构念关系指定方面的平均评分最低,为1.67分。Proctor的实施研究结果在所有三个评估功能方面表现出相对平衡的概况。

值得注意的是,Proctor的实施研究结果已被建模为中介预测因子,介导实施策略和临床结果之间的关系。这种方法应用于一项纳入的混合有效性-实施研究中,其中标准化放射学报告模板的采用和可接受性预测了初级保健随访和诊断评估的改进。同样,Pohnert等人将实施结果嵌入老年友好型健康系统倡议的多级评估中。使用混合效应泊松回归,作者使用RE-AIM和CFIR框架将实施保真度和可接受性与组织绩效和患者报告的结果联系起来。

在研究层面,TMFS的平均综合评估功能评分为8.22分(3-9分量表),表明它们通常以支持QI评估中多种评估功能的方式应用。MRC的平均综合评分为8.67分,其次是NPT(8.60分)、CFIR(8.37分)、RE-AIM(8.35分)和Proctor的实施研究结果(8.33分),均高于总体平均分。相比之下,AIF和ERIC的平均综合评分最低,均为7.33分,而FRAME/FRAME-IS和PARIHS/i-PARIHS的评分也低于平均值,均为7.50分。

纳入研究中TMFS的可用性和可测试性

在每项TMF应用于纳入文章的六项T-CaST项目上评分(1-3分量表),TMFS通常展示了捕获核心实施元素的充分可用性和可测试性。评分最高的是包含相关实施构念,平均分为2.90分,以及提供对所提议关系的表面效度解释,平均分为2.64分。评分最低的是支持基于假设的评估,平均分为2.02分,只有28%的纳入研究报告了可测试的假设。

当可用性和可测试性评分根据每项TMF在评估研究中的应用方式在纳入文章中汇总时(6-18分量表),评分范围从11到18分,总体平均分为14.94分。探索、准备、实施、维持和DSF获得了18分的平均评分。在最常使用的TMFS中,CFIR和Proctor的实施研究结果的平均T-CaST评分高于总体平均分,分别为15.16分和15.00分。RE-AIM和PARIHS/i-PARIHS接近总体平均分,平均评分分别为14.19分和14.33分。ERIC和FRAME/FRAME-IS观察到较低的平均T-CaST评分,分别为12.67分和12.00分,而慢性病定制实施的平均评分总体最低,为11.00分。

使用SELECT-IT对TMFS进行比较评估

在TMF层面,使用SELECT-IT元框架进行比较评估(补充文件5)显示,23种识别的TMFS通常在清晰度和结构方面表现最强,平均项目评分为2.8分(1-3分量表)。相比之下,公平性和社会文化响应性获得了最低的平均项目评分,为2.1分。在适用性和可用性领域(5-15分量表)中,提供操作指导的TMFS(如分步说明、检查表或决策工具)表现最佳。RE-AIM获得了13分的平均评分,而NPT在此领域获得了最高的平均评分,为15分。

当领域评分汇总生成SELECT-IT综合评分(可能范围为24-72分)时,23种TMFS的平均评分为55.65分,范围从50到59分。这些发现表明,综述中识别的TMFS具有中等至高的总体概念稳健性和实际可用性。RE-AIM的最高平均综合评分为59分,其次是CFIR(58分)和Proctor的实施研究结果(57分)。

纳入研究的报告质量

使用QI-MQCS工具,86%的研究(n=69)满足至少14个质量领域,表明报告质量高。最常缺失的元素是关于比较护理过程的信息(n=24,30%)、干预的可持续性(n=18,23%)以及关于推广的参考(n=13,16%)。

讨论

解释和对QI评估的启示

在QI举措评估中应用和操作化实施科学TMFS的方式存在相当大的异质性。不到一半的研究明确描述了TMF构念如何指导变量选择、假设测试或研究结果解释。TMF选择也与预期的评估目的不一致,与先前的综述一致,显示决定因素框架被用作结果模型,而评估框架则被描述性而非实证地应用。

TMF层面较高的SELECT-IT评分与文章层面较低的T-CaST可用性和可测试性评分之间的对比表明,具有强方法学属性的TMFS并未一致地以支持QI举措实证评估的方式应用。先前的TMF评估综述指出,大多数TMFS明确指定了其概念组件,但较少提供使用指导,增加了在QI评估研究中表面或错误应用的风险。CFIR说明了这一更广泛的挑战,因为用户指南和模板可以支持更结构化的应用,但其广度可能仍限制一致使用,而无需足够的方法学专业知识和分析资源。

公平性和社会文化响应性

尽管最近对TMFS进行了适应,例如FRAME-IS和更新的CFIR,明确整合了公平性和文化定制,但SELECT-IT评估中公平性和社会文化响应性领域获得了最低评分。公平性通常不是作为具有定义测量和反事实的明确结果来处理,而是更常嵌入在更广泛的背景或人群差异考虑中。

因此,公平性应被视为明确的评估目标,具有可以实证测试的特定领域问题。实用、稳健的实施和可持续性模型的应用指南、RE-AIM公平性扩展,强调评估跨实施结果的公平性代表性并概念化结果级联,其中公平性损耗可能在连续阶段发生。在此方法下,早期在接触或交付方面的改进不一定转化为持续的公平效益,如果与采用能力、组织准备或实施基础设施相关的障碍未得到解决。

因此,公平导向的QI评估应纳入组间和组内比较,按关键社会和组织特征分层,并使用互补的决定因素和评估TMFS检查多级背景条件如何塑造不公平绩效。这种方法将允许明确测试不公平产生的假设机制,并帮助识别实用杠杆,以随着时间的推移维持公平影响。

对研究和实践的建议

解决本综述确定的当前挑战需要向更严格、全面和以理论为导向的评估策略转变。评估策略应定义QI举措打算支持的最低限度声明集:(1)是否发生了与QI举措目标一致的变化,(2)所提出的的内容理论是否合理解释了如何产生这种变化,以及(3)替代解释(例如世俗趋势、并发举措、测量伪影、选择偏差)是否得到充分解决,以保证因果解释。

然后,这些问题可以指导根据其评估角色计划选择和组合TMFS。面向结果的TMFS,如评估框架,可用于操作化实施结果。决定因素框架可用于识别预期中介或混淆因果路径的背景和条件。

一旦构念被指定且测量与所选TMFS一致,评估应随后使用准实验设计测试这些构念。根据可行性和数据结构,这可能包括中断时间序列、受控前后设计、差分差、合成控制、回归不连续或工具变量。这些方法应与明确的识别假设、预先指定的反事实逻辑和稳健性检查配对。

优势和局限性

本综述具有与异质性QI干预的理论构念综合固有的局限性。首先,尽管进行了映射过程,但需要解释性判断来确定TMF是否评估性应用,而不仅仅是描述性引用。尽管应用了共识讨论,但分类偏差无法完全消除。其次,TMF操作化在研究间差异很大。不一致的报告限制了充分评估构念级应用的能力,这可能低估了某些TMFS的实证使用。

在优势方面,通过将纳入限制在捕获QI独特方法学特征的干预,如迭代测试和适应,本综述允许识别不仅用于测量传统实施研究中实施结果,还用于评估通向远端实施结果的因果路径的TMFS。此外,SELECT-IT元框架的应用允许对23种TMFS进行标准化评估,增强如何操作化评估属性的可比性。

结论

本综述强调了需要一种严格、整合的评估方法,应用实施科学TMFS来加强QI举措的评估。我们的发现表明,单一TMF无法提供核心评估领域的充分覆盖。相反,评估将受益于互补TMF类型的组合使用,例如决定因素框架与评估框架,以检查背景、机制和结果如何随时间互动。未来研究应优先将TMF构念,特别是公平性,系统地嵌入研究设计、测量和评估中。还应开发实用指南,以支持在QI举措的所有阶段一致操作化这些构念,并改善不同环境中发现的可重复性和可转移性。

【全文结束】

猜你喜欢
  • OpenAI的GPT-5.5 Instant在医疗准确性基准测试中超越医生OpenAI的GPT-5.5 Instant在医疗准确性基准测试中超越医生
  • 幕后揭秘:人工智能医疗保健的未来正在休斯顿崛起幕后揭秘:人工智能医疗保健的未来正在休斯顿崛起
  • 医院医师已在使用人工智能——实施方式将决定其影响医院医师已在使用人工智能——实施方式将决定其影响
  • Cell Stem Cell最新文章Cell Stem Cell最新文章
  • 新加坡与不丹合作开发农村胸部X光AI技术新加坡与不丹合作开发农村胸部X光AI技术
  • 10个最常导致立即危及的CMS引证10个最常导致立即危及的CMS引证
  • 人工智能能否提前数十年预测癌症?香港英矽智能与美国人类长寿公司达成合作人工智能能否提前数十年预测癌症?香港英矽智能与美国人类长寿公司达成合作
  • AI有望变革医院质量报告的生成方式AI有望变革医院质量报告的生成方式
  • 在医疗保健中运用AI制胜的关键在于选择正确的工作流程在医疗保健中运用AI制胜的关键在于选择正确的工作流程
  • AI辅助的医疗保健中机器学习伦理使用框架AI辅助的医疗保健中机器学习伦理使用框架
热点资讯
全站热点
全站热文