医疗系统已超越人工智能的探索阶段。如今,AI已完全融入临床工作流程,尤其是在文档记录、影像学、运营预测和人群健康管理方面。然而,实施仅仅是开始;真正的工作在于持续的监督。
对AI采用和企业IT的独立分析一致表明,当领导者事先定义好治理和问责制,而不是在部署后试图事后补救时,组织更有可能扩展AI规模并维持其影响力。这一教训在医疗领域尤为重要,因为其风险更高,“上线”时刻往往是风险真正开始显现之时。
与传统技术不同,许多AI工具旨在随时间推移而学习和适应。这使得部署后监控成为AI治理计划的关键部分。
通过推出我们有史以来第一个医疗AI认证,URAC确定了三个成功支柱:风险管理、运营与基础设施、以及绩效监控与改进。我们认为,对AI工具真正的考验是其在实际工作流程中与真实患者互动时的表现。对于医疗系统领导者而言,以下是上线后需要持续关注的领域。
1. 临床结果与患者安全
第一个问题很简单:这个工具是否改善了医疗质量,并且对谁有益?
部署后,医疗系统应追踪:
- 临床准确性与错误模式,例如误报/漏报、漏诊或不恰当的建议。
- 结果趋势,例如再入院率、并发症、诊断时间或治疗时间的变化,以及与AI支持决策相关的不良事件。
- 险情与否决操作。当临床医生不同意AI时,他们是对还是错?
URAC的认证框架将临床AI视为更类似于药物而非小工具:应进行部署前测试和“上市后”监测,以发现仅在规模化应用时才出现的问题。这种思维方式促使组织进行持续的、结构化的质量审查。
2. 模型行为:漂移、偏差和幻觉
鉴于AI具有随时间学习和适应的能力,领导者应预期并监控三种特定风险:
- 漂移:当模型输出因底层数据或环境变化而发生改变。
- 偏差:不同种族、语言、地域、支付方类型或护理环境间的性能差异。
- 幻觉:自信、看似合理但虚假的输出,尤其在生成式或摘要工具中。
在制定标准时,我们明确指出了需要监控偏差、漂移和幻觉,并围绕它们构建可审计流程。这意味着要定义可接受的性能阈值、创建用于持续监控的仪表板,并制定发现错误时的处理规则。
3. 隐私、安全与数据二次使用
目前许多最流行的工具是环境记录和工作流程助手,它们位于诊室中,与患者和临床医生同在。
部署后,医疗系统应:
- 验证数据存储位置、保留时长以及谁能访问。
- 确认供应商未将临床对话用于驱动不相关的商业模型。
- 定期审计是否存在不当数据共享、重新识别风险以及违反HIPAA的情况。
在任何医疗环境中,患者信任都至关重要,而建立并维护这种信任应成为AI框架的一部分。
4. 人为因素:培训、过度依赖与工作量
AI本身并不可信;人在使用AI时必须符合伦理且值得信赖。这就是为什么监控人为因素与监控代码同样重要。
医疗系统应追踪:
- 培训与能力:在期望临床医生依赖该工具之前,他们是否已接受了关于其适应症、局限性和故障模式的培训?
- 过度依赖:临床医生是否不加批判地接受AI建议(自动化偏差),还是保持适当的怀疑态度?
- 工作量与倦怠:文档记录时间、收件箱负担或下班后工作时间是否有所改善,还是新的警报和点击操作抵消了这些收益?
5. 治理、供应商与独立监督
最后,领导者应监控系统周围的系统:治理结构和供应商绩效。
URAC 将这些专业原则转化为可审计的步骤,包括设立临床监督委员会,该委员会定期召开会议并记录,职责明确,并有明确证据表明其审查并就AI绩效采取行动。
在供应商方面,组织需要关注:
- 供应商是否履行了正常运行时间、支持和更新义务。
- 他们如何沟通已知问题、补丁和模型变更。
- 他们是否与独立的第三方标准保持一致,例如旨在验证安全、道德和负责任使用的AI认证项目。
认证提供了独立的第三方验证,证明医疗系统已建立明确标准并在实践中始终如一地加以应用。在医疗AI领域,这种验证必须远远超出上线时间,通过持续监控和有意义的监督,确保工具保持安全、有效并与临床现实保持一致。当组织在安全性、性能、隐私和人为因素方面保持问责制,并能证明这些控制措施在实际工作流程中发挥作用时,患者和合作伙伴会更有信心,AI也能作为医疗服务的一部分负责任地向前发展。
【全文结束】

