当AI代理"偏离脚本"时,医疗系统该如何应对?对于这种新兴技术,"脚本"又是什么呢?
在俄亥俄州坎顿的Aultman Health System,这一问题源于团队构建的一个内部员工手册代理,用于回答员工问题。
Aultman首席信息官Raza Fayyaz向《Becker's》表示:"早期,我们注意到当代理无法自信地找到答案时,它偶尔会'偏离脚本'。它不会承认不确定性,而是生成看似合理但不正确的答案,这是在没有适当保护措施的情况下部署基于大语言模型的代理的核心风险之一。"
这种行为揭示了这些系统工作方式的一个基本特点:一个被放任自流的代理会倾向于追求流利的答案,而不是准确的答案。
Fayyaz先生表示:"这强化了一个重要教训:没有保护措施的AI代理通常只是大语言模型的包装器。底层模型的设计目的是完成任务,而不一定知道何时该停止。"
这个拥有三家医院的系统的解决方案有两方面。团队重新训练了代理,当源材料不支持回答时,它会说"我不知道"或拒绝回答;同时实施了检索增强生成(RAG)方法,为模型提供有限的上下文集。Fayyaz先生认为,对于大多数企业查询代理来说,这种限制至关重要,既是一种可靠性措施,也是一种成本控制手段,因为它减少了模型处理的令牌量。
他表示:"更广泛的启示是,AI代理可能非常强大,但它们应该像任何其他企业系统一样对待:在广泛部署之前进行管理、测试和约束。"
在费城的Jefferson Health,意外行为更为微妙,模型对指令的理解明显不像人类。
Jefferson Health执行副总裁兼首席数字和信息官Luis Taveras博士表示:"在Jefferson,我们了解到,即使是最精心设计的AI系统也仍可能让你感到惊讶——不是通过戏剧性的'失控'行为,而是通过它们解释世界的更安静、更微妙的方式。真正的挑战往往出现在边缘情况中,模型会暴露出意外行为、不一致的优先级,或对指令的解释与人类自然意图不同。"
Taveras博士表示,Jefferson尚未发现其代理表现出恶意或不可预测的行为(除了这些误解),并且当它们确实发生时,用户会很快发现。
他表示:"这正是为什么人工监督对我们来说不仅仅是一种保障措施——它是一种核心设计原则。它确保我们的代理系统在每一步都保持一致、可靠,并以人类判断为基础。"
最终目标是让AI代理保持在"脚本"之内。例如,科罗拉多州奥罗拉的UCHealth在实验时迅速行动,但在任何东西触及患者、临床医生或核心操作之前会放慢速度,依靠严格限定的用例、生产前验证和明确的保护措施。
UCHealth首席医疗和创新官Richard Zane博士表示:"我们还将代理视为生态系统中受管理的身份,具有最低权限访问、持续监控和明确的所有权,因此如果某些行为偏离预期,我们可以及早检测并干预。事实上,我们内部开玩笑说,我们可能对AI代理的要求比对人类的要求更高,因为人类不可避免地会偏离脚本,所以软件不被允许这样做。"
在休斯顿卫理公会医院,担忧的不是上线当天,而是之后的一切。
休斯顿卫理公会医院执行副总裁兼首席创新官Roberta Schwartz博士表示:"重要的是,我们不仅要了解代理在部署时的行为,还要了解随着时间推移的行为,特别是当它们交互的系统演变以及它们与预期受众互动时。它们的性能和影响可能会在升级或长期使用后发生显著变化。监测和评估这一进展至关重要,尽管这对人类和机器人来说仍然是一个复杂的挑战。"
【全文结束】

