OpenAI的ChatGPT Health是与超过260名医生合作构建的,经过了超过60万轮临床反馈的塑造,并依托一个定制的安全框架,旨在关键时刻优先保障安全。然而,它在首次独立评估中表现糟糕,甚至可以说是惨败。
该系统在自己的推理过程中识别出了呼吸衰竭的症状,却告诉患者预约24到48小时后的门诊。在三位独立医生一致认定为紧急情况的病例中,它52%的时间将患者引导离开急诊室。其自杀危机防护措施对模糊的情绪困扰反应更频繁,而对描述具体自伤计划的患者反而反应较弱。来自家人的一句轻描淡写的话,就将分诊建议从紧急护理中偏移开,其比值比高达11.7。每天有4000万人使用这个工具。
几个月来,我一直在密切关注各类模型和用例的推理痕迹,我已经数不清有多少次,读到推理痕迹时心里想着“这个智能体在说什么”,但最终看到的输出却似乎合理。或者反过来:推理痕迹正确识别了问题,但接下来的答案却忽略了模型刚刚思考过的所有内容。我没有特意挑选呼吸衰竭的例子。它就在那篇论文里。系统自己的分析写道“早期呼吸衰竭”。输出却是“等待”。
OpenAI做了安全工作。但这些失败仍然未被发现,因为评估方法的设计初衷就不是为了找到它们——而这才是真正的故事。同样的四个失效模式,也存在于你的企业正在部署的每一个AI智能体中。
以下是本文内容:
- 四个结构性失效模式:它们出现在一项医学研究中,但并非医学问题。它们是LLM在生产环境中表现出的属性,并且直接映射到处理理赔、合规、客户服务和采购的智能体身上。
- 一个因子评估方法:由一群医生偶然构建的。这是迄今为止任何人发布的最严谨的智能体评估方法,并且其适用范围超出了医疗保健领域。
- 一个四层评估架构:针对每个失效模式提供了具体的对策,从置信度路由到确定性验证,再到压力测试。
- 成本模型:让这一切变得可行。人力投入集中在前端,而非持续进行。第六个月的成本仅仅是第一个月的一小部分。
对于任何正在构建或部署智能体的人来说,问题在于:你是否已经建立了基础设施,以便在客户发现这些盲点之前,自己先找到它们?
【全文结束】

