Anthropic的Claude Fable 5模型拥有先进的安全防护机制,即使是普通请求也可能触发这些限制。
当被安全分类器标记时,Mythos级别的模型会被阻止回答或自动回退到Opus 4.8版本。
Anthropic表示,这些安全措施对于向公众发布该模型是必要的。
如果您尝试向Anthropic新发布的Claude Fable 5模型提出关于网络安全或生物学的简单问题,您可能会发现它无法胜任这项任务。
这是因为底层的"Mythos级别"模型功能如此强大,以至于为了向公众发布,它需要广泛的防护措施,这些措施可能会错误地标记良性请求,Anthropic解释道。
在一些在线用户表示他们用关于癌症或网络安全的基本问题触发了安全防护响应后,Business Insider对此进行了测试。
我尝试向Fable 5提出一些关于癌症的简单问题,例如癌症 misinformation 如何在网上传播,以及不同类型的癌症分类。
Claude迅速从Fable 5切换到Opus 4.8,并在我收到回应前通知我这一变化。
"Fable 5具有针对大多数网络安全或生物学主题的安全措施。它们也可能将安全、正常的内容标记为风险。这些措施使我们能够更快地在其他领域为您提供Mythos级别的能力,我们正在努力完善它们,"弹出窗口显示。
Anthropic于周二发布了Fable 5,并表示它与Mythos 5模型一样强大,只是增加了安全措施。此次发布是在该公司两个月前表示Mythos由于网络安全担忧而过于强大,不适合广泛发布之后进行的。当时Mythos仅作为网络安全项目的一部分提供给一小群用户。
Anthropic表示,为了安全地向公众发布该模型,这些安全措施是必要的。
"随着Claude Fable 5的发布,作为我们的首个Mythos级别模型,我们相信模型现在具有更大的能力来完成现实世界的科学任务,恶意行为者也可能潜在地利用我们的模型进行高风险的生物研究,"Anthropic发言人在给Business Insider的声明中表示。"我们一直使用分类器来阻止我们的模型协助生物武器相关请求。为了安全部署Fable 5,我们认为有必要对安全措施采取过度保守的态度,以便它们阻止与生物学工作相关的大多数查询。"
该公司表示,有三类请求可能会被其安全分类器标记:网络安全、生物学和化学,以及Fable 5能力的知识蒸馏。
当安全防护被触发时,Fable 5要么被阻止回答,要么模型会在响应前回退到Opus 4.8,具体取决于用户的偏好设置。
Anthropic在其公告中表示,这些安全措施可能导致安全、正常内容被标记,但其早期数据显示超过95%的Fable会话没有回退到Opus。
"为了安全且快速地发布该模型,我们对这些安全措施进行了保守调整,"Anthropic表示,并补充说正在改进安全措施以减少误报。
"我们打算向更广泛的生物学和生命科学社区提供没有这些安全措施的Mythos级别模型,以便这些能力可以用于加速生物医学研究和药物发现,"Anthropic发言人表示。
此次发布大约在Anthropic研究人员表示AI发展如此之快,前沿实验室可能需要放慢速度或暂时暂停,以便社会能够跟上一周后。
Palisade Research政策主管David Kasten表示,从Anthropic的公开声明中"非常明显",该公司担心日益强大的模型所带来的风险。
尽管他认为这些安全措施是Anthropic降低风险的善意尝试,但他表示历史上,"人们最终会找到绕过安全限制的方法。"
"这总是一场攻击者和防御者之间的猫捉老鼠游戏,"他说,并补充说发布更强大的模型仍然存在一定风险。
他还表示,Anthropic最强大的模型频繁回退到较弱模型可能会导致公众对AI模型能力的理解出现差距。
"这种理解上的差距可能非常危险,会导致政策制定者或公众无法充分理解这些模型在提供能力方面所带来的风险,"他说。
如果您喜欢这个故事,请务必在Yahoo上关注Business Insider。
【全文结束】

