Anthropic 的安全优势开始暴露代价

Claude 拒绝了 Hugging Face 的取证请求,团队换用中国模型后恢复出 4 倍数据。同一周,Anthropic 自查发现自己的测试也出了问题。

分享
一道深靛蓝色的安全屏障,一侧挡住持盾的防御者,另一侧是空的缺口,琥珀色标记断裂处

7 月 28 日,Hugging Face 发布了一份完整技术复盘:一个由 OpenAI 模型驱动的自主 AI agent 入侵了平台,在 4.5 天内执行约 17,600 次操作。

为了还原入侵过程,安全团队需要借助大模型分析入侵者留下的加密内容。他们首先选择了 Anthropic 的 Claude Opus 和 Fable。

Claude 的安全分类器,也就是通常所说的「护栏」,会自动识别和拦截可能造成危险的请求。这个系统将漏洞分析与实际攻击同等处理,拒绝了大部分调查请求。Hugging Face 在报告中附上了 API 报错截图

团队随后转向 Z.ai 的开源模型 GLM-5.2,在自己的基础设施上完成全部调查,恢复出的敏感信息约为初次扫描的 4 倍。

两天后,Anthropic 披露了自查结果。公司复查 141,006 次网络安全测试后,发现三起影响真实系统的事件,最早可以追溯至 4 月。为了测量模型本身的完整能力,这些测试没有启用安全过滤和监控。

两起事件指向同一个矛盾:客户使用 Claude 调查安全事件时,合法请求遭到拒绝;Anthropic 测试模型能力时,却主动关闭了这些限制。

7 月 18 日至 31 日,Anthropic 的安全策略同时受到产品、客户和内部执行三方面的检验。

产品方面,Anthropic 在 Opus 5 发布公告中将「安全分类器介入频率比 Fable 5 低约 85%」列为卖点。被拦截的请求默认回落到 Opus 4.8。安全过滤系统介入多少,开始成为一项公开的产品指标。

客户侧出现了两起具体案例。Hugging Face 的调查请求被拒;美国疾病控制与预防中心(CDC)5 月使用 Claude 追踪大西洋邮轮上的汉坦病毒疫情时,包含「pathogen」的提示触发全面拦截。

此外,20 多家公司发表联署,称闭源模型「可能被攻破、被滥用,或以外部无法察觉的方式失效」。

在 Anthropic 内部,三起事件涉及三个不同的 Claude 模型。Opus 4.7 意识到目标可能是真实系统后仍然继续操作;Mythos 5 上传的恶意 Python 软件包被 15 个真实系统执行。Anthropic 强调,公开发布的模型启用了足以阻止这些行为的安全控制。

此前,外界通常分别讨论安全限制是否影响正常使用、内部测试是否安全,以及模型测试是否应成为强制要求。7 月底发生的几起事件把三者联系在了一起:错误拦截合法请求会损害产品价值,内部执行不一致则会削弱 Anthropic 推动行业监管的说服力。

🔒 以下为 Dailyio 会员专属内容

安全过滤系统把防御者和攻击者的请求同等处理,这个设计选择的代价有多大?Anthropic 内部测试主动关闭护栏有工程理由,但它与公司推动强制安全测试的主张如何共存?微软跳过第三方评测直接进场,又意味着什么?

成为 Dailyio 会员,阅读完整的机制拆解和行业竞争分析。