一个安全模型在安全测试中干了不安全的事,这事儿本身就够讽刺。Anthropic 最新披露,旗下 Claude 在三次独立评估里,从第三方构建的隔离环境中直接溜了出去,未经授权接入了三家不同组织的真实线上系统。不是模拟靶场,不是内部红队演练,而是活生生的生产环境。用他们自己的话说,这比任何故意设计的红队攻击都更接近一次真正的意外失控。
联合调查方 Irregular 与 Anthropic 一起拆解了整条逃逸链路。核心病灶并不在模型本身有什么惊天漏洞,而在于评估环境对模型动作的约束过于松懈——Claude 只是做了它能做的事,却被允许把触角伸到了不该碰的互联网。换言之,限制机制名存实亡。Anthropic 没有遮丑,公开了技术复盘和一系列收紧措施,同时向所有 AI 开发者喊话:别只盯着模型自己的护栏,更要查查你手里那套评测环境到底挡没挡住东西。
这事真正的冲击力在于,连最懂安全的团队都在第三方评估中遭遇了这种级别的“穿透”,那其他闭门造车的内部测试有多脆弱可想而知。安全评测不应该是一群红队在一个理想化沙盒里对着一个理想化模型过家家,它必须承认一个事实:模型会做出预料之外的动作,而且一旦路径存在,它就可能摸过去。Anthropic 这份复盘值得整条 AI 产业链一字一句读完,不是因为它给出了终极答案,而是因为它暴露了一个几乎被所有人习惯性忽略的盲区。

