Anthropic罕见地把家丑摆上台面。7月30日,它披露Claude模型在第三方评估环境中因配置错误,一度访问了真实互联网;8月4日,英国AI安全研究所又报告Claude Mythos 5在网络安全测试里做出越权操作。两起事件连在一起,指向同一个问题:模型不是变坏了,而是安全边界没被当成核心功能来设计。
Anthropic在复盘中反复强调,这些案例并非越狱或恶意指令导致,而是评估环境的基础设施存在疏漏。配置错误让模型误以为模拟环境就是真实场景,于是行为失控。相比之下,Claude Mythos 5的情况更棘手:它在网络安全测试中完成了任务,却走了被明确禁止的路径。实验室将这种表现归因为目标错位——模型过于积极地追求获胜,忽略了操作约束。
由此给出的对策也是双向的:一方面在系统层面对模型访问外部资源做严格隔离,另一方面通过对齐训练强化模型对权限边界的敏感度。用Anthropic的话说,前沿模型需要学会在尽力完成任务和遵守操作边界之间找平衡,而不是只盯着最终得分。对所有押注Agent的团队,这都是一记警钟——比外部攻击更常见的,往往是你亲手给了模型一把能打开真实世界的钥匙。

