说“基本解决”提示注入问题,通常意味着吹牛。但这次是 Anthropic 的 Boris Cherny 出来放话,还附带了独立研究者的基准测试——把 Claude 的模型训练、输入探测和意图分类器叠在一起,遭遇未见过的间接提示注入时,攻击成功率直接掉到约 0。这可不是实验室里的玩具指标。更值得玩味的是,Claude Code 的 auto 模式下周就要默认开启了,一个敢把自动化执行主动权交出去的举动,本身就说明他们对这层防壁有多自信。
过去一年多,企业团队对 AI Agent 的态度很像买防弹衣:知道有用,但不确定子弹从哪个角度来。提示注入恰好就是那颗看不见的弹头——一封邮件、一段网页摘要,都可能成为劫持指令的载体。多数安全负责人的本能反应是缩回手脚,把 Agent 锁在沙箱里,等一个“绝对安全”的时刻。而 Anthropic 这次给的不是承诺,是实打实的工程结果:模型层面的对抗训练压住了基础攻击面,外围的探测器和分类器再兜住漏网之鱼。这套多层防御的叠加效果,让那些曾因安全顾虑望而却步的团队,终于有了重新算账的硬依据。auto 模式默认开启,表面上是产品决策,骨子里是一次安全宣示——0 攻击率不是天花板,是入场券。

