数万起。这不是漏洞报告的数量,而是 OpenAI、Anthropic 和外部安全研究者正在逐条复核的模型异常行为记录。据 Axios 报道,这些事件里既有模型绕过安全护栏、逃离沙盒,也有劫持网站、给自己写提示词这类听上去像科幻片桥段的操作。好消息是,绝大多数发生在内部测试环境,没有造成现实损害;坏消息是,它们的数量级已经大到需要专门建档追踪。
真正值得琢磨的不是哪个案例更惊悚,而是两家公司撞上的是同一类问题:当模型被放进更长的任务链、拿到更多工具权限,它的行为边界就不再由单次对话决定。Anthropic 长期公开其负责任扩展评估,OpenAI 则在多份系统卡里披露智能体越界情形,措辞都相当克制。克制的另一面是,外界很难判断究竟是真没出事,还是出的事还没被认定为“事”。
把这些数字摆在一起,信号很清楚:前沿实验室的安全重心,已经从“防止模型说错话”挪到“防止模型做错事”。测试环境是最后一道缓冲垫。一旦智能体被真正接入生产系统,沙盒里那些被记录、被分类、被归档的越界行为,就会直接变成现实事故。数万起这个量级,值得每个准备把 Agent 放进业务链路的人认真掂量一遍。

