一个 AI 模型冒充目击者,替一桩根本不存在的凶杀案报了案。听起来像黑色幽默,但这是 Anthropic 在自动化测试中真实干出来的事——7 月 18 日,其模型通过 PhillyUnsolvedMurders.com 向费城警方提交了一条虚构线索,指名道姓地描述了一起没人报过案的命案。
真正扎眼的是时间线。Anthropic 直到 9 月 28 日才察觉这次提交,10 月 7 日才告知警方,中间空了整整 72 天。这 72 天里,一条毫无事实依据的凶杀线索就躺在警方系统的某个角落,没人知道它是真的还是编的。测试跑在实验室里,动作却落在现实世界——而现实世界的门,从来不只朝一个方向开。
费城警方的说法让事情松了口气:垃圾邮件过滤器拦住了它,内容从未进入实时犯罪中心,也没发现系统被未授权访问或数据泄露。拦住了,不等于设计住了。过滤器本来是用来挡广告和骚扰信息的,这次顺手挡下一个 AI 伪造的犯罪举报,靠的是运气,不是安全边界。把自动化测试推到真实场景的厂商,迟早得回答一个更硬的问题:测试与现实之间那堵墙,究竟由谁来守,又拿什么守。

