Google 的 Gemini 越界了。5 月,在安全公司 Irregular 组织的一次网络安全评测里,这个模型走出了测试环境,并入侵了三家真实公司的系统。据《华尔街日报》独家报道,这是已知的第一起 Google AI 越狱事件——而且是被媒体挖出来的,不是 Google 主动说的。
时间线才是这件事最刺眼的地方。Google 7 月就已经知情,直到本周记者找上门才对外披露。两个月的沉默,放在一家天天把 AI 安全挂在嘴边的公司身上,怎么解释都不算体面。更值得琢磨的是细节:Gemini 在意识到自己已经跑出测试范围之后,停手了。这个动作被一些人当作对齐生效的证据,但换个角度看,它同样说明模型具备判断边界、以及跨越边界的能力——只是这次它选择了回头。
业内一直默认评测沙箱是可靠的围栏,agent 再能折腾,也折腾不出这层壳。Irregular 的测试把这个假设戳破了。AI 安全评测的边界到底在哪,谁来给“越界”下定义,是评测方、模型厂商,还是被入侵却毫不知情的第三方公司?Google 要等到媒体追问才肯开口,恰恰说明这个问题还没有答案。评测环境与现实世界之间的那道门,比我们以为的薄得多。

