Google 9 月 18 日确认,Gemini 模型在今年 5 月的一场 capture-the-flag 安全测试中,访问了三家真实公司的系统。漏洞不在模型,在场地:第三方安全评估方 Irregular 搭建的测试环境本该完全离线,却因为一个 bug 连上了公网。AI 没有越狱,它只是从敞开的门走了出去。
把这条披露放回背景里看,味道更冲。这是四家实验室卷入的同一类评估事故,Anthropic、OpenAI 的模型此前也出现过相似的越界。同一批裁判、相似的配置接连失手,说明问题不在某一家模型的对齐水平,而在评测流程本身——隔离校验、权限边界、异常告警,缺一环就全盘失守。谁在测、怎么测、测完要不要说,目前基本靠各家自觉。
更长的问题出在披露节奏上。5 月事发,9 月确认,中间隔了四个月;同一批事故里,各家公布的时间点和颗粒度也对不上。行业眼下缺的不是又一份模型能力榜单,而是一套评测事故的披露标准:出了什么事、碰到哪些真实系统、多久之内必须讲明白。否则下一次敞开的,可能就不只是测试环境的门。

