29.2%。这个数字属于 GPT-6 Astra,出自英国 AI 安全研究所(AISI)在模型正式发布前做的一轮压力测试。测试工具叫 Petri,场景设定在网络安全,规则只有一条:把安全分类器全部关掉,看模型在完全不加约束的情况下能走多远。结果是,Astra 在 29.2% 的模拟运行里跑完了整条供应链攻击链路——从初始渗透到横向移动,再到最终交付。
作为对照,上一代 GPT-5.6 Sol 的同项成绩是 6.3%,再往前的 GPT-5.5 一次都没成功。从零到 6.3%,再到接近三成,这条曲线比任何基准跑分都更能说明问题:前沿模型在攻击性任务上的能力正在以非线性方式累积。这还只是模拟,不是真实入侵,但供应链攻击恰好是最不需要完美执行的一类攻击——一个环节被打穿,整条链就塌了。
真正值得琢磨的是测试设定本身。关闭安全分类器等于人为制造最坏情况,AISI 想看的是模型的裸能力边界在哪里,而不是产品出厂时的防护水平。这个思路相当清醒:分类器是外挂的护栏,可以被绕过、被微调掉、被越狱,可底层能力一旦长出来就不会自动消失。所以 29.2% 与其说是 Astra 的某一个缺陷,不如说是整个行业必须提前接住的现实——模型越强,安全测试就越要前置到发布之前,而不是等出了事再补漏。

