OpenAI 这次没打算让你慢慢消化。GPT-6 Astra 带着一张几乎“没有错题”的成绩单亮相:FrontierMath Tier 4 拿下 98%,ARC-AGI-3 冲到 99.9%,ExploitBench 干脆交了满分。故事到这儿,充其量又是一次跑分碾压。真正让人坐直的是后半句——OpenAI 同时宣布,这个模型的网络安全能力已经触及自家 Preparedness Framework 里的 Critical 门槛,并因此对模型的可用范围和部分能力做出限制。这是第一次,一家头部 AI 实验室在发布“最强模型”时亲口说:它太强了,所以我不能完整地交给你。
一张太干净的成绩单,反而让旧考卷失去了意义
98%?数学这门考试对 Astra 已经没什么区分度
FrontierMath 从设计之初就不是给普通模型准备的。出题人是一群人类数学专家,题目需要严密的推导与长链条求证,很多题甚至没有现成解析可供语料回收。此前最强模型能拿下一半分已算重大突破,Tier 4 又是其中最难的一级。98%出现在这里,意味着能难住它的数学题,正在肉眼可见地绝迹。
到了这个阶段,争论“AI 会不会做数学”已经索然无味。更值得留意的是另一件事:当推理链条长到专业数学家都感到费力的程度,Astra 仍能给出稳定输出。单凭这一点,就不能再把它归类为“擅长对话的聊天机”。
99.9% 摆在 ARC-AGI-3 上,我们得重新谈谈什么是智能
ARC-AGI 系列一直在设法绕开“背题”。它把一堆从未出现过的图形规律摆到模型面前,要求现场总结规则、预测后续图案。模型要是只会从训练数据里找相似题型,到这里会立刻露馅。ARC-AGI-3 的99.9%,说明 Astra 掌握了一种更通用的能力:面对新事物,迅速建模,随即套用。这已经超出记忆与模式匹配的范畴。
得分越高,定义问题就越大。当模型在“从未见过的推理任务”里也能拿满分,这套基准的区分度就开始失效。ARC-AGI 的初衷是测试通用智能的影子,如今影子跑在了本体前面。我们只好回到那个没有标准答案的原题:究竟什么样的表现,才算真正够格的通用人工智能?
真正的100分,落在最危险的科目上
ExploitBench 满分意味着什么?它比的不是智力,是杀伤力
ExploitBench 不在“聪明程度排行榜”上抛头露面,却是最有现实后果的测试之一。它把模型放进一个允许识别漏洞、构造攻击链路的沙盒里,考察系统能否主动发现软件弱点并加以利用。100%意味着,在测试设定的场景中,它每次都能找到撕开系统缺口的方法。
这样的能力一旦脱离沙盒,局面就完全不同。拿到真实网络环境里,哪怕攻击效果打几个折扣,也足以让防守方陷入被动。网络安全领域原本的攻防成本平衡,会被这种能力系统性地推向攻击者一侧。
风险评级跳到 Critical,OpenAI 做了一个罕见的动作
OpenAI 的 Preparedness Framework 很久以前就把模型风险划分为不同等级,Critical 被摆在天花板的位置。过去各代模型发布前也会做对抗性测试,评级大多落在可控区间。Astra 这次直接把指针推到最高一级。随后的动作更为直接:限制访问范围、限制部分能力,不把完整形态交付给所有用户。
这个动作的商业代价肉眼可见。限制功能,往往意味着更少调用、更窄场景、更低营收。OpenAI 仍然选择这么做。与其等一次外部安全事故后被迫召回,不如在发布当天就把“危险”二字写在脸上。
如果说它是一个模型,不如说是一个住在电脑里的数字操作员
1.05M 上下文,不是给你聊天用的,是给 Agent 当工作记忆用的
人们太习惯把上下文长度当成“能读多少字”的营销参数。放到 Astra 的 Agent 形态里,指标含义彻底变了。它要保住用户设定的目标,回顾自己已经执行过哪些动作,分辨界面上弹出来的新窗口和当前任务的关系,同时处理用户中途追加的指正。
想在一段长任务里不丢状态,模型的“工作记忆”必须足够宽。1.05M token的上下文,本质上是一块大号的临时写字板,让它能够在数小时的工作流里保持连贯,而不是做到一半忘记自己为什么要打开某个软件。
从“你问我答”到“你看着我操作”,交互方式已经翻篇
现有的大模型产品大多还在对话框里打转。Astra 的桌面自动化把它拉出了聊天框:用户可以交代一个宽泛目标,然后退到旁边当监督者。它自己打开目录、识别文件类型、调用软件、填写表单,遇到权限缺失或指令模糊时再回头确认。整个流程不像执行一串写死的脚本,更像一个坐在电脑前的实习生:看屏幕,想下一步,动手做。
这种转变对软件行业的影响远不止“多一个助手”。当模型成了操作电脑的主体,人不再需要记住每个应用的功能藏在哪个菜单里,只要说清楚自己想要什么结果。界面接下来的争夺战,也许不再是哪个产品 UI 更好看,而是哪个软件更容易被 AI 看明白、操作对。
OpenAI 亲手锁住自家最强的模型,也顺手改写了竞争规则
安全终于不只是道德宣言,而是实打实的产品约束
过去几年,安全报告更像是发布会上的公关附录:写对齐、写测试、写原则,最后交出一份没多少人细读的文档。Astra 发布后,安全第一次变成产品设计中的硬约束。某些功能做了,但不放出;某些能力存在,但不给全。用户看到的是“你想要,但我不给”,而不是“我已经尽力”。
对企业客户来说,这种主动设限未必劝退。愿意为前沿模型付出高溢价的团队,最怕的往往是模型失控带来的次生灾害。供应商先把灾难性场景拦在门外,安全反而成了严肃采购流程里的加分项。
Critical 先例一旦立下,同行们都要面对同样的追问
接下来的竞争会很有意思。各家实验室除了要比推理分数、编码成绩,还要比怎样面对自己造出来的攻击能力。另一家实验室若推出类似能力却完全不做限制,舆论压力会比以往任何一次发布都猛烈。OpenAI 在这里立下了一根高得不舒服的横杆,也把一道难题丢给所有追赶者:敢不敢用同一把尺子量自己?
承认造物难以完全掌控:这个行业终于有了敬畏心
模型的智能曲线还在往上冲,危险半径也在同步生长。GPT-6 Astra 是第一只抵达临界点的鸟,绝不是最后一只。未来的前沿模型,也许不会总是以“能力全开”的姿态问世;“哪些能力能以多大范围交到什么人手里”,会成为设计阶段就必须回答的题目。承认自己的造物强到需要上锁,不是失败的故事。它代表的,是整个行业终于在能力与后果之间开始寻找平衡。而那把钥匙,只属于能证明自己不会乱用它的人。

