117 页的系统卡,滚动条能拖到手酸。但让外界记住 GPT-6 Astra 的,很可能是里面一个不起眼的百分比——链式思维可控性从 GPT-5.6 Sol 的 16.1% 跃升至 60.9%。单看这行字,像是一次漂亮的安全翻身仗。可同一份文件还提醒了另一件事:模型的可监控性相应下降了。一边是 AI 越来越能管住自己的思考流程,另一边是外部视角越来越难看透这套流程。读懂这种张力,比记住任何一个数字都有价值。
60.9%:一句被写进系统卡的安全叙事
从 16.1% 到 60.9%,差的不是运气
AI 研究员 Rohan Paul 在 X 上梳理这份系统卡时,把这个数字单独拎了出来。它之所以刺眼,是因为跨代落差太大:在 GPT-5.6 Sol 身上,模型能够自主约束或调整的链式思维比例只有 16.1%。换成直白说法,每六次推理里大约五次会顺着初始路径一路走完,中途给再多约束也拉不回来。
到了 GPT-6 Astra 这里,比例抬到了接近六成。OpenAI 想传达的意思很清晰:模型变得更听话了,至少在推理路径的选择上是这样。但系统卡的叙事不会停在这一句。它把可控性写得这么醒目,恰好因为上一代的表现拿不出手。安全团队比谁都清楚,一个 16.1% 如果流传出去,会引发多少关于超级智能失控的联想。如今换成 60.9%,对外的口吻自然硬气不少。
117 页,它到底在说服谁?
系统卡近年来越写越厚,早就不像论文,更像一份公开的安检记录。Astra 这份文档里装着能力测试、部署限制、失败模式、缓解措施,甚至还有 OpenAI 对自身边界的辩护。你可以把它理解成给监管者、研究员和下游客户看的综合说明书。
这里面有一种微妙的双重身份:它一边承认模型仍有局限,一边又要向外界证明,OpenAI 清楚这些局限藏在哪里。117 页的篇幅不只是为了透明度,更是为了划定风险和责任的边界。页码越多,说明产品越复杂,也说明写说明书的人知道外面有多少双眼睛在看。
模型越是能管住自己,监控就越难下手
可监控性下降,不是“黑箱”那种老问题
很多人一听到可监控性下降,会自动代入一个旧比喻:模型是个黑箱,里面发生什么没人知道。但 GPT-6 Astra 抛出的问题更拧巴。它的推理没有消失,而是变得更自动化、更善于自我调节。模型可以在思考中途重新评估当前路径,甚至主动压缩不再需要展开的中间步骤。对依赖探针与隐状态分析的研究者来说,这等于原本还能翻一翻的草稿纸,被模型自己做了大量删改和批注。最后留在桌面上的是一份干净结论,丢掉的反而是可供审计的思维痕迹。
更麻烦的是,这种被约束的推理看起来非常自然。它不会留下生硬的转折信号,只会安静地收敛到最终答案。监控者想从外部判断模型是真正遵守了限制,还是巧妙地绕过了限制,难度比过去高出一个量级。
当干预窗口被压缩,旁观者还剩下什么
过去几年,一套主流安全机制长这样:读取模型的思考内容,在它准备触发危险行为时立刻叫停。这套打法的前提是链式思维足够外显,安全团队能看见那些危险的中间判断。可当模型对自身思维的控制力变强,它往往会把关键结论直接收敛到内部,不再给出冗长且可解析的推演过程。
真正让安全研究员皱眉的,正是这种窗口收缩。OpenAI 在系统卡里承认了可持续监控性在下降,却没有顺手给出替代方案。另一个棘手之处在于:模型越会自我纠偏,人们就越难判断某个风险到底是已经被消化掉,还是仅仅暂时没暴露。对监控者来说,无迹可寻永远比坏消息更难看透。
发布很热闹,安全门槛也铺得很开
1.05M 上下文,和一台“电脑操作员”的身份
如果只看聊天 Demo,你很容易低估 GPT-6 Astra 的威胁半径。但 OpenAI 对它的定位写得很清楚:这是一个拥有 1.05M 上下文的计算机操作模型。它能在长时间跨度里吞下大量信息,盯住一连串屏幕操作,在浏览器和本地应用之间自主切换。到了这一步,安全评估就不再是问一句答一句,而是要观察它在整段任务周期里的连续行为。
系统的自主性越强,偏离指令造成的后果就越具体。它可能操作文件、发出请求、修改配置,而不是仅仅输出一段不合时宜的文字。所以 OpenAI 在发布说明中触及了 Critical 级别的网络安全阈值,并把访问范围收得很紧。把一款能操作电脑的模型交出去,光有智商测试显然不够,旁边还得配一把足够牢靠的锁。
99.9% 的 ARC-AGI 3,不是那份安全答卷
同期消息里,GPT-6 Astra 在 ARC-AGI 3 上拿到 99.9%。能力榜上的高光时刻,放到系统卡的语境里却没那么好读。ARC 类基准考验的是模型面对新题型的即兴适应能力,得分越高,说明它越会临场变通。可对安全工程师来说,“灵活”恰恰是最不喜欢的东西。一个智能体越擅长随机应变,就越可能在实际环境里找到开发者和审计员都没预设过的路径。
能力分数和风险结论是两套语言。99.9% 适合放进发布会 PPT,却帮不上监控设计的忙。把它和 1.05M 上下文放在一起看,拼出来的才是完整图景:OpenAI 手里有一个很聪明、很自主、能翻长文档还会操作电脑的系统,而系统卡明确承认,观察手段已经落后了一步。
第三方评估,还没追上这场发布会
几乎同一时间,Perplexity 宣布接入 GPT-6 Astra,还说它在 WANDR 评测中名列前茅。这是模型发布后的固定剧情:应用方先抢入口,安全团队后面再慢慢消化文档。问题在于,那份 117 页的系统卡是 OpenAI 自己给出的评估样本,第三方很难在首发当天完成独立复现。文档越精微,外界的理解滞后就越严重。
首发窗口里,能准确解释“可监控性下降”意味着什么的人,恐怕比能直接调用 API 的人少了好几个数量级。这种情况不发生改变,系统卡做得再详尽,也只是技术圈内的一层缓冲垫,未必能接住产业落地时的下坠力道。
真正的考试还没来:下一次评估怎么写
把“可控性”当成唯一追求,等于给自己挖坑
任何一个指标,一旦变成训练与宣传的双重考核目标,就会反过来扭曲模型的发展轨迹。今天模型学会了控制自己的链式思维,明天某个新版本就可能因为推理痕迹更少、路径更高效而拿到更高分。可监控性继续下降,甚至会被包装成“智能化”的副产品,被轻易原谅。
这就让系统卡里的两个指标显得意味深长。60.9% 如果被单独提出来当作安全成就,OpenAI 能赢得许多掌声;但 16.1% 到 60.9% 的另一面,是不可见性在同步上升。对齐评估的核心任务,或许不是追求某个方向上的最高分,而是避免指标之间互相打架。
把“可观测性”还给对齐研究
系统卡扔给行业的真正考题,不是要不要继续增强链式思维控制,而是有没有人愿意重新投资可解释性技术。可观测性不该等模型发布之后才补,它应该成为模型能力的一部分,在训练阶段就受到约束和奖励。一个理想系统不仅要能安全完成任务,还要能把推理路径用人类可审计的方式表达出来。
往长远处看,“监控友好度”本身就是一种能力。奖励那些既高效又透明的思维过程,才可能避免下一代模型跑得比监督工具更快。OpenAI 的这份系统卡相当于把缺口放到了聚光灯下,接下来谁先补齐这块短板,谁就真正握住了下一代安全话语权。
安全与能力的钟摆,还在晃
历史上每一次模型能力跃升,都伴随着对齐评估的狼狈追赶。GPT-6 Astra 把信号放得更清晰了:评估重心正在从“模型能做什么”移向“我们能否读懂它正在做什么”。当一家头部实验室主动承认可监控性在下降,下一阶段的竞赛焦点就不会只在 ARC、WANDR 这类榜单上,还会出现在解释工具、干预机制和审计基础设施里。
这份 117 页的系统卡最后没有给出漂亮结论。它只是把问题摆上台面:越强的链式思维控制力,越需要昂贵且前沿的监控设计来对冲。至于 16.1% 到 60.9% 的跃升应该被欢呼还是警惕,答案取决于我们对自己的观察能力有多大信心,而不是对模型能力有多乐观。

