GPT-6 Astra 拿下了 ARC-AGI-3 的 SOTA,但 OpenAI 的 Greg Brockman 第一时间转发评测时却补了句“这个基准已经饱和”。这不是凡尔赛,而是一个真实的技术判断:同一个模型,在标准 harness 下只拿到 63%,换上新的 Provider Adapter harness 后却直接冲到 99%。跨越 36 个百分点的差距,远比模型本身的得分更值得琢磨——因为它暴露了 ARC-AGI-3 的核心问题:我们到底在测模型,还是在测测试工具?
SOTA 背后,是基准先撑不住了
63% 和 99%,哪个才是真正的 Astra?
如果只看标准测评配置,GPT-6 Astra 的成绩并不算惊艳——63% 的得分虽然能坐上 ARC-AGI-3 的头把交椅,但与人类顶尖选手之间仍有一眼可见的距离。问题在于,这个标准配置的设计思路,还停留在大模型普及之前:它假设模型必须像人类一样按部就班地观察、试错、推理,每一步动作都付出真实的 token 代价。
新的 Provider Adapter harness 则完全不同。它允许模型用更接近实际生产的方式接入能力插件,相当于给了一个更灵活的“外设接口”。结果同一套模型权重,得分从 63% 飙到 99%,几乎追平满分的表现。换句话说,不是 Astra 变聪明了,而是测评方终于允许它把手脚全伸开。
96% 的关卡胜过人类,剩下的 4% 留了余地
更引人注目的是,ARC Prize 的评估显示,Astra 在 96% 的 ARC-AGI-3 关卡上超越了人类表现。这意味着,仅剩的那 4% 关卡仍然像一面镜子,照出这个系统的边界——它不是万能的,但在绝大多数需要抽象推理的任务里,合成模型已经跑到了人类前面。
不过这 4% 同样不能完全归咎于模型。ARC-AGI-3 题目本身设计精巧,答案与规则之间往往隔着不止一步思维跳跃。如果 harness 给出的操作空间稍有差异,剩余难题中有一部分也可能被转化为可解。因此,Brockman 口中的“饱和”,更像是对评测天花板的一种直白暗示。
与其说是基准,不如说是一副可拆卸的眼镜
Provider Adapter 到底改变了什么?
过去测试一个推理模型,通常用一个固定 harness 让它自己发挥,得分高低直接等于模型能力强弱。Provider Adapter 所改变的,正是这一最底层的等价关系。它把模型推理和工具调用、外部反馈、局部搜索等环节拆开,让每部分都能被独立评估,最后再合成一个总分。
这一调整的影响,在某些任务上比换个更大的模型更显著。标准 harness 下,Astra 需要不断尝试错误路径,认知负担高,token 消耗大;而在 Provider Adapter 模式下,它可以利用更清晰的状态反馈,减少无用动作,把推理资源集中在真正有歧义的步骤上。如此,同一批权重在同一组题目里,成绩自然会拉开巨大差距。
当高分榜的评分逻辑开始支配讨论
一个直接后果是,ARC-AGI-3 排行榜的含金量开始被重新审视。先前大家热议“哪家模型拥有更强泛化能力”,如今争论焦点却变成了“哪个 harness 更公平”。事实上,从 63% 到 99% 的跳跃,已经在宣布:评测工程本身就是一层没有写在题目里的隐藏分数。
放眼整个行业,类似的基准同样面临 harness 依赖问题。Model Context Protocol 类的适配层正在成为新玩家的救生衣——模型逻辑没有翻天覆地,得分却可以轻松翻倍。这提醒我们,看任何 ARC-AGI 或同类结果时,必须先把“用什么工具考的”这句话问清楚。
越擅长推理的动作,越便宜的 token 账单
智力的度量,不只是正确率,还是一条成本曲线
ARC Prize 发布图表时放出了一个同时有点反直觉的细节:更高推理层级的 Astra,平均成本反而更低。原因不复杂——层级越高的模型动作越精准,能以更少的尝试步数到达正确答案。而每一步动作,都意味着一轮模型调用和成串的 token 消耗。动作少了,总成本自然降了下来。
这里头有一个很容易被忽略的行业讯号:未来的 AI 定价权,可能不是由参数规模或智力上限决定的,而是由“单位智力消耗的资源”决定的。那些能在复杂任务中第一个跳出试错循环的模型,即使 API 单价略贵,反而会在实际使用中更省钱。
1.05M 上下文与限流背后的安全博弈
GPT-6 Astra 的另一项高频指标是支持 1.05M tokens 的大型上下文窗口,这给了它更强的“全局记忆”,让同一任务里前后多次动作不再彼此遗忘。但 OpenAI 选择限制部分访问,理由抛出了 Critical 网络安全阈值 这个概念。如此设计令人想起此前发布的 o3 系列:能力一旦触及某种安全红线,产品开放节奏就会即时刹车。
这种谨慎并非没有道理。Astra 既能借助高推理层级把 ARC-AGI-3 的剩余难题几乎逐个击穿,就可能被改造成更难被识别的漏洞挖掘工具。它的动作精简能力,同样让传统的按调用次数计费的安全护栏变得无效。分数上涨的另一面,是风险敞口同步静默扩张。
把 99% 当成起点,而不是终点
Perplexity 已经宣布将接入 GPT-6 Astra,并在自家 WANDR 评测中把它的综合能力列到首位。另一边,ARC-AGI-3 尚未跑的 4% 关卡、不同 harness 之间的巨大分差、以及随之而来的安全限流,都让这份 SOTA 变得迷人而暧昧。你可以说 GPT-6 Astra 真的很强,也可以说很多强是评测框架给的。
但有一点很清楚:模型与评测之间那种“被测即所得”的日子已经过去了。谁能定义下一次评测的 harness,谁就更可能定义通往 AGI 的航线。在这个意义上,Brockman 的“基准饱和”不是终点,而是一个提醒——接下来的竞争,将从“模型本身”转移为“评分规则”本身。

