如果只看最终得分,OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 Semi-Private 上的成绩几乎无可挑剔:Provider Adapter harness 下拿到 99.9%,成本压到了 1.9 万美元。同一模型在 Standard harness 下则是 62.7%,这个分数也不算差,可两者之间足足差了 37 个百分点。ARC 官方发布拆解报告后,真正值得琢磨的不是“又刷新了 SOTA”,而是这一高一低之间,暴露了 AI 智能体评测里一个常年被忽视的变量——动作效率。
GPT-6 Astra 的 99.9% 与 62.7%:差在接口,不差智商
同一个模型,两种“马具”,哪个更接近真实能力?
Standard harness 的玩法接近人类日常操作。模型要自己移动鼠标、点击界面、输入字符,每一步动作都必须在测试环境里真实执行。这很费劲,也容易出错。Astra 在这里拿到 62.7%,代价是 2.6 万美元的推理成本。
Provider Adapter harness 则换了一套输入方式。模型不再需要模拟每一个底层鼠标事件,而是可以直接调用针对测试场景优化的高级动作接口,比如“选择菜单项”“拖拽网格块”这类语义化操作。同样一个 Astra,得分飙升到 99.9%,成本反而降到 1.9 万美元。
两个分数放在一起,说明模型的内在推理能力也许早就到了能解出几乎所有题目的程度,但让它用笨拙的人类输入方式去表达,就打了折扣。就像一位顶尖棋手能算出最优解,可如果要求他每走一步都要先把棋子举起来转三圈,失误率自然上去了。
成本下降 27%,得分却涨了 37 个百分点
从 2.6 万到 1.9 万,这不是一笔简单的账。省下的 27% 成本背后,是无效动作的锐减。Standard harness 里,模型可能因为一次坐标偏移而反复试错;Provider Adapter 则把动作抽象到了更高层级,让模型把能量用在决策而非“操控鼠标”上。把成本算进去,每千美元得分是 Standard harness 的 2.2 倍——这个效率差比 99.9% 的绝对数字更值得玩味。
换句话说,得分暴涨不是因为模型变聪明了,而是因为它不再需要把智商浪费在低级接口上。
ARC 官方的拆解:一次对智能体评测的重定义
ARC-AGI-3 的考法变了:完整动作链才是重点
这次测试的样本来自桌面自动化和网络安全任务。模型面对的界面里有弹窗、命令行、文件管理器,甚至还有模拟攻击者留下的日志。它必须观察屏幕状态,推理出下一步做什么,再发出指令。整个流程是动态的——上一个动作会改变下一个画面。ARC 把这套流程设计成了连续决策场景,而不是一道需要一次性给出答案的选择题。
Astra 在这种连续决策场景里表现出近乎完整的一致性。它不只是“知道答案”,还能按照正确顺序把操作步骤走完,全程没有迷失在界面噪声里。更难得的是,当目标窗口不规则或者按钮没有标准文本时,Astra 依然能保持导向正确,这一点比单纯高分更说明问题。
Provider Adapter 是外挂,还是性能释放?
有人质疑 Provider Adapter 是给模型开后门。ARC 官方明确说明,这是测试不同接入方式对能力发挥的影响。好比让一个人做数学题,他可以心算,也可以用草稿纸。草稿纸并没有降低题目难度,只是让思维过程更顺畅。
从这个角度看,Provider Adapter 的成绩反映的是 GPT-6 Astra 在最佳工具条件下的能力上限,而 Standard 分数反映的是它在裸机环境下的鲁棒性。两者都真实,但后者更贴近今天的终端用户。
真正值得记下的不是满分,而是“动作效率”这个新标尺
分数高不算新闻,钱花得少还能分数高才是
AI 圈见惯了动辄千万美元的训练成本和十万级推理开销。如果 Astra 用 10 万成本拿满分,大家只会感叹“果然有钱”。可它只用不到 2 万成本做完整个 Semi-Private 测试,这压缩到动作层面,意味着每一步操作都比以前的模型更精准。
ARC 报告里特意比较了不同模型在相同任务上的动作次数。Astra 在 Provider Adapter 下,平均每个任务的动作数远低于其他模型。传统 Agent 遇到坐标偏移时,容易陷入“点击—截图—再点击”的循环;Astra 则会用语义化动作重新规划路径。动作越少,累积延迟和错误概率就越低,成本自然跟着下降。
对 AI Agent 开发者的三个启示
一个明显的教训:评测方式极大影响模型的能力呈现,不要因为一个基准分数就断定模型强弱。一个更务实的选择:为特定任务领域设计适配层,是当前释放大模型潜力的最务实路径,OpenAI 已经用 99.9% 做了示范。而最关键的一点是,动作质量比动作数量更重要——未来 Agent 的竞争点,不会只是“能不能做对”,还会包括“出手够不够干净”。
这三个启示指向同一个方向:动作效率正在成为衡量智能体的核心性能指标,就像当年图像识别用准确率之外的面板来评判算法水平一样。
别急着庆祝——这组数字还有几道阴影
Semi-Private 集合,防得了污染吗?
Semi-Private 的意思是,题目有一半是保密的,另一半可能公开过。Astra 在两个 harness 下的巨大差距,让一些人怀疑它是否在 Standard 的公开题上记住了答案——毕竟 62.7% 这个数字看起来过于“谦虚”。ARC 采用了动态生成的网格逻辑来降低记忆风险,但互联网上没有绝对干净的模型。
我们需要更多独立机构对 Astra 做同样的测试,尤其是关闭 Provider Adapter、只给普通鼠标键盘接口来复现结果。在那之前,99.9% 可以当作一个振奋人心的信号,但别急着宣布大功告成。
接下来盯紧什么?
先看 OpenAI 是否会把 Provider Adapter 的能力通过 API 开放给开发者,再看其他实验室会不会用同样的模式在 ARC-AGI-3 上逼近满分。此外,ARC 的下一个版本是否会取消 Provider Adapter 也是个问题——如果满分太容易拿,那这项测试的鉴别力就会下降。
当然,最有趣的事情在于:当动作接口被优化到极致后,模型之间的差距会重新回到纯推理能力上。到那时,我们才会看到真正的江湖座次。
GPT-6 Astra 的这份答卷,最迷人的地方其实藏在两个分数的夹缝里。那是一条从“能思考”通往“会行动”的阶梯,平时总被忽略。模型迷茫时在 62.7%,从容时能到 99.9%,大脑还是同一个大脑,变的只是它把想法变成动作的流畅度。下一场 AI 竞赛,或许就从这个起点发令。

