François Chollet 在 X 上抛出了 GPT-6 Astra 在 ARC-AGI-3 交互式推理任务上的实测成绩:标准 harness 下 66%,持续对话 harness 与自定义 compaction 叠加后接近满分。两个数字之间的落差,比模型分数本身更值得咀嚼。它把一个争论已久的问题重新摆上台面:我们到底是在测模型的能力,还是在测一套包含模型、框架和记忆策略的复合系统?
一个分数读出两种逻辑
66%:标准 harness 下的“裸考”现场
先把标准 harness 说清楚。这种测试方式近似传统考场:模型收到任务,依据输入信息做出判断并输出结果,不能中途追问,也无法借外部对话修正假设。对前沿模型来说,66% 在 ARC-AGI-3 上已经是一个让人停下来的数字。Chollet 用的形容是“阶跃式提升”,说明这不是调调 prompt 挤出来的百分点,而是推理难度曲线上的一次换挡。真正跑过这类任务的人知道,60% 之后的每一分都会变贵;模型要跨过的不只是隐藏规则,还有第一轮判断留下的惯性。
接近满分:当对话成为答题环境
持续对话 harness 给了模型另一条跑道。模型可以描述自己的猜想,在环境反馈里验证,甚至承认某个想法走不通,然后换方向。自定义 compaction 在这个过程里充当记忆整理者:它把冗长的探索过程按重要程度折叠,留下仍能支撑后续推理的关键判断。成绩因此逼近 100%。这个满分并不来自某个突然“开窍”的瞬间,而来自模型在多轮互动里把错误逐一清出决策树的过程。
还是同一个模型吗?
权重没变,测试框架变了,分差超过三十个点。不用急着判定哪一个分数更真实,两个分数都成立:66% 是模型在封闭作答中的表现,接近满分是模型进入交互环境后的表现。人类做复杂推理时也会借助纸笔和对话给自己制造外部反馈。这套外部反馈让模型显得更强,但同时也意味着,以后不能把百分数单纯记在模型头上。评测单位,恐怕要从模型本身挪到系统上。
ARC-AGI-3 到底在考哪种“智力”?
没有题库的抽象推理
ARC-AGI 系列一直刻意逃离“见多识广”的诱惑。它没有题库,模型也无法依赖训练数据里见过的相似题面。ARC-AGI-3 的交互式任务更是如此:模型的下一步行动会改变它接下来看到的内容,而正确解法往往藏在一条被多轮探索验证过的路径里。如果模型只是在不断生成下一个合理的 token,它也许能走过前两步,却会在某次错误匹配之后越陷越深。
compaction 不只是在压缩上下文
很多人看到自定义 compaction,第一个念头是上下文太长,需要截断。它的作用比截断精细得多。compaction 保留的不是原始对话,而是被提炼后的判断结构:哪些假设已经被环境否定,哪些规律仍具备解释力,哪些边界还需要新样例确认。GPT-6 Astra 的亮点在于,compact 之后那些判断仍然能被后续推理继续使用。这更像人类使用笔记,而不是背诵笔记。
接近满分,先别急着把功劳全给模型
也要给这个接近满分的成绩浇一盆冷水。结果产生于一个被精心准备的测试环境,自定义 compaction 意味着有人替模型提前整理过记忆。这是不是作弊,取决于怎么定义智能。你可以说,真实世界里的助手本来就应该学会整理自己的上下文;也可以说,当 harness 和任务来自同一个设计者时,分数难免带一点水份。但无论站在哪一边,这个结果都指向一个方向:与其让模型在静态考卷里拿高分,不如认真设计能让记忆与试错产生复利的交互环境。
360 美元一局,成本说明了什么?
钱被模型的“思考路径”烧掉了
每局约 360 美元,这个数字会劝退绝大多数研究团队。它不是简单调一次 API 的价格,而是完整交互走完后的算力账单。多轮对话意味着模型每走一步都要重新计算后续路径;每次 compaction 都相当于一次对压缩结果的重新理解;ARC-AGI-3 的任务难度又决定了模型必须反复探索才能找到正确分支。钱没有花在输出文字上,而是花在让模型从错误里寻找可行路径这件事上。
贵,把问题推到产品面前
高成本把“接近满分”拉回现实。一方面,它说明深度推理确实可以做到极高准确率;另一方面,如果每一次接近人类协作质量的推理都要数百美元,普通产品就不可能照搬这套框架。厂商未来面对的不只是准确率,还有单位质量的推理成本。这个“推理税”会决定技术究竟能留在实验室,还是真正走进日常场景。
智能评测,正在被交互式框架改写
从单点答题到多轮协作
经典 benchmark 的题设大多是单轮:模型看到问题,给出答案,评分结束。现实中的推理没有这种真空。一个人在被质疑、被补充信息、甚至犯错之后重新组织思路,才是更常见的智能表现。GPT-6 Astra 在 ARC-AGI-3 上接近满分的路径,恰恰是那条允许犯错、允许通过 compact 把错误消化成经验的路径。这件事比最终分数更有参考价值。
多份报告,需要用同一种语言
如果每家实验室都拿一套定制的完美 harness 来报喜,基准很快就会失去公共意义。最理想的状态是评测报告像论文的方法章节:模型版本、任务集、harness 类型、compaction 策略、单局成本都写清楚。分数之外,读者需要知道这份能力是用多少钱、多少外部支撑换来的。技术讨论越是接近 AGI,评测语言就越需要诚实。
这场测试留下的问题多于答案
现在最该警惕的是,厂商把“接近满分”写进宣传语,却不提测试环境、compaction 和成本。Chollet 愿意公开 66% 与接近满分两种配置,已经给行业做了一个示范。后续要追问的事情还有不少:自定义 compaction 会不会泄露任务的结构?第三方设计的交互任务还能不能复现这个结果?ARC-AGI-3 上烧掉的 360 美元,有没有更便宜的方式解释?这些问题比一个满分更值得等待答案。

