François Chollet 评 GPT-6 Astra 在 ARC-AGI-3 上的表现

发布时间: 2026-09-04 文章分类: AI前沿技术
阅读量: 0
AI智能体
企业级AI智能体开发与部署
LumeValley提供全栈式企业级AI智能体开发与部署服务,涵盖战略规划、场景化开发、企业级应用构建、行业解决方案及算力支撑。从需求分析到持续优化,确保智能体高效稳定运行,助力企业实现智能化转型,提升运营效率与竞争力。

François Chollet 在 X 上抛出了 GPT-6 AstraARC-AGI-3 交互式推理任务上的实测成绩:标准 harness 下 66%,持续对话 harness 与自定义 compaction 叠加后接近满分。两个数字之间的落差,比模型分数本身更值得咀嚼。它把一个争论已久的问题重新摆上台面:我们到底是在测模型的能力,还是在测一套包含模型、框架和记忆策略的复合系统?

一个分数读出两种逻辑

66%:标准 harness 下的“裸考”现场

先把标准 harness 说清楚。这种测试方式近似传统考场:模型收到任务,依据输入信息做出判断并输出结果,不能中途追问,也无法借外部对话修正假设。对前沿模型来说,66% 在 ARC-AGI-3 上已经是一个让人停下来的数字。Chollet 用的形容是“阶跃式提升”,说明这不是调调 prompt 挤出来的百分点,而是推理难度曲线上的一次换挡。真正跑过这类任务的人知道,60% 之后的每一分都会变贵;模型要跨过的不只是隐藏规则,还有第一轮判断留下的惯性。

接近满分:当对话成为答题环境

持续对话 harness 给了模型另一条跑道。模型可以描述自己的猜想,在环境反馈里验证,甚至承认某个想法走不通,然后换方向。自定义 compaction 在这个过程里充当记忆整理者:它把冗长的探索过程按重要程度折叠,留下仍能支撑后续推理的关键判断。成绩因此逼近 100%。这个满分并不来自某个突然“开窍”的瞬间,而来自模型在多轮互动里把错误逐一清出决策树的过程。

还是同一个模型吗?

权重没变,测试框架变了,分差超过三十个点。不用急着判定哪一个分数更真实,两个分数都成立:66% 是模型在封闭作答中的表现,接近满分是模型进入交互环境后的表现。人类做复杂推理时也会借助纸笔和对话给自己制造外部反馈。这套外部反馈让模型显得更强,但同时也意味着,以后不能把百分数单纯记在模型头上。评测单位,恐怕要从模型本身挪到系统上。

ARC-AGI-3 到底在考哪种“智力”?

没有题库的抽象推理

ARC-AGI 系列一直刻意逃离“见多识广”的诱惑。它没有题库,模型也无法依赖训练数据里见过的相似题面。ARC-AGI-3 的交互式任务更是如此:模型的下一步行动会改变它接下来看到的内容,而正确解法往往藏在一条被多轮探索验证过的路径里。如果模型只是在不断生成下一个合理的 token,它也许能走过前两步,却会在某次错误匹配之后越陷越深。

compaction 不只是在压缩上下文

很多人看到自定义 compaction,第一个念头是上下文太长,需要截断。它的作用比截断精细得多。compaction 保留的不是原始对话,而是被提炼后的判断结构:哪些假设已经被环境否定,哪些规律仍具备解释力,哪些边界还需要新样例确认。GPT-6 Astra 的亮点在于,compact 之后那些判断仍然能被后续推理继续使用。这更像人类使用笔记,而不是背诵笔记。

接近满分,先别急着把功劳全给模型

也要给这个接近满分的成绩浇一盆冷水。结果产生于一个被精心准备的测试环境,自定义 compaction 意味着有人替模型提前整理过记忆。这是不是作弊,取决于怎么定义智能。你可以说,真实世界里的助手本来就应该学会整理自己的上下文;也可以说,当 harness 和任务来自同一个设计者时,分数难免带一点水份。但无论站在哪一边,这个结果都指向一个方向:与其让模型在静态考卷里拿高分,不如认真设计能让记忆与试错产生复利的交互环境。

360 美元一局,成本说明了什么?

钱被模型的“思考路径”烧掉了

每局约 360 美元,这个数字会劝退绝大多数研究团队。它不是简单调一次 API 的价格,而是完整交互走完后的算力账单。多轮对话意味着模型每走一步都要重新计算后续路径;每次 compaction 都相当于一次对压缩结果的重新理解;ARC-AGI-3 的任务难度又决定了模型必须反复探索才能找到正确分支。钱没有花在输出文字上,而是花在让模型从错误里寻找可行路径这件事上。

贵,把问题推到产品面前

高成本把“接近满分”拉回现实。一方面,它说明深度推理确实可以做到极高准确率;另一方面,如果每一次接近人类协作质量的推理都要数百美元,普通产品就不可能照搬这套框架。厂商未来面对的不只是准确率,还有单位质量的推理成本。这个“推理税”会决定技术究竟能留在实验室,还是真正走进日常场景。

智能评测,正在被交互式框架改写

从单点答题到多轮协作

经典 benchmark 的题设大多是单轮:模型看到问题,给出答案,评分结束。现实中的推理没有这种真空。一个人在被质疑、被补充信息、甚至犯错之后重新组织思路,才是更常见的智能表现。GPT-6 Astra 在 ARC-AGI-3 上接近满分的路径,恰恰是那条允许犯错、允许通过 compact 把错误消化成经验的路径。这件事比最终分数更有参考价值。

多份报告,需要用同一种语言

如果每家实验室都拿一套定制的完美 harness 来报喜,基准很快就会失去公共意义。最理想的状态是评测报告像论文的方法章节:模型版本、任务集、harness 类型、compaction 策略、单局成本都写清楚。分数之外,读者需要知道这份能力是用多少钱、多少外部支撑换来的。技术讨论越是接近 AGI,评测语言就越需要诚实。

这场测试留下的问题多于答案

现在最该警惕的是,厂商把“接近满分”写进宣传语,却不提测试环境、compaction 和成本。Chollet 愿意公开 66% 与接近满分两种配置,已经给行业做了一个示范。后续要追问的事情还有不少:自定义 compaction 会不会泄露任务的结构?第三方设计的交互任务还能不能复现这个结果?ARC-AGI-3 上烧掉的 360 美元,有没有更便宜的方式解释?这些问题比一个满分更值得等待答案。

AI智能体
企业级AI智能体开发与部署方案
LumeValley打造企业级AI智能体全流程方案,涵盖需求洞察、定制开发、多平台适配部署。凭借专业算法与丰富经验,确保智能体精准理解业务,高效执行任务,无缝融入企业生态,为企业数字化转型提供强劲智能引擎,提升核心竞争力。
点赞 | 53

Lumevalley——全栈AI服务领航者,以“战略-应用-算力”三位一体服务框架,为企业提供从顶层战略规划、场景化AI智能体(AI Agent)开发/搭建/部署,到企业级AI应用开发、AI+行业场景解决方案的全链路服务,并配套AI大模型部署与高性能AI算力底座支撑,助力客户在营销、服务、运营等核心环节实现效率倍增与模式创新。

马上扫码获取产品资料
相关文章

相关文章

填写以下信息, 免费获取方案报价
姓名
手机号码
企业名称
  • 建筑建材
  • 化工
  • 钢铁
  • 机械设备
  • 原材料
  • 工业
  • 环保
  • 生鲜
  • 医疗
  • 快消品
  • 农林牧渔
  • 汽车汽配
  • 橡胶
  • 工程
  • 加工
  • 仪器仪表
  • 纺织
  • 服装
  • 电子元器件
  • 物流
  • 化塑
  • 食品
  • 房地产
  • 交通运输
  • 能源
  • 印刷
  • 教育
  • 跨境电商
  • 旅游
  • 皮革
  • 3C数码
  • 金属制品
  • 批发
  • 研究和发展
  • 其他行业
需求描述
填写以下信息马上为您安排系统演示
姓名
手机号码
你的职位
企业名称

恭喜您的需求提交成功

尊敬的用户,您好!

您的需求我们已经收到,我们会为您安排专属电商商务顾问在24小时内(工作日时间)内与您取得联系,请您在此期间保持电话畅通,并且注意接听来自广州区域的来电。
感谢您的支持!

您好,我是您的专属产品顾问
扫码添加我的微信,免费体验系统
(工作日09:00 - 18:00)
电话咨询 (工作日09:00 - 18:00)
客服热线: 18011747352
售前热线: 189 2432 2993
扫码即可快速拨打热线