Greg Brockman 转发:GPT-6 Astra 在 ARC-AGI-3 达到 SOTA,基准趋于饱和

发布时间: 2026-09-04 文章分类: AI前沿技术
阅读量: 0
AI智能体
企业级AI智能体开发与部署
LumeValley提供全栈式企业级AI智能体开发与部署服务,涵盖战略规划、场景化开发、企业级应用构建、行业解决方案及算力支撑。从需求分析到持续优化,确保智能体高效稳定运行,助力企业实现智能化转型,提升运营效率与竞争力。

GPT-6 Astra 拿下了 ARC-AGI-3 的 SOTA,但 OpenAI 的 Greg Brockman 第一时间转发评测时却补了句“这个基准已经饱和”。这不是凡尔赛,而是一个真实的技术判断:同一个模型,在标准 harness 下只拿到 63%,换上新的 Provider Adapter harness 后却直接冲到 99%。跨越 36 个百分点的差距,远比模型本身的得分更值得琢磨——因为它暴露了 ARC-AGI-3 的核心问题:我们到底在测模型,还是在测测试工具?

SOTA 背后,是基准先撑不住了

63% 和 99%,哪个才是真正的 Astra?

如果只看标准测评配置,GPT-6 Astra 的成绩并不算惊艳——63% 的得分虽然能坐上 ARC-AGI-3 的头把交椅,但与人类顶尖选手之间仍有一眼可见的距离。问题在于,这个标准配置的设计思路,还停留在大模型普及之前:它假设模型必须像人类一样按部就班地观察、试错、推理,每一步动作都付出真实的 token 代价。

新的 Provider Adapter harness 则完全不同。它允许模型用更接近实际生产的方式接入能力插件,相当于给了一个更灵活的“外设接口”。结果同一套模型权重,得分从 63% 飙到 99%,几乎追平满分的表现。换句话说,不是 Astra 变聪明了,而是测评方终于允许它把手脚全伸开。

96% 的关卡胜过人类,剩下的 4% 留了余地

更引人注目的是,ARC Prize 的评估显示,Astra 在 96% 的 ARC-AGI-3 关卡上超越了人类表现。这意味着,仅剩的那 4% 关卡仍然像一面镜子,照出这个系统的边界——它不是万能的,但在绝大多数需要抽象推理的任务里,合成模型已经跑到了人类前面。

不过这 4% 同样不能完全归咎于模型。ARC-AGI-3 题目本身设计精巧,答案与规则之间往往隔着不止一步思维跳跃。如果 harness 给出的操作空间稍有差异,剩余难题中有一部分也可能被转化为可解。因此,Brockman 口中的“饱和”,更像是对评测天花板的一种直白暗示。

与其说是基准,不如说是一副可拆卸的眼镜

Provider Adapter 到底改变了什么?

过去测试一个推理模型,通常用一个固定 harness 让它自己发挥,得分高低直接等于模型能力强弱。Provider Adapter 所改变的,正是这一最底层的等价关系。它把模型推理和工具调用、外部反馈、局部搜索等环节拆开,让每部分都能被独立评估,最后再合成一个总分。

这一调整的影响,在某些任务上比换个更大的模型更显著。标准 harness 下,Astra 需要不断尝试错误路径,认知负担高,token 消耗大;而在 Provider Adapter 模式下,它可以利用更清晰的状态反馈,减少无用动作,把推理资源集中在真正有歧义的步骤上。如此,同一批权重在同一组题目里,成绩自然会拉开巨大差距。

当高分榜的评分逻辑开始支配讨论

一个直接后果是,ARC-AGI-3 排行榜的含金量开始被重新审视。先前大家热议“哪家模型拥有更强泛化能力”,如今争论焦点却变成了“哪个 harness 更公平”。事实上,从 63% 到 99% 的跳跃,已经在宣布:评测工程本身就是一层没有写在题目里的隐藏分数。

放眼整个行业,类似的基准同样面临 harness 依赖问题。Model Context Protocol 类的适配层正在成为新玩家的救生衣——模型逻辑没有翻天覆地,得分却可以轻松翻倍。这提醒我们,看任何 ARC-AGI 或同类结果时,必须先把“用什么工具考的”这句话问清楚。

越擅长推理的动作,越便宜的 token 账单

智力的度量,不只是正确率,还是一条成本曲线

ARC Prize 发布图表时放出了一个同时有点反直觉的细节:更高推理层级的 Astra,平均成本反而更低。原因不复杂——层级越高的模型动作越精准,能以更少的尝试步数到达正确答案。而每一步动作,都意味着一轮模型调用和成串的 token 消耗。动作少了,总成本自然降了下来。

这里头有一个很容易被忽略的行业讯号:未来的 AI 定价权,可能不是由参数规模或智力上限决定的,而是由“单位智力消耗的资源”决定的。那些能在复杂任务中第一个跳出试错循环的模型,即使 API 单价略贵,反而会在实际使用中更省钱。

1.05M 上下文与限流背后的安全博弈

GPT-6 Astra 的另一项高频指标是支持 1.05M tokens 的大型上下文窗口,这给了它更强的“全局记忆”,让同一任务里前后多次动作不再彼此遗忘。但 OpenAI 选择限制部分访问,理由抛出了 Critical 网络安全阈值 这个概念。如此设计令人想起此前发布的 o3 系列:能力一旦触及某种安全红线,产品开放节奏就会即时刹车。

这种谨慎并非没有道理。Astra 既能借助高推理层级把 ARC-AGI-3 的剩余难题几乎逐个击穿,就可能被改造成更难被识别的漏洞挖掘工具。它的动作精简能力,同样让传统的按调用次数计费的安全护栏变得无效。分数上涨的另一面,是风险敞口同步静默扩张。

把 99% 当成起点,而不是终点

Perplexity 已经宣布将接入 GPT-6 Astra,并在自家 WANDR 评测中把它的综合能力列到首位。另一边,ARC-AGI-3 尚未跑的 4% 关卡、不同 harness 之间的巨大分差、以及随之而来的安全限流,都让这份 SOTA 变得迷人而暧昧。你可以说 GPT-6 Astra 真的很强,也可以说很多强是评测框架给的。

但有一点很清楚:模型与评测之间那种“被测即所得”的日子已经过去了。谁能定义下一次评测的 harness,谁就更可能定义通往 AGI 的航线。在这个意义上,Brockman 的“基准饱和”不是终点,而是一个提醒——接下来的竞争,将从“模型本身”转移为“评分规则”本身。

AI智能体
企业级AI智能体开发与部署方案
LumeValley打造企业级AI智能体全流程方案,涵盖需求洞察、定制开发、多平台适配部署。凭借专业算法与丰富经验,确保智能体精准理解业务,高效执行任务,无缝融入企业生态,为企业数字化转型提供强劲智能引擎,提升核心竞争力。
点赞 | 23

Lumevalley——全栈AI服务领航者,以“战略-应用-算力”三位一体服务框架,为企业提供从顶层战略规划、场景化AI智能体(AI Agent)开发/搭建/部署,到企业级AI应用开发、AI+行业场景解决方案的全链路服务,并配套AI大模型部署与高性能AI算力底座支撑,助力客户在营销、服务、运营等核心环节实现效率倍增与模式创新。

马上扫码获取产品资料
相关文章

相关文章

填写以下信息, 免费获取方案报价
姓名
手机号码
企业名称
  • 建筑建材
  • 化工
  • 钢铁
  • 机械设备
  • 原材料
  • 工业
  • 环保
  • 生鲜
  • 医疗
  • 快消品
  • 农林牧渔
  • 汽车汽配
  • 橡胶
  • 工程
  • 加工
  • 仪器仪表
  • 纺织
  • 服装
  • 电子元器件
  • 物流
  • 化塑
  • 食品
  • 房地产
  • 交通运输
  • 能源
  • 印刷
  • 教育
  • 跨境电商
  • 旅游
  • 皮革
  • 3C数码
  • 金属制品
  • 批发
  • 研究和发展
  • 其他行业
需求描述
填写以下信息马上为您安排系统演示
姓名
手机号码
你的职位
企业名称

恭喜您的需求提交成功

尊敬的用户,您好!

您的需求我们已经收到,我们会为您安排专属电商商务顾问在24小时内(工作日时间)内与您取得联系,请您在此期间保持电话畅通,并且注意接听来自广州区域的来电。
感谢您的支持!

您好,我是您的专属产品顾问
扫码添加我的微信,免费体验系统
(工作日09:00 - 18:00)
电话咨询 (工作日09:00 - 18:00)
客服热线: 18011747352
售前热线: 189 2432 2993
扫码即可快速拨打热线