OpenAI GPT-6 Astra 在 ARC-AGI-3 上取得 SOTA 并超越人类动作效率基线

发布时间: 2026-09-04 文章分类: AI前沿技术
阅读量: 0
AI智能体
企业级AI智能体开发与部署
LumeValley提供全栈式企业级AI智能体开发与部署服务,涵盖战略规划、场景化开发、企业级应用构建、行业解决方案及算力支撑。从需求分析到持续优化,确保智能体高效稳定运行,助力企业实现智能化转型,提升运营效率与竞争力。

如果只看最终得分,OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 Semi-Private 上的成绩几乎无可挑剔:Provider Adapter harness 下拿到 99.9%,成本压到了 1.9 万美元。同一模型在 Standard harness 下则是 62.7%,这个分数也不算差,可两者之间足足差了 37 个百分点。ARC 官方发布拆解报告后,真正值得琢磨的不是“又刷新了 SOTA”,而是这一高一低之间,暴露了 AI 智能体评测里一个常年被忽视的变量——动作效率。

GPT-6 Astra 的 99.9% 与 62.7%:差在接口,不差智商

同一个模型,两种“马具”,哪个更接近真实能力?

Standard harness 的玩法接近人类日常操作。模型要自己移动鼠标、点击界面、输入字符,每一步动作都必须在测试环境里真实执行。这很费劲,也容易出错。Astra 在这里拿到 62.7%,代价是 2.6 万美元的推理成本。

Provider Adapter harness 则换了一套输入方式。模型不再需要模拟每一个底层鼠标事件,而是可以直接调用针对测试场景优化的高级动作接口,比如“选择菜单项”“拖拽网格块”这类语义化操作。同样一个 Astra,得分飙升到 99.9%,成本反而降到 1.9 万美元。

两个分数放在一起,说明模型的内在推理能力也许早就到了能解出几乎所有题目的程度,但让它用笨拙的人类输入方式去表达,就打了折扣。就像一位顶尖棋手能算出最优解,可如果要求他每走一步都要先把棋子举起来转三圈,失误率自然上去了。

成本下降 27%,得分却涨了 37 个百分点

从 2.6 万到 1.9 万,这不是一笔简单的账。省下的 27% 成本背后,是无效动作的锐减。Standard harness 里,模型可能因为一次坐标偏移而反复试错;Provider Adapter 则把动作抽象到了更高层级,让模型把能量用在决策而非“操控鼠标”上。把成本算进去,每千美元得分是 Standard harness 的 2.2 倍——这个效率差比 99.9% 的绝对数字更值得玩味。

换句话说,得分暴涨不是因为模型变聪明了,而是因为它不再需要把智商浪费在低级接口上。

ARC 官方的拆解:一次对智能体评测的重定义

ARC-AGI-3 的考法变了:完整动作链才是重点

这次测试的样本来自桌面自动化和网络安全任务。模型面对的界面里有弹窗、命令行、文件管理器,甚至还有模拟攻击者留下的日志。它必须观察屏幕状态,推理出下一步做什么,再发出指令。整个流程是动态的——上一个动作会改变下一个画面。ARC 把这套流程设计成了连续决策场景,而不是一道需要一次性给出答案的选择题。

Astra 在这种连续决策场景里表现出近乎完整的一致性。它不只是“知道答案”,还能按照正确顺序把操作步骤走完,全程没有迷失在界面噪声里。更难得的是,当目标窗口不规则或者按钮没有标准文本时,Astra 依然能保持导向正确,这一点比单纯高分更说明问题。

Provider Adapter 是外挂,还是性能释放?

有人质疑 Provider Adapter 是给模型开后门。ARC 官方明确说明,这是测试不同接入方式对能力发挥的影响。好比让一个人做数学题,他可以心算,也可以用草稿纸。草稿纸并没有降低题目难度,只是让思维过程更顺畅。

从这个角度看,Provider Adapter 的成绩反映的是 GPT-6 Astra 在最佳工具条件下的能力上限,而 Standard 分数反映的是它在裸机环境下的鲁棒性。两者都真实,但后者更贴近今天的终端用户。

真正值得记下的不是满分,而是“动作效率”这个新标尺

分数高不算新闻,钱花得少还能分数高才是

AI 圈见惯了动辄千万美元的训练成本和十万级推理开销。如果 Astra 用 10 万成本拿满分,大家只会感叹“果然有钱”。可它只用不到 2 万成本做完整个 Semi-Private 测试,这压缩到动作层面,意味着每一步操作都比以前的模型更精准。

ARC 报告里特意比较了不同模型在相同任务上的动作次数。Astra 在 Provider Adapter 下,平均每个任务的动作数远低于其他模型。传统 Agent 遇到坐标偏移时,容易陷入“点击—截图—再点击”的循环;Astra 则会用语义化动作重新规划路径。动作越少,累积延迟和错误概率就越低,成本自然跟着下降。

对 AI Agent 开发者的三个启示

一个明显的教训:评测方式极大影响模型的能力呈现,不要因为一个基准分数就断定模型强弱。一个更务实的选择:为特定任务领域设计适配层,是当前释放大模型潜力的最务实路径,OpenAI 已经用 99.9% 做了示范。而最关键的一点是,动作质量比动作数量更重要——未来 Agent 的竞争点,不会只是“能不能做对”,还会包括“出手够不够干净”。

这三个启示指向同一个方向:动作效率正在成为衡量智能体的核心性能指标,就像当年图像识别用准确率之外的面板来评判算法水平一样。

别急着庆祝——这组数字还有几道阴影

Semi-Private 集合,防得了污染吗?

Semi-Private 的意思是,题目有一半是保密的,另一半可能公开过。Astra 在两个 harness 下的巨大差距,让一些人怀疑它是否在 Standard 的公开题上记住了答案——毕竟 62.7% 这个数字看起来过于“谦虚”。ARC 采用了动态生成的网格逻辑来降低记忆风险,但互联网上没有绝对干净的模型。

我们需要更多独立机构对 Astra 做同样的测试,尤其是关闭 Provider Adapter、只给普通鼠标键盘接口来复现结果。在那之前,99.9% 可以当作一个振奋人心的信号,但别急着宣布大功告成。

接下来盯紧什么?

先看 OpenAI 是否会把 Provider Adapter 的能力通过 API 开放给开发者,再看其他实验室会不会用同样的模式在 ARC-AGI-3 上逼近满分。此外,ARC 的下一个版本是否会取消 Provider Adapter 也是个问题——如果满分太容易拿,那这项测试的鉴别力就会下降。

当然,最有趣的事情在于:当动作接口被优化到极致后,模型之间的差距会重新回到纯推理能力上。到那时,我们才会看到真正的江湖座次。

GPT-6 Astra 的这份答卷,最迷人的地方其实藏在两个分数的夹缝里。那是一条从“能思考”通往“会行动”的阶梯,平时总被忽略。模型迷茫时在 62.7%,从容时能到 99.9%,大脑还是同一个大脑,变的只是它把想法变成动作的流畅度。下一场 AI 竞赛,或许就从这个起点发令。

AI智能体
企业级AI智能体开发与部署方案
LumeValley打造企业级AI智能体全流程方案,涵盖需求洞察、定制开发、多平台适配部署。凭借专业算法与丰富经验,确保智能体精准理解业务,高效执行任务,无缝融入企业生态,为企业数字化转型提供强劲智能引擎,提升核心竞争力。
点赞 | 3

Lumevalley——全栈AI服务领航者,以“战略-应用-算力”三位一体服务框架,为企业提供从顶层战略规划、场景化AI智能体(AI Agent)开发/搭建/部署,到企业级AI应用开发、AI+行业场景解决方案的全链路服务,并配套AI大模型部署与高性能AI算力底座支撑,助力客户在营销、服务、运营等核心环节实现效率倍增与模式创新。

马上扫码获取产品资料
相关文章

相关文章

填写以下信息, 免费获取方案报价
姓名
手机号码
企业名称
  • 建筑建材
  • 化工
  • 钢铁
  • 机械设备
  • 原材料
  • 工业
  • 环保
  • 生鲜
  • 医疗
  • 快消品
  • 农林牧渔
  • 汽车汽配
  • 橡胶
  • 工程
  • 加工
  • 仪器仪表
  • 纺织
  • 服装
  • 电子元器件
  • 物流
  • 化塑
  • 食品
  • 房地产
  • 交通运输
  • 能源
  • 印刷
  • 教育
  • 跨境电商
  • 旅游
  • 皮革
  • 3C数码
  • 金属制品
  • 批发
  • 研究和发展
  • 其他行业
需求描述
填写以下信息马上为您安排系统演示
姓名
手机号码
你的职位
企业名称

恭喜您的需求提交成功

尊敬的用户,您好!

您的需求我们已经收到,我们会为您安排专属电商商务顾问在24小时内(工作日时间)内与您取得联系,请您在此期间保持电话畅通,并且注意接听来自广州区域的来电。
感谢您的支持!

您好,我是您的专属产品顾问
扫码添加我的微信,免费体验系统
(工作日09:00 - 18:00)
电话咨询 (工作日09:00 - 18:00)
客服热线: 18011747352
售前热线: 189 2432 2993
扫码即可快速拨打热线