Artificial Analysis:Claude Opus 5.5 登顶 Coding Agent Index,但单任务成本升至 $13.04

发布时间: 2026-09-24 文章分类: AI前沿技术
阅读量: 0
AI智能体
企业级AI智能体开发与部署
LumeValley提供全栈式企业级AI智能体开发与部署服务,涵盖战略规划、场景化开发、企业级应用构建、行业解决方案及算力支撑。从需求分析到持续优化,确保智能体高效稳定运行,助力企业实现智能化转型,提升运营效率与竞争力。

66 分。Artificial Analysis 的 Coding Agent Index 换了个第一名——Claude Opus 5.5 在 Claude Code 的 max effort 档位下跑到 66,把上一代 Opus 5 的 60 分甩开整整 6 分。更值得琢磨的是,这不是某一项评测的偶然爆发:Terminal-Bench 4.0 拿到 63.1%,DeepSWE v1.1 是 68.4%,SWE-Atlas-QnA 66.4%。三项全涨,而且涨的不是同一种能力。

三个战场,没有一项是侥幸

终端里没有蒙对的空间

Terminal-Bench 4.0 这个名字听着枯燥,考的东西一点也不温柔。它把代理丢进真实终端环境,给一个目标,剩下的全靠自己:读目录、敲命令、看报错、修正方向。写错一条 shell 指令,整个环境当场给你脸色看。Opus 5.5 在这里拿到 63.1%。这类任务真正考验的不是模型能不能写出漂亮的代码,而是它在长链路里还能不能保持方向感——跑到第七步,还记不记得第一步的约束条件。max effort 在这里派得上用场,多出来的思考预算花在「下一步做什么」上,而不是「这句话怎么写得体面」上。

一个动手,一个动嘴

DeepSWE v1.1 和 SWE-Atlas-QnA 从两个方向夹击。前者是典型的仓库级修改任务:给一个真实 issue,模型得自己在文件树里定位问题、读懂上下文、交出一份能跑的补丁,68.4% 放在这个赛道上属于第一梯队。后者换了考法,偏问答,题目取自软件工程语料,看的是模型能不能把复杂系统的因果关系讲清楚——不生成代码,而是解释代码,66.4% 说明它在「说」这一侧同样没有短板。一个动手,一个动嘴,底子却是同一件事:对大型代码库的结构化理解。

三项齐涨,比单项登顶更值钱

单项冲高有很多办法。prompt 调优、针对性训练、挑一个对自己有利的测试集,都能把某个数字做上去。三项同时上涨,而且覆盖的是不同能力维度,信号的成色就完全不一样了。这说明 Anthropic 这一轮动的大概率不是表面功夫,而是底座层面的东西:训练数据、推理策略、工具调用的编排逻辑,三者里至少有一项发生了实质变化。对使用者来说,这比「又刷新了一个纪录」有参考价值得多。

max effort 的账,最后是谁来付

Artificial Analysis 这份榜单跟早期那些只看通过率的产品不一样。它把 token 用量和单任务成本一起摊开,摆明了要你自己算这笔账。

慢下来是要花钱的

Claude Code 里的 effort 档位,本质是给模型分配多少思考时间。max 意味着它会消耗大量 token 做内部推演,一次任务的响应长度可能是普通模式的数倍。分数好看,延迟和费用同步往上走。这不是缺陷,是设计上的取舍——用算力换准确率。问题只剩下一个:换得值不值。

贵不贵看任务,不看模型

一个任务如果本身值几十美元的人力成本,多花几美元让代理一次做对,这笔买卖明摆着划算。反过来,只是让模型帮你重命名一个函数、补一段注释文档,max effort 就是拿高射炮打蚊子。真正务实的用法是按难度分流:格式调整、小范围重构走快档;涉及跨模块依赖、并发竞争、难以复现的偶发 bug,才交给 max 慢慢磨。把 effort 当成随手可切换的旋钮,而不是默认打开的开关。

便宜模型一直在身后追

榜单越往上走,边际收益越薄。Opus 5 的 60 分已经能覆盖绝大多数日常编码场景,多出来的这 6 分买的是什么?是最难那一档任务上的成功率。这个溢价合不合理,不取决于模型本身,取决于你的工作里有多少任务属于「最难的那一档」。如果答案是「偶尔碰上」,多花的钱大概换不回等价的回报;如果答案是「天天如此」,这笔账很容易算平。

评测口径换了几轮,这次测的是会不会干活

从补函数到跑流程

几年前大家比 HumanEval,一个函数一个函数地补全。后来换成 SWE-bench,考仓库级修复。再往后,任务时长从几分钟拉长到几十分钟,模型得连续行动、自我纠错、中途调整策略。评测口径每换一次,背后都是产品形态迁移了一次。Coding Agent Index 这个名字本身就把答案写明了:它测的是 agent,不是 autocomplete。名字里那个 Agent 才是重点。

Anthropic 争的不是榜首

登顶对 Anthropic 的意义,不在于多一条营销素材。编码代理正在变成开发者接触大模型的第一入口,谁在这个入口上被默认选中,谁就握住了后续所有调用的分发权。Opus 5.5 的这 6 分,是往这个位置上加的筹码。榜单是手段,默认选项才是目的。

66 分不等于你的仓库能跑通

跑分与你的代码库之间隔着一条河

Terminal-Bench 的任务是人精心构造的:环境干净、依赖明确、目标清晰。你的 monorepo 不是。私有依赖、三年前没人敢改的构建脚本、只在生产环境复现的时序问题——这些东西在榜单里一个都不存在。63.1% 和 68.4% 能告诉你模型的天花板在哪,但它没法告诉你,它会在你的代码库里具体摔在哪一步。

重跑一次,数字会晃

代理评测的方差向来不小。同一个模型、同一个任务,换个随机种子、换个依赖版本,结果可能差出好几个百分点。6 分的领先幅度值得关注,但别把它当成跨不过去的护城河。真想下判断,拿团队最头疼的那几个 issue 做一轮私测,比看任何公开榜单都靠谱。榜单给的是方向,私测给的才是答案。

那这 6 分到底值多少

它意味着在最难的那批任务上,Opus 5.5 比它的前任更少半途而废。就这么多,也够了。编码代理的价值从来不是「每次都对」——那是不现实的期待——而是「卡住的次数足够少」。少卡一次,就少一次人工接管,少一次上下文重建。这 6 分,量的就是这个。

AI智能体
企业级AI智能体开发与部署方案
LumeValley打造企业级AI智能体全流程方案,涵盖需求洞察、定制开发、多平台适配部署。凭借专业算法与丰富经验,确保智能体精准理解业务,高效执行任务,无缝融入企业生态,为企业数字化转型提供强劲智能引擎,提升核心竞争力。
点赞 | 27

Lumevalley——全栈AI服务领航者,以“战略-应用-算力”三位一体服务框架,为企业提供从顶层战略规划、场景化AI智能体(AI Agent)开发/搭建/部署,到企业级AI应用开发、AI+行业场景解决方案的全链路服务,并配套AI大模型部署与高性能AI算力底座支撑,助力客户在营销、服务、运营等核心环节实现效率倍增与模式创新。

马上扫码获取产品资料
相关文章

相关文章

填写以下信息, 免费获取方案报价
姓名
手机号码
企业名称
  • 建筑建材
  • 化工
  • 钢铁
  • 机械设备
  • 原材料
  • 工业
  • 环保
  • 生鲜
  • 医疗
  • 快消品
  • 农林牧渔
  • 汽车汽配
  • 橡胶
  • 工程
  • 加工
  • 仪器仪表
  • 纺织
  • 服装
  • 电子元器件
  • 物流
  • 化塑
  • 食品
  • 房地产
  • 交通运输
  • 能源
  • 印刷
  • 教育
  • 跨境电商
  • 旅游
  • 皮革
  • 3C数码
  • 金属制品
  • 批发
  • 研究和发展
  • 其他行业
需求描述
填写以下信息马上为您安排系统演示
姓名
手机号码
你的职位
企业名称

恭喜您的需求提交成功

尊敬的用户,您好!

您的需求我们已经收到,我们会为您安排专属电商商务顾问在24小时内(工作日时间)内与您取得联系,请您在此期间保持电话畅通,并且注意接听来自广州区域的来电。
感谢您的支持!

您好,我是您的专属产品顾问
扫码添加我的微信,免费体验系统
(工作日09:00 - 18:00)
电话咨询 (工作日09:00 - 18:00)
客服热线: 18011747352
售前热线: 189 2432 2993
扫码即可快速拨打热线