66 分。Artificial Analysis 的 Coding Agent Index 换了个第一名——Claude Opus 5.5 在 Claude Code 的 max effort 档位下跑到 66,把上一代 Opus 5 的 60 分甩开整整 6 分。更值得琢磨的是,这不是某一项评测的偶然爆发:Terminal-Bench 4.0 拿到 63.1%,DeepSWE v1.1 是 68.4%,SWE-Atlas-QnA 66.4%。三项全涨,而且涨的不是同一种能力。
三个战场,没有一项是侥幸
终端里没有蒙对的空间
Terminal-Bench 4.0 这个名字听着枯燥,考的东西一点也不温柔。它把代理丢进真实终端环境,给一个目标,剩下的全靠自己:读目录、敲命令、看报错、修正方向。写错一条 shell 指令,整个环境当场给你脸色看。Opus 5.5 在这里拿到 63.1%。这类任务真正考验的不是模型能不能写出漂亮的代码,而是它在长链路里还能不能保持方向感——跑到第七步,还记不记得第一步的约束条件。max effort 在这里派得上用场,多出来的思考预算花在「下一步做什么」上,而不是「这句话怎么写得体面」上。
一个动手,一个动嘴
DeepSWE v1.1 和 SWE-Atlas-QnA 从两个方向夹击。前者是典型的仓库级修改任务:给一个真实 issue,模型得自己在文件树里定位问题、读懂上下文、交出一份能跑的补丁,68.4% 放在这个赛道上属于第一梯队。后者换了考法,偏问答,题目取自软件工程语料,看的是模型能不能把复杂系统的因果关系讲清楚——不生成代码,而是解释代码,66.4% 说明它在「说」这一侧同样没有短板。一个动手,一个动嘴,底子却是同一件事:对大型代码库的结构化理解。
三项齐涨,比单项登顶更值钱
单项冲高有很多办法。prompt 调优、针对性训练、挑一个对自己有利的测试集,都能把某个数字做上去。三项同时上涨,而且覆盖的是不同能力维度,信号的成色就完全不一样了。这说明 Anthropic 这一轮动的大概率不是表面功夫,而是底座层面的东西:训练数据、推理策略、工具调用的编排逻辑,三者里至少有一项发生了实质变化。对使用者来说,这比「又刷新了一个纪录」有参考价值得多。
max effort 的账,最后是谁来付
Artificial Analysis 这份榜单跟早期那些只看通过率的产品不一样。它把 token 用量和单任务成本一起摊开,摆明了要你自己算这笔账。
慢下来是要花钱的
Claude Code 里的 effort 档位,本质是给模型分配多少思考时间。max 意味着它会消耗大量 token 做内部推演,一次任务的响应长度可能是普通模式的数倍。分数好看,延迟和费用同步往上走。这不是缺陷,是设计上的取舍——用算力换准确率。问题只剩下一个:换得值不值。
贵不贵看任务,不看模型
一个任务如果本身值几十美元的人力成本,多花几美元让代理一次做对,这笔买卖明摆着划算。反过来,只是让模型帮你重命名一个函数、补一段注释文档,max effort 就是拿高射炮打蚊子。真正务实的用法是按难度分流:格式调整、小范围重构走快档;涉及跨模块依赖、并发竞争、难以复现的偶发 bug,才交给 max 慢慢磨。把 effort 当成随手可切换的旋钮,而不是默认打开的开关。
便宜模型一直在身后追
榜单越往上走,边际收益越薄。Opus 5 的 60 分已经能覆盖绝大多数日常编码场景,多出来的这 6 分买的是什么?是最难那一档任务上的成功率。这个溢价合不合理,不取决于模型本身,取决于你的工作里有多少任务属于「最难的那一档」。如果答案是「偶尔碰上」,多花的钱大概换不回等价的回报;如果答案是「天天如此」,这笔账很容易算平。
评测口径换了几轮,这次测的是会不会干活
从补函数到跑流程
几年前大家比 HumanEval,一个函数一个函数地补全。后来换成 SWE-bench,考仓库级修复。再往后,任务时长从几分钟拉长到几十分钟,模型得连续行动、自我纠错、中途调整策略。评测口径每换一次,背后都是产品形态迁移了一次。Coding Agent Index 这个名字本身就把答案写明了:它测的是 agent,不是 autocomplete。名字里那个 Agent 才是重点。
Anthropic 争的不是榜首
登顶对 Anthropic 的意义,不在于多一条营销素材。编码代理正在变成开发者接触大模型的第一入口,谁在这个入口上被默认选中,谁就握住了后续所有调用的分发权。Opus 5.5 的这 6 分,是往这个位置上加的筹码。榜单是手段,默认选项才是目的。
66 分不等于你的仓库能跑通
跑分与你的代码库之间隔着一条河
Terminal-Bench 的任务是人精心构造的:环境干净、依赖明确、目标清晰。你的 monorepo 不是。私有依赖、三年前没人敢改的构建脚本、只在生产环境复现的时序问题——这些东西在榜单里一个都不存在。63.1% 和 68.4% 能告诉你模型的天花板在哪,但它没法告诉你,它会在你的代码库里具体摔在哪一步。
重跑一次,数字会晃
代理评测的方差向来不小。同一个模型、同一个任务,换个随机种子、换个依赖版本,结果可能差出好几个百分点。6 分的领先幅度值得关注,但别把它当成跨不过去的护城河。真想下判断,拿团队最头疼的那几个 issue 做一轮私测,比看任何公开榜单都靠谱。榜单给的是方向,私测给的才是答案。
那这 6 分到底值多少
它意味着在最难的那批任务上,Opus 5.5 比它的前任更少半途而废。就这么多,也够了。编码代理的价值从来不是「每次都对」——那是不现实的期待——而是「卡住的次数足够少」。少卡一次,就少一次人工接管,少一次上下文重建。这 6 分,量的就是这个。

