Artificial Analysis 刚发布的 Coding Agent Index,把编程智能体从"会写代码"拉到"能交付任务"的尺度上重新排了一遍。榜首写着 Claude Sonnet 5.5(max)——在 Claude Code 里跑到 68 分,全场最高。紧挨着这个数字的另一栏同样扎眼:单任务成本 14.19 美元,也是最贵的那一档。第一名和第一贵撞在一起,这张榜单就值得多看两眼了。
68分背后,那张账单才是真新闻
榜单把模型和外壳绑在一起打分
过去两年,编程能力评测基本是模型对模型的比试:给同一道题,看谁修得对。Coding Agent Index 换了个尺度——它测的是"一个装了模型的智能体,能不能把一整个任务从头做到尾"。这里的关键变量不止模型本身。系统提示怎么写、工具怎么调、上下文怎么压缩、失败之后怎么重试,全都算数。
所以榜首那句话里,"在 Claude Code 里"这几个字不能省。同一个模型换个外壳,成绩可能差出两位数。对使用者来说这其实是好消息:你手里的选项不只是换模型,还包括换编排方式、换工具链、换约束条件。
"max"档位买到的不是答案,是思考时间
括号里的 max 值得单独拎出来说。它通常意味着把推理预算拉满——更长的思维链、更多的自我检查、更高的重试上限。这些动作在单次调用里看不出来,累积到任务级别就是真金白银。
换句话说,68 分不是模型"聪明"到 68 分,而是它被允许花足够多的 token 去想、去试、去纠错,才堆到 68 分。同一个模型调到低档位,分数会掉,账单也会掉。榜单给的是天花板,不是默认值,更不是你会实际拿到的平均表现。
14.19 美元不是价格,是行为成本
很多人看到这个数字,第一反应是拿它去跟 API 的 token 单价做对比。这没什么意义。单任务成本是一连串行为的结果:读了几个文件、跑了几轮测试、在第几次失败之后回头重写、上下文超限后重新加载了多少内容。它衡量的是一段"工作过程"的价钱,而不是一次"调用"的价钱。
这也解释了它为什么比别家贵出一截。更贵的往往不是每个 token 的单价,而是它敢多想一步、多试一次。放在硬骨头上这是优点,放在改个字段名这种活上,就是纯粹的浪费。
便宜三倍,就真的亏三倍吗
平均分掩盖了任务分布的长尾
单个分数最大的毛病,是它把分布压成了一个点。真实的工程任务从来不是均匀的:大头是改字段名、补测试、调格式、拆函数,小头是跨模块重构、疑难并发、依赖地狱。前者便宜智能体就能干净利落地收拾干净,后者可能直接卡在那里转圈。
于是"平均每任务 14 美元"这种说法,对具体团队几乎没有指导价值。你的任务组合长什么样,决定了这张榜单里哪一行才跟你有关。别人的均值,可能是你的极端值。
成本曲线从来不是线性的
还有个更容易被忽略的点:任务难度往上走的时候,成本不是按比例涨的。简单任务上,各家智能体的差距可能只有几美分;一旦任务开始需要多轮试错,成本就会跳一个台阶。一次失败的重试,代价常常是成功那次的几倍。
真正该盯的不是平均成本,而是成本在你任务集上的尾部形状。少数几个任务吃掉大部分预算,这在智能体场景里是常态,不是意外。
有些活,弱小模型反而先到终点
反过来也成立。一个便宜智能体可能在简单任务上先跑完、先提交,而高配版本还在那里做额外的自我验证。多花的那部分钱换来的是稳定性,如果你的任务容错率高、有测试兜底、回滚成本低,那这笔稳定性溢价就等于白掏。
结论有点反直觉:贵不贵不该是选型的第一问。"这活值不值得多花钱"才是。把这两个问题混在一起,预算和效果会同时失控。
团队落地时,别照抄排行榜
先划任务边界,再挑模型
实操上,第一件事不是打开榜单,是把团队自己的任务清单摊在桌上。哪些是机械改动、哪些需要读懂半个仓库、哪些必须一次做对不能返工。分完类你会发现,能放心交给便宜智能体的比例,通常比拍脑袋想出来的高。
划完边界再回头看榜单,判断标准就变得很具体了:这个模型在我最贵的那一类任务上,能不能把失败率压下来。压不下来,它再便宜也是负资产——你省下的 token 钱,会以人工返工的形式还回去。
把"每任务成本"换成"每次合并成本"
单任务成本只是中间指标。真正进财务报表的是另一笔账:从任务开工到代码合并,中间总共花了多少钱、多少人工介入、多少返工轮次。一个 14 美元的智能体如果能一次过审,很可能比一个 4 美元、但总要人回头收拾的智能体划算。
所以要盯住"人参与的次数"。人一旦介入,成本结构就变了,人力的价格远高于 token 账单。排行榜不统计这一栏,但你的团队会。
混合编排比单押一个赢家更稳
最务实的做法不是选一个模型打天下,而是分层:便宜的干前置筛查、批量改动、测试补全;贵的留给高风险改动和它啃不动的硬骨头。路由规则可以先从简单启发式起步——动了几个文件、影响范围多大、有没有碰到核心模块。
榜单在这里的角色是备选池,不是判决书。它告诉你谁在天花板上最强,同时也告诉你爬到那层天花板得付多少钱。
下一个战场,是谁来给返工率打分
从答题能力到工程耐力
这轮榜单转向的意义,比具体名次更大。它等于承认了一件事:编程智能体的价值不在单点正确率,而在于能不能在一段真实工作流里坚持到交付。这个方向上还有一堆东西没被量化——上下文管理能力、在大型仓库里的导航效率、任务被打断之后能不能恢复、跑偏了会不会自己发现。
成本透明化会是硬需求
14.19 美元这个数字传播得这么快,是因为它头一次把"智能体干一次活值多少钱"摆到了台面上。接下来评测大概率会往更细的维度走:不只是平均成本,还有成本分布、超预算任务的占比、达到同样质量所需的最低预算。
对买方来说,这些比多几个准确率小数点有用得多。预算表不会因为你排第一就自动扩容,而工程团队最终要回答的,永远是同一道题:这笔钱花出去,换回来的是可合并的代码,还是一堆需要人重新收拾的半成品。

