Arena 又更新了。Claude Opus 5.5 这次以 High 档位踩进 Agent Arena 第二名,净改进分 +12.15%,前面只剩 Fable 5.1 的 Max 配置挡着。消息短得只有一行,但信息量全在括号里——那个 High,比排名第二本身更值得说。
先把已知的东西摆正
能确认的只有三件事:上榜的是 Claude Opus 5.5 的 High 档,位置是 Agent Arena 第 2,净改进分 +12.15%,榜首是 Fable 5.1 的 Max 档。没有任务集细节,没有成本曲线,也没有失败样本的分布。信息稀薄的榜单,往往最容易被过度解读,所以先把边界画清楚再谈判断。
净改进分不是跑分,它在追问代价
这个名字比"准确率""通过率"更值得琢磨。听起来像是把"涨了多少"和"付出多少"放进同一个算式里算了个净值——Arena 没公开口径,可能是相对上一代模型,也可能是扣掉时间、token、调用轮次这些隐性开销之后的余额。不管是哪种,方向都一样:榜单不再只奖励"能做完",它开始追问"做完花了多大代价"。这跟两年前那张只看单轮回答质量的榜,已经是两种东西了。
High 打 Max,这场比较本来就不对等
同一张表里,两个条目的推理预算不一样。High 意味着还有更高的档位没启用,Max 基本是一个模型在当前框架下能给到的上限。所以这个第二名有两层含义。对 Anthropic 来说是好消息:带着余量拿第二,上限还没交出来。对读榜的人来说是提醒:名次是横向的,配置是纵向的,两个维度叠在一起,可比性比看上去脆弱得多。
12.15% 在 agent 场景里算大数字吗
放在传统问答基准上,两位数提升接近代际差距。到了多步任务里,门槛被抬高了——一条链上十个环节,每个环节 90% 的成功率,整条链跑通只剩三成多。所以 agent 场景里每一点提升都要在最容易崩的那一环上兑现。12% 的净改进,很可能对应着某些任务从"经常断在半路"变成"基本能收尾"的质变,而不是平均分上多涂了一层漆。
Agent 排行榜,可能是当下最难做的一张表
单轮对话的排行榜早就卷到没什么信息量了:题库泄漏、污染检测、针对性的微调,一轮轮下来,分数和真实体验的关联越来越松。Agent 评测重新变得有意思,是因为它把模型扔进了更接近上班的环境——要调工具、要走多步、要在中途自己判断方向对不对。
对话错一句,任务能错一串
聊天场景里的错误是局部的,答偏了换一句追问就能拉回来。Agent 不一样。工具调用的参数错一个字段,后面所有依赖它的步骤全部作废,而模型往往意识不到自己已经跑偏。这就让评测从"考知识"变成了"考稳定性":能不能在第八步还记得第一步的约束,能不能发现某个工具返回的结果明显不对劲然后停下来重试。
它奖励的是"会自己找活干"的模型
好的 agent 有个不太好量化的特征:不等人推。任务描述留了缺口,它会去补;工具没返回预期结果,它会换个路径再试一次;发现自己缺信息,它知道该问什么。这些行为在静态题库里几乎测不出来,只有把模型放进有状态的、会被自己前一步污染的环境里,才会浮出来。Agent Arena 这一类的榜单,本质上是在测这种"主动性",而不是测谁知道得多。
但评测环境也在被反向优化
这是所有公开榜单绕不开的宿命。一旦某个任务集成为行业标尺,它就会进入训练数据的视野,模型会朝着这个标尺的形状长。Agent 任务因为依赖工具和外部状态,比纯文本题抗污染一些,但也不是免疫的——工具名、接口习惯、常见的任务模板,都可能被记住。所以读榜的正确姿势不是看绝对分,而是看模型换代时的相对位移:同一个任务集上,两代之间的差值,比任何一版的绝对值都诚实。
手里有活儿的人,该怎么读这张榜
先看档位,再看名次
这是最容易被跳过的一步。一个模型在 High 档拿到第二,和它在 Max 档拿到第二,对你的账单影响可能差好几倍。选型的时候真正的问题从来不是"哪个最强",而是"哪个档位在我的预算内,稳定地把我这批任务做对"。如果 High 已经够用,那 Max 那一档的提升对你就是纯粹的成本项。
你自己的任务集,才是唯一的裁判
公开榜单能帮你把候选名单收窄,通常从几十个收到三五个,这一步很有价值。到这一步就该停了。把你的真实任务抽五十条出来,跑一遍,看成功率,也看失败的模式——是不知道停,还是乱调工具,还是走到一半把上下文弄丢了。这些信息在任何公共榜单上都找不到,但它们才是决定你能不能上线的因素。榜单告诉你谁值得试,试完的结果才告诉你能不能用。
接下来该盯的三件事
Opus 5.5 的 Max 档什么时候出现
如果 High 能站到第二,Max 的位置是个开放的悬念。它可能冲上榜首,也可能因为预算拉高之后稳定性反而下降——多步任务里,思考得更久不总是好事,有时候意味着在错误的方向上走得更远。这个答案比现在这次的第二名更有看头。
Fable 5.1 守得住吗
榜首被追到只差一个档位,接下来的迭代节奏会很说明问题。是继续拉高单模型的峰值,还是转向更低成本、更稳定的中档配置,背后是两种完全不同的产品判断。Agent 这个赛道到现在还没有出现公认的最优解,谁能把"稳定做对"和"便宜做对"同时做到,谁就拿到了下一轮的话语权。
至于 +12.15% 这个数字,它会很快被下一个版本覆盖。真正留下来的是那个括号里的 High——它说明这个赛道的竞争,已经从"谁的峰值更高"滑向了"谁在更低的预算下更靠得住"。这才是这次榜单更新里,唯一不会过期的那句话。

