Agent Arena 的榜单一更新,Claude Opus 5.5 (High) 就落在了第二名,净提升 +12.15%。排在它前面的只有 Claude Fable 5.1 (Max)。排名本身没什么好惊讶的,真正让人坐直的是紧挨着它的另一个数字:每任务中位价格 $1.31。在一个所有人都在比跑分的赛道里,一个把价格压到同水平六折以下的模型挤进前二,这件事比名次值得聊得多。
1.31 美元,把"同水平"三个字加了引号
便宜 64% 是什么概念
Arena 给的原文是"比同水平低 64%"。这句话往白了说,就是同一个能力档位里,别人收三四块,它收一块三。Agent 场景和聊天场景最大的区别在于调用量——聊天是一次对话一次成本,Agent 是一串工具调用、一串重试、一串自我校验,一个任务跑下来可能是十几次模型往返。单价乘以调用次数,才是你月底看到的账单。64% 的差距放在这种乘法结构里,不是省钱,是决定这个产品能不能上线。
从 Opus 5 到 5.5,价格连砍三刀
更有意思的是代际对比。Opus 5.5 (High) 比 Opus 5 (High) 低 40%,比 Opus 5 (Max) 低 56%。同一家族内部,性能往上走,价格往下掉,这条曲线在过去两年里并不常见。以往的经验是能力每上一个台阶,单价跟着抬一截,用户被迫在"能跑通"和"跑得起"之间做取舍。现在这个取舍正在被拆掉。背后的原因不难猜:推理成本在降,工程侧的优化在累积,而竞争压力让厂商不敢把省下来的钱装进自己口袋。
中位价这个口径,比平均价诚实
顺便说一下为什么这里用中位价而不是平均价。Agent 任务的成本分布是典型的长尾:绝大多数任务几分钟、几毛钱搞定,少数复杂任务能烧掉几十倍预算。平均值会被那几根长尾拉歪,中位数才能真正告诉你"一个典型任务要花多少"。$1.31 这个中位价,意味着你的产品在标准负载下的单位经济模型是可以算得清的——这对做预算的人来说,价值不亚于榜单上的那 12 个百分点。
Steerability 拿了第一,这比总分有意思
操控性到底是什么手感
分项信号里,Claude Opus 5.5 (High) 的 Steerability 排到了第一,+14.50%。这个词直译是"可操控性",但翻译丢了它的分量。它测的是:你让它别做某件事,它听不听;你给它加一条约束,它会不会在第三轮对话里忘掉;你要求它按某个格式输出,它会不会自作主张加点"贴心"的解释。做过 Agent 的人都知道,模型不够强可以靠拆任务补,模型不听话基本无解——你没法给一个随时跑偏的系统写可靠的编排逻辑。
分数咬得紧的时候,谁更听话谁赢
看榜单头部这几家,能力总分已经进入互有胜负的区间。差个百分之几,换个测试集就能翻盘。这种时候,真正的分野从"谁更聪明"滑向"谁更好管"。Steerability 登顶加上 64% 的价格优势,组合起来的信号很清楚:在高强度、多轮次、需要严格约束的生产环境里,这一个模型的性价比不是领先一点,是领先一个身位。
别把可操控性当成工程问题
很多人第一反应是"多写点提示词不就行了"。实际做过的团队会发现,提示词能补的是边界清晰的小问题,补不了模型本身的服从倾向。当你的 Agent 要接支付、要改数据、要对外发消息,一次越界就是一次事故。这类风险不是靠加班调 prompt 能消掉的,它得从模型层面就带着"愿意被约束"的属性。
榜单在测什么,以及它测不到什么
净提升分数不是绝对分
+12.15% 的"净提升"是个相对量,它描述的是这个配置相对于某个基线的进步幅度,而不是一个可以横向拿去跟别的榜对比的绝对能力值。读这类数字时得留个心眼:提升幅度大,可能因为起点低;提升幅度小,也可能因为已经接近天花板。把它当成趋势指标用没问题,当成选型唯一依据就容易踩坑。
账单里还有看不见的部分
每任务中位价只覆盖了 token 成本这一层。真实的生产账单里还躺着失败重试、超时兜底、人工介入、上下文膨胀带来的额外轮次。一个便宜但不稳定的模型,重试两次就把省下的钱花光了。所以 $1.31 这个数字的正确用法,是把它当作起点去乘你的成功率与重试系数,而不是当作终点直接写进财务模型。
便宜又能打,接下来会怎样
定价战往下压,压到哪一层
头部模型每任务价格压到一美元出头,直接把中间层挤没了。那些"能力还行、价格便宜"的定位正在失效——上面的人降价,下面的人没有别的牌可打。接下来一年,Agent 模型市场大概率会向两端收拢:一端是极致性价比的生产主力,一端是为特定高难度场景付溢价的特种部队,中间地带会越来越难站。
买方的问题换了
过去选模型,第一个问题是"它能不能做对"。现在这个问题正在变成"它做对一次要多少钱,以及它做错的时候我听不听得懂它的解释"。采购逻辑从能力评估转向单位经济加风险控制,这个变化比任何一次跑分刷新都更深刻地影响着产品路线图。
悬着的一问
Arena 的数据把 Opus 5.5 (High) 的坐标画得很清楚:第二名、+12.15%、$1.31、可操控性第一。剩下的问题不是技术问题,是商业问题——当性能差距被压到几个百分点以内,价格差被拉到六成以上,还有多少团队愿意为那几分能力多付三倍的钱。这个答案,会在接下来几个季度的 API 用量里自己浮出来。

