Agent Arena 刚刷新的榜单,Anthropic 把前三名全端走了。但真正值得你停下滑动手指的,不是这个。是 Claude Sonnet 5.5——净提升 +12.5%,排第三,单任务中位成本 $2.74,比排第二的 Claude Opus 5.5 贵了整整 73%,而 Opus 5.5 的得分还更高。于是 Sonnet 5.5 连 Agent Arena 的 Pareto 前沿都没进去。一个能力排名第三的模型,在性价比的坐标里被自己的同门挤出了局。
第三名没进 Pareto 前沿,比第一名更值得聊
Opus 5.5 在两个维度上同时压住了它
Pareto 前沿是个朴素到有点冷酷的概念。把成本放在横轴,把得分放在纵轴,凡是找不到另一个模型在两方面都不差、至少一方面更好的点,才算站在前沿上。Claude Sonnet 5.5 拿到的 +12.5% 净提升并不寒酸,第三名也不丢人。问题出在它的同门身上。Claude Opus 5.5 排第二,单任务中位成本 $1.58,比 $2.74 便宜了四成多,得分还更高。横轴纵轴同时被压住,Sonnet 5.5 就自动掉到了前沿线以内。这不是评分规则在针对谁,这是支配关系的数学结果。
排名回答"谁更强",前沿回答"谁值得买"
榜单排名是单维度的,谁分高谁靠前,干净利落。可真实的选型决策从来不只一个维度。当团队要为每天几十万次调用做预算时,第二名和第一名差多少分,往往没有"每任务多花一块多钱"来得扎心。Agent Arena 把 Pareto 前沿和排名并排放出来,其实是在提醒一件事:排名榜是给媒体看的,前沿图是给掏钱的人看的。Sonnet 5.5 恰好卡在两者之间——纸面上光鲜,坐标图上难看。
一块五和两块七之间,隔着一次架构判断
中位成本比平均成本更诚实
为什么榜单盯的是中位数,而不是平均值?因为 Agent 任务的成本分布尾长得离谱。少数任务会疯狂调用工具、反复重试、在长上下文里兜圈子,硬生生把平均值抬到一个谁都认不出的高度。中位数砍掉两头的噪音,给出的是"典型一次任务到底花多少钱"。$2.74 对 $1.58,说的是典型任务的账,不是极端情况的账。财务看预算表时的体感,更接近前者。
Agent 把每一次调用的差价乘以任务里的步数
聊天场景里,一轮对话通常就一到两次模型调用,成本差几毛钱没人计较。Agent 完全是另一回事。一个任务要拆成规划、检索、执行、校验,动辄十几次调用,有些还得跑分支重试。单次贵 73%,摊到整条链路上,放大倍数远超直觉。更麻烦的是,调用次数并不固定——任务越复杂,次数越多,差价被乘的次数也跟着涨。选型时只盯分数挑模型,很可能在三个月后的账单上补课。
真正的成本藏在失败重试里
报价单上写的是单次调用价格,实际支出里最贵的那一块,往往是一次没做对、重来一遍。Agent 任务失败不是回到起点,而是带着已经烧掉的 token 重新开始。一个稳定性差半档的模型,可能在纸面上更便宜,在真实流量里更烧钱。这也是为什么单任务成本比单位 token 价格更有参考价值——它已经把重试和纠错的代价揉进去了。
Chat 第一,Agent 第三,落差从哪来
+15.6% 的聊天冠军,考的是另一套本事
Sonnet 5.5 在 Chat 类目以 +15.6% 拿下第一,这个成绩单看很亮眼。聊天考的是指令理解、语气拿捏、上下文衔接,一次交互就能交付价值。模型在这条赛道上的表现,和对话质量强相关,和规划能力关系有限。同一个模型在 Chat 榜登顶、在 Agent 榜平平无奇,一点都不矛盾——两套评测考的压根不是同一种能力。
把事办完,靠的是长链条不崩
Agent 的难点从来不在单步聪明,而在于十几步之后还记得自己要干什么。工具调用的参数格式、失败后的重试策略、中间结果的校验、上下文窗口里的信息取舍,任何一环掉链子,整个任务就废了。这类能力对模型的要求更接近"稳定施工",而不是"即兴发挥"。Sonnet 5.5 在这个维度上被 Opus 5.5 压了一头,说明它更擅长把话说明白,而不是把活干到底。
前三名全是自家的,麻烦也一起包了
自家人抢自家人的位置
包揽前三,表面看是统治力,往深了看是产品线的内部挤压。Opus 5.5 更便宜、更强,直接把 Sonnet 5.5 顶出了 Pareto 前沿;而 Sonnet 5.5 在 Chat 类目又是第一。客户的采购逻辑会变得很直白:跑 Agent 用 Opus,做对话用 Sonnet。中间那层模糊地带被压没了。这对 Anthropic 未必是坏事,但它得比对手更早回答一个难题——同一家的模型怎么分工,才不至于互相踩脚。
前沿图上的每一个点,都是一次妥协
那条曲线上没有完美模型,只有不同的取舍。有人愿意为最后 5% 的分数多付一倍成本,也有人宁愿把分数降一点、把预算省一半。榜单只告诉你谁排第几,前沿图告诉你每个选择要付什么代价。做 Agent 产品的人真正需要的,是后一张图。
对手该盯的不是排名,是那条成本线
追分是一条没有尽头的路
盯着 +12.5% 和 +15.6% 去追,等于把自己绑在别人的节奏上。Agent 市场里真正稀缺的不是最强,是"够用且便宜"。前沿图上每一个点都是成本与能力的某种平衡,谁能在同等成本下把分数往上推一格,谁就能切走一块预算。这个赛道的胜负手,从来不在榜首,而在中段。
$1.58 才是需要盯住的那条线
Anthropic 前三的光鲜背后,$1.58 这个数字才是对手要啃的硬骨头。做到比它低,同时分数别太难看,就有生意可谈。低不下来,就得在别的地方——稳定性、工具生态、部署成本——找回差价。排名会每天都在变,成本曲线不会。谁把这条线往下压,谁就在下一版榜单上重新画前沿。

