Text Arena 的榜首换人了,换得没什么悬念。Claude Opus 5.5 (High) 拿到 1509 分,第一次站到第一位,把上一代 Opus 5 (High) 甩开整整 18 分——那位前任如今排在第 11。更值得盯一眼的是第二到第六名:全部写着 Anthropic 的名字。这不是一个模型赢了,而是一家公司把同一张榜单的前六把交椅全占了。榜单这种事情,第一名天天换,但一支队伍霸占整条前排,说明的问题完全不一样。
1509 分,是一个什么量级的数字
榜首那 18 分,从来都不便宜
竞技榜的前排向来是贴身肉搏。Text Arena 用的是人类盲测投票,分数本质上是偏好的统计结果,越往上越挤。前十名之间的差距常常只有个位数,三五分的起伏,一半来自采样噪声,一半来自这一周投票的人心情好不好。在这种地方拉开 18 分,不是运气。它意味着在大量成对比较里,Opus 5.5 (High) 被选中的概率稳定地压过老版本,而且这种压制分布在各类问题上,不是靠某几个题材刷出来的。
当然,偏好投票有它自己的口味。回答更整齐、结构更清楚、话更少的模型,天然占便宜;真正难的任务,比如长链条推理和代码重构,在投票里被稀释掉了。所以 1509 分应该读成"人类更喜欢",而不是"更聪明"。这两件事高度相关,但不等价。
从第 1 到第 11,中间只隔了一个版本
Opus 5 (High) 拿 1491 分,落在第 11 位。这个位置放在一年前,大概能坐头把交椅。现在的处境是:前六名全是自家后辈,它连前五的门都摸不到。模型代际的半衰期就是这样,两三个季度足够把昨日的旗舰挤到中游。对那些还在按两年一升级的节奏做技术规划的团队来说,这个数字比任何行业报告都直白:你的采购周期,已经比模型迭代周期长了四倍。
换个角度看,这也解释了为什么推理档位(reasoning effort)会变成一个独立的营销位置。同一批权重,加更多的思考预算,分数就能往上拱一截——这种"软件层面就能涨分"的空间,正在被榨得越来越干。
前六被包揽,比登顶更值得琢磨
榜首只有一个位置,但第二到第六是五个位置。全占下来,意味着 Anthropic 的产品线里有一整排配置都能站上第一梯队:不同版本、不同推理档位,彼此之间还保持着几分到十几分的梯度。对竞争对手来说,压力不在于"打不过最强的那一个",而在于要面对一整个家族——你出一个新模型打赢了 5.5,第二名的 4.6 还在那儿守着。
这里有个细节挺有意思:Opus 4.6 (High) 以 4 分之差排第二,居然压在 Opus 5 (High) 前面。版本号不是实力排名,4.6 显然拿到了比 5 更近的一次更新。这对买模型的人是个提醒——别看着数字大小猜强弱,去看榜,去看自己的评测集。
"High" 这个后缀,藏着一整套成本账
同一个名字,其实是两种产品
带 High 的版本,指的是模型在回答前愿意花多少 token 去"想"。档位调高,思考链更长,复杂题目的正确率上去了,代价是延迟和账单一起上去。同一个 Opus 5.5,在低档位下可能是个反应利落的助手,在高档位下变成了一个慢半拍但更少犯错的解题机器。榜单提交的一般是最强配置,所以那个 1509 分,对应的是最贵、最慢的那一档使用方式,不是你随手调用 API 时的默认表现。
看榜的人容易忽略这一点,只记住分数。做工程的人不能忽略,因为线上系统里,延迟从 3 秒涨到 30 秒,产品形态就变了。
$16 的混合价格,算的是哪笔账
素材里给出的口径是"按每百万 token 输入/输出定价折算的混合价格",也就是输入价和输出价按某个假定的比例加权后的结果,Opus 5.5 (High) 落在 $16/MToken。这个数字本身不带比例假设就没什么意义——如果实际负载是输入占大头,真实成本会明显低于 16;如果输出主导,比如长文生成、深度推理,那 16 可能还算偏乐观。
放到行业坐标系里,$16/MToken 属于贵的。便宜的小模型能低到它的几十分之一,中间段的模型大概在个位数美元。但"贵"这件事要跟分数一起看才有意义:如果一个任务能一次做对,那 $16 比反复重试五次、每次两美元的方案便宜得多。推理成本从来不是单价问题,是单任务总成本问题。
Pareto 前沿不是奖状,是一张坐标纸
所谓进入 Pareto 前沿,意思是在"价格—分数"这张二维图上,找不到另一个模型比它更便宜且分数更高。Opus 5.5 (High) 现在站在这条曲线上,等于宣布:想拿 1500 分以上,你至少要付到这个价位。
但前沿是会移动的。对手降一次价、出一个新版本,原本的最优点可能一夜之间被包到曲线内侧,从"前沿"变成"只是贵"。前沿位置最大的价值不在于荣誉,而在于它给采购方提供了一条谈判基准线——想要这个分数,市场价摆在那里。
分数字典之外,选型的人到底在看什么
过了及格线之后,分数的边际效用掉得很快
对绝大多数业务流程来说,模型从 1400 分涨到 1500 分,用户感知不到;客服问答、摘要、分类这类任务,早在几年前就够用了。真正把分数变成钱的场景不多,但每一个都很重:多步工具调用、长上下文代码库改造、数学与理论物理这类硬推理。原文相关阅读里提到,同一个模型家族还在无人值守的情况下算出了 N=4 超杨-米尔斯理论的九圈散射振幅,把人类此前八圈的记录往后推了一格——这类活儿,分数差 15 分就是能不能干成的差别。
所以正确的读法不是问"1509 比 1495 强多少",而是问"我的任务落在曲线的哪一段"。落在平坦段,多花的钱买的是心安;落在陡峭段,省下的钱买的是返工。
同一张榜,三种完全不同的看法
能力上限看第一名的绝对分数,看的是技术天花板被推到哪儿了。性价比看自己预算区间附近那一小段曲线,谁在那儿最划算。稳定性则要反着看:翻历史快照,盯那些分数突然掉下来的模型——掉分往往意味着版本更新引入了回归,或者推理服务被悄悄改了配置。这三种看法对应三拨人:研究员、采购、运维。榜单只有一个,用它的人各有各的算盘。
企业选型还有一条不成文的规则:别把关键路径压在一个刚登顶的版本上。榜首模型的稳定性和文档通常要等一两个小版本才跟得上,而它前面的那个版本,往往已经开始打折了。
接下来该盯哪几件事
要打断这个局面,对手得拿出什么
逻辑上只有两条路:要么做一个分数超过 1505、价格不高于 $16 的模型,直接从前沿曲线上切一刀;要么在同样的分数上把价格砍掉一半,让 Opus 5.5 从"前沿"退回"高端"。前一条路难在能力,后一条路难在毛利。历史上这两种打法都出现过,前者通常来自实验室,后者通常来自算力成本更低的一方。
另一个变量是榜单本身。Text Arena 的投票人群会变,题材分布会变,新模型涌入之后难度基线整体上移。今天的 1509,三个月后可能只值 1480 的名次。所有分数都要加上一个有效期。
自家模型互相踩踏,也是一种成本
前六名同姓,看着风光,内耗也是真的。客户在 5.5、5、4.6 之间反复对比,工程团队为每个版本维护一套提示词和评测,模型下线的时间表越排越密,迁移成本被摊到每一次升级上。命名也跟着乱:4.6 排在 5 前面,这件事本身就说明版本号已经不再承载"谁更新更强"的信息了。
对 Anthropic 来说,真正的考验不是能不能继续霸榜,而是能不能让这张前六名单保持足够长的有效期,让掏钱的人敢于把生产系统压上去。榜单是给外人看的,留存率才是给自己看的。而对所有人来说,1509 这个数字最实际的意义,是它把"最强推理能力"的市场标价,暂时钉在了每百万 token 十六美元这个位置上。

