Claude Sonnet 5.5 进了 Code Arena 的 WebDev 榜单,1786 分,第三名。挡在前面的 GPT-6 Astra 是 1788——两分。在一张经常出现几十分跨度的排行榜上,这个差距小到近乎象征性。但真正值得琢磨的恰恰是这种象征性:它说明这一轮模型竞争的形态已经变了,没有碾压,只有贴身。
两分的差距,到底算什么
它不是考卷,是投票
Code Arena 的机制决定了它测的不是标准答案。用户拿到两个匿名模型的输出,投出更喜欢的那一个,分数由大量这样的两两对比累积而来。所以 1786 和 1788 描述的其实是同一件事:在人类评审眼里,这两个模型生成的网页,大多数时候分不出高下。注意是"大多数时候"——不是从不分高下,而是分高下的那些样本,不足以拉开身位。
误差、置信区间,以及那些没人念的小字
任何基于抽样投票的排名都自带误差。参与投票的题目在换,投票人的口味在漂移,模型版本在悄悄更新。几分之差很可能落在波动范围之内,下一轮数据进来名次就互换。把 1786 和 1788 当成胜负判决,约等于把天气预报里 51% 和 49% 的降水概率当成两种天气。榜单给出的是一张快照,不是一张判决书。
第三名是最难坐的位置
第一名的叙事是"领先",第二名的叙事是"紧咬",第三名两头都不占。抬头要盯着两个还差一口气的对手,回头要防身后一群分数贴着脚后跟的模型。更要命的是,第三名最容易被放进"第一梯队"这个筐里,然后被追问一个问题:那你凭什么让人换掉已经在用的那个?Claude Sonnet 5.5 现在面对的,正是这道题。
括号里的 xHigh,才是这次的关键变量
同一个名字,不同的推理预算
如今的前沿模型很少是单一配置,而是一组档位。低档位快速响应,高档位在给出答案之前允许模型消耗大量思考 token。这次进榜的 Claude Sonnet 5.5(xHigh),走的是后一条路。同一份权重,配上更大的推理预算,代码生成的完成度和自洽性会明显不同——榜单记录的是这个配置下的成绩,不是模型默认状态下的日常表现。
多烧的算力,买回了什么
复杂前端任务、长链路重构、跨文件的依赖梳理,这些场景里,想得久确实有用。模型会自己检查约束、发现前后矛盾、把方案推翻重来。问题是这笔账的另一半:延迟和成本。对交互式编码工具来说,等 40 秒和等 8 秒是两种完全不同的产品。分数高的那一档,未必是每天用得最多的那一档。
WebDev 为什么成了必争之地
前端是整个软件世界最容易被验证的部分
生成一个页面,浏览器一渲染就知道对不对。视觉结果是直接可见的,反馈闭环极短,不用跑测试、不用搭环境、不用等 CI。这种可验证性让 WebDev 天然适合做评测场:题目便宜、判分快、结果有说服力。也正因如此,几乎所有头部模型都会在这里刷一遍存在感。
但写得出组件,不等于交得出系统
真实项目里最难的部分从来不是那个按钮。是构建配置,是状态在几十个文件之间的流转,是升级依赖时炸出来的连锁反应,是三个月后接手代码的人能不能看懂。这些恰恰是榜单分数覆盖不到的地方。一个在 WebDev 上拿到 1786 分的模型,放进一个五万行的遗留仓库,表现可能完全是另一回事。
Anthropic 和 OpenAI,正在互相抄作业
分数为什么越挤越近
训练数据高度重叠,后训练方法几个月内就会扩散到所有玩家手里,评测集本身也逐渐饱和。当所有人都在同一批公开语料上打磨,在同一类偏好数据上做对齐,产出趋同几乎是必然结果。这不是谁不努力,而是赛道本身在收窄。名次变动越来越像微调,而不是反超。
那开发者到底该怎么选
能力差距缩到两分以后,选择依据就转移了。工具链成熟度够不够,长任务里会不会突然掉链子,上下文窗口在真实仓库里撑不撑得住,价格能不能接受,企业合规能不能过审。这些维度没有一张统一的榜单,但它们对团队的实际影响,远大于两分的排名差。
榜单之外,还有一张没被排出来的榜
每百万 token 的价钱,和用户愿意等的秒数
把 xHigh 档位的成绩拿去和别人的默认档位比,本身就不太公平。真正有意义的比较,是单位成本下的有效产出:花同样的钱,谁一次做对的概率更高,谁需要人来返工的次数更少。这张榜没人做,但它才是采购决策的现场。
真正的考试在周一早上
周一早上,需求文档躺在那里,仓库里还有半年前留下的技术债,产品经理在群里催进度。模型要在这个环境里证明自己,而不是在干净的评测沙盒里。1786 分是一个不错的起点,它说明 Claude Sonnet 5.5 有资格站上牌桌。至于它能不能留在你的工具列表里,还得看接下来几个月,它在真实提交记录里留下的痕迹。

