1587 分,第 30 名,Pareto 前沿之外。Arena 刚刚公布的这组数据,给 Claude Haiku 5.5 (High) 在 Code Arena: WebDev 的首秀定了个微妙的调子——不难看,但也远谈不上惊艳。多数人扫一眼标题就翻过去了,无非又是一个小模型刷榜没刷动的故事。可要是你正在写代码 Agent、正在为每个月的 token 账单头疼,这三个数字里的信息密度,比"第 30 名"这个排名本身高得多。
先说一句可能不太讨喜的判断:这是一份体检报告,不是判决书。而报告里最值得看的地方,其实不是分数,是型号名后面那个 High。
Pareto 前沿之外,究竟"外"在哪儿
它不排名次,它画的是性价比的等高线
把每个模型的跑分和它的调用价格放进同一张二维图,再把那些"没有对手能在更低价位上给出同样分数"的点连起来,得到的这条线就是 Pareto 前沿。线内的模型有个特点:想再便宜一分,就得掉分;想再涨一分,就得多掏钱。
落在线外的处境则是——市场上存在某个替代品,要么更省钱,要么更强,或者两头都占。所以"Arena 把 Claude Haiku 5.5 (High) 放在前沿之外",翻译成人话是:在这个价位段上,它有对手。而不是:它不行。
第 30 名和第 3 名的距离,可能比你以为的窄
代码评测榜单的头部向来拥挤。1587 分往上,常常每加几分就要跨过一个身位,而首秀名次对单点波动极其敏感——换一次采样、换一套提示词模板,重测出来的位置就可能挪动好几位。真正稳定的信号来自多次复测后收敛出的区间,不是首发那一枪。
Haiku 这条产品线的 KPI 里,从来没写过"屠榜"
Anthropic 给 Haiku 的定位一直很清楚:便宜、快、够用。它存在的意义,是让 Agent 循环里那些"看一眼文件、改一行配置、再确认一次"的琐碎步骤有个低成本的执行者。指望它在纯质量榜上压过 Opus 和 Sonnet,等于让短跑选手去跑马拉松还要求他拿第一。评判它的尺子应该是"每美元产出多少可用代码",而不是"绝对分数排第几"。
"High" 这两个字,信息量比分数大
推理强度,正从隐藏开关变成型号的一部分
过去调推理强度是 API 里的一个参数,藏在文档第三页。现在 Anthropic 干脆把它写进型号名,用括号标出来。这个动作本身就是信号:同一套权重、同一个模型,配不同的思考预算,跑出来的结果可以差出一个档位。Claude Haiku 5.5 (High) 考的是它的上限表现,不是默认状态。
同一套权重,两张账单
High 档意味着更多思考 token,也意味着更贵的单次调用。取舍很实际:如果整条流水线全是 High 档的 Haiku,成本优势会被吃掉一大截,甚至可能不如直接用低档位的更大模型。反过来,只在关键节点挂 High、其余环节走默认档,性价比曲线就完全是另一个形状。
选模型这件事,正在变成调配比
两年前工程师问的是"我该用哪个模型"。这个问题现在不够精确了,得问"哪一步用哪个模型、开哪一档思考强度"。模型在增加,档位在增加,组合空间是乘法级膨胀的。自由多了,认知负担也跟着涨。
WebDev 这条赛道,考的到底是什么
它测的不是补全一行,而是交付一个能跑的东西
这类任务通常要求模型从零搭出可交互的前端产物,结构、样式、状态、边界处理得同时在线。它对"局部正确"的容忍度极低,一个拼错的属性名就能让整页塌掉。所以分数分布往往比纯代码补全榜更陡,头部和腰部之间的落差也更真实。
首秀分数,别直接外推到你的仓库里
评测环境是干净的,需求是写清楚的,没有历史包袱。你的项目里则躺着三年前的遗留代码、没写文档的内部组件,还有一个只在周五下午复现的 bug。榜单分数说明的是能力上限,不是它在你的代码库里能拿到的平均分。把 1587 当成简历上的成绩,而不是入职后的绩效。
落到采购决策上,这条数据怎么用
先数一数你的 Agent 循环里有多少廉价步骤
打开日志,把一次完整任务拆开:真正需要"想清楚"的调用占多少,剩下的读取、改写、格式化、重试占多少。后面那部分占比越高,Haiku 档的价值就越大,哪怕它只排 30 名。不少团队的真实情况是,八成以上的调用根本用不着顶级模型。
盯下一次复测,别盯这一次首秀
首秀数据最大的用途是建立坐标,不是下结论。等它跑进多个榜单、等第三方用不同提示词复现,再来看它稳定落在哪个区间。Claude Haiku 5.5 这次在 Code Arena: WebDev 拿到的 1587 分,先记在本子上,别急着写进架构决策文档。
榜单每周都在变,前沿每周都在挪。今天第 30 名,下周可能就挤进去了。真正不变的是那道算术题——你愿意为每一次思考,付多少钱。

