1534 分,第 45 名。这是 Mistral Large 4 在 Code Arena 的 WebDev 榜上留下的第一个正经坐标。数字谈不上惊艳——榜首那几家早把分数线顶到常人看不懂的高度——但对比 Mistral Large 3 停在第 130 名的位置,这一代一口气往上蹿了 304 分。对一家把"欧洲的 OpenAI"写进融资材料的公司来说,这 304 分比发布会上任何漂亮话都更能说明问题:上一代 Large 在写代码这件事上,是真的掉过队。
第 45 名,尴尬但诚实
先看分差,再谈名次
Code Arena 的分数不是自评,是一局一局对打出来的相对值。1534 分意味着 Mistral Large 4 站在中上游的尾巴上,前面还压着四十多个对手,而且大概率是清一色的中美头部模型。
但如果只盯着"45"这个数字就下结论,等于没看懂这份成绩单。真正有信息量的是那两组差值:对 Large 3 是 +304,对 Medium 3.5 是 +271。同一家公司的两代产品之间拉开三百多分,在竞技型榜单上属于断层级别的变化,通常意味着架构、训练数据或后训练流程里至少有一项被推倒重来。
第 130 名是个什么概念
Mistral Large 3 排在 130 名,这个位置放在整个 WebDev 榜里已经接近"存在感稀薄"的区域。用户拿着它写前端,大概率会在第一次生成后就开始手动返工;企业把它接进 CI 流水线,生成的补丁需要通过人工复核的比例会高到让流程失衡。
把大型模型做到这个水平,问题不在参数规模。写网页代码对模型的考验集中在长上下文里的结构一致性、对框架版本细节的记忆,以及一次生成跨越多个文件的连贯性——这几项恰恰是纯堆算力堆不出来的。
中型模型的位置最难堪
Mistral Medium 3.5 落后 Large 4 足足 271 分。这个差距比很多人预想的要大。中型模型的卖点一直是"性价比甜点区",可一旦分差跨过两百分,甜点就变成了保质期很短的零食——便宜是真便宜,出错也是真出错,省下来的推理成本会以工程师时间的形式加倍还回去。
WebDev 这一关,测的不是刷题能力
投票制榜单的脾气
Code Arena 走的是人类偏好投票路线,和跑固定测试集的基准不一样。它不给标准答案,只让人在两个模型给出的结果里选一个更好的。这种机制会放大"第一眼观感"的权重:布局是不是干净、交互有没有明显 bug、样式有没有崩,评审往往几秒钟内就形成了判断。
好处是它很难被过拟合。坏处是它对那些"能跑但丑"的实现相当不友好,而后者在真实工程里并不少见。
前端代码为什么难以糊弄
让模型写一段快排,它有海量正确样例可以模仿。让它从零搭一个可交互的页面,它得同时管住 HTML 结构、样式层叠、状态流转和事件绑定,任何一处松动都会在浏览器里当场暴露。
更麻烦的是版本漂移。前端生态两三年就换一轮方言,训练数据里沉淀的旧写法会不自觉地从模型笔尖流出来。分数高的模型,往往不是更聪明,而是更克制。
单榜成绩的边界在哪里
WebDev 只是 Code Arena 的一个分区。一个模型在这个分区排 45 名,不代表它在算法竞赛、后端重构或者 SQL 优化上处于同一位置。拿单一榜单给模型定性,是行业里最常见也最省事的误读。
合理的用法是把排名当作筛选器,而不是判决书:先看它有没有进到"可以认真试一试"的区间,再拿自己的真实代码库去跑一轮。
法国人的算盘
主权 AI 叙事的保质期
Mistral 一直靠"欧洲自己的前沿模型"这张牌吃饭,政府采购、金融合规、工业客户的私有化部署,都是这套叙事的直接受益者。叙事能撑住的前提是模型本身别掉到二线。代码能力尤其敏感——它是开发者接触一家模型公司最直接、也最挑剔的入口。
Large 3 在第 130 名待着的那段时间,等于把开发者入口拱手让人。这次回到 45 名,勉强够把门重新打开,但离"欧洲旗舰"该有的位置还差着一截。
补课一年,补上了什么
304 分的涨幅不会凭空出现。行业里能凑出这种跳幅的路径就那么几条:换掉更干净的代码语料、在强化学习阶段专门针对可执行反馈做优化、或者干脆借力合成数据和执行沙箱反复试错。
Mistral 没有公布细节,外界也很难从分数倒推配方。能确定的是,这次升级的方向对了——它没有去追那些展示效果华丽、实际调用场景稀薄的能力,而是先把写代码这个硬指标补上。
45 名到底值多少钱
企业采购清单上看的是别的东西
真正掏钱的人很少问"你排第几"。他们问的是延迟能不能压到 200 毫秒以内、上下文能不能吃下整个仓库、私有部署要不要额外定制、许可证条款允不允许商用。这些问题的权重加起来,远超榜单上的十几个名次。
第 45 名在这里的作用只有一个:让对方的技术负责人愿意抽出半小时做一次 PoC。剩下的路,得靠模型自己在真实仓库里走完。
名次的边际效用正在变薄
榜单前三能换来发布会上的 headline,前十能换来开发者的试用意愿,从二十名往后,每往前挪一位带来的关注度几乎可以忽略。第 45 名和第 40 名之间的差别,对绝大多数团队来说感知不到。
这也是为什么头部厂商越来越懒得更新自己的榜单成绩——冲榜的投入产出比,早就不划算了。
下一次更新才是分水岭
Large 4 解决的是"能不能用",不是"好不好用"。真正的考验在下一代:如果 Mistral 能把这次的涨幅再复制一次,它就有资格重新挤进代码模型的第一梯队讨论;如果原地踏步,第 45 名就会成为这家公司代码能力的天花板,被人反复拿出来当参照物。
1534 分是个开始,不是结局。榜单每更新一次,坐标系就重画一次——现在还不到开香槟的时候。

