1628 分。这是小米 MiMo-V2.6-Pro 在 Code Arena 的 WebDev 榜单上留下的数字,AutoEval 口径下大致排在第十位。把范围收窄到开放权重模型,它坐到了第三把交椅。上一代 MiMo-V2.5-Pro 是 1475 分,中间隔了 153 分。数字不撒谎,但数字也不会解释自己——这 153 分是怎么挣来的,第十名在今天的编码模型江湖里又算个什么位置,得拆开慢慢看。
1628 分,先别急着鼓掌
第十名,和那个更硬的第三
总榜第十是个容易让人犹豫的位置。往前数,九家都在你头上;往后看,还有一大片。真正有信息量的其实是开放权重那一栏的第三——愿意把权重交出来的模型里,能压住 MiMo-V2.6-Pro 的只剩两家。开放权重模型这个赛道的密度,和闭源阵营完全不是一个量级,第十和第三放在一起看,才拼得出完整的位置感。
还有一点素材没交代:它前面是谁,后面差多少分。缺了对手名单,这个第十就只能当坐标,不能当结论。
153 分是个什么概念
1475 到 1628。模型迭代里,个位数的提升算调参,两位数是正常的版本推进,到了三位数,就得有个像样的解释。小米此前在 MiMo-V2.6 系列上提过一条主线:扩大强化学习的规模,往自我提升的方向走。这条路线如果真跑通了,编码能力的涨幅往往不是线性的,而是会在某个节点上突然跳一下。
153 分更像是跳了一下,而不是慢慢爬上去的。
AutoEval 这三个字不能省
成绩后面缀着 AutoEval,这不是装饰。榜单方用自动化流程跑出的分数,和人工投票、人工评审出来的分数,本来就是两套语言。自动化那套胜在可复现、可批量、成本低,代价是它测的是解题能力,不是人坐在电脑前的真实体验。
拿这个分数去比另一个口径下的分数,等于拿摄氏度和华氏度直接比大小。
Pro 和 Flash 一起发,两种活法
全模态,说的是接口能接住多少种东西
这一批两款都是全模态模型。这个词被用滥了,落到工程上其实很朴素:输入的模态别只认文字,输出的形态也别只给文本。截图、语音、视频帧进来,模型得接得住;该给图的时候给图,该给结构化结果的时候别硬凑一段散文。多模态能力在编码场景里尤其实际——前端还原设计稿、读报错截图、看一段录屏定位问题,这些活都不是纯文本模型擅长的。
Flash 才是要被真正调用的那个
Pro 负责把上限顶上去,Flash 负责日常。这个搭配在近一年的模型发布里越来越常见,原因也不复杂:Pro 级别的推理成本摆在那里,没人愿意为每一次按钮点击付那个价。真正会跑在生产环境里、每天被调用几百万次的,通常是轻量那一款。
所以 Pro 的成绩好看,Flash 的表现才决定这套东西能不能用起来。可惜这次放出的评测数据只覆盖了 Pro。
MIT 许可,比分数更难忽略的东西
权重是权重,配方是配方
开放权重和开源,中间隔着一整套训练细节。前者是把练好的模型交出去,后者还要附上数据配方、训练流程、超参设置。业界这几年把这两个词混着用,混得久了,很多人已经忘了区别。小米 MiMo-V2.6-Pro 走的是前一条路,权重放出来,能下载、能部署、能在自己的机器上跑。
对于绝大多数使用方来说,这就够了。真正需要那份配方的,是打算从头复现一遍的团队。
MIT 这三个字母,才是递出去的名片
许可证的选择比参数表更能说明态度。MIT 是宽松阵营里最宽松的那一档,商用、修改、再分发,几乎不设门槛。选它,等于提前放弃了后续拿授权条款卡人的可能性。
国内厂商在开源许可上向来谨慎,Apache 2.0 是常见选项,MIT 出现得少。小米这次按下这个按钮,传递的信号比 1628 分更直接。
换的不是口碑,是生态位
把模型放出去,短期账面收入是零。换回来的是开发者的默认选项:当一堆工具链、插件、微调版本都围绕某套权重生长起来,它的地位就不再由跑分决定了。这条路 Meta 走过,DeepSeek 走过,小米现在也在走。
区别在于,小米手里还有硬件和终端。模型和设备的配合,是别家给不出的组合。
榜单给不了的答案
WebDev 只是编码能力的一个切面
WebDev 测什么?大致是网页开发这一类任务。可编码这个词覆盖的范围太宽了——后端服务、数据库迁移、嵌入式固件、遗留系统重构,哪一样都不是写页面。在这张榜上拿高分,说明前端类任务处理得不错,仅此而已。
把它当成整体编码能力的代理指标,会高估;当成完全无关的数字,又会低估。
真正的对手,未必在这张榜上
Code Arena 收录的是愿意被评测的模型。那些没上榜的、内部版本、只对特定客户开放的,都不在名单里。开放权重阵营的第三,放在所有模型里是什么位置,没人能给准数。
对小米来说,眼下这一步的意义或许不在排名本身。两款模型同时落地、MIT 许可、全模态定位——这几件事凑在一起,说明它已经把模型能力当成基础设施在做,而不是当成发布会上的一个环节。分数会过期,基础设施不会。

