小米 MiMo-V2.6-Pro 登上 Code Arena: WebDev 榜约第10名,开源权重中约第3

发布时间: 2026-09-22 文章分类: AI前沿技术
阅读量: 0
AI智能体
企业级AI智能体开发与部署
LumeValley提供全栈式企业级AI智能体开发与部署服务,涵盖战略规划、场景化开发、企业级应用构建、行业解决方案及算力支撑。从需求分析到持续优化,确保智能体高效稳定运行,助力企业实现智能化转型,提升运营效率与竞争力。

1628 分。这是小米 MiMo-V2.6-Pro 在 Code Arena 的 WebDev 榜单上留下的数字,AutoEval 口径下大致排在第十位。把范围收窄到开放权重模型,它坐到了第三把交椅。上一代 MiMo-V2.5-Pro 是 1475 分,中间隔了 153 分。数字不撒谎,但数字也不会解释自己——这 153 分是怎么挣来的,第十名在今天的编码模型江湖里又算个什么位置,得拆开慢慢看。

1628 分,先别急着鼓掌

第十名,和那个更硬的第三

总榜第十是个容易让人犹豫的位置。往前数,九家都在你头上;往后看,还有一大片。真正有信息量的其实是开放权重那一栏的第三——愿意把权重交出来的模型里,能压住 MiMo-V2.6-Pro 的只剩两家。开放权重模型这个赛道的密度,和闭源阵营完全不是一个量级,第十和第三放在一起看,才拼得出完整的位置感。

还有一点素材没交代:它前面是谁,后面差多少分。缺了对手名单,这个第十就只能当坐标,不能当结论。

153 分是个什么概念

1475 到 1628。模型迭代里,个位数的提升算调参,两位数是正常的版本推进,到了三位数,就得有个像样的解释。小米此前在 MiMo-V2.6 系列上提过一条主线:扩大强化学习的规模,往自我提升的方向走。这条路线如果真跑通了,编码能力的涨幅往往不是线性的,而是会在某个节点上突然跳一下。

153 分更像是跳了一下,而不是慢慢爬上去的。

AutoEval 这三个字不能省

成绩后面缀着 AutoEval,这不是装饰。榜单方用自动化流程跑出的分数,和人工投票、人工评审出来的分数,本来就是两套语言。自动化那套胜在可复现、可批量、成本低,代价是它测的是解题能力,不是人坐在电脑前的真实体验。

拿这个分数去比另一个口径下的分数,等于拿摄氏度和华氏度直接比大小。

Pro 和 Flash 一起发,两种活法

全模态,说的是接口能接住多少种东西

这一批两款都是全模态模型。这个词被用滥了,落到工程上其实很朴素:输入的模态别只认文字,输出的形态也别只给文本。截图、语音、视频帧进来,模型得接得住;该给图的时候给图,该给结构化结果的时候别硬凑一段散文。多模态能力在编码场景里尤其实际——前端还原设计稿、读报错截图、看一段录屏定位问题,这些活都不是纯文本模型擅长的。

Flash 才是要被真正调用的那个

Pro 负责把上限顶上去,Flash 负责日常。这个搭配在近一年的模型发布里越来越常见,原因也不复杂:Pro 级别的推理成本摆在那里,没人愿意为每一次按钮点击付那个价。真正会跑在生产环境里、每天被调用几百万次的,通常是轻量那一款。

所以 Pro 的成绩好看,Flash 的表现才决定这套东西能不能用起来。可惜这次放出的评测数据只覆盖了 Pro。

MIT 许可,比分数更难忽略的东西

权重是权重,配方是配方

开放权重和开源,中间隔着一整套训练细节。前者是把练好的模型交出去,后者还要附上数据配方、训练流程、超参设置。业界这几年把这两个词混着用,混得久了,很多人已经忘了区别。小米 MiMo-V2.6-Pro 走的是前一条路,权重放出来,能下载、能部署、能在自己的机器上跑。

对于绝大多数使用方来说,这就够了。真正需要那份配方的,是打算从头复现一遍的团队。

MIT 这三个字母,才是递出去的名片

许可证的选择比参数表更能说明态度。MIT 是宽松阵营里最宽松的那一档,商用、修改、再分发,几乎不设门槛。选它,等于提前放弃了后续拿授权条款卡人的可能性。

国内厂商在开源许可上向来谨慎,Apache 2.0 是常见选项,MIT 出现得少。小米这次按下这个按钮,传递的信号比 1628 分更直接。

换的不是口碑,是生态位

把模型放出去,短期账面收入是零。换回来的是开发者的默认选项:当一堆工具链、插件、微调版本都围绕某套权重生长起来,它的地位就不再由跑分决定了。这条路 Meta 走过,DeepSeek 走过,小米现在也在走。

区别在于,小米手里还有硬件和终端。模型和设备的配合,是别家给不出的组合。

榜单给不了的答案

WebDev 只是编码能力的一个切面

WebDev 测什么?大致是网页开发这一类任务。可编码这个词覆盖的范围太宽了——后端服务、数据库迁移、嵌入式固件、遗留系统重构,哪一样都不是写页面。在这张榜上拿高分,说明前端类任务处理得不错,仅此而已。

把它当成整体编码能力的代理指标,会高估;当成完全无关的数字,又会低估。

真正的对手,未必在这张榜上

Code Arena 收录的是愿意被评测的模型。那些没上榜的、内部版本、只对特定客户开放的,都不在名单里。开放权重阵营的第三,放在所有模型里是什么位置,没人能给准数。

对小米来说,眼下这一步的意义或许不在排名本身。两款模型同时落地、MIT 许可、全模态定位——这几件事凑在一起,说明它已经把模型能力当成基础设施在做,而不是当成发布会上的一个环节。分数会过期,基础设施不会。

AI智能体
企业级AI智能体开发与部署方案
LumeValley打造企业级AI智能体全流程方案,涵盖需求洞察、定制开发、多平台适配部署。凭借专业算法与丰富经验,确保智能体精准理解业务,高效执行任务,无缝融入企业生态,为企业数字化转型提供强劲智能引擎,提升核心竞争力。
点赞 | 18

Lumevalley——全栈AI服务领航者,以“战略-应用-算力”三位一体服务框架,为企业提供从顶层战略规划、场景化AI智能体(AI Agent)开发/搭建/部署,到企业级AI应用开发、AI+行业场景解决方案的全链路服务,并配套AI大模型部署与高性能AI算力底座支撑,助力客户在营销、服务、运营等核心环节实现效率倍增与模式创新。

马上扫码获取产品资料
下一篇: 没有了
相关文章

相关文章

填写以下信息, 免费获取方案报价
姓名
手机号码
企业名称
  • 建筑建材
  • 化工
  • 钢铁
  • 机械设备
  • 原材料
  • 工业
  • 环保
  • 生鲜
  • 医疗
  • 快消品
  • 农林牧渔
  • 汽车汽配
  • 橡胶
  • 工程
  • 加工
  • 仪器仪表
  • 纺织
  • 服装
  • 电子元器件
  • 物流
  • 化塑
  • 食品
  • 房地产
  • 交通运输
  • 能源
  • 印刷
  • 教育
  • 跨境电商
  • 旅游
  • 皮革
  • 3C数码
  • 金属制品
  • 批发
  • 研究和发展
  • 其他行业
需求描述
填写以下信息马上为您安排系统演示
姓名
手机号码
你的职位
企业名称

恭喜您的需求提交成功

尊敬的用户,您好!

您的需求我们已经收到,我们会为您安排专属电商商务顾问在24小时内(工作日时间)内与您取得联系,请您在此期间保持电话畅通,并且注意接听来自广州区域的来电。
感谢您的支持!

您好,我是您的专属产品顾问
扫码添加我的微信,免费体验系统
(工作日09:00 - 18:00)
电话咨询 (工作日09:00 - 18:00)
客服热线: 18011747352
售前热线: 189 2432 2993
扫码即可快速拨打热线