小米的 MiMo-V2.6-Pro 在 Artificial Analysis 智能指数上拿到 46 分,前代 MiMo-V2.5-Pro 是 26。接近翻倍,而且这是目前开放权重模型里的最高分——是最高,不是并列最高。真正值得琢磨的地方不在这两个数字,而在 Hugging Face CEO Clément Delangue 转发这条消息时那种"顺手一发"的姿态:开放权重这条线上,又有人把杆往上抬了一格。
26 到 46,翻倍的究竟是什么
智能指数不是一场单科考试
Artificial Analysis 那套指数的做法说穿了并不玄乎:把几组公开评测的成绩做完归一化再加权求和,覆盖推理、代码、数学、知识问答这几块。好处是横向可比,代价是掩盖偏科。所以看到 46 这个数字,第一反应不该是"小米模型变强了",而应该是"它在大多数科目上都没有明显塌方"。一个模型如果代码封神、数学掉队,复合分是爬不到这个位置的。
翻倍的速度,比翻倍本身更值钱
从 V2.5-Pro 到 V2.6-Pro,版本号只跳了一位,跨度却有 20 分。这种幅度的跃升,靠堆参数基本堆不出来,多半来自强化学习规模的扩大、数据配比的重做、后训练流程的返工——这些活儿不出现在发布会的 PPT 上,却是真正的分水岭。开放权重阵营过去常被说"慢半拍",眼下的情况是,这半拍正在被一点点抹掉。当然,46 分离闭源第一梯队还有明显距离,别急着喊超车。
开放权重内部的排序被打乱了
Code Arena 的 WebDev 榜上,MiMo-V2.6-Pro 大致在第 10 位附近,单看开放权重模型,大约第 3。这个位置挺微妙:综合分第一,垂直能力也进了前三。以往开放权重模型的常见剧本是"综合分好看,一碰具体任务就露怯",这次没这么明显。第 10 和第 3 之间的那段距离,往往就是"能录个演示"和"能上生产"之间的距离。
权重放出来之后,账要怎么算
部署成本才是那道隐藏门槛
Artificial Analysis 的榜单一向不只给智能分,还会给出每秒输出 token 数和每百万 token 的花费,这两个数字对开放权重模型尤其要命。权重是白给的,算力不是。同样一个 46 分,跑在 GPU 集群上和跑在两张消费级卡上,商业含义完全是两码事。企业评估这类模型的正确姿势,从来都是先拿自己手里的硬件压一遍吞吐,再看分数。
权重到手,和能跑起来,是两件事
下一个几十 GB 的权重文件不费劲。费劲的是量化、显存调度、推理框架适配,以及长上下文下的稳定性。开放权重最大的隐性成本就藏在这里——没有官方托管 API 兜底,所有工程债都得自己还。这也是为什么 Hugging Face 模型页的评论区里,总有一半人在问"多少显存能跑得动"。
那条转发本身就是个信号
Clément Delangue 的身份是 Hugging Face 的 CEO。他转一条模型发布推文,动作很小,含义不小。开放权重生态的分发入口早就固化了,HF 是必经之路。小米选择在这个时间点放开权重,等于直接接入了全球最大的一批微调者和应用开发者。传播效率比开一场发布会高得多,成本却低得多。
一家手机厂商,为什么非要自己造基座
端侧和云侧,都得攥着一张自己的牌
手机厂商做大模型,逻辑并不复杂。端侧要小参数、低延迟、隐私不出设备;云侧要能扛住助手类产品每天烧掉的推理成本。这两头如果全靠外部 API,议价权就是零。MiMo 这条线一路推到 V2.6,说明小米不打算只当调用方。
开源换来的不是钱,是位置
把权重放出去,短期内看不到直接收入。换回来的是开发者的手、研究者的引用,还有招聘时简历上的那点吸引力。Meta 靠 Llama 走过这条路,阿里靠 Qwen 也走过。路径本身不新鲜,新鲜的是执行质量——同样一套开源策略,有人做成生态,有人做成公告。
榜单之外,还有几件事没有答案
分数是快照,产品是长跑
评测跑一轮只要几个小时,产品上线要跑好几年。46 分能证明模型在标准题库里表现稳定,可真实用户的问题没有标准答案,还夹着错别字、方言和缺失的上下文。榜单是入场券,从来不是终点线。
真正的验证,得等第三方动手
官方数字永远该打折看。接下来几周值得盯的是三件事:独立机构能不能复现这个 46 分?社区微调版本多久冒出来?推理成本有没有可能压到能上量的水平?任何一环掉链子,热度退得都会比涨得还快。

