小米把 MiMo-V2.6 Pro 的权重扔进开源池子那一刻,最坐不住的未必是国内同行。Artificial Analysis Intelligence Index 46 分,这个成绩放在半年前属于闭源前沿模型的专属座位,现在它挂在一个谁都能下载的模型名下,旁边站着 Claude Opus 5 和 GPT-5.6 Sol,而多数 Agent 基准上三者已经拉不开明显差距。开源与闭源之间那条被反复引用的分界线,正在被一次规模化强化学习的训练实践磨薄。
46 分,一个让闭源阵营不太舒服的数字
开源模型头一回挤进前排
过去两年,开源阵营追赶闭源前沿的节奏基本是"落后一代到一代半"。新模型发布时总能刷几个子项榜单,但拉到综合智能指数上,差距立刻显形。46 分打破的正是这个惯性。它不意味着开源已经追平,而是说明第一梯队里终于有了非闭源成员。梯队门槛一旦被跨过,后面的追赶就不再是"能不能"的问题,而是"多久"的问题。
变量不在参数,在训练方式
这次发布里最容易被忽略的一句话是"通过规模化强化学习训练"。参数规模早就不是秘密武器,谁都能堆。真正稀缺的是把强化学习推到足够大的规模,同时让训练过程不崩、不发散、不出现奖励作弊。这类工作没有捷径,靠的是工程细节的反复打磨。小米选择把这条路线摆到台面上讲,本身就是一种态度宣示:能力提升来自训练范式的推进,而非单纯的算力堆砌。
Agent 基准比对话榜单更难糊弄
聊天类榜单早已被刷得失去参考价值,多轮工具调用、长链任务规划、跨应用操作这些 Agent 能力,才是当下真正区分模型档次的考场。MiMo-V2.6 Pro 在多数 Agent 基准上与 Claude Opus 5、GPT-5.6 Sol 表现相当,这个结论比单纯的跑分更有分量。Agent 场景对模型的稳定性、指令遵循和容错能力要求极高,任何一环掉链子都会让任务直接失败。能在这个维度上贴近闭源旗舰,说明模型的下限被抬起来了。
Pro 立旗,Flash 干活
旗舰负责把上限说清楚
Pro 的使命很单纯:证明技术天花板在哪。它承担榜单压力、对标任务和技术声誉,是给研究者、评测机构和竞争对手看的。这类模型通常推理成本高、部署门槛高,短期内不会出现在普通用户的日常交互里。但它的存在决定了一家公司在大模型牌桌上的座次。
Flash 才是进你手机的那一个
真正改变使用体验的往往是低配那个版本。Flash 面向延迟敏感、成本敏感的落地场景,端侧助手、实时翻译、图像理解、系统级操作代理,都需要一个响应足够快、调用足够便宜的模型。小米的硬件盘子给了 Flash 别人羡慕不来的试验场。数十亿台设备构成的分发网络,让一个中等规模的模型也能获得惊人的真实调用量,而这些调用数据又会反哺下一轮训练。
全模态是地基,不是噱头
"全模态"这个词已经被用滥了。但放在手机、汽车、IoT 设备的语境里,它是刚需而非装饰。用户对着屏幕说话、拍一张照片、录一段环境音,设备需要同时理解文本、图像、音频甚至视频流。模型如果只擅长单一模态,系统就得在多个模型之间做拼接,延迟和错误率都会上升。MiMo-V2.6 从设计上就打通这些输入通道,对于要把 AI 塞进操作系统底层的厂商来说,这个选择是必然而非加分项。
权重一开放,竞争规则就换了
小米手里有什么别人没有的
纯模型公司做开源,收益主要来自声誉和生态位。小米多了一层:它自己就是这些模型的最大用户之一。模型开放之后,外部开发者贡献的微调、评测、漏洞报告和应用案例,都会间接改善自家产品的体验。这种"自用 + 开源"的双重身份,让开放权重的商业逻辑变得比单纯的公关动作扎实得多。
闭源前沿的护城河还剩多宽
护城河从来不是模型本身,而是围绕模型建立的服务能力:推理基础设施、企业级合规、稳定 SLA、工具链成熟度。开源模型可以逼近甚至追平能力上限,但在这些看不见的地方,闭源厂商依然占优。问题在于,当能力差距缩小到某个阈值以下,很多企业会开始重新算账。同样的 Agent 任务效果,一个按 token 付费,一个可以私有化部署,决策天平会往哪边倾斜并不难猜。
开发者的选择会形成复利
开源生态最强的机制在于复利。权重开放后,社区会自发完成量化、蒸馏、端侧适配、领域微调这些厂商自己做不完的工作。模型越好用,参与的人越多;参与的人越多,模型越好用。这个正循环一旦转起来,后来者想要撬动就很难了。MiMo-V2.6 Pro 拿出的这份成绩单,本质上是在给这个循环点火。
先别急着开香槟
跑分终究只是一张快照
基准测试的价值在于横向比较,局限也在这里。测试集是固定的,真实世界的任务分布变化无常;榜单分数高,不等于在混乱、模糊、充满干扰的输入下依然靠谱。Artificial Analysis 的指数设计相对严谨,但它依然是一个被精心构造的考场。46 分值得重视,不值得当成结论。
开源和能用之间隔着工程
下载权重只是第一步。推理吞吐、显存占用、长上下文稳定性、工具调用的失败恢复机制,这些东西不会写在发布博客里,却决定了一个模型能否真正进入生产环境。很多开源模型在 demo 阶段惊艳,在真实业务里因为一个边缘 case 反复翻车。MiMo-V2.6 是否能跨过这道坎,要看接下来几个月社区和企业的实际反馈。
下一轮交锋才是真考验
这一轮小米抢到了一个身位。但模型迭代的周期已经压缩到以季度计,今天的 46 分,半年后可能只是入场券。真正值得跟踪的是两个信号:Flash 在端侧设备上的实际渗透速度,以及社区基于开放权重长出来的应用形态。前者验证商业路径,后者验证生态生命力。牌桌上的位置从来不是一次发布就能锁定的,能持续跟住节奏的玩家,才有资格谈格局。

