小米把 MiMo-V2.6-Pro 扔进 Agent Arena,拿回来的第一个数字是 +3.17%。不是跑分涨了三个点,是在 8.1K+ 场真实智能体会话里净胜出三个点。这个成绩在开源模型里排第 5,而它的上一代 MiMo-V2.5-Pro 排第 13,分数是 -7.23%。中间隔着九个名次,也隔着一次几乎推倒重来的工程活。同一份公告里还有一行更值得琢磨:Confirmed Success 提升 7.35%,开源第二。
先把那个负号抹掉
负分不是发挥失常,是模型在拖后腿
很多人第一眼会把 -7.23% 读成"上一代差一点"。不对。净提升为负,意味着这套模型接进智能体流程之后,整体任务表现比不接它还要糟。模型在对话里能说会道,一旦进入多轮工具调用、状态回传、错误重试的链路,就开始制造麻烦——调错参数、重复已完成的步骤、把工具的报错当成任务成功。这类损耗在日常演示里看不出来,只有在足够长的会话里才会累积成统计意义上的负数。
所以从 -7.23% 走到 +3.17%,真正被修掉的不是某一道题的正确率,而是一整类系统性毛病。净提升这个指标本身就很苛刻:做对的任务要减去做坏的任务,收益和破坏一起入账。一个模型可以靠"多做多错"把成功率刷得很漂亮,但净提升骗不了人。
九个名次,一半靠自己,一半靠别人
从第 13 到第 5,字数上只是九个位置,解释起来得分两半。一半是小米确实变强了,上一代那种"进了智能体环境就掉链子"的问题被压住;另一半是榜单本来的排位会在版本更替中来回晃,别的开源团队也在往前挤,谁停一步就掉两位。名次是相对量,分数才是绝对量。盯着第 5 名看,容易高估自己;盯着 +3.17% 看,才知道路还有多长。
Agent Arena 这把尺子,跟考试不是一回事
8100 场真实会话里藏着的东西
据 Arena 公布的口径,这 8.1K+ 场会话取自真实使用场景,不是人工构造的测试集。这个区别很要命。题库是干净的:题目边界清晰,输入格式规范,预期答案在写题的人脑子里。真实会话是脏的:用户说到一半改主意,复制粘贴进来一段带格式的表格,工具超时返回空值,上一步的中间结果被误当成最终答案。
模型在这种环境里的表现,和它在静态榜单上的表现常常不相关。有些模型能拿很高的推理分数,却在第一次工具报错之后就彻底跑偏。真实会话测的正是这条抗摔打能力,而抗摔打能力是智能体能不能上生产的分水岭。
Confirmed Success 比成功率更难刷
成功率这个说法太宽松。任务做了一半、关键步骤缺一个、结果看着像但要人工返工,都可能被算进去。Confirmed Success 加了一道确认:任务得被验证为真的完成,而不是"看起来完成了"。MiMo-V2.6-Pro 在这个更严的口径上提了 7.35%,开源第二——这个位置的含金量,比净提升第 5 更能说明问题。因为净提升看的是总体不亏,Confirmed Success 看的是收尾能力,后者恰恰是多轮智能体最容易崩的地方。
榜单也有它照不到的地方
得说句公道话:任何智能体榜单都有盲区。会话的构成比例没公开,任务难度分布没公开,用户画像没公开。一个模型可能在代码类任务上很强,在跨应用操作上一般,最终得分取决于这两类的配比。榜单还天然忽略成本和延迟——一个慢三倍、贵五倍但分数高一点的模型,在榜单上是赢家,在账单上是灾难。看榜的人如果只抄名次,等于把这些问题全跳过。
小米下的是双线棋
Pro 打硬仗,Flash 打密度
这次同时报了两个型号:MiMo-V2.6-Pro 和 MiMo-V2.6-Flash。命名方式已经把分工写明白了。Pro 面对的是长链路、多步骤、需要反复推理和修正的难任务,是拿来刷榜、也拿来啃硬骨头的;Flash 走的是另一个方向——响应快、单价低、能扛高频调用,负责把智能体塞进每天几百万次的小动作里。真正让智能体落地的往往不是 Pro,是 Flash 够不够便宜、够不够稳。
开源前五的座次,正在被重新洗牌
去看开源智能体这条赛道,前十里挤着好几家中国团队,彼此分差不大,版本一升就可能换位。这种密度下,"开源第二"之类的名次保质期很短,可能只有几周。它的价值不在于证明谁最强,而在于证明一件事:开源模型已经能在真实智能体场景里跑出正收益,不再只是闭源模型的廉价替代品。这个结论对整个生态的意义,比某个具体名次大得多。
小米手里那张别人没有的牌
小米做智能体模型,优势不在算法团队规模,而在落地面。手机、车机、家居、可穿戴,全在自家体系里,系统层到应用层的接口不用跟别人谈判。一个能被 Agent Arena 验证过的模型,可以立刻接入这些场景做闭环验证,拿回来的真实数据再喂给下一代训练。这个循环是纯模型公司很难复制的——它们有模型,但没有那么多让人每天真的去用的终端。
接下来该盯什么
分数之外,看长任务还稳不稳
短会话里的净提升三个点,不等于跨十步、二十步的任务就能保持。智能体的失败有个典型规律:步数越长,误差累积越快,前面多走一步弯路,后面要用三步去纠正。MiMo-V2.6-Pro 接下来的考题不在榜单上,在于任务步数翻倍之后,那个 +3.17% 会不会变成负数。这是所有智能体模型的共同天花板,小米不例外。
Flash 一个数字都没给,这才是悬念
整份公告里,Pro 的成绩写得很细,Flash 只有名字。这不太正常,也很有意思。要么 Flash 还在调整,要么它主打的场景本来就不在 Agent Arena 的测量范围内——如果它要跑的是本地设备上的轻量任务,那么推理速度、内存占用、端侧耗电这些指标,比一个云端会话榜单更有说服力。等 Flash 的数据出来,能看清小米到底是想拿开源名声,还是真想把这套东西铺进几亿台设备里。这个问题的答案,比第 5 名重要得多。

