MiMo-V2.6-Pro 和 MiMo-V2.6-Flash 登陆 Agent Arena,分列开源模型第5和第9

发布时间: 2026-10-02 文章分类: AI前沿技术
阅读量: 0
AI智能体
企业级AI智能体开发与部署
LumeValley提供全栈式企业级AI智能体开发与部署服务,涵盖战略规划、场景化开发、企业级应用构建、行业解决方案及算力支撑。从需求分析到持续优化,确保智能体高效稳定运行,助力企业实现智能化转型,提升运营效率与竞争力。

小米把 MiMo-V2.6-Pro 扔进 Agent Arena,拿回来的第一个数字是 +3.17%。不是跑分涨了三个点,是在 8.1K+ 场真实智能体会话里净胜出三个点。这个成绩在开源模型里排第 5,而它的上一代 MiMo-V2.5-Pro 排第 13,分数是 -7.23%。中间隔着九个名次,也隔着一次几乎推倒重来的工程活。同一份公告里还有一行更值得琢磨:Confirmed Success 提升 7.35%,开源第二。

先把那个负号抹掉

负分不是发挥失常,是模型在拖后腿

很多人第一眼会把 -7.23% 读成"上一代差一点"。不对。净提升为负,意味着这套模型接进智能体流程之后,整体任务表现比不接它还要糟。模型在对话里能说会道,一旦进入多轮工具调用、状态回传、错误重试的链路,就开始制造麻烦——调错参数、重复已完成的步骤、把工具的报错当成任务成功。这类损耗在日常演示里看不出来,只有在足够长的会话里才会累积成统计意义上的负数。

所以从 -7.23% 走到 +3.17%,真正被修掉的不是某一道题的正确率,而是一整类系统性毛病。净提升这个指标本身就很苛刻:做对的任务要减去做坏的任务,收益和破坏一起入账。一个模型可以靠"多做多错"把成功率刷得很漂亮,但净提升骗不了人。

九个名次,一半靠自己,一半靠别人

从第 13 到第 5,字数上只是九个位置,解释起来得分两半。一半是小米确实变强了,上一代那种"进了智能体环境就掉链子"的问题被压住;另一半是榜单本来的排位会在版本更替中来回晃,别的开源团队也在往前挤,谁停一步就掉两位。名次是相对量,分数才是绝对量。盯着第 5 名看,容易高估自己;盯着 +3.17% 看,才知道路还有多长。

Agent Arena 这把尺子,跟考试不是一回事

8100 场真实会话里藏着的东西

据 Arena 公布的口径,这 8.1K+ 场会话取自真实使用场景,不是人工构造的测试集。这个区别很要命。题库是干净的:题目边界清晰,输入格式规范,预期答案在写题的人脑子里。真实会话是脏的:用户说到一半改主意,复制粘贴进来一段带格式的表格,工具超时返回空值,上一步的中间结果被误当成最终答案。

模型在这种环境里的表现,和它在静态榜单上的表现常常不相关。有些模型能拿很高的推理分数,却在第一次工具报错之后就彻底跑偏。真实会话测的正是这条抗摔打能力,而抗摔打能力是智能体能不能上生产的分水岭。

Confirmed Success 比成功率更难刷

成功率这个说法太宽松。任务做了一半、关键步骤缺一个、结果看着像但要人工返工,都可能被算进去。Confirmed Success 加了一道确认:任务得被验证为真的完成,而不是"看起来完成了"。MiMo-V2.6-Pro 在这个更严的口径上提了 7.35%,开源第二——这个位置的含金量,比净提升第 5 更能说明问题。因为净提升看的是总体不亏,Confirmed Success 看的是收尾能力,后者恰恰是多轮智能体最容易崩的地方。

榜单也有它照不到的地方

得说句公道话:任何智能体榜单都有盲区。会话的构成比例没公开,任务难度分布没公开,用户画像没公开。一个模型可能在代码类任务上很强,在跨应用操作上一般,最终得分取决于这两类的配比。榜单还天然忽略成本和延迟——一个慢三倍、贵五倍但分数高一点的模型,在榜单上是赢家,在账单上是灾难。看榜的人如果只抄名次,等于把这些问题全跳过。

小米下的是双线棋

Pro 打硬仗,Flash 打密度

这次同时报了两个型号:MiMo-V2.6-Pro 和 MiMo-V2.6-Flash。命名方式已经把分工写明白了。Pro 面对的是长链路、多步骤、需要反复推理和修正的难任务,是拿来刷榜、也拿来啃硬骨头的;Flash 走的是另一个方向——响应快、单价低、能扛高频调用,负责把智能体塞进每天几百万次的小动作里。真正让智能体落地的往往不是 Pro,是 Flash 够不够便宜、够不够稳。

开源前五的座次,正在被重新洗牌

去看开源智能体这条赛道,前十里挤着好几家中国团队,彼此分差不大,版本一升就可能换位。这种密度下,"开源第二"之类的名次保质期很短,可能只有几周。它的价值不在于证明谁最强,而在于证明一件事:开源模型已经能在真实智能体场景里跑出正收益,不再只是闭源模型的廉价替代品。这个结论对整个生态的意义,比某个具体名次大得多。

小米手里那张别人没有的牌

小米做智能体模型,优势不在算法团队规模,而在落地面。手机、车机、家居、可穿戴,全在自家体系里,系统层到应用层的接口不用跟别人谈判。一个能被 Agent Arena 验证过的模型,可以立刻接入这些场景做闭环验证,拿回来的真实数据再喂给下一代训练。这个循环是纯模型公司很难复制的——它们有模型,但没有那么多让人每天真的去用的终端。

接下来该盯什么

分数之外,看长任务还稳不稳

短会话里的净提升三个点,不等于跨十步、二十步的任务就能保持。智能体的失败有个典型规律:步数越长,误差累积越快,前面多走一步弯路,后面要用三步去纠正。MiMo-V2.6-Pro 接下来的考题不在榜单上,在于任务步数翻倍之后,那个 +3.17% 会不会变成负数。这是所有智能体模型的共同天花板,小米不例外。

Flash 一个数字都没给,这才是悬念

整份公告里,Pro 的成绩写得很细,Flash 只有名字。这不太正常,也很有意思。要么 Flash 还在调整,要么它主打的场景本来就不在 Agent Arena 的测量范围内——如果它要跑的是本地设备上的轻量任务,那么推理速度、内存占用、端侧耗电这些指标,比一个云端会话榜单更有说服力。等 Flash 的数据出来,能看清小米到底是想拿开源名声,还是真想把这套东西铺进几亿台设备里。这个问题的答案,比第 5 名重要得多。

AI智能体
企业级AI智能体开发与部署方案
LumeValley打造企业级AI智能体全流程方案,涵盖需求洞察、定制开发、多平台适配部署。凭借专业算法与丰富经验,确保智能体精准理解业务,高效执行任务,无缝融入企业生态,为企业数字化转型提供强劲智能引擎,提升核心竞争力。
点赞 | 75

Lumevalley——全栈AI服务领航者,以“战略-应用-算力”三位一体服务框架,为企业提供从顶层战略规划、场景化AI智能体(AI Agent)开发/搭建/部署,到企业级AI应用开发、AI+行业场景解决方案的全链路服务,并配套AI大模型部署与高性能AI算力底座支撑,助力客户在营销、服务、运营等核心环节实现效率倍增与模式创新。

马上扫码获取产品资料
相关文章

相关文章

填写以下信息, 免费获取方案报价
姓名
手机号码
企业名称
  • 建筑建材
  • 化工
  • 钢铁
  • 机械设备
  • 原材料
  • 工业
  • 环保
  • 生鲜
  • 医疗
  • 快消品
  • 农林牧渔
  • 汽车汽配
  • 橡胶
  • 工程
  • 加工
  • 仪器仪表
  • 纺织
  • 服装
  • 电子元器件
  • 物流
  • 化塑
  • 食品
  • 房地产
  • 交通运输
  • 能源
  • 印刷
  • 教育
  • 跨境电商
  • 旅游
  • 皮革
  • 3C数码
  • 金属制品
  • 批发
  • 研究和发展
  • 其他行业
需求描述
填写以下信息马上为您安排系统演示
姓名
手机号码
你的职位
企业名称

恭喜您的需求提交成功

尊敬的用户,您好!

您的需求我们已经收到,我们会为您安排专属电商商务顾问在24小时内(工作日时间)内与您取得联系,请您在此期间保持电话畅通,并且注意接听来自广州区域的来电。
感谢您的支持!

您好,我是您的专属产品顾问
扫码添加我的微信,免费体验系统
(工作日09:00 - 18:00)
电话咨询 (工作日09:00 - 18:00)
客服热线: 18011747352
售前热线: 189 2432 2993
扫码即可快速拨打热线