小米发布并开源 MiMo-V2.6 系列,扩展强化学习规模迈向自我提升

发布时间: 2026-09-22 文章分类: AI前沿技术
阅读量: 0
AI智能体
企业级AI智能体开发与部署
LumeValley提供全栈式企业级AI智能体开发与部署服务,涵盖战略规划、场景化开发、企业级应用构建、行业解决方案及算力支撑。从需求分析到持续优化,确保智能体高效稳定运行,助力企业实现智能化转型,提升运营效率与竞争力。

小米 MiMo 今天把 MiMo-V2.6 系列整体开源了。Pro 和 Flash 两个型号同时放出,都是原生全模态,权重和训练环境一并给到。官方稿件里最不安分的一句不是参数量、不是榜单名次,而是"探索 RSI 路径的关键一步"——递归自我改进。

一家做手机的公司谈 RSI,听上去越界。可正是这句越界的话,把这次发布和过去一年里那些例行公事的"我们又刷榜了"分开了。

Pro 和 Flash,不是同一家族的两个尺寸

Pro 负责把名字刻在榜单上

MiMo-V2.6-Pro 的坐标摆得很直白:Code Arena 的 WebDev 榜大约第 10,把范围缩到开放权重里,能排到第 3 上下;Artificial Analysis 的开放权重智能指数上,它坐到了头名。三个数字连起来看,意思很清楚——它不打算在"开源"这个小池子里自娱自乐,而是把脸伸到闭源旗舰那边去比。

两年前这事想都不用想。那时开源模型和闭源旗舰差着整整一代,榜单前列清一色是 API 生意。现在一家手机公司的模型团队能把名字挤进去,靠的不是情怀。

Flash 才是真正会被跑起来的那一个

按行业里通行的命名习惯,Flash 类模型不追极致分数,它追的是延迟、吞吐和单位成本。这类模型不出现在发布会的高光时刻里,它出现在 Agent 的循环调用日志里,出现在每小时几万次请求的账单上。

一个模型团队的工程水平,往往不看 Pro,看 Flash。Pro 能用更多算力、更长思考时间换分数,Flash 只能在紧巴巴的预算里做同样的事。两个型号同时开源,等于把自己的上限和下限一起摆出来了。

"原生全模态"这四个字,早就被用滥

业内叫"多模态"的模型很多,做法是把一个视觉编码器挂到文本模型旁边,中间接一层投影。这种拼装能跑通,但模态之间存在翻译损耗——图片被压成文本模型能咽下去的向量,信息在那一层就掉了。

"原生全模态"指的是从预训练阶段就把不同模态的数据混在一起喂进去,共用同一套参数去做对齐。差别不在演示视频里,在需要跨模态推理的任务上:看不懂图中表格的数字关系、听不出音频里的语气变化,都是拼装方案的老毛病。

RSI 不是宣传词,是成本结构问题

自我改进卡在哪,其实一直很清楚

RSI 的设想不复杂:模型提出改进方案,自己验证,自己迭代,人只在旁边看。真正卡住的是验证环节。模型能一口气生成一万个"更好的训练配方",但判断哪一个真的更好,得真金白银跑一遍。评估不能自动化,递归就断在半路上。

所以谈 RSI 的团队,最后都会落到两件事上:评估能不能被自动执行,以及单次训练的成本能不能低到让模型自己试错。这两件事都不是算法问题,是钱的问题。

训练环境开源,比给权重重要得多

权重放出来,你能拿它做推理、做微调、做产品。但你想知道它是怎么被训练出来的,权重不会告诉你任何事。数据配方、奖励设计、rollout 策略、超参搜索的路径——这些才是模型能力真正的来源,也通常是最不公开的部分。

这次小米把训练环境一起放出来,意义在这一层。想复现的团队不用再从零猜,能顺着现成的地图走一遍。对 RSI 这类需要反复迭代训练流程的方向来说,环境比权重值钱。

把 RL 步数和花销写进通稿,是另一种自信

官方给了 RL 训练成本、步数和多项评测分数。这三样东西里,最有信息量的是成本。步数告诉你训练规模,分数告诉你结果,只有成本能告诉你这条路走起来贵不贵、别家跟不跟得起。

愿意公开这个数字的团队不多。它容易被横向比较,也容易暴露训练效率上的短板。公布本身,说明小米 MiMo 认为这个数字拿得出手。

榜单的含金量,得拆开看

第 10 名和第 3 名说的不是同一件事

Code Arena 的整体第 10 名,意味着前面有过半是闭源旗舰。开放权重里的第 3 名,意味着还有两个同类型的模型排在它前面。前者说明差距在缩,后者说明开源阵营内部本身就在激烈竞争——这两个结论方向相反,一个给人信心,一个给人压力。

开放权重这张榜单,现在是混战

过去一年,开放权重模型的迭代速度快得有点失控。每隔几个月就有新模型在某个子榜单上反超,然后又被反超回去。没有谁的位置是稳的,也没有哪个团队能靠一次发布吃半年。

在这种节奏下,"登顶某个指数"的宣传价值在下降。真正拉开差距的是发布频率、工程稳定性和下游采用的广度——这些东西不会写进新闻稿里。

分数和手感之间那条缝

评测分数是平均值的游戏。它在大量题目上取平均,抹掉方差,也抹掉了"这个模型在某些任务上会突然犯蠢"这类信息。做产品的人早晚会撞上这条缝:分数漂亮,但接进 Agent 循环跑三天,工具调用开始在某个边界条件下错得离谱。

所以看到评测数字,正确的反应不是信或不信,是去问它测的是什么、谁出的题、有没有被优化过。

要不要跟,先算两笔账

权重免费,推理不免费

开源省下的是授权费,不是运营成本。一个全模态模型跑起来,显存、带宽、并发调度每一项都要真金白银。Flash 在这一点上的价值被低估了——它不是为了刷榜存在的,它是为了让你在同样的预算里多跑几倍的请求。

复现门槛削掉一层,但没有削平

训练环境公开,能让复现少走很多弯路。但从环境到结果之间,还有集群规模、数据版本、工程细节这些变量。小团队照着走,大概率能跑通,大概率复现不出同样的分数。这不是小米的问题,是所有开源训练流程的共同局限。

对研究者来说,一个可运行、可修改的训练环境,价值已经超过一份精确复现的承诺。你能在里面做消融、换奖励函数、试新的 rollout 方案——这才是搞研究的用法。

MiMo-V2.6 这次值得记住的不是分数,是它摊在明面上的那几样:训练环境、成本、步数,以及一句关于 RSI 的自我定位。这些东西不会立刻变成产品,但它们决定了这个系列半年后还有没有人愿意拿出来讨论。

AI智能体
企业级AI智能体开发与部署方案
LumeValley打造企业级AI智能体全流程方案,涵盖需求洞察、定制开发、多平台适配部署。凭借专业算法与丰富经验,确保智能体精准理解业务,高效执行任务,无缝融入企业生态,为企业数字化转型提供强劲智能引擎,提升核心竞争力。
点赞 | 24

Lumevalley——全栈AI服务领航者,以“战略-应用-算力”三位一体服务框架,为企业提供从顶层战略规划、场景化AI智能体(AI Agent)开发/搭建/部署,到企业级AI应用开发、AI+行业场景解决方案的全链路服务,并配套AI大模型部署与高性能AI算力底座支撑,助力客户在营销、服务、运营等核心环节实现效率倍增与模式创新。

马上扫码获取产品资料
相关文章

相关文章

填写以下信息, 免费获取方案报价
姓名
手机号码
企业名称
  • 建筑建材
  • 化工
  • 钢铁
  • 机械设备
  • 原材料
  • 工业
  • 环保
  • 生鲜
  • 医疗
  • 快消品
  • 农林牧渔
  • 汽车汽配
  • 橡胶
  • 工程
  • 加工
  • 仪器仪表
  • 纺织
  • 服装
  • 电子元器件
  • 物流
  • 化塑
  • 食品
  • 房地产
  • 交通运输
  • 能源
  • 印刷
  • 教育
  • 跨境电商
  • 旅游
  • 皮革
  • 3C数码
  • 金属制品
  • 批发
  • 研究和发展
  • 其他行业
需求描述
填写以下信息马上为您安排系统演示
姓名
手机号码
你的职位
企业名称

恭喜您的需求提交成功

尊敬的用户,您好!

您的需求我们已经收到,我们会为您安排专属电商商务顾问在24小时内(工作日时间)内与您取得联系,请您在此期间保持电话畅通,并且注意接听来自广州区域的来电。
感谢您的支持!

您好,我是您的专属产品顾问
扫码添加我的微信,免费体验系统
(工作日09:00 - 18:00)
电话咨询 (工作日09:00 - 18:00)
客服热线: 18011747352
售前热线: 189 2432 2993
扫码即可快速拨打热线