一兆参数,四百九十亿激活。Mistral 把 Mistral Large 4 的公开预览版扔出来那一刻,参数表上最刺眼的其实不是那个「1T」,而是后面那个零头。代号 le Chonk——法语里对胖猫的爱称,2018 年那只网红肥猫的名字——听上去像个内部玩笑,可把它拆开看,玩笑背后是一笔相当清醒的账。现在模型能在 Mistral Studio 里试,权重得等到月底。先让人用,再交钥匙,这个顺序本身就值得琢磨。
一兆参数,只点亮 5%
稀疏不是省钱的技巧,是架构前提
混合专家的核心逻辑,是把「容量」和「算力」拆成两件事。总参数决定模型能装下多少知识,激活参数决定每生成一个 token 要烧多少浮点运算。1T 对 49B,比例大约 1 比 20,意味着每个 token 只走通二十分之一的网络。
这里有个常被混淆的点:省下来的是算力,不是显存。整个 1T 权重还是得老老实实装进集群,只是每次前向传播时大部分专家处于休眠。很多团队把 MoE 搬到自建机房时撞的第一堵墙,就在这儿。
49B 激活,卡在一条很有意思的线上
这个量级不上不下,恰好落在自建推理和多卡托管的分界处。比 7B、13B 那批小模型贵得多,又比全程激活的千亿稠密模型便宜不少。Mistral 过去的 Large 系列走的是稠密路线,这一代把激活量控制在这个区间,说明预算主要花在了容量和模态上,而不是一味堆推理开销。
代号 le Chonk 泄露的那点心思
Mistral 的命名一向偏工程味,突然开始卖萌,大概率是团队对自家模型体积的自嘲。但对写代码的人来说,代号毫无意义——有意义的是它出现在公开预览里。内部自用、内部评测、小范围试用,这些阶段都已经过去了。
「原生多模态」这四个字,已经被用烂了
差别藏在训练的那一刻
原生多模态,通常指文本、图像乃至更多模态从预训练阶段就在同一套参数里共同成长,而不是先训好一个语言模型,再外挂一个视觉编码器。后者的典型症状很具体:模型能给你描述图片,却很难在推理链条中真正把图片当作中间步骤来用。demo 上看不出差距,复杂任务上的出错方式会暴露一切。
先上 Studio,再交权重
预览版放在 Mistral Studio,等于先把产品体验交给开发者,把钥匙留在自己手里。对企业客户,这是一段观察期;对开源社区,这是一段倒计时。这种节奏 Mistral 用过不止一次——先证明有人愿意付钱,再把权重放出去换生态。次序反过来的公司,通常活得更累。
月底放权重,几个绕不开的问题
什么许可证?研究用途还是商用?量化版本几时跟上?一兆参数的模型,哪怕每次只激活 49B,下载和存储本身就是门槛。多数团队拿到权重也跑不起来,最后还是要回到托管推理。所以这一代的开放权重,象征意义可能大于实际部署价值——但对生态而言,象征往往更值钱。
开放权重是这家法国公司的护城河
它卡在两拨人中间
一边是 OpenAI、Anthropic、Google 这些闭源前沿实验室,一边是 Llama、Qwen、DeepSeek 这类密集迭代的开源阵营。Mistral 的活法很清楚:前沿能力上不落后太多,同时把权重交出去,让欧洲的企业、政府和国防客户手里始终有个不依赖美国供应商的选项。
谁会觉得不舒服
最难受的是那些两头不靠的中间厂商——既没有前沿闭源模型的品牌溢价,也换不来开放权重积累的生态忠诚度。反倒是云厂商乐见其成:模型越开放,托管需求越旺盛,算力账单越厚。
参数表之外,真正该盯的是三件事
推理成本最后落在哪个价位
定价还没公布。激活参数决定算力量级,1T 的显存占用决定部署门槛。如果 Studio 上的价格贴近中端闭源模型,这套组合相当有杀伤力;若与第一梯队旗舰同价,那就得在能力上正面对撞,没有退路。
欧洲主权叙事还剩多少空间
Mistral 的估值里,有相当一部分是「欧洲自己的前沿模型」这个位置给的。位置值钱,也有天花板——客户最终看的是能力。le Chonk 能不能在法语、德语这类非英语任务上守住优势,可能比它在公开榜单上多拿两分更重要。
社区跟进的速度
一个 1T 的开放权重模型落地,会立刻变成量化、蒸馏、微调的原料。如果月底放出的版本足够好用,接下来几周会冒出一批衍生模型和推理优化方案。这才是开放权重真正的复利,也是 Mistral 拿它换生态的底气所在。

