Arena 的投票池里刚多了一位重量级选手:Mistral 的 Mistral Large 4 已经进入 Agent Arena,任何人现在都能上手测试并投票,分数要等一阵子才公布。纸面规格相当凶——1T 总参数、49B 激活,原生多模态,开放权重。同一时间它也在 Code Arena 的 WebDev、Text 和 Vision 三个赛道里摆上了台面。对一个长期被贴着“欧洲小而美”标签的团队来说,这次的动作不算小。
1T 参数的壳,49B 的芯
稀疏激活不是新概念,难的是把它稳住
1T 参数、49B 激活,意味着每次前向计算只动用总量的百分之五左右。这是混合专家(MoE)的经典玩法:把容量堆上去,把算力按住。道理谁都懂,难点从来不在路由器的设计,而在训练过程中专家负载能不能均衡——一旦路由塌缩,几个专家被反复调用,其余的在旁边看戏,模型规模就是虚的。能把激活比例压到这个量级、同时保住质量,才是真本事。
开放权重这四个字,分量在变
Mistral 一直是欧洲开源阵营的旗手,但把万亿级参数的权重放出来,意义和放一个 7B 小模型完全不同。过去两年行业默认的叙事是“开源等于落后一代”,现在这条线正在被反复擦掉重画。需要提醒的是,开放权重不等于免费,也不等于可以随意商用微调——许可条款、上下文长度、是否允许蒸馏,这些细节往往比参数表更能决定你能拿它干什么。
原生多模态,和后装一个视觉塔不是一回事
“原生”这个词被用滥了,但差别是实打实的。视觉编码从预训练第一天就参与进来,模型对图像的理解是内生的;而后接一个视觉塔的做法,本质是在语言模型的表征空间上做适配。差距在粗粒度任务上看不出来,一到细粒度就露馅:密集图表、UI 截图、扫描文档的版面还原,原生模型通常更稳。
Agent Arena 的分数,为什么值得等
投票制把评测变成了一场市场
Arena 的玩法是匿名两两对比、用户盲测投票,最后折算成 Elo 类分数。这套机制的好处是绕开了自动评测的作弊空间,代价是把话语权交给了早期用户样本。分数后置公布还有一个副作用:模型上线头几天的口碑会被放大,谁能先吸引到硬核玩家,谁就先拿到票。所以现在这个阶段,榜单空着不代表模型弱,只代表样本还在攒。
智能体跑分难做,难在哪
单轮问答的评测可以简单看答案对不对,Agent 不行。它要跑多步工具调用,错误会沿着链条累积;外部环境本身不稳定,同一条指令跑两次结果可能不一样;一次完整评测的 token 消耗和延迟都远超对话任务。可复现性差到一定程度,自动评测就没有公信力了——这也是为什么竞技场这类人类偏好投票机制,在智能体场景下反而更有说服力。
Code Arena 三线并测的用意
WebDev、Text、Vision,三个赛道对应三种截然不同的能力。WebDev 考的是生成和编辑前端代码,考验的是长上下文里的结构一致性;Text 是常规的代码生成与补全;Vision 则是看图写代码,从设计稿、截图甚至白板照片里还原逻辑。三线同时开测,等于把“这个模型到底适合干什么”这个问题拆成三个可以分别回答的小问题。
开发者的账本要重算一遍
开源与闭源的分界线在挪动
一边是万亿参数级别的开放权重,一边是头部闭源模型的持续涨价和配额限制。企业选型的天平上,数据主权、推理延迟、单位成本这三块砝码的重量正在变化。以前“开源”意味着性能妥协,现在这个前提至少值得重新验证一次。真正卡住很多团队的,反而不是模型能力,而是合规和运维。
49B 激活,部署成本并不温柔
别被“只激活 49B”骗了。激活参数决定计算量,但总参数决定显存占用——1T 参数的权重即使做激进量化,也不是一机一卡能轻松装下的量级。多卡互联、内存带宽、批处理调度,每一项都是真金白银。开源模型的“免费”,很多时候只是把账单从 API 调用费转成了电费、硬件折旧和运维人力。
先别下结论,也别干等分数
Agent Arena 的分数没出来之前,任何关于“谁更强”的断言都是猜。但有一件事现在就能做:注册、上手、在自己的真实任务上跑一遍。榜单分数衡量的是平均偏好,你的业务场景衡量的是能不能用。另外值得留意的是,Arena 的推文通常只给骨架,权重许可、上下文窗口、推理配置这些关键细节,往往要等 Mistral 官方渠道补齐。规格已经摆在这儿了,接下来看它扛不扛得住真实工作流。

