Mistral Large 4 悄悄出现在 OpenRouter 的公测列表里,没有发布会,没有预热。规格却相当硬:1T 总参数、49B 激活,原生多模态,512K 上下文,最高支持 256K 输出。稀疏 MoE 这套打法 Mistral 早就用熟了,但把激活参数压到 49B 的同时把上下文拉到 512K,说明它在路由和注意力上做了实打实的工程改造,而不是简单堆卡。
真正让人停下来看一眼的是价格。前两周打五折:每 1M tokens 输入 $0.68、输出 $2.09,缓存命中只要 $0.07。49B 的激活规模撑起接近千亿级的输出质量,账单却落在中端区间。缓存价压到一毛钱以下,明显是冲着高频调用的 agent 和 RAG 流水线去的——上下文反复塞同一份文档的场景,成本几乎可以忽略不计。
不过 512K 输入配 256K 输出,这个组合的野心不在聊天框里。主流模型的输出上限普遍卡在 8K 到 64K,256K 意味着一次能吐出一整份长文档、一整个模块的代码,或者跑完一条几十步的推理链而不用来回拼接。这类需求过去要靠工作流编排硬凑,现在模型自己就能吃下。公测挂在 OpenRouter 而非自家平台首发,也耐人寻味:Mistral 要的不是品牌曝光,是开发者用脚投票的调用量。折扣只给两周,够不够把生产流量切过来,很快就有答案。

