推理模型烧钱,行业吵了一年多。降 effort、砍思维链、换小模型——招数试了一圈,代价都指向同一处:准确率往下掉。Fireworks AI 放出的 Ember-1 换了个切法。它的基座是 Moonshot AI 开源权重的 Kimi K3,重做的是后训练。结果是推理 Token 少用了大约 40%,任务准确率却基本没动。
省下来的 40%,到底省在哪一环
不是让模型变懒,是让它别绕圈
推理模型吐出来的长串文字里,真正推进解题的往往只是其中一部分。剩下的是什么?把同一个假设换个说法再确认一遍,算完一次不放心再算一次,绕了三圈回到原点然后继续往前。Ember-1 盯的就是这些。
Fireworks 的说法很清楚:这不是简单地调低推理努力程度。调参数的做法等于给模型打镇静剂,它想得少了,难题上也就不想了。Ember-1 保住了自我反思——回头质疑自己的假设、发现矛盾后掉头——只削掉那些反复兜圈子的部分。区别听起来细,做起来极难,因为从外面看,有价值的反思和无效的循环长得一模一样,都是模型在自言自语。
要教会模型分辨,只能靠后训练
既然从输出层面切不开,那就得从偏好层面教。后训练的价值恰恰在这儿:给模型喂进大量"哪种推理轨迹更好"的信号,让它在生成过程中自己长出对冗余的敏感度。预训练阶段学到的是怎么想,后训练阶段调整的是怎么想得更经济。
这条路的好处是不动基座。不用重跑几万张卡,不用重新对齐,几天到几周就能迭代出一版。对一家要持续交付模型的团队来说,这种迭代速度比单次刷分重要得多。
Kimi K3 只是起点,不是重点
值得注意的是 Ember-1 选了一个开源权重的基座。K3 的权重公开,意味着任何有算力和数据的团队理论上都能照着这个思路自己走一遍。Fireworks 选择公开说明技术路径而不公开产物,这本身就说明了它认为护城河在哪里。
分数好看,但真正的证据在线上流量里
两个基准都挑了 token 消耗最凶的场景
Terminal Bench 2.1 和 DeepSWE 1.1,一个偏终端操作,一个偏软件工程任务。这两个方向的共同点是链路长、工具调用多、每一步都要重新读取上下文。Agent 类任务之所以贵,就是因为推理开销会沿着调用链层层累积。
Ember-1 在这两项上表现优于 K3 Max。这个结果有意思的地方不在于赢了几个点,而在于它是靠更少的推理 Token 赢的。通常模型想得越少、做得越差,这次两者没绑在一起走。
A/B 测试才是最难造假的数字
榜单可以针对性优化,生产环境的 A/B 测试不行。真实流量、真实的输入分布、真实的延迟约束,还有真实的任务失败率。Fireworks 提到 Ember-1 在生产 A/B 测试中带来了显著的成本节约。
把 Token 降幅换算成账单就明白这意味着什么。推理服务的计费基本锚定 Token,输出侧尤其贵,往往比输入贵出好几倍。推理模型的输出里,思维链是绝对大头。砍掉 40% 的输出 Token,对一个每天跑几十万次长链路 Agent 的团队来说,不是优化项,是能不能继续跑下去的开关。
冷静一点:它并没有更聪明
需要强调的是一个容易被忽略的事实——Ember-1 没有让模型获得更强的能力。它让同样的智力变得更便宜。这在商业上价值巨大,在能力曲线上却是一次平移,不是跃升。上限仍然是 K3 本身。
把这一点和"推理效率"混为一谈,是做技术选型时最常见的误判。你要的是一个更省钱的 GPT 级选手,还是一个更聪明的选手?这两个需求会把你引向完全不同的模型。
只给 API,不给权重,这步棋怎么算
研究预览是个精心设计的位置
Ember-1 目前只通过 Fireworks Serverless API 提供,标注为研究预览,权重不开放。这个定位让它同时拿到两样东西:真实的生产反馈,以及不承诺 SLA 和长期定价的自由。定价可以调,接口可以改,模型可以下架。
对 Fireworks 而言,这是最舒服的姿势。既把技术能力秀了出来,又把商业风险控在最低。真正让人好奇的是研究预览会持续多久,以及正式版会不会变成按 Token 分层的定价体系。
开发者的账要算两遍
短期看这是好事。同样一个任务,Token 少了,延迟低了,账单小了,接入还只是换个模型名的成本。尤其是已经在 Fireworks 上跑 K3 的团队,迁移几乎零摩擦。
长期看,锁定风险是实打实的。基座开源不等于产物开源。Ember-1 的后训练成果是 Fireworks 的资产,你不能下载、不能私有部署、不能在合规要求高的场景里自己托管。想复现,得自己准备偏好数据和算力,还要解决那个最难的问题:怎么定义"有用的反思"。
真正被压缩的是中间层
这类模型一出,最难受的不是基座厂商,也不是终端应用,而是夹在中间的那一层——既没有自己的基座能力,又没有把单位成本压到极致的工程能力,靠 API 转售和薄封装活着的服务。
当推理成本下降 40% 变成一件可以打包成 API 卖的事情,这一层的议价空间就被继续挤压。效率优化正在从"技术炫技"变成"基础设施标配",而标配意味着它不再能成为单独的卖点。
效率这根曲线,斜率才刚开始变陡
推理模型正在集体减肥
过去两年比的是谁的思维链更长、谁在奥数题上分数更高。风向已经转了。榜单还在,但采购决策里真正的权重正在往另一个指标上挪:完成一个任务要花多少钱。
Ember-1 提供的是一个可复制的模板——不动基座,只动后训练,把冗余从推理轨迹里挤出去。这个思路对任何手握开源权重的团队都成立,也意味着接下来半年里,类似的后训练产物会一批批冒出来。
省掉的是浪费,不是思考
整个行业在推理效率上绕了一大圈,试过剪枝、量化、投机采样、小模型蒸馏,最后发现有一条路一直摆在那里:模型大部分的昂贵开销,来自它自己都意识不到的重复。把重复去掉,思考本身不用打折。
Ember-1 不是一个能力突破,它更像一次对行业惯性提问的回答。当所有人都在比谁想得更多的时候,敢问一句"这些想法里有多少是白想的",反而更难。

