K2 Horizon 抛向社区的那一刻,最让我意外的不是参数表,也不是基准分数,而是 IFM 的坦诚:六个模型,全量开源,Apache 2.0,外加一条从预训练到智能体后训练的完整技术链路。在模型商们把“开源”做成橱窗摆设的今天,这种交底方式像一记重拳。36B-A4B 直接亮出了代号为 MoVA 的稀疏注意力架构,那些被刷屏的 SOTA 声明反而成了陪衬。我更想讨论的,是这家公司如何重新定义了“发布模型”——注意,不是“发布权重”。
一个模型是新闻,六个模型是一种生态宣言
模型全家桶:从 0.9B 到 375B,算力逻辑藏在数字背后
翻开参数表,K2 Horizon 的排布很有意思。375B-A23B 是总参数 375B、激活参数 23B 的大规模 MoE 模型;36B-A4B 是总参数 36B、激活参数 4B 的稀疏模型,并在此次发布中首次搭载了官方称为 MoVA 的稀疏注意力架构;其余 32B、7B、3.7B 与 0.9B 则覆盖了主流 Dense 模型的甜点区间。这张产品表把三层需求都照顾到了:云端顶级推理、端侧可部署的轻量任务、以及开发者自己折腾 Agent 工作流的中等模型。
注意激活参数的差异。同样是“大模型”,375B-A23B 在推理时只唤醒 23B 参数,能大幅降低单次请求开支。36B-A4B 更是把稀疏化推到了注意力层面。IFM 显然在赌一个方向:未来的模型竞赛不再比拼谁把参数堆得多,而是比拼谁能用更少的计算得到更多有用的注意力。
Apache 2.0 不是许可证,是武器
很多公司把开源当营销,条款里塞满限制:商用要申请,衍生要共享,甚至训练数据都要受约束。IFM 选了 Apache 2.0,等于告诉所有人:你们拿去用,拿去改,拿去商用,我不设路障。严格来说,Apache 2.0 允许后续版本闭源,也允许开发者把 K2 Horizon 集成进私有产品。这种尺度,在互联网大厂主导的模型生态里已经绝迹了。
直接把协议作为产品策略的一部分,魄力背后有商业逻辑:模型层竞争早已白热化,真正的价值在上层工具和场景。让模型成为公共基础设施,自己则依靠更底层的技术积累与对齐能力持续迭代——这才是 IFM 真正的算盘。
为什么小模型敢喊 SOTA,大模型却只谈能力
发布稿里最直接的口号是:0.9B、3.7B、7B 在各自规模上做到了 SOTA。小模型用户最在意能否在手机、树莓派或者边缘服务器上跑出效果,IFM 给了他们一个衡量坐标。至于 375B-A23B 和 36B-A4B,官方措辞明显更克制,重点落在“能力”和“效率”。
这种温差不是谦虚。大模型的性能边界高度依赖评测集、训练数据分布和后指令调优,与其抛出一个马上会被推翻的 SOTA,不如强调实际体验。小模型则不同,参数少、跑分差异容易量化,敢喊 SOTA 通常意味着在架构和数据层面做了真优化。换句话说,小模型 SOTA 是引流的钩子,大模型能力是留存的基石。
MoVA 架构:稀疏注意力正在变成新贵
被很多人忽略的 36B-A4B
这次发布里,最容易被人扫一眼就过去的其实是 36B-A4B。4B 激活参数容易让人误以为是一颗廉价小糖豆,可它的总参也有 36B。这意味着它走的是典型的 MoE 路线:模型记住了很多知识,每次计算只动用一小部分必要参数。而 MoVA 架构的加入,让方案比传统 MoE 更激进——把稀疏化思想从专家层延伸到了注意力模块。
注意力一变稀疏,长上下文的成本模型立刻改头换面。模型不再对每个历史位置都给予同样的计算预算,而是学会跳过无关内容,只在关键片段上投入细粒度运算。训练时的并行效率、推理时的显存占用、以及面对超长文本时的稳定性,都会因此产生连锁反应。
稀疏注意力如何改写 Agent 的工作方式
Agent 场景是最能放大这种变化的领域。K2 Horizon 系列既然公布了智能体后训练产物,就说明 IFM 盯上的不只是聊天窗口。Agent 在执行任务时要不断翻看旧对话、工具返回的 JSON 结构、代码仓库的上下文,这些内容堆叠起来,很快就会撑爆普通注意力的胃口。稀疏注意力让模型能在长文里“跳着读”,却仍然抓住关键关联。
落到生产环境,用户真正关心的不是跑分表,而是延迟会不会随着对话轮次一起膨胀。当 Agent 跑了十几轮之后,前置上下文越来越长,传统注意力机制的计算代价会陡峭上扬,MoVA 却可以让资源消耗保持在相对平缓的爬坡上。对长期运行自动化流程的团队来说,这比 0.5% 的准确率提升更关键。
真正让同行坐不住的,是那条完整训练链路
大多数开源模型发布只给权重和推理代码,附赠微调指令已经算客气。IFM 这次放出的,是从预训练到智能体后训练的全流程产物。你不只能拿来推理,还可以知道它是怎么被造出来的。训练配方、对齐策略、Agent 工具使用能力的塑造方式,全都摆在明面上。虽然企业级工程经验不可能全部浓缩在文档里,但骨架已经公开。
这条链路的价值怎么强调都不过分。过去,研究者想复现一篇 SOTA 论文,总会在数据配比和超参数上碰壁;想改进一条新的稀疏注意力路线,得花几个月从零搭起训练框架。现在 IFM 用真实权重做担保,把方法论摊在阳光下。学术界能从被动围观转为拆解、验证,再用自己的新思路去改装它。
开源模型的下半场:从刷榜到可复现的基建
SOTA 声明需要一条可复现的路
“0.9B 和 3.7B 的 SOTA 到底是不是真的?”以前这种问题只能靠信任,现在你可以自己动手查。因为 K2 Horizon 的训练产物不是藏在新闻稿里的感叹号,而是真实可得的资源。开源的意义也被推到了新位置:不光是免费用,更是可验证。
Benchmark 圈的猫腻早就不新鲜,测试集污染、评估脚本魔改、选择性汇报时有发生。完整开放训练链路,至少让刷榜的难度提高了。我们能检查数据配方,复盘对齐阶段,甚至自己重跑一条小巧的基线。IFM 没把 SOTA 当终点,反而把通往 SOTA 的路修成了公共走廊,这种做法的后续价值会超过模型的单点跑分。
社区的下一个动作:改写配方,而不是重复下载
开源模型生态正在发生位移。K2 Horizon 这类全套开源,让社区从“蹲守 checkpoint”变成“定制新模型”。企业可以拿 0.9B 版本做低功耗设备,把 36B-A4B 改造成垂直行业的私有 Agent;如果自己有算力,甚至可以从某条中间状态继续训练,不必每次都从零开始。当 Apache 2.0 把法律门槛降到最低,模型本身的重要性就让位给数据与场景。
回想前两年,我们还在为一个开放权重而欢呼。到了现在,如果谁只发权重而不给训练细节,使用者就会在心里打问号:你究竟藏了什么?IFM 把标准抬起来之后,其他玩家如果想继续留在开源阵营里,就必须跟上这一轮的透明化竞赛。
当“开源”被滥用时,IFM 的选择像一面镜子
当然也要泼一盆冷水。Apache 2.0 虽然宽厚,却并不等于公布全部训练数据;名字叫开源,主导权仍在一家公司手里。这种怀疑合理,但在当下的生态坐标里,IFM 已经比绝大多数厂商走得更远。如果非要用“只要没交数据就是假开源”的标尺去量,全世界恐怕没有几个项目能通过。
更务实的检验方式只有一句:换一拨人,拿着这些公开物料,能不能再造出同一个水准的模型?K2 Horizon 给出的回答是“能,但还需要足够的算力”。这句话本身就足够诚实。开源从来不是免费的承诺,而是一种把选择权还给使用者的姿态。IFM 不仅做出了这种姿态,还把实现它的台阶铺到了每个人脚下。接下来的戏眼,在于谁能真正踏上去,把这条路延伸向属于自己的方向。

