IFM 发布 K2 Horizon 六款开源模型,覆盖 0.9B 到 375B-A23B 并开放完整训练生命周期

发布时间: 2026-09-04 文章分类: AI前沿技术
阅读量: 0
AI智能体
企业级AI智能体开发与部署
LumeValley提供全栈式企业级AI智能体开发与部署服务,涵盖战略规划、场景化开发、企业级应用构建、行业解决方案及算力支撑。从需求分析到持续优化,确保智能体高效稳定运行,助力企业实现智能化转型,提升运营效率与竞争力。

K2 Horizon 抛向社区的那一刻,最让我意外的不是参数表,也不是基准分数,而是 IFM 的坦诚:六个模型,全量开源,Apache 2.0,外加一条从预训练到智能体后训练的完整技术链路。在模型商们把“开源”做成橱窗摆设的今天,这种交底方式像一记重拳。36B-A4B 直接亮出了代号为 MoVA 的稀疏注意力架构,那些被刷屏的 SOTA 声明反而成了陪衬。我更想讨论的,是这家公司如何重新定义了“发布模型”——注意,不是“发布权重”。

一个模型是新闻,六个模型是一种生态宣言

模型全家桶:从 0.9B 到 375B,算力逻辑藏在数字背后

翻开参数表,K2 Horizon 的排布很有意思。375B-A23B 是总参数 375B、激活参数 23B 的大规模 MoE 模型;36B-A4B 是总参数 36B、激活参数 4B 的稀疏模型,并在此次发布中首次搭载了官方称为 MoVA 的稀疏注意力架构;其余 32B、7B、3.7B 与 0.9B 则覆盖了主流 Dense 模型的甜点区间。这张产品表把三层需求都照顾到了:云端顶级推理、端侧可部署的轻量任务、以及开发者自己折腾 Agent 工作流的中等模型。

注意激活参数的差异。同样是“大模型”,375B-A23B 在推理时只唤醒 23B 参数,能大幅降低单次请求开支。36B-A4B 更是把稀疏化推到了注意力层面。IFM 显然在赌一个方向:未来的模型竞赛不再比拼谁把参数堆得多,而是比拼谁能用更少的计算得到更多有用的注意力。

Apache 2.0 不是许可证,是武器

很多公司把开源当营销,条款里塞满限制:商用要申请,衍生要共享,甚至训练数据都要受约束。IFM 选了 Apache 2.0,等于告诉所有人:你们拿去用,拿去改,拿去商用,我不设路障。严格来说,Apache 2.0 允许后续版本闭源,也允许开发者把 K2 Horizon 集成进私有产品。这种尺度,在互联网大厂主导的模型生态里已经绝迹了。

直接把协议作为产品策略的一部分,魄力背后有商业逻辑:模型层竞争早已白热化,真正的价值在上层工具和场景。让模型成为公共基础设施,自己则依靠更底层的技术积累与对齐能力持续迭代——这才是 IFM 真正的算盘。

为什么小模型敢喊 SOTA,大模型却只谈能力

发布稿里最直接的口号是:0.9B、3.7B、7B 在各自规模上做到了 SOTA。小模型用户最在意能否在手机、树莓派或者边缘服务器上跑出效果,IFM 给了他们一个衡量坐标。至于 375B-A23B 和 36B-A4B,官方措辞明显更克制,重点落在“能力”和“效率”。

这种温差不是谦虚。大模型的性能边界高度依赖评测集、训练数据分布和后指令调优,与其抛出一个马上会被推翻的 SOTA,不如强调实际体验。小模型则不同,参数少、跑分差异容易量化,敢喊 SOTA 通常意味着在架构和数据层面做了真优化。换句话说,小模型 SOTA 是引流的钩子,大模型能力是留存的基石。

MoVA 架构:稀疏注意力正在变成新贵

被很多人忽略的 36B-A4B

这次发布里,最容易被人扫一眼就过去的其实是 36B-A4B。4B 激活参数容易让人误以为是一颗廉价小糖豆,可它的总参也有 36B。这意味着它走的是典型的 MoE 路线:模型记住了很多知识,每次计算只动用一小部分必要参数。而 MoVA 架构的加入,让方案比传统 MoE 更激进——把稀疏化思想从专家层延伸到了注意力模块。

注意力一变稀疏,长上下文的成本模型立刻改头换面。模型不再对每个历史位置都给予同样的计算预算,而是学会跳过无关内容,只在关键片段上投入细粒度运算。训练时的并行效率、推理时的显存占用、以及面对超长文本时的稳定性,都会因此产生连锁反应。

稀疏注意力如何改写 Agent 的工作方式

Agent 场景是最能放大这种变化的领域。K2 Horizon 系列既然公布了智能体后训练产物,就说明 IFM 盯上的不只是聊天窗口。Agent 在执行任务时要不断翻看旧对话、工具返回的 JSON 结构、代码仓库的上下文,这些内容堆叠起来,很快就会撑爆普通注意力的胃口。稀疏注意力让模型能在长文里“跳着读”,却仍然抓住关键关联。

落到生产环境,用户真正关心的不是跑分表,而是延迟会不会随着对话轮次一起膨胀。当 Agent 跑了十几轮之后,前置上下文越来越长,传统注意力机制的计算代价会陡峭上扬,MoVA 却可以让资源消耗保持在相对平缓的爬坡上。对长期运行自动化流程的团队来说,这比 0.5% 的准确率提升更关键。

真正让同行坐不住的,是那条完整训练链路

大多数开源模型发布只给权重和推理代码,附赠微调指令已经算客气。IFM 这次放出的,是从预训练到智能体后训练的全流程产物。你不只能拿来推理,还可以知道它是怎么被造出来的。训练配方、对齐策略、Agent 工具使用能力的塑造方式,全都摆在明面上。虽然企业级工程经验不可能全部浓缩在文档里,但骨架已经公开。

这条链路的价值怎么强调都不过分。过去,研究者想复现一篇 SOTA 论文,总会在数据配比和超参数上碰壁;想改进一条新的稀疏注意力路线,得花几个月从零搭起训练框架。现在 IFM 用真实权重做担保,把方法论摊在阳光下。学术界能从被动围观转为拆解、验证,再用自己的新思路去改装它。

开源模型的下半场:从刷榜到可复现的基建

SOTA 声明需要一条可复现的路

“0.9B 和 3.7B 的 SOTA 到底是不是真的?”以前这种问题只能靠信任,现在你可以自己动手查。因为 K2 Horizon 的训练产物不是藏在新闻稿里的感叹号,而是真实可得的资源。开源的意义也被推到了新位置:不光是免费用,更是可验证。

Benchmark 圈的猫腻早就不新鲜,测试集污染、评估脚本魔改、选择性汇报时有发生。完整开放训练链路,至少让刷榜的难度提高了。我们能检查数据配方,复盘对齐阶段,甚至自己重跑一条小巧的基线。IFM 没把 SOTA 当终点,反而把通往 SOTA 的路修成了公共走廊,这种做法的后续价值会超过模型的单点跑分。

社区的下一个动作:改写配方,而不是重复下载

开源模型生态正在发生位移。K2 Horizon 这类全套开源,让社区从“蹲守 checkpoint”变成“定制新模型”。企业可以拿 0.9B 版本做低功耗设备,把 36B-A4B 改造成垂直行业的私有 Agent;如果自己有算力,甚至可以从某条中间状态继续训练,不必每次都从零开始。当 Apache 2.0 把法律门槛降到最低,模型本身的重要性就让位给数据与场景。

回想前两年,我们还在为一个开放权重而欢呼。到了现在,如果谁只发权重而不给训练细节,使用者就会在心里打问号:你究竟藏了什么?IFM 把标准抬起来之后,其他玩家如果想继续留在开源阵营里,就必须跟上这一轮的透明化竞赛。

当“开源”被滥用时,IFM 的选择像一面镜子

当然也要泼一盆冷水。Apache 2.0 虽然宽厚,却并不等于公布全部训练数据;名字叫开源,主导权仍在一家公司手里。这种怀疑合理,但在当下的生态坐标里,IFM 已经比绝大多数厂商走得更远。如果非要用“只要没交数据就是假开源”的标尺去量,全世界恐怕没有几个项目能通过。

更务实的检验方式只有一句:换一拨人,拿着这些公开物料,能不能再造出同一个水准的模型?K2 Horizon 给出的回答是“能,但还需要足够的算力”。这句话本身就足够诚实。开源从来不是免费的承诺,而是一种把选择权还给使用者的姿态。IFM 不仅做出了这种姿态,还把实现它的台阶铺到了每个人脚下。接下来的戏眼,在于谁能真正踏上去,把这条路延伸向属于自己的方向。

AI智能体
企业级AI智能体开发与部署方案
LumeValley打造企业级AI智能体全流程方案,涵盖需求洞察、定制开发、多平台适配部署。凭借专业算法与丰富经验,确保智能体精准理解业务,高效执行任务,无缝融入企业生态,为企业数字化转型提供强劲智能引擎,提升核心竞争力。
点赞 | 59

Lumevalley——全栈AI服务领航者,以“战略-应用-算力”三位一体服务框架,为企业提供从顶层战略规划、场景化AI智能体(AI Agent)开发/搭建/部署,到企业级AI应用开发、AI+行业场景解决方案的全链路服务,并配套AI大模型部署与高性能AI算力底座支撑,助力客户在营销、服务、运营等核心环节实现效率倍增与模式创新。

马上扫码获取产品资料
相关文章

相关文章

填写以下信息, 免费获取方案报价
姓名
手机号码
企业名称
  • 建筑建材
  • 化工
  • 钢铁
  • 机械设备
  • 原材料
  • 工业
  • 环保
  • 生鲜
  • 医疗
  • 快消品
  • 农林牧渔
  • 汽车汽配
  • 橡胶
  • 工程
  • 加工
  • 仪器仪表
  • 纺织
  • 服装
  • 电子元器件
  • 物流
  • 化塑
  • 食品
  • 房地产
  • 交通运输
  • 能源
  • 印刷
  • 教育
  • 跨境电商
  • 旅游
  • 皮革
  • 3C数码
  • 金属制品
  • 批发
  • 研究和发展
  • 其他行业
需求描述
填写以下信息马上为您安排系统演示
姓名
手机号码
你的职位
企业名称

恭喜您的需求提交成功

尊敬的用户,您好!

您的需求我们已经收到,我们会为您安排专属电商商务顾问在24小时内(工作日时间)内与您取得联系,请您在此期间保持电话畅通,并且注意接听来自广州区域的来电。
感谢您的支持!

您好,我是您的专属产品顾问
扫码添加我的微信,免费体验系统
(工作日09:00 - 18:00)
电话咨询 (工作日09:00 - 18:00)
客服热线: 18011747352
售前热线: 189 2432 2993
扫码即可快速拨打热线