蚂蚁百灵发布Ling-3.0-flash原生混合推理模型

发布时间: 2026-07-24 文章分类: AI前沿技术
阅读量: 0
AI智能体
企业级AI智能体开发与部署
LumeValley提供全栈式企业级AI智能体开发与部署服务,涵盖战略规划、场景化开发、企业级应用构建、行业解决方案及算力支撑。从需求分析到持续优化,确保智能体高效稳定运行,助力企业实现智能化转型,提升运营效率与竞争力。

蚂蚁百灵这轮更新有点疯狂。不是那种加了十倍预算砸出来的面子工程,而是一个总参数量124B、激活参数仅5.1B的模型,在推理、指令遵循和长文本任务上直接对标——有些地方甚至超过了——上一代旗舰Ring-2.6-1T。5.1B对1T,差了将近两个数量级,结果跑分不降反升。这件事本身就在挑战行业里那条默认规则:大就是好。

5.1B 凭什么叫板 1T

参数量的障眼法

先拆一个最容易误读的点。124B 是总参数量,5.1B 是激活参数量。什么意思?跑一次推理,真正被唤醒参与计算的只有 5.1B 个参数,剩下的全在“休眠”。这和传统的稠密模型完全不同——稠密模型每一次预测都要把所有参数跑一遍,121B 就得全量激活 121B。Ling-3.0-flash 用了一种极度稀疏的混合专家架构,1/64 稀疏 MoE,也就是说每一层有 64 个专家,但只选其中 1 个干活。推理成本直接打下来,速度上去了,但模型的“知识储备”却仍然保留在 124B 的容量里。这事不新鲜,新鲜的是它把稀疏程度推到了这么极端的比例,还能在性能上对齐稠密的 1T 模型。这意味着过去几年行业在 MoE 上的调参经验终于到了可以规模化兑现的阶段。

对标 Ring-2.6-1T,到底是哪些指标说了算

官方给出的信息很直接:传统推理、指令遵循、长文本。这三个维度恰好是第一代大模型落地时掉坑最多的地方。推理能力不够,Agent 连工具都调不明白;指令遵循差,流程一复杂就乱跳;长文本一跑偏,RAG 和多轮对话场景直接没法用。Ling-3.0-flash 在这三项上对齐甚至超越 Ring-2.6-1T,说明蚂蚁在 RLHF 后期的数据工程和偏好对齐上做了大量工作。更关键的是,这不是一个堆显卡堆出来的“平替”,而是用 5.1B 激活参数跑出来的效果。Agent 场景对延迟极度敏感,以前只能靠缩小模型牺牲性能来换速度,现在多了一种开口——小激活量、高吞吐、不降智商。

原生混合线性注意力,这名字值得多看两眼

为什么是“原生”,不是“改造”

行业里大部分混合注意力方案是在标准 Transformer 上打补丁:前几层用线性注意力,后面还是保留原始的自注意力,或者在特定层上做局部-全局切换。这种改法见效快,但训练不稳定,推理引擎适配成本高。Ling-3.0-flash 的“原生”意味着整个架构从设计之初就用线性注意力作为一等公民,而不是折中方案。原生混合线性注意力带来的直接好处是长输入下首 token 延迟大幅下降——官方透露 TTFT(Time To First Token)降低 60% 到 80% 以上。对实时对话、超长文档处理、代码库级任务而言,这个优化不是痒点,是命门。

Attention 的结构改造怎么影响 Agent 体验

Agent 推理有一个大家不怎么谈但很要命的问题:每次工具调用返回结果,上下文窗口都会膨胀。传统自注意力的计算复杂度随序列长度二次增长,上下文一长,响应就开始变慢,用户体感上就是“卡了”。混合线性注意力把长序列的计算复杂度压到近似线性,意味着模型在处理复杂 Agent 任务——反复调用 API、在多轮思考中来回检索信息——时,速度衰减不会那么剧烈。这才是它能做到 TTFT 降 60%-80% 背后真正的工程价值。不是跑分好看,是真实交互场景里不用再盯着光标转圈。

一万个训练环境到底练出了什么

10,000+ 可交互环境的强化学习意味着什么

大模型训练分两个阶段。预训练决定知识面,RL/post-training 决定行为模式。Ling-3.0-flash 这次在强化学习阶段扩展到了 10,000 个以上可交互训练环境,这个数字放在整个行业里都是惊人的。绝大多数团队在 RL 阶段的环境数量是两位数或者刚过百,因为维护环境、设计奖励函数、避免奖励 hacking 每多一个环境都是指数级增加的工作量。一万个环境不只是规模问题,它代表环境多样性达到了一个临界点——模型在训练中见过足够多的交互模式、工具形态和反馈方式,部署到真实场景时就不太会出现“没见过的工具就呆住”这种低级错误。

从跑分到 Agent,中间缺的那块拼图

过去一年 Agent 赛道特别火,但上线之后普遍反馈“不稳定”。核心原因就在 RL 阶段环境覆盖不足。训练环境少的模型,遇到稍微不同格式的 API 响应就会做出奇怪动作。一万个环境意味着模型在工厂里已经练过成千上万种交互变体,上手的泛化能力自然更强。蚂蚁这次把环境数量作为一个亮点单独拿出来讲,说明他们自己很清楚:Agent 时代,RL 阶段的环境工程与架构创新同等重要。再好的模型结构,如果没见过足够丰富的交互场景,面对复杂任务也是一张白纸。

开源加免费 API,这套打法在打什么算盘

124B 总参、5.1B 激活的开源诚意

蚂蚁这次的做法很干脆:开源,加免费 API。124B 的总参数意味着知识密度足够高;5.1B 的激活参数意味着部署门槛足够低。对中小团队来说,拉一个 124B 的稠密模型做本地推理,别说显存不够,连硬盘都吃力。但一个激活量只有 5.1B 的 MoE 模型,剩下的参数不打 tensors 就不占显存,服务器成本直接降一个量级。再配上免费 API,蚂蚁显然不是在做技术 demo,而是在铺生态。这种策略逻辑和当年的 Android 开源一模一样:核心能力我开放,生态养成之后商业化路径自然打开。

低成本跑强 Agent,这个决策窗口有多长

想要跑强 Agent 的团队现在面临一个难得的窗口期。一方面,5.1B 激活参数的推理成本已经低到可以让 Agent 做密集的工具调用而不心疼预算;另一方面,开源意味着可以进行私域微调,把模型吃透自己的业务数据。蚂蚁抢先一步把 Ling-3.0-flash 推到开源和免费两条线上,本质是在用工程效率换生态加速度。但窗口不会永远开着——上游架构创新的红利正在快速向应用层释放,谁先在这个窗口期里跑通 Agent 的闭环,谁就有机会定义下一阶段的交互标准。犹豫的成本比试错的成本高得多。

AI智能体
企业级AI智能体开发与部署方案
LumeValley打造企业级AI智能体全流程方案,涵盖需求洞察、定制开发、多平台适配部署。凭借专业算法与丰富经验,确保智能体精准理解业务,高效执行任务,无缝融入企业生态,为企业数字化转型提供强劲智能引擎,提升核心竞争力。
点赞 | 97

Lumevalley——全栈AI服务领航者,以“战略-应用-算力”三位一体服务框架,为企业提供从顶层战略规划、场景化AI智能体(AI Agent)开发/搭建/部署,到企业级AI应用开发、AI+行业场景解决方案的全链路服务,并配套AI大模型部署与高性能AI算力底座支撑,助力客户在营销、服务、运营等核心环节实现效率倍增与模式创新。

马上扫码获取产品资料
相关文章

相关文章

填写以下信息, 免费获取方案报价
姓名
手机号码
企业名称
  • 建筑建材
  • 化工
  • 钢铁
  • 机械设备
  • 原材料
  • 工业
  • 环保
  • 生鲜
  • 医疗
  • 快消品
  • 农林牧渔
  • 汽车汽配
  • 橡胶
  • 工程
  • 加工
  • 仪器仪表
  • 纺织
  • 服装
  • 电子元器件
  • 物流
  • 化塑
  • 食品
  • 房地产
  • 交通运输
  • 能源
  • 印刷
  • 教育
  • 跨境电商
  • 旅游
  • 皮革
  • 3C数码
  • 金属制品
  • 批发
  • 研究和发展
  • 其他行业
需求描述
填写以下信息马上为您安排系统演示
姓名
手机号码
你的职位
企业名称

恭喜您的需求提交成功

尊敬的用户,您好!

您的需求我们已经收到,我们会为您安排专属电商商务顾问在24小时内(工作日时间)内与您取得联系,请您在此期间保持电话畅通,并且注意接听来自广州区域的来电。
感谢您的支持!

您好,我是您的专属产品顾问
扫码添加我的微信,免费体验系统
(工作日09:00 - 18:00)
电话咨询 (工作日09:00 - 18:00)
客服热线: 18011747352
售前热线: 189 2432 2993
扫码即可快速拨打热线