大模型圈有一条越来越硬的规矩:别被总参数唬住,翻到推理激活量那行再说话。蚂蚁百灵刚开源的 Ling-3.0-tiny,直接把这行数字加粗加亮——总参数 7.9B,激活参数仅仅 1.3B。更绝的是,它拿这 1.3B 的“实际干活儿”的脑细胞,在 Agent 任务上干翻了一票激活量是自己二十多倍的巨无霸。这哪是 tiny,分明是一次精心策划的越级刺杀。
参数表的障眼法,以及为什么这次你该信
7.9B 只是外壳,1.3B 才是刀刃
谈论 Ling-3.0-tiny 之前,得先把参数观掰过来。业内习惯盯着总参数量排队,但混合专家(MoE)架构早就把游戏规则改了——真正决定推理成本和响应速度的,是每个 token 实际激活的参数量。蚂蚁团队这次没藏着掖着,上来就亮底牌:一个 7.9B 的模型,推理时只唤醒 1.3B 的活跃参数。什么概念?你在本地拿它实时对话,跑起来的计算负担和 1B 出头的小模型差不多,但它的知识密度、多步推理的连贯性,却稳稳站在 4B 级别密集模型那一档。这种“大容量存储、轻量运算”的异构设计,让它在延迟和功耗上完美贴合物端与边缘场景,同时又不用牺牲太多智商。
Agent 分数越级,不是魔法是架构
最让我兴奋的,还不是它省了多少算力,而是官方给出的 Agent 评测结果。在函数调用、工具编排、多步指令跟踪这类实打实的智能体任务上,Ling-3.0-tiny 硬生生超过了部分总参数量 30B 以上的模型。这听起来反直觉,但翻一翻技术思路就通了。模型做 Agent,瓶颈往往不在知识覆盖,而在“注意力分配”——能否在嘈杂的上下文中牢牢记住当前目标,不被中间结果带偏。蚂蚁的混合推理方案很可能在路由机制上做了高度针对性的优化,让每个 token 都能精准匹配到最擅长处理该类意图的专家模块。结果就是,面对一连串 API 调用和状态切换,模型极少发生“忘了最初要干嘛”的经典错误,表现出一种不属于这个体量的稳健。
三种精度一把梭,部署者要的它全给
BF16 保精度,FP8 降门槛,INT4 闯终端
开源社区看模型发布,常遇到一种拧巴:权重放出来了,但想真正跑起来还得自己折腾量化、裁剪,折腾一圈性能掉一地。Ling-3.0-tiny 这次的做法简单粗暴——同时提供 BF16、FP8 和 INT4 三个完整版本。BF16 版留给有高吞吐推理卡的研究者,原汁原味保留训练精度;FP8 版瞄准新一代数据中心的硬件,在几乎不磨损能力的前提下实现显存减半;而 INT4 版直接掀了桌,保证模型能在笔记本、边缘盒子甚至移动端芯片上流畅运行。三种精度不是简单的后量化产物,而是原生训练中就对量化友好做了适配,避免了常见的权重漂移。你直接下载对应的 GGUF 或你自己喜欢的格式,跑起来就是那个效果,不用再怀疑自己是不是哪里弄错了。
本地部署的“最后一公里”被打通了
过去我们聊端侧智能,总卡在“能跑起来”和“真能用”之间那段缝隙。1.3B 激活配合 4-bit 量化,意味着手机上的 CPU 就能在可接受的延迟内完成多轮 Agent 对话,而不需要外挂 GPU 或者云端来回传数据。我甚至看到早期社区开发者已经在树莓派上跑通了这个 INT4 版本,处理简单的日程安排和邮件摘要完全可用。这种本地闭环对隐私敏感的企业服务、金融合规场景来说,不是锦上添花,是入场券。蚂蚁这次等于把产业落地的最后一段土路给铺上了柏油,而且没设收费站。
蚂蚁的豪赌:Agent 不是未来,是现在
为什么是 Agent,又为什么是“tiny”
从支付宝里的智能助理到各种业务线的数字员工,蚂蚁早就不是单纯的金融科技公司,它是一家被逼着在超大规模异构场景里不断折腾 AI 落地的技术巨头。Ling 系列选择的突破口不是刷榜,而是死磕 Agent 能力,这很蚂蚁。因为只有 Agent 才能把搜索、交易、风控等实际动作串联成可交付的服务,而不是一个只会聊天的对话框。至于为什么费大力气搞出一个 tiny 版本,答案同样在场景里。当你的 Agent 需要同时跑在千万级用户的手机后台、商超 POS 机、IoT 网关里时,模型的每一次内存释放、每一毫秒延迟削减,都在决定整个商业链条的成本结构能不能成立。
开源的阳谋:让轻量 Agent 成为默认选项
Ling-3.0-tiny 选择开源,甚至贴心地给出了多精度版本,背后是一套精明的生态策略。蚂蚁很清楚,Agent 的推理范式不像聊天那样可以忍受一两秒的延迟,高频调用、链式操作会把延迟和成本快速放大成灾难。它必须把端侧推理的成本打到地板上,而开源正是加速这一过程最有效的方式。让更多开发者把 tiny 模型嵌进自己的应用里,让硬件厂商主动适配驱动和算子,让社区围绕 1.3B 激活这个规格产出数不清的微调变体——一旦“本地优先的 Agent 引擎”成为行业默认,蚂蚁在整个 Agent 生态中的话语权就远远不只在一个基础模型上。这不是一次简单的权重公开,是一场针对下一个计算入口的提前布局。
当你不用再为算力焦虑
我始终觉得,技术的平民化往往发生在算力焦虑消失的那一瞬间。Ling-3.0-tiny 给出的信号很明确:构建一个能处理复杂多步任务、调用外部工具的智能体,不需要几块 A100。当你拿起手机,随时随地让一个本地 Agent 帮你在各种应用间穿梭完成操作,而不用担心隐私泄露或服务宕机,整个交互范式就会发生根本性偏移。蚂蚁把这个未来往前拽了一大步,用极小的激活量撬动了一个极重的生态位。剩下的,就看开发者的想象力了。

