DeepSeek 发布 V4.1 Flash:552B MoE 多模态模型,同步开源并下调 API 定价

发布时间: 2026-09-10 文章分类: AI前沿技术
阅读量: 0
AI智能体
企业级AI智能体开发与部署
LumeValley提供全栈式企业级AI智能体开发与部署服务,涵盖战略规划、场景化开发、企业级应用构建、行业解决方案及算力支撑。从需求分析到持续优化,确保智能体高效稳定运行,助力企业实现智能化转型,提升运营效率与竞争力。

DeepSeek 又甩出一张牌——V4.1 Flash。名字里带 Flash,参数却顶到 552B,乍看自相矛盾。真正值得盯的不是总量,而是它每次唤醒多少:输入侧激活 8B,输出侧激活 16B。再配上一套全新的 Causal-Encoder-Decoder 结构和原生多模态视觉理解,它在基准测试里把自家旗舰 V4 Pro 也压了过去。稀疏 MoE 这条线,DeepSeek 走得比谁都极端。

552B 的体量,8B 的开销

稀疏激活不新鲜,新的是把输入输出拆开算

MoE 的逻辑早就公开:总参数堆得极大,每次前向只走一小撮专家。决定账单的从来不是总量,而是被点亮的那部分。V4.1 Flash 的特别之处,是它给出了两个不同的激活数字——输入 8B,输出 16B。这不是文字游戏,而是承认了预填充和解码本来就是两种负载。

解码端更"重",贴合推理的真实分布

预填充阶段能把整段上下文并行吃掉,算力利用率高,稀疏一点没关系。解码就麻烦得多:一次一个 token,串行推进,每一层都要在显存带宽和延迟之间反复权衡。把输出侧激活放宽到 16B,等于承认生成质量对参数量更敏感。这种不对称设计业内并非首创,但落到 552B 这个体量上,两侧差出整整一倍,比例相当激进。

视觉能力是长进去的,不是贴上去的

过去不少所谓多模态模型,做法是把视觉编码器挂在语言模型旁边,中间靠一层投影层对齐。训练阶段各练各的,推理时接口生硬,遇到复杂图表就开始露怯。V4.1 Flash 把视觉理解写进主干,图文在同一套表征空间里被处理。这件事对 Agent 场景格外要紧——屏幕截图、表格、流程图这类输入,不再需要先被"翻译"成一段文字描述再喂给模型。

Causal-Encoder-Decoder:拗口名字背后的取舍

它在解决一个具体的麻烦

纯 Decoder 架构这几年几乎成了默认答案,好处是简单、通用、扩展性好。代价藏在推理侧:每个新生成的 token,都要把之前所有内容重新过一遍注意力,开销随上下文长度线性甚至更差地膨胀。Encoder-Decoder 的思路是先把输入压缩成一个相对紧凑的表征,解码时反复复用,而不是每次都从头算起。DeepSeek 给它加上 Causal 前缀,说明编码过程仍然保持因果掩码,不是那种双向编码再解码的老套路。

KV Cache 被砍的那一刀

长上下文推理最烧钱的一块,就是 KV Cache 的显存占用。序列越长,缓存越膨胀,最后往往不是算力不够,而是显存先撑不住。Encoder 结构把输入侧的表示固化下来,解码阶段不必为每个历史 token 保留完整的键值对,缓存的增长曲线因此被压平。压缩幅度官方没有给出全部细节,但从结构本身推断,收益主要落在超长输入、输出相对较短的场景上——文档问答、代码库检索、Agent 反复读取环境状态,全在射程之内。

长上下文的账本

值得注意的是,缓存压缩省下的不只是显存,还有每次解码要搬运的数据量。生成速度的瓶颈常常卡在带宽而非浮点算力上,键值对少搬一点,吞吐就能实打实地涨。这也解释了 Flash 这个名字的由来:它不是把模型做小,而是让同样的参数量跑得更快。

跑分压过 V4 Pro,然后呢

自家人被自家超,信号很清楚

模型发布里最有信息量的部分,往往是它赢了谁。V4.1 Flash 在多项基准上超过 V4 Pro,而后者是上一代旗舰。同一家公司、相近的参数量级,差距只能来自架构和训练方法。新结构在内部评估中胜出,等于官方公开确认了技术路线的切换。对开发者来说,这比任何跑分数字都更值得记一笔。

定价下调,谁先松一口气

API 价格同步下调,配合激活参数只有 8B/16B 的事实,单位 token 的推理成本被压到一个相当低的位置。真正受益的不是聊天机器人这类轻量场景,而是那些需要反复调用、循环决策的 Agent 工作流。一个任务里调用几十次模型是常态,价格每降一档,能跑通的商业模式就多一批。长上下文加低单价这个组合,过去两年一直是 Agent 落地的硬门槛,现在门槛矮了一截。

开源生态里的位置

DeepSeek 一贯的打法是技术开放加价格下探,这次也不例外。新结构一旦被社区复现、微调、改进,围绕它的工具链和推理优化会迅速铺开。对闭源厂商来说,压力不在于某个具体分数被超过,而在于一套新架构从论文变成可用的开源资产,中间的时间差正在缩短。

剩下的问题

结构红利能吃多久

Causal-Encoder-Decoder 解决了缓存膨胀,却引入新的复杂度:编码器和解码器要分别调优,训练稳定性更依赖工程细节。这套结构能不能像当年的 Transformer 一样被广泛复制,还是只在特定场景里占优,目前还没有答案。更现实的问题是,下一轮上下文长度再翻十倍,这层压缩是否依然够用。

参数表已经不是主战场

552B、8B、16B——这些数字摆在一起,说明规模竞赛的叙事已经换了写法。比谁的参数多不再有意义,比谁在单位成本下能多干多少活才有。V4.1 Flash 的发布,与其说是一次模型更新,不如说是一次关于成本结构的表态。谁能把推理价格压到 Agent 可以随便跑的程度,谁就掌握了下一阶段的入场券。

AI智能体
企业级AI智能体开发与部署方案
LumeValley打造企业级AI智能体全流程方案,涵盖需求洞察、定制开发、多平台适配部署。凭借专业算法与丰富经验,确保智能体精准理解业务,高效执行任务,无缝融入企业生态,为企业数字化转型提供强劲智能引擎,提升核心竞争力。
点赞 | 88

Lumevalley——全栈AI服务领航者,以“战略-应用-算力”三位一体服务框架,为企业提供从顶层战略规划、场景化AI智能体(AI Agent)开发/搭建/部署,到企业级AI应用开发、AI+行业场景解决方案的全链路服务,并配套AI大模型部署与高性能AI算力底座支撑,助力客户在营销、服务、运营等核心环节实现效率倍增与模式创新。

马上扫码获取产品资料
相关文章

相关文章

填写以下信息, 免费获取方案报价
姓名
手机号码
企业名称
  • 建筑建材
  • 化工
  • 钢铁
  • 机械设备
  • 原材料
  • 工业
  • 环保
  • 生鲜
  • 医疗
  • 快消品
  • 农林牧渔
  • 汽车汽配
  • 橡胶
  • 工程
  • 加工
  • 仪器仪表
  • 纺织
  • 服装
  • 电子元器件
  • 物流
  • 化塑
  • 食品
  • 房地产
  • 交通运输
  • 能源
  • 印刷
  • 教育
  • 跨境电商
  • 旅游
  • 皮革
  • 3C数码
  • 金属制品
  • 批发
  • 研究和发展
  • 其他行业
需求描述
填写以下信息马上为您安排系统演示
姓名
手机号码
你的职位
企业名称

恭喜您的需求提交成功

尊敬的用户,您好!

您的需求我们已经收到,我们会为您安排专属电商商务顾问在24小时内(工作日时间)内与您取得联系,请您在此期间保持电话畅通,并且注意接听来自广州区域的来电。
感谢您的支持!

您好,我是您的专属产品顾问
扫码添加我的微信,免费体验系统
(工作日09:00 - 18:00)
电话咨询 (工作日09:00 - 18:00)
客服热线: 18011747352
售前热线: 189 2432 2993
扫码即可快速拨打热线