DeepSeek AI 发布 DeepSeek-V4.1-Flash:1M 上下文、FP4 KV 缓存与跨层注意力复用

发布时间: 2026-09-10 文章分类: AI前沿技术
阅读量: 0
AI智能体
企业级AI智能体开发与部署
LumeValley提供全栈式企业级AI智能体开发与部署服务,涵盖战略规划、场景化开发、企业级应用构建、行业解决方案及算力支撑。从需求分析到持续优化,确保智能体高效稳定运行,助力企业实现智能化转型,提升运营效率与竞争力。

890 字节。DeepSeek-V4.1-Flash 这轮发布里,最扎眼的不是参数量,是这个数——每 token 的全局 KV 缓存占用,相当于上一代 V4-Flash 的四分之一,V1 的四百三十七分之一。552B 主干、196B Engram 参数、1M 上下文窗口、prefill 只激活 8B、decode 激活 16B,这一串数字讲的其实是同一件事:长上下文推理的账,终于有人愿意从架构层面认真算了。

每 token 890 字节,这一刀砍在哪里

长上下文真正烧钱的地方

参数量的热闹属于发布会,账单的残酷属于推理集群。上下文从 128K 拉到 1M,KV 缓存跟着线性膨胀,而且它必须在整个生成过程中常驻显存,不能扔到硬盘上慢慢读。按 V1 的量级换算,每 token 要吃掉将近 388KB;一条塞满 100 万 token 的会话,光缓存就是三百多 GB,还没算权重本身。降到 890 字节之后,同样长度的会话缓存总量不到 1GB,一张卡就能兜住。这不是优化,是把一整个部署场景从"不可行"挪到了"可行"。

从 1/437 到 1/4,压缩曲线在说什么

V1 到 V4-Flash 是 437 倍的落差,V4-Flash 到这一代只剩 4 倍。增幅收窄,恰恰说明低垂的果子摘完了。早期靠共享 KV、分组查询、缓存换精度这些通用手段就能拿到数量级收益;再往下走,必须动模型内部结构——跨层注意力复用、KV 走 FP4、输入侧预精简,哪一项都不是调个参数能解决的。这条曲线会越来越平,后来者想复制同等的压缩幅度,代价只会更高。

FP4 落在 KV 上,省的不只是显存

权重用 FP4 已经有人跑通过,把量化压到 KV 缓存上是另一回事。权重是只读的,缓存是要反复读写的,量化误差会在每个 decode step 里被重新读取、重新累加,误差不是一次性损失,而是持续污染。长文档问答、跨文件代码检索这类任务最先暴露问题:答案就在上下文里,模型却因为数值精度退化而抓不住。890 字节这个数字之所以值得看,是因为它同时压掉了显存占用和读取带宽,前提是精度守得住。

552B 的主干,一次只叫醒 8B

Engram 参数在架构里干什么

Engram 是神经科学里的老词,指记忆留下的痕迹。DeepSeek 把 196B 参数单独拎出来命名,显然不打算让它混在普通专家层里。比较合理的读法是分工:主干 552B 管推理、管组合、管把散落的信息接起来;Engram 那 196B 更像一张可寻址的知识底表,被调用时查一次,没被调用就不参与逐 token 的密集计算。知识存储和推理计算分开,是稀疏化能继续做深的前提。

prefill 8B 与 decode 16B,差在哪

prefill 是并行的,整个 prompt 一次性过网,算力打满,稀疏度可以压得更狠;decode 一个 token 接一个 token 地吐,每步都得把权重搬进计算单元,访存瓶颈比算力瓶颈更早撞墙。这时候激活的专家反而要多留一些,否则单步延迟压不住,吞吐再漂亮也没用。两个数字差一倍,是两种负载形态的必然结果,不是配置表写错了。

越稀疏,工程上的窟窿越多

激活 8B 听着便宜,可 552B 的参数还得分散在几十张卡上。专家并行意味着每层都要 all-to-all 通信,一旦路由倾斜,热专家所在的卡就成了瓶颈,冷专家所在的卡就在空转。负载均衡损失、通信开销、专家副本策略,这些看不见的成本会吃掉相当一部分稀疏化带来的红利。参数表上的 8B,落到真实集群里是多少,得看路由做得怎么样。

1M 窗口,重点不在能塞多少

跨层注意力复用省下了什么

标准 Transformer 每一层都重算一遍自己的注意力,而相邻层的键值分布高度相似,这里面有大量重复劳动。跨层复用让靠后的若干层直接吃前面已经算好的注意力结果,或者做低秩共享。省下来的是两头:计算量少了,需要独立维护的缓存也少了。上下文越长,这种层间冗余越明显,收益也越大。

编码器-解码器回来了,理由不太一样

这几年 decoder-only 几乎一统天下,编码器-解码器被扫进了历史抽屉。DeepSeek 这次把 causal encoder-decoder 重新拿出来,逻辑变了:输入侧交给编码器一次性吞下,做充分的全局理解;解码器只负责生成。1M 上下文下,检索、定位、跨文档对齐这类需要全局视野的操作集中在编码阶段完成,生成阶段就不用反复回看整段上下文。这是对超长输入的一种分工,不是对旧架构的怀旧。

视觉理解不再是外挂

原生视觉理解意味着图像和文本在预训练阶段就混在一起学,而不是事后接一个 vision encoder 去做对齐。这个差别在 Agent 场景里会被放大:截图、PDF、界面操作记录本质都是图像,模型能不能直接读屏、直接看懂一张报错截图,决定了它能不能被塞进自动化流程里当执行者,而不是只当个聊天窗口。

账单最后会挪到谁头上

Agent 最先吃到红利

Agent 的负载特征就是反复调用、上下文越滚越长,一轮工具调用追加一批结果,几十轮下来轻松突破几十万 token。缓存便宜四倍,意味着同样的显存能撑起四倍的并发会话,或者让同一个会话跑得更久而不被截断。这类场景对单位成本最敏感,也最先感受到差别。API 定价跟着下调,本质上是把架构省下来的钱让出一部分换调用量。

自部署团队要重算的那几笔账

先别急着按 8B 激活去估卡数。显存要按缓存和权重的实际分布重算,带宽要按 decode 阶段的访存压力重算,精度要按自己的业务场景实测——通用基准上掉一个点,在合同审阅或者日志分析里可能是另一种结果。890 字节是个漂亮的数字,但它成立的前提是路由均衡、量化损失可控、长上下文里的关键信息真的被找得到。这三条里任何一条不成立,省下来的钱都会以别的方式还回去。

AI智能体
企业级AI智能体开发与部署方案
LumeValley打造企业级AI智能体全流程方案,涵盖需求洞察、定制开发、多平台适配部署。凭借专业算法与丰富经验,确保智能体精准理解业务,高效执行任务,无缝融入企业生态,为企业数字化转型提供强劲智能引擎,提升核心竞争力。
点赞 | 62

Lumevalley——全栈AI服务领航者,以“战略-应用-算力”三位一体服务框架,为企业提供从顶层战略规划、场景化AI智能体(AI Agent)开发/搭建/部署,到企业级AI应用开发、AI+行业场景解决方案的全链路服务,并配套AI大模型部署与高性能AI算力底座支撑,助力客户在营销、服务、运营等核心环节实现效率倍增与模式创新。

马上扫码获取产品资料
相关文章

相关文章

填写以下信息, 免费获取方案报价
姓名
手机号码
企业名称
  • 建筑建材
  • 化工
  • 钢铁
  • 机械设备
  • 原材料
  • 工业
  • 环保
  • 生鲜
  • 医疗
  • 快消品
  • 农林牧渔
  • 汽车汽配
  • 橡胶
  • 工程
  • 加工
  • 仪器仪表
  • 纺织
  • 服装
  • 电子元器件
  • 物流
  • 化塑
  • 食品
  • 房地产
  • 交通运输
  • 能源
  • 印刷
  • 教育
  • 跨境电商
  • 旅游
  • 皮革
  • 3C数码
  • 金属制品
  • 批发
  • 研究和发展
  • 其他行业
需求描述
填写以下信息马上为您安排系统演示
姓名
手机号码
你的职位
企业名称

恭喜您的需求提交成功

尊敬的用户,您好!

您的需求我们已经收到,我们会为您安排专属电商商务顾问在24小时内(工作日时间)内与您取得联系,请您在此期间保持电话畅通,并且注意接听来自广州区域的来电。
感谢您的支持!

您好,我是您的专属产品顾问
扫码添加我的微信,免费体验系统
(工作日09:00 - 18:00)
电话咨询 (工作日09:00 - 18:00)
客服热线: 18011747352
售前热线: 189 2432 2993
扫码即可快速拨打热线