890 字节。DeepSeek-V4.1-Flash 这轮发布里,最扎眼的不是参数量,是这个数——每 token 的全局 KV 缓存占用,相当于上一代 V4-Flash 的四分之一,V1 的四百三十七分之一。552B 主干、196B Engram 参数、1M 上下文窗口、prefill 只激活 8B、decode 激活 16B,这一串数字讲的其实是同一件事:长上下文推理的账,终于有人愿意从架构层面认真算了。
每 token 890 字节,这一刀砍在哪里
长上下文真正烧钱的地方
参数量的热闹属于发布会,账单的残酷属于推理集群。上下文从 128K 拉到 1M,KV 缓存跟着线性膨胀,而且它必须在整个生成过程中常驻显存,不能扔到硬盘上慢慢读。按 V1 的量级换算,每 token 要吃掉将近 388KB;一条塞满 100 万 token 的会话,光缓存就是三百多 GB,还没算权重本身。降到 890 字节之后,同样长度的会话缓存总量不到 1GB,一张卡就能兜住。这不是优化,是把一整个部署场景从"不可行"挪到了"可行"。
从 1/437 到 1/4,压缩曲线在说什么
V1 到 V4-Flash 是 437 倍的落差,V4-Flash 到这一代只剩 4 倍。增幅收窄,恰恰说明低垂的果子摘完了。早期靠共享 KV、分组查询、缓存换精度这些通用手段就能拿到数量级收益;再往下走,必须动模型内部结构——跨层注意力复用、KV 走 FP4、输入侧预精简,哪一项都不是调个参数能解决的。这条曲线会越来越平,后来者想复制同等的压缩幅度,代价只会更高。
FP4 落在 KV 上,省的不只是显存
权重用 FP4 已经有人跑通过,把量化压到 KV 缓存上是另一回事。权重是只读的,缓存是要反复读写的,量化误差会在每个 decode step 里被重新读取、重新累加,误差不是一次性损失,而是持续污染。长文档问答、跨文件代码检索这类任务最先暴露问题:答案就在上下文里,模型却因为数值精度退化而抓不住。890 字节这个数字之所以值得看,是因为它同时压掉了显存占用和读取带宽,前提是精度守得住。
552B 的主干,一次只叫醒 8B
Engram 参数在架构里干什么
Engram 是神经科学里的老词,指记忆留下的痕迹。DeepSeek 把 196B 参数单独拎出来命名,显然不打算让它混在普通专家层里。比较合理的读法是分工:主干 552B 管推理、管组合、管把散落的信息接起来;Engram 那 196B 更像一张可寻址的知识底表,被调用时查一次,没被调用就不参与逐 token 的密集计算。知识存储和推理计算分开,是稀疏化能继续做深的前提。
prefill 8B 与 decode 16B,差在哪
prefill 是并行的,整个 prompt 一次性过网,算力打满,稀疏度可以压得更狠;decode 一个 token 接一个 token 地吐,每步都得把权重搬进计算单元,访存瓶颈比算力瓶颈更早撞墙。这时候激活的专家反而要多留一些,否则单步延迟压不住,吞吐再漂亮也没用。两个数字差一倍,是两种负载形态的必然结果,不是配置表写错了。
越稀疏,工程上的窟窿越多
激活 8B 听着便宜,可 552B 的参数还得分散在几十张卡上。专家并行意味着每层都要 all-to-all 通信,一旦路由倾斜,热专家所在的卡就成了瓶颈,冷专家所在的卡就在空转。负载均衡损失、通信开销、专家副本策略,这些看不见的成本会吃掉相当一部分稀疏化带来的红利。参数表上的 8B,落到真实集群里是多少,得看路由做得怎么样。
1M 窗口,重点不在能塞多少
跨层注意力复用省下了什么
标准 Transformer 每一层都重算一遍自己的注意力,而相邻层的键值分布高度相似,这里面有大量重复劳动。跨层复用让靠后的若干层直接吃前面已经算好的注意力结果,或者做低秩共享。省下来的是两头:计算量少了,需要独立维护的缓存也少了。上下文越长,这种层间冗余越明显,收益也越大。
编码器-解码器回来了,理由不太一样
这几年 decoder-only 几乎一统天下,编码器-解码器被扫进了历史抽屉。DeepSeek 这次把 causal encoder-decoder 重新拿出来,逻辑变了:输入侧交给编码器一次性吞下,做充分的全局理解;解码器只负责生成。1M 上下文下,检索、定位、跨文档对齐这类需要全局视野的操作集中在编码阶段完成,生成阶段就不用反复回看整段上下文。这是对超长输入的一种分工,不是对旧架构的怀旧。
视觉理解不再是外挂
原生视觉理解意味着图像和文本在预训练阶段就混在一起学,而不是事后接一个 vision encoder 去做对齐。这个差别在 Agent 场景里会被放大:截图、PDF、界面操作记录本质都是图像,模型能不能直接读屏、直接看懂一张报错截图,决定了它能不能被塞进自动化流程里当执行者,而不是只当个聊天窗口。
账单最后会挪到谁头上
Agent 最先吃到红利
Agent 的负载特征就是反复调用、上下文越滚越长,一轮工具调用追加一批结果,几十轮下来轻松突破几十万 token。缓存便宜四倍,意味着同样的显存能撑起四倍的并发会话,或者让同一个会话跑得更久而不被截断。这类场景对单位成本最敏感,也最先感受到差别。API 定价跟着下调,本质上是把架构省下来的钱让出一部分换调用量。
自部署团队要重算的那几笔账
先别急着按 8B 激活去估卡数。显存要按缓存和权重的实际分布重算,带宽要按 decode 阶段的访存压力重算,精度要按自己的业务场景实测——通用基准上掉一个点,在合同审阅或者日志分析里可能是另一种结果。890 字节是个漂亮的数字,但它成立的前提是路由均衡、量化损失可控、长上下文里的关键信息真的被找得到。这三条里任何一条不成立,省下来的钱都会以别的方式还回去。

