DeepSeek 又甩出一张牌——V4.1 Flash。名字里带 Flash,参数却顶到 552B,乍看自相矛盾。真正值得盯的不是总量,而是它每次唤醒多少:输入侧激活 8B,输出侧激活 16B。再配上一套全新的 Causal-Encoder-Decoder 结构和原生多模态视觉理解,它在基准测试里把自家旗舰 V4 Pro 也压了过去。稀疏 MoE 这条线,DeepSeek 走得比谁都极端。
552B 的体量,8B 的开销
稀疏激活不新鲜,新的是把输入输出拆开算
MoE 的逻辑早就公开:总参数堆得极大,每次前向只走一小撮专家。决定账单的从来不是总量,而是被点亮的那部分。V4.1 Flash 的特别之处,是它给出了两个不同的激活数字——输入 8B,输出 16B。这不是文字游戏,而是承认了预填充和解码本来就是两种负载。
解码端更"重",贴合推理的真实分布
预填充阶段能把整段上下文并行吃掉,算力利用率高,稀疏一点没关系。解码就麻烦得多:一次一个 token,串行推进,每一层都要在显存带宽和延迟之间反复权衡。把输出侧激活放宽到 16B,等于承认生成质量对参数量更敏感。这种不对称设计业内并非首创,但落到 552B 这个体量上,两侧差出整整一倍,比例相当激进。
视觉能力是长进去的,不是贴上去的
过去不少所谓多模态模型,做法是把视觉编码器挂在语言模型旁边,中间靠一层投影层对齐。训练阶段各练各的,推理时接口生硬,遇到复杂图表就开始露怯。V4.1 Flash 把视觉理解写进主干,图文在同一套表征空间里被处理。这件事对 Agent 场景格外要紧——屏幕截图、表格、流程图这类输入,不再需要先被"翻译"成一段文字描述再喂给模型。
Causal-Encoder-Decoder:拗口名字背后的取舍
它在解决一个具体的麻烦
纯 Decoder 架构这几年几乎成了默认答案,好处是简单、通用、扩展性好。代价藏在推理侧:每个新生成的 token,都要把之前所有内容重新过一遍注意力,开销随上下文长度线性甚至更差地膨胀。Encoder-Decoder 的思路是先把输入压缩成一个相对紧凑的表征,解码时反复复用,而不是每次都从头算起。DeepSeek 给它加上 Causal 前缀,说明编码过程仍然保持因果掩码,不是那种双向编码再解码的老套路。
KV Cache 被砍的那一刀
长上下文推理最烧钱的一块,就是 KV Cache 的显存占用。序列越长,缓存越膨胀,最后往往不是算力不够,而是显存先撑不住。Encoder 结构把输入侧的表示固化下来,解码阶段不必为每个历史 token 保留完整的键值对,缓存的增长曲线因此被压平。压缩幅度官方没有给出全部细节,但从结构本身推断,收益主要落在超长输入、输出相对较短的场景上——文档问答、代码库检索、Agent 反复读取环境状态,全在射程之内。
长上下文的账本
值得注意的是,缓存压缩省下的不只是显存,还有每次解码要搬运的数据量。生成速度的瓶颈常常卡在带宽而非浮点算力上,键值对少搬一点,吞吐就能实打实地涨。这也解释了 Flash 这个名字的由来:它不是把模型做小,而是让同样的参数量跑得更快。
跑分压过 V4 Pro,然后呢
自家人被自家超,信号很清楚
模型发布里最有信息量的部分,往往是它赢了谁。V4.1 Flash 在多项基准上超过 V4 Pro,而后者是上一代旗舰。同一家公司、相近的参数量级,差距只能来自架构和训练方法。新结构在内部评估中胜出,等于官方公开确认了技术路线的切换。对开发者来说,这比任何跑分数字都更值得记一笔。
定价下调,谁先松一口气
API 价格同步下调,配合激活参数只有 8B/16B 的事实,单位 token 的推理成本被压到一个相当低的位置。真正受益的不是聊天机器人这类轻量场景,而是那些需要反复调用、循环决策的 Agent 工作流。一个任务里调用几十次模型是常态,价格每降一档,能跑通的商业模式就多一批。长上下文加低单价这个组合,过去两年一直是 Agent 落地的硬门槛,现在门槛矮了一截。
开源生态里的位置
DeepSeek 一贯的打法是技术开放加价格下探,这次也不例外。新结构一旦被社区复现、微调、改进,围绕它的工具链和推理优化会迅速铺开。对闭源厂商来说,压力不在于某个具体分数被超过,而在于一套新架构从论文变成可用的开源资产,中间的时间差正在缩短。
剩下的问题
结构红利能吃多久
Causal-Encoder-Decoder 解决了缓存膨胀,却引入新的复杂度:编码器和解码器要分别调优,训练稳定性更依赖工程细节。这套结构能不能像当年的 Transformer 一样被广泛复制,还是只在特定场景里占优,目前还没有答案。更现实的问题是,下一轮上下文长度再翻十倍,这层压缩是否依然够用。
参数表已经不是主战场
552B、8B、16B——这些数字摆在一起,说明规模竞赛的叙事已经换了写法。比谁的参数多不再有意义,比谁在单位成本下能多干多少活才有。V4.1 Flash 的发布,与其说是一次模型更新,不如说是一次关于成本结构的表态。谁能把推理价格压到 Agent 可以随便跑的程度,谁就掌握了下一阶段的入场券。

