DeepSeek 这次把刀挥向了自己。9 月 14 日中午 12 点,所有发往 v4-pro 的请求将被强制路由到 DeepSeek V4.1 Flash,并按照 Flash 的低价计费。没有投票,没有过渡选项。对于还在依赖 v4-pro 的开发者来说,一觉醒来账单结构就变了——缓存命中的输入价格直接降了 7 倍多,输出费用砍掉三分之二。这不是促销,是定价体系的重写。
价格不是打折,是重新定价
缓存命中降价 7 倍,输出砍掉三分之二
先看数字。根据作者实测,V4.1 Flash 在缓存命中场景下的输入成本,相比 v4-pro 下降了超过 7 倍。输出侧更狠——只有原来的三分之一。如果你在做高频调用、长上下文复用的 Agent 应用,这个降幅足以改变整个项目的 ROI 模型。以前需要精打细算的 token 预算,现在可以放得更开。但别急着高兴,价格下降从来不是慈善,它意味着某些能力被重新分配了。
强制路由:v4-pro 用户没有选择
9 月 14 日这个时间点很微妙。官方没有给 v4-pro 留任何回旋余地,直接强制路由。这种做法在 API 服务里并不常见,通常至少会保留一个手动切换的窗口。DeepSeek 敢这么干,大概率是算过账的:V4.1 Flash 在绝大多数常见任务上的表现已经足够接近 v4-pro,而成本结构却好得多。换句话说,他们认为你没那么需要 v4-pro。至于那些真正需要 v4-pro 能力的场景——比如超长上下文或者复杂推理——你只能另寻他路,或者接受 Flash 的妥协。
实测 V4.1 Flash:跑分之外的真相
架构参数与生成任务:快,但快得有限
作者对 V4.1 Flash 的架构参数做了拆解,并跑了多个生成任务。结论是:它的响应速度确实快,首 token 延迟在同类 Flash 模型中属于第一梯队。但“快”不等于“好”。在简单问答、摘要、翻译这类任务上,输出质量与 v4-pro 的差距肉眼难辨。一旦进入需要多步推理的生成任务——比如写一段带业务逻辑的代码,或者规划一个多轮对话流程——Flash 就开始露怯。它会跳过一些边界条件,或者在长链条推理中丢失中间状态。这不是 bug,是模型容量和训练目标的取舍。
对比 GLM 5.3 Flash:谁更懂中文开发者
把 V4.1 Flash 和 GLM 5.3 Flash 放在一起,差异很有意思。GLM 5.3 Flash 在中文语境下的指令遵循更稳,尤其是涉及国内业务术语和格式要求时,它很少跑偏。V4.1 Flash 的优势则在代码生成和结构化输出上——它更愿意按照你给定的 schema 返回 JSON,字段缺失率更低。但 GLM 5.3 Flash 在多模态任务上明显更成熟,图像描述和图表理解的成功率更高。如果你做的是纯文本 Agent,两者差距不大;一旦涉及图片输入,V4.1 Flash 的短板就暴露了。
缺陷暴露:多模态和长上下文仍是软肋
作者在实测中重点测试了多模态能力。V4.1 Flash 对图片的理解停留在“能识别主要物体”的水平,细粒度问答——比如“图中第三行表格的第二个数字是多少”——基本靠猜。长上下文方面,虽然标称支持的长度不低,但实际有效记忆窗口明显缩水。超过一定 token 数后,它开始遗忘前面的指令。这两个缺陷直接限制了它在复杂 Agent 场景中的可用性。低价是有代价的,代价就是你不能什么都想要。
Agent 与编码场景:低价 Flash 的边界
编码任务:能写,但别指望一次过
编码是 V4.1 Flash 的相对强项。作者让它生成 Python 脚本、SQL 查询和简单的 React 组件,大部分情况下第一版就能跑。但问题出在“简单”二字上。一旦任务涉及多个文件、依赖注入或者异步逻辑,Flash 生成的代码就会出现遗漏。它不会主动帮你处理错误边界,也不会考虑并发安全。你需要把任务拆得足够细,每一步都给明确的输入输出示例。换句话说,它像一个手速很快但经验尚浅的初级工程师——能干活,但需要你盯着。
Agent 工作流:成本敏感型项目的解药
对于 Agent 工作流,V4.1 Flash 的定位很清晰:它适合那些调用量大、单次任务简单、对错误有一定容忍度的场景。比如信息抽取、分类打标、简单路由决策。这些任务以前用 v4-pro 跑,成本高得让人心疼;现在换成 Flash,成本直接降了一个数量级,准确率可能只掉几个百分点。但如果你的 Agent 需要做多步规划、工具调用链很长、或者需要维护复杂的状态机,Flash 的遗忘问题和推理短板会被放大。它不是万能解药,它是特定场景下的止痛片。
谁该立刻切换,谁该再等等
适合切换的三种情况
第一,你的应用以短文本处理为主,比如客服自动回复、评论审核、简单摘要。第二,你在做大批量的数据清洗或标注,对单次准确率要求不是 100%,但调用量极大。第三,你的 Agent 任务步骤少、依赖弱,不需要长上下文记忆。这三种情况下,V4.1 Flash 的性价比几乎是无敌的。缓存命中降价 7 倍不是噱头,它能把你的月度账单直接打下来。
建议观望的两种场景
如果你在做多模态应用——尤其是需要理解图表、文档版面或者视频帧——V4.1 Flash 目前还撑不起来。它的图像理解能力与 GLM 5.3 Flash 存在代差。另一个需要观望的是复杂编码 Agent,比如自动修复跨文件 bug、重构大型代码库。Flash 的推理深度不够,强行上马只会让你在 debug 上花掉更多时间。省下的 token 费用,可能还不够付工程师的加班费。
DeepSeek 这次强制路由,本质上是一次用户分层。它把“够用就好”的场景全部赶进 Flash 的池子,用低价留住高频调用者;而那些真正需要 v4-pro 能力的场景,要么接受 Flash 的妥协,要么转向其他模型。这不是技术退步,是商业策略的精准切割。对于开发者来说,唯一要做的是搞清楚自己的任务到底属于哪一边。别被低价冲昏头,也别因为强制路由就急着骂娘——先跑一遍你的真实工作流,看看 Flash 到底能不能接住。接得住,省下的钱是实打实的;接不住,趁早找备胎。

