DeepSeek 又发模型了,这次是 DeepSeek-V4.1-Flash。名字里带 Flash,身材是全新型号结构系列里最小的一个,却标配了原生多模态视觉理解。随模型一起放出来的还有一串数字:GPQA Diamond 90.9、HLE 36.8、Codeforces Rating 3471、Terminal-Bench 2.1 拿到 90.6。同一张成绩单上,90.9 和 36.8 并排站着,本身就值得说几句。
先把四个数字摊在桌上
GPQA Diamond 的 90.9,细看有点吓人
这个基准测的是研究生级别的物理、化学、生物硬题,题目设计出来就是为了让搜索引擎帮不上忙。人类博士在自己领域内的正确率长期在七成上下徘徊。一个 Flash 定位、体积最小的模型干到 90.9,说明知识密度和推理链的稳定性已经不在"能用"这个区间里了。
但这里有个读数陷阱。GPQA Diamond 只有几百道题,训练数据污染的排查始终是笔糊涂账,各家口径也不完全一致。看到 90 以上先别急着封神,把它当成"这个模型在硬科学问答上不掉链子"的信号更合适。真正要观察的是它在你自己领域里的表现,而不是榜单上的小数点。
Codeforces 3471,会做题和能干活是两件事
3471 这个 Rating 放在 Codeforces 上属于什么位置?人类选手里能稳定维持这个分数的,一只手数得过来。竞赛题考的是在有限时间内把算法想清楚并写对,压力测试、边界条件、复杂度分析全得在线,这跟写业务代码确实不是一回事。
可它至少证明了一件事:模型在强约束下的代码生成质量已经越过了某个门槛。过去用模型写算法题,你得盯着它别在边界条件上翻车;现在需要担心的变成了它给的解法是否过于"竞赛化"——为了跑分漂亮而牺牲可读性和工程可维护性。这个偏差在实际项目里会咬人。
HLE 36.8 才是这份成绩单上最诚实的一行
Humanity's Last Exam 是这两年公认最不客气的一套题,横跨上百个学科,专门挑那些连专家都要查文献的问题。36.8 这个数字摆在 90.9 旁边显得寒酸,但它恰恰说明模型没有在"已知答案的题库"里刷分刷到失真。
换个角度看,36.8 意味着三分之一的题能答对。两年前这个数字还在个位数徘徊。前沿模型在 HLE 上的爬升曲线,比任何营销话术都更能说明通用推理能力到底走了多远。剩下那六成多,才是留给人脑的地盘。
Flash 不是缩水版,是另一种定位
尺寸变小,野心没变小
命名习惯里,Flash、Mini、Lite 这些后缀长期被默认为"阉割版"——便宜、快、但别指望它干重活。DeepSeek 这次的用法有点不一样:V4.1-Flash 是新结构系列的第一个成员,最小,可它承载的是整套架构的验证任务。
先放出小尺寸跑通结构、跑顺训练和推理链路,再往上堆参数,这是工程上更稳妥的路子。对调用方来说,好处是价格和延迟都能压下来;风险是如果这个尺寸撑不住复杂 agent 任务,后面被迫换大模型时,prompt 和工具链得重调一遍。
原生多模态,得从训练第一天算起
"原生"这两个字容易被当成宣传词,但它有具体的技术含义。后接式的多模态方案是在语言模型外面挂一个视觉编码器,再把图像特征投影进文本空间,图文对齐的质量受限于两套系统各自的训练目标。原生多模态从预训练阶段就把图像和文本混在一起喂,模型对图文关系的理解是长在参数里的。
差别体现在细节上:图表里的数据趋势、界面截图里的按钮位置、手写公式的识别——这些任务对拼接式方案一直是难点。DeepSeek 把原生视觉理解下放到最小尺寸的模型上,等于把多模态从"高端型号专属"变成了默认配置。
一个结构系列的第一块砖
单独看 V4.1-Flash,它就是一次常规迭代。放到"全新模型结构系列"这个定语下,意义就不同了。架构换代意味着训练配方、并行策略、推理优化全都要重做一遍,第一个版本的价值往往不在能力上限,而在它能不能稳定跑起来、能不能撑住真实流量。
这也是为什么官方这次把评测数字和 API 切换细节一起放出来。前者是给研究者和选型的人看的,后者是给已经在生产环境里跑着旧模型的团队看的。两拨人的关注点完全不同。
真正让开发者头疼的是 API 那一页
旧模型什么时候彻底关灯
新模型上线的另一面,是旧模型退场。更新日志里写明了下线安排,这类信息最容易被忽略——发布公告里满屏都是跑分,下线日期缩在文档角落。等到某天早上接口返回 404,才发现线上服务挂了,这种事故每年都在不同团队里重演。
稳妥的做法是把模型 ID 从硬编码里抽出来,做成配置项。听起来是老生常谈,但真正做的人不多。更麻烦的是那些把模型名称写进 prompt 模板、写进日志解析逻辑、写进测试断言的地方,它们不会报错,只会悄悄给出不一样的结果。
计费口径悄悄改了
价格下调是好消息,可计费规则的变化比单价更值得盯。输入输出的计费比例、缓存命中的折扣、多模态输入的 token 折算方式,任何一项调整都会让月度账单偏离预期。尤其是图像输入,不同厂商对一张图折算多少 token 的算法差别很大,一张高分辨率截图可能顶得上几千字的文本。
建议在切换前先用历史流量做一次影子测试,把同样的请求同时打到新旧两个模型上,比对 token 消耗和实际输出质量。花半天时间,能省掉后面一个月的对账扯皮。
切换时真正会出问题的地方
模型换代最隐蔽的坑在输出格式。同样的 prompt,新模型可能换一种方式组织答案,多一层解释、少一个换行、把 JSON 字段顺序调了个个儿。人看着没区别,下游的解析器直接崩。凡是依赖严格格式的地方——结构化抽取、工具调用参数、代码块提取——都得重新跑一遍回归测试。
另一个坑是拒绝行为的变化。安全策略和指令遵循的边界在不同版本之间会漂移,昨天能过的请求今天可能被挡回来。生产环境里这类变化往往由用户先发现,而不是监控系统。
这批调用最终会流向谁
它抢的是谁的地盘
把小尺寸、多模态、强推理、低价格这四个标签叠在一起,指向的是一块很具体的市场:大批量的文档理解、截图分析、代码辅助、终端自动化。这些场景的共同点是对单次成本极度敏感,对延迟有要求,同时又需要模型真的看懂图、真的会调工具。
Terminal-Bench 2.1 的 90.6 分在这里就显出分量了。这个基准测的是模型在真实终端环境里执行任务的能力——读日志、改配置、跑命令、根据报错调整下一步。分数高意味着它能扛住 agent 类产品的核心链路,而不只是当个聊天窗口。
开源加定价调整,老配方新用法
同步开源、同步调价,这套组合 DeepSeek 已经用过不止一次。逻辑很直白:开源把开发者拉进来,低价把调用量留下来。对企业客户来说,权重可获取意味着最坏情况下还有自部署这条退路,这在采购谈判桌上是很实在的筹码。
不过自部署和 API 调用是两笔账。自己跑要算显卡、算运维、算利用率,除非调用量足够大或者数据合规要求足够硬,否则 API 仍然是更划算的选择。真正的价值在于议价空间,而不是真的一定了要自己搭。
值得留意的是节奏。新结构系列才放出第一个成员,后面大概率还有更大尺寸的版本在路上。现在做技术选型,最好把接口层留出足够抽象度——今天用 Flash 省钱,明天换更大模型时不至于推倒重来。模型迭代的速度,早就超过了大多数团队重构一次架构的周期。

