DeepSeek 这次没有发论文,而是在一条推特里扔出了一枚深水炸弹——V4-Flash 官方 API 公测,Agent 基准测试分数直接把 V4-Pro-Preview 甩在身后。顺带宣布两件事:原生支持 Responses API 格式,以及完全适配 Codex。三句话,三个动作,但每一条都在指向同一个方向:他们想让开发者把智能体跑在 Flash 上,而且立刻就能跑。
Agent 分数跳级,Pro 版脸上挂不住
一句“远超”背后,数据真空让人抓心
官方表述是“基准测试分数现已远超 V4-Pro-Preview”,没有列出具体数字,没有说明是什么评测集,也没有给出去年 Pro 版的基线。这对一个技术判断来说非常要命。做 Agent 的人都知道,10 个百分点的提升可能来自工具调用链的改良,也可能是评测集针对性调优的结果。没有透明数据,就只能靠自家压测来验证。但话又说回来,DeepSeek 敢在公开推文里说“远超”,胆子不小——V4-Pro-Preview 之前的 Agentic 能力本来就不弱,若真能在 Flash 这种低成本形态上实现大幅越级,那意味着推理架构可能动了不小的刀。
Flash 路线突然加速,省钱不再是唯一卖点
Flash 系列的传统记忆是便宜、够快,但 Agent 能力向来不是它的主战场。开发者通常的算盘是:用 Pro 做复杂规划,用 Flash 做执行、总结、简单问答。现在 DeepSeek 把 Flash 的 Agent 评分直接拉到 Pro 前面,是在告诉市场:你可以不再纠结“能力 vs 成本”的二元划分。如果这项提升持续稳定,以后那些需要频繁调用工具、走多步推理的智能体,可能只用 Flash 就够了。对推理毛利、对应用层架构,这都会产生连锁反应。
对团队意味着:赶紧上,但别立刻切生产
聪明团队收到这种消息的第一反应不是换模型,而是搭对照实验。把现有的 Agent 编排逻辑同时跑在 V4-Pro-Preview 和新版 Flash 上,比较任务完成率、工具调用准确性,以及那种“不可言说”的规划合理性。Flash 分数越级很可能是真实的,但不一定覆盖你手头那个边角案例。别被“远超”两个字冲昏,也别因为数据没公开就嗤之以鼻。这是一个信号,不是一个结论。
Responses API 原生化,接口变革悄然而至
不再是 Messages 的补丁,而是新的原生语言
很多人对 Responses API 的认识还停留在“类似 Chat Completions 的另一种格式”。但 DeepSeek 这次强调原生支持,意思很清楚:模型内部对多轮工具调用、推理步骤、结构化输出做了端到端适配,而不是在消息格式上加个壳。Responses API 天然更适合记录和传递中间状态,这对 Agent 来说简直像血管有了专门的通道。过去要自己维护对话树、分步解析函数调用,现在模型层面已经把这些信息按标准格式喂出来,开发负担会显著下降。
完全适配 Codex,不止是适配器那么简单
Codex 是 OpenAI 为开发者打造的终端工具生态,能让模型直接读写文件、执行命令、操控 IDE。DeepSeek 说“已完全适配 Codex”,意味着 Flash 现在可以充当 Codex 的推理大脑,而且是官方认证了兼容性。这比你自己抓一个 API 往 Codex 里塞要靠谱得多。编程场景下的 Agent——从写补丁到自动调试——可能会最先感受到这个组合的威力。换句话说,你不用等某个 AI 编码工具的官方集成,直接照着文档配,就能让 Flash 在你的代码仓库里工作。
文档里的暗线:Agent 集成区已经就位
打开官方 API 文档,路径 quick_start/agent_integrations/codex 直接指向配置详情。这条目录树的存在本身就在说:Agent 不再是附加实验功能,而是正式版 API 的一部分。文档里没有停留在“请参考响应格式”这种万金油描述,而是提供了具体集成步骤。DeepSeek 正在悄悄铺设一个以 Flash 为底座的 Agent 基础设施,Responses API 和 Codex 适配只是最先露头的两块积木。
烟雾还是狼烟,开发者的本能反应该是什么
Agent 评测从来不是干净的赛道
业内做 Agent 评测的人都知道,不同模型在 WebArena、SWE-bench、GAIA 这些榜单上的排名年年洗牌。分数跨越常常跟模型真正“理解了任务”关系不大,而是跟系统提示、工具定义、解析器的鲁棒性强相关。DeepSeek 这次说“远超”,但没指明是哪套题,也没说是一次性成绩还是稳定复现。别急着以此作为选型依据,它更适合当一个“压力测试优先”的启动信号。
Flash 过往的落差,提醒我们保持警觉
早前的 Flash 版本在某些多步推理任务上有过“快但不稳”的刻板印象——简单的几步一气呵成,一旦链条拉长就开始遗忘上下文或漏调工具。新版本如果真的把 Agent 能力提到那么高,那必然在上下文坚持、工具码解析这些细节上做了大量底层重写。但经验告诉我们,一项升级如果在短期内没经过全量推演,往往会在极端边缘任务上露出马脚。所以,先用它跑非关键路径,让它跟 Pro 版并肩工作,而不是立刻替换。
一句话:验证它,但别神话它
DeepSeek 这次放出的组合拳——Agent 升级、Responses API 原生化、Codex 适配——逻辑闭环非常漂亮。它想让 Flash 成为 Agent 编排的默认第一选择,省去中间网关,省去协议转换。这套叙事如果全部兑现,确实会对整个智能体中间件市场形成挤压。但漂亮归漂亮,开发者口袋里的真理永远是自己的测试集。把 Flash 塞进你那个总是卡在第三步就迷路的客服 Agent,看它自己能不能走出来。走出来了,这波升级就值万金;走不出来,Pro 版依然是你的后盾。

