两个小时内,DeepSeek V4 Pro 正式版和 Grok 4.6 先后发布。1.6T、1.5T 参数,纸面数字都指向同一个对手——Claude Fable 5。但真正值得注意的不是性能接近,而是价格。输出百万 token 0.87 美元,对比 Fable 5 的 50 美元,这不是降价,是换了一套成本坐标系。Agent 模型的竞争第一次从跑分台打到了财务表上。
两小时内的同赛道截胡
发布节奏本身就是一种打法
两小时不是一个普通的时间窗口。DeepSeek 前脚把 V4 Pro 正式版摆上台面,xAI 后脚就把 Grok 4.6 推出来。有人说是巧合,但同一天内两款上千亿参数模型同时亮相,在以往并不常见。它们瞄准的是同一批用户:正在测试 Agent 工作流、编码自动化、需要长链条推理的团队。发布节奏越近,比较越直接。用户还没来得及跑完第一家的测试集,第二家的 API 已经开放。这种贴身发布让市场没法慢慢消化,只能放在一起比价格、比稳定性、比任务完成率。对团队来说,这不是选模型,是被推着重新评估预算。
1.6T 与 1.5T 的参数口径
参数规模聊起来很唬人,但 1.6T 和 1.5T 放在今天已经不是新闻。真正关键的是这些参数怎么被激活、怎么在长任务里保持输出质量。两家都没有把参数当作唯一卖点,而是强调“逼近 Claude Fable 5 体验”。这个说法很有意思:它默认 Fable 5 是 Agent 体验的参照物,然后用参数量去证明自己没偷工减料。但参数大不等于推理稳。团队要看的是长链条任务里会不会中途崩掉,以及输出结果能不能直接进生产。纸面上的 T 数只是入场券。
为什么这次没人提对标 GPT
过去一年,模型发布必谈 GPT 对标。但这次 DeepSeek V4 Pro 和 Grok 4.6 的发布物料里,对照系换成了 Claude Fable 5。这说明行业叙事已经变了:单纯对话能力不再稀缺,能稳定执行多步操作的 Agent 能力才是新基准。GPT 仍然重要,但当团队把预算花在自动化任务上时,他们关心的是模型能不能规划、调用工具、修正错误。对标 GPT 解决不了这个疑问。所以发布会不谈 GPT,谈的是 任务完成率和成本,这才是采购决策里的硬指标。
Agent 能力第一次被摆上价格牌桌
Fable 级体验意味着什么
Claude Fable 5 之所以被反复提起,不是因为它便宜,而是因为它在 Agent 任务里表现稳定。所谓“Fable 级体验”,大致可以理解为:模型能理解复杂指令,拆解任务,调用外部工具,输出格式规范,并且在多步操作中少犯低级错误。这种体验过去是有溢价的。团队愿意为稳定付钱,因为失败重试的成本更高。现在两款新模型声称逼近这种体验,意味着稳定不再是一家独有。如果 Agent 体验开始商品化,价格自然成为下一个战场。
0.87 美元与 50 美元的财务冲击
先算一笔账。输出百万 token 0.87 美元,对比 Fable 5 的 50 美元,差距超过五十倍。哪怕 Fable 5 的价格包含更高阶的推理保障,这个数字也足够让财务负责人停下来。Agent 任务不是单次调用,它需要反复尝试、多轮工具调用、长上下文回填。一个自动化流程跑下来,可能轻轻松松消耗几百万 token。每百万省下几十美元,一个月几百条任务就是一笔可见的利润。以前团队做自动化,先问能不能跑通;现在会先算跑通一次要多少钱。这就是 定价对行为的影响。
自动化任务的成本核算逻辑变了
过去评估模型成本,用的是一次 API 调用多少钱。Agent 模型让这个口径失效了。一次任务可能包含几十次调用、几千行上下文、多次重试。真正该看的是 单任务成本,而不是单 token 价格。DeepSeek V4 Pro 把单 token 价格压下来,实际上是在鼓励团队把更多任务自动化。50 美元的模型可能只用于高价值流程,而 0.87 美元的模型可以覆盖长尾场景。这个变化对开发者的意味是,那些以前因为成本被搁置的自动化需求,现在可以重新拿出来评估。
编码与 Agent 工作流的真实影响
编码模型不再只看 benchmark
编码榜单已经卷不动了。HumanEval 之类的测试越来越像应试教育,模型能过题,不代表能在一个真实 repo 里改对逻辑。DeepSeek V4 Pro 和 Grok 4.6 这次强调 Agent 体验和编码能力,其实在把战场从 benchmark 拉到实际工作流。一个模型能不能读懂项目结构、能不能在 CI 失败后自己定位问题、能不能生成可回滚的补丁,这些比跑分重要得多。对工程师来说,模型价格低意味着可以更频繁地让它尝试。失败成本低,反而提高了成功概率。
团队该重新算账的三种场景
批量代码迁移是一个。以前用贵模型迁移整个代码库,成本高到不敢动,现在可以尝试用低价模型做初稿,再人工 review。自动化测试生成是另一个。测试脚本数量大、重复性高,用 0.87 美元的模型生成再执行,预算可控。还有内部工具调用链。让模型调用多个 API 完成数据汇总、报告生成,这些任务 token 消耗大,价格差直接影响月度账单。三种场景的共同点是:模型稳定性能用,价格就是唯一的门槛。
接下来会发生什么
价格战的下一站
当 Agent 体验不再一家独大,价格战会向两个方向扩散。一是输入价格,因为 Agent 任务往往读得多写得少,输入成本同样关键。二是上下文缓存,长链条任务里重复读取同一批文档,缓存命中率直接决定真实花费。DeepSeek V4 Pro 这次把输出价格打下来,但对手可能从输入价格或缓存价格反击。对买方来说,接下来几个月的模型报价会越来越像云服务商,算 总拥有成本,而不是盯着单 token 标价。
别急着切换生产环境
低价很诱人,但生产环境切换不是改一行 API key 那么简单。需要验证长任务稳定性,测试工具调用格式是否一致,观察限流策略,还要评估数据合规。DeepSeek V4 Pro 和 Grok 4.6 刚发布,真实负载下的表现还需要时间。建议团队先拿非关键任务跑 并行测试,把失败率、重试成本、输出质量都记下来。等数据够了再切生产,别被 0.87 美元冲昏头。价格是决策的一部分,但宕机一次可能吃掉半年省下的成本。
模型发布的节奏会更快
这次两小时内的先后发布不会是最后一次。当头部玩家都盯着 Agent 市场,发布会节奏会被竞争推着走。对团队来说,好处是选择变多、价格向下;坏处是评估成本上升。每个新版本都需要重新测试,过度频繁的发布反而消耗工程资源。聪明的做法不是每个版本都追,而是建立自己的基准测试集,让模型跑同一批任务,用数据决定要不要升级。发布越快,越需要一套稳定的内部评估体系,否则会被版本号牵着走。

