三周。Google DeepMind 只用了三周,就把Gemini Flash 系列的价格砍了一半。新的 Gemini 3.7 Flash 来了,输入每百万 token 0.75 美元,输出 3.75 美元,主打编程与智能体任务。这不是小修小补,这是直接把成本敏感型编码智能体团队从预算表里拽了出来。
三周,价格腰斩,Flash 系列在跑什么
从 3.6 到 3.7,迭代节奏已经按周计算
三周前 Gemini 3.6 Flash 刚刚发布,现在 3.7 Flash 就摆到了台面上。这种节奏放在一年前几乎不可想象。开发者习惯的是几个月等一次模型更新,再花几周做适配。如今 Flash 系列的更新频率已经压缩到按周计算。这个系列本身的定位就是轻量、低成本、快速响应,适合大规模调用。DeepMind 这次没有在规格参数上绕弯子,直接给出一个让市场无法忽视的数字:输入输出价格较前代腰斩。这意味着 Flash 产品线不再只是技术展示,而是真正进入开发者工作负载的争夺战。
0.75 美元这个数字,为什么值得写进账本
对普通聊天应用来说,每百万 token 0.75 美元可能只是一个抽象数字。但编码智能体的消耗逻辑完全不同。一个软件工程 agent 跑一次任务,可能需要几十轮甚至上百轮的工具调用、代码生成、环境反馈与重试。输入 token 会被反复消耗。价格从上一代直接砍半,单个任务省下的绝对金额或许不大,但乘以每天数千次任务、再乘以以月为单位的持续运行,成本曲线会明显下移。成本敏感型团队尤其看重这一点,因为他们评估模型时不是看单次价格,而是看跑完整条流水线的总拥有成本。
不再挤牙膏,而是直接改写性价比基线
过去模型厂商降价通常遵循缓慢递减的节奏,小幅下调、小幅提升。Gemini 3.7 Flash 这次把价格和性能组合在一起打,显然不是挤牙膏。它把上一代 3.6 Flash 的定价直接腰斩,同时官方披露 FrontierCode 和 DeepSWE 两项基准分数提升。这意味着“便宜”和“能用”不再需要做取舍。对于正在评估是否扩大智能体部署规模的团队来说,这条消息传递的信号很直接:你手上那张成本表需要重做了。性价比基线已经被向前推了一截。
编码智能体这次拿到了新燃油
FrontierCode 和 DeepSWE 的分数上探,不是装饰
在模型发布公告里,基准分数往往被包装成营销素材。但 FrontierCode 和 DeepSWE 这两项指标对编码智能体团队有实际参考价值。FrontierCode 对应代码生成能力,DeepSWE 则更贴近软件工程智能体的综合表现。官方明确提到这两项分数提升,说明 3.7 Flash 不只是便宜,而是在编程任务上确实比以前更可靠。更值得关注的是,这种提升是在价格减半的条件下实现的。过去“低价模型性能打折”的预期被打破了。
从补全到智能体,Flash 系列在换赛道
传统代码补全只需要预测下一行,而编码智能体要理解任务、规划步骤、调用工具、处理错误并自我修正。这对模型的多步推理、工具调用和长上下文处理能力提出了完全不同的要求。Gemini 3.7 Flash 直接把“智能体任务”作为主打方向,说明 Flash 系列不再只是给简单场景准备的便宜货,而是开始切入更重的工作负载。DeepSWE 分数的提升正是这个转向的注脚。Google 想告诉开发者:你可以用 Flash 跑更复杂的事情了。
成本敏感型团队应该重新算一笔账
很多团队在选择模型时,长期卡在一个两难里:要么为复杂智能体支付高昂的模型费用,要么为了控制成本砍掉一部分自动化任务。Gemini 3.7 Flash 的出现让这个选择变得不那么尖锐。输入 0.75 美元、输出 3.75 美元,同时给出更好的编程基准,等于把那个“性价比基线”移动了。这不是一个孤立的价格标签,它会成为后续模型发布的参照系。其他厂商如果还想在编码智能体市场占住位置,就不得不回应这个价格点。对开发者来说,重新算账的时候到了。
Google 的节奏与开发者的实际选择
三周一发,DeepMind 在焦虑什么
三周就更新一代 Flash,这不是常规操作。它说明 Google DeepMind 在模型竞赛中感受到了巨大的压力。Anthropic、OpenAI 都在往编码智能体方向发力,价格战也已经开始。Flash 系列作为 Google 面向开发者的走量产品,必须快速响应市场变化。三周迭代可能意味着内部研发管线已经高度自动化,也可能意味着上一代 3.6 Flash 存在某些需要快速修正的短板。无论真实原因是什么,这种节奏对竞争对手来说都是压迫性的。它让“等下一个版本”变成了一种很被动的策略。
Cursor builds 也在加速,这不是巧合
同期的消息里,Cursor 推出 builds,云智能体启动速度提升至 3 倍。这听起来是另一个产品线的新闻,但放在一起看,行业趋势很清楚:模型层在降价增能,工具层在优化执行效率。开发者的实际体验不是单一模型价格决定的,而是端到端完成任务的成本和时间共同决定的。当模型更便宜、工具启动更快,编码智能体的单位经济模型才开始真正正循环。这两件事同时发生,说明智能体开发的基础设施正在从“能用”走向“可规模化”。
开发者该怎么跟进,而不是被节奏带着走
价格减半不代表所有任务都应该立刻切到 3.7 Flash。需要做的是重新评估自己的任务集。哪些工作负载适合 Flash 系列,哪些仍然需要更强的模型,要按任务难度分层。价格腰斩最大的价值是让你敢于把更多中低复杂度任务交给 3.7 Flash,把省下来的预算留给少数高难度场景。这也意味着你需要建立更细粒度的成本监控和模型路由机制。模型迭代这么快,最好的策略不是追新,而是让自己手里的分配逻辑足够灵活。

