0.43 美元。这是 DeepSeek-V4.1-Flash 在 DeepSWE 上完成一道软件工程任务的花费。同一个基准、相近的分数,GPT-6 Astra 要付出大约十五倍的钱。Fireworks 把这两组数字并排摆在官网上,又补了一句更狠的:max 档下 74.34% 的 pass@1,与 Astra 同一水平。便宜十五倍、成绩不落后,这种组合过去只出现在营销页里,现在有了官方实测数据垫底。
可数字越漂亮,越值得拆开看。三组基准、一个档位、一家厂商的推理服务,构成了这次发布的全部证据链。它能说明什么,不能说明什么,得掰扯清楚。
74.34% 这个数,先问它在哪一档跑出来的
max 档意味着放开了推理预算
编码智能体的评测里,档位往往比模型本身更影响结果。低档位卡住推理长度,模型会在长链路任务里提前收手——测试没跑完就交卷。max 档把预算放开,允许它反复读文件、回滚改动、重跑测试。Fireworks 报的正是这个档位下的成绩,所以 74.34% 回答的是"给足算力它能做到什么",而不是默认配置下的日常表现。打算上线的团队,第一件事是确认自己用的是哪一档。
和 Astra 打平,缩掉的是哪一段差距
GPT-6 Astra 是闭源阵营里编码智能体的标杆机型,DeepSWE 上的完成率长期被当作参照系。这次两者落在同一条水平线上,意味着开源权重模型在标准化任务切分下已经贴到第一梯队,"代差"这个说法基本可以退休了。不过 pass@1 统计的是第一次输出就通过的比例,它奖励稳定,不奖励上限。真正难啃的仓库级重构,看的是把重试和人工介入算进去之后的端到端完成率——那个数字,官方没给。
三组基准拼出的地图有多大
DeepSWE 偏仓库级软件工程,Terminal-Bench 考终端环境里的操作与调试,HLE 则更接近通用推理的天花板。把它们叠在一起,大致能看出模型在"动手"和"动脑"两个方向上的位置。看不到的部分同样要紧:多轮上下文里的漂移、工具调用失败后的恢复、长会话里的指令保持。这三样恰恰是生产环境最容易翻车的地方,而它们都不在榜单上。
十五倍成本差,改的是架构不是预算
便宜不会凭空出现
0.43 美元一任务,压到 Astra 的十五分之一,靠的不是单点优化。MoE 结构的稀疏激活、KV 缓存的复用、推理栈对长上下文的调度,几件事叠在一起才把单位成本拉到这个位置。换句话说,模型权重便宜只是入场券,服务侧工程才是真正让账单缩水的那一环。别的厂商拿同样的权重自建,未必能复现这张价目表。
成本一旦降下来,智能体的设计就会变形
贵的时候,工程师会给 agent 加各种刹车:限制循环次数、压缩上下文、只在关键节点上大模型。便宜之后,这些约束反而成了多余的自我设限。并行跑八条候选路径、让模型自己多试几轮、失败就整段重来——这些策略在 6 美元一次的成本下想都不敢想,在 0.43 美元下只是算术题。真正被这个价格改写的,是团队敢让 agent 干多长的活。
什么情况下这十五倍会被吃回去
如果成功率需要靠三次重试才能追上对手,成本优势立刻砍掉三分之二。如果失败任务的 token 消耗远高于成功任务——这在编码场景里相当常见——实际均价还会往上飘。标价是最理想情况下的单价,账要按自己的任务分布来算。
Agent Arena 第三名,比基准更值得琢磨
榜单上的位置是别人打出来的
基准成绩由厂商自己跑、自己报,天然带着选择偏差。Agent Arena 不一样,它按实际对局排名,DeepSeek-V4.1-Flash(Max)在开源模型里排到第三。这个名次比 74.34% 更有说服力,因为它是被对手和测试环境共同决定的,没有挑选的余地。
首发窗口本身就是一种信号
Fireworks 在模型发布的第一时间给出完整的三组基准,动作很快。推理服务商的竞争早就不在"能不能跑",而在"多久能跑、跑得贵不贵"。谁先把新模型的性价比摸清楚,谁就先拿到那批预算敏感、又急着上 agent 的客户。
便宜模型的坑,通常藏在平均值之外
尾部任务才是分水岭
74.34% 意味着每四道题里就有一道没过。这四分之一长什么样,决定了一个模型能不能进生产——是那种一眼可见的语法错误,还是需要理解整个代码库意图的隐性 bug?前者重试一次就能补上,后者会把重试成本堆成雪球。基准报告给的是均值,团队要的是尾部。
换模型从来不是换个 API 地址
提示词要重调,工具调用的格式要重测,缓存策略要重算。一个模型在 A 框架里表现良好,换到 B 框架里可能因为工具描述格式不匹配而掉十几个点。迁移成本真实存在,评估的时候别只算 token 单价。
该不该切过去
现在就值得试的情况
任务边界清晰、单次执行时长可控、失败可以无脑重试的场景——代码补全、单元测试生成、日志分析、批量重构,这些是 0.43 美元单价最直接的受益者。先跑一批影子流量,把自己的任务分布喂进去,比看任何榜单都准。
建议再等等的情况
需要长周期上下文保持、需要跨会话记忆、或者单次失败代价极高的任务,先别急着换。这类场景下模型之间的差距会被放大,省下来的钱很可能被一次事故抵消。等社区把真实工作负载的复现结果攒够,再动手不迟。

