Fireworks 评测 DeepSeek-V4.1-Flash:DeepSWE 达 GPT-6 Astra 水准、成本仅 1/15

发布时间: 2026-09-15 文章分类: AI前沿技术
阅读量: 0
AI智能体
企业级AI智能体开发与部署
LumeValley提供全栈式企业级AI智能体开发与部署服务,涵盖战略规划、场景化开发、企业级应用构建、行业解决方案及算力支撑。从需求分析到持续优化,确保智能体高效稳定运行,助力企业实现智能化转型,提升运营效率与竞争力。

0.43 美元。这是 DeepSeek-V4.1-Flash 在 DeepSWE 上完成一道软件工程任务的花费。同一个基准、相近的分数,GPT-6 Astra 要付出大约十五倍的钱。Fireworks 把这两组数字并排摆在官网上,又补了一句更狠的:max 档下 74.34% 的 pass@1,与 Astra 同一水平。便宜十五倍、成绩不落后,这种组合过去只出现在营销页里,现在有了官方实测数据垫底。

可数字越漂亮,越值得拆开看。三组基准、一个档位、一家厂商的推理服务,构成了这次发布的全部证据链。它能说明什么,不能说明什么,得掰扯清楚。

74.34% 这个数,先问它在哪一档跑出来的

max 档意味着放开了推理预算

编码智能体的评测里,档位往往比模型本身更影响结果。低档位卡住推理长度,模型会在长链路任务里提前收手——测试没跑完就交卷。max 档把预算放开,允许它反复读文件、回滚改动、重跑测试。Fireworks 报的正是这个档位下的成绩,所以 74.34% 回答的是"给足算力它能做到什么",而不是默认配置下的日常表现。打算上线的团队,第一件事是确认自己用的是哪一档。

和 Astra 打平,缩掉的是哪一段差距

GPT-6 Astra 是闭源阵营里编码智能体的标杆机型,DeepSWE 上的完成率长期被当作参照系。这次两者落在同一条水平线上,意味着开源权重模型在标准化任务切分下已经贴到第一梯队,"代差"这个说法基本可以退休了。不过 pass@1 统计的是第一次输出就通过的比例,它奖励稳定,不奖励上限。真正难啃的仓库级重构,看的是把重试和人工介入算进去之后的端到端完成率——那个数字,官方没给。

三组基准拼出的地图有多大

DeepSWE 偏仓库级软件工程,Terminal-Bench 考终端环境里的操作与调试,HLE 则更接近通用推理的天花板。把它们叠在一起,大致能看出模型在"动手"和"动脑"两个方向上的位置。看不到的部分同样要紧:多轮上下文里的漂移、工具调用失败后的恢复、长会话里的指令保持。这三样恰恰是生产环境最容易翻车的地方,而它们都不在榜单上。

十五倍成本差,改的是架构不是预算

便宜不会凭空出现

0.43 美元一任务,压到 Astra 的十五分之一,靠的不是单点优化。MoE 结构的稀疏激活、KV 缓存的复用、推理栈对长上下文的调度,几件事叠在一起才把单位成本拉到这个位置。换句话说,模型权重便宜只是入场券,服务侧工程才是真正让账单缩水的那一环。别的厂商拿同样的权重自建,未必能复现这张价目表。

成本一旦降下来,智能体的设计就会变形

贵的时候,工程师会给 agent 加各种刹车:限制循环次数、压缩上下文、只在关键节点上大模型。便宜之后,这些约束反而成了多余的自我设限。并行跑八条候选路径、让模型自己多试几轮、失败就整段重来——这些策略在 6 美元一次的成本下想都不敢想,在 0.43 美元下只是算术题。真正被这个价格改写的,是团队敢让 agent 干多长的活。

什么情况下这十五倍会被吃回去

如果成功率需要靠三次重试才能追上对手,成本优势立刻砍掉三分之二。如果失败任务的 token 消耗远高于成功任务——这在编码场景里相当常见——实际均价还会往上飘。标价是最理想情况下的单价,账要按自己的任务分布来算。

Agent Arena 第三名,比基准更值得琢磨

榜单上的位置是别人打出来的

基准成绩由厂商自己跑、自己报,天然带着选择偏差。Agent Arena 不一样,它按实际对局排名,DeepSeek-V4.1-Flash(Max)在开源模型里排到第三。这个名次比 74.34% 更有说服力,因为它是被对手和测试环境共同决定的,没有挑选的余地。

首发窗口本身就是一种信号

Fireworks 在模型发布的第一时间给出完整的三组基准,动作很快。推理服务商的竞争早就不在"能不能跑",而在"多久能跑、跑得贵不贵"。谁先把新模型的性价比摸清楚,谁就先拿到那批预算敏感、又急着上 agent 的客户。

便宜模型的坑,通常藏在平均值之外

尾部任务才是分水岭

74.34% 意味着每四道题里就有一道没过。这四分之一长什么样,决定了一个模型能不能进生产——是那种一眼可见的语法错误,还是需要理解整个代码库意图的隐性 bug?前者重试一次就能补上,后者会把重试成本堆成雪球。基准报告给的是均值,团队要的是尾部。

换模型从来不是换个 API 地址

提示词要重调,工具调用的格式要重测,缓存策略要重算。一个模型在 A 框架里表现良好,换到 B 框架里可能因为工具描述格式不匹配而掉十几个点。迁移成本真实存在,评估的时候别只算 token 单价。

该不该切过去

现在就值得试的情况

任务边界清晰、单次执行时长可控、失败可以无脑重试的场景——代码补全、单元测试生成、日志分析、批量重构,这些是 0.43 美元单价最直接的受益者。先跑一批影子流量,把自己的任务分布喂进去,比看任何榜单都准。

建议再等等的情况

需要长周期上下文保持、需要跨会话记忆、或者单次失败代价极高的任务,先别急着换。这类场景下模型之间的差距会被放大,省下来的钱很可能被一次事故抵消。等社区把真实工作负载的复现结果攒够,再动手不迟。

AI智能体
企业级AI智能体开发与部署方案
LumeValley打造企业级AI智能体全流程方案,涵盖需求洞察、定制开发、多平台适配部署。凭借专业算法与丰富经验,确保智能体精准理解业务,高效执行任务,无缝融入企业生态,为企业数字化转型提供强劲智能引擎,提升核心竞争力。
点赞 | 67

Lumevalley——全栈AI服务领航者,以“战略-应用-算力”三位一体服务框架,为企业提供从顶层战略规划、场景化AI智能体(AI Agent)开发/搭建/部署,到企业级AI应用开发、AI+行业场景解决方案的全链路服务,并配套AI大模型部署与高性能AI算力底座支撑,助力客户在营销、服务、运营等核心环节实现效率倍增与模式创新。

马上扫码获取产品资料
相关文章

相关文章

填写以下信息, 免费获取方案报价
姓名
手机号码
企业名称
  • 建筑建材
  • 化工
  • 钢铁
  • 机械设备
  • 原材料
  • 工业
  • 环保
  • 生鲜
  • 医疗
  • 快消品
  • 农林牧渔
  • 汽车汽配
  • 橡胶
  • 工程
  • 加工
  • 仪器仪表
  • 纺织
  • 服装
  • 电子元器件
  • 物流
  • 化塑
  • 食品
  • 房地产
  • 交通运输
  • 能源
  • 印刷
  • 教育
  • 跨境电商
  • 旅游
  • 皮革
  • 3C数码
  • 金属制品
  • 批发
  • 研究和发展
  • 其他行业
需求描述
填写以下信息马上为您安排系统演示
姓名
手机号码
你的职位
企业名称

恭喜您的需求提交成功

尊敬的用户,您好!

您的需求我们已经收到,我们会为您安排专属电商商务顾问在24小时内(工作日时间)内与您取得联系,请您在此期间保持电话畅通,并且注意接听来自广州区域的来电。
感谢您的支持!

您好,我是您的专属产品顾问
扫码添加我的微信,免费体验系统
(工作日09:00 - 18:00)
电话咨询 (工作日09:00 - 18:00)
客服热线: 18011747352
售前热线: 189 2432 2993
扫码即可快速拨打热线