DeepSeek V4.1 Flash 在 ARC-AGI (Verified) 评测中的成绩公布

发布时间: 2026-10-06 文章分类: AI前沿技术
阅读量: 0
AI智能体
企业级AI智能体开发与部署
LumeValley提供全栈式企业级AI智能体开发与部署服务,涵盖战略规划、场景化开发、企业级应用构建、行业解决方案及算力支撑。从需求分析到持续优化,确保智能体高效稳定运行,助力企业实现智能化转型,提升运营效率与竞争力。

72.9%。这是 ARC Prize 公布的 DeepSeek V4.1 Flash 在 ARC-AGI-2 上的成绩,每个任务花掉 0.13 美元;换到 ARC-AGI-1,它拿到 94.5%,单任务成本 0.07 美元。相比 V4 Flash 的历史最好成绩,两项分别高出 11.5 分和 5.5 分,代价是每任务成本上涨约 250%。这组数字里最值得琢磨的,其实不是那个 72.9%,而是后面三个带美元符号的小数——它们比分数更早暴露出这一代模型真正的取舍。

分数只是门票,账单才是判决书

先把数字摆清楚

ARC-AGI-1 的 94.5% 和 ARC-AGI-2 的 72.9%,放在一起看才有意义。这两个基准难度不在一个量级,前者的题目更接近"规则清晰但样本极少",后者把抽象层级又往上推了一截,公开成绩的分布也更散。同一个模型在两个基准上出现二十多个百分点的落差,属于正常现象,不该被解读成"退步"。

真正透露信息的是对比项。V4 Flash 的最好成绩被 V4.1 Flash 分别超过 11.5 分和 5.5 分——这是同门内部迭代,不是外来挑战者掀桌子。版本号里那个".1"已经说明了一切:这不是重造,是加强。

被忽略的那个分母

过去两年,几乎所有模型发布都在比谁的分数更高,很少有人把"每个任务多少钱"写进标题。ARC Prize 这次把它和分数并列公布,本身就是一种立场。0.13 美元听起来像个零头,但乘以规模就不一样了:一万个任务 1300 美元,十万个任务 1.3 万美元。而 ARC-AGI 这类题目往往逼着模型跑很长的推理链,token 消耗远高于普通问答。

更关键的是,这个成本对应的还只是"单次作答"。真实产品里要重试、要投票、要加校验层,账单还要再往上翻。

贵三倍半,多买 11.5 分

每任务成本上涨约 250%,换回来的是 ARC-AGI-2 上 11.5 分的提升。这个交换划不划算,取决于你站在谁的立场上。

对研究团队,这是一笔划算买卖——ARC-AGI-2 的分数越往上越难啃,11.5 分属于实打实的台阶。对采购方,账要换个算法:如果任务量是百万级,成本从 A 涨到 3.5A,预算表会先于技术评估发出尖叫。所以这次公布的真正价值,不是让人感叹"又强了",而是第一次把边际智能的价格摊在桌面上。

ARC-AGI 从来不是刷榜游戏

它考的是没见过的东西

ARC-AGI 的题目形态很朴素:一张张彩色网格进,一张彩色网格出。规则不给,只给两三个示例,剩下的靠推。这种设计的靶心是少样本归纳能力,而不是知识储备。

也正因如此,它天生抗记忆。你把整个互联网的题解背下来,遇到新网格照样卡住。这就是为什么它能在众声喧哗的评测榜单里保留一点公信力。

人觉得简单,机器觉得难

八岁小孩能做的题,模型却常年不及格,这件事曾经被反复拿来说事。原因不神秘:人靠一两个例子就能抽出一条抽象规则,再把它搬到新场景里;模型要在上下文里完成同样的跃迁,缺的往往不是算力,而是先验。它能算,但不知道往哪儿算。

于是解题路径被拉长,思维链被撑大,每任务成本自然往上走。分数与成本的这层因果,比任何跑分截图都更接近技术真相。

Verified 那两个字值不少钱

公开任务一旦被训进模型,就不再干净。ARC Prize 的 Verified 版本是重新筛过的集合,目的就是让成绩单不含水分。同样的 72.9%,标在 Verified 上,含金量完全不同。

这一点对读者很重要:看到分数先看集合,别被裸数字带走。

DeepSeek 在赌什么

迭代快,但步子收着走

从 V4 Flash 到 V4.1 Flash,命名本身透露了节奏感。同一个基座,打补丁式升级,重点不在参数规模,而在推理效率和正确率的边际改善。这种打法省资源,也省时间,代价是每次跃升幅度有限。

用 250% 的成本上涨换十来个点的分数,说明这一代的能力提升,很大一部分是靠更多思考时间和更强验证机制堆出来的,而不是靠更聪明的内部结构。

便宜是入口,不是护城河

DeepSeek 的长期标签是性价比。0.07 美元跑完一个 ARC-AGI-1 任务,这个价格足以让不少团队心动。但价格优势有个天然保质期——竞品跟进的周期通常是几个月。等对手把单任务成本压到同一水位,比的就又是别的东西了。

所以更值得观察的不是"现在多便宜",而是"这条成本曲线还能压多久"。

贵在哪,得说清楚

成本上行通常来自三处:更长的思维链、多次采样取最优、外加一层校验器。三者都能提分,也都能把账单撑大。V4.1 Flash 到底是哪一项在吃预算,官方没说,但方向无非这几种。

这个问题不解决,下一代的定价空间就会变窄。

下一轮比拼,账本比分数先翻页

成本曲线还压得下去吗

如果 V4.2 或 V5 能在保持 72.9% 的同时把单任务成本砍回 0.05 美元,那才是真正的技术拐点。提分不难,提分的同时降价才难。算力效率会成为下一阶段的主战场,而不是参数表。

从历史看,同一代模型在半年内把推理成本压低一个数量级并不罕见。所以现在这个 0.13 美元,很可能只是临时价签。

基准的保质期有多长

ARC-AGI-1 已经冲到 94.5%,这个集合基本被啃穿了。ARC-AGI-2 的 72.9% 还留着空间,但按当前速度,一两年内也会逼近饱和。基准的生命周期越来越短,ARC Prize 需要不断造新题,模型厂则需要不断找新靶子。

这是评测机构与模型团队之间一场没有终点的赛跑。

买单的人换了尺子

最实际的变化发生在采购侧。两年前问的是"哪个模型最强",现在问的是"每解决一个任务花多少钱、错误率多少、重试几次"。评分表从单一维度变成了三元组:分数、价格、稳定性。

DeepSeek V4.1 Flash 这份成绩单之所以值得单拎出来讲,正在于它同时给出了三个数字。它没有宣称自己是最强的,但它把选择的成本讲明白了。而在真实世界里,讲明白了成本,往往比多拿几分更能说服人。

AI智能体
企业级AI智能体开发与部署方案
LumeValley打造企业级AI智能体全流程方案,涵盖需求洞察、定制开发、多平台适配部署。凭借专业算法与丰富经验,确保智能体精准理解业务,高效执行任务,无缝融入企业生态,为企业数字化转型提供强劲智能引擎,提升核心竞争力。
点赞 | 6

Lumevalley——全栈AI服务领航者,以“战略-应用-算力”三位一体服务框架,为企业提供从顶层战略规划、场景化AI智能体(AI Agent)开发/搭建/部署,到企业级AI应用开发、AI+行业场景解决方案的全链路服务,并配套AI大模型部署与高性能AI算力底座支撑,助力客户在营销、服务、运营等核心环节实现效率倍增与模式创新。

马上扫码获取产品资料
相关文章

相关文章

填写以下信息, 免费获取方案报价
姓名
手机号码
企业名称
  • 建筑建材
  • 化工
  • 钢铁
  • 机械设备
  • 原材料
  • 工业
  • 环保
  • 生鲜
  • 医疗
  • 快消品
  • 农林牧渔
  • 汽车汽配
  • 橡胶
  • 工程
  • 加工
  • 仪器仪表
  • 纺织
  • 服装
  • 电子元器件
  • 物流
  • 化塑
  • 食品
  • 房地产
  • 交通运输
  • 能源
  • 印刷
  • 教育
  • 跨境电商
  • 旅游
  • 皮革
  • 3C数码
  • 金属制品
  • 批发
  • 研究和发展
  • 其他行业
需求描述
填写以下信息马上为您安排系统演示
姓名
手机号码
你的职位
企业名称

恭喜您的需求提交成功

尊敬的用户,您好!

您的需求我们已经收到,我们会为您安排专属电商商务顾问在24小时内(工作日时间)内与您取得联系,请您在此期间保持电话畅通,并且注意接听来自广州区域的来电。
感谢您的支持!

您好,我是您的专属产品顾问
扫码添加我的微信,免费体验系统
(工作日09:00 - 18:00)
电话咨询 (工作日09:00 - 18:00)
客服热线: 18011747352
售前热线: 189 2432 2993
扫码即可快速拨打热线