72.9%。这是 ARC Prize 公布的 DeepSeek V4.1 Flash 在 ARC-AGI-2 上的成绩,每个任务花掉 0.13 美元;换到 ARC-AGI-1,它拿到 94.5%,单任务成本 0.07 美元。相比 V4 Flash 的历史最好成绩,两项分别高出 11.5 分和 5.5 分,代价是每任务成本上涨约 250%。这组数字里最值得琢磨的,其实不是那个 72.9%,而是后面三个带美元符号的小数——它们比分数更早暴露出这一代模型真正的取舍。
分数只是门票,账单才是判决书
先把数字摆清楚
ARC-AGI-1 的 94.5% 和 ARC-AGI-2 的 72.9%,放在一起看才有意义。这两个基准难度不在一个量级,前者的题目更接近"规则清晰但样本极少",后者把抽象层级又往上推了一截,公开成绩的分布也更散。同一个模型在两个基准上出现二十多个百分点的落差,属于正常现象,不该被解读成"退步"。
真正透露信息的是对比项。V4 Flash 的最好成绩被 V4.1 Flash 分别超过 11.5 分和 5.5 分——这是同门内部迭代,不是外来挑战者掀桌子。版本号里那个".1"已经说明了一切:这不是重造,是加强。
被忽略的那个分母
过去两年,几乎所有模型发布都在比谁的分数更高,很少有人把"每个任务多少钱"写进标题。ARC Prize 这次把它和分数并列公布,本身就是一种立场。0.13 美元听起来像个零头,但乘以规模就不一样了:一万个任务 1300 美元,十万个任务 1.3 万美元。而 ARC-AGI 这类题目往往逼着模型跑很长的推理链,token 消耗远高于普通问答。
更关键的是,这个成本对应的还只是"单次作答"。真实产品里要重试、要投票、要加校验层,账单还要再往上翻。
贵三倍半,多买 11.5 分
每任务成本上涨约 250%,换回来的是 ARC-AGI-2 上 11.5 分的提升。这个交换划不划算,取决于你站在谁的立场上。
对研究团队,这是一笔划算买卖——ARC-AGI-2 的分数越往上越难啃,11.5 分属于实打实的台阶。对采购方,账要换个算法:如果任务量是百万级,成本从 A 涨到 3.5A,预算表会先于技术评估发出尖叫。所以这次公布的真正价值,不是让人感叹"又强了",而是第一次把边际智能的价格摊在桌面上。
ARC-AGI 从来不是刷榜游戏
它考的是没见过的东西
ARC-AGI 的题目形态很朴素:一张张彩色网格进,一张彩色网格出。规则不给,只给两三个示例,剩下的靠推。这种设计的靶心是少样本归纳能力,而不是知识储备。
也正因如此,它天生抗记忆。你把整个互联网的题解背下来,遇到新网格照样卡住。这就是为什么它能在众声喧哗的评测榜单里保留一点公信力。
人觉得简单,机器觉得难
八岁小孩能做的题,模型却常年不及格,这件事曾经被反复拿来说事。原因不神秘:人靠一两个例子就能抽出一条抽象规则,再把它搬到新场景里;模型要在上下文里完成同样的跃迁,缺的往往不是算力,而是先验。它能算,但不知道往哪儿算。
于是解题路径被拉长,思维链被撑大,每任务成本自然往上走。分数与成本的这层因果,比任何跑分截图都更接近技术真相。
Verified 那两个字值不少钱
公开任务一旦被训进模型,就不再干净。ARC Prize 的 Verified 版本是重新筛过的集合,目的就是让成绩单不含水分。同样的 72.9%,标在 Verified 上,含金量完全不同。
这一点对读者很重要:看到分数先看集合,别被裸数字带走。
DeepSeek 在赌什么
迭代快,但步子收着走
从 V4 Flash 到 V4.1 Flash,命名本身透露了节奏感。同一个基座,打补丁式升级,重点不在参数规模,而在推理效率和正确率的边际改善。这种打法省资源,也省时间,代价是每次跃升幅度有限。
用 250% 的成本上涨换十来个点的分数,说明这一代的能力提升,很大一部分是靠更多思考时间和更强验证机制堆出来的,而不是靠更聪明的内部结构。
便宜是入口,不是护城河
DeepSeek 的长期标签是性价比。0.07 美元跑完一个 ARC-AGI-1 任务,这个价格足以让不少团队心动。但价格优势有个天然保质期——竞品跟进的周期通常是几个月。等对手把单任务成本压到同一水位,比的就又是别的东西了。
所以更值得观察的不是"现在多便宜",而是"这条成本曲线还能压多久"。
贵在哪,得说清楚
成本上行通常来自三处:更长的思维链、多次采样取最优、外加一层校验器。三者都能提分,也都能把账单撑大。V4.1 Flash 到底是哪一项在吃预算,官方没说,但方向无非这几种。
这个问题不解决,下一代的定价空间就会变窄。
下一轮比拼,账本比分数先翻页
成本曲线还压得下去吗
如果 V4.2 或 V5 能在保持 72.9% 的同时把单任务成本砍回 0.05 美元,那才是真正的技术拐点。提分不难,提分的同时降价才难。算力效率会成为下一阶段的主战场,而不是参数表。
从历史看,同一代模型在半年内把推理成本压低一个数量级并不罕见。所以现在这个 0.13 美元,很可能只是临时价签。
基准的保质期有多长
ARC-AGI-1 已经冲到 94.5%,这个集合基本被啃穿了。ARC-AGI-2 的 72.9% 还留着空间,但按当前速度,一两年内也会逼近饱和。基准的生命周期越来越短,ARC Prize 需要不断造新题,模型厂则需要不断找新靶子。
这是评测机构与模型团队之间一场没有终点的赛跑。
买单的人换了尺子
最实际的变化发生在采购侧。两年前问的是"哪个模型最强",现在问的是"每解决一个任务花多少钱、错误率多少、重试几次"。评分表从单一维度变成了三元组:分数、价格、稳定性。
DeepSeek V4.1 Flash 这份成绩单之所以值得单拎出来讲,正在于它同时给出了三个数字。它没有宣称自己是最强的,但它把选择的成本讲明白了。而在真实世界里,讲明白了成本,往往比多拿几分更能说服人。

