88.06%。ARC-AGI-2 高分榜的榜首换成了 TUFA Labs,这个成绩比第二名高出一大截。更值得注意的是,它越过了 85%——ARC Prize 2026 赛季专门为这条线设了一笔 15 万美元的 Bonus Prize。
85% 这道线,被跨过去了
为什么是 85%,不是 90%
ARC Prize 把 85% 单独拎出来做奖励门槛,不是随手定的。ARC-AGI-2 上线以来,这个基准的得分曲线一直很刁钻:前期进展快,随后迅速撞墙,不少方案在 60% 到 80% 之间反复摩擦。85% 大致对应着"解法已经不只是技巧堆叠"的位置。
TUFA Labs 交出的 88.06%,说明它不只是摸到了门框,还往里走了一步。
15 万美元不归一个人
这笔 Bonus Prize 的分配规则值得多看两眼:不是"第一个过线的独吞",而是"所有超过 85% 的团队平分"。奖励从竞速变成了共享,这会实打实地改变参赛者的策略——藏招的收益变低了,公开方法的压力变大了。
按目前公开的榜单看,前五名里只有 TUFA Labs 站在 85% 以上。也就是说,这 15 万美元眼下很可能由一家拿走。但规则摆在那儿,后来者随时可以挤进来分账。
奖金是注脚,时间点才是正文
10 万美元的常规奖金加上 15 万美元的额外奖励,听着不少,放在 ARC Prize 的整体盘子里却只是零头。真正被反复引用的是那个进度条:模型刚面对 ARC-AGI-2 时几乎交白卷,前沿模型一度在个位数到二十几之间徘徊,到现在有人稳定跑到 88%。
速度本身就是结论。一个被刻意设计成抗记忆、抗暴力枚举的基准,如果被推得这么快,说明围绕它的方法论正在快速收敛。
中段榜单藏着更真实的信息
四个名字,四段距离
第 2 名 Rabbithole,80.56%;第 3 名 Yi-Chia Chen,77.22%;第 4 名 Nubanana,77.08%;第 5 名 _hans,67.64%。把这几组数字排开,能看到两种完全不同的落差。
77% 附近挤成一团
第 3 和第 4 名之间只差 0.14 个百分点。这个量级已经接近评测波动本身——同一套方法多跑几次,排名就可能互换。换句话说,77% 是个拥挤的区间,至少有两支队伍卡在同一个台阶上,谁也没找到往上跳的支点。
从 80.56% 掉到 77.22%,损失 3.34 个百分点;再往下,从 77.08% 到 67.64%,一口气丢了 9.44 个点。前五名内部的分布一点也不平滑。榜首和第二名之间那条 7.5 个点的沟,宽度几乎等于第 3 名和第 5 名的全部差距。
断层出现在 67%
第 5 名 67.64% 与第 4 名之间的落差,比榜首到第二名还大。榜单越往下走,分数掉得越快——这通常意味着方法层面存在明显分层:有人已经掌握了可复用的抽象策略,有人还在靠针对性的工程技巧一点点抠分。
另一个细节容易被忽略:从署名看,榜上既有机构团队,也有以个人名义提交的研究者。ARC-AGI-2 的门槛并没有把独立研究者挡在门外,这在动辄需要大集群的推理类基准里并不常见。
这个分数该信几分
ARC-AGI-2 从来不考知识
ARC-AGI 系列的设计逻辑和大多数基准相反。它给出几组彩色网格,要求解题者现场推断变换规则,再套用到新网格上。题目对人类不算难,对模型却长期是硬骨头,因为它考的是即时归纳,而不是检索。
所以看榜不能只看数字。对外公布的高分榜之外,ARC Prize 的正式评比还有一层不公开的验证环节。公开集可以反复试错、反复调参,私有集不能。这两者之间的分差,才是判断一个成绩含金量的关键。
榜单成绩不等于泛化能力
还有几个问题得问清楚:这个成绩花了多少算力?是单模型直出,还是多路采样再挑最好的那一个?有没有针对公开集的调优痕迹?
这三件事不回答,88.06% 就只是一个数字,不是一项能力。ARC-AGI-2 的价值恰恰在这里——题目设计就是要压住背题这条路,逼着解题者展示真正的泛化。分数越高,这些追问就越必要,而不是越少。
接下来盯三件事
第一,TUFA Labs 会不会把方法公开。ARC Prize 一贯鼓励参赛者写清楚方案,一份可复现的技术报告,分量不比排名轻。第二,85% 以上会不会很快从独苗变成一群人——如果真出现分账局面,那才是这个基准被实质性攻破的信号。第三,成本。
一个 88% 的成绩,如果跑一次要烧掉六位数美元,那它距离"通用智能往前迈了一步"这种说法,还得重新丈量一遍。

