Sherwin Wu 此前觉得 ARC-AGI-3 难到近乎无解——现在这个基准被 Astra 直接打穿了。太快了。快到 François Chollet 自己都不得不修正预期:他当时估摸前沿模型要花一年才能饱和,结果只用六个月,约为预计速度的两倍。Chollet 是这套基准的缔造者,也是最懂 ARC 难度曲线的人。连他都低估了下一代模型,说明我们正踩在一个认知断崖的边缘。
ARC-AGI-3 设计的初衷是测试抽象推理,而不是让模型靠刷题库混分。它能扛住上一代模型的暴力记忆,却在 Astra 面前只撑了半年。这不是某个单项指标小幅攀升,而是能力曲线整体右移。更关键的是,新一代模型的能力将挑战人们基于旧模型形成的 AI 观点——这句话不是修辞,是现实。你过去觉得“AI 做不到的事”清单,正在以双倍速作废。
一个值得玩味的细节是:Sherwin Wu 自己就是站在前沿的人。他的“难”基于大量实测和深入理解,而 Astra 的饱和并非简单堆算力或数据。它揭示出推理能力的瓶颈可能比我们想象的更脆弱。当基准设计者的预期被现实甩开半年,我们该调整的不是某个模型分数,而是对 AI 进展速度的整套判断框架。下一个被证伪的,可能就是你此刻最笃定的那个结论。

