GPT-6 Astra刚压过发布线,评测圈就先吵成一团。Epoch AI在横跨267个模型的队列里给了它169分,排名第一;紧接着,Artificial Analysis只打出61分,说它与前代Sol基本持平,还落在Claude Fable 5.1的66分之后。同一款旗舰模型,一边封神,一边原地踏步,这两句话同时为真。问题不在于哪个分数错了,而在于当基准评测自己先打起架来,我们该怎么读懂真正的技术信号。
同一颗模型,凭什么拿到两个悬殊分数?
169分,Epoch AI亮出全场最高牌
先看169分意味着什么。Epoch AI的榜单横跨267个模型,能够登上这个顶端的模型,在它定义的维度里就是现阶段的最强。GPT-6 Astra拿到这一成绩,说明它的推理能力足以在一个很大的模型集合中脱颖而出。若只用Epoch AI的尺子衡量,你看不到任何关于“退步”的蛛丝马迹。
61分,前代Sol和Claude Fable 5.1都在前方
同样必须承认,61分也来自一套被行业长期引用的评价体系。Artificial Analysis把GPT-6 Astra与它的前代Sol放在同一套测试框架内,结论是两者几乎没有拉开代差;更值得注意的是Claude Fable 5.1拿到66分,压了它一头。顺着这组数字往下读,GPT-6 Astra并不具备全方位碾压旧旗舰的统治力,更像是一个在每个方向上重新调校过的进化版本。
两个分数之间,隔着一种“智能观”
但别急着站队。169与61之间,不存在某种正确的换算率。Epoch AI测的是模型在极限难度任务中的绝对实力,Artificial Analysis测的是模型在真实使用场景中的综合可用性。两者都可以用严格的测试流程证明自己,也都在用不同的关键词回答“什么是更强的模型”。要理解GPT-6 Astra的位置,最好先承认这一层认知分歧。
别急着判断强弱,先看评测在奖励什么
既然排行榜不能直接互相换算,下一步值得做的是拆开它们的刻度。这样你才能看到GPT-6 Astra在不同坐标系中的真实坐标。
Epoch AI的尺度:算力转化为能力的速率
Epoch AI的长期研究重心,落在算力与AI能力增长之间的关系上。它的评测框架天然更看重推理纵深、大规模训练带来的系统性提升。GPT-6 Astra能在这种框架内排在第一,说明它在把巨量计算资源转化为可用答案这一层已经做得足够好。这种优势也会成为后续一切复杂任务的基础。
Artificial Analysis的尺度:好用才是硬道理
Artificial Analysis的评测视角不同,它站在API服务与开发者需求的交界处观察模型——速度、价格、稳定性这些指标会一起参与打分。GPT-6 Astra在这里只拿61分,未必意味着核心能力退步,更可能的情况是:它在许多分项任务上没有横扫前代,也没有拉开与竞品的安全距离。那些分数对生产环境选型的人来说,往往比争第一更能说明问题。
编码智能体追平Fable 5,价格却高出一截
把价格因素拉进来后,问题会更明显。Artificial Analysis针对编码智能体的单独测试中,GPT-6 Astra勉强追平了Claude Fable 5.1,但API价格上升到2.5倍。要知道,编码智能体是当前企业最愿意付费的AI能力之一,也是最容易核算投入产出比的核心场景。技术参数可以说得天花乱坠,一旦落到代码仓库的日常运维里,算的都是真金白银。
ARC-AGI-3把效率抬进考场,AGI时刻因此前移
真正能够重新校准判断的是ARC-AGI-3。这个基准与普通排行榜的关键差异在于:它不关心你背过多少题目,也不关心你能用多大力气解决已知类型的问题,而是看你在面对从未见过的新任务时,能不能快速掌握规则并用较小的代价完成它。
ARC-AGI-3:答题消耗开始计入分数
ARC-AGI系列的设计者François Chollet向来反对“暴力刷题”式的智能认证。到了ARC-AGI-3,这种倾向被进一步固化:只答对题目不够,推理所消耗的算力、步骤和时间都会变成评分的一部分。换句话说,一个模型就算最终做对了,但如果它耗费了不成比例的巨量资源,也不能证明自己具备真正的泛化能力。
以超越人类的效率解开新任务
GPT-6 Astra在ARC-AGI-3上的结果,正是促使Chollet改变预测的那块拼图。结论最核心的部分是“效率”——它以超过人类的效率完成了ARC-AGI-3的任务。比正确率更重要的,是模型在完成这些任务时展现出的适应速度。它没有依赖无限制的试错和搜索,而是通过有限次尝试抓住了任务背后的结构。这正是Chollet一直认为AGI必须具备的东西。
Chollet为何主动把AGI时间线提前?
Chollet对AGI时间表的判断一直很谨慎。过去,每当模型在某个排行榜上拿到惊人分数,他都会提醒大家注意刷分与真实智能之间的差别。但这一次,效率数据击中了他判断体系的关键参数。当系统能以超过人类的效率去适应新任务,AGI就不再只是能力堆叠的副产品,而成为一个工程上可逼近的目标。他把预测时间线向前拉,不是情绪化,而是这套判断体系里最难的一条假设率先突破了。

