GPT-6 Astra将ARC-AGI-3成绩从前代的7.8%拉到99.9%——这不只是迭代,更像物种级别的跳跃。作者实测后直言,最突出的能力不是数学或编码,而是计算机使用:它能像熟练员工一样点按界面、拖拽文件、跨应用操作,把一套真实任务在浏览器和桌面工具之间跑通。图像渲染同样惊人,从概念图直接进到可用的专业输出。
比分数更值得拆解的是底层架构。GPT-6 Astra采用looped transformer,核心是把同一个模块循环计算多次,在参数不膨胀的前提下加深有效深度。这项设计并非新概念,但落到旗舰模型上有了新使命:用循环计算替代部分显式推理链条。作者特别强调,这种循环架构与外界猜测的“隐藏思维链”毫无关系。OpenAI可能会要求模型不自曝推理细节,这是产品策略;而循环是结构机制,它用迭代计算换取更深的抽象能力,二者从技术路径上就分道扬镳。
分清这一点,才能看懂这代模型的真实信号。若只是偷偷“想一下”,那本质仍是表演;若是架构设计,则意味着高难度推理可以通过结构逼出来。ARC-AGI-3拿到99.9%当然不等于通用人工智能,但结合计算机使用能力的跃升,一个能自己看着屏幕干活、同时做好抽象规划的Agent,轮廓已经清晰。GPT-6 Astra不是单纯的“更大模型”,它把竞争推向了循环架构与真实场景互相解锁的阶段。

