版本号堆到6,OpenAI这次没有继续把聊天当成主场。GPT-6 Astra把自己定义成computer use model——说直白一点,一个替你操作电脑的模型。它不满足于在对话框里陪你交锋,它的核心能力是移动鼠标、检索文件、操作软件、把一个任务从开始一路带到结尾。OSWorld V2-Offline得分72.6%,平均任务时间从75分钟左右降到40分钟左右。与此同时,它的网络安全能力触发了OpenAI自家Preparedness Framework中的Critical级,因此只能被严格受控地访问。放在一起看,这次发布的信号不是“模型又变大了”,而是“模型的手够到了键盘”。
先忘掉聊天框,GPT-6 Astra的目标是替你坐工位
1.05M token,装得下整个任务现场
上下文窗口被反复营销了好几年,到Agent场景里才真正显出分量。模型要在电脑上连续执行操作,就必须同时记住用户指令、屏幕截图、代码仓库、历史操作和系统报错,像人办公时在桌上摊开所有材料那样。1.05M token足够容纳一个中型项目的完整语境。它不再需要频繁地把先前步骤搬进搬出,任务链条上的记忆断点大幅减少。这个能力放在聊天里是奢华,放在Agent手里是刚需。
输出128k token,模型在执行长任务时不容易断电
128,000的输出token,站在聊天视角像一个话痨。可一旦进入Agent行动,它就是完成整套活的“行动额度”:调用工具要写参数,操作界面要生成点击路径,出错后要复盘日志并调整方案,这些内容都必须在同一次生成里写完。输出窗口一旦见底,模型要么被迫中断,要么把中间状态塞给外部文件,任务失控的概率随之升高。128k的真正价值在于:一段复杂操作可以不换气地跑完,而不是做到一半就停下来喘。
知识截止日期正在贬值,Agent更拼实时感知
GPT-6 Astra的知识截止日期是2026年4月30日,比发布早了好几个月,看起来像信息不够新。但把一个整天跟电脑打交道的Agent放在真实环境里,它做判断的先决条件不再是背过多少旧知识,而是当前屏幕给了什么反馈、外部工具查到了什么事实。读屏、调用和修正,比记忆新鲜度更能决定任务质量。知识截止日期,将越来越像一个出厂标签,而不是能力边界。
OSWorld 72.6%怎么读,才不冤枉这个分数
考官是一台真实电脑,不是纸面问答
OSWorld把Agent送进接近真实的操作系统,让它面对一堆软件窗口完成一系列任务:打开应用、跨程序取数据、汇总成表格、再放到指定位置。V2-Offline中任务的起止条件已经给好,路径要靠模型自己探索。它比纯文本基准残酷得多——一次错误的点击不会消失,而是变成后续界面里新的障碍。72.6%意味着,它开始能在大多数任务里从头到尾走完,而不只是答对一步。
65.7%到72.6%,真正的差异藏在时间账本里
上一代模型GPT-5.6 Sol在同一项测试中得到了65.7%。六个多百分点的进步,听起来不算夸张。但如果把平均任务时间拉出来,叙事就变了:从约75分钟锐减到40分钟。这部分省出来的时间不是打字速度变快,而是模型在更早的环节选对了路线。Agent任务中的错误带有复利效应,走错一步,后面要花更多步去弥补;路径正确率一旦提升,总耗时的压缩会非常明显。
ARC-AGI-3的99.9%,别急着当成现实工作能力
相关成绩单里还有一组数字:ARC-AGI-3得分99.9%。这种抽象推理基准不依赖常识与经验,专门考模型从陌生图形规律中找模式的能力。考到满分附近,说明泛化能力又上了一个台阶。但把99.9%翻译成“能独立处理复杂编程”或“能承担真实科研”,是跨了一大步。ARC的世界没有模糊需求、历史包袱和来回扯皮的协作者。推理能力是发动机,但要驱动一整台车,还差很多零件。
OpenAI给GPT-6 Astra上了把锁,锁住的比放开的更值得看
Critical级从安全报告里走出来,成为一道门禁
OpenAI这次把“访问权限”直接卡在网络安全Critical级阈值之后,而不是先开放再补安全说明。Preparedness Framework很早就有,真正拦住旗舰模型却是头一回。Critical级意味着,GPT-6 Astra在网络安全任务上的能力已经足以跨入攻防两端的高风险地带。一个会操作电脑的模型,如果同时懂得怎么发现系统弱点,它造成的潜在影响就要按另一个量级计算。不是所有能力都适合直接冲进市场,这是Agent第一次用自己的方式提醒行业。
谁能跨过门槛,谁就被留在了房间里
门禁不是对所有人都一视同仁。企业客户和有合规团队的机构更容易准备审查材料,个人开发者和小团队可能要面对完全不同的等待时间。结果很可能是:更强的模型能力向少数能承担审查成本的机构集中,开源社区和个人开发者与最前沿之间的缝隙变大。当年那种“模型发布即人人可用”的普惠叙事,到Agent时代正在被复杂的准入门槛改写。如果不尽早补充第三方审计与托管访问通道,这种能力集中会演化成新的技术权力问题。
限制发布不等于安全落地,但至少走出了第一步
有人可能觉得OpenAI是自我设限,有人觉得这不过是营销。从防御角度看,一个能自主完成复杂电脑操作的模型,完全开源带来的滥用成本会成倍增长。受控访问至少给追溯和回收留出了空间。难点在于,限制不能只停留在申请环节,使用中的监测、异常行为熔断、权限回收都得跟上。把锁做好只是开始,真正难的是有人持续巡夜。
谁先接住GPT-6 Astra这双手,谁就改写流量入口
Perplexity第一个举手,搜索框提前感受到寒意
GPT-6 Astra发布后,Perplexity几乎第一时间宣布接入,还特别提了一句“WANDR评测第一”。这家公司长期做搜索,现在的动作却不像搜索公司。当模型能直接操作电脑完成交付,搜索的终极体验就不只是罗列链接,而是帮着把事情做完。谁先把这种能力封装成顺手的产品,谁就能抢占下一轮入口。搜索框还在,但它已经知道自己不再唯一。
OpenAI真正换掉的,是评价模型的坐标系
从GPT-5.6 Sol在OSWorld V2-Offline上留下的65.7%,到GPT-6 Astra的72.6%,OpenAI把进步标尺从“语言生成质量”挪到了“真实环境的操作水平”。对用户来说,这段距离远比版本号跳了一个数字更值得注意。以后模型竞争不会只发生在聊天排行榜上,而会发生在谁能在无人盯守时把任务做完、做对、做好。语言能力是主角的时代,正在被操作能力抢走一半聚光灯。
模型已经够到了键盘,人的判断力成为新关卡
过去我们喜欢用“问它一个问题”来测试AI。GPT-6 Astra给出的答案是交付一件做完的事:文件归纳好了,邮件发出去了,报表异常被标出来了。大量流程型任务因此开始从人的待办清单里撤退。接下来需要人去做的事情,会是定义任务边界、验收交付结果、给Agent划定不能越过的红线。模型已经够到了键盘,真正的悬念只剩下:你准备让它按下哪些键,以及按下之后由谁来负责。

