你可以把GPT-6 Astra的发布公告念成一张成绩单:FrontierMath Tier 4、ARC-AGI 3、TerminalBench-4.0、Terminal-Bench Science 0.1、HealthBench Pro——每一个名字都代表一段难啃的评估。作为全新一代多模态模型,它把这些任务域刷成SOTA的同时,真正让技术圈躁动的反而不是数字。而是它在真实电脑环境里“动手干活”的能力。作为提前体验过的人,我先剧透一句:这次别只盯着benchmark。
这次SOTA,含金量到底如何?
数学推理:从竞赛题到无人区
FrontierMath Tier 4是什么概念?这套题不是让你解二次方程,而是把数学研究的前沿问题压缩成可验证的格式,很多题目连普通硕士都读得头疼。GPT-6 Astra拿下的,是这一体系里最高难度等级。上一个版本还在外面打转,这次直接钻进无人区。更吓人的是它完成题目的稳定度——不是靠堆算力的暴力枚举,而是表现出清晰可溯的推理路径。那些声称“大模型只会记忆不会思考”的论调,看完这一段评测结果大约会沉默一阵。
抽象模式:ARC-AGI 3带着刺的玫瑰
ARC-AGI系列一直是模型的照妖镜。它不考知识储备,只考从少量样例中提炼规则的抽象能力。GPT-6 Astra在ARC-AGI 3上刷到的SOTA,意味着面对全新视觉-空间任务时,它能像人一样快速构建假设、验证错误、调整策略。我私下和一些参与评测的人聊过,他们承认:新纪录有一半来自模型“看穿”了题目的结构,而不是死记硬背。
终端执行与健康:动手能力和专业把关并重
TerminalBench-4.0考察的不是模型会不会写代码,而是它在真终端里敲命令、读报错、改脚本、把任务彻底做完的闭环能力。GPT-6 Astra在这一项甩开对手。连带发力的还有Terminal-Bench Science 0.1,一个专门面向科学计算场景的子集。HealthBench Pro则更偏向医疗决策里的长程记忆与合规权衡。几个分项凑一起,释放的信号很统一:OpenAI这次赌的是模型独立处理复杂任务的能力,而不只是嘴皮子上的功夫。
真正让我坐直的是电脑操作
从“会聊天”到“会干活”有多远?
如果你只看到一排榜单,你可以说GPT-6 Astra是常规升级。但亲眼见识过它的computer use,你会明白OpenAI为什么不敢把话说满——因为它操作电脑的样子太像一个真实员工了。过去大家用模型,都是人出主意、它写方案,再由人复制粘贴去执行。这一版把整个链路砍短:模型直接接管界面、打开浏览器、定位按钮、逐项填写表单,甚至中途发现问题自己回滚。1.05M token的上下文,相当于让它能记住整张数字工作台的状态。与其说这是多模态,不如说这是长了眼睛和手的智能体。
第一手体验:像在给实习生派活
我实际测试时,让它帮我整理一份包含二十个来源的调研报告,故意把其中一个网站做成动态加载的复杂布局。它没卡壳,先截屏、再定位搜索区、键入关键词,等页面刷新后把数据一行一行抄进表格。中间有个字段读错了,它居然自行返回重读。整个过程比熟练的人类慢,但那种连贯节奏让人后背发凉——这不再是一个输出文本的聊天框,而是一个能坐在电脑前干活的数字同事。
开放入口与限制门槛
OpenAI当然没有让所有用户立刻玩疯。因为模型体现出的网络操作能力,已经触及内部Preparedness Framework划定的Critical级阈值。目前放给外界的接口都有较高的访问门槛,部分能力被刻意削弱,上下文也根据用途分级管理。想尝鲜的人只能排队等候早期试用入口,别指望一上来就能解锁全部上限。这套谨慎设计,与其说是技术受限,不如说是为自己留有调整安全策略的缓冲时间。
安全亮起红灯,然后呢?
Critical级背后的左右手互搏
GPT-6 Astra最耐人寻味的部分,不在基准清单里,而在OpenAI附带的安全说明:它的网络安全能力达到Preparedness Framework中的Critical级。这等于承认,模型已经具备自主进行复杂攻击的潜力。你可能觉得这很酷,但站在发布方的角度,这是一支必须被锁进匣子里的枪。
Perplexity们已经抢跑
有趣的是,发布后没多久,Perplexity就宣布接入GPT-6 Astra,并声称它在WANDR评测里排名领先。商业伙伴的动作永远比公关稿快。搜索引擎本质上就是信息处理和任务代理,GPT-6 Astra的强项恰好落在这条坐标轴上。搜索的下一步不是给你十条蓝色链接,而是帮你把事情做完。当别人还在攀比“每百万token价格”时,真正头部玩家已经开始预订agent时代的入口。
别忘了那些还没上车的玩家
这次发布把AI竞赛切成了两个世界。一边是OpenAI和它的几个头号捕手,开始用agent能力铺路;另一边,大多数竞争者还在把“更长上下文”和“多模态识别”当核心卖点。如果Critical级安全限制没有被滥用事件进一步收紧,GPT-6 Astra极有可能在半年内成为企业自动化的事实标准。对落后者而言,想用同样的benchmark追赶已经没有意义——人家早就换了赛道。
别只盯着分值,看它干活
长上下文的真正意义
1.05M上下文听起来只是个容量数字,可正是这个容量让computer use变得可信。真实终端任务里,一次操作会累积几十轮工具调用、上百屏输出;小窗口模型早就在上下文溢出后变成“失忆员工”。GPT-6 Astra告诉行业一件重要的事:智能体更缺的不是大脑,而是一块足够长的草稿纸。只有当每个决策都能回溯到几步之前的观测,连续完成复杂流程才成为可能。
一种新工具主义:模型成为执行器
“你来说、我来做”的协作模式正在被倒转。过去人们调整提示词去适应模型,如今模型开始学习操作人类世界的鼠标键盘。GPT-6 Astra更像一个执行器:把目标拆成步骤、在真实环境留下操作痕迹、并为结果负责。这种转变带来的产品形态,不再是一个对话框,而是一个拥有账号和操作权限的数字代理——对软件生态的冲击,远比benchmark分数更猛烈。
未来三个月的观察窗口
我建议行业别急着下结论。未来九十天真正值得盯住的有三件事:OpenAI会不会继续放开computer use的使用范围;安全限制是否因为新型攻击案例而进一步收紧;Perplexity和更多应用伙伴能不能跑通一套可盈利的agent工作流。这些问题,比眼下的分数更能说明GPT-6 Astra究竟是又一场烟花,还是新一轮AI基建的真正起点。

