75 分钟到 40 分钟,18% 到 41%,48% 到 0%。这三个数字摆在一起,已经比任何发布会措辞都更能说明问题——OpenAI 这次发布的 GPT-6 Astra,不是给聊天框加了个新皮肤,而是把 Agent 能做的事,从"演示级"往前推到了"可用的边缘"。Mark Chen 说它能构建测试软件、跨应用操作电脑、尝试开放科学问题,这些话听起来仍是典型的 PR 口径。但数字不会撒谎:真实桌面任务的耗时几乎砍半,职场自动化的可完成率翻了一倍多,最关键的,未防护状态下的越权行为从 48% 被摁到了 0%。上一代还在靠"别让它干坏事"的安全护栏硬撑,这一代直接换了个底层思路。如果你只记住了 GPT-6 Astra 这个名字,那还不够。真正值得记住的,是这三个数字背后代表的一次代际切换。
桌面操作、职场自动化:提速的不只是网速
AI Agent 喊了两年,多数产品的真实水平仍然停留在"能打开网页、能帮你点两下鼠标"的阶段。GPT-6 Astra 这次直接把这个水位往上拉了一大截,而且给的数据不是自说自话的基准分,是可对照的实测结果。
OSWorld 的含金量,不在分高,在时间被砍掉近一半
OSWorld 是业内公认难啃的桌面任务测试集,因为它考的不是"模型知不知道答案",而是"模型能不能像人一样在真实电脑上把事办完"。上一代 GPT-6 在 OSWorld 上完成一项典型桌面任务,平均要花 75 分钟。75 分钟是个什么概念?一个熟练的人类操作员处理同样任务大概只需要几分钟,AI 在电脑前面转转悠悠、开错窗口、反复试错的过程中烧掉一个多小时。Astra 把时间压到了 40 分钟——仍然谈不上快,但已经跨过了一个临界点:它在桌面上的操作,开始有资格被当作"需要一点耐心的帮手",而非"演示完就关掉的玩具"。提速的直接价值是成本。Agent 跑得越久,token 消耗越大,API 账单越高。40 分钟意味着推理成本相对上一代几乎打了对折,也意味着在真实办公场景中,让 AI 干活这件事的经济账第一次算得过来了。
职场自动化率翻倍——从"18% 的幸存者"到"41% 的常态"
如果说 OSWorld 测的是通用桌面能力,那职场自动化率测的就是钱。18% 到 41% 的跃升,放在具体场景里是这样一组画面:以前 100 个典型的办公室任务里,AI 只有 18 个能从头到尾独立完成,剩下 82 个都得靠人把它拆碎成步骤喂到嘴边;现在它能自己拿下的任务数翻了倍。这个跨越的难点不在于模型"更聪明了",而在于它开始懂得处理真实工作流里的脏活——从杂乱邮件里提取指令,在多个软件之间来回切换找信息,遇到弹窗和意外报错时自己判断怎么绕过去。Mark Chen 提到的"跨应用操作电脑",翻译过来就是这么回事:不是在一个应用里把活干完,而是像人一样同时驾驭 Slack、Excel、浏览器和内部系统,把一件事从头跟到尾。这种连贯性,比任何单点技能都更能决定 Agent 在办公室里究竟是个摆设,还是能顶上半个实习生。
安全不是打补丁,是换了套底层引擎
这一代 GPT-6 Astra 最让安全圈侧目的不是它多了什么能力,而是一个反常识的数字:未防护越权率从上代的 48% 直接归零。48% 是个惊悚的数字——上一代模型中,差不多一半的攻击性提示词都能骗它越过权限边界。一个能操作电脑的 Agent,一旦被越权利用,它手里的权限就是攻击者手里的钥匙。过去一年里各家 AI 安全团队都在疲于奔命地打补丁,OpenAI 这次直接承认:打补丁治标不治本,得把护栏焊进模型的行为逻辑里。
0% 越权率背后:从"别做坏事"到"做不了坏事"
上一代模型的防护逻辑更像是在模型外面围了一圈保安——只要提示词写得够刁钻,保安总有一瞬间的走神。Astra 的思路是把"权限边界"这个概念预置成了模型行为的内在约束。用 OpenAI 安全团队的话说,这不是在外面加了一道锁,而是让模型在决策过程中天然把越权当作不可选项。0% 的成绩单意味着在标准对抗性测试中,无论攻击者怎么绕,模型都不会越过系统给它划定的操作红线。这对企业客户的意义很直接:之前敢不敢让 AI Agent 碰财务系统、碰客户数据库,是个需要法务部门开三次会才能决定的大事;现在至少从技术层面,AI 的权限自律性第一次达到了可审计、可信赖的档位。
这次罕见的 Critical 档位——OpenAI 自己给自己上强度
值得留意的是,OpenAI 对 GPT-6 Astra 的安全评级给出了罕见的 Critical 档。这个概念源自美国政府对 AI 前沿模型的安全监管框架,Critical 意味着模型能力越强,潜在危害越大,需要在发布前进行最高级别的安全测试和红队对抗。OpenAI 主动把 Astra 推到 Critical 档位接受检验,本身就是在抢跑监管——与其等政策落地之后被追着补课,不如先把自己的安全标准拉到法规可能要求的水平之上。某种意义上这也是对 48% 越权率的一次公开道歉和补救:上一代的教训太深,这次宁可在发布流程上多走几道程序,也不愿再赌一次侥幸。
十道十年未解的题,和一次伟大的烧钱实验
Mark Chen 在发布中提了一句耐人寻味的话:Astra 花了大约 2000 美元的计算成本,解出了 10 道困扰数学和理论计算领域十年的难题。这组数据最震撼的地方不在"十年未解"四个字,而在那个实在得有些刺眼的数字——2000 美元,不过是某些顶级 AI 实验室一次训练 run 成本的零头中的零头。
2000 美元的背后,是推理范式的质变
这 10 道题的难度等级,相当于数学和理论计算领域的"哥德巴赫猜想微缩版"——卡了领域十年,说明传统方法把路都走遍了也没走通。Astra 的思路不再是海量数据堆砌后的模式匹配,而是在推理过程中真正引入了类似数学家的试探路径:先假设一条路,证明不通,再回溯换一条。这个过程消耗的 2000 美元算力,如果换算成传统超算的时间,成本会是这个数字的几十甚至上百倍。OpenAI 官方把这次突破称为"测试时计算"的胜利——模型的聪明不再完全取决于训练时吸收了多少数据,而是取决于它在解题那一刻愿意思考多久、多深。对科研界而言,这才是比任何模型参数更值得兴奋的消息:一个普通课题组花几千美元就能让 AI 帮自己啃十年的硬骨头,科研的边际成本正在被重新定义。
给科学家的不是答案,是一条以前不存在的路
更值得细品的是 Astra 解出这 10 道题的方式——它不是靠蛮力搜索答案,产出的是可以验证的证明过程和推导链条。这意味着科研人员拿到的不只是"结论正确"四个字,而是一份可以检查、可以复用的探索路径。过去一年,外界对 AI 科学发现的质疑集中在一个点上:你给的结果是对的,但我们不知道你是怎么算出来的,也不敢拿它当真。Astra 的解题逻辑首次让 AI 的推导过程逼近了人类数学家的可读性——每一步都有据可查,每一条思路转折都留下了痕迹。这样做对科研圈建立信任,比十道题本身更重要。
一个诚实的现状:带工具的综合测试,Claude 仍是标杆
不过,在一片亮眼的数字里,OpenAI 自己发布的长文里也藏了一条不愿被放大的注释:在带工具调用的综合能力测试上,Astra 仍落后于 Anthropic 的 Claude 系列。这不是第三方跑分,是 OpenAI 内部自评时给出的结论,能把这个短板写进发布材料里,说明问题已经大到没法选择性忽略了。
Claude 赢在哪:API 生态里多工具编排的成熟度
过去一年,Anthropic 把大量精力砸在了 Model Context Protocol(MCP)和工具调用的稳定性上,Claude 在真实开发环境里被验证的次数远超任何竞品。OpenAI 的优势在模型底座的通用智力,但"聪明"和"好用"之间横着一条工具生态的鸿沟——Agent 每次调用外部 API、操作一个第三方软件,都是一次可能翻车的交互。Claude 在这些场景里浸泡得更久,积累的兼容性修复和编排策略自然更成熟。这像极了浏览器大战早期的 Netscape 和 IE——先发者未必拥有最好的内核,但生态的熟悉度本身就是一种碾压式优势。
40 分钟的价值,必须是"能进企业流程",而不是"能跑通演示"
对 Astra 而言,通往企业市场的路只有一条:真正改善工具调用的可靠性,让 40 分钟的成绩单不仅仅停留在测试环境。毕竟企业买 Agent 回去不是看演示的,是要它对接 SAP、Salesforce 和内部 OA 系统的。如果 Astra 在一个标准浏览器环境里表现优异,却在企业一堆老旧的内部系统面前频繁掉链子,那 41% 的自动化率就会变成一纸空谈。好在这次 Astra 的开局明显带着向开发者示好的姿态——不光是模型层面的升级,还同步开放了更多环境适配的接口。能不能追上 Claude 在过去一年多里建立的工具生态信任,是 Astra 接下来最值得盯的赛点。
回看这次发布,GPT-6 Astra 的实质叙事其实只有一条:AI Agent 的安全性和实操成本都突破了临界点,而 AI 的科研推理能力正在让"2000 美元解十年难题"变成日常。在这个节点上,跑分与概念已经不太能说明问题,真正会被记住的,是那些被压短的时间、被拉到零的风险,以及它身后 Cluade 那片它还没追上、但必须追上的生态阴影。

