GPT-6 Astra今天正式向全部订阅用户推送。我第一时间拿它跑完手头的真实任务,结论相当干脆:综合能力追平Claude Fable 5,可用额度100%兑现。相比GPT-5.6 Sol,这代模型没有丢给我一堆刷榜数字,而是把速度、代码扫描、3D生成和中文写作全面推高了一个台阶。中文白描和用词干净了许多,但那份真正的留白感,还差一点。
跑分没意义,等得久才有意义
一次大型系统审查,从数小时变成十分钟
以前做大型系统审查,最折磨人的不是问题多,而是模型要烧很久。GPT-5.6 Sol偶尔会跑到一半像死机,结果出来还有不少漏网之鱼。Astra把同一份项目丢进去,十分钟左右就交回完整报告。它不是靠压缩思考时间换速度,而是把代码结构理得更清晰;每个风险点都给出定位,也给出为什么危险。原本要留出半天的工作,现在只够你冲完一杯手冲咖啡。
额度不用看脸色,是这次最容易被忽略的修复
我不太愿意为“额度100%可用”欢呼,因为这件事本该如此。但经历过去一年各种大模型嘴上说无限、实际用起来限流的场面,真正能连续调用而不降质的模型并不多。Astra倒是把额度用得很干净,连续跑完代码审查、前端生成和好几轮写作,没有突然变笨,也没有排队转圈。这种稳定感,比榜单上浮动的分数更影响使用体验。
速度快起来之后,工作流才敢试错
速度在AI产品里一直被轻看。等我真正用上Astra,才意识到快不只是一个体感问题。之前做系统重构,我每次只敢改一个模块,因为交给大模型跑一轮代价太高。现在可以同时给几条不同路线让它验证,错了再换也还来得及。工作方式从单点试探变成批量迭代,这比跑分上涨一个点实用得多。
代码和3D双双开窍,说明判断力在成形
旧仓库里的隐藏问题,终于被翻了出来
代码扫描是我对每一次模型升级最直接的测试。Astra从我一个维护了很久的旧仓库里,找出一批之前从未被报告的性能问题。它们不算致命,但叠加起来足以在真实负载下拖慢服务。更难得的是,模型把触发链路画得很完整,修复建议也没有停在“应该优化”的废话上。我按它的方案做了清理,两小时完成修复。那些问题一直在那里,只是上一代模型没能力看见。
前端3D和审美,不再靠发光边框撑场面
前端生成是我平时用得很多的方向,之前模型经常把“高科技”理解成发光边框加蓝色渐变。Astra的3D页面在空间构图、色调、阴影层次上明显更像有审美的设计师做出来的东西。它不是把更多视觉元素塞进画面,而是让每个元素退到该待的位置。一个首页的视差结构,一次生成就能接近真实产品原型的完成度。
追平Claude Fable 5,赢在跨任务不露馅
把代码扫描和3D生成放在一起看,就会明白Astra为什么有底气说追平Claude Fable 5。它不再是偏科模型:代码能力硬,审美判断也能跟上,而且两者之间没有明显的拼接感。对用户来说,真正好用的模型不是每项都刷第一,而是在跨任务时保持稳定的输出水准。Astra这次确实做到了。
写作到了另一个阶段,可中文的缺口藏不住了
白描变干净,用词变准确
写作任务最能看出模型的表达层次。Astra写出来的人物白描,显然比GPT-5.6 Sol的手法成熟:动词不追求花哨,句子之间的呼吸更舒服。在商务文案里,它不再一句话堆三个金句,而是知道把最有力的信息留给起收。整体用词接近一位经常写稿的人,少了一种每句都像广告语的尴尬。
留白感依然不是这个模型的长处
但要说中文写作登顶,我还得站出来泼冷水。Astra能写出不错的文章,却写不出“少说一句”的余味。很多地方它已经理解了语气和语境,仍然忍不住在段尾补上结论,或者把本来可以意会的情绪挑明。中文表达里最高级的留白,不是删掉字,而是给读者留一段自己走进文本的路。这一点,Astra还不会走。
GPT-6 Astra真正让我意外的,是AGENT.md该做减法了
提示词越短,执行越准
原本用在GPT-5.6 Sol上的AGENT.md被越写越长,生怕模型漏掉一个细节。换到Astra以后,我试着把同样的AGENT.md简化到一半,只保留目标、边界和关键历史决策,删掉那些“必须用什么语气”“不要用某些词”的逐条操作说明。结果执行准确率不降反升。提示词从操作手册退回到作战简报后,模型反而有了更多灵活应对的空间。
从控制到信任,才是新模型时代的提示词思路
这个发现最好用的一点,是能迁移到其他项目。很多团队写提示词像写验收文档,每个步骤都规定死,最后模型只能机械执行,遇到新情况立刻失灵。真正该写进AGENT.md的,是任务目标、不可逾越的边界和可以调用的资源。当模型有能力对高层信息建立自己的路径,事无巨细的控制就不再必要。模型越强,我们越该学着把表达变得克制。

