GPT-6 Astra 发布当天,OpenAI Developers 没按惯例先摆 Benchmark 曲线,而是直接甩出一批社区作品。这个动作比参数更值得琢磨:新一代模型的卖点,已经从“答得对”转向“做得出来”。
被点名的两个案例反差极大。一个是把人体解剖拆成 2234 个部件做成的 3D 展示——这不是画一张解剖图,模型得同时握住部件命名、层级归属和空间位置,任何一处错位,旋转视角时立刻露馅。另一个是在 Unreal Engine 里复刻曼哈顿,从自然语言描述到可运行的场景资产,中间隔着建模、材质、光照一整套管线,考验的是长上下文能不能扛住一个完整项目,多模态输入输出是否真正闭环。
官方主动汇总这类东西,信号很清楚:开发者对模型的评判标准,正从“能不能回答”滑向“能不能交付”。但别急着下结论。精选 demo 永远只展示最好看的那一面,2234 个部件里有多少需要人工返工、曼哈顿场景重跑了几次才成,帖子里不会写。真正决定 GPT-6 Astra 能走多远的,是接口稳定性、成本曲线,以及那些没人截图发出来的失败尝试。

