OpenAI 把 GPT-6 Sol 和 GPT-6 Luna 一起放出来了。两款模型都踩在 GPT-6 Astra 的技术底座上,官方给的卖点直白得不像发布会语言:更快、更便宜,扛得住大规模工作。API 定价比 GPT-5.6 的促销价还低 50%。这不是一次常规迭代,更像一次对着成本结构打的定点爆破。
便宜一半,OpenAI 在赌什么
50% 这个数字,比它听起来更狠
降价不稀奇。稀奇的是参照物。GPT-5.6 的促销价本身已经是打过折的,Sol 和 Luna 在折后价上再砍一刀——对做大规模推理的公司来说,这不是省点零花钱,而是直接改写了某些业务能不能跑通的前提。那些因为单次调用太贵而被无限期搁置的场景,现在有机会重新回到排期表上。
另一面是压力。OpenAI 主动把价格锚点往下拽,等于告诉整个市场:推理成本还有得降。靠"更便宜"当护城河的那批模型厂商,护城河的水位一夜之间浅了一截。
Sol 和 Luna 不是大小杯
两款模型同时上线,官方说法是服务"大规模工作"。这个措辞值得琢磨。大规模意味着调用量大、并发高、单个任务的价值密度低——这类活最怕的就是贵。贵一点点,乘以百万次调用,就是能不能立项的区别。
命名上也有点意思。太阳和月亮,听起来像两条并行路线而非同一模型的两种规格。官方没把两者的边界讲透,从定位推断,选型逻辑更接近"我要什么节奏"而不是"我要多大参数"。真要用起来,还得靠实测数据说话。
缓存和推理效率,才是藏在后面的主角
发布信息里"优化了缓存和推理效率"这几个字很容易被划过去,可它恰好解释了降价空间从哪来。缓存命中率高一点,重复的前缀就不用重新计算;推理调度改一改,GPU 的空转时间就少一截。这些改动一点都不性感,却是单价能腰斩的物理基础。
换句话说,价格是结果,效率是原因。盯着价格做决策,不如盯着效率变化做预判——今天贵得离谱的任务,半年后可能就是个日常操作。
Arena 上线之后,评测变得具体了
第三方入口比官方文档更值得盯
Arena 把这两款模型接了进去,并且说明了评测方式。这条信息的分量,未必低于发布本身。官方榜单永远在自家场地上跑,而 Arena 提供的是带对抗性的观察窗口:同一个任务,不同模型轮番上,输赢当场见。
对开发者来说,这等于多了一条"先试后买"的通道。不用先充钱,不用先啃几十页文档,直接拿手头的真实任务去压一压,答案来得比任何宣传都快。
智能体任务里,跑分只是入场券
标签里有 Agent,这才是真正的考场。智能体任务不是单轮问答,它要调工具、要维护中间状态、要在失败之后决定重试还是放弃。这类任务考验的是稳定性和上下文管理,不是某一次回答有多漂亮。
一个模型在闲聊里妙语连珠,放到八步链路里可能第三步就开始胡编。Arena 特意说明评测方式,大概也是冲着这一点:把模型扔进多步任务,看它第几步开始崩。这种数据在官方页面上通常看不到。
评测方法本身也要打个问号
任何评测都带偏向。任务集怎么选、判分标准谁定、重试次数算不算进总耗时——每一项都能把排名搅动一遍。看到"某模型领先"的结论,先追问一句:这个结论在什么条件下成立,换一批任务还站得住吗?
谁先感受到变化
编码工具链的反应最快
Sol 和 Luna 同步被推到 ChatGPT Work 和 Codex 这类场景里,节奏说明了一切。编码是智能体落地最成熟的领域,也是 token 消耗最凶的领域之一。价格腰斩叠加推理提速,直接改变的是一个具体决策:要不要让模型多跑几轮。
过去只敢让它改一次就收手,现在可以放它自己迭代三轮再验收。质量的提升,往往就藏在这多出来的几轮里。
批量任务的账本要重算
做数据清洗、批量摘要、大规模分类的团队,成本曲线是陡的,也是最敏感的。单价掉一半,卡在预算线上的项目突然就能过审。这类工作不耀眼,但数量多、盘子大,是真正吃满价格红利的群体。他们不会发推庆祝,只会默默把并发数调高。
没被解决的那部分
便宜和快,回答的是"能不能用",不回答"该不该信"。长链条任务里的可靠性、错误如何不逐层放大、以及成本下降后必然出现的滥用——这些都不在发布信息的射程内。
价格一降,用的人就多;用的人一多,边界就撞得越频繁。下一轮讨论的重点,大概率不再是数字,而是这些边界到底在哪。

