OpenAI 又往桌上扔了一张牌。GPT-6 家族多了两个名字:Sol 和 Luna。官方说法很干脆——两者建立在 GPT-6 Astra 的技术成果之上,把那一代的绝大部分能力,搬进了跑得更快、更便宜、能扛大规模负载的躯壳里。更刺眼的是价格:API 定价比 GPT-5.6 的促销价还低 50%。"促销价"这三个字值得多念一遍,因为这意味着刀是砍在一条已经折过的基准线上的。
半价不是姿态,是效率结出来的果
先看钱是从哪儿省下来的
官方把原因写得很直白:缓存和推理效率的提升。这两样听着像工程细节,实际上是定价的地基。缓存命中率每上去一点,重复的上下文就不用重算一遍;推理效率每优化一档,每个 token 的边际成本就往下掉一截。当这两条曲线同时往下走,价格才有下探的余地。所以别把这次调价理解成一次市场动作,它更像是成本表被改写之后,价格顺势跟上的结果。
缓存命中率:最不性感,也最值钱
开发者习惯盯着榜单分数,却常常忽略账单里最大的一块来自哪里。长系统提示、固定知识库、多轮对话里反复出现的那段上下文——这些内容如果每次都重新算一遍,钱就是这么烧掉的。命中缓存的那部分成本能低一个量级,而大多数生产环境的真实负载里,重复内容的占比远比想象中高。这项优化不产生任何 demo 效果,也没法拿去做发布会,但它直接决定一个 AI 产品能不能盈利。OpenAI 把"缓存"和"推理效率"并排写进公告,等于在明说:这次降价的杠杆不在模型能力,在工程。
Astra 的底子,决定了 Sol 和 Luna 的天花板
这两个模型不是从零长出来的。沿着 Astra 的路线做工程收缩——蒸馏、结构裁剪、推理路径优化——本质上是把一代旗舰的技术红利,摊薄到更多产品线上。这种做法在行业里并不新鲜,难的是摊薄之后能力掉得够不够少。官方用的措辞是"大部分能力",这个词留了余地,也透露了信心:如果掉得太多,通常会说"核心能力"或者干脆不提比例。真正要等的,是开发者拿真实任务去撞它的边界。
一次发两个,这笔账是算过的
Sol 和 Luna 各领一种活
同一时间放出两个型号,通常意味着一件事:OpenAI 认定这条线上至少存在两种截然不同的负载。一种要的是速度与单价的极致,批量处理、分类、抽取、路由这类活;另一种得在复杂任务上守住质量下限,不能让用户觉得"便宜版就是不行"。官方没公布详细分工,但"支持大规模工作"这个表述指向很明确——至少有一个是冲着跑量去的。对开发者来说,这意味着选型不再是"用哪个模型",而是"哪段链路用哪个"。
中间层正在被挤扁
过去两年模型家族越铺越长:旗舰、轻量、迷你、廉价版,中间塞了七八个档位。结果是用户选型花掉的时间成本,比调用成本还高。现在把 Astra 级别的能力压到更低价位,等于 OpenAI 自己动手清理中间档。那些定价卡在中间、能力又不上不下的型号,日子会变紧。这个趋势对整个行业都成立:当顶部能力的成本持续下滑,中间层的存在理由就只剩下特定场景的定制,而不是"便宜一点点,弱一点点"。
Arena 分数还没出,市场已经先动了
两个模型已经在 Arena 上线测试,评分即将公布。但真正值得看的不是分数本身,而是开发者会用多快的速度把它们塞进生产链路。价格信号向来比评测分数传导得快——分数影响的是"要不要试",价格影响的是"今晚就改配置"。如果 Sol 和 Luna 在 Arena 上拿到的分数不拉胯,这轮迁移的规模可能会超过过去任何一次同级别发布。
便宜之后,难的地方换了位置
迁移不难,难的是证明它不掉链子
改一行模型名,十分钟的事。真正花时间的是向自己和团队证明,新模型在你的场景里不出错。自建评测集、抽取线上真实的长尾 case、跑回放对比、盯住那些低频但致命的失败模式——这套流程走完,通常以周计。50% 的降价当然诱人,但如果为了省这笔钱搭进去两周工程时间,还要承担一次线上事故的风险,账就不一定划算了。理性做法是先切流量占比最高、容错空间最大的那条链路,跑稳了再往下推。
量越大,这 50% 越像一道分水岭
对调用量小的团队,省下来的钱不够请一顿饭,意义更多在心理层面。对每天跑几十亿 token 的业务,这就是毛利率的直接变化——推理成本占营收的比重每下降一个百分点,商业模式的可行性就往上抬一档。很多 AI 应用过去卡在"能跑通但算不过账"这一步,现在这个卡点被松动了。也正因如此,这次降价的冲击不会均匀分布:它奖励的本来就是那些已经把产品跑起来、正在被成本压着的团队。
接下来该盯三件事
第一,缓存机制的实际命中条件与计费口径,公告里的"效率提升"到账单上到底怎么体现,得拿真实流量去对。第二,稳定性——不是榜单上的稳定性,是连续跑三个月、在高峰期、在长上下文下的表现。第三,竞品会不会跟进。如果这轮定价确实建立在成本结构改善之上而非补贴,那它就不会轻易收手,跟进者也被迫跟着改自己的成本表。价格战打到这里,拼的已经不是谁更敢烧钱,而是谁的推理栈更省。

