OpenAI 把 GPT-6 Sol 和 GPT-6 Luna 一起端了出来,最扎眼的不是能力曲线,是价目表。Sol 每百万 token 输入 2 美元、输出 10 美元;Luna 输入 0.1 美元、输出 0.5 美元。对照 GPT-5.6 的对应版本,整体下调 50%。这个数字放在两年前,会被当成官网写错了小数点。
两款模型的训练方法都沿用 GPT-6 Astra 那一套。这句话的信息量不小——工艺没换,改的是成本和产品切分。下面把这两件事拆开聊。
一次定价,把整个价格锚点往下拽
降价 50% 单独看是促销,放进产品线里看是重新定锚。
$2 和 $10,落在过去的中端价位
输入 2 美元、输出 10 美元这个档,过去是给"够用但不顶尖"的模型准备的。现在它挂在 Sol 这个主力名字下面。对一个常驻运行的编码 agent 来说,一天烧掉几十万 token 不算夸张,输出侧的价格尤其要命——$10 和 $20 之间差的不是零花钱,而是能不能把 agent 从演示环境推到生产环境。定价压到这个位置,很多原本只活在方案书里的用法,会突然算得过账。
Luna 的 $0.10,才是真正搅局的那个数
输入一毛、输出五毛。这个价位过去属于小厂或者开源托管服务,现在由前沿实验室提供。它打开的是另一类工作:文档分类、字段抽取、意图路由、长上下文预处理、给大模型当质检员。这些活以前要么用规则硬扛,要么丢给一个能力不够的便宜模型,然后花人力去补它的错。当便宜模型本身足够可靠,脏活累活的分配方式就会变。
便宜从哪来,官方没说透
沿用 Astra 的训练方法,是个可以反推的线索。配方不变,意味着数据管线和后训练流程大概率是复用的,边际研发成本被摊薄;剩下的空间来自推理侧——批处理、稀疏化、缓存、硬件利用率,都是能挤出利润的地方。具体哪一项在起作用,OpenAI 没有公开,这也不奇怪。但有个判断值得先记下来:训练方法不变而价格腰斩,说明省的多半是工程账,不是能力账。
Sol 和 Luna,不是大小号的关系
把这两个名字理解成"旗舰与青春版",选型时一定吃亏。它们更像针对两种完全不同的负载做的取舍。
Sol 接的是需要连续推理的活
专业工作、编码、计算机使用这几类任务有个共同点:一步错,后面全错,中间状态还压不掉。让它读代码仓库、改三处、跑测试、根据报错回头再改——这种链式操作对稳定性要求极高,token 消耗也收不住。Sol 的阵地就在这里。贵是贵,但它省下来的是人的时间。
Luna 卖的是吞吐,不是峰值智力
换个角度看 Luna:它的价值不在于能不能解出最难的题,而在于你愿意把它放在多少条调用路径上。一批十万条的用户反馈要做情感与主题标注,用 Sol 跑一遍可能直接吃掉一个月预算,用 Luna 跑就是常规开销。这类模型的正确用法是"让它犯点小错也没关系",然后用抽样校验兜住质量下限。
中间那档被腾空了
GPT-5.6 时代的版本梯度比较密,开发者习惯按"稍微好一点、稍微便宜一点"来微调选择。现在两极分化:要么用 Sol 干难活,要么用 Luna 干量活。这个安排其实在逼团队做一件更健康的事——先判断任务属于哪一类,而不是靠调模型档位找平衡。中间地带不是被砍掉,是被要求用工程手段自己搭出来:路由、任务拆分、结果验证,都算。
基准表要横着看,别竖着看
官方给出的分数覆盖了专业工作、编码、计算机使用等几个方向。数字有用,但用法得讲究。
专业工作与编码,差距容易看错方向
Sol 在这两类任务上领先,这没什么争议。问题在于基准的构造方式:题目是干净的、有标准答案的、单轮完成的。真实工作里,输入是脏的,需求是含糊的,验收标准还得自己定。所以看到那几个百分点的差距,先别急着下结论,拿自己的评测集跑一遍再说。
计算机使用这一类,反而更接近实战
让模型操作浏览器、点按钮、填表单、在界面之间搬数据——这类评测噪声大、波动大,恰恰因为这个,它跟真实产品的距离更近。选型时如果只看一栏,我会先看这栏。Agent 落地的成败,多半不在模型会不会写代码,而在它扛不扛得住界面变化和意外状态。
总分是个陷阱
综合分是给排行榜用的。团队真正要问的是另一个问题:在我这 200 条真实请求上,哪一款的失败率能压到我愿意接受的水平。基准只能帮你缩小候选范围,最后那一公里没人替你跑。
账要算在部署侧,不在价目表上
单位任务成本,而不是 token 单价
便宜一半的模型,如果多花三成步骤才把活干完,总账可能是亏的。反过来,贵模型一次做对,省下的重试和人工排查,往往比 token 费贵得多。做对比测试时,把"完成一个任务花掉多少美元"设成指标,别把价格表乘一下就算完。
路由层重新变得值钱
Sol 和 Luna 的输出价格差了 20 倍,这个差距足以撑起一套路由架构。简单请求发给 Luna,判断不确定的升级到 Sol,用验证器兜底再决定要不要重试。这套东西不新鲜,两年前大家都嫌麻烦——当时便宜模型太差,路由的收益抵不过复杂度。现在天平偏过去了,架构投入的回收周期比过去短得多。
迁移的成本不在接口上
从 GPT-5.6 换到 GPT-6,调用方式大概率变化不大,真正的成本埋在提示词、工具定义和评测集里。这些东西一旦跟某一代模型的脾气绑死,换起来就疼。趁现在把评测集和路由层做成与模型无关的,比急着切换模型更值钱。这一轮价格战才刚开始,下一轮降价来的时候,能快速搬家的人才占得到便宜。

