GPT-6 没有以「一个更强的模型」的姿态出现。OpenAI 直接把它劈成两半——GPT-6 Sol 和 GPT-6 Luna,同一时间上线 API,价格同时砍到 GPT-5.6 促销价的一半左右。Sol 每百万 tokens 输入 2 美元、输出 10 美元;Luna 是 0.10 美元和 0.50 美元。这两个数字摆在一起,比任何单个基准分数都更能说明问题:OpenAI 不再只卖「最强」,它开始认真卖「够用且便宜」。
价格表里藏着两条产品线
Sol 卡在一个耐人寻味的位置
每百万输入 2 美元、输出 10 美元。这个价位既不是旗舰血统的延续,也不是清仓甩卖。相比 GPT-5.6 的促销价,它直接对折,但绝对值仍然站在中高端区间。OpenAI 显然不打算让 Sol 变成随手调着玩的模型——它被放在那里,是给复杂推理、长链路 Agent、多轮工具调用准备的。输出 10 美元意味着什么?一次深度思考任务如果吐出一万 token 的推理过程,账单从一美元起步。做重活的人会接受,做轻活的人会绕开。
Luna 是真的便宜
输入 0.1 美元,输出 0.5 美元。Luna 的定价已经不是「便宜」,而是接近基础设施的价位。分类、路由、字段抽取、格式转换、短文本摘要,这些每天能跑几十亿次的任务,成本结构从「得算一算」变成了「可以忽略」。过去两年,很多团队在这类任务上宁愿自己部署小开源模型,唯一的理由就是 API 太贵。Luna 把这条理由抽掉了。
砍掉一半,砍的是心理门槛
50% 的降幅听起来像常规促销,真正的作用点却在别处。开发者在做架构决策时,价格往往不是按计算器算出来的,而是按直觉估的。当「每百万 token 两块」和「每百万 token 一块」摆在一起,后者更容易被写进方案第一稿,然后整条链路都围绕它设计。降价最狠的那一次,通常不是省钱最多的那一次,而是改变默认选项的那一次。
Sol 和 Luna 不是大小杯,是两种工种
Sol 站的是 Agent 场景
把 Sol 理解成「贵一点的 Luna」是误读。Agent 任务的成本结构很特殊:单次调用贵,但调用次数少;输出 token 多,但错误代价高。一个跑二十步的工具调用链,如果第三步就把参数搞错,后面十七步全是浪费。Sol 的定价允许开发者在关键节点上不省,把预算集中砸在需要判断力的地方。这也是为什么它的输出价是输入价的五倍——思考比阅读贵,OpenAI 把这件事明码标价了。
Luna 负责承接流量
反过来看 Luna。它不需要在难题上跟 Sol 较劲,它要的是在简单任务上跟自部署的小模型抢生意。延迟、并发、单价,三样东西里它至少能赢两样。真正跑过大规模推理管线的团队都清楚,一个应用里 80% 的调用量都发生在最无聊的环节:意图识别、实体归一化、结果校验、失败重试。这些环节用 Sol 是浪费,用 Luna 刚好。
串起来用才是设计意图
两档模型同时发布,本身就暗示了推荐用法:用 Luna 做前置分流和格式化,把真正需要推理的请求转给 Sol。这套路由逻辑听起来简单,做起来全是细节——阈值怎么定、失败怎么降级、上下文怎么在两次调用之间传递。OpenAI 给出的不是两个模型,而是一道架构题,答案得由开发者自己填。
缓存控制:那份被翻得最少的文档
重复上下文才是账单大头
生产环境里输入 token 的重复率,远高于开发者的直觉。系统提示、工具定义、检索回来的同一份文档、多轮对话中反复携带的历史——每调一次模型,这些内容就重算一次。新的缓存控制细节把这个环节单独拎出来定价:命中缓存的输入 token 与普通输入走两套价格,写入缓存有成本,读缓存便宜得多。问题在于,你得先知道自己流量里有多少是重复的。多数团队并不清楚。
缓存粒度决定了 Agent 的经济性
一个执行二十步的 Agent,每一步都在把前面所有步骤重新喂进去。如果缓存能覆盖稳定不变的那段前缀,成本曲线会从线性变成接近阶梯状;如果提示词每轮都在变,缓存就等于白设。所以缓存控制不只是一个省钱开关,它在逼开发者重新审视提示词结构:把不变的东西固定死在前面,把变化的部分挪到后面。这个工程习惯,以前是可选项,现在是必修课。
定价设计倒逼工程规范
有意思的地方在于,缓存策略做得好不好,短期看不出来,长期全写在账单上。这类成本不会在压测里暴露,只会在生产环境跑到第三个月时突然变得刺眼。OpenAI 把它做成显式计费项,等于把一部分优化责任转移给了使用者。对认真做工程的团队,这是利好;对习惯堆提示词的团队,这是隐形涨价。
基准分数该往哪儿看
总分是最不重要的那部分
这次公布的基准对比覆盖了好几组任务,编码、数学推理、Agent 工具使用各占一块。看这类表格,最容易犯的错是盯着一行总分然后下结论。真实场景里的差距往往藏在分项里:某个模型在短上下文任务上领先,换成长文档检索就掉队;工具调用的成功率好看,但一轮失败后的自我纠正能力很差。这些细节不会出现在摘要行里。
把价格除进去再比一次
更实用的做法是做一次成本归一化:同样的任务集,按每百万 token 的实付价格折算,看每解决一个问题花多少钱。这个算法会得出一些反直觉的结果——某个模型分数低 5%,但单价低 80%,在批量场景里它才是正解。基准测试衡量能力,价格衡量可行性,两者不放在一起看,选型就会失真。
定价战的下一个回合
对手不会坐着不动
Claude Opus 5.5 已经把成本压低了 40%,Google 那边也不会等太久。整个行业的输入输出价格在过去一年里持续下探,降价的节奏比模型能力的提升更规律。OpenAI 这次把 Luna 压到 0.1 美元,某种程度上是在给对手划一条线:低于这条线,大家都得重新算账。价格战打到现在,拼的已经不是谁更便宜,而是谁能在便宜的同时不砍掉关键能力。
小团队的窗口期有多长
对资源有限的团队来说,这轮降价是实打实的红利。以前需要自建推理集群才能控制的成本,现在直接调 API 就够了,省下的精力可以放到产品上。窗口期不会太长,因为价格优势会被迅速抹平,真正留下的差异还是场景理解与工程细节。Sol 和 Luna 提供的是原料,菜怎么做,还是厨房里的事。

