GPT-6 Sol 和 Luna 的价格一出来,圈内第一反应是"又降价了"。Artificial Analysis 给出的账单很直白:Sol 每百万输入/输出 token 卖 2 美元和 10 美元,Luna 只卖 0.1 美元和 0.5 美元,两个型号都把 GPT-5.6 同名版本的价格压到了大约一半。但真正值得琢磨的不是省下的那点钱。当同等量级的智能指数被打成半价,一批过去算不过账的活儿会突然变得划算——自动化的边界从来不是由模型能力单独决定的,它也由每条 token 的价格决定。
价格砍半,被改写的是"什么活值得交给模型"
便宜的一半,未必落在账单上
token 单价只是账单的分子。完整账单是单价乘以推理长度、重试次数、agent 循环的步数之和。便宜模型有个隐性副作用:你会更舍得让它多试几次、多读几个文件、多跑一轮自我检查。这些行为叠加起来,成本可能不降反升,省下的单价被挥霍掉的步数吃掉。反过来,在调用量大、单次任务短、失败代价低的场景里,单价下降几乎是一比一传导到账单。所以判断该不该换,先别问"便宜多少",要问"我的调用里,有多少是短平快的"。
Sol 和 Luna 差了 20 倍,这不是同一个梯队的两个尺寸
按输入价算,Luna 比 Sol 便宜整整 20 倍,输出端同样是 20 倍。这么大的价差说明 OpenAI 没把它们当成"大杯和超大杯"来卖,而是做了明确分工:Sol 站在需要判断力、需要一次做对的位置,Luna 被推到那些量大、琐碎、错了重来也不心疼的位置。用错梯队的代价往往比用贵模型更高。让 Luna 去啃复杂重构,反复失败的重试会把省下的钱连本带利吐回去;让 Sol 去干格式化抽取这类机械活,则是纯粹的浪费。
省下来的预算,通常不会留在原地
历史上每一次推理降价,最后都不是让账单变小,而是让用法变贪。单价掉一半,团队的第一反应往往是把上下文从 32K 拉到 128K,把候选方案从 3 个加到 10 个,把一次调用拆成"生成—自检—重写"三段。这是好事:过去被成本压住的产品设计空间被释放出来了。但它也意味着,做预算时不能只拿旧用量乘以新单价,得按"你会怎么改变用法"来算。
基准表上的升降,比总分更有信息量
智能指数持平,意味着什么
Artificial Analysis 的结论里最醒目的四个字是"指数持平"——新模型没有靠牺牲综合能力来换低价。这在价格战里并不常见。降价的路子通常两条:一条是蒸馏,把大模型的能力压进小模型,代价是复杂推理上的衰减;另一条是工程优化,同样的能力用更少的算力跑出来,能力基本不动。从指数持平这个结果看,这一轮更接近后者。但"持平"是个平均值,而平均值会掩盖结构性变化,只看一个总分就下结论,容易踩空。
幻觉率是那条暗线
降价之后模型会不会更容易胡说,是所有人心里没说出口的问题。把幻觉相关的评测单列出来看很有必要,理由很简单:幻觉对成本的杀伤是隐性的。一个爱编造的模型表面上 token 更便宜,但它会把你拖进"发现错误—重新提问—再验证"的循环,人工复核的时间成本远高于那点差价。客服、法务、医疗这类场景里,幻觉率哪怕小幅上升,也足以抵消全部降价收益。评估新模型时,这一栏的权重应该高于综合分。
逐项看升降,能看到取舍的痕迹
任何一次"综合能力不变"的发布,拆到科目级别都会看到有升有降。那是工程取舍留下的指纹:某些推理链条被压缩了,某些知识覆盖被重新分配了。读懂这些升降,比记住总排名有用得多,因为你的业务只落在其中几个科目上。做代码补全的盯编码类,做长文档问答的盯长上下文与检索类,做多轮工具调用的盯 agent 类。总分一样,落到你的场景里可能是完全不同的两个模型。
编码,是第一个被重新定价的战场
Codex 和 ChatGPT Work 里的分工
Sol 和 Luna 已经推进 Codex 与 ChatGPT Work,这个顺序不是偶然。编码是目前 token 消耗最密集、收益又最容易量化的场景:一次任务要读文件、改代码、跑测试、修报错,循环几十步是常态。在这种结构里,单价乘以步数的效应被放到最大。一个合理的分法正在成型——让贵的模型做规划、拆解和关键改动,让便宜的模型做批量生成、样板代码、日志分析和测试补齐。
agent 循环里,每一步都在计费
把 agent 想成一列火车,每节车厢单独收费。过去为了让整列车跑得稳,只能全程用贵模型;现在可以在中间挂几节便宜车厢——读取文件、解析报错、生成候选补丁交给 Luna,真正需要判断力的那几步再切回 Sol。这种混合编组的做法,在两代模型价差 20 倍的时候才有意义。它也解释了为什么一张价格表的变动会直接改变 agent 产品的架构选择,而不只是运维成本表上的一个数字。
便宜的那个,兜不住复杂重构
但别指望 Luna 什么都能接。长上下文里的信息保持、跨文件的依赖推理、需要理解业务意图的重构,这些任务对模型的要求是台阶式的,不是渐进的。便宜模型在这些地方的表现往往不是"差一点",而是"错得让你更难查"。判断方法很土但有效:把同一批真实工单同时丢给两个模型,不看通过率,看人工返工的时间。返工时间一旦超过 token 差价,便宜就是假的。
换还是不换,是道算术题
个人开发者:先动调用量最大的那条链路
别整体迁移,先翻日志,找 token 消耗排前三的接口。它们通常干着最机械的活,换成 Luna 的风险最低、收益最直接。跑一周,盯失败率和重试次数有没有抬头。这套流程花不了半天,却能省掉后面几周的排查。
团队:用真实流量做 A/B,别拿公开榜拍板
公开基准是用来筛候选的,不是用来做决策的。把 5% 的线上流量切给新模型,观察三件事:任务成功率、平均返工时间、单任务总成本。三件事里有两件变好,才值得扩大比例。做这个对比时有一条铁律——评估集必须来自你自己的业务,否则你测的是别人的场景。
什么时候该按兵不动
如果业务对错误极度敏感,或者当前调用量本来就不大,这轮降价的绝对收益有限,迁移带来的不确定性反而不划算。还有一种情况值得等:如果你的场景高度依赖长上下文和复杂推理,而这两个方向恰好可能是新模型做了取舍的地方,那就先观望一两周,等行业里跑出更多真实反馈再说。
这轮降价,争的是单位智能的价格
降价不是促销,是产能问题
把价格砍半通常只有两种解释:推理效率真的提升了,或者用低价换市场份额。同时推出高价位的 Sol 和极低价的 Luna,更像是前者叠加分层定价——用一个型号守住能力上限,用另一个型号去试探智能的底价在哪里。对使用者来说,这个策略的副产品是:那些卡在"必须用最好的"和"不值得用模型"之间的任务,第一次有了明确的价格坐标。
接下来值得盯的几个信号
看三件事就够了。第一,Luna 的实际采用率——如果它在 agent 和批处理场景里铺开,说明低价位确实有真实需求。第二,Sol 的价格会不会跟着松动——如果连高端型号都开始降,说明竞争压力已经传导到利润最厚的地方。第三,幻觉率在后续版本里的走向——价格可以一直降,可信度一旦掉下去,是很难用价格赎回来的。

