GPT-6.1 Sol 的价格一挂出来,OpenAI 就动手把自家最贵那条产品线的定价锚给拔了。每百万输入 token 两美元,缓存输入一毛,输出十美元——这组数字摆在 GPT-6 Astra 旁边,恰好是它的五分之一。便宜五倍还能贴着旗舰跑,一年前没人敢这么报价。
先把价格摊开看
Astra 的锚,被自己人拔了
Astra 在 OpenAI 的产品序列里是什么位置?做最难的任务,收最贵的钱,客户是那些不太计较单价、只在乎能不能跑通的企业。它的定价本身也是信号:贵,是因为算力堆得狠、推理链拉得长。
Sol 把这条逻辑撬开了。同样的输入两美元,同样的输出十美元,等于对外宣告:以前只有 Astra 能干的活,现在不一定要花这个价。旗舰的溢价空间第一次被自家兄弟从下方挤压。
缓存输入一毛钱,这才是重点
很多人盯着那两美元,其实真正决定成本结构的是缓存输入。0.1 美元每百万 token,意味着重复上下文几乎不要钱。
Agent 是什么形态的工作负载?系统提示、工具定义、代码库摘要、上一轮的执行日志,每一轮都要重新喂一遍。上下文越攒越长,输入 token 像滚雪球。缓存把这部分成本压到原来的二十分之一,一个循环几十轮的编码 agent,账单能差出数量级。
便宜的性能,才叫性能
跑分高但用不起,等于没有。价格掉到五分之一,同一个预算能跑的 agent 轮次、能并发的工作流、能试的失败方案,全都翻了几倍。
评估一个模型的真实能力,从来不该只看它答对多少题,还要看每道题花掉多少钱。单位任务成本这把这尺子,Sol 几乎重新刻了刻度。
三块硬骨头,它都啃了
agentic 编码,难的不是写,是收尾
让模型补一段函数,早就不是问题了。难的是它接下整个任务:翻遍仓库、改五六个文件、跑测试、看见报错、自己回头修、再跑一遍,直到绿灯。
这条链路里最容易崩的地方在收尾。模型容易在第二三次迭代后开始打转,或者干脆自信地宣布完成。Sol 在这类长程任务上逼近 Astra,说明它在自我纠错和状态跟踪上补了课。对天天跑 CI、盯 diff 的团队来说,这才是真正能省人的能力。
computer use 从演示走向干活
点按钮、滚页面、填表格、在只有网页版的老系统里走流程——这块能力过去两年一直停在视频演示阶段。演示好看,一进生产环境就翻车:界面慢一拍、弹窗挡住控件、验证码跳出来。
Sol 把这个能力拉到接近 Astra 的水平,价值不在能力上限,而在稳定性。能连续操作几十步不出错,才有资格接管那些没人愿意写的 RPA 脚本。
专业工作不等于写得漂亮
很多人一提到专业工作就想到写报告。真正的工作量在别处:把三份口径不同的表格对齐、在合同里找出一致性冲突、按流程把数据从 A 系统搬到 B 系统。
这类任务没有标准答案,只有对不对。Sol 要证明的不是文采,而是它在模糊指令下依然能守住边界、不瞎编、不乱猜。
命名里的那点心思
为什么不直接叫 GPT-7
版本号是资产,也是承诺。挂上 7,等于告诉所有人这是一次代际跃迁,得配得上全行业重新评测一轮的期待。叫 6.1,就是另一套说法:同代内的补位,能力小步走,价格大步走。
这种命名策略很实际。它把用户的注意力从"是不是又变强了"转到"是不是终于用得起了"。
采购的算盘要重打一遍
企业采购看三件事:能力够不够、单价能不能接受、换供应商麻不麻烦。Sol 直接把第二项的答案改了。
原本因为成本压着只敢在小场景试 agent 的团队,现在可以把范围放大。原本打算多模型混跑、拿便宜模型做粗活的公司,会发现统一到一个模型上的管理成本更低。
对手的窗口还剩多少
价格战一旦开打,跟进的人只有两条路:要么把同等能力的模型降到相近价位,牺牲毛利;要么守住高价,讲清楚自己凭什么值那个钱。
最难受的是那些靠"便宜但够用"立足的中档模型。它们原本的生存空间,恰恰是 Astra 和廉价小模型之间的夹层。现在这个夹层被 Sol 直接占住了。
开发者现在该做什么
别急着全量迁移,先跑通一条链路
换模型的成本从来不在 API 调用那一行代码,而在提示词、工具定义、重试逻辑、评测集。挑一个真实的、有明确成功标准的工作流,比如自动修 CI 失败的测试,先跑两周。
看三件事:完成率、平均轮次、单次任务成本。这三个数出来,迁不迁就不用争论了。
把缓存当成架构的一部分来设计
缓存输入一毛钱的定价,本质是在鼓励你重排上下文。固定的系统提示放前面,变动的内容放后面;把长期不变的代码库摘要单独固化;别在每轮里重新拼一遍工具描述。
这不是优化技巧,是设计约束。上下文顺序写得好,成本能砍掉一大半;写得乱,再便宜的模型也救不回来。
留一条退路,别把核心链路焊死
模型迭代速度摆在那,今天的最优解半年后大概率不是。抽象一层调用接口,把评测集攥在自己手里,让切换成本保持在一天以内。
价格低是好事,但把所有重要流程绑死在单一供应商上,省下来的钱迟早会在下一次变动里加倍还回去。
Sol 真正有意思的地方不是它有多强,而是它把"够强的能力"重新定了价。当一轮 agent 任务从几美元掉到几十美分,很多以前算不过账的产品,突然就算得过来了。

