OpenAI 把 GPT-6.1 Sol 的价格挂了出来:每百万 token 输入 2 美元,输出 10 美元,缓存输入 0.1 美元。对照 GPT-6 Astra 的标准价,这个数字大约是五分之一。官方给的定位也很直白——编码与电脑操作能力接近 Astra,价格降到几乎谁都能上手试一把的程度。这两句话放在一起,比任何一个 benchmark 分数都更值得琢磨。
一张价目表,把行业心理价位往下拽了一截
输入 2 美元、输出 10 美元,落在哪条曲线上
先看比例本身。输入和输出是 1:5。这个溢价倍数在近两年的公开定价里算是偏高的,说明 OpenAI 仍然把生成侧当作稀缺资源来卖,读取侧则被当成引流的口子。2 美元的输入价位已经很难再叫"小模型价"了,它落在的是主力模型的位置——换句话说,Sol 不是拿来打杂的,它是被设计来承接真实生产流量的。
而 10 美元的输出价,恰好卡在大多数团队的"能用但会心疼"区间。写长文、生成大段代码、跑多轮推理,这些输出密集型场景的账单不会因为你换了个便宜模型就消失,只是从难以承受变成可以接受。
真正的主角是那 0.1 美元
缓存输入压到标准输入的 1/20,这个折扣比输出侧的定价更能说明意图。厂商希望你把重复的长上下文留在它的缓存里,而不是自己回去裁剪 prompt。对 Agent 类应用来说,这一条几乎重新定义了架构选择:系统提示词、工具定义、代码库索引、历史对话前缀,这些过去被反复精简的东西,现在可以反过来堆厚,靠缓存摊薄成本。
过去两年工程团队花了大量精力做上下文压缩,做的其实是省钱。当重复前缀的价格降到十分之一量级,一部分压缩工作就失去了意义——省下来的那点 token,还不够你多写两天代码。
"五分之一"是怎么算出来的
这个说法有口径问题。真实降幅取决于你的输入输出混合比例。读文档、读代码库这类输入密集的工作负载,实际成本下降可能远超 80%;而长文生成、大段代码输出这类输出密集的任务,降幅就贴近五分之一这个数。所以别把"五分之一"直接搬进财务模型,它更适合当成一个对外传播的锚点,不是你的账单预测。要预测,就得拿自己的真实流量跑一遍。
便宜到能做电脑操作,才是要紧事
写代码这件事正在被重新定价
编程 Agent 是公认的 token 消耗大户。一次跨文件重构,动辄烧掉几十万 token,中间还要反复读仓库、跑测试、修正错误。价格下降带来的直接变化,不是"每次调用便宜了",而是使用频率可以放开——原来只敢在关键任务上开的高强度模式,现在可以常驻在后台,让它自己找活干。
这个转变的量级,比单价降八成要大得多。成本约束一旦松开,被压住的需求会自己冒出来。
一旦成本不再是瓶颈,瓶颈就换人了
成本让位之后,排在前面的是什么?延迟、上下文窗口的边界、工具调用的成功率、评测和回滚机制。这些问题以前被"太贵了"掩盖着,现在会一个个浮上来。
更现实的是,团队会发现自己的工程能力跟不上模型的性价比。价格便宜的模型给你更多尝试机会,同时也意味着你需要一套能快速判断"这次尝试有没有变好"的系统。没有这套东西,便宜只会带来更多的无效调用。
长链路任务的失败成本
电脑操作类的任务天然是多步的,每一步都可能出岔子。单步成本降了,错误却会累积:一个五十步的任务,假如单步成功率是 95%,整体成功率不到 8%。这意味着大部分算力花在了失败的路径上。
所以便宜的模型在长链路场景里未必真便宜。单次调用省下来的钱,可能被重跑和人工兜底吃掉。真正决定成本的,是你在第几步发现跑偏、能不能干净地回滚。
有人松口气,有人要改预算表
卡在中间的模型厂商
最难受的是夹在开源方案和前沿模型之间的那一层。往上,能力差距还在;往下,价格优势被 Sol 这类产品直接吃掉。它们的定价空间被两头挤压,剩下的差异化只能往垂直场景、私有部署、数据合规这些方向走。
Agent 创业公司的单位经济学
如果你的产品按"每个任务多少钱"来卖,成本突然掉八成,你会面临一个不太好回答的问题:要不要降价?不降,客户自己会算这笔账;降,收入数字立刻难看。这是个窗口期的博弈——先动的人能抢份额,后动的人被迫跟进却没有先发优势。
比较务实的做法,是把省下来的成本转投到产品能力上,让客户感知到的是"同样价格能做更多事",而不是单纯的价格标签变化。
自建推理还划算吗
自建的成本结构是固定的:GPU 折旧、机房、运维人力,这些不会因为 API 降价而减少。外部价格越往下走,自建的相对劣势就越明显。除非有数据驻留、合规审计或者极端定制化的需求,否则租用会比自建更划算,而且迭代速度也更跟得上。
值得提醒的是,别用今天的价格去论证三年期的自建投资。这个市场的价格曲线,不太适合拿来做长期折现。
迁移之前,先算三笔账
标价不等于账单
实际支出大致由三部分构成:未命中缓存的输入按标准价,命中的部分按缓存价,输出按输出价。你的真实账单取决于这三者的比例。拿一个月的生产流量做一次影子测试,比看任何定价页都有用。
缓存命中率不是你能控制的
缓存有存活时间,有淘汰策略,也可能因为你调整了 prompt 前缀而整体失效。命中率会波动,账单就会跟着波动。把稳态命中率当成合同条款来规划预算,是个常见但代价不小的错误——留出余量,比追求极致优化更实在。
迭代速度带来的隐性折旧
模型版本的更新节奏快得离谱。你今天为 Sol 打磨的提示词、搭建的评测集、调优的参数,下个版本未必还适用。迁移成本不只在工程侧,还有团队的学习曲线和组织记忆的重新建立。
价格战打到这个阶段,被压缩的其实是试错成本。当一次实验只花几块钱的时候,分出胜负的就不再是谁能拿到模型,而是谁的评测体系能更快地告诉自己:这条路走不通,换一条。便宜给了所有人更多机会,也把淘汰的速度调快了一档。

