GPT-6.1 Sol 上线没有配发布会,只有开发者账号的一条推文。但定位写得毫不含糊:复杂重构、深度代码库调查、跨应用长时间运行的智能体。翻译成人话——OpenAI 这次不打算让模型更会聊天,它想让模型更像一个能打卡上班的同事。同时放出的还有 computer use 能力和一张让不少人愣了一下的价格表。
能力清单里,藏着一次重心转移
编码这件事,从"补全"走到了"接手"
过去两年,编码模型的竞争焦点是补全准确率:给半行函数,猜出下一行。Sol 谈的却是重构。重构难在哪?不在写新代码,而在读懂旧代码为什么长成这样——那些没人写注释的兼容分支,那些为了绕开某个已下线服务而留下的硬编码。要在这里不出错,模型得对整个代码库建立长期记忆。工程量级完全不同。
computer use 补上了最后一环
会写代码的模型有个天然残疾:它只能活在自己的文本世界里。要跑一次构建、要看 CI 报错、要在内部工具里点两下确认发布状态,它就得停下来等人。computer use 把这个断点接上了。看屏幕、操作界面,这些动作串起来,模型才第一次能自己完成"改→测→看结果→再改"的闭环。闭环一旦成立,agent 才算具备独立工作的资格。
"接近 Astra"是句很重的评价
Astra 在 OpenAI 的产品序列里处于什么位置,圈内人心里有数。用"接近"而不是"对标",措辞相当克制,信息量却足够大:Sol 不是常规的小版本迭代,它在某些维度上已经咬住了更高一档的产品。剩下那点差距具体在哪,官方没说。这种沉默通常比参数表更值得琢磨。
价格表里那句容易被读反的话
95% 折扣,等于标价的二十分之一
官方措辞是缓存输入定价为标准输入价格的 95% 折扣。仔细读——不是打九五折,是减掉 95%,实际支付标准价的 5%。这个力度在 API 市场里几乎找不到先例。多数厂商的缓存折扣在 50% 到 90% 之间徘徊,做到 95%,基本等于把重复上下文当成免费资源在发。
它赌的是长任务会成为主流
为什么下这个狠手?因为长时间运行的智能体会疯狂重复发送同一批上下文。你让它调查一个大型代码库,第一轮读进去十万 token,第二轮、第三轮、第十轮还在读同样的文件。每次都按标准价计费,成本曲线会陡到没人敢用。把缓存价格压到 5%,等于给长任务松了绑。
门槛从单价挪到了总量
便宜不便宜,得看跑多久。一个 agent 连续工作八小时,调用次数可能上千,累计 token 消耗远超单人一天的对话量。这个定价结构其实在筛客户:偶尔问两句的人感受不到便宜,只有真打算让模型长时间干活的人,才会发现账单和预期完全不是一回事。
三个场景,三种不同的赌注
复杂重构:把跨季度的事塞进两周
遗留系统迁移、框架升级、模块解耦——这类活的特点是收益明确、过程折磨。没人愿意干,因为改动面太广,风险散落在几百个文件里。第一轮全量梳理和机械替换交给它,人类只处理被标出来的疑点,这个分工在 Sol 这一档上第一次显得靠谱。
深度调查:新人不必再问那个问题
"这段代码为什么这么写"是团队里最贵的问题。答案往往藏在三年前的提交记录、某个已离职同事的邮件,以及一条没人记得的工单里。把这项任务交出去,附带一个时间预算,它给出的不只是解释,还有引用路径。这比一位语焉不详的老员工口述可靠得多。
跨应用长跑:耐力比聪明更难
同时操作代码仓库、CI 面板、工单系统和聊天工具,中途不能掉线,不能忘记三小时前设定的目标。这种任务考验的不是单步推理,而是状态维持。它一旦稳定,改变的就不只是程序员的工作方式,还有整个发布流程的人力配置。
剩下那些没人回答的问题
八小时自主运行,谁来兜底
agent 跑得越久,犯错的窗口越大。一个错误的分支决策在第八小时才暴露,中间它可能已经改了几十个文件、触发了几次构建。权限边界怎么划、回滚怎么做、谁在什么时刻按下暂停键——发布推文里一个字都没提。
评测体系还在追产品
现有编码基准大多测单轮任务,十几分钟跑完。拿它们衡量一个能连续工作八小时的模型,相当于用百米成绩预测马拉松。缺少合适的评测手段,结果就是用户只能在自己的生产环境里试错,而这个试错成本并不低。
Sol 的发布没有烟花,方向却指得很明白:能长时间独立干活的模型,和能漂亮回答问题的模型,是两种完全不同的产品。前者要处理的问题更脏、更琐碎,也更接近真实工作本身。价格表已经先走一步,接下来要看的是生态跟不跟得上。

