Anthropic 把 Claude Opus 5.5 放出来了,5.5 系列的第一个模型,不是 Opus 6,也不是一整套 5.5 全家桶,就一个 Opus 打头阵。官方说明里两句话最实在:多数任务上够到 Claude Fable 5.1 的水平,运行成本比 Opus 5 低 40%。一个讲能力,一个讲价格,剩下的解读空间全留给了用户。
便宜四成,账本却没变薄
单价下降和总支出之间隔着一层
40% 这个数字指的是推理价格,落到实际账单上未必等比例收缩。原因不复杂:模型便宜了,团队的第一反应往往是加大用量,而不是砍预算。上下文拉长一点,让模型自己多反思两轮,失败任务重试几次,或者干脆并行采样三个答案再挑最好的——这些在过去因为贵而被迫省掉的动作,现在都有理由加回来。
于是常见的一幕出现了:单价降了 40%,月度支出反而涨了。这不叫失控,这叫需求被释放。真正该盯的不是价格表,而是单位任务的完整成本——一次成功的智能体任务,包括失败的中间步骤、工具调用重试、上下文重复读入,总共花了多少。
51% 的那个数字更接近真实体感
Boris Cherny 的实测给出了另一个口径:比 Fable 5.1 更快,成本低 51%。两个数字不一样,40% 是相对 Opus 5 的官方定价差,51% 是相对竞品在真实工作负载下的实测差。前者是标价,后者是跑了活之后的账。
关注后者更有意义。因为在智能体场景里,成本和速度是绑在一起的——模型快,一次任务里的串行步骤就少,每个步骤的 token 消耗也少,省钱是从两个方向同时发生的。只盯单价,很容易漏掉这一层。
追平 Fable 5.1,是及格线不是终点
“多数任务”四个字留了多大的余地
官方说的是“多数任务达到 Fable 5.1 的水平”,不是“超过”,也不是“全面对标”。这种措辞在模型发布里很常见,它同时传达两件事:日常场景可以放心替换,边缘场景得自己验证。所谓边缘场景,通常是超长上下文里的信息检索、多轮工具调用后的状态一致性、以及需要严格格式输出的结构化任务。
如果你的业务跑的全是标准问答和文档摘要,这个差距基本感觉不到。如果你在跑几十步的工具链,模型在第七步理解错了工具返回值的格式,后面全盘崩掉,那“多数任务持平”对你来说就不是好消息。
编码智能体被单独点名,不是偶然
相关实测里,智能体编码是被反复拎出来讲的场景。这块是当下大模型竞争最密集的战场,也是最能体现综合能力的考场:要读懂大半个仓库的代码,要规划改动顺序,要执行命令、看报错、回头改,一环扣一环。
在这个场景里,模型的差距会被放大,而不是被平均掉。一次任务动辄几十次模型调用,每次调用省下的时间和钱都乘以几十。所以厂商愿意在这里做对比,用户也最该在这里做对比——把你的真实 CI 流程、真实的仓库和真实的报错日志丢进去跑一遍,比任何评测榜单都准。
OpenRouter 同步上架,说明什么
Claude Opus 5.5 上线 OpenRouter 这件事,容易被当成例行公事。它其实透露了 Anthropic 对分发渠道的态度:不指望所有人都从官方 API 进来。对中小团队来说,多一个入口意味着更低的迁移摩擦——不用改结算方式,不用重签合同,改一行模型名就能跑 A/B 测试。
反过来看,这也让“观望”变得更没道理。过去换模型要评估的事一大堆,现在切换成本低到几乎可以忽略,剩下的只是你愿不愿意花半天时间做对照实验。
迁移这件事,先分清自己的位置
三类负载可以马上动手
批量内容处理是第一个。分类、抽取、摘要、翻译这类任务,输入输出结构稳定,失败一眼就能看出来,Opus 5.5 的成本优势在这里能全部兑现。
第二类是内部工具和后台自动化。这类场景对延迟和稳定性要求不高,对价格敏感,换过去之后省下的钱是实打实的,出问题的影响面也可控。
第三类是高并发但低风险的对话场景,比如客服前置筛选、FAQ 分流。就算模型偶尔判断偏差,后面还有人工兜底,试错成本小。
两类场景反而该稳住
一类是把模型输出直接写进生产数据库或触发真实操作的工作流。这类场景里,模型的每一个动作都有不可逆的后果,能力“持平”远不足以支撑切换,需要的是逐条用例的回归验证,这个周期至少以周计。
另一类是对输出格式有严格契约的场景。如果你的下游解析器对 JSON 结构、字段顺序、枚举值容错极低,换模型之前先把契约测试跑满,否则省下来的钱不够修一次线上事故。
尾号 5.5 暴露的节奏问题
大版本号正在贬值
5.5 系列的第一个模型叫 Opus 5.5,而不是 Opus 6。这个命名方式说明 Anthropic 自己也认为,这次迭代的幅度够不上一个整数代。能力上追平一个更强的竞品,成本上砍掉四成,放在两年前足够撑起一次大版本发布,现在只配一个点号。
对整个行业来说,这是好事也是麻烦。好事在于改进的节奏更快、更细,用户能持续吃到红利。麻烦在于版本号的参考价值在下降——你没法再靠“这是新一代”来判断该不该升级,只能自己动手测。
等待的成本比过去更贵
过去观望一个季度,代价是错过了大概一代模型的提升。现在观望一个季度,可能错过两到三次迭代,每一次都在降成本、补短板。对于那些按 token 计费、月消耗量在千万级以上的团队,晚三个月切换,省下的钱就够养一个人。
当然,没人该为了追新而追新。判断标准很简单:把你最贵的那条工作流拿出来,用 Opus 5.5 跑一批真实样本,对比成功率、延迟和总花费。数字好看就换,数字不好看就等下一个。这比任何发布说明都可靠。

