Anthropic 把 Claude Opus 5.5 放出来了,这是 Claude 5.5 系列的第一个模型。比起"又强了多少",我更关心另一组数字:典型负载成本比 Opus 5 低 40%。在一个各家都能把榜单刷到高位的年份里,便宜四成往往比强一点点更能改变实际用起来的样子。
便宜四成,比强一点更值得聊
先谈钱,因为钱决定了能力能不能被用上。模型再强,如果一次任务跑下来账单让人肉疼,团队自然会把它锁进"高价值、低频次"的角落里。40% 的降幅,足以把 Opus 5.5 从那个角落拽出来。
成本降下来,调用姿势就会变
过去两年,团队用旗舰模型的典型姿势是"省着用":先让便宜模型跑一轮,拿不准的再升级;一次任务最多重试两次;上下文能截就截。这套纪律不是审美偏好,是被账单逼出来的。成本砍掉四成之后,纪律会松动。重试三次变成五次,检索结果多塞两轮,让模型自己反思一遍再输出——这些动作单独看都是小事,加在一起就是产品体验的台阶。省下来的钱本身不重要,重要的是原来不敢做的那些调用,现在敢做了。
每百万 token 的账,成了新的比分区
榜单分数同质化的速度比想象中快。前十名挤在几分之内,用户根本分辨不出差别。于是决策依据往下沉,落到输入输出单价、缓存命中率、批量折扣这些冷冰冰的条目上。行业成熟了,才会把注意力放到成本结构上。旗舰和次旗舰之间的价格差在收窄,对做长链路产品的团队来说,这是实打实的利好。
越过 Fable 5.1 这条线之后
Anthropic 给 Opus 5.5 的定位说法很克制:在多数工作上达到 Fable 5.1 的水平。这句话值得拆开看。
"多数工作"这四个字留了余地
"多数"意味着还有少数。哪些是少数,官方没细说,但按模型发布的一般规律推,吃亏的通常是那些需要超长上下文一致性、多模态精细判断、或者高度专业领域推理的任务。对绝大多数产品团队来说,这个"多数"覆盖了日常百分之八九十的调用场景——写代码、改文案、跑数据分析、做客服分流。所以这句话的实际含义是:你不必为了顶配能力付顶配的钱,主流场景已经够用。真正落到那"少数"里的需求,才值得继续往上一档看。
长任务才是分水岭
短问答早就不是问题了。难的是让模型自己跑二十分钟,中间调十几个工具,还不能在第八步就跑偏。长任务里误差会累积,一次小的判断失误会在后面被放大成完全错误的结果——这也是"多数工作达标"这句话在长任务语境下要打个折扣的原因。如果场景是一次性生成,Opus 5.5 大概率够用;如果是端到端的自动化流程,还是得拿真实数据自己跑一遍,别信任何人的评测,包括官方的。
Agent 与编码,被改写的部分在这里
标签里写着 Agent 和编码,这不是随手贴的。这两件事恰好最吃 token,也最在意单次成本。
写代码的重心正在后移
补全式的代码助手已经没什么可卷的了。真正的战场往后挪到了"给一个 issue,让模型自己读仓库、改文件、跑测试、提交 PR"。这条链路里,模型要读的上下文动辄几十万 token,要来回修改十几轮。成本每降一点,能跑完的链路就长一截。Opus 5.5 强调智能体编码上的能力提升,配合成本下降,针对的正是这个位置:帮你把整段流程接过去,而不是让你敲得快一点。工程团队的衡量指标也会跟着变,从"补全接受率"变成"这个 PR 有多少不需要人来返工"。
Agent 能跑多久,取决于账单
做 Agent 的人都懂一个残酷现实:架构设计最后都会被成本约束改写。要不要保留完整历史、要不要每步都做自我验证、能不能并行开三条支线探索——这些看起来是技术决策,本质上是财务决策。单次调用便宜四成,意味着原先因为太贵而砍掉的设计可以捡回来。反过来,如果模型在长任务上确实更强,一次做对的概率提高,重试次数下降,实际成本的降幅会比标称的 40% 还大。两个因素叠在一起,才是这次发布对 Agent 生态的真正意义。
58 分、安全报告,以及榜单没说的事
按第三方评测,Claude Opus 5.5 在 Artificial Analysis 智能指数上拿到 58 分,排在第一。榜单值得看一眼,但别盯着看。
登顶智能指数的边际意义
第一名和第三名之间那几分,对实际产品的意义非常有限。榜单测的是标准化任务,你的业务跑的是非标准化任务,两者相关性没有想象中高。真正有参考价值的是分数背后的分布——哪些维度领先得多,哪些垫底。如果领先集中在推理和编码,那它就不是通用型选择,而是有明确适用面的工具。榜单的正确用法是排除法:先用它筛掉明显不合适的,剩下的交给自己的测试数据。
安全评测里不热闹的部分
Anthropic 照例给了安全评测细节,这部分通常没人爱读,却是企业采购流程里绕不过去的一环。对合规敏感的行业来说,模型能不能上线,往往不取决于它多聪明,而取决于风险披露是否完整、滥用防护是否可验证。Opus 5.5 在长任务上的自主性越强,这部分的权重就越高——一个能自己跑二十分钟、调十几个工具的模型,出错的方式和只会问答的模型完全不是一回事。上线前把权限边界和人工确认点重新过一遍,别沿用上一代模型的假设,这一条比看榜单有用得多。
5.5 系列刚开门
Opus 5.5 是 5.5 系列的第一个模型。开局之作的任务不是封顶,是定调。
首发模型定的是什么调
从定价策略看,这一代的基调是"把旗舰能力做成能批量使用的东西"。成本下降四成、能力对齐前沿参照、主打智能体与编码,三条线指向同一个方向:让模型从偶尔被请出来的专家,变成流水线上稳定运转的一环。这意味着后续几个模型大概率会沿同一路径走,继续压成本、补长任务短板,而不是去追某个单项纪录。对开发者来说这是好消息,它降低了押注的风险。
开发团队现在该做的三件事
第一,拿你自己的任务集重跑一遍基准,重点看长链路任务的失败模式,而不是平均分。第二,把成本算清楚,但要用真实的调用次数和重试率,别只乘单价——重试率的变化往往比单价更能决定总账。第三,重新翻一遍当年因为成本被砍掉的功能清单,它们现在可能重新可行了。技术选型里最贵的从来不是模型费用,而是你因为成本假设而放弃的那些产品形态。

