Anthropic 把 Claude Sonnet 5.5 放出来了,价格一个字没动——每百万输入 token 还是 2 美元,输出 10 美元,缓存读取 0.20 美元。变的是另外两个数字:生成速度比 Sonnet 5 快 30% 以上,单个任务的花费最多降 30%。同样一张账单,买到的东西多了。这在大模型圈子里其实不常见。过去两年大家习惯的剧本是二选一:性能涨、价格跟着涨,或者价格降、能力悄悄缩水。这一次,Anthropic 把两头的压力都自己吞了。
价格没动,账却变薄了
2 美元和 10 美元,这两个数字的分量
输入 2 美元、输出 10 美元,这个价位 Anthropic 已经守了一段时间。守着不涨,本身就是一种表态。在中间层模型这个价格带上,单价接近一种公共约定,谁先动手谁先失血,所以真正的差距不在标价,而在同一个价格能干多少活。输出价格是输入的 5 倍,这个比例把成本结构说得很清楚:生成是大头,读进去的上下文相对便宜。任何能减少输出浪费、减少来回重试的优化,最后都会直接落在账单上。
“每个任务便宜 30%”不等于“单价打了七折”
这两句话经常被混着说,差别其实很大。单价打折是财务动作,签个字就能做到;任务成本下降是工程结果,得靠模型在同一个问题上少绕弯、少说废话、少触发重试。Anthropic 给的是后一种说法——token 价格原地不动,完成一次任务的整体开销最多降三成。也就是说,同样是写一段代码、跑一轮工具调用、总结一份合同,消耗的 token 变少了。对企业而言,这种降本才是可持续的,它不依赖补贴,也不会在下个季度被收回去。
缓存那道杠杆,很多人还没拧到底
缓存读取 0.20 美元,是输入价格的十分之一。这个折扣幅度直接决定了哪些架构值得做、哪些不值得做。一个每轮都要带上几万字系统提示和知识库片段的 Agent,如果每次都按 2 美元重新读一遍,账单会很难看;走缓存就是另一回事。速度提升三成,再叠加缓存折扣,受益最明显的恰恰是那些调用密集、上下文冗长的场景——代码助手、客服自动化、文档流水线。这些也正是过去一年 token 消耗涨得最快的地方。
Claude 5.5 家族的第二块拼图
先出谁、后出谁,是有讲究的
Sonnet 5.5 是 Claude 5.5 家族的第二款模型。一个家族通常不会平铺开来发布,而是先立住一个标杆,再往下填产能。旗舰负责证明能力上限,中间型号负责把这份能力变成可以大规模铺开的商品。第二款落在 Sonnet 上,说明这一代产品线正在从“证明自己”切换到“占领预算”。企业采购从来不是买最强的那一个,而是买够用又便宜的那一个,而“够用又便宜”恰恰是最难做的产品定义。
中间层是最别扭的位置
夹在旗舰和轻量型号之间,Sonnet 要同时应付两种挑剔:嫌它贵的人会往下看,嫌它笨的人会往上看。它得便宜到能承接每天跑几十万次的批处理任务,又得聪明到让工程团队不必为每个请求写一套路由逻辑。这一层做砸了,用户要么全量上旗舰、成本失控,要么全量下沉到小模型、质量塌方。所以 30% 的速度和 30% 的成本摆在参数表上是两行字,摆在产品线上就是能不能坐稳这把椅子的区别。
小数点后面的迭代,才是现在的战场
版本号从 5 走到 5.5,听起来像小修小补,可速度提升三成、单任务成本降三成,这不是补丁的量级。眼下几家头部实验室的节奏都在往这个方向走:不再等一年憋一个大版本,而是隔几个月推一次中期刷新,把工程优化和训练配方上的小步改进快速交付出来。对用户来说,好消息是能力提升来得更密;坏消息是评估和迁移成了常态化工作,一年只做一次的日子结束了。
快 30% 是体感,不是跑分
延迟掉到某条线以下,产品形态就换了
基准测试里的速度差异,用户往往感知不到;可一旦跨过某条阈值,能做的事情就完全不一样了。自动补全要求几百毫秒内出结果,实时对话要求首 token 尽快冒出来,Agent 要求一轮接一轮地快速推进。提升 30% 未必让每个场景都变好,但它可能把几个原本“能用但别扭”的场景推到“顺手”那一侧。产品团队最怕的就是卡在阈值下面——不是做不了,是做了没人用。
多轮调用里,省下来的时间会复利
单次调用快三成,落到一个跑十几轮的 Agent 流程上,账不是简单的三成。串行步骤会把每一次的节省累加起来,中间还省掉了等待期间的资源占用和用户流失。反过来讲,如果流程里大部分时间花在工具调用、网络往返或者数据库查询上,模型快三成对总时长的贡献就很有限。值不值得为速度买单,得先看清楚自己的瓶颈落在哪一段。
采购桌上真正被算的三笔账
算的是任务,不是 token
财务部门不盯 token 单价,盯的是每张工单、每份报告、每次会话的成本。这两个口径之间隔着一堆变量:模型要几轮才能收敛,输出会不会啰嗦,失败重试多不多,人工兜底的比例有多高。“每个任务成本最多降 30%”之所以比“单价降 30%”更有说服力,就是因为它已经把这些变量算进去了。当然,“最多”两个字留了余地,实际降幅取决于任务类型,复杂推理链的收益通常不如格式化的批量处理。
缓存价格在悄悄改架构
0.20 美元的缓存读取价,影响的不是账单小数点,而是技术选型。当长上下文复用足够便宜,团队会更愿意把整份代码库、整本手册直接塞进提示里,而不是花几周搭一套检索管线。检索增强和长上下文本来各有拥趸,可定价一旦倾斜,天平就会动。这也不是 Anthropic 独有的手法,几家都在用缓存折扣引导用户把上下文留长、把调用频次做高——用户省了钱,平台锁住了工作负载。
报价单上看不见的迁移成本
提示词要重调,评测集要重跑,回归问题要一个个查,合规和法务还得重新过一遍。这些加起来,可能比省下来的那三成还多。所以真正会立刻迁移的往往是两类人:一类是调用量大到对成本极度敏感,另一类是新项目还没写死架构。已经在生产环境跑了半年、跑得还算稳的团队,多半会先挑几个非核心场景试水,而不是整条链路切过去。
对手不会站着看
同一个价格带,挤满了人
中间层是眼下最拥挤的战场。这个价位段的产品性能差距已经不大,决定胜负的往往不是跑分,而是稳定性、工具调用的可靠度、生态成熟度,以及“我现有的代码能不能直接换过去”。谁在这一层拿到默认集成的位置,谁就能吃到最长尾的那部分调用量。Sonnet 5.5 把速度和成本同时推了一格,压力立刻传导到同价位的其他选项:跟,利润被压;不跟,份额被吃。
开源模型从下面往上顶
另一股力量来自开源。自部署的模型在单价上有天然优势,能力也在往上追,尤其是任务边界清晰、格式要求固定的那类活。它们暂时还啃不动最复杂的部分,可中间层里本来就有大量“不需要最强模型”的工作。闭源厂商用降价和提速守住这块地盘,逻辑上说得通:与其等着被替换,不如自己先把单位经济性做薄。
换不换,先看你的瓶颈在哪
回到最实际的问题。如果痛点是用量太大、账单压不住,那三成的任务成本降幅值得认真测一轮;如果痛点是质量不稳定、输出格式老出错,速度再快也解决不了问题。如果瓶颈卡在工具链和检索环节,模型侧的提升会被稀释掉。Sonnet 5.5 给出的是一组很实在的参数改进,但它不是万能药——判断标准永远是你自己系统里最慢、最贵、最容易出错的那一段。

