Anthropic 把 Claude Sonnet 5.5 放出来了,这是 Claude 5.5 系列的第二款模型。两个数字很扎眼:输出速度提升超过 30%,单任务消耗的 token 更少,折算下来有效成本最多降低 30%。更值得琢磨的是后半句——多项基准上,它已经贴到了 Opus 5.5 的身后。
两个数字,一个被藏起来的杠杆
快三成靠算力,省三成靠克制
输出速度提升 30% 以上,这是一眼能看懂的成绩。推理栈优化、调度策略、硬件利用率,任何一项调好都能挤出这些百分点。
token 消耗下降走的是另一条路。速度是让每一次吐字更快,效率是让模型少说废话、少绕弯路。前者省时间,后者同时省时间和钱。真正难的是后者——它要求模型在内部推理时更早收敛,而不是靠堆步数换正确率。
厂商做宣传时最爱把这两件事混在一起说,因为它们听起来都像"变快了"。可对掏钱的人来说,区别大得很:一个只是让你少等几秒,另一个是让你少付一笔。
"有效成本"掀翻了旧比价表
过去两年比模型贵不贵,看的是每百万 token 的标价。这个习惯正在失效。
标价只是原料单价。真实账单取决于做完一件事要烧多少原料。Sonnet 5.5 把单任务 token 消耗压了下去,"每任务成本"这条曲线最多降了三成。两个标价相同的模型,一个干完活只用七成 token,它的实际价格就是另一个的七折。
Anthropic 没在标价上做文章,换的是计价视角。对采购方来说,这比直接降价更诚实,也更难被对手用一句"我们也降了"抵消掉。
价格战的战场,从原料挪到了成品
按 token 计价的年代,厂商最容易做的事就是降价。数字好看,毛利照掉,最后谁都不赚。
按任务计价,优化空间回到了模型自己身上。同样的活儿干得更利索,成本自然下来,价目表可以一动不动。这条路更难走,但护城河更深——谁先把每任务成本压下来,谁就先拿到那批对价格敏感、又对质量挑剔的客户。
半夜看到这条消息,谁最睡不着
跑 agent 的团队,第一天就有体感
单次问答省三成 token,感受有限。agent 完全是另一回事。
一个 agent 任务动辄几十轮调用,每轮都拖着上下文,失败重试还会把消耗翻倍。token 效率的提升会在这种放大结构里层层叠加。原来一天烧掉几百美元的流水线,现在可能只用七成。这不是财报上的小数点,是"这个功能敢不敢上生产"的分界线。
中间档模型的定位被自己人重写
Sonnet 一直扮演够用且便宜的角色。现在多项基准逼近 Opus 5.5,等于把中间档的天花板往上顶了一截。
麻烦也在这里。原本必须上 Opus 的长文档分析、复杂代码改造,如今有机会下放到 Sonnet。Anthropic 得回答一个问题:用户凭什么多花钱买 Opus?答案只能是那些 Sonnet 依然做不好的边缘任务。
把模型塞进产品里的创业公司
对他们来说,模型成本是毛利率的直接变量。每任务成本降三成,要么变成利润,要么变成更激进的定价权。
更微妙的是产品设计。成本下来之后,原本因为太贵而砍掉的功能可以捡回来——更长的上下文、更多的自动重试、更密的工具调用。成本结构一变,能做的事就变了。很多产品路线图上的"暂缓项",其实等的就是这一天。
逼近旗舰,这四个字值多少钱
先泼一盆冷水。基准测试是平均分,而工程里的难点从来不在平均线上。
剩下的差距,长在最要命的地方
多项基准接近,说明常规任务上两者已经难分伯仲。真正拉开距离的,是长链条推理、模糊需求下的取舍、以及几十步不能出错的任务。
这类差距不会出现在跑分里。它出现在用户第三次追问时,模型还能不能守住上下文一致。基准差两个百分点,业务侧感受到的差距可能是一个数量级。
旗舰不靠全面碾压卖钱,靠关键时候不崩
分层定价的逻辑反而更清楚了。中档模型扛量,旗舰兜底。用户按任务难度挑模型,成本曲线就变得可调。
这对 Anthropic 是好事。全线都强的模型卖不出价差,只有分工清晰的产品线,才能把每一档的钱都赚足。
要不要换,标准不在跑分上
任务越标准化,迁移收益越大
分类、抽取、摘要、格式转换这类活儿,输入输出边界清晰,Sonnet 5.5 的性能足以覆盖。成本降三成,质量几乎无感,换过去几乎是白捡的。
反过来,需要跨文档交叉验证、需要模型自己判断"我是不是漏了什么"的场景,先拿小样本试。跑分接近,不等于失误模式相同。
把你的失败案例当评测集
通用基准测的是平均水平。你线上那几十个翻过车的 case,才是模型的真实考场。拿它们跑一遍,比看任何榜单都有用。
尤其盯住两类输出:模型自信但答错的,和模型犹犹豫豫不敢下判断的。前者是事故,后者是体验损耗。这两种毛病,跑分表上一条都看不出来。
接下来三个月,盯这几件事
真实负载跑出来的数字才算数
发布会上的 30% 是实验室口径。你自己的 prompt、工具调用链、重试策略,才是最终答案。
建议直接拿一条生产流水线做 A/B,把每任务成本和任务成功率放在一起看。只盯其中一个,很容易被漂亮的数字带偏。
延迟这件事,别只当成福利
输出速度提升三成,对聊天产品是体验升级,对批处理是成本下降,对交互式 agent 则可能是可用与不可用的分界。
速度一旦跨过某个阈值,产品形态就会变。用户愿意等两秒和三秒,能设计出的交互完全不同。这层影响往往比省下来的钱更长远。
竞品的回应不会等太久
Sonnet 5.5 把每任务成本摆上台面,等于给行业立了新坐标。接下来大概率有对手用同一口径回击——比的不再是谁每百万 token 更便宜,而是谁干完同样的活花得更少。
定价战从原料打到成品,省下的是真金白银。买方拿到的,是一个更接近真实价值的价格标签。

