三十个百分点,听着不像什么大新闻。可落到每天几十上百次的往返对话里,它就是"盯着转圈等三秒"和"几乎不用等"的区别。Anthropic 放出 Claude Sonnet 5.5,官方打出的第一个数字就是速度:比 Sonnet 5 快超过 30%,写作更清晰,冲着快速往复的日常任务来的。同一时间,Opus 5.5 被摆在另一头,负责需要谨慎判断的复杂活儿。Sonnet 5.5 即日起全面可用,Haiku 5.5 会在未来几周加入这个系列。
快三成,到底改变了什么
单轮省一点,链路省一截
大模型的延迟从来不是线性叠加的。一个 agent 任务里嵌套十几轮调用是常事:读文件、改代码、跑测试、看报错、再改。每轮省下 30%,端到端的等待可能就从两分钟压到一分多钟。差别不在于那一分钟本身,而在于用户会不会趁这个空档切去回消息、刷邮件。人一旦切走,回来的成本比那 30% 高得多。
"快速往复"是个被长期低估的场景
官方用的词是 rapid back-and-forth,翻译得直白点就是"来回折腾"。写代码时反复确认一行正则、改需求描述、把一段生硬的英文邮件顺成中文、让模型解释一段看不懂的堆栈——这些活儿的共同点是不需要深思熟虑,只需要随叫随到。拿 Opus 这种重量级模型去干这些,其实是一种浪费:你付出了等待,换回来的推理深度根本没被用上。
速度是产品变量,不只是跑分
响应快到某个阈值以下,交互形态会自己变。实时代码补全、边写边改的协作文档、接近语音节奏的来回问答,这些玩法的地基全是延迟。慢模型只适合"提交任务—等结果"的模式,快模型才撑得起"说一句、看一眼、再改一句"。Anthropic 这次把速度放在宣传的第一位,说明它清楚自己在卖什么。
官方点名的能力清单,藏着 Anthropic 的算盘
修 bug、写文档:软件团队最日常的痛
官方说 Sonnet 5.5 擅长修复 bug、制作文档、做幻灯片和表格。前两项有个共同特征——高频、低创造性、但必须准确。修 bug 要求模型能吞下大段上下文、准确定位、给出真能跑通的补丁;文档要求它把散落在代码和注释里的信息整理成人能读的东西。这两件事都不性感,却占据了开发者大量的碎片时间。谁能把它们做扎实,谁就拿到了开发团队的日常入口。
设计感被摆上台面,这是个信号
"较强设计感"这个说法,在以跑分和基准测试为主的模型发布里并不常见。过去模型做 PPT 和表格的通病是内容对了、样子难看:字体层级混乱、留白失控、表格列宽扭曲。所谓设计感,落到实际使用里就是少一道人工返工。对咨询、市场、运营这些岗位来说,返工时间才是真成本——生成十秒、改半小时,那还不如自己动手。这个方向如果成立,受益的不只是效率,还有模型在非技术岗位里的渗透率。
三档梯队,分工越来越清楚
Opus 守上限
Opus 5.5 的定位是"需要谨慎判断的复杂工作"。这不是客套话,是分层策略的明确表达:最难的问题交给最贵的模型,并且允许它慢。架构设计、跨系统重构、合规审查、需要多步推理的技术或法律问题,属于这一档。这类任务的错误代价高,等待成本反而次要。
Sonnet 打主力,Haiku 补位
Sonnet 系列一直是性价比主力,5.5 把速度提上去,等于让它吃掉更多原本要升级到 Opus 的任务。而 Haiku 5.5 指向的是另一头——分类、信息抽取、请求路由、批量处理,这类任务量大且单价敏感,模型不需要聪明,需要便宜且稳定。三档各守一段,边界比上一代更清晰了。
选型这件事,别再一模型打天下
按任务分层,而不是按团队偏好
很多团队的问题不是选错了模型,而是只选了一个。把所有请求都丢给同一个模型,结果是简单任务的价格被拉高、复杂任务的质量被压低。更合理的做法是做路由:小模型先判断任务类型,日常改稿、格式化、小修小补走 Sonnet 或 Haiku,识别出高复杂度请求再升级到 Opus。这套架构的成本不高,省下来的钱和响应时间却很实在。
把等待时间折算成钱
评估新模型时,除了每百万 token 的价格,还得把等待时间算进去。十个人的团队,每人每天二十次调用,每次省十秒,一天就是半小时多。这还没算上下文切换带来的额外损耗。速度带来的收益很难写进采购表格,但它真实存在于工时里,而且随着调用量上涨会越滚越大。
上线前,先跑自己的题
官方描述再漂亮,也是别人的场景。真正该做的评估,是拿出团队最近三个月的真实任务做一次回归:那些曾经让旧模型翻车的 bug 修复、那些被反复退回重写的文档草稿、那些格式总出错的周报表格。30% 是基准测试里的数字,落到自己业务上还剩多少,只有跑一遍才知道。别拿别人的榜单替自己做决定。
接下来几周,盯两件事
Haiku 5.5 的延迟和定价
Sonnet 5.5 已经把主力位坐稳了,Haiku 5.5 的表现决定的是另一件事:那些量最大、最不起眼的批量任务,成本能压到什么程度。如果它在延迟和价格上足够激进,很多原本靠规则和脚本硬扛的场景会被重新推翻重来。
速度优势能领先多久
推理速度这件事,没有谁能长期独占。竞品追上来只是时间问题,所以真正值得观察的是 Anthropic 会不会围绕"快"继续做产品化——实时协作、流式交互、更细粒度的增量输出。模型发布只是起点,把速度变成别人抄不走的体验,才是后半场。

