Anthropic 把 Claude Sonnet 5.5 的缓存读取价格砍到每百万 token 0.10 美元,直接对半。缓存读取命中时,系统提示、长文档、代码库、对话历史这些重复上下文都按这个价计费。它一直是长任务账单里最沉的那一块,现在单价又低了一档。
官方给的说法是,多数长期运行任务的成本因此下降约 20%。为什么不是 50%?因为一次调用里,只有命中缓存的那部分输入享受新价格,新写入的 token 和模型生成的输出仍是原价。省多少,说到底取决于缓存命中率。提示结构稳定、反复调用同一段上下文的 agent 工作流,最能吃到这波红利;每次调用都往里塞全新内容的场景,几乎无感。
更值得琢磨的是定价指向。缓存读取本就比标准输入便宜一个数量级,如今再压一档,等于明说多轮、长上下文、agent 化负载才是主战场,竞争对手的定价也在往同一方向推。所以开发者的实际动作不是盯着单价算账,而是回头量自己的缓存命中率:把系统提示和固定上下文放在最前面,别在中间插会变的内容。命中率提上去,这次降价才真落到你的账单上。

