OpenAI 给 GPT-6 系列的提示词缓存动了一次真格的手术:命中率默认抬高,凡是在 30 分钟窗口内被复用的合规共享前缀,缓存输入 token 最高能拿到 90% 的折扣。看着像计费页脚上的一行小字,实际改的是智能体的成本曲线。长上下文、多轮工具调用、固定不变的系统提示词——这类负载里,输入 token 往往就是账单上最沉的那一块,缓存一命中,单价直接塌下去。
更值得琢磨的是同步补上的监控和诊断工具。过去开发者对缓存的体感基本是碰运气:命没命中、命中多少、为什么没命中,全在黑箱里。现在命中率能被观测、被拆解,也就意味着它能被工程化——把稳定不变的部分尽量前置,把易变内容往后压,别让一个时间戳或者一次随机排序把整段前缀作废。30 分钟这个窗口也很实在,它逼着团队回头审视自己的调用节奏:批处理怎么切、重试怎么排、并发会话怎么叠,才能让同一份前缀被反复吃到折扣。缓存不再是省钱的彩蛋,而是一项需要设计的架构决策。
跑长期智能体的团队,账得重算一遍。延迟和成本从来不是两件事,命中缓存既省 token 又省首字时间,那些为了压成本而拆短上下文、牺牲推理质量的妥协,现在未必还划算。

