烧了5亿token后,我给Codex和Claude Code做Skill上下文瘦身的新技巧

发布时间: 2026-08-05 文章分类: AI前沿技术
阅读量: 0
AI智能体
企业级AI智能体开发与部署
LumeValley提供全栈式企业级AI智能体开发与部署服务,涵盖战略规划、场景化开发、企业级应用构建、行业解决方案及算力支撑。从需求分析到持续优化,确保智能体高效稳定运行,助力企业实现智能化转型,提升运营效率与竞争力。

每次在Codex或Claude Code开新会话,我都会被一个数字刺痛:9,877 tokens。那不是你的代码,不是你的需求,而是你自己安装的、密密麻麻的Skill清单——还没开始干活,助手已经默默吞掉了将近一万个token的上下文。按七月份的使用强度往上翻,光这一项,冗余的Skill列表就吃掉了4到5亿token的上下文空间。这还只是我一个人。

Skill清单:10K token的沉默税

一次性的菜单,为什么这么重

多数人对Skill的认知还停留在“装得越多越强大”。但当你往Codex或Claude Code里塞进几百个Skill,实际情境很像你走进一家餐厅,服务员先对照着三百道菜名给你从头念一遍,再问你想吃什么。每次新会话,助手都得把那个全局Skill描述表原封不动塞进上下文窗口,等你看都不看就滑过去了。这近一万个token的“菜单”并不是发挥过一次作用,而是每次对话都要重新吞入,像一笔收得悄无声息的沉默税。

从9.9K到4亿,数字背后是模型推理的真实成本

9,877 tokens只是单次会话的一次性加载。如果一天开二十次会话,一个月下来,这份菜单就要重复传送六百次。再乘上七月的使用强度和任务唤醒次数,4到5亿token并非夸张。更关键的是,这些token不只占坑位,它们还会把真正有价值的历史信息挤到上下文窗口边缘,让模型在长任务中途“失忆”。我见过不止一次,在排查复杂Bug时助手突然忘了刚刚自己给出的修复建议,回头一看上下文,Skill描述正死死压在对话记录上。

让低频技能隐身:从菜单变成搜索栏

触发词,而不是目录

解决问题的核心思路听起来简单得可笑:别把全部Skill挂在门口,让助手按需去仓库里拿。我会给每个Skill设定一组清晰的触发关键词——比如一个专门优化SQL查询的Skill,触发词是“慢查询”“索引建议”“SQL refactor”。平日这些Skill的描述完全不出现在上下文里。只有当用户的消息命中了触发词,对应的Skill描述才会动态注入到系统提示里。这相当于把一张必读菜单换成了一个搜索引擎,你输入需求,工具才亮出来。

这不仅是上下文瘦身,更是一种注意力治理。模型在决策时不再面对三百多个“可能有用”的选项,而只看到两三个和当前意图高度匹配的Skill。决策噪音骤降,执行精度反而上去了。

平衡召回率与噪声:触发词设计比想象中更吃经验

触发词的难处在于校准——写得太宽泛,“Skill又开始抢戏”;写得过于狭窄,助手永远想不起自己还有这个本事。我的经验是:把触发词分成两级,一级是硬触发,即用户消息里必须出现的精确短语;另一级是软触发,用少量语义相近的描述,让模型自己在需要时拉取。比如一个处理Markdown表格的Skill,硬触发是“表格合并”“列对齐Markdown”,软词条是“格式转换”“文档排版”。软触发允许助手在模糊场景下主动询问是否要激活,保留了一点智能弹性,又不会随随便便就把Skill甩进上下文。

跨工具可迁移:从Codex到Claude Code的治理路径

指令语法不一样,治理骨架完全相通

Codex用的是OpenAI的工具调用体系,Claude Code走的是Anthropic的Tool Use和系统提示逻辑,二者的Skill暴露机制、上下文拼接方式都不同,但这套动态加载的骨架几乎不需要大改。在Codex端,我通过functions声明来控制Skill是否展示;在Claude Code端,我会维护一个skill_manifest文件,脚本在每次对话启动前根据触发匹配结果动态拼接进system prompt。只要把Skill的描述、触发词和注入脚本抽象成一套轻量配置,它就能横跨工具运行。

事实上,做完这层治理后,我的Skill管理从“装完就忘”变成了一套活着的策略。每个Skill都有生命周期:高频Skill继续全局暴露,低频Skill改成触发词动态加载,几乎不用的Skill则直接归档。整个清单的token开销被压到了原先的十分之一左右。

为什么MCP和Agent场景更需要这层治理

当开发者开始用MCP协议把外部工具接入Agent,工具膨胀比Skill膨胀更可怕。一个Agent可能同时挂载着数据库查询、文件系统、浏览器、API网关,而每个工具的schema描述都可能成百上千token。如果所有工具描述常驻上下文,Agent很快就会被自己的“能力菜单”淹死。把工具描述也纳入动态加载治理,用同样的触发词逻辑决定哪些工具定义在这一次调用中可见,是一次极低耦合的复用——底层的推送机制不用动,只在上下文组装层多一道筛选。

上下文即资产,别把它当成免费的

算清楚成本,本能才跟得上

大多数人不会去算上下文上的浪费,是因为token这玩意儿看不见。但一旦做过一次粗算——哪怕只是拿出一个月的使用条数,乘上平均skill_list长度——你就会本能地想要优化。4到5亿token在商业API价格下不是零,在模型推理质量上更不是零。上下文是最贵的“空地”,每挤进来一点无关信息,模型回答的连贯性和深度就削掉一层。

把治理前置,而不是成为下一次上下文窗口翻倍的借口

业界很喜欢用“上下文窗口又翻倍了”来回避治理问题。但更大的窗口只是给你更长时间轴上的遗忘,而不是解决信息结构的根本矛盾。Skill的动态加载不是新概念,它更像老派操作系统里“按需加载动态库”的思路,现在必须被认真对待,因为AI Agent的能力已经膨胀到连模型自己都吃不消。下一个让我失眠的数字,恐怕就不是9.9K了。

AI智能体
企业级AI智能体开发与部署方案
LumeValley打造企业级AI智能体全流程方案,涵盖需求洞察、定制开发、多平台适配部署。凭借专业算法与丰富经验,确保智能体精准理解业务,高效执行任务,无缝融入企业生态,为企业数字化转型提供强劲智能引擎,提升核心竞争力。
点赞 | 75

Lumevalley——全栈AI服务领航者,以“战略-应用-算力”三位一体服务框架,为企业提供从顶层战略规划、场景化AI智能体(AI Agent)开发/搭建/部署,到企业级AI应用开发、AI+行业场景解决方案的全链路服务,并配套AI大模型部署与高性能AI算力底座支撑,助力客户在营销、服务、运营等核心环节实现效率倍增与模式创新。

马上扫码获取产品资料
相关文章

相关文章

填写以下信息, 免费获取方案报价
姓名
手机号码
企业名称
  • 建筑建材
  • 化工
  • 钢铁
  • 机械设备
  • 原材料
  • 工业
  • 环保
  • 生鲜
  • 医疗
  • 快消品
  • 农林牧渔
  • 汽车汽配
  • 橡胶
  • 工程
  • 加工
  • 仪器仪表
  • 纺织
  • 服装
  • 电子元器件
  • 物流
  • 化塑
  • 食品
  • 房地产
  • 交通运输
  • 能源
  • 印刷
  • 教育
  • 跨境电商
  • 旅游
  • 皮革
  • 3C数码
  • 金属制品
  • 批发
  • 研究和发展
  • 其他行业
需求描述
填写以下信息马上为您安排系统演示
姓名
手机号码
你的职位
企业名称

恭喜您的需求提交成功

尊敬的用户,您好!

您的需求我们已经收到,我们会为您安排专属电商商务顾问在24小时内(工作日时间)内与您取得联系,请您在此期间保持电话畅通,并且注意接听来自广州区域的来电。
感谢您的支持!

您好,我是您的专属产品顾问
扫码添加我的微信,免费体验系统
(工作日09:00 - 18:00)
电话咨询 (工作日09:00 - 18:00)
客服热线: 18011747352
售前热线: 189 2432 2993
扫码即可快速拨打热线