所有人都默认一件事:智能体的记忆,越多越好。把过去的所有决策、工具调用、纠错经验统统塞进上下文,模型总能从里面捞到有用的东西。但IBM研究院最近一项实验给出了截然相反的结论——智能体记忆并非可随意开启的功能,而是需按模型能力校准的剂量。强模型适合喂全套指南,弱模型反而应该精选着喂,否则记忆不仅帮不上忙,还在白白烧token。
记忆不是免费的午餐,剂量得看模型的饭量
这项研究的对照组极其直观:同样是给智能体注入从过往轨迹中蒸馏出的“行动指南”,一个用671B参数的DeepSeek-V3.2,一个用117B参数的gpt-oss-120b。但结果没有走向“模型越大收益越高”的俗套,而是画出一道分水岭。
强模型:你给它一整套,它就还你一整套成绩
DeepSeek-V3.2作为MoE架构下的顶尖选手,在注入完整指南集后,任务完成率直接提升9.5个百分点。这个数字的含金量在于:它不是靠堆few-shot示例堆出来的,而是把Agent过往的决策路径、失败教训、工具调用规律煮成一锅高密度指南,然后一次性注入。强模型的注意力机制扛得住这种信息密度,甚至能从指南之间的矛盾中找到自己的判断。
弱模型:塞得越多,脑子越乱
gpt-oss-120b的表现则印证了另一个规律:当注入全量指南时,它的提升幅度小于模型能力的增长预期。注意,不是没有提升,而是“不够赚”。真正亮眼的数据来自“精选检索”策略——只从轨迹库里检索出与当前任务最相关的核心指南注入。这一招让gpt-oss-120b拿下了16.1个百分点的提升,比全量注入高出近一倍,而token开销只增加了5%。
Token账本:5%的代价换16.1pp的提升,值到离谱
以120B这个体量的模型为例,在推理时多花5%的token意味着什么?换算成实际成本,几乎可以忽略不计。但任务完成率往上跳了16.1个百分点,这在任何工业级Agent系统里都是一个足以改写预算报告的数字。反过来看全量注入的方案,token成本上去了,收益却只有个位数——这等于提醒所有人:把记忆一股脑塞进上下文,是成本效率最差的做法,没有之一。
什么变了:从“记忆越多越好”到“记忆够用就行”
这项研究真正踩中的不是技术细节,而是工程直觉的转折点。过去Agent的记忆设计一路沿着“扩容”的思路走——上下文窗口越长越好,检索库越全越好,记忆条目越细越好。但IBM这次用数据证明:记忆是一条取舍曲线。
不更新权重、不人工标注:记忆从离线走向在线蒸馏
这套方法的工程价值在于低侵入。它不需要对模型做任何微调或权重更新,也不需要人工为每类任务打标签写规则。流程是:从智能体过去跑过的轨迹中自动蒸馏出可复用的行动指南,在推理时按需注入。这等于把“记忆”从训练环节中抽离,放进了一个随时可调、可回滚的上下文工程层。对生产环境来说,这意味着记忆系统可以独立迭代,不必拖着模型一起发版。
检索器才是真正的记忆管理者
既然注入指南的质量直接决定了弱模型的天花板,那检索器就不再是配角了。精选检索的核心在于“判断什么该记、什么该忘”,这本质上是在替模型做上下文预算管理。在这个框架里,记忆不是一种被动存储,而是一种主动筛选。gpt-oss-120b的巨大提升,更像是检索策略的胜利——它证明了:当模型能力有限时,你喂给它的每一条信息都必须在刀刃上。
从“全量指南”到“最小充分集”:上下文预算有了量化依据
过去做Agent上下文优化,大家凭感觉:感觉多了就删,感觉少了就加。现在有了一个明确的坐标系——模型能力越弱,注入的信息越要克制;模型能力越强,越可以放心地给它完整上下文。这种“记忆剂量”的量化思路,让上下文预算第一次有了硬指标。企业再做Agent成本规划时,不用再拍脑袋,而是可以拿着模型参数量与任务复杂度,直接算出记忆注入的天花板。
当记忆不再是一种负担,Agent才开始真正进化
回到最初的问题:Agent的记忆能力如何演进?IBM这项研究的回答是,不需要让模型记住更多,而是让该被记住的东西在正确的时机出现在正确的地方。这不是算法层面的炫技,而是对推理效率的一次结构性优化。
模型能力与记忆策略的匹配,是下一代Agent的护城河
所有做Agent产品的人都在面对一个同样的困境:模型迭代太快,系统架构跟不上。但记忆策略与模型能力的解耦,给了大家一个重新设计的空间——你的Agent可以搭载不同能力的模型,只要记忆策略跟着模型走,系统整体性能就不会崩。这种设计哲学把“模型强则Agent强”的单一逻辑,改写成了“模型与记忆协同进化”的双引擎叙事。
5%的token盈余,未来可能是一个Agent的生存线
当Agent从单轮对话走向长时间自主运行,token消耗的增长是线性的。在这个背景下,任何一项只增加5%token却带来性能飞跃的技术,都有资格成为Agent架构的标配。你可以想象这样的场景:一个长期运行的客服Agent,在每天的轨迹中自动蒸馏指南,夜间完成一次静脉注射式的检索更新——第二天醒来,它比昨天更懂你的业务,却没有多花多少算力。
记忆工程的终点,是把“忘记”变成一种能力
这项研究最有哲学意味的洞察在这里:对弱模型而言,最聪明的记忆策略是选择性遗忘。强模型可以承载完整指南集,但并非所有场景都需要强模型。那些参数较小的模型,更适合轻装上阵——用好5%的额外token,换取16.1个百分点的能力跃升,这才是记忆工程的终极形态。不是堆得越多越好,而是记得越准越好。
说到底,智能体记忆不是一个存储问题,而是一个调度问题。IBM这次实验没有发明新模型,也没有创造新架构,它只是把一个被忽视的变量摆上了台面——你的模型,到底能吃下多少记忆?这个问题问对了,一半的token预算就已经省下来了。

