忘掉让大模型自己写日记那一套。一项新工作证明,给智能体记性最好的办法,是根本不让AI碰这件事。研究者递出一组令人惊讶的数字:在同一个单人、51个活跃天的屏幕语料上,一种完全确定性的编译管线把一天原始捕获压缩到86分之一大小,只花68毫秒;智能体拿着这块压缩记忆回答问题,准确率98.4%。而让AI自己生成摘要去答,准确率只有66%到80%。差距不是一星半点,是记忆可信不可信的分界线。
为什么“AI自己总结”这条路走不通?
幻觉是记忆的头号杀手
对智能体而言,记忆不是什么玄学概念,就是它执行任务时塞进提示窗口的那段上下文。上下文偏移一根头发丝,后续推理就可能彻底跑偏。业界眼下最流行的办法是让大模型读完整段屏幕记录或交互日志,吐一段摘要,再把摘要当成记忆喂回去。这等于把整个管线里最不稳定、最擅长“合理编造”的环节插进了记忆中枢。更要命的是,摘要生成没有版本控制概念。同一份原始画面,上午让模型总结一遍,下午再让它总结一遍,结果可能完全不同。你永远不知道它省略了什么、添加了什么——连模型自己也不知道。
六成到八成的准确率够吗?远远不够
拿66%到80%的问答准确率来当记忆基准,放在任何严肃工程环境里都是开玩笑。这意味着智能体有五分之一的概率记错某条关键界面信息,可能是一笔金额、一个按钮位置、一次用户确认的态度。这类差错在自动流程里往往会连环放大。研究者用一组对照实验把问题赤裸裸揭开:同一个智能体,读确定性编译的记忆块,回答有关历史屏幕的问题几乎不出错;读大模型摘要,错误率陡升。本质在于,基于模型的摘要是一种不可控的有损编码——损失在哪里、损失多大,没有人能预先保证。
Activity Frames:不靠AI的确定性压缩
什么是“零模型管线”?
Activity Frames这个名字背后藏着一个非常干脆的决策:在记忆生成阶段零模型介入。该方法不调用任何神经网络去“理解”屏幕内容,而是依赖一组预设的视觉不变性规则与屏幕交互特征,将像素级的屏幕活动帧编译成一种结构化的中间表示。这相当于给每一帧画面盖上一个强制一致的抽象印章,这个印章完全由算法逻辑定义,而非统计概率。好处立刻显出来。第一,字节一致:任何时间、任何机器对同一份输入运行编译管线,输出哈希完全相同。第二,可缓存:重复出现的屏幕状态只编译一次,后续直接复用缓存结果。第三,可审计:每一块记忆是怎么从原图提炼出来的,可以从规则层面逐条追溯,没有黑箱。
68毫秒把一整天的记录压进86分之一
论文在一个人128,756帧、51个活跃天的真实屏幕活动语料上跑通了这套编译管线。原始捕获数据量大到对检索极不友好,随便翻一天的长时段记录都会吃掉大量Token预算和推理时间。编译器介入后,单天数据被压成体积仅为原始86分之一的提示块,编译耗时仅68毫秒。这是什么概念?连做个HTTP请求摇晃一下的时间都不够,它已经把你一整天的屏幕活动塞进智能体刚好能快速翻阅的窄小上下文里。而且这种压缩不是靠丢弃信息换来的——后面我们会看到它为什么能保留这么高的问答正确率。
为什么98.4%的准确率不是靠运气
关键在于确定性压缩不靠“重要性”来取舍信息。大模型摘要天然会判断什么重要、什么可以忽略,这种判断依赖训练分布和当前提示,极易漏掉低频但关键的事实。Activity Frames走的完全是另一条路:它由屏幕元素的类型、位置变化、交互状态等确定规则驱动,能稳定捕捉那些不显眼但必要的信息碎屑。实验里,智能体阅读压缩后的记忆块去回答针对历史屏幕活动的问题,准确率飙到98.4%,几乎逼近人类直接回看原画面的水平。这不是模型碰巧答对的奇迹,而是确定性管线没有权利遗忘。
不止省Token,更让记忆流变成资产
可缓存、可审计的记忆基建
对于企业级智能体部署,这项特性直接决定了记忆能否成为可治理的数据资产。想象一个每天处理数以万计用户屏幕操作的Agent系统,如果每次生成记忆都要调大模型,不仅系统成本暴涨,而且合规审计几乎不可能——因为你拿不出一个稳定可复现的记忆版本。Activity Frames给出的答案是:记忆流版本化。同一个用户、同一段屏幕记录,永远产生同一份记忆快照。调试时可以重放,审计时可以回溯,缓存可以跨会话、跨用户复用。把记忆从虚无的概率游戏拉回工程可控的轨道上,这是它真正的分量所在。
重新思考记忆的成本度量
确定性管线还带来一个被人低估的副产品:成本可以算得一清二楚。调用大模型做摘要,价格随负载、模型版本、提示词变动上下浮动,你很难预估某个DAU规模的记忆存储和检索会烧多少钱。Activity Frames把这件事变成了简单的计算题:每帧编译时间固定、压缩比固定、缓存命中率可推算。这使得开发者能够像规划API请求额度一样精确规划记忆管线的开销。研究虽然没有直接给出大规模部署的TCO模型,但它为智能体经济的成本核算提供了一个可量化的底座——这一点放到按Token计价几乎靠玄学的LLM生态里,格外醒目。
但还没有完
屏幕之外的记忆怎么办?
当前工作的输入限定在屏幕活动捕获的帧序列,也就是智能体“看见”的界面变化。现实中的Agent记忆来源远比这更杂——API返回的JSON、用户语音片段、环境传感器读数、来自其他工具的日志流。这些非视觉信号同样需要一种确定性的压缩与索引方式,Activity Frames的规则思路能不能平滑迁移过去,研究没有直接给出答案。可以想象,如果每一种模态都要独立设计规则引擎,初期成本会显著上升,但一旦形成标准,多模态记忆的可组合性反而会催生出更健壮的智能体架构。
边缘案例与长尾分布
实验只在一个人的51天屏幕数据上完成,样本的多样性和长尾覆盖度显然不够。屏幕活动的变化多到令人绝望:不同操作系统的窗口风格、异常弹窗、残缺渲染、用户疯狂的快速切换——规则能不能覆盖这些边缘场景,还需要更大型、更多样的语料去验证。但作为概念证明,Activity Frames已经足够清晰地指出,不需要把记忆问题完全外包给大模型。哪怕未来实际落地中混合了确定性回放和模型兜底,只要主干是稳定的,整个智能体行为的可预期性就会上一个台阶。

