Elea Notes.

Zero-Mem: 把 agent 记忆的 LLM 调用降到零, 只留最后一次回答

主流 agent 记忆用 LLM 抽取和合并记忆, 每步都烧 token 且用转述替换原始轨迹。Zero-Mem 只建两个非生成式索引, 记忆操作零 token, 比最快基线快 57.6%。

agent 加长期记忆,主流做法是让模型自己写记忆:把对话交给 LLM,让它抽取事实、合并旧条目、决定增删。这套流程里每一步都是一次模型调用,都在烧 token,而且原始对话被换成了模型的转述。Zero-Mem 问的是一个更激进的问题:记忆操作到底需不需要生成?

先说结论

  • Zero-Mem 定义了一个操作区间叫 zero-token memory operations:除了最后回答问题的那一次读取,记忆的构建、组织、路由、检索、证据补全、校准,全都不调用 LLM,也不消耗任何 LLM 的输入或输出 token。编码器计算单独计费。
  • 它不生成任何中间记忆表示。原始交互轨迹本身就是记录源,系统只在它上面建两个非生成式的索引视图:一个实体-上下文图,一个时间层级
  • 在 LoCoMo 上(GPT-4o-mini 作为读取器)平均 F1 达 59.15,比最强基线 GAM 的 53.75 高 5.40 分。在 HotpotQA 上下文从 56K 拉到 448K token 的全部档位上都是最高 F1,平均比最强基线高 5.52 分。
  • 效率对比里,最省 token 的基线 LightMem 在记忆操作上仍消耗超过 87 万 token,Zero-Mem 是 0。总耗时 334.77 秒、每查询 0.22 秒,比最快的基线快 57.6%。省掉生成没有把成本转移成一条更慢的非生成流水线。
  • 消融显示两个视图确实互补:只留图视图 62.50 F1,只留层级视图 54.88,合起来 72.07。

机制

记忆基底:不改写,只加索引

生成式记忆系统的通行做法是把历史压成模型写的摘要或三元组。Zero-Mem 保留原始轨迹,在上面建两套索引,两套都指回同一批带来源(provenance)的源单元。

图视图用一个非生成式的命名实体识别模型(论文举例 spaCy)扫每个上下文单元,把检测到的实体和它出现的单元连起来,边来自观察到的共现和轨迹邻接,不是模型推断出来的语义关系。这是关键区别:Mem0 用 LLM 工具调用来做增删改,Zep 建带时间的知识图谱,A-Mem 按卡片盒法写带关键词和标签的笔记,这些都要模型生成内容。Zero-Mem 的边只记录「这两个东西在同一段里出现过」。

层级视图按时间顺序保留会话局部性和会话级状态,也就是「这句话前后说了什么」「这是哪一段会话」。

查询时:先判断要哪种结构

查询 q
  |
  v
轻量 profile: 主题 / 关键词 / 答案类型 / 时间线索 / 边界
  |
  +--> 关系型问题 --> 图视图权重 rho, 层级 1-rho
  +--> 局部型问题 --> 权重互换
  |
  v
两个视图都跑, 排名归一化后按 rho 融合
  |
  v
证据补全: 补上关系桥接 + 邻近轨迹上下文
  |
  v
确定性校准: 丢掉违反来源约束和查询边界的候选,
            再按主题/时间/答案类型兼容性排序
  |
  v
紧凑证据集 R(q) --> 读取器 (唯一一次 LLM 调用)
  |
  v
确定性答案校准: 证据支持 / 类型 / 格式检查

路由的判断依据是确定性的查询结构信号,问题形式、是否有时间或聚合要求、有没有主题锚点,不是让模型判断。两个视图在完整模型里都会执行,路由只控制融合时的相对权重。论文里 rho 和阻尼系数都取 0.6。

值得注意的是校准也在两端:读取之前丢掉冲突证据,读取之后检查答案是否被检索到的轨迹支持。后一步同样不调用第二个模型。

为什么「不转述」本身是个优势

生成式记忆的失效模式不只是贵。论文的说法是,被省略或被合并的细节会遮蔽原始证据,一旦模型把三次对话压成一句摘要,读取器再也看不到那三次里的具体措辞和时间。Zero-Mem 的两个视图都解析到同一批带来源的源单元,所以「没有任何生成的记忆挡在原始轨迹和读取器之间」。

这解释了成绩单的形状。相对 LONG-LLM(长上下文直接塞)和 RAG(扁平相似度检索)的优势在时间类和开放域问题上最大,论文的判读是:光有长上下文访问或扁平相似度检索,不足以支撑对状态和边界敏感的回忆。

为什么这样设计

这是一次很干净的取舍:放弃语义抽象,换取来源可追和成本可预测

代价是真实的。图里的边只是共现,不带关系语义,所以需要「证据补全」这一步去补关系桥接;消融里去掉补全,F1 从 72.07 掉到 67.90。检索预算也有下限效应:Top-K 从 1 提到 5,平均 F1 从 52.59 涨到 59.15,Top-10 最好但只比 Top-5 高 0.65 分。主实验用 Top-5 是为了和所有基线的检索设置对齐。

另一个必须说清的是,零 token 不等于零计算。编码器推理、记忆组织、检索、确定性校准都还在花时间。论文自己点了这一句,然后用 334.77 秒/0.22 秒每查询的实测来证明这条非生成流水线没有反过来变慢。

边界

  • 这是 2026 年 7 月 31 日提交的 v1 预印本,尚未同行评审;代码要等评审之后才公开。
  • 实验只用了两个读取器(GPT-4o-mini 与 Qwen2.5-14B-Instruct)、RTX 4090 硬件、所有方法都被限制在最多检索 5 条。跨硬件和更大读取器上的相对关系没有测。
  • 57.6% 的延迟下降是相对 LightMem 这一个最快基线、在同一并发和硬件设置下的数字,不是相对所有系统的普适加速比。
  • 依赖非生成式 NER 的质量。实体检不出来,图视图的边就不存在,这条失败路径论文没有单独量化。
  • LoCoMo 和 HotpotQA 都是问答基准。「记忆」在需要跨会话改写决策的 agent 任务里是否同样够用,这两个基准回答不了。

来源

  1. Zero-Mem: Zero-Token Memory Operations for LLM AgentsarXiv 2607.29377v1