Agent 记忆评测翻车了:三周最好的方案,九周几乎垫底

一个工具如何揭开了 Agent 长期记忆的“伪靠谱”面纱

AI Agent 最令人头疼的问题之一不是推理,而是记忆——那种能记住用户上个月提过的需求、三个月前配置偏好、甚至哪些决策被否决掉的跨 Session、跨天、跨周的长期记忆。这恰恰是现有大模型对话窗口无法解决的痛点。

最近,arXiv 上的一篇论文(arXiv:2607.21962)和配套的开源评估工具 Veracium,为这个问题提供了一个更干净的测量方式,也暴露出一个让开发者不太好受的真相:很多在短评测中表现出色的记忆架构,在长期场景下可能彻底失效。

三周冠军 → 九周倒数:短期 ≠ 可靠

Veracium 的核心贡献在于重新设计了评测方法论。过去的 Agent 记忆评测通常是让人或模型先生成一段聊天记录,再从记录中提取答案作为「标准答案」——这种做法有两个隐患:人工标注容易出错,而且数据可能泄露到训练集中。

Veracium 把流程完全倒了过来: 先用「人生脚本采样器」先生成带有效期、变化速度、来源渠道的事实,再用 LLM 把这些事实渲染成聊天和邮件文本,最后机械式地生成问题。这样,答案的正确性从一开始就来自脚本保证,而不是从文本中反推。

用这套方法评测五种主流记忆架构 + 一个无记忆对照组时,结果令人意外:

  • 一种「预算化精简地图」类记忆(budgeted curated-map),在 3 周 时间窗口内准确率达到 96%,是所有方案中最高的;
  • 但在 9 周 后,由于早期内容被驱逐(evict),召回率掉到了 72%
  • 反过来,另一种带「来源类型标记」的图记忆(provenance-typed graph),在 3 周时排名平平,却在 9 周 时上升到 90%

这个对比揭示了一个严峻的现实:短期评测表现不能作为长期可靠性的代理指标。 如果你在 demo 或短期对话里测试通过的记忆架构,很可能在实际上线两三个月后就「失灵」了。

此外,还有一种「全历史原文输入」baseline——直接把所有聊天记录原文喂给 LLM,不做任何压缩或记忆萃取。这种方法在短期几乎能追平最好的记忆方案,但到 9 周就不再具有 judge-independent 优势,且存储和读取成本差不多翻倍。

写入质量直接决定召回成败

论文还给出了一个对从业者极具实操价值的发现:写入阶段的质量,直接决定了下游召回质量。

具体来说,那些被标记为「写得弱」的事实,后续失败率达 24%;而「写得好的」事实,失败率只有 2%。这个差距非常直观地说明:不要只关注检索和压缩算法,写入环节才是很多问题的源头——事实本身没写清楚、有效期标注混乱、来源信息不完整,再怎么优化搜也搜不回来。

分层架构是目前的「最优解」

论文最终指出,一个分层架构(layered architecture) 在两个时间窗口(3 周和 9 周)里都保持了最佳表现,短期准确率高达 96.8%。这套方案连同 Veracium 评测工具和语料生成器已经开源,GitHub 仓库位于 github.com/veracium-ai/Veracium

真正的启示:评测周期必须拉长时间线

这篇论文最宝贵的价值不在于某个具体架构赢了,而在于它提供了一个可复现、更可靠的长期记忆评测框架,并证实了一个直觉经常被忽视的观点:短期评测的结果不能外推到长期场景。

对于正在为 Agent 搭建记忆层的团队来说,这意味着至少两件事需要调整:

  1. 你的评估周期得拉长到数周甚至数月,而不能只靠几个小时的对话演示就下结论;
  2. 一个在 demo 中表现惊艳的记忆方案,上线两个月后可能完全不同,因为驱逐策略、写入质量、长期上下文积累等因素会逐渐显现出来。

工具已经摆在那儿,接下来的关键,是更多团队在不同场景下跑这类长周期评测,才能真正把 Agent 长期记忆这件事从「感觉还行」推进到「可衡量、可比较」。


延伸阅读:
- 论文全文:arXiv:2607.21962
- GitHub 仓库:github.com/veracium-ai/Veracium
- PDF 下载:View PDF