LiveMem 论文解读|大模型终于有「长期记忆」了,但跟你想的不一样

跑过长时间运行的 AI Agent,大概都见过这个场景:对话进行到第 50 轮,模型开始忘记 20 轮前交代过的事情。摘要压缩试过、RAG 检索试过、把历史记录重新塞进上下文也试过——要么丢细节,要么越塞越贵,要么上下文窗口终究还是爆了。

这是架构层面的问题,不是 prompt 写得不够好。

8 月 3 号挂在 arXiv 上的一篇论文,叫 LiveMem,直接把这个当成一个独立问题来解。作者来自哪几个机构论文里没展开提,但工作本身很实在——他们定义了一个概念叫 "state continuity under context turnover",翻译过来就是:当活跃的上下文窗口因为长度限制被迫换掉时,模型的计算状态能不能不丢?

现有的方案——上下文保留、摘要、检索增强——本质上都是把历史信息存成外挂,等需要的时候再拉回来。但它们都不提供"持久化的内部状态"。LiveMem 的做法是给一个预训练的 full-attention LLM 加上一个固定容量的记忆状态,这个状态的生命周期不依赖于当前活跃的上下文窗口。主 attention 路径仍然走一个有边界的 KV window,而记忆状态负责把整个生命周期内的信息扛下来。

以前模型处理长对话,像一个人每十分钟被换一张新便利贴,旧便利贴要么扔掉,要么找人摘要成一行字。LiveMem 相当于在脑子里直接多出一块白板,便利贴不断换,白板上的内容不擦。

实现上分了三块:上下文切换 + 记忆维护的机制面向记忆的后训练状态感知的服务调度。记忆状态不再只是 inference 时顺便算出来的副产物,而是经过专门的训练阶段让它真正能承重——即便原始 token 已经被释放出上下文,记忆状态里还能捞得出有用信息。

实验结果跑在 LongMemEval 上,LiveMem 在对比的系统和同类 intrinsic memory 方法里拿了整体最优。核心指标是:支撑答案的证据已经被移出当前上下文时,模型仍然能靠记忆状态答对问题。他们还做了 evidence-distance 分析,证明有用信息确实能持久存在到活跃窗口之外。

模型自己内部有一个持续更新的状态向量,把关键信息留住了,不需要靠 RAG 去外部文档里翻答案。

这篇是 arXiv 上的工作,还没看到开源代码或者可以上手试的 demo。它定义了一个好的问题,也给了一个有竞争力的解法,但距离变成一个能在 Agent 框架里直接 import 的包还有段路要走。记忆状态的容量到底多固定、多任务干扰怎么处理、长时间运行下的状态漂移——论文里有一些讨论,但工程落地的坑肯定比实验里多。

不过方向是对的。现在大家都盯着把上下文窗口撑到 1M、10M token,LiveMem 的思路是说:不需要记住所有 token,模型需要的是自己学会记住那些该记住的东西,而且这个记忆不随窗口换页而消失。

对跑长期 Agent、做持续性交互的团队来说,这是一个值得盯的进展。尤其是那些已经被"上下文爆炸"逼到不得不每天清一次 Agent 记忆的开发者——LiveMem 如果真的能工程化落地,少掉的不是一次 API 调用,而是整套记忆管理的心智负担。

论文在 arXiv 上,标题是 LiveMem: Maintaining Memory State Continuity in Long-Running LLM Inference,编号 2608.02515。想深挖的去 arXiv 上搜就行,我就不逐段翻译了。

相关链接

  • 论文页面:https://arxiv.org/abs/2608.02515
  • PDF:https://arxiv.org/pdf/2608.02515