记忆正在成为 LLM 的独立维度,这篇综述画了一张全景图
「记忆」这个词在 AI 圈正在变得越来越难用。有人说大模型记忆,有人理解成注意力窗口,有人理解成 RNN 的隐状态,有人想到 RAG 检索,有人直接说微调就是记忆。都不是错的,但放到一块根本没法聊。谈不上谁的锅——是这两年相关技术铺得太广太碎,每个人都只摸到了大象的一条腿。
所以上周 arXiv 上挂出来的这篇《Memory for Large Language Models》我直接点了进去。20 页,四个作者,背景是清华和华为。它不是发布某个新模型或新架构,而是一份系统性综述,目标是把散落在注意力机制、RNN 状态、参数高效微调、检索增强这些方向里的记忆研究,拼到同一个框架里。
它给的支架很直观:三个轴——表示方式(隐式还是显式)、更新方式(离线还是在线)、持久性(短期还是长期)。注意力头和 RNN 隐状态是隐式记忆,从数据库里检索出来的文档是显式记忆。预训练阶段把知识写进权重是离线更新,推理时写缓存或在上下文里追加信息是在线更新。上下文窗口容纳的是短期记忆,权重里固化的是长期记忆。
这三个轴一拉,几乎所有记忆相关技术的定位都清楚了。Transformer 的注意力是「隐式短期在线」;LoRA 属于「隐式长期离线」;RAG 是「显式长期离线」;像 Transformer-XL 或 Infini-attention 那种带了记忆压缩的架构,算「显式长期在线」。不是谁取代谁的关系,是放在不同坐标系里的工具。
不过这篇综述真正值钱的部分不是分类本身,而是它把记忆拆成了一个完整的操作流程:写入、路由、状态转换、巩固。大部分研究只盯着写入——怎么把信息存进记忆——但让记忆真正起作用的是路由:生成的时候,什么时候该读哪一段记忆?以及巩固:短期的上下文信息怎么沉淀成长期知识?这两个问题现在都还没解决好,论文里标出了哪些方向有人探过、哪些还是空地。
它还专门讨论了一个核心取舍:记忆和计算到底应该紧耦合还是松耦合。Transformer 的注意力头里记忆和计算是搅在一起的,高效但不好单独升级。RAG 把记忆彻底外挂,灵活但每次检索都有延迟和带宽成本。这不是纯理论问题,落到工程上必须硬着头皮选。
最后一段谈评测。那么多记忆论文各跑各的 benchmark,很难横向比较。这篇整理了现有的多维评测方法,没有丢出一张统一榜单,但至少告诉你在什么场景下该用什么指标去衡量记忆好不好用。
如果你想搞清楚 RAG、Mamba、Infini-attention、LoRA 这些东西到底怎么归类到同一个「记忆」框架下,这篇是目前为止最清晰的一张起点。
相关链接:
- 论文页面:https://arxiv.org/abs/2607.25380
- PDF:https://arxiv.org/pdf/2607.25380
- HTML(实验性):https://arxiv.org/html/2607.25380v1