能背出所有聊天记录的 AI,其实根本不懂你
这两年做个人 AI 助手的团队越来越多,我认识的几个组都在往 Agent 里挂记忆系统——把聊天记录、操作日志、偏好设置一股脑塞进去,让模型需要的时候能翻出来。效果有,但总觉得差一口气:Agent 能准确背出用户上周说过的一句话,可要它判断对方是「先调研再下单」还是「看中就买」的类型,它就懵了。它能记住事实,但没法推断用户。
今天看到一篇正好戳在这个点上的论文。Setoka,一个专门评估个性化 Agent「用户理解深度」的基准,7 月 29 号挂到了 arXiv 上。
这套基准不测「Agent 能不能找到用户说过的一句话」,它要测的是一个更根本的问题:Agent 到底能在多深的层次上理解一个人?
Setoka 的设计者从认知心理学和人格心理学里借了框架,把用户理解拆成四个层次。
第一层,语义记忆。用户直接告诉系统的信息——「我在 Google 工作」「我用 VS Code 写代码」。现在主流的记忆系统做这层基本没问题。
第二层,情景记忆。用户在具体场景下做过什么、说过什么——比如「上周二的会上他反对了那个方案」。这层已经开始有挑战了。
第三层,行为模式。用户反复出现的习惯和倾向——比如「他压力大的时候会频繁切换工具」「做决策前至少查三个来源」。这需要把分散在时间线上的碎片信息串起来推断。
第四层,人格特质。用户相对稳定的内在特征。最难的一层,要靠大量零散的行为线索去推断,还不能过度泛化。
Setoka 用了一套基于心理测量学的数据生成管线,合成了 10 个虚拟用户,每个用户都对应多源异构数据,然后拿 3 个语言模型配合 5 种记忆系统去跑,测它们在四个层次上的表现。
结果不意外,但很扎眼。所有系统在第一层(语义记忆)表现都不错——存进去的事实基本都能翻出来。到了第二层(情景记忆),开始往下掉。到了第三层(行为模式)和第四层(人格特质),几乎全线崩溃。
现在的 Agent 记忆系统,本质上还是一个检索数据库。它能找到存过的信息,但缺乏跨来源整合和随时间线抽象的能力。它记住了一切,但它不懂用户。
换个更大的模型也解决不了这个短板。Setoka 的结论很清楚:用户理解不能靠简单的事实检索,需要专门设计针对跨源信息整合和长期行为抽象的记忆机制。
对于正在搭 Agent 记忆层的团队来说,这个基准提供了一个比较清晰的标尺。Setoka 目前用的是合成用户数据,真实世界里用户的混乱程度和不可预测性只会更高。合成数据上跑通了,不代表在真实用户面前能扛住。
至少目前看,想让 Agent 真正理解一个人,靠更大的上下文窗口恐怕走不通。
相关链接
- https://arxiv.org/abs/2607.27056