你的 AI 记得你,但它不照做——一篇论文拆开了「记住」和「行动」之间的裂缝

做 AI 产品的朋友应该都遇到过这种场景:用户跟助手说过三次「我吃素」,下一次推荐餐厅,助手依然兴冲冲列出一排牛排馆。查日志,用户画像里「饮食偏好:素食」写得清清楚楚,上下文里也带着。

模型不是不知道,但它就是没照做。

7 月 31 号挂在 arXiv 上的一篇新论文,正好把这个问题拎出来单独打了一盏聚光灯。题目挺直白——Know It, Act on It,来自 Zhaoxin Feng、Jianfei Ma 和 Emmanuele Chersoni。他们想弄清楚一件事:当一个 AI 助手没能按用户的偏好来响应,到底是它没记住,还是记住了但没用

这两个原因指向完全不同的修法。记不住,需要改检索、改记忆窗口、改 embedding。记住了但不执行,那是指令遵循、偏好对齐、甚至推理层面的问题——堆再多 RAG 也没用。

研究团队设计了一套解耦评估方法:对同一条用户偏好,同时跑两个测试。

一个是 Know 测试——纯考 recall。模型能不能准确说出用户的这个偏好?相当于闭卷提问:「用户喜欢什么?」

另一个是 Act 测试——把这条偏好塞进一个需要它去响应的场景里。比如用户说过「我不喜欢被打断」,那对话里安排一个人插话,看助手是礼貌提醒还是无视继续往下讲。

如果 Know 过了、Act 没过,那就不是记忆的问题,而是知识利用(knowledge utilization)的断裂。

实验规模不小。他们跑了 16 个系统、5 种记忆架构,嵌入了 1000 条用户偏好,分三个表达强度级别。结果差距非常明显:大量智能体能在 recall 测试里准确复述用户偏好,但在对应的行为场景里完全没体现出来。很多助手是「学了一肚子用户信息,但临场发挥的时候全忘了用」。

论文特别点了一个领域——健康和疗愈相关的偏好。论文原文写的是「utilization remains especially weak for health and therapy-related preferences, where failures to act carry the greatest real-world stakes」:用户告诉助手自己正在做心理治疗、有某些触发话题、或者不能承受某种语气,模型记住了,但到了对话里照样踩雷。而且这类偏好的 Act 失败率比一般偏好更高。

做 AI 情感陪伴、心理健康助手方向的团队,应该把这篇 paper 翻出来仔细看一遍。搭了记忆模块,用户填了偏好问卷,结果模型在关键对话里没接住——这不是 bug,这是产品层面的信任崩塌。

论文也承认,加了专门记忆模块的系统确实比裸模型表现好,Know-Act 的 gap 没那么大。但 gap 依然存在,而且不是靠堆更长的上下文或者更大的 embedding 就能抹掉的。

问题出在模型本身:它把「知道用户的偏好」和「把这个偏好转化成行为约束」当成两件事在处理。训练时可能也没有专门针对这种场景做对齐。

在搭 Agent 或做个性化助手时,这篇 paper 给了一个很实用的诊断思路:下次用户反馈说「它明明知道我喜欢什么但就是不做」,不要急着改记忆模块,先在内部跑一遍 Know 和 Act 的解耦测试,看到底断在哪一环。

有些裂缝是工程能补的,有些是模型能力本身的边界,后者只能等下一版模型或者自己用 preference tuning 去填。

文末放个链接:arXiv:2607.29433,CC-BY 4.0 许可,PDF 和 HTML 都能看。