MemOS 开源评测:14 款主流 Agent 记忆系统横评,Hermes 实测表现亮眼
近期,AI Agent 领域的竞争焦点正从单一的对话能力转向更深层的长期记忆管理。开源记忆托管平台 MemOS 发布了 OmniMemEval 统一评测框架,对 14 款主流 Memory 产品进行了标准化横向对比。与此同时,开发者在 Hermes Agent 上部署 MemOS Local Plugin 2.0 的实测数据表明,引入长期记忆后,Agent 在软件工程等核心任务上的能力实现了结构性增强。
一、 评测框架:打破壁垒,统一标准下的“同场竞技”
此前,AI 记忆能力的评测往往因 Prompt 设计、Judge 模型选择及数据集版本不同而缺乏可比性。MemOS 推出的 OmniMemEval 框架旨在解决这一行业痛点,通过统一 Benchmark、模型配置、Prompt 和 Judge 机制,对 14 款商业化 Memory 产品进行标准化测试。
User Memory 赛道:效率与准确率的双赢
在面向个人用户的长期记忆(User Memory)评测中,MemOS 云服务最新版本在五大评测集上取得了行业 SOTA(State of the Art)水平:
- LoCoMo 得分:92.34
- LongMemEval 得分:93.40
更值得关注的是其上下文 Token 的使用效率。数据显示,MemOS 并非通过简单堆砌上下文 Token 来提升分数,而是凭借更高效的记忆抽取、检索路由和上下文组织能力,以更少的 Token 消耗达到更优效果。这在生产环境中直接意味着更低的调用成本、更快的响应速度以及更少的模型幻觉风险。
Agent Memory 赛道:编程与推理能力的显著提升
在针对编程 Agent 的 Agent Memory 赛道中,测试基于 MemOS Local Plugin 2.0,并在 OpenClaw 和 Hermes 两大 Agent 平台上展开。评测涵盖 BrowseComp-Plus(信息检索)、OmniMath(数学推理)、SWE-Bench(软件工程)、LiveCodeBench(代码实现)及 GDPVal(知识工作)五大任务域。
OpenClaw 平台表现:
MemOS 在五项评测中拿下四项第一。平均任务完成率从 36.63% 提升至 50.87%,显示出记忆系统带来的实质性帮助。
Hermes 平台表现:
在 Hermes 上的专项测试中,MemOS 的表现同样突出。以 SWE-Bench(软件工程)为例,引入 MemOS 后,Agent 的任务完成表现从 Baseline 的 37.18% 跃升至 52.56%,提升幅度超过 15 个百分点;在 OmniMath(数学推理)中,得分也从 62.00 提升至 72.67。相比之下,其他记忆方案如 Mem0 和 Hindsight 在 SWE-Bench 上均出现分数下滑或增长乏力。
二、 技术架构:从“被动记录”到“主动进化”
目前主流 Agent 的记忆设计哲学存在显著差异:
- Claude Code:侧重项目经验和工作规则,由用户+Claude 共同维护 Markdown 文件。
- OpenAI ChatGPT:侧重用户画像和跨聊天个性化,由后台系统动态合成上下文。
- OpenClaw:构建可审计的 Agent 知识库,包含
MEMORY.md、每日笔记及索引。 - Hermes Agent:限制容量的自主管理记忆,依赖
MEMORY.md(上限 2,200 字符)和USER.md(上限 1,375 字符)。
MemOS 的定位是“记忆操作系统”,它提供了一个可视化的记忆面板。对于 Hermes 用户而言,原生记忆容量有限,MemOS 插件通过外挂方式扩展了其长期记忆能力。
三、 实测:Hermes + MemOS Local Plugin 2.0 深度体验
安装与部署
用户可以通过官方提供的一键脚本快速部署插件:
curl -fsSL https://raw.githubusercontent.com/MemTensor/MemOS/main/apps/memos-local-plugin/install.sh | bash
该脚本会自动检测已安装的 OpenClaw 或 Hermes,并将插件部署至对应目录(如 ~/.hermes/plugins/),同时生成配置文件并启动 Viewer。
功能体验
- 可视化面板:安装完成后,Viewer 默认运行在
http://127.0.0.1:18800,用户需设置密码保护后可查看各层级记忆数据。 - 记忆自进化:这是 MemOS 的核心亮点。开启该功能后,Agent 不仅记录基础摘要,还能自动沉淀任务经验、环境认知,甚至结晶出新的 Skills(技能)。
- 大模型配置:为了实现记忆自进化,需要配置底层大模型能力。实测中,用户可配置如 Qwen3.8-max-preview 等模型来驱动记忆的自动生成与优化。
实际成效
在实际工作流中,随着 Hermes 执行更多任务(如模型能力测试、项目开发),MemOS 面板中逐渐积累了大量关于项目结构、内容创作规范及工作环境感知的经验。甚至会出现 Agent 自主创造出开发者未曾预设的 Skills 的情况,体现了“越用越聪明”的自进化特性。
四、 总结
MemOS 通过 OmniMemEval 证明了其在记忆检索效率和准确率上的技术优势,并通过 Local Plugin 2.0 解决了 Hermes 等 Agent 平台记忆容量受限的问题。其实测表明,长期记忆不仅仅是数据的存储,更是 Agent 执行复杂任务(如修 Bug、数学推理)时的结构性能力增强。对于 OpenClaw 和 Hermes 的重度用户而言,这套具备“成长感”的记忆方案提供了显著的生产力提升空间。