MemOS 开源评测:14 款主流 Agent 记忆系统横评,Hermes 实测表现亮眼

AI Agent 长期记忆管理新突破:MemOS 统一评测与实战效能深度解析

近期,AI Agent 领域的竞争焦点正从单一的对话能力转向更深层的长期记忆管理。开源记忆托管平台 MemOS 发布了 OmniMemEval 统一评测框架,对 14 款主流 Memory 产品进行了标准化横向对比。与此同时,开发者在 Hermes Agent 上部署 MemOS Local Plugin 2.0 的实测数据表明,引入长期记忆后,Agent 在软件工程等核心任务上的能力实现了结构性增强。

一、 评测框架:打破壁垒,统一标准下的“同场竞技”

此前,AI 记忆能力的评测往往因 Prompt 设计、Judge 模型选择及数据集版本不同而缺乏可比性。MemOS 推出的 OmniMemEval 框架旨在解决这一行业痛点,通过统一 Benchmark、模型配置、Prompt 和 Judge 机制,对 14 款商业化 Memory 产品进行标准化测试。

User Memory 赛道:效率与准确率的双赢

在面向个人用户的长期记忆(User Memory)评测中,MemOS 云服务最新版本在五大评测集上取得了行业 SOTA(State of the Art)水平:

  • LoCoMo 得分:92.34
  • LongMemEval 得分:93.40

更值得关注的是其上下文 Token 的使用效率。数据显示,MemOS 并非通过简单堆砌上下文 Token 来提升分数,而是凭借更高效的记忆抽取、检索路由和上下文组织能力,以更少的 Token 消耗达到更优效果。这在生产环境中直接意味着更低的调用成本、更快的响应速度以及更少的模型幻觉风险。

Agent Memory 赛道:编程与推理能力的显著提升

在针对编程 Agent 的 Agent Memory 赛道中,测试基于 MemOS Local Plugin 2.0,并在 OpenClaw 和 Hermes 两大 Agent 平台上展开。评测涵盖 BrowseComp-Plus(信息检索)、OmniMath(数学推理)、SWE-Bench(软件工程)、LiveCodeBench(代码实现)及 GDPVal(知识工作)五大任务域。

OpenClaw 平台表现:
MemOS 在五项评测中拿下四项第一。平均任务完成率从 36.63% 提升至 50.87%,显示出记忆系统带来的实质性帮助。

Hermes 平台表现:
在 Hermes 上的专项测试中,MemOS 的表现同样突出。以 SWE-Bench(软件工程)为例,引入 MemOS 后,Agent 的任务完成表现从 Baseline 的 37.18% 跃升至 52.56%,提升幅度超过 15 个百分点;在 OmniMath(数学推理)中,得分也从 62.00 提升至 72.67。相比之下,其他记忆方案如 Mem0 和 Hindsight 在 SWE-Bench 上均出现分数下滑或增长乏力。

二、 技术架构:从“被动记录”到“主动进化”

目前主流 Agent 的记忆设计哲学存在显著差异:

  • Claude Code:侧重项目经验和工作规则,由用户+Claude 共同维护 Markdown 文件。
  • OpenAI ChatGPT:侧重用户画像和跨聊天个性化,由后台系统动态合成上下文。
  • OpenClaw:构建可审计的 Agent 知识库,包含 MEMORY.md、每日笔记及索引。
  • Hermes Agent:限制容量的自主管理记忆,依赖 MEMORY.md(上限 2,200 字符)和 USER.md(上限 1,375 字符)。

MemOS 的定位是“记忆操作系统”,它提供了一个可视化的记忆面板。对于 Hermes 用户而言,原生记忆容量有限,MemOS 插件通过外挂方式扩展了其长期记忆能力。

三、 实测:Hermes + MemOS Local Plugin 2.0 深度体验

安装与部署

用户可以通过官方提供的一键脚本快速部署插件:

curl -fsSL https://raw.githubusercontent.com/MemTensor/MemOS/main/apps/memos-local-plugin/install.sh | bash

该脚本会自动检测已安装的 OpenClaw 或 Hermes,并将插件部署至对应目录(如 ~/.hermes/plugins/),同时生成配置文件并启动 Viewer。

功能体验

  1. 可视化面板:安装完成后,Viewer 默认运行在 http://127.0.0.1:18800,用户需设置密码保护后可查看各层级记忆数据。
  2. 记忆自进化:这是 MemOS 的核心亮点。开启该功能后,Agent 不仅记录基础摘要,还能自动沉淀任务经验、环境认知,甚至结晶出新的 Skills(技能)。
  3. 大模型配置:为了实现记忆自进化,需要配置底层大模型能力。实测中,用户可配置如 Qwen3.8-max-preview 等模型来驱动记忆的自动生成与优化。

实际成效

在实际工作流中,随着 Hermes 执行更多任务(如模型能力测试、项目开发),MemOS 面板中逐渐积累了大量关于项目结构、内容创作规范及工作环境感知的经验。甚至会出现 Agent 自主创造出开发者未曾预设的 Skills 的情况,体现了“越用越聪明”的自进化特性。

四、 总结

MemOS 通过 OmniMemEval 证明了其在记忆检索效率和准确率上的技术优势,并通过 Local Plugin 2.0 解决了 Hermes 等 Agent 平台记忆容量受限的问题。其实测表明,长期记忆不仅仅是数据的存储,更是 Agent 执行复杂任务(如修 Bug、数学推理)时的结构性能力增强。对于 OpenClaw 和 Hermes 的重度用户而言,这套具备“成长感”的记忆方案提供了显著的生产力提升空间。