我给 Hermes 装了个记忆插件,它开始自己造 Skills,MemOS 实测!

0 评论 631 浏览 1 收藏 12 分钟

我是 Codex 爱好者,但是最近我把 100 刀的 Pro 降回 Plus 了

核心原因:最近刷榜的 GLM5.2、Kimi K3、Qwen-3.8-Max 好像都挺能打。所以我又把 Hermes 捞回来了(它的客户端我蛮喜欢的)

但是 Codex 的记忆系统与 Hermes 设计哲学差异巨大:Codex 认为记忆是机器生成的副产品(人别碰),Hermes 认为记忆是 agent 的主动资产(只有两个极小容量的文件,MEMORY.md(agent 笔记)上限 2,200 字符; USER.md(用户画像)上限 1,375 字符),我还是习惯有强大的记忆系统,最好可以 AI 自进化,给 Hermes 加个强大的外挂

我找到了一个开源的记忆托管平台 MemOS,可以让 AI 应用及 Agent 获得长期记忆

MemOS 官方把自己定位成”记忆操作系统”,它提供了一个记忆面板挺直观的。看了官方文档,也安装试了一下,完美解决我的问题,也推荐给大家,本文后面我再详细介绍完整安装过程

记忆是最被低估的 Agent 概念

现在的 Agent 很强,但你和它一起工作的时间,并没有真正沉淀下来

今天告诉它项目放在哪里、资料应该怎么整理、哪些来源可以使用、最后保存成什么格式。换一个新会话,它可能又要重新熟悉一遍。

上次踩过的坑、被纠正过的错误、已经验证有效的工作方法,也未必能迁移到下一次任务

各家 Agent 都有自己的记忆管理手段,但是对记忆的理解、设计、风格完全不一样:

产品
Memory 更接近什么
主要载体
谁负责写入
如何使用
Claude Code
项目经验和工作规则
Markdown 文件
用户 + Claude
会话开始时加载
OpenAI ChatGPT
用户画像和跨聊天个性化
平台内部记忆状态
用户 + ChatGPT 后台系统
动态合成相关上下文
OpenClaw
可审计的 Agent 知识库
MEMORY.md

、每日笔记、索引
Agent + 用户 + dreaming
启动注入 + 按需检索
Hermes Agent
有容量限制的 Agent 自主管理记忆
MEMORY.md

USER.md + 外部 Provider
Agent 自己
启动快照 + 每轮预取

这也是为什么最近 AI Memory 管理赛道越来越热闹,每家都说自己领先,但你信哪个?

市面上很多评测,问题是各家跑分的评测条件完全不一样,不同的 prompt、不同的 judge 模型、不同的数据集版本,甚至连”得分”的定义都不统一,就像大模型刚出来那会儿各种榜单乱飞一样

MemOS 最近开源了 OmniMemEval 评测框架,把 14 款主流 Memory 产品拉到同一条流水线上跑,统一 benchmark、统一模型配置、统一 prompt、统一 judge——而且 MemOS 自己的成绩确实打得很漂亮

OmniMemEval 做的事情很简单:让所有人穿同样的鞋、跑同样的赛道、用同一个裁判计时

User Memory:14 款产品统一横评,MemOS 领先

先看 User Memory 赛道,也就是面向个人用户的长期记忆能力,这对应的是 MemOS 云服务产品

OmniMemEval 把 14 款商业化 Memory 产品拉到一起,在五大评测集上统一跑分:

User Memory 统一横评对比
User Memory 统一横评对比

据官方最新数据,MemOS 云服务最新版本已进一步提升到 LoCoMo 92.34、LongMemEval 93.40,达到行业 SOTA 水平

真正有意思的是 Context Tokens——这代表每次回答时注入给模型的上下文 token 数:

记忆效率比对比
记忆效率比对比

MemOS 不是靠”塞更多上下文”来提高分数的,它的记忆检索效率明显更高——用更少的 token 达到更好的效果——这在生产环境下意味着:更低的调用成本、更快的响应速度、更少的模型幻觉风险

这说明 MemOS 在记忆抽取、检索路由和上下文组织上做了比较深的优化,不是简单粗暴地把所有相关记忆全塞进去

Agent Memory:让编程 Agent 越用越聪明

再看 Agent Memory 赛道——这是我更关心的方向——当 AI Agent 需要执行真实任务(写代码、搜索信息、做数学推理)时,长期记忆到底能帮多少忙?

这部分对应的产品是 MemOS Local Plugin 2.0,安装在 OpenClaw 或 Hermes 上,让 Agent 具备本地长期记忆能力

评测使用了 AgentBench 的五大任务域:

任务
能力维度
BrowseComp-Plus
信息检索
OmniMath
数学推理
SWE-Bench
软件工程
LiveCodeBench
代码实现
GDPVal
知识工作

OpenClaw 评测结果:

Agent Memory 五大任务评测
Agent Memory 五大任务评测

MemOS 在五项中拿下四项第一(BrowseComp-Plus、OmniMath、SWE-Bench、GDPVal),平均任务完成率从 36.63% 提升到 50.87%——这不是微调 prompt 能带来的提升,是记忆系统带来的结构性能力增强

Hermes 评测结果同样亮眼:

方法
OmniMath
SWE-Bench
Baseline
62.00
37.18
Mem0
64.33
34.62
Hindsight
64.00
28.20
MemOS 72.67 52.56

Hermes 上的 SWE-Bench 从 37.18% 飙到 52.56%,提升幅度超过 15 个百分点——这意味着 Agent 修 bug 的能力因为有了长期记忆而显著变强了

实测:Hermes + MemOS Local Plugin 2.0

MemOS 有几个形态,我用的是本地插件

安装过程:

curl -fsSL https://raw. githubusercontent. com/MemTensor/MemOS/main/apps/memos-local-plugin/install.sh | bash

一键脚本会自动检测已安装的 OpenClaw 和 Hermes,部署插件到对应的 ~/.hermes/plugins/ 目录,生成 config.yaml 并启动 Viewer

Viewer 面板:

安装完成后,Hermes 的 Viewer 默认运行在 http://127.0.0.1:18800,可以查看所有记忆层级

首次使用需要设置密码
首次使用需要设置密码

然后在配置中,可以导入 Hermes 原生记忆

然后就可以在工作区查看了

我强烈建议开启【记忆自进化】功能,它可以在基础摘要记忆之外,自动沉淀任务、经验、环境认知和技能

这个功能需要配置大模型能力,我配置的是 Qwen3.8-max-preview

MemOS 还有团队共享记忆功能,不过我还没有尝试

Hermes 长期记忆 + 记忆进化

MemOS 让我比较有感的地方,除了把分散的记忆集中到一个面板里,它还会让记忆继续往上生长:一次次任务形成记录,反复验证的做法沉淀为经验,对项目和环境的理解逐渐形成认知,成熟后甚至可以结晶成技能

我把 Codex 很多任务都放到 Hermes 执行了,比如我最近正在测试 GLM5.2、Kimi K3、Qwen-3.8-Max 这三个模型各方面能力,慢慢滴记忆面板中有了很多关于我项目开发和内容创作方面的很多经验了

还有 Hermes 对工作环境的感知

还有自动沉淀的技能,有些我自己都没想到可以做成 Skills

总结

我现在还没有把 MemOS 的所有功能都用透,但至少就目前的体验来说,它已经很好地解决了我的实际问题,也是我用过比较完整、比较有成长感的一套 Agent 记忆方案。

如果你也是 OpenClaw、Hermes 的重度用户,我还是挺建议亲自装起来体验几天,很多价值,不是安装完成、问几个问题就能立刻看到的。等你真正带着它做过一些项目,让任务、经验和技能一点点沉淀下来,才会逐渐感受到它确实开始越来越懂你了

本文由作者【Ai学习的老章】,微信公众号:【Ai学习的老章】,原创/授权 发布于平台,未经许可,禁止转载。
更多精彩内容,请关注人人都是产品经理微信公众号或下载App
评论
评论请登录
  1. 目前还没评论,等你发挥!