网易首页 > 网易号 > 正文 申请入驻

AI不再用完即忘:华为诺亚开源MindMemOS,记忆和Skill一起进化

0
分享至

允中 发自 凹非寺量子位 | 公众号 QbitAI

Agent的能力越来越强,但使用体验仍有一个尴尬之处:

每换一个Agent甚至换一个session,就像换了一个完全不了解你的新员工。

用户偏好、项目背景和踩坑经验无法迁移,只能从头解释,再把新Agent“重新养一遍”。

真正的挑战不只在于“有没有记忆”,还在于四件事:

  • 记忆带不走:记忆依附于单个Agent,无法跨应用和框架复用。
  • 记忆视角不同:不同业务关注的实体、属性和提取规则完全不同,一套固定模板难以通用。
  • 记忆系统不会成长:提取、检索和组织策略在开发完成后便基本固化,无法从真实使用与用户纠偏中持续演进。
  • 记忆缺少时间维度:系统既要知道最新事实,也要保留事实如何变化、旧状态如何被新状态取代的过程。

为此,华为诺亚方舟实验室推出了面向AI Agent的可迁移、自演进记忆操作层MindMemOS



它将记忆从单个Agent中解耦;

记忆建模以实体、属性、时间三维结构同时保存最新状态与完整演化轨迹;

通过MindSchema记忆模式预设记忆提取规则,或围绕给定任务与标注问答离线演化提取策略;

Feedback挖掘用户隐式的纠正性反馈,有选择地强化或降级已有记忆,从而提升记忆的可靠性及其与用户意图的一致性。

Dreaming离线巩固记忆,消解冲突,持续提升记忆质量。

MindMemOS想解决的不只是“怎样让Agent记住”,而是记忆怎样带得走,系统怎样知道该记什么,以及记忆与记忆系统怎样一起进化。

更直接的是结果:

  • MindMemOS在LoCoMo上取得分,在PersonaMem上达到70.63%
  • 在MemoryAgentBench的FactConsolidation测试中,Dreaming压缩19.4%-23.5%活跃记忆的同时,将问答准确率最高提升10.3个百分点
  • 基于真实执行轨迹的Skill演进,则把SpreadsheetBench-Verified的任务成功率提升至57.2%±2.4%

项目地址:https://github.com/mindscale-noah/MindMemOS
项目官网:https://mindmemos.cn



MindMemOS将Agent接入、记忆算法与底层记忆结构解耦,并把质量优化和Skill Evolution纳入同一系统。

用「实体-属性-时间」重建记忆中的世界

MindMemOS首先改变了记忆的基本组织方式。

传统方案常把记忆保存为一组文本片段或向量块。MindMemOS则用一个三维结构描述开放世界的信息流:

  • 实体(Entity):人、项目、文件、工具、组织等持续存在的对象;
  • 属性(Property):对象的事实、偏好、状态和高阶特征;
  • 时间(Time):属性在什么时间成立,又在何时发生变化。



每条记忆都可以落到“实体、属性、时间”的唯一坐标,同时保留实体关系和属性演变轨迹。

这相当于不再把“用户以前喜欢X”和“用户现在改用Y”当成两段互不相干的文本,而是把它们放回同一实体、同一属性的时间轴上。

实体之间可以建立语义关联,每个属性的演变也能被追踪。

在此之上,MindMemOS提供两条互补的记忆生成路径。

一条是MindVanilla模式

它不依赖预先定义的建模模板,可以接收对话、文本和工具执行轨迹,适合开放域信息快速进入统一记忆库。

另一条是MindSchema模式

系统先通过实体建模规定当前领域关注哪些实体和属性,再完成话题片段切分、属性级记忆生成、等价实体融合和图结构合并。

不同场景可以调整记忆提取规则种子,让同一套系统适配不同任务,而不必重写整个记忆基础设施。

检索时,MindMemOS也不是只做一次向量相似度匹配。

它设计了一套Compact Search:

  • 外层Agentic模块负责分析查询、规划检索路径和判断信息是否充分;
  • 内层工具则执行从实体到属性、从属性反查实体、多跳关系扩展和属性时间线追踪等多路径搜索。

简单来说,系统不只是寻找“最像问题的一段话”,而是在记忆图中寻找抵达答案最短、同时覆盖信息最充分的路径。

Dreaming:让Agent在「空闲时间」整理记忆

人类不会永久保留每个细节。我们会在回顾中合并重复信息、淘汰过时判断,并从多次经历中形成更抽象的认识。

业界把类似过程称为Dreaming

Dreaming在离线阶段从尚未整理的记忆出发,围绕相关实体扩展局部范围,识别重复、冲突和演化关系,再生成具体操作:合并冗余内容、归档被新事实取代的旧记忆、补充关系,或发现更高阶的模式。

关键在于,这种整理结果会变成持久的记忆状态,而不是把判断压力留给每一次回答时的语言模型。

例如,当同一个实体对应两条相互冲突的事实时,普通检索可能把两条内容一起返回,再期待回答模型临场判断。

MindMemOS会在Dreaming阶段识别其中的替代关系,归档已经失效的版本,并保留supersedes关系。之后的普通检索拿到的是更干净、没有歧义的上下文。

这里有一个更直观的Case Study。

MemoryAgentBench先后写入两条互相冲突的事实,并规定后写入的事实应当覆盖旧版本。

Dreaming之前,两条记忆都会进入检索上下文,回答模型受到现实世界知识干扰而选择了旧答案;

Dreaming之后,系统把较早版本归档、建立supersedes关系,同一查询便只会得到当前有效的事实。



Dreaming将冲突判断从每次查询时的临场推理,前移为可持续保存的离线记忆状态。

MindMemOS在MemoryAgentBench的FactConsolidation子集上,测试了这一机制:



结果显示,Dreaming并不是通过“记得更多”换取提升。

相反,它在提高Single-hop和Multi-hop得分的同时,将大约五分之一的活跃记忆转入归档(归档则不会被主动召回)。

这是一种典型的“少即是多”:减少干扰,本身就是提升记忆质量的一部分。

Feedback:用户的一次纠正,不应该只修一条答案

Dreaming负责系统主动整理,Feedback则让用户交互中的纠错信号回到记忆系统。

MindMemOS同时支持显式与隐式反馈。

用户可以直接用自然语言指出某条记忆错误,也可以在后续对话中表达不满、修正或新的偏好。

系统会判断这条信号是当前任务临时信息、特定场景偏好,还是适合长期保留的规律,再决定新增、更新、归档、删除或强化相关记忆。

这一步很重要,因为用户偏好往往不只是一个“是什么”的事实。

一个用户说自己偏好临时约见,真正影响推荐的可能是背后的原因:低压力安排反而能让其更可靠地赴约。

随着更多交互出现,系统需要逐渐补全“为什么”和“在什么场景下成立”,而不是无限新增相似的碎片。

论文中的PersonaMem-Evo案例展示了这种变化。

Feedback之前,系统只留下“偏好临时安排”这条表层信息,在Top-10中仅召回一条模糊相关记忆,最终给出了结构化群体活动这一错误选项。

Feedback从多轮交互中识别出真正稳定的关系是“喜欢临时或当天计划,担心长期计划有变”,并为其补上社交场景边界。

更新后,三条一致的社交规划记忆共同进入Top-10,答案也转向正确的“自发一对一活动”。



Feedback不只是增加一条记忆,而是更新原记忆的语义结构、归档旧版本,并改变后续检索结果。

因此,Feedback的目标不只是修改单条记忆。

期望是让反馈继续作用于记忆提取、检索和组织策略,实现记忆内容与记忆系统的共同演进。

不只记住发生过什么,还要沉淀「下一次怎么做」,持续优化Skills

如果说事实和偏好让Agent更懂用户,那么Skill决定了它能否把经验真正变成能力。

MindMemOS将Skill视为记忆系统的一个关键应用。

系统提供云端Skill注册、版本链、同步和回滚能力,并通过统一的Memory Add接口收集真实任务轨迹。

不同Agent框架只需在轨迹中附带本次使用的Skill上下文,系统便能把执行结果绑定到对应版本。

当轨迹积累到一定数量后,MindMemOS会依次完成:

真实任务轨迹

→ 提取目标、关键转折、工具使用和最终结果

→ 聚合反复成功的策略与反复出现的失败

→ 生成针对当前SKILL.md的修改计划

→ 应用编辑并生成新的Skill版本

→ 同步回后续任务

如果轨迹没有任务得分,系统可以从反复出现的成功路径和失败模式中做无监督演进(MindEvolve-Unsup);

如果有评分,则会强化高分轨迹中的有效行为,并抑制低分轨迹里的常见错误(MindEvolve-Sup)。

论文在包含400个真实表格操作任务的SpreadsheetBench-Verified上。进行了三次重复实验:



SpreadsheetBench-Verified任务成功率。结果为三次重复实验的均值与标准差;亮蓝和深蓝分别代表MindEvolve的无监督与监督演进配置。

这里有一个颇有意思的结果:未经优化的初始Skill甚至低于No-skill

换句话说,给Agent一份操作指南并不必然带来提升,过时、冗余或不适配任务分布的规则反而可能制造干扰。

而MindMemOS的无监督演进仅依靠执行轨迹,就将成功率从51.3%提升到55.3%;加入任务评分后进一步达到57.2%,相比No-skill提升5.9个百分点,相比未经演进的Init-skill提升9.2个百分点。

这进一步解释了这些数字从何而来:

最初的表格Skill主要是一份openpyxl、pandas使用说明,只告诉Agent怎样打开、编辑和保存工作簿,却没有覆盖真实任务中反复出现的失败:公式不会被openpyxl自动重算、格式化空行会让ws.max_row虚高、在活动工作表上一边读取一边写入可能移动行或覆盖源数据,保存成功也不代表结果已经通过验证。

无监督演进从失败轨迹中把这些经验改写成可执行约束,例如:不要把公式文本当作数值;筛选、排序和删除时先从源表构造稳定快照;保存后必须重新打开文件并按评测读取方式复核。

它完成的不是“增加更多API教程”,而是把反复踩坑的历史压缩成通用避错规则。

加入任务分数后,监督式演进又学会了规则的适用边界。

例如,它不会为了通过缓存值检查而把所有公式粗暴替换成硬编码数值;写入复杂工作簿前,还要先确认源列、目标列和映射关系。

也就是说,监督信号带来的不只是更多规则,而是让Skill逐渐知道一条规则何时应该使用、何时应该停止。

Skill不再是一份写完就不动的提示词文件,而可以成为一项带版本、带证据、可持续更新的长期能力资产。

记忆基准SOTA

除了Dreaming与Skill演进,MindMemOS还在两项主流长期记忆基准上评估了基础记忆能力。

LoCoMo包含10组超长多会话对话。使用gpt-4.1-mini作为回答模型,并将系统、检索、回答和评判配置与EverOS默认实现对齐。

MindMemOS-Modeling的Overall Accuracy达到,成为所有对比方法中的最高结果。



LoCoMo Overall Accuracy。灰色为对比方法,蓝色为MindMemOS两种配置。

在面向长期个性化的PersonaMem上,MindMemOS-MindSchema的Overall Accuracy为70.63%;MindMemOS-MindVanilla也以67.74%略高于Baseline。



PersonaMem Overall Accuracy。灰色为对比方法,蓝色为MindMemOS两种配置

这些结果共同指向一个结论:结构化建模的价值,不只是让记忆“看起来更整齐”,而是让系统在长期事实召回、用户画像和个性化推断中获得可测量的提升

从API、SDK到插件:记忆应该独立于某个Agent

MindMemOS在架构上将Agent接入层、记忆算法层与记忆结构层解耦。

当前开源代码提供FastAPI HTTP接口、Python SDK、CLI、Skills以及OpenClaw插件等接入方式,覆盖add、search、update、delete、feedback和dreaming等完整记忆生命周期操作。

这种解耦带来的直接价值是可迁移性:记忆不必继续绑定在某个Agent的私有实现中,而可以作为用户、项目或组织独立维护的长期资产,在不同应用和Agent框架之间复用。

开发者既可以本地部署完整服务,也可以从云端API、SDK或CLI开始接入。

项目采用MIT License,详细部署配置与评测流程均已随代码公开。

  • Tips:MindMemOS云服务现已开放注册试用;
  • 在GitHub为项目点亮Star后,还可获得更多使用额度。

项目官网:https://mindmemos.cn

当自动算法设计开始积累经验:MindMemOS在LLM4AD NEXT中的应用

基于大模型的自动算法设计正在展现潜力,但这类任务通常需要经历大量候选生成、评测与迭代。

若缺少长期记忆,模型很容易反复尝试已经被证明无效的方案;切换任务后,上一轮探索积累的设计经验也可能随上下文一起消失。

为此,MindMemOS已接入自动算法设计平台LLM4AD_Next,将算法搜索过程中产生的反馈转化为可存储、可检索、可复用的经验资产。

针对算法设计任务层次多、周期长的特点,平台构建了三层记忆:

  • 任务记忆(Task Memory):动态捕捉并提炼当前算法设计任务中的即时灵感与失败教训。
  • 项目记忆(Project Memory):深度沉淀特定应用场景(如组合优化任务等)下的专家共识与先验知识。
  • 全局记忆(Global Memory):固化跨项目、普适性的底层算法设计规范与基本范式。

基于该架构,平台能够将从高分结果中提炼的“有效经验”与从低分试错中总结的“避坑指南”进行系统化存储。

为了精准适配复杂多变的科研场景,系统支持两种灵活的记忆调度机制:

LLM4AD_Next提供两种记忆调度方式:Auto Mode根据当前任务和上下文自动匹配历史经验,Manual Mode则允许研究人员精确选择需要注入的记忆。

记忆的调用、注入与流转过程全程可视化,使研究人员能够观察某条经验如何影响算法生成,也更方便开展消融实验与对照分析。

MindMemOS的核心愿景,是确保大模型的每一份反馈都能转化为高价值、可复用的数字资产。

在MindMemOS的赋能下,LLM4AD_Next所执行的每一次算法搜索,都不再是孤立的尝试,而是通往下一次“进化”的坚实起点。

由MindMemOS赋能的全新自动算法发现平台LLM4AD_Next已开放体验,欢迎广大研究者前往探索:

GitHub开源项目:https://github.com/Optima-CityU/LLM4AD_Next
在线体验地址:https://llm4ad-next.cn/

Coming Features

  • 技术报告:MindMemOS完整技术报告即将发布,将进一步披露算法设计、系统实现、评测设置与更多案例分析。
  • Skills系统:与经验记忆联动,自动合成Skills;基于真实执行轨迹持续演化,并针对新问题智能分发和推荐合适的Skills。
  • 文件系统记忆:把散落在本地文件、文档、项目产物和Agent输出中的知识结构化为可检索、可关联的知识对象或知识图谱,让Agent更可靠地使用用户的文件知识。

结语:Agent的下一场竞争,可能是「谁更会积累」

今天的Agent已经拥有越来越强的模型和越来越丰富的工具,但长期智能并不只取决于一次任务能做多好。

真正拉开差距的,可能是完成一百次任务之后,它留下了什么。

是越来越长、越来越混乱的历史记录,还是一套能追踪变化、主动整理、接受纠正,并把成功与失败继续沉淀为Skill的记忆系统?

MindMemOS的答案,是把记忆从Agent的附属缓存提升为独立的操作层:信息可以跨场景建模,冲突可以在离线阶段被消解,反馈可以反向修改记忆,任务轨迹还能继续推动Skill演进。

从“记住用户”到“学会做事”,这或许也是Agent从一次性工具走向长期协作者必须补上的一层基础设施。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
【油价大跌】超2.18元/升后,9月油价大涨到“8元时代”,9月11日油价或再“涨近200元/吨”!

【油价大跌】超2.18元/升后,9月油价大涨到“8元时代”,9月11日油价或再“涨近200元/吨”!

油价早知道
2026-09-06 04:03:23
4年1.04亿合同成包袱?猛龙或再贴首轮送走珀尔特尔

4年1.04亿合同成包袱?猛龙或再贴首轮送走珀尔特尔

甜份超标的我
2026-09-06 06:38:44
年亏近百万,理发店陷入倒闭潮!不是没生意,是自己把客人劝退了

年亏近百万,理发店陷入倒闭潮!不是没生意,是自己把客人劝退了

铭记历史呀
2026-09-06 00:46:56
一夜输光几十万,打工小伙喝下整瓶百草枯:被伤透的妻子选择放弃治疗

一夜输光几十万,打工小伙喝下整瓶百草枯:被伤透的妻子选择放弃治疗

民生故事会
2026-09-05 23:23:10
“全球首款”乙肝治愈药日本开卖!中国正在审,7500万人在等?

“全球首款”乙肝治愈药日本开卖!中国正在审,7500万人在等?

李云飞Afey
2026-09-05 17:30:10
大陆接到消息,绿营大佬排队“反水”:不惜代价推动两岸和平统一

大陆接到消息,绿营大佬排队“反水”:不惜代价推动两岸和平统一

墨兰史书
2026-09-04 22:25:06
花40W租房2年,退租时房东要求扣除押金、更换新家具;租户:花了2千多清理房子,房东依然不满意;房东:她不是修复,只是掩盖

花40W租房2年,退租时房东要求扣除押金、更换新家具;租户:花了2千多清理房子,房东依然不满意;房东:她不是修复,只是掩盖

大风新闻
2026-09-05 17:05:09
琼斯:齐沃几句话就能让我们明白他的想法,他完美管理着球队

琼斯:齐沃几句话就能让我们明白他的想法,他完美管理着球队

懂球帝
2026-09-06 03:26:10
刚刚,GPT-6 突然全量上线,额度重置再+1,全网实测效果太离谱

刚刚,GPT-6 突然全量上线,额度重置再+1,全网实测效果太离谱

AppSo
2026-09-05 09:22:54
郑钦文美网逆转,1亿代言费保住了!

郑钦文美网逆转,1亿代言费保住了!

乡野小珥
2026-09-06 07:12:19
续航960km!比亚迪新车官宣:9月14日上市

续航960km!比亚迪新车官宣:9月14日上市

高科技爱好者
2026-09-05 22:54:24
袁咏仪55岁生日,儿子准备的“包”蛋糕,精准狙击妈妈软肋!

袁咏仪55岁生日,儿子准备的“包”蛋糕,精准狙击妈妈软肋!

娱乐小叨叨
2026-09-05 15:20:53
海港0-0国安,侯森屡救险,李新翔、莱昂纳多失良机

海港0-0国安,侯森屡救险,李新翔、莱昂纳多失良机

懂球帝
2026-09-05 21:34:14
程维高之子携巨款逃亡海外,买下65公顷岛屿,重金将女儿送进政坛

程维高之子携巨款逃亡海外,买下65公顷岛屿,重金将女儿送进政坛

健康快乐丁
2025-08-05 15:53:11
ESPN:亚马尔19岁零49天达成巴萨50球,对比梅罗等人

ESPN:亚马尔19岁零49天达成巴萨50球,对比梅罗等人

懂球帝
2026-09-05 17:50:25
久违了,300路公交

久违了,300路公交

小虎新车推荐员
2026-09-05 09:16:41
喝酒四巨头全没了,最大35岁最小26岁,直播间成了他们最后的地方

喝酒四巨头全没了,最大35岁最小26岁,直播间成了他们最后的地方

绚丽的画卷
2026-09-05 06:56:57
上海交大调查发现:若60岁前没患这几种疾病,患癌几率或微乎其微

上海交大调查发现:若60岁前没患这几种疾病,患癌几率或微乎其微

今日养生之道
2026-09-06 03:30:46
我离婚后嫁了一个老光棍,洞房夜他比我还紧张,我笑着说:放松点

我离婚后嫁了一个老光棍,洞房夜他比我还紧张,我笑着说:放松点

千秋文化
2026-08-28 20:37:52
手机涨价潮遇冷:一场没人接盘的“价格游戏”!

手机涨价潮遇冷:一场没人接盘的“价格游戏”!

小柱解说游戏
2026-09-06 01:35:34
2026-09-06 08:16:49
量子位 incentive-icons
量子位
追踪人工智能动态
13270文章数 176550关注度
往期回顾 全部

科技要闻

华为何庭波,再次更新韬定律论文

头条要闻

决胜盘一度0比5落后 郑钦文连赢七局上演"史诗级逆转"

头条要闻

决胜盘一度0比5落后 郑钦文连赢七局上演"史诗级逆转"

体育要闻

本西蒙斯加盟国王,不管怎样,回来就好

娱乐要闻

阿Sa蔡卓妍首度求婚细节,感动落泪

财经要闻

被曝试药后死亡,药企董事竟怒怼记者

汽车要闻

带升降立标MPV 岚图梦想家9预售价42.99万起

态度原创

本地
房产
亲子
游戏
军事航空

本地新闻

扒完小作文,富豪们私藏的度假胜地有多绝

房产要闻

突发重磅!海口出台楼市新政!

亲子要闻

AI造娃?生殖专家开发“智能扫精术”,无精症患者都能硬找出蝌蚪生?

发售时间迎来新线索!《龙珠》新作或明年初就能玩到

军事要闻

俄罗斯建"粉碎大日本帝国"纪念碑 日本急了

无障碍浏览 进入关怀版