序章 · Harness、Context 与 Memory75 SEC

记忆蓝图:LLM / Agent / AI Memory 三层边界

LLM Memory 底层计算内核 → Agent Memory 中层感知-规划-行动 → AI Memory 上层终身演化

PAPER-ORIGINALSurvey on AI Memory · PDF metadata · 2026-01-22 · 论文原图 · 三层边界图
序章 · Harness、Context 与 Memory65 SEC

Harness Engineering:从输入设计到系统执行

Prompt 优化单次输入,Context 组织多步工作集,Harness 控制整个系统如何执行

Figure 1Prompt、Context 与 Harness 工程作用域
论文来源Agent Harness Engineering · OpenReview / TMLR submission · 2026-05-14一作:Junjie Li团队:卡内基梅隆大学 等 11 家机构公开状态:TMLR 在审
序章 · Harness、Context 与 Memory75 SEC

Harness 中的 Context 与 Memory

Context 决定本次执行看什么,Memory 让状态与经验跨步骤、会话和任务持续作用

SYNTHESISAgent Harness Engineering · OpenReview / TMLR submission · 2026-05-14 · ETCLOVG
综述与研究地图 01 · Cognitive Architectures for Language Agents65 SEC

CoALA:用认知架构描述语言智能体

论文以 Agent 的状态、动作与控制语言为主轴,记忆产品分类只是其中一部分

Figure 1LLM 从文本输入输出扩展到内外双循环

A 只保留文本输入输出;B 加入观察、动作与环境反馈;C 再加入学习、推理和内部状态,系统边界由单次生成逐步扩展为内外双循环。

Figure 4CoALA 记忆动作与决策循环

决策程序把程序、语义、情景与工作记忆接到 LLM 和外部环境;Prompt、解析、检索与学习属于可执行过程,使记忆真正参与动作选择。

论文来源Cognitive Architectures for Language Agents · TMLR 2024 · arXiv 2309.02427v3一作:Theodore R. Sumers团队:普林斯顿大学正式发表:TMLR 2024
综述与研究地图 01 · Cognitive Architectures for Language Agents55 SEC

四类记忆对应四类功能问题

工作、情景、语义与程序记忆共同构成功能坐标,可由一种或多种物理载体承载

Figure 4CoALA 记忆动作与决策循环

Working 维持当前状态,Episodic 记录经历,Semantic 承载世界知识,Procedural 则同时包含模型能力与 Agent 代码;四类描述功能,不绑定四套存储。

Figure 5CoALA 的 reasoning retrieval learning grounding 动作空间

内部侧由 Reasoning、Retrieval、Learning 读写工作与长期记忆,外部侧由 Grounding 对接对话、工具和物理环境;Planning 横跨两侧组织行动。

论文来源Cognitive Architectures for Language Agents · TMLR 2024 · arXiv 2309.02427v3一作:Theodore R. Sumers团队:普林斯顿大学正式发表:TMLR 2024
综述与研究地图 01 · Cognitive Architectures for Language Agents55 SEC

内部动作、外部动作与决策循环

读取、更新与使用记忆共同进入 Agent 决策循环,并持续影响后续环境选择

Figure 3单次 LLM 调用固定链与环境反馈循环

从语言模型到语言智能体。A 是单次 LLM 调用:prompt construction 从 working memory 选模板并填变量,输出字符串被解析成一个或多个动作后执行。

Figure 4CoALA 记忆动作与决策循环

每轮先把新观察写入工作记忆,再由 retrieval 与 reasoning 生成、评估候选动作;选中的 learning 更新长期记忆,grounding 改变外部环境,随后进入下一轮。

论文来源Cognitive Architectures for Language Agents · TMLR 2024 · arXiv 2309.02427v3一作:Theodore R. Sumers团队:普林斯顿大学正式发表:TMLR 2024
综述与研究地图 02 · A Survey on the Memory Mechanism of LLM-based Agents65 SEC

2024 综述:建立 Agent Memory 的工程坐标

论文从定义、必要性、实现与评测四个问题建立工程入口

Figure 1LLM-based Agent Memory 的跨场景作用示意
论文来源Agent Memory Mechanism Survey · arXiv 2404.13501v1 · 2024-04-21一作:Zeyu Zhang团队:中国人民大学高瓴人工智能学院、华为诺亚方舟实验室
综述与研究地图 02 · A Survey on the Memory Mechanism of LLM-based Agents55 SEC

Sources—Forms—Operations 三元组

存了什么、以何存在、怎样操作必须分开讨论

Figure 4Agent Memory 的 Sources—Forms—Operations 总览
论文来源Agent Memory Mechanism Survey · arXiv 2404.13501v1 · 2024-04-21一作:Zeyu Zhang团队:中国人民大学高瓴人工智能学院、华为诺亚方舟实验室
综述与研究地图 02 · A Survey on the Memory Mechanism of LLM-based Agents55 SEC

从写入、管理到读取的完整闭环

完整记忆机制由写入、反思、整合、更新、遗忘与读取共同构成

Figure 3Task—Trial—Step 交互与记忆读写管理闭环

(a) 将任务展开为多次 trial 与逐步环境反馈;(b) 显示读、写、管理三条路径,跨 trial 信息经虚线进入长期状态,再服务后续尝试。

Figure 4Agent Memory 的 Sources—Forms—Operations 总览

来源包括当前对话、既往任务经验与外部知识,记忆形式分为参数式与非参数式;完整操作链先写入,再经合并、反思或遗忘管理,最后按任务读取。

论文来源Agent Memory Mechanism Survey · arXiv 2404.13501v1 · 2024-04-21一作:Zeyu Zhang团队:中国人民大学高瓴人工智能学院、华为诺亚方舟实验室
综述与研究地图 03 · Memory for Large Language Models65 SEC

模型级记忆:从计算副产物到架构维度

记忆正从规模扩张的副产物变成可单独设计和组合的模型内资源

Figure 1记忆从隐式计算状态演进为显式架构维度
论文来源Memory for Large Language Models · arXiv 2607.25380v1 · 2026-07-28一作:Sining Zhoubian团队:机构归属待核验
综述与研究地图 03 · Memory for Large Language Models55 SEC

三轴分类:表示、更新动态与持久性

三轴组合回答记忆以何存在、如何更新以及保留多久

Table I代表性模型在三轴 taxonomy 中的归类
论文来源Memory for Large Language Models · arXiv 2607.25380v1 · 2026-07-28一作:Sining Zhoubian团队:机构归属待核验
综述与研究地图 03 · Memory for Large Language Models55 SEC

隐式记忆:历史状态随计算过程持续演化

三种机制分别保留细粒度 token、筛选有效历史和压缩长程状态

Figure 3三种计算内状态机制
论文来源Memory for Large Language Models · arXiv 2607.25380v1 · 2026-07-28一作:Sining Zhoubian团队:机构归属待核验
综述与研究地图 03 · Memory for Large Language Models55 SEC

显式记忆:独立设计存储、寻址与更新接口

独立模块、键值条目和条件参数提供可寻址载体,专门的更新周期提供可塑性

Figure 4四种可独立更新的记忆载体
论文来源Memory for Large Language Models · arXiv 2607.25380v1 · 2026-07-28一作:Sining Zhoubian团队:机构归属待核验
综述与研究地图 04 · Memory in the Age of AI Agents65 SEC

Memory in the Age:记忆成为主动能力层

Agent Memory 通过生成、管理与调用持续参与学习和行动

Figure 1Agent Memory 的 Forms—Functions—Dynamics 统一全景

按三轴交叉读取:Forms 描述载体,Functions 描述用途,Dynamics 描述形成、演化与调用;同一系统可同时占据多轴位置。

Figure 2Agent Memory 与 LLM Memory、RAG、Context Engineering 的边界

四类系统会共享 KV 复用、图检索等实现;Agent Memory 的判别点在于交互持续形成并更新认知状态,向量库只是可选实现之一。

论文来源Memory in the Age of AI Agents · arXiv 2512.13564v2 · 2026-01-13一作:Yuyang Hu团队:新加坡国立大学、中国人民大学、复旦大学 等 12 家机构
综述与研究地图 04 · Memory in the Age of AI Agents55 SEC

形成、演化与调用的主动闭环

主动记忆选择写入内容、重组经验,并按任务路由到合适的调用路径

Figure 8Agent Memory 的形成、演化与检索生命周期
论文来源Memory in the Age of AI Agents · arXiv 2512.13564v2 · 2026-01-13一作:Yuyang Hu团队:新加坡国立大学、中国人民大学、复旦大学 等 12 家机构
综述与研究地图 05 · Survey on AI Memory65 SEC

Survey on AI Memory:扩展记忆研究版图

论文以跨范式视角连接模型内知识、上下文、外部存储与 Agent 记忆

Figure 1AI Memory 综述的演化景观与内容路线图

路线图从认知与神经科学基础进入 4W 分类,再展开单体、多体记忆、评测、应用与未来方向;箭头仅编码综述叙事顺序,技术成熟度需要独立证据。

Figure 2LLM Memory、Agent Memory 与 AI Memory 的三层边界

底层 LLM Memory 承担权重与上下文中的即时计算,中层 Agent Memory 把状态接入感知—规划—行动闭环,上层 AI Memory 讨论跨系统与跨时间的认知演化。

论文来源Survey on AI Memory · PDF metadata · 2026-01-22一作:Ting Bai团队:百家 AI 团队、北京邮电大学、华为技术有限公司
综述与研究地图 05 · Survey on AI Memory55 SEC

编码、存储、检索与更新

编码、存储、检索与更新共同塑造记忆能力,载体提供其中一类约束

Table 2AI Memory 的基础功能与高级能力分类
论文来源Survey on AI Memory · PDF metadata · 2026-01-22一作:Ting Bai团队:百家 AI 团队、北京邮电大学、华为技术有限公司
综述与研究地图 06 · Rethinking Memory Mechanisms of Foundation Agents65 SEC

Rethinking:从 LLM 扩展到 Foundation Agents

记忆研究对象扩展到文本、视觉、具身和多 Agent 的统一基础智能体

Figure 1基础智能体记忆系统的研究演进路线图

时间线用载体与主体双标签组织代表工作:研究从外部检索扩展到内部和混合载体,同时由用户画像逐步覆盖 Agent 自身经验与策略。

Figure 3218 篇样本在三维分类上的累计发表趋势

218 篇样本中,载体统计为 185 篇外部、33 篇内部;主体统计为 72 篇用户中心、146 篇 Agent 中心。两组终点都守恒到样本总数,并显示 2025 年明显加速。

论文来源Rethinking Memory Mechanisms · arXiv 2602.06052v3 · 2026-02-10一作:Wei-Chieh Huang团队:伊利诺伊大学芝加哥分校 等 27 家机构已接收:TMLR 2026
综述与研究地图 06 · Rethinking Memory Mechanisms of Foundation Agents55 SEC

按记忆对象与载体重新分类

内容语义和物理载体是两条独立设计轴

Figure 4基础智能体记忆系统的展开式分类图
论文来源Rethinking Memory Mechanisms · arXiv 2602.06052v3 · 2026-02-10一作:Wei-Chieh Huang团队:伊利诺伊大学芝加哥分校 等 27 家机构已接收:TMLR 2026
综述与研究地图 06 · Rethinking Memory Mechanisms of Foundation Agents55 SEC

五操作链与控制策略

获取、存储、检索、更新和遗忘需要由提示、训练或策略共同控制

Figure 6单 Agent 五操作链与多 Agent 协同记忆机制

上半部以遗忘与保留为中心串联存储、读取、更新与压缩;下半部把同一操作链扩展到多 Agent 的共享架构、路由协议、隔离与冲突处理。

Figure 7提示、微调与强化学习的记忆管理策略

Prompting 用结构化指令控制记忆操作,Fine-Tuning 把行为内化到参数,RL 则按长程奖励学习取舍;三者对应由规则驱动到策略学习的控制权迁移。

论文来源Rethinking Memory Mechanisms · arXiv 2602.06052v3 · 2026-02-10一作:Wei-Chieh Huang团队:伊利诺伊大学芝加哥分校 等 27 家机构已接收:TMLR 2026
综述与研究地图 07 · Memory for Autonomous LLM Agents65 SEC

Autonomous LLM Agents:记忆接入行动闭环

时间线显示记忆从检索组件扩展为持续影响推理、行动与反馈的状态机制

Table 12020–2026 年 LLM Agent 记忆系统与基准演进
论文来源Memory for Autonomous LLM Agents · arXiv 2603.07670v1 · 2026-03-08一作:Pengfei Du团队:香港技术研究院
综述与研究地图 07 · Memory for Autonomous LLM Agents55 SEC

代表系统如何把记忆接入行动

记忆责任从提供上下文逐步扩展到反思、技能形成和操作策略

Table 12020–2026 年 LLM Agent 记忆系统与基准演进
论文来源Memory for Autonomous LLM Agents · arXiv 2603.07670v1 · 2026-03-08一作:Pengfei Du团队:香港技术研究院
综述与研究地图 08 · Anatomy of Agentic Memory65 SEC

Anatomy:分类之后继续做系统审计

论文在分类框架之外继续验证外部记忆的效果、可靠性与成本净值

Table 1与相关综述在分类焦点与五个评测/系统维度上的覆盖度对比
论文来源Anatomy of Agentic Memory · arXiv 2602.19320v2 · 2026-05-20一作:Dongming Jiang团队:德克萨斯大学达拉斯分校、加州大学戴维斯分校、德克萨斯农工大学
综述与研究地图 08 · Anatomy of Agentic Memory55 SEC

三项诊断:Saturation、Stability、Agency Tax

记忆系统要证明相对强基线的增益、写入可靠性和成本净值

Table 2五个记忆基准沿 Volume/Interaction Depth/Entity Diversity 三轴的结构化饱和风险

记忆基准的结构化饱和风险。基准基于内在统计而非模型性能分析;Saturation Risk 是对长上下文 LLM 能否通过直接 prompt 解决该基准的启发式估计。

Table 5七个系统的用户面延迟(T_read+T_gen)与离线构建成本

结构化维护会同时进入在线与离线成本:MemoryOS 的读取把总延迟推到 32.372 秒,AMem 构建需 15 小时,Nemori 构建消耗 7,044k token。

论文来源Anatomy of Agentic Memory · arXiv 2602.19320v2 · 2026-05-20一作:Dongming Jiang团队:德克萨斯大学达拉斯分校、加州大学戴维斯分校、德克萨斯农工大学
综述与研究地图 09 · Are We Ready For An Agent-Native Memory System?65 SEC

Agent-Native Memory:把记忆当持续运行的数据系统

论文从黑盒问答分数转向可分解的数据管理与系统实证

Figure 1四类典型 Agent Memory 执行工作流
论文来源Agent-Native Memory System · arXiv 2606.24775v1 · 2026-06-23一作:Wei Zhou团队:上海交通大学、清华大学、MemTensor(上海)科技有限公司 等 4 家机构
综述与研究地图 09 · Are We Ready For An Agent-Native Memory System?55 SEC

写入链:结构化发生在检索之前

原始序列可直接拼接,也可抽取为自由文本事实或 Schema 记录;写入选择决定后续可恢复的信息边界

Figure 4记忆抽取方法
论文来源Agent-Native Memory System · arXiv 2606.24775v1 · 2026-06-23一作:Wei Zhou团队:上海交通大学、清华大学、MemTensor(上海)科技有限公司 等 4 家机构
综述与研究地图 09 · Are We Ready For An Agent-Native Memory System?55 SEC

读取链:召回是一段可编排的候选生成过程

原生注意力、稠密检索、子图遍历与 LLM 路由可组合成多阶段检索计划

Figure 5记忆检索方法
论文来源Agent-Native Memory System · arXiv 2606.24775v1 · 2026-06-23一作:Wei Zhou团队:上海交通大学、清华大学、MemTensor(上海)科技有限公司 等 4 家机构
综述与研究地图 09 · Are We Ready For An Agent-Native Memory System?55 SEC

维护链:记忆对象在后台持续更新状态

版本失效、容量淘汰、语义合并与参数优化共同决定记录如何保留、压缩与演化

Figure 6记忆维护方法
论文来源Agent-Native Memory System · arXiv 2606.24775v1 · 2026-06-23一作:Wei Zhou团队:上海交通大学、清华大学、MemTensor(上海)科技有限公司 等 4 家机构
综述与研究地图 10 · AI Meets Brain: A Unified Survey on Memory Systems from Cognitive Neuroscience to Autonomous Agents65 SEC

AI Meets Brain:从认知神经科学到自主智能体记忆

跨学科综述把脑科学记忆机制与 LLM/Agent 记忆工程逐层对齐,提供功能启发与证据分层

Figure 1LLM Agent Memory 的三类核心效用
论文来源AI Meets Brain · arXiv 2512.23343v1 · 2025-12-29一作:Jiafeng Liang团队:哈尔滨工业大学、复旦大学、北京大学 等 4 家机构
综述与研究地图 10 · AI Meets Brain: A Unified Survey on Memory Systems from Cognitive Neuroscience to Autonomous Agents55 SEC

性质 × 范围:两轴组合分类

Nature 区分 episodic 与 semantic,scope 区分 inside-trail 与 cross-trail;同一记忆可同时取得两轴标签

Figure 2Agent Memory 的内容性质与适用范围两轴分类
论文来源AI Meets Brain · arXiv 2512.23343v1 · 2025-12-29一作:Jiafeng Liang团队:哈尔滨工业大学、复旦大学、北京大学 等 4 家机构
综述与研究地图 10 · AI Meets Brain: A Unified Survey on Memory Systems from Cognitive Neuroscience to Autonomous Agents55 SEC

脑侧短期/长期存储与 Agent 存储位置/格式

脑侧区分感觉皮层/额顶网络与海马/新皮层;Agent 侧区分上下文窗口与记忆库,存储格式含文本、图、参数与隐表示

Figure 3认知神经科学中的短期与长期记忆存储概览

感觉输入先编码到短期系统,再向海马—新皮层长期系统转存,并在任务时取回为上下文或先验;位置与格式是两条独立设计轴。

Figure 5Agent Memory 管理分类闭环总览

原始交互先形成扁平、层级或生成式记忆,随后经更新与冲突处理维持状态,再由语义、结构或模型路由检索;应用结果回到后续交互,形成管理闭环。

论文来源AI Meets Brain · arXiv 2512.23343v1 · 2025-12-29一作:Jiafeng Liang团队:哈尔滨工业大学、复旦大学、北京大学 等 4 家机构
Benchmark 地图 · 先认基准再看结果85 SEC

LoCoMo、LongMemEval-S、PersonaMem-32K 与 AML 的分工

LoCoMo 覆盖长期关系任务,LongMemEval-S 施加长上下文压力,PersonaMem-32K 聚焦画像演化;AML 统一接口后做七维横评

具体数据集 · 分别诊断任务能力综合评测 · 统一接口横评

LoCoMo

长期对话广度回归

能否在一段长期关系史中找到正确证据,并完成事实、多跳、时间与拒答?

规模
1,986 道 QA · 10 段长期对话
评测单元
整段 conversation
上下文 / 覆盖
中位 17.5K token
评分方式
开放回答 + evidence

主要压力来自长期关系中的多跳、时间定位和错误归因。

LongMemEval-S

长上下文规模压力

能否在约 10 万 token 中处理事实更新、时间定位和跨会话证据?

规模
500 题 · 每题 38–62 sessions
评测单元
每题独立 haystack
上下文 / 覆盖
中位 103.2K token
评分方式
rubric + LLM judge

主要压力来自海量干扰、知识更新和跨会话时间检索。

PersonaMem-32K

长期画像与偏好专项

能否追踪偏好变化、解释原因,并把长期画像迁移到新的决策场景?

规模
589 题 · 20 个 personas
评测单元
persona / shared context
上下文 / 覆盖
中位 25.7K token
评分方式
四选一 exact match

主要压力来自偏好演化、原因追溯、推荐和新场景泛化。

Agent Memory Leaderboard

统一协议与综合榜单

同一 Add / Search 合同下,不同记忆系统的七维能力结构有什么差异?

规模
10+ 数据集 · 近 5,000 个问题
评测单元
统一 Add / Search 接口
上下文 / 覆盖
1,500+ histories / tasks
评分方式
统一 reader / judge · 0–100

能力剖面覆盖事实、推理、时间、治理、个性化、执行与安全。

LOCAL-OBSERVATION三套长期记忆数据集本地统计快照 · snapshot 2026-07-20 · dataset comparison · benchmark map
Benchmark 地图 · 先认基准再看结果85 SEC

LoCoMo:一段长期关系史,拆成五类记忆问题

能力面最广,适合回归;但 1,986 道题只来自 10 段独立长期对话

长期对话10 段
会话数272 个
对话轮数5,882 轮
问题数1,986 道
图像相关轮次910 轮
中位上下文17.5K token
样本怎样构成样本结构 · 讲解示意
  1. 长期历史

    同一人物关系跨多个 session 演化

  2. 证据定位

    问题绑定一个或多个历史 evidence

  3. 开放问题

    事实、多跳、时间、常识或对抗归因

  4. 答案出口

    按证据回答;低置信度时走拒答

任务构成5 类问题
  1. 多跳 / 组合(映射推断)282 题
  2. 时间推理(映射推断)321 题
  3. 常识推断(映射推断)96 题
  4. 单跳事实(映射推断)841 题
  5. 对抗归因(映射推断)446 题
LOCAL-OBSERVATION三套长期记忆数据集本地统计快照 · snapshot 2026-07-20 · datasets.locomo
Benchmark 地图 · 先认基准再看结果85 SEC

LongMemEval-S:每道题都是约 10 万 token 的独立 haystack

检索答案、知识更新、时间推理与问题级写入成本在同一压力面上验收

问题数500 道
每题会话38–62 个
每题中位消息491 条
每题中位上下文103.2K token
全量输入≈51.55M token
证据字段answer_session_ids
样本怎样构成样本结构 · 讲解示意
  1. 问题级 haystack

    每题独立写入 38–62 个 session

  2. 状态变化

    旧事实、更新事实与大量无关会话共存

  3. 目标问题

    单会话、多会话、时间、更新或偏好

  4. 证据契约

    answer_session_ids 指向应被召回的 session

任务构成6 类问题
  1. 多会话组合133 题
  2. 时间推理133 题
  3. 知识更新78 题
  4. 用户事实70 题
  5. 助手事实56 题
  6. 单会话偏好30 题
LOCAL-OBSERVATION三套长期记忆数据集本地统计快照 · snapshot 2026-07-20 · datasets.longmemeval_s
Benchmark 地图 · 先认基准再看结果85 SEC

PersonaMem-32K:从记住偏好,走到解释变化与新场景决策

四选一让复跑稳定,但也要求把记忆能力与选项偏差分开解释

问题数589 道
画像数20 个
共享上下文37 份
中位上下文25.7K token
平均引用距离62.6%
最大引用距离98.47%
样本怎样构成样本结构 · 讲解示意
  1. 共享历史

    同一 context 可服务多道 persona 问题

  2. 画像演化

    偏好、事实及其变化原因散落在历史中

  3. 新场景

    要求回忆、解释、推荐或迁移到新情境

  4. 四个选项

    选择唯一答案并做 exact match

任务构成7 类问题
  1. 偏好演化139 题
  2. 用户共享事实129 题
  3. 变化原因99 题
  4. 创意建议93 题
  5. 新场景泛化57 题
  6. 偏好推荐55 题
  7. 零散事实17 题
LOCAL-OBSERVATION三套长期记忆数据集本地统计快照 · snapshot 2026-07-20 · datasets.personamem_32k
Benchmark 地图 · 先认基准再看结果100 SEC

AML:覆盖多个数据集的一份统一评测合同

参评系统暴露 Add / Search;平台统一回答、评审、聚合与任务编排

评测流程参评系统与平台按职责衔接
  1. 历史进入

    平台把历史逐条送入参评系统 Add

  2. 问题到来

    平台调用 Search 取回候选记忆

  3. 统一回答

    平台固定 reader / prompt 生成答案

  4. 统一评分

    平台评审、聚合并形成能力剖面

10+ 数据集1,500+ histories / tasks近 5,000 问题
能力维度七项 Textual 能力逐项诊断
显式事实召回

能否找回用户明确说过的事实与细节?

关系与多跳组合

能否把分散记忆连接成关系链与结论?

时间与事件理解

能否理解先后、持续、频率与事件变化?

记忆治理

能否更新、覆盖、遗忘并处理冲突信息?

个性化与关怀

能否依据长期偏好与处境给出合宜回应?

规则与流程执行

能否持续遵循用户规则、约束和工作流程?

认识论安全与隐私

能否拒绝臆测、避免越权和隐私泄露?

OFFICIAL/CODEAgent Memory Leaderboard 官方评测说明 · README_CN · accessed 2026-08-20 · 评测范围 / AML 评估什么 / 统一评测协议
Benchmark 地图 · 先认基准再看结果95 SEC

AML 最新榜单:总分接近,七维能力结构各有侧重

前五仅差 0.723 分;选型同时读取总分与七维热图

ACADEMIC · TEXTUALpublic_suite_v3

数据 2026-08-12 · 核对 2026-08-20

  1. 01InvMemBalanced45.057
  2. 02RefindVerbose44.974
  3. 03ActiveMemoryIndexBalanced44.841
  4. 04Hybrid Search v2.0Verbose44.573
  5. 05ChronoHybridMemBalanced44.334

#1–#2:0.083 分 · Top 5 跨度:0.723 分

CAPABILITY PROFILE · 0–100同分附近,能力结构不同
系统事实召回组合推理时间推理治理更新个性化执行安全
InvMem56.846.021.832.653.130.830.3
Refind57.745.319.633.352.828.330.3
ActiveMemoryIndex56.945.018.438.054.629.732.9
Hybrid Search v2.057.946.820.932.152.626.730.3
ChronoHybridMem55.744.423.332.957.128.335.0
低高

最高单项:Hybrid Search v2.0 事实召回 57.9;ChronoHybridMem 个性化 57.1、安全 35.0。

OFFICIAL/CODEAgent Memory Leaderboard · public_suite_v3 · accessed 2026-08-20 · Academic / Textual · Top 5 + capability aggregates
论文结果 · 具体方案在什么条件下有效65 SEC

Memory in the LLM Era (Ours):LongMemEval 结果与 LoCoMo 成本权衡

层级方法整体靠前,最优方法随主干模型变化;效果还需与上下文 token 成本一起判断

Table 3LONGMEMEVAL:10 种方法的分项与 Overall 结果

7B 的 Overall F1 由 MemTree 以 36.92 领先;72B 则由 MemoryOS 以 46.04 领先,层级与树结构方法整体靠前。

图例:紫色为最佳,橙色为次佳。
Figure 6LOCOMO:F1 与平均 token 成本

MemOS、MemTree 取得较高 F1,同时消耗更多 token;MemoryOS 与 Zep 以中等 token 成本取得较高 F1,呈现更好的效果—成本折中。

论文评测Memory in the LLM Era · arXiv 2604.01707v2 · 2026-05-01一作:Yanchen Wu团队:香港中文大学(深圳)、香港中文大学、哈尔滨工业大学(深圳) 等 5 家机构
论文结果 · 具体方案在什么条件下有效65 SEC

NapMem:主结果与记忆访问消融

NapMem-9B 经 RL 后三项均值为 62.74;导航、工具集、层级记忆与训练共同贡献增益

Table 1记忆密集任务主结果

NapMem-9B 经 RL 后三项得分为 59.92、80.33、47.97,平均 62.74;高于未训练的 397B 版本 59.85,也高于 Mem0 的 59.25。

Table 4记忆访问设计消融

完整系统平均 62.74;移除 RL、主动导航、完整工具集或高层 topic/profile 后分别降至 48.39、54.08、44.93 与 54.11。

论文评测NapMem · arXiv 2607.05794v1 · 2026-07-07一作:Yue Xu团队:阿里巴巴通义大模型应用团队、上海科技大学、浙江大学 等 5 家机构
论文结果 · 具体方案在什么条件下有效65 SEC

MemVerse:LoCoMo 与 LongMemEval 双协议结果

MemVerse 在四种底座上的 LoCoMo Overall F1 为 33.8–60.0,并在 LongMemEval 取得 89.8 Recall@5 与 68.4 Accuracy

Table 1LoCoMo 上四类问题与四种 backbone 的 F1 对比

在 Qwen2.5-7B、GPT-4o-mini、GPT-5.1 与 GPT-3.5 四组底座上,MemVerse 的 LoCoMo Overall F1 分别为 33.8、43.4、43.0 与 60.0。

Table 2LongMemEval 上记忆方法的 Recall@5 与 Accuracy 对比

MemVerse 的 Recall@5 为 89.8,超过 QRRetriever 80.4 与 RAG 62.4;最终 Accuracy 为 68.4,高于 QRRetriever 66.7 与 Mem0 65.0。

论文评测MemVerse: Multimodal Memory for Lifelong Learning Agents · arXiv 2512.03627 · 2026-06-02一作:Junming Liu团队:上海人工智能实验室
论文结果 · 具体方案在什么条件下有效65 SEC

InfMem:超长 RULER 主结果

InfMem+RL 在 Qwen3-4B 与 Qwen2.5-7B 上分别达到 66.40 与 60.30 平均分,并在 896K 档保持优势

Table 1合成 RULER 主比较
论文评测InfMem · arXiv 2602.02704 · 2026-02-02一作:Xinyu Wang团队:麦吉尔大学、华为诺亚方舟实验室、蒙特利尔大学
论文结果 · 具体方案在什么条件下有效65 SEC

AutoMem:优化过程与长程游戏主结果

记忆脚手架优化带来 1.89×–3.74× 增益,操作训练再把三种环境的 progression 提升到 51.36、30.00 与 1.85

Figure 1记忆技能优化曲线

三条曲线都先在记忆脚手架迭代中跃升,再由记忆训练继续抬高;收敛版本分别是 Crafter v5、MiniHack v4、NetHack v2,说明结构与熟练度形成互补增益。

Table 1长程游戏主结果

AutoMem 32B 从 v0 的 25.00/7.50/0.42,经记忆脚手架优化到 47.27/27.50/1.57,再经记忆训练达到 51.36/30.00/1.85。

论文评测AutoMem: Automated Learning of Memory as a Cognitive Skill · arXiv 2607.01224v1 · 2026-07-01一作:Shengguang Wu团队:斯坦福大学
论文结果 · 具体方案在什么条件下有效65 SEC

MetaMem:LongMemEval 主结果与元记忆演化

MetaMem 在 Qwen 与 Llama 上分别较 LightMem 提升 4.40 与 2.91 个百分点;通用策略占比上升,但 Knowledge Update 后段回落

Table 1LongMemEval 总体性能:6 类任务×2 底座

在六类 LongMemEval 任务上,MetaMem 的 Qwen 平均准确率为 71.90%,Llama 为 69.08%;对应 LightMem 分别为 67.50% 与 66.17%。

Figure 4演化中的元记忆单元类别组成与子任务准确率趋势

(a) 通用元记忆占比从约 65% 升至 80% 以上;(b) 子任务准确率早期同步上升,而 Knowledge Update 在第 5 轮后下降,说明规则抽象与任务性能呈阶段性分化。

论文评测MetaMem · Findings of ACL 2026 · camera-ready一作:Haidong Xin团队:东北大学(沈阳)、清华大学、北京邮电大学论文:Findings of ACL 2026
论文结果 · 具体方案在什么条件下有效65 SEC

Reflexion:决策、推理与编程三类任务结果

Reflexion 在 ALFWorld、HotPotQA 与 HumanEval 上均报告改善;曲线同时揭示反思文本比单纯回看轨迹更关键

Figure 3AlfWorld 学习曲线与失败归因

(a) ReAct 在第 6–7 次尝试后停在约 97/134,启发式 Reflexion 持续升至 130/134;(b) 反思同时降低幻觉与低效规划两类失败。

Figure 4HotPotQA 学习曲线与消融

(a) Reflexion 同时提升 ReAct 与 CoT;(b) 给定正确答案对应的上下文后,准确率仍由约 0.6 升至 0.8;(c) 仅回看轨迹的 episodic memory(EPM)收益有限,加入第一人称反思文本后才形成主要增量。

论文评测Reflexion · NeurIPS 2023 · arXiv 2303.11366v4一作:Noah Shinn团队:东北大学、麻省理工学院、普林斯顿大学论文:NeurIPS 2023
论文结果 · 具体方案在什么条件下有效65 SEC

Generative Agents:受控消融与两日仿真

完整架构在特定可信度评估中优于逐步移除反思、规划与记忆的变体

Figure 8完整架构与逐步消融条件的可信度比较
论文评测Generative Agents · UIST 2023 · arXiv 2304.03442v2一作:Joon Sung Park团队:斯坦福大学、谷歌研究院、谷歌 DeepMind(谷歌深度思维)论文:UIST 2023
论文结果 · 具体方案在什么条件下有效65 SEC

ExpeL:三个主域与迁移实验

论文在 HotpotQA、ALFWorld 和 WebShop 上报告同向改进,并测试 HotpotQA 到 FEVER 的规则迁移

Figure 5三类任务主结果、消融与跨域迁移
论文评测ExpeL · AAAI 2024 · arXiv 2308.10144v3一作:Andrew Zhao团队:清华大学自动化系 BNRist、清华大学计算机科学与技术系 BNRist论文:AAAI 2024
论文结果 · 具体方案在什么条件下有效65 SEC

MemoryBear:LOCOMO 风格基准与效率报告

论文在四类长期问答中报告 Judge 得分优势,同时给出 token 和尾延迟对照

Figure 5.1长期问答效果、Memory Token 与延迟对比
论文评测Memory Bear · arXiv 2512.20651v2 · 2026-03-18一作:Deliang Wen团队:机构归属待核验
具体方案 · 核心机制:上下文与工作状态管理主分类 · 非排他70 SEC

Claude Code:规则、Auto Memory 与 Compaction 的分层生命周期

Claude Code 把显式规则、Auto Memory、会话历史与 compaction 分成不同生命周期;extractor/Dream 归入旧源码历史能力。

本地观察Claude Code 记忆机制整体架构 · 本地审计快照 · 2026-07-28 · claude-code记忆机制整体架构图.png
具体方案 · 核心机制:上下文与工作状态管理主分类 · 非排他70 SEC

Codex:线程续航与跨线程长期记忆分层

Codex 把同一 thread 的 rollout/compaction 续航与跨 thread 的 Phase 1/Phase 2 长期记忆编译严格分开。

本地观察Codex 记忆机制整体架构 · 本地审计快照 · 2026-07-28 · codex-memory-overall-architecture-main-2026-07-28-v2.png
具体方案 · 核心机制:上下文与工作状态管理主分类 · 非排他55 SEC

InfMem:PreThink–Retrieve–Write 有界记忆与早停

PreThink 控制器决策 retrieve/write/stop,文档内 BM25 恢复跨段证据,evidence-aware 联合压缩保界,γ 衰减早停奖励进入 GRPO。

源码解读InfMem 锁定源码解读 · main@2026-08-10 · baseline/memory-plugin/invmem · 26f176663726b9ab23e76ec19d7ac43fb3f6788f
具体方案 · 核心机制:上下文与工作状态管理主分类 · 非排他55 SEC

Letta:AgentState 与活动上下文编译

Letta 围绕 AgentState 串联持久 blocks、活动消息投影、全量消息表与 archival passages,并在每次 provider request 前编译当前活动上下文。

源码解读Letta 锁定源码解读 · 0.16.8 · baseline/memory-plugin/letta · 1131535716e8a31c9a437f8695e25ac98f203a24
具体方案 · 核心机制:上下文与工作状态管理主分类 · 非排他55 SEC

Acontext:把上下文蒸馏成 AgentSkill 文件树

Acontext 把宿主上下文蒸馏为可维护的 AgentSkill 文件树,再通过按需读取与本地副本供宿主加载。

源码解读Acontext 锁定源码解读 · main@2026-07-30 · baseline/memory-plugin/acontext · 259d73bfdebeed35ec2d4211ddc060a2d4126bc6
具体方案 · 核心机制:上下文与工作状态管理主分类 · 非排他55 SEC

claude-mem:从宿主事件到可注入上下文

claude-mem 用宿主 hooks 汇集生命周期事件,经 worker 生成 observations/summaries,再由搜索编排器和 ContextBuilder 注入上下文。

源码解读claude-mem 锁定源码解读 · v13.24.1 · baseline/memory-plugin/claude-mem · f6f72747e1298aef37b1baccefc11ce7305d7bf8
具体方案 · 核心机制:上下文与工作状态管理主分类 · 非排他55 SEC

agentmemory:自动观察、显式记忆与上下文编译

agentmemory 把自动 observe 与显式 remember 分开授权,从 state、vector、temporal graph 三类状态平面检索信息,再由 mem::context 编译并注入宿主上下文。

源码解读agentmemory 锁定源码解读 · v0.9.29 · baseline/memory-plugin/agentmemory · 2d38dafede67d0d4ed920cde94d2106e98825b8a
具体方案 · 核心机制:记忆形成、巩固与演化主分类 · 非排他55 SEC

Mem0:v2.0.20 ADD-only 写入与多信号检索

Mem0 v2.0.20 的默认主链是 ADD-only:先用有限历史与相似旧记忆辅助事实抽取,再把新事实写入可检索存储。

具体方案 · 核心机制:记忆形成、巩固与演化主分类 · 非排他55 SEC

TencentDB Agent Memory:L0 捕获、分层抽取与召回注入

TencentDB Agent Memory 用 checkpoint 捕获增量 turn,先写 L0 原对话,再逐层抽取、去重并在回答前临时注入。

源码解读TencentDB Agent Memory 锁定源码解读 · v2.0.0@2026-08-03 · baseline/memory-plugin/tencentdb-agent-memory · 0aff21a2d9f2b8a0354aaa80a2e586aab4054562
具体方案 · 核心机制:记忆形成、巩固与演化主分类 · 非排他55 SEC

Hindsight:可追溯事实与异步综合观察

Hindsight 先保存可追溯 facts,再异步综合 observations;reflect 只读,只有显式操作才把结果固化为 mental model。

源码解读Hindsight 锁定源码解读 · v0.9.2 · baseline/memory-plugin/hindsight · ebad478240d3171bb88201ececda5e8d9883d22d系统论文:ACL 2026 · System Demonstrations论文团队:Vectorize.io、The Washington Post、弗吉尼亚理工大学
具体方案 · 核心机制:记忆形成、巩固与演化主分类 · 非排他55 SEC

M-flow:原始写入与记忆构建的两阶段管线

M-flow 先持久化原始内容,再构建可查询记忆;检索统一编排情景记忆、原子记忆与程序性记忆。

源码解读M-flow 锁定源码解读 · main@2026-08-03 · baseline/memory-plugin/m_flow · 0d585cda2f588af69fb872ae6914caba0c217816
具体方案 · 核心机制:记忆形成、巩固与演化主分类 · 非排他55 SEC

LangMem:结构化状态变换与 BaseStore 持久化

LangMem 让 LLM 产生记忆状态变换,再把持久化、索引和最终注入交给 LangGraph BaseStore 与宿主。

源码解读LangMem 锁定源码解读 · snapshot-2026-07-19 · baseline/memory-plugin/langmem · a2d580946465137c89162e67dc0b18108bd4850c
具体方案 · 核心机制:记忆形成、巩固与演化主分类 · 非排他55 SEC

HyMemory:L1 原文锚点与分层事实调和

HyMemory 的真实主链是先保留原文锚点,再分层抽取并调和事实,图式归纳则由调用方显式触发。

源码解读HyMemory 锁定源码解读 · pypi-1.2.20 · baseline/memory-plugin/hymemory · 9055a2b793e553aead5558c821f1a69667aac20838929f314c95bfd6c3bf3cc2
具体方案 · 核心机制:记忆形成、巩固与演化主分类 · 非排他55 SEC

HMS:事实、观察与心智模型三层状态

HMS 把可追溯原始事实、后台综合的 observation 与显式物化的 mental model 分成三层。

源码解读HMS 锁定源码解读 · main@2026-07-17 · baseline/memory-plugin/HMS · 9ba0184d482f8bccf5ad5b97f85395fe6a292083
具体方案 · 核心机制:记忆形成、巩固与演化主分类 · 非排他55 SEC

VoltMem:用领域波动性治理事实更新

VoltMem 用领域波动性和观测不匹配度决定是确认当前事实、累计冲突,还是让新事实取代旧事实。

源码解读VoltMem 锁定源码解读 · main@2026-07-24 · baseline/memory-plugin/voltmem · 29c59ebdc73bd94526ad38fca93ccdd859f58aa1
具体方案 · 核心机制:记忆形成、巩固与演化主分类 · 非排他55 SEC

EverOS:三路 Markdown 摄取与 OME/Cascade 异步派生

EverOS 将用户对话、Agent 轨迹与知识文档分成三条摄取轨道;OME 异步生成复合记忆资产,Cascade 为已物化 Markdown 建立检索投影。

具体方案 · 核心机制:记忆形成、巩固与演化主分类 · 非排他55 SEC

LightMem:主题缓冲与显式离线更新

LightMem 用主题缓冲把在线对话压缩为长期事实,跨轮次合并由调用者显式触发 offline_update;论文流程与锁定默认配置需分别理解。

源码解读LightMem 锁定源码解读 · main@2026-09-07 · baseline/memory-plugin/lightmem · 8449d574df6bae1bdf3314a1564da65e2f37e046论文:ICLR 2026论文团队:浙江大学、新加坡国立大学、南京大学
具体方案 · 核心机制:记忆形成、巩固与演化主分类 · 非排他55 SEC

NEMORI:用预测残差选择性写入语义记忆

NEMORI 先用既有知识形成预期,再把预期与实际情景的差异选择性蒸馏为 SemanticMemory,使写入聚焦新增或修正信息。

源码解读NEMORI 锁定源码解读 · main@2026-07-19 · baseline/memory-plugin/nemori · d2a6dff6e5481214a0be6a2d10147feccfc16244论文:ACL 2026 · Long Paper论文团队:复旦大学、盛大集团、北京航空航天大学、上海财经大学
具体方案 · 核心机制:记忆形成、巩固与演化主分类 · 非排他55 SEC

Memori:从 Agent Turn 构建三类结构化记忆

Memori 从 Agent Turn 同步抽取原子实体事实、过程属性与叙事摘要,并在模型调用前完成事实召回。

源码解读Memori 锁定源码解读 · main@2026-08-21 · baseline/memory-plugin/memori · a7bf568cda9a3b89703b9edcda20c586e3e4f3a2
具体方案 · 核心机制:记忆形成、巩固与演化主分类 · 非排他55 SEC

memU:把宿主轨迹提炼为可检索的记忆与技能文件

memU 读取各宿主的 transcript,由 agent 生成记忆与技能 Markdown,再同步 RecallFile、分段和向量索引,支持渐进检索。

源码解读memU 锁定源码解读 · main@2026-09-04 · baseline/memory-plugin/memu · 385bdb30cda7f5265368934b8008ce2b73283283
具体方案 · 核心机制:记忆形成、巩固与演化主分类 · 非排他55 SEC

Amind:按 owner 隔离并以两阶段写入控制质量与延迟

Amind 先按 owner 隔离记忆,再由 WriteGate 控制写入质量;fastStore 负责低延迟落库,版本链与六级仲裁处理后续冲突。

源码解读Amind 锁定源码解读 · main@2026-06-21 · baseline/memory-plugin/amind · da59f6f35034afc154a478ef7a6182a9c68ffee5
具体方案 · 核心机制:记忆形成、巩固与演化主分类 · 非排他55 SEC

Memorix:从项目观察到有界任务工作集

Memorix 先把项目事件形成可追溯 observation,再用共享 SQLite 管理多类证据;只有通过资格与批准门槛的长期记忆进入有界 Workset。

源码解读Memorix 锁定源码解读 · v1.9.0 · baseline/memory-plugin/memorix · 3a5a3c700e4d09b359dc0b90809ec7cc16e80263
具体方案 · 核心机制:记忆形成、巩固与演化主分类 · 非排他55 SEC

Reflexion:把失败轨迹压缩为下一轮行动计划

Reflexion 在同一任务中把失败轨迹与评估反馈压缩为新计划,追加到任务局部的反思记忆,并在下一轮尝试时读入。

源码解读Reflexion 锁定源码解读 · main@2026-08-23 · baseline/memory-plugin/reflexion · 218cf0ef1df84b05ce379dd4a8e47f17766733a0论文:NeurIPS 2023论文团队:东北大学、麻省理工学院、普林斯顿大学
具体方案 · 核心机制:记忆形成、巩固与演化主分类 · 非排他55 SEC

Generative Agents:观察、反思与规划的共享记忆流

Generative Agents 把观察、反思与规划统一写入 AssociativeMemory,即时行动和高层反思再通过两条不同召回路径利用它们。

源码解读Generative Agents 锁定源码解读 · main@2026-08-23 · baseline/memory-plugin/generative-agents · fe05a71d3e4ed7d10bf68aa4eda6dd995ec070f4论文:UIST 2023论文团队:斯坦福大学、谷歌研究院、谷歌 DeepMind
具体方案 · 核心机制:记忆形成、巩固与演化主分类 · 非排他55 SEC

MemoryBear:Neo4j 图谱、分级检索与异步维护环

MemoryBear 把宿主消息异步写成 Neo4j 长期图谱,以四级读路返回证据,再由配额遗忘和 Layer 2 反思异步维护图状态。

源码解读MemoryBear 锁定源码解读 · v0.4.4 · baseline/memory-plugin/memory-bear · 5f8bc471f223d8875258a5b3c16991339a759a5a
具体方案 · 核心机制:结构化、时序与层级组织主分类 · 非排他55 SEC

Graphiti:Episode 来源锚点与双时间事实边

Graphiti 把 episode 作为来源锚点,把可失效的事实边置于双时间轴上,再按多类图对象检索。

源码解读Graphiti 锁定源码解读 · v0.30.0 · baseline/memory-plugin/graphiti · 31653f61d5d4dd916f85d7dba89666ce6a621552
具体方案 · 核心机制:结构化、时序与层级组织主分类 · 非排他55 SEC

Cognee:来源保留与三存储面认知管线

Cognee 先保留 Dataset/Data 来源,再把 LLM 生成的 DataPoints 分阶段写入关系、图和向量三个存储面。

源码解读Cognee 锁定源码解读 · v1.5.4 · baseline/memory-plugin/cognee · 20e0bd88746de2d96e99b4b122361dfc3dad21bc
具体方案 · 核心机制:结构化、时序与层级组织主分类 · 非排他55 SEC

MemOS:GeneralMemCube 统管异构记忆资源

MemOS v2.0.33 以 GeneralMemCube 管理异构记忆资源,但当前开源主路径仍以文本与图文本记忆为中心。

源码解读MemOS 锁定源码解读 · v2.0.33 · baseline/memory-plugin/memos · 78a372a4fc853a24d2a78efa3b4bbbd27ab9f7ad
具体方案 · 核心机制:结构化、时序与层级组织主分类 · 非排他55 SEC

MemVerse:三类多模态记忆与中央编排双路径

FastAPI/MCP 双入口把多模态输入交给中央编排器;写入侧将内容文本化并更新三类 LightRAG MMKG,读取侧先判断参数记忆是否相关,再按需回退到图检索。

源码解读MemVerse 锁定源码解读 · main@2026-08-12 · baseline/memory-plugin/memverse · e94d9acb6f8326bb47325f7aff82375d2c647b06
具体方案 · 核心机制:结构化、时序与层级组织主分类 · 非排他55 SEC

GBrain:规则自连线知识图与带引用答案

页面写入阶段由术语表与正则规则建立类型化边;查询阶段依次完成意图识别、证据汇集、答案合成与提交,输出引用和明确的未知项,后台维护复用六阶段循环。

源码解读GBrain 锁定源码解读 · v0.48.4.0 · baseline/memory-plugin/gbrain · 2efaaf8f8a817b5b82e023383618fdcdb1cc5f7d
具体方案 · 核心机制:结构化、时序与层级组织主分类 · 非排他55 SEC

OpenViking:先归档,再做 VikingFS 多粒度派生

OpenViking 采用归档优先(archive-first)写入:先把会话提交到 VikingFS,再异步生成多粒度摘要、长期记忆和执行经验。

源码解读OpenViking 锁定源码解读 · v0.4.17.1 · baseline/memory-plugin/openviking · 420d4074f74070bc6fe7151aa54527cf1ff15152
具体方案 · 核心机制:结构化、时序与层级组织主分类 · 非排他55 SEC

MemPalace:Drawer 原文底座与 Closet 派生索引

v3.6.0 深审主链经 v3.8.0 与 v3.9.0 升级复核仍成立:Drawer 保存归一化原文,Closet 提供可选派生索引,检索先筛选候选再回填完整内容。

源码解读MemPalace 锁定源码解读 · v3.9.0 · baseline/memory-plugin/mempalace · d5250c788995cbdc17a6c095345a98a997ad1728
具体方案 · 核心机制:结构化、时序与层级组织主分类 · 非排他55 SEC

Memoria:SQL 真值、图激活与 GitForData 版本

Memoria 以 MemoryService 协调 SQL 真值、图激活与混合索引,并用 MatrixOne GitForData 管理数据库状态版本。

源码解读Memoria 锁定源码解读 · v0.5.1 · baseline/memory-plugin/memoria · ea38f6056e809be61ed046140cba9d6c96f695c2
具体方案 · 核心机制:结构化、时序与层级组织主分类 · 非排他55 SEC

MCP Reference Memory:实体、关系与观察组成的 JSONL 最小知识图

MCP Reference Memory 用 Entity、Relation、Observation 构成最小知识图;每次修改采用“完整加载 JSONL—内存改图—整文件覆盖”的路径。

源码解读MCP Reference Memory 锁定源码解读 · 2026.8.31 · baseline/memory-plugin/mcp-reference-memory · a40bc270fb5ece62673f8a1196f57116d885c5eb
具体方案 · 核心机制:结构化、时序与层级组织主分类 · 非排他55 SEC

Engram (Gentleman):SQLite/FTS5 Observation 与显式冲突判定

Engram 把由 Agent 整理的 Observation 串行写入本地 SQLite/FTS5,并在事务提交后分两步处理冲突候选与最终关系判定。

源码解读Engram (Gentleman) 锁定源码解读 · v1.20.0 · baseline/memory-plugin/engram-gentleman · ba9e46ced152c37a7cb9e576153c41995873e2fc
具体方案 · 核心机制:结构化、时序与层级组织主分类 · 非排他55 SEC

Memory in the LLM Era (Ours):FIFO、分段摘要与双路平面检索

Memory in the LLM Era (Ours) 把对话先放入用户级 FIFO,容量触发后分段摘要并同步写树与 Milvus,查询则融合近期历史和两路平面 top-k。

源码解读Memory in the LLM Era (Ours) 锁定源码解读 · main@2026-08-23 · baseline/memory-plugin/memory-llm-era · badd0f1e3ffa33c46095435a015d77b1f8ae73b7
具体方案 · 核心机制:检索、路由与主动导航主分类 · 非排他55 SEC

HippoRAG:OpenIE 知识图与 PPR 单步多跳检索

写入时,模型对文本块执行 NER 与 OpenIE,抽取三元组并构建 igraph;检索时先给事实打分,再通过 PPR 的单次传播完成多跳段落排序。

源码解读HippoRAG 锁定源码解读 · main@2026-09-07 · baseline/memory-plugin/hipporag · 1438aba3fc44ff10573e5a5e1e7cc3c7f9794aff
具体方案 · 核心机制:检索、路由与主动导航主分类 · 非排他55 SEC

Thought-Retriever:用未来问题生成可检索 Thought

Thought-Retriever 先为未来可能出现的问题生成推理摘要(thought),再让原文块与经字符串门控的摘要共同参与检索;该门控只筛除特定拒答模式,不判定事实真值。

源码解读Thought-Retriever 锁定源码解读 · main@2026-07-27 · baseline/memory-plugin/thought-retriever · d0ee3eebbc79888dfa4bff8880ac716e5b3c06d4论文:TMLR 2026论文团队:伊利诺伊大学厄巴纳-香槟分校、卡内基梅隆大学
具体方案 · 核心机制:检索、路由与主动导航主分类 · 非排他55 SEC

SYNAPSE:批量重建记忆图与扩散检索

SYNAPSE 公开版按批重建情景—语义记忆图,再通过扩散激活与侧抑制筛出供回答使用的情景片段。

源码解读SYNAPSE 锁定源码解读 · main@2026-07-20 · baseline/memory-plugin/synapse · e58e7ffa8dcdf15105b01a2689ff16327182af27方法论文:Findings of ACL 2026论文团队:Gyri QAI、佐治亚大学、田纳西大学诺克斯维尔分校
具体方案 · 核心机制:检索、路由与主动导航主分类 · 非排他55 SEC

Engram:SQLite 主数据底座与混合检索

Engram 以 SQLite 作为主数据底座;混合检索、访问强化和显式巩固围绕主库运行,legacy storage 与 CLI graph DB 保留为兼容入口或派生路径。

源码解读Engram 锁定源码解读 · snapshot-2026-07-20 · baseline/memory-plugin/engram-ai · 03896b79314452d0ebfb48a055396ef74153eea9
具体方案 · 核心机制:记忆策略与技能学习主分类 · 非排他55 SEC

MemSkill:让策略控制器选择记忆操作

MemSkill 把记忆管理建模为可学习策略:控制器选择记忆操作技能,LLM 将技能落实为动作并更新当前任务轨迹的 MemoryBank。

源码解读MemSkill 锁定源码解读 · main@2026-07-27 · baseline/memory-plugin/memskill · 9907c35f8cc71684d06a1f00e0b9c5c4a7b12c4c
具体方案 · 核心机制:记忆策略与技能学习主分类 · 非排他55 SEC

AtomMem:用 GRPO 学习原子记忆操作策略

AtomMem 在部分可观测决策环中组合文本块、暂存区与 FAISS 召回结果,由模型输出 XML 原子记忆操作,再以精确匹配奖励通过 GRPO 优化整条控制策略。

源码解读AtomMem 锁定源码解读 · main@2026-03-31 · baseline/memory-plugin/atommem · 7b50580830f19d748d658b15c2e2b80e3b16c76c
具体方案 · 核心机制:记忆策略与技能学习主分类 · 非排他55 SEC

MetaMem:事实记忆与利用策略分层演化

MetaMem 把 LightMem 召回的事实与可读元记忆策略分层,用标准答案反馈离线演化利用规则,推理期只读注入选定快照。

源码解读MetaMem 锁定源码解读 · main@2026-08-23 · baseline/memory-plugin/metamem · 66232c1cb33d3d7939d323b431f21c741785142e论文:Findings of ACL 2026论文团队:东北大学、清华大学、北京邮电大学
具体方案 · 核心机制:记忆策略与技能学习主分类 · 非排他55 SEC

ExpeL:规则表负责抽象,成功轨迹负责回放

ExpeL 把训练任务的成败轨迹沉淀为带计数规则与成功案例池;评测时注入完整规则表,并用内存 FAISS 召回相似任务的少样本案例。

源码解读ExpeL 锁定源码解读 · main@2026-08-23 · baseline/memory-plugin/expel · e41ec9a24823e7b560c561ab191441b56d9bcefc论文:AAAI 2024论文团队:清华大学 BNRist
收束 · Harness Memory85 SEC

Memory 是 Harness 的长期状态层

以 Context 为核心,Memory 横跨 Lifecycle、Observability、Verification 与 Governance

PROPOSALHarness Memory 统一记忆基座命题 · v6 synthesis · 2026-08-04 · ETCLOVG + 本项目综合
附录 · 链接与致谢35 SEC

论文入口与中文深度解读索引

21 篇论文按研究框架与具体系统分组,每项同时提供官方原文与本地中文解读

综述、框架与评测

  1. Agent Harness Engineering论文中文解读
  2. Cognitive Architectures for Language Agents论文中文解读
  3. Agent Memory Mechanism Survey论文中文解读
  4. Memory for Large Language Models论文中文解读
  5. Memory in the Age of AI Agents论文中文解读
  6. Survey on AI Memory论文中文解读
  7. Rethinking Memory Mechanisms论文中文解读
  8. Memory for Autonomous LLM Agents论文中文解读
  9. Memory in the LLM Era论文中文解读
  10. Anatomy of Agentic Memory论文中文解读
  11. Agent-Native Memory System论文中文解读
  12. AI Meets Brain论文中文解读

记忆系统与策略

  1. NapMem论文中文解读
  2. MemVerse: Multimodal Memory for Lifelong Learning Agents论文中文解读
  3. InfMem论文中文解读
  4. AutoMem: Automated Learning of Memory as a Cognitive Skill论文中文解读
  5. MetaMem论文中文解读
  6. Reflexion论文中文解读
  7. Generative Agents论文中文解读
  8. ExpeL论文中文解读
  9. Memory Bear论文中文解读
01 / 93
连接中 CURRENT · 当前页

记忆蓝图:LLM / Agent / AI Memory 三层边界

SPEAKER NOTES · 提示稿

    NEXT · 下一页

    Harness Engineering:从输入设计到系统执行

    01 / 93