LoCoMo
长期对话广度回归能否在一段长期关系史中找到正确证据,并完成事实、多跳、时间与拒答?
- 规模
- 1,986 道 QA · 10 段长期对话
- 评测单元
- 整段 conversation
- 上下文 / 覆盖
- 中位 17.5K token
- 评分方式
- 开放回答 + evidence
主要压力来自长期关系中的多跳、时间定位和错误归因。
LLM Memory 底层计算内核 → Agent Memory 中层感知-规划-行动 → AI Memory 上层终身演化
Prompt 优化单次输入,Context 组织多步工作集,Harness 控制整个系统如何执行
Context 决定本次执行看什么,Memory 让状态与经验跨步骤、会话和任务持续作用
论文以 Agent 的状态、动作与控制语言为主轴,记忆产品分类只是其中一部分
A 只保留文本输入输出;B 加入观察、动作与环境反馈;C 再加入学习、推理和内部状态,系统边界由单次生成逐步扩展为内外双循环。
决策程序把程序、语义、情景与工作记忆接到 LLM 和外部环境;Prompt、解析、检索与学习属于可执行过程,使记忆真正参与动作选择。
工作、情景、语义与程序记忆共同构成功能坐标,可由一种或多种物理载体承载
Working 维持当前状态,Episodic 记录经历,Semantic 承载世界知识,Procedural 则同时包含模型能力与 Agent 代码;四类描述功能,不绑定四套存储。
内部侧由 Reasoning、Retrieval、Learning 读写工作与长期记忆,外部侧由 Grounding 对接对话、工具和物理环境;Planning 横跨两侧组织行动。
读取、更新与使用记忆共同进入 Agent 决策循环,并持续影响后续环境选择
从语言模型到语言智能体。A 是单次 LLM 调用:prompt construction 从 working memory 选模板并填变量,输出字符串被解析成一个或多个动作后执行。
每轮先把新观察写入工作记忆,再由 retrieval 与 reasoning 生成、评估候选动作;选中的 learning 更新长期记忆,grounding 改变外部环境,随后进入下一轮。
论文从定义、必要性、实现与评测四个问题建立工程入口
存了什么、以何存在、怎样操作必须分开讨论
完整记忆机制由写入、反思、整合、更新、遗忘与读取共同构成
(a) 将任务展开为多次 trial 与逐步环境反馈;(b) 显示读、写、管理三条路径,跨 trial 信息经虚线进入长期状态,再服务后续尝试。
来源包括当前对话、既往任务经验与外部知识,记忆形式分为参数式与非参数式;完整操作链先写入,再经合并、反思或遗忘管理,最后按任务读取。
记忆正从规模扩张的副产物变成可单独设计和组合的模型内资源
三轴组合回答记忆以何存在、如何更新以及保留多久
三种机制分别保留细粒度 token、筛选有效历史和压缩长程状态
独立模块、键值条目和条件参数提供可寻址载体,专门的更新周期提供可塑性
Agent Memory 通过生成、管理与调用持续参与学习和行动
按三轴交叉读取:Forms 描述载体,Functions 描述用途,Dynamics 描述形成、演化与调用;同一系统可同时占据多轴位置。
四类系统会共享 KV 复用、图检索等实现;Agent Memory 的判别点在于交互持续形成并更新认知状态,向量库只是可选实现之一。
主动记忆选择写入内容、重组经验,并按任务路由到合适的调用路径
论文以跨范式视角连接模型内知识、上下文、外部存储与 Agent 记忆
路线图从认知与神经科学基础进入 4W 分类,再展开单体、多体记忆、评测、应用与未来方向;箭头仅编码综述叙事顺序,技术成熟度需要独立证据。
底层 LLM Memory 承担权重与上下文中的即时计算,中层 Agent Memory 把状态接入感知—规划—行动闭环,上层 AI Memory 讨论跨系统与跨时间的认知演化。
编码、存储、检索与更新共同塑造记忆能力,载体提供其中一类约束
记忆研究对象扩展到文本、视觉、具身和多 Agent 的统一基础智能体
时间线用载体与主体双标签组织代表工作:研究从外部检索扩展到内部和混合载体,同时由用户画像逐步覆盖 Agent 自身经验与策略。
218 篇样本中,载体统计为 185 篇外部、33 篇内部;主体统计为 72 篇用户中心、146 篇 Agent 中心。两组终点都守恒到样本总数,并显示 2025 年明显加速。
内容语义和物理载体是两条独立设计轴
获取、存储、检索、更新和遗忘需要由提示、训练或策略共同控制
上半部以遗忘与保留为中心串联存储、读取、更新与压缩;下半部把同一操作链扩展到多 Agent 的共享架构、路由协议、隔离与冲突处理。
Prompting 用结构化指令控制记忆操作,Fine-Tuning 把行为内化到参数,RL 则按长程奖励学习取舍;三者对应由规则驱动到策略学习的控制权迁移。
时间线显示记忆从检索组件扩展为持续影响推理、行动与反馈的状态机制
记忆责任从提供上下文逐步扩展到反思、技能形成和操作策略
论文在分类框架之外继续验证外部记忆的效果、可靠性与成本净值
记忆系统要证明相对强基线的增益、写入可靠性和成本净值
记忆基准的结构化饱和风险。基准基于内在统计而非模型性能分析;Saturation Risk 是对长上下文 LLM 能否通过直接 prompt 解决该基准的启发式估计。
结构化维护会同时进入在线与离线成本:MemoryOS 的读取把总延迟推到 32.372 秒,AMem 构建需 15 小时,Nemori 构建消耗 7,044k token。
论文从黑盒问答分数转向可分解的数据管理与系统实证
原始序列可直接拼接,也可抽取为自由文本事实或 Schema 记录;写入选择决定后续可恢复的信息边界
原生注意力、稠密检索、子图遍历与 LLM 路由可组合成多阶段检索计划
版本失效、容量淘汰、语义合并与参数优化共同决定记录如何保留、压缩与演化
跨学科综述把脑科学记忆机制与 LLM/Agent 记忆工程逐层对齐,提供功能启发与证据分层
Nature 区分 episodic 与 semantic,scope 区分 inside-trail 与 cross-trail;同一记忆可同时取得两轴标签
脑侧区分感觉皮层/额顶网络与海马/新皮层;Agent 侧区分上下文窗口与记忆库,存储格式含文本、图、参数与隐表示
感觉输入先编码到短期系统,再向海马—新皮层长期系统转存,并在任务时取回为上下文或先验;位置与格式是两条独立设计轴。
原始交互先形成扁平、层级或生成式记忆,随后经更新与冲突处理维持状态,再由语义、结构或模型路由检索;应用结果回到后续交互,形成管理闭环。
LoCoMo 覆盖长期关系任务,LongMemEval-S 施加长上下文压力,PersonaMem-32K 聚焦画像演化;AML 统一接口后做七维横评
能否在一段长期关系史中找到正确证据,并完成事实、多跳、时间与拒答?
主要压力来自长期关系中的多跳、时间定位和错误归因。
能否在约 10 万 token 中处理事实更新、时间定位和跨会话证据?
主要压力来自海量干扰、知识更新和跨会话时间检索。
能否追踪偏好变化、解释原因,并把长期画像迁移到新的决策场景?
主要压力来自偏好演化、原因追溯、推荐和新场景泛化。
同一 Add / Search 合同下,不同记忆系统的七维能力结构有什么差异?
能力剖面覆盖事实、推理、时间、治理、个性化、执行与安全。
能力面最广,适合回归;但 1,986 道题只来自 10 段独立长期对话
同一人物关系跨多个 session 演化
问题绑定一个或多个历史 evidence
事实、多跳、时间、常识或对抗归因
按证据回答;低置信度时走拒答
检索答案、知识更新、时间推理与问题级写入成本在同一压力面上验收
每题独立写入 38–62 个 session
旧事实、更新事实与大量无关会话共存
单会话、多会话、时间、更新或偏好
answer_session_ids 指向应被召回的 session
四选一让复跑稳定,但也要求把记忆能力与选项偏差分开解释
同一 context 可服务多道 persona 问题
偏好、事实及其变化原因散落在历史中
要求回忆、解释、推荐或迁移到新情境
选择唯一答案并做 exact match
参评系统暴露 Add / Search;平台统一回答、评审、聚合与任务编排
平台把历史逐条送入参评系统 Add
平台调用 Search 取回候选记忆
平台固定 reader / prompt 生成答案
平台评审、聚合并形成能力剖面
能否找回用户明确说过的事实与细节?
能否把分散记忆连接成关系链与结论?
能否理解先后、持续、频率与事件变化?
能否更新、覆盖、遗忘并处理冲突信息?
能否依据长期偏好与处境给出合宜回应?
能否持续遵循用户规则、约束和工作流程?
能否拒绝臆测、避免越权和隐私泄露?
前五仅差 0.723 分;选型同时读取总分与七维热图
数据 2026-08-12 · 核对 2026-08-20
#1–#2:0.083 分 · Top 5 跨度:0.723 分
| 系统 | 事实召回 | 组合推理 | 时间推理 | 治理更新 | 个性化 | 执行 | 安全 |
|---|---|---|---|---|---|---|---|
| InvMem | 56.8 | 46.0 | 21.8 | 32.6 | 53.1 | 30.8 | 30.3 |
| Refind | 57.7 | 45.3 | 19.6 | 33.3 | 52.8 | 28.3 | 30.3 |
| ActiveMemoryIndex | 56.9 | 45.0 | 18.4 | 38.0 | 54.6 | 29.7 | 32.9 |
| Hybrid Search v2.0 | 57.9 | 46.8 | 20.9 | 32.1 | 52.6 | 26.7 | 30.3 |
| ChronoHybridMem | 55.7 | 44.4 | 23.3 | 32.9 | 57.1 | 28.3 | 35.0 |
最高单项:Hybrid Search v2.0 事实召回 57.9;ChronoHybridMem 个性化 57.1、安全 35.0。
层级方法整体靠前,最优方法随主干模型变化;效果还需与上下文 token 成本一起判断
7B 的 Overall F1 由 MemTree 以 36.92 领先;72B 则由 MemoryOS 以 46.04 领先,层级与树结构方法整体靠前。
MemOS、MemTree 取得较高 F1,同时消耗更多 token;MemoryOS 与 Zep 以中等 token 成本取得较高 F1,呈现更好的效果—成本折中。
NapMem-9B 经 RL 后三项均值为 62.74;导航、工具集、层级记忆与训练共同贡献增益
NapMem-9B 经 RL 后三项得分为 59.92、80.33、47.97,平均 62.74;高于未训练的 397B 版本 59.85,也高于 Mem0 的 59.25。
完整系统平均 62.74;移除 RL、主动导航、完整工具集或高层 topic/profile 后分别降至 48.39、54.08、44.93 与 54.11。
MemVerse 在四种底座上的 LoCoMo Overall F1 为 33.8–60.0,并在 LongMemEval 取得 89.8 Recall@5 与 68.4 Accuracy
在 Qwen2.5-7B、GPT-4o-mini、GPT-5.1 与 GPT-3.5 四组底座上,MemVerse 的 LoCoMo Overall F1 分别为 33.8、43.4、43.0 与 60.0。
MemVerse 的 Recall@5 为 89.8,超过 QRRetriever 80.4 与 RAG 62.4;最终 Accuracy 为 68.4,高于 QRRetriever 66.7 与 Mem0 65.0。
InfMem+RL 在 Qwen3-4B 与 Qwen2.5-7B 上分别达到 66.40 与 60.30 平均分,并在 896K 档保持优势
记忆脚手架优化带来 1.89×–3.74× 增益,操作训练再把三种环境的 progression 提升到 51.36、30.00 与 1.85
三条曲线都先在记忆脚手架迭代中跃升,再由记忆训练继续抬高;收敛版本分别是 Crafter v5、MiniHack v4、NetHack v2,说明结构与熟练度形成互补增益。
AutoMem 32B 从 v0 的 25.00/7.50/0.42,经记忆脚手架优化到 47.27/27.50/1.57,再经记忆训练达到 51.36/30.00/1.85。
MetaMem 在 Qwen 与 Llama 上分别较 LightMem 提升 4.40 与 2.91 个百分点;通用策略占比上升,但 Knowledge Update 后段回落
在六类 LongMemEval 任务上,MetaMem 的 Qwen 平均准确率为 71.90%,Llama 为 69.08%;对应 LightMem 分别为 67.50% 与 66.17%。
(a) 通用元记忆占比从约 65% 升至 80% 以上;(b) 子任务准确率早期同步上升,而 Knowledge Update 在第 5 轮后下降,说明规则抽象与任务性能呈阶段性分化。
Reflexion 在 ALFWorld、HotPotQA 与 HumanEval 上均报告改善;曲线同时揭示反思文本比单纯回看轨迹更关键
(a) ReAct 在第 6–7 次尝试后停在约 97/134,启发式 Reflexion 持续升至 130/134;(b) 反思同时降低幻觉与低效规划两类失败。
(a) Reflexion 同时提升 ReAct 与 CoT;(b) 给定正确答案对应的上下文后,准确率仍由约 0.6 升至 0.8;(c) 仅回看轨迹的 episodic memory(EPM)收益有限,加入第一人称反思文本后才形成主要增量。
完整架构在特定可信度评估中优于逐步移除反思、规划与记忆的变体
论文在 HotpotQA、ALFWorld 和 WebShop 上报告同向改进,并测试 HotpotQA 到 FEVER 的规则迁移
论文在四类长期问答中报告 Judge 得分优势,同时给出 token 和尾延迟对照
Claude Code 把显式规则、Auto Memory、会话历史与 compaction 分成不同生命周期;extractor/Dream 归入旧源码历史能力。
Codex 把同一 thread 的 rollout/compaction 续航与跨 thread 的 Phase 1/Phase 2 长期记忆编译严格分开。
PreThink 控制器决策 retrieve/write/stop,文档内 BM25 恢复跨段证据,evidence-aware 联合压缩保界,γ 衰减早停奖励进入 GRPO。
Letta 围绕 AgentState 串联持久 blocks、活动消息投影、全量消息表与 archival passages,并在每次 provider request 前编译当前活动上下文。
Acontext 把宿主上下文蒸馏为可维护的 AgentSkill 文件树,再通过按需读取与本地副本供宿主加载。
claude-mem 用宿主 hooks 汇集生命周期事件,经 worker 生成 observations/summaries,再由搜索编排器和 ContextBuilder 注入上下文。
agentmemory 把自动 observe 与显式 remember 分开授权,从 state、vector、temporal graph 三类状态平面检索信息,再由 mem::context 编译并注入宿主上下文。
Mem0 v2.0.20 的默认主链是 ADD-only:先用有限历史与相似旧记忆辅助事实抽取,再把新事实写入可检索存储。
TencentDB Agent Memory 用 checkpoint 捕获增量 turn,先写 L0 原对话,再逐层抽取、去重并在回答前临时注入。
Hindsight 先保存可追溯 facts,再异步综合 observations;reflect 只读,只有显式操作才把结果固化为 mental model。
M-flow 先持久化原始内容,再构建可查询记忆;检索统一编排情景记忆、原子记忆与程序性记忆。
LangMem 让 LLM 产生记忆状态变换,再把持久化、索引和最终注入交给 LangGraph BaseStore 与宿主。
HyMemory 的真实主链是先保留原文锚点,再分层抽取并调和事实,图式归纳则由调用方显式触发。
HMS 把可追溯原始事实、后台综合的 observation 与显式物化的 mental model 分成三层。
VoltMem 用领域波动性和观测不匹配度决定是确认当前事实、累计冲突,还是让新事实取代旧事实。
EverOS 将用户对话、Agent 轨迹与知识文档分成三条摄取轨道;OME 异步生成复合记忆资产,Cascade 为已物化 Markdown 建立检索投影。
LightMem 用主题缓冲把在线对话压缩为长期事实,跨轮次合并由调用者显式触发 offline_update;论文流程与锁定默认配置需分别理解。
NEMORI 先用既有知识形成预期,再把预期与实际情景的差异选择性蒸馏为 SemanticMemory,使写入聚焦新增或修正信息。
Memori 从 Agent Turn 同步抽取原子实体事实、过程属性与叙事摘要,并在模型调用前完成事实召回。
memU 读取各宿主的 transcript,由 agent 生成记忆与技能 Markdown,再同步 RecallFile、分段和向量索引,支持渐进检索。
Amind 先按 owner 隔离记忆,再由 WriteGate 控制写入质量;fastStore 负责低延迟落库,版本链与六级仲裁处理后续冲突。
Memorix 先把项目事件形成可追溯 observation,再用共享 SQLite 管理多类证据;只有通过资格与批准门槛的长期记忆进入有界 Workset。
Reflexion 在同一任务中把失败轨迹与评估反馈压缩为新计划,追加到任务局部的反思记忆,并在下一轮尝试时读入。
Generative Agents 把观察、反思与规划统一写入 AssociativeMemory,即时行动和高层反思再通过两条不同召回路径利用它们。
MemoryBear 把宿主消息异步写成 Neo4j 长期图谱,以四级读路返回证据,再由配额遗忘和 Layer 2 反思异步维护图状态。
Graphiti 把 episode 作为来源锚点,把可失效的事实边置于双时间轴上,再按多类图对象检索。
Cognee 先保留 Dataset/Data 来源,再把 LLM 生成的 DataPoints 分阶段写入关系、图和向量三个存储面。
MemOS v2.0.33 以 GeneralMemCube 管理异构记忆资源,但当前开源主路径仍以文本与图文本记忆为中心。
FastAPI/MCP 双入口把多模态输入交给中央编排器;写入侧将内容文本化并更新三类 LightRAG MMKG,读取侧先判断参数记忆是否相关,再按需回退到图检索。
页面写入阶段由术语表与正则规则建立类型化边;查询阶段依次完成意图识别、证据汇集、答案合成与提交,输出引用和明确的未知项,后台维护复用六阶段循环。
OpenViking 采用归档优先(archive-first)写入:先把会话提交到 VikingFS,再异步生成多粒度摘要、长期记忆和执行经验。
v3.6.0 深审主链经 v3.8.0 与 v3.9.0 升级复核仍成立:Drawer 保存归一化原文,Closet 提供可选派生索引,检索先筛选候选再回填完整内容。
Memoria 以 MemoryService 协调 SQL 真值、图激活与混合索引,并用 MatrixOne GitForData 管理数据库状态版本。
MCP Reference Memory 用 Entity、Relation、Observation 构成最小知识图;每次修改采用“完整加载 JSONL—内存改图—整文件覆盖”的路径。
Engram 把由 Agent 整理的 Observation 串行写入本地 SQLite/FTS5,并在事务提交后分两步处理冲突候选与最终关系判定。
Memory in the LLM Era (Ours) 把对话先放入用户级 FIFO,容量触发后分段摘要并同步写树与 Milvus,查询则融合近期历史和两路平面 top-k。
写入时,模型对文本块执行 NER 与 OpenIE,抽取三元组并构建 igraph;检索时先给事实打分,再通过 PPR 的单次传播完成多跳段落排序。
Thought-Retriever 先为未来可能出现的问题生成推理摘要(thought),再让原文块与经字符串门控的摘要共同参与检索;该门控只筛除特定拒答模式,不判定事实真值。
SYNAPSE 公开版按批重建情景—语义记忆图,再通过扩散激活与侧抑制筛出供回答使用的情景片段。
Engram 以 SQLite 作为主数据底座;混合检索、访问强化和显式巩固围绕主库运行,legacy storage 与 CLI graph DB 保留为兼容入口或派生路径。
MemSkill 把记忆管理建模为可学习策略:控制器选择记忆操作技能,LLM 将技能落实为动作并更新当前任务轨迹的 MemoryBank。
AtomMem 在部分可观测决策环中组合文本块、暂存区与 FAISS 召回结果,由模型输出 XML 原子记忆操作,再以精确匹配奖励通过 GRPO 优化整条控制策略。
MetaMem 把 LightMem 召回的事实与可读元记忆策略分层,用标准答案反馈离线演化利用规则,推理期只读注入选定快照。
ExpeL 把训练任务的成败轨迹沉淀为带计数规则与成功案例池;评测时注入完整规则表,并用内存 FAISS 召回相似任务的少样本案例。
以 Context 为核心,Memory 横跨 Lifecycle、Observability、Verification 与 Governance
21 篇论文按研究框架与具体系统分组,每项同时提供官方原文与本地中文解读
SPEAKER NOTES · 提示稿
NEXT · 下一页