转写说明

本文基于已校验的公开原文进行结构化转写与事实梳理,非原文转载。 转写保留可核验的技术事实,并将工程建议与来源观点明确分开。

核心结论

跨会话记忆的核心挑战不是存储,而是维护一条完整的数据链:记什么、凭什么信、如何随事实变化、什么时候找回来、何时忘掉。四类记忆在工作场景中承担不同职责——工作记忆服务当前任务,情景记忆保留事件的时间、来源与结果,语义记忆提炼值得复用的稳定事实,程序记忆保存做事方式与工具约定。

记忆生命周期包含六种操作:巩固、更新、索引、检索、遗忘与压缩。这六种操作并非必须独立部署的服务,而是检查系统完整性的六个视角。工程实现可重新组织为四条路径:写入路径负责从原始事件形成可信记忆,演化路径处理新旧事实的更替,维护路径处理纠错与删除,读取路径负责找得到且适用。

能力机制

记忆系统在写入侧需要经历三个阶段。首先是巩固,从消息、工具回执和业务事件中筛选值得长期保留的内容,形成情景、语义或程序记忆。其次是质量门,组合 schema 校验、规则检查与抽样复核,持续检查 owner 错配、时间错位、偏好升级为硬约束、工具失败被写成成功等四类错误。最后是索引,为记忆建立 owner、时间、状态与访问路径。

原始层与派生层的分层设计是基础。原始层保存消息、工具返回和业务事件,是核对事实的锚点;派生层保存抽取后的偏好、事实、摘要与状态,允许重算、纠错和失效。派生记忆应能通过 source_ref 回到原始材料,但原始不等于永久,两层都应服从数据最小化与保留期要求。

在演化侧,针对不同需求有三种处理方式。快照覆盖只关心当前值,更新后直接替换旧地址。追加显式标记在保留历史的同时将旧记录标为被取代,但单纯 ADD-only 不会自动解决当前值判断。双时态模型同时记录有效时间与记录时间,能回答任意时点的状态,但建模与维护成本更高。

在读取侧,存储选型应从查询形态出发。结构化过滤适合按 owner 和时间查询的场景,向量语义检索适合相似案例匹配,精确关键词检索适合特定 ID 查询。稳妥的读取链通常分四步:先按 owner_id、状态和有效时间做结构化硬过滤,再做查询路由选择检索信号,接着对候选做排名融合或 rerank,最后在 token 预算内注入有限带来源的内容。

快速开始

异步提取任务至少需要幂等键、失败重试、死信或告警,以及按原始事件回放的能力。提取任务不应阻塞每轮对话,会话结束后异步处理可降低主链路延迟,但高风险动作应先记录结构化事件再异步生成长期记忆。

原始事件入队后,系统会依次执行质量门、抽取、索引与持久化。写入前应验证事件结构,确认来源字段、时间戳和动作结果完整。

适用边界

来源明确指出,本文只讨论单个 Agent 为同一用户保存跨会话记忆的场景。多人、多 Agent 共用记忆时新增的权限和治理问题不在讨论范围内。

RAG 不是跨会话记忆的同义词。向量、关键词和全文检索都可以被记忆系统复用,但 RAG 主要回答哪些片段与问题相关,长期记忆还必须负责内容的形成、冲突演化、时间适用性和遗忘。检索只是生命周期的一段。

将聊天记录直接接到向量库会暴露五类问题:噪声淹没有效信息、抽取把偏好升级成硬约束、新旧事实没有状态与时间关系、只靠语义相关性无法满足硬条件、错误摘要被反复召回。向量数据库不是记忆系统的默认起点,查询形态才是决定因素。

核验清单

记忆系统应在写入、读取和维护三个阶段形成可回放的指标闭环。

抽取准确率衡量内容是否忠于原文,归属、时间和类型是否正确,可对抽样记录回放原始消息进行验证。有效召回率衡量完成任务真正需要的记忆有多少进入候选或上下文,需要为真实任务预先标注必需事实。错误注入率衡量有多少错误、失效或不相关内容实际误导回答或动作。正确不注入率衡量证据不足时系统能否克制而非硬凑。过期记忆命中率衡量被召回内容中有多少已失效或被取代。纠错生效时延衡量用户修正后旧值多久停止被使用,需要分别记录主存、索引和缓存完成更正的时间。

指标应按记忆类型、查询形态和风险等级拆分。总体命中率高不代表系统没有在高风险查询上稳定犯错,离线召回提升也不等于任务成功率提升。

来源与核验

  • 原始文章
  • 页面事实以原始来源及其引用的官方资料为准;版本、星标和模型能力会随时间变化。
  • AI Stack 不公开抓取到的全文快照,只发布独立转写与来源入口。

站内链接

相关文章