】《为 Agent 铸造时间记忆:缓存、持久存储与遗忘法则---辨析长短记忆,解析语义、情景与程序记忆,走完记忆完整生命周期,借助 Mem0 搭建智能体长效》)
一.⼈⼯介⼊Human-in-the-Loop/HITL1.什么是⼈⼯介⼊a.HITL(⼈在回路Human-in-the-Loop 是指在 AI Agent 或⾃动化系统中引⼊⼈类的监督、⼲预或审批环节。当 Agent遇到不确定、⾼⻛险或需要判断的任务时会主动暂停、向⼈类请求输⼊或确认⼈类完成⼲预后系统再继续运⾏。其核⼼作⽤是提升安全性、降低错误⻛险并能将⼈的知识和直觉融⼊⾃动化流程中。核⼼逻辑AI提供预判但最终决策权/执⾏权必须经⼈⼯确认。系统是“助理”⼈是“审批流”的必经节点。⽐如你买完单⼿机⾃动识别你的脸。如果识别清晰、⾦额⼩直接⽀付Agent⾃动但如果⾦额超过500元⼿机会弹窗让你 输⼊⽀付密码或按指纹确认 —— 这就是“把⼈拉进来决策”防⽌误刷。b.HOTL⼈在环上——监督与叫停模式运作逻辑AI先全⾃动执⾏⼈类不参与每⼀个决策但保留“紧急制动”和“宏观调参”的权限。系统持续运⾏⼈类在旁边实时监控仪表盘只有当AI的置信度跌破阈值、或检测到异常指标时⼈类才“拍下暂停键”接管或调整策略后让AI继续。核⼼区别HITL是“必须等你点头才能继续”阻塞式HOTL是“你先⼲着我盯着出⼤事我叫停”⾮阻塞式。核⼼逻辑AI负责99%的常规操作⼈负责监控⻓尾⻛险和策略调参。⼈是“空中交通管制员”不指挥每⼀次起降但管航路和应急处置。⽐如⾃动驾驶 L3 级别⻋辆正常时⾃⼰开驾驶员不需要碰⽅向盘⼈在环上监控路况但当系统检测到前⽅施⼯且路径模糊时会发出警报要求驾驶员⽴即接管。c.HOOTL⼈在环外——完全⾃治模式运作逻辑⼈类彻底退出运⾏链路。系统不向⼈类请求实时输⼊也不接受实时覆盖。⼈类只在系统设计、训练、部署前设定好终极⽬标和约束条件上线后⼀切决策由AI⾃主完成且没有暂停键或暂停键有极⾼的延迟。核⼼区别HITL和HOTL⾥“⼈还在场”HOOTL⾥⼈已经离场系统完全依赖初始设定的规则和⾃学习进化。核⼼逻辑⼈是“⽴法者”AI是“执法者”。系统上线后不依赖任何实时⼈类输⼊⼀切依赖预设的奖励函数和约束边界。⽐如⾼频量化交易算法以微秒级执⾏买卖⼈类根本来不及反应⼀旦启动就全⾃动运⾏但事先设定了最⼤亏损熔断线。2.为什么⼈⼯介⼊这是一张关于HITLHuman-in-the-Loop人机回环的说明表格展示了在不同场景下AI的局限性以及人类介入的必要性。总⽽⾔之⼈⼯介⼊并⾮要取代AI⽽是构建了⼀种“⼈机协同”的伙伴关系AI负责⼴度和效率⼈类负责深度和良知。在未来好的设计不是追求“零介⼊”⽽是追求“精准介⼊”——即在关键决策点引⼊最⾼质量的⼈类判断⽤最⼩的⼲预成本换取最⼤的系统安全性和社会信任度。3.⼈⼯介⼊的基本⼯作流程举个发票的例子进行说说明用户查询 -- Agent财务人员说帮我审核今天报销的50张发票LLM思考层AI自动识别每张发票的公司名称、税号、金额、日期、发票代码判断是否需要人工介入AI检查是否有异常情况无需介入则执行所有发票信息完整金额正常AI自动标记审核通过完成入账需要介入则触发断点发现某张发票金额10万超出常规或税号不匹配或发票代码查不到触发人工介入保存现场AI记录已审核49张卡在第50张发票代码XXX金额10万系统识别为可疑人工介入财务主管收到通知人工查看这张发票三种处理方式同意则主管确认特殊业务AI继续执行通过拒绝则主管发现假发票拒绝报销AI记录驳回原因编辑完善信息则主管发现税号少一位修正后AI继续处理恢复现场AI从第50张发票继续按主管决策完成后续操作执行全部50张发票处理完毕生成最终审核报告⼈类审核时往往有3种选择每种对应不同的 Agent ⾏为4.HITL 的核⼼步骤HITL模式主要有三步中断流程在重要节点先暂停不继续执⾏。保存把现场所有状态都记住⽅便后续恢复。恢复等⼈类审核确认后流程再接着⾛。5.HITL 的触发机制触发机制是 HITL 的⻔禁常⻅的有四种逻辑敏感动作触发 (High-Stakes Actions) 涉及转账、删除数据、法律协议签署等不可逆的“红线”操作。业务逻辑触发 (Guardrails) 违反了预设的硬规则如预算超标、字数超限、包含敏感词。异常死循环触发 (Loop Detection) AI 连续多次尝试同⼀错误操作⽆法跳出时强制请求⼈⼯接管。低置信度触发 (Low Confidence) AI 对当前决策的概率评分低于设定阈值例如 P 0.8。6.实战-体验下⼈⼯介⼊提示词如下# 项⽬个⼈导航⽹站 ## 项⽬背景 我需要⼀个简洁、美观的个⼈导航⽹站⽤来集中管理⽇常⼯作和学习常⽤的⽹站链接。 ## 核⼼功能需求 1. **⽹站展⽰**以卡⽚⽹格展⽰所有⽹站卡⽚包含名称、⽹址和图标。 2. **优先级排序**⽀持设置“⾼、中、低”优先级⾼优先级排在前⾯。 3. **点击统计**⾃动记录每个⽹站的点击次数并⽀持按点击量排序。 4. **数据持久化**使⽤浏览器的 localStorage 保存数据刷新不丢失。 ## 技术约束 - 纯前端HTML CSS JavaScript。 - 界⾯适配移动端和桌⾯端。 ## ⾮功能需求 - 加载速度快UI 现代简洁。 ## ⼯作流要求 1. **计划⽣成与⽂件输出**在编写任何代码前请先分析需求并⽣成⼀份详细的开发计划包含技 术选型、UI设计、数据结构、实现步骤。**除了在对话中输出计划摘要外你必须同时将完整的计划 内容写⼊项⽬根⽬录下的 plan.md ⽂件中**如果项⽬没有根⽬录则在当前⼯作区根⽬录创 建。计划⽂件应使⽤标准 Markdown 格式结构清晰。 2. **暂停等待确认**完成计划输出和⽂件写⼊后**必须暂停**明确提⽰“计划已写⼊ plan.md请审核确认后再继续”等待我审核或提出修改意⻅。在我明确回复“确认”之前不得开始 编码。 3. **确认后⾃动执⾏**在我确认后请⼀次性完成全部代码开发⽆需中途汇报。如果我需要调 整会随时主动提出你可以随时响应并修改。1. 我们启动TraeAgent模式搭建⼀个个⼈导航⽹站新建文件选择Agent模式2. 可以看到计划已经写⼊到⽂件3. 明确提出来需要我们审核⽅案4. 我们审核⽅案问题进行提示修改⽅案有问题 1. 我们连不上⾕歌 2. 明确⽣成50条以上的演⽰数据需要看下效果5. 等待⽅案更新6. 更新完成后我们检查⽅案没有问题就开始执⾏7. 我们看下效果二.记忆管理Memory1.Memory是什么Agent Memory即AI智能体的记忆系统是专⻔为AI智能体Agent设计的、能够跨会话、跨任务持久保留和召回信息的外部记忆机制.没有记忆的Agent就像⼀位每天重置的临时⼯——你每次开⼝他都会礼貌地问“您好请问您贵姓”你告诉他“姓王”五分钟后换了个话题他再问“您好请问您贵姓”他从不留任何记录每⼀次对话都是全新的开始。有记忆的Agent则像⼀位随⾝携带“全能档案夹”的专属秘书⽐如你今天跟他说“我喜欢靠窗的座位”“对芒果过敏”他当场记下明天你再让他订机票他会直接问“还是靠窗吗”后天你让他推荐餐厅他会主动提醒“您对芒果过敏这家甜品没有芒果可以放⼼。”更厉害的是这个档案夹是持续累积的——你三个⽉前随⼝提过“讨厌嘈杂的环境”现在让他找咖啡馆他会避开热⻔⽹红店只推荐安静的⻆落。他不需要翻什么“笔记本”或“便签”只需看⼀眼那本统⼀的档案所有信息⾃然浮现。2.为什么需要记忆1. LLM没有状态⼤语⾔模型从根本上是⽆状态的。发送⼀条消息产⽣⼀个回复每次新对话都是⼀块⽩板。这是因为模型本⾝就是⼀个巨型函数输⼊进去token 出来模型权重中没有任何持久化存储能在会话之间保留对话历史。简单聊天机器⼈不在乎这⼀点。让它写⼀封求职信写完就结束不需要连续性。Agent ⾯对的情况截然不同。它们需要处理⻓期运⾏的任务在时间推移中学习⽤⼾偏好跨多个会话与其他 agent 协作。⽆状态性构成了根本性障碍没有⼈能接受⼀个每周⼀早上都要重新⾃我介绍的个⼈助理。2. 上下⽂问题最初业界认为可以⽤巨⼤的上下⽂窗⼝填满所有信息但现实击碎了这种幻想上下⽂腐烂当上下⽂中包含⼤量与当前任务⽆关的信息时模型需要在更⼤的信息空间中寻找相关内容注意⼒资源被分散容易出现关键信息遗漏、指令遵循能⼒下降以及推理质量下降等问题⽐如你塞给它 100 万字的对话历史⾥⾯ 99% 是废话、重复、⽆关信息。模型看花了眼注意⼒被稀释该记住的关键信息⽐如“⽤⼾要求⽤摄⽒度⽽不是华⽒度”反⽽被淹没了。学术界常⻅现象Lost in the Middle中间内容遗忘 当关键信息位于上下⽂窗⼝的正中间时模型的召回率准确率会跌到最低点甚⾄不如把关键信息放在开头Primacy效应或结尾Recency效应。Attention Dilution注意⼒稀释 当⽆关的废话越多模型就必须把原本集中在“关键信息”上的概率权重强⾏分给成千上万个⽆意义的词语如“的、了、嗯、⽽且”。Context Interference上下⽂⼲扰⽆关信息不仅仅占位置它们包含的语义特征Semantic Features在模型的向量空间中与有效信息产⽣了负向交互NegativeInterference。你给⼀群⼈开了个“跨部⻔辩论会”。第⼀个发⾔的⼈说“⽤⼾喜欢简洁答案”第⼆个⼈说“⽤⼾是⾏业专家需要详尽分析”第三个⼈⼜说“⽤⼾今天赶时间越快越好”。它们三个在会议室⾥互相打架。研究者将这种现象称为“上下⽂腐烂”Context Rot。它的本质不是“信息变旧了”⽽是“信噪⽐Signal-to-Noise Ratio急剧下降”。当上下⽂膨胀时模型的注意⼒头AttentionHeads被迫分配⼤量权重去处理⽆关的噪⾳。结果就是模型为了“看完”所有内容不得不压缩信息的内部表征Representation Compression这种压缩过程会直接抹去细微但关键的⽤⼾偏好⽐如你喜欢的摄⽒度或者⽤⼾名的⼤⼩写规则。检索昂贵⻓上下⽂检索成本呈指数级增⻓计算复杂度通常随上下⽂⻓度呈平⽅增⻓上下⽂越⻓模型定位相关信息的代价越⾼。每次你问 AI ⼀个问题它都要把整个⼯作台上的所有东西从头到尾捋⼀遍才能找到和问题相关的⼏⾏字。⼯作台越⼤它捋得就越慢、越费劲。成本失控每个请求都携带⼤量历史token费⽤迅速累积。你每说⼀句话AI 都要把之前所有的对话历史哪怕是⼀年前的废话重新打包⼀起发给⼤模型处理。就像你每次倒⼀杯⽔快递员都要把你家整个游泳池的⽔⼀起运过去。3. 追踪⻓期⽬标胜任复杂任务许多现实任务不是⼀次性的。任务连续性Agent需要记住“任务进⾏到哪⼀步了”⽐如订机票--选座位--⽀付或“哪些⽅案已经被否决过”标⼀致性确保在跨越数天、数周的任务中Agent的⾏为和决策始终围绕最终⽬标保持⼀致4. 构建个性化画像从“通⽤”⾛向“专属”当Agen能够回忆过去的对话时它感觉更个⼈化、更协作。情感连续性建⽴信任改变⼈类对AI的感受。看个简单的例⼦失忆AI机械你深夜说“我最近特别焦虑感觉做什么都做不好”。它回复“焦虑是常⻅的情绪建议深呼吸转移注意⼒……”——虽然正确但像在听录⾳机。记忆AI共情它回复“记得上个⽉你搞定那个难缠客⼾时也说过同样的‘做不好’。但后来你复盘时发现其实是你对⾃⼰要求太⾼了。今天是不是⼜遇到类似‘全盘否定⾃⼰’的瞬间了要不要像上次那样我们先把⼤⽬标拆成三个今天能做的⼩事”3.记忆分类学术界和⼯程界最常⻅的分类是借鉴⼈类认知科学的⼆分法短期记忆和⻓期记忆。a.短期记忆在 Agent 的语境下短期记忆指的是在当前⼀次对话或任务执⾏过程中临时存储的、上下⽂相关的信息。核⼼作⽤维持对话的连贯性⽀撑多步推理。技术本质它通常就是⼤语⾔模型的上下⽂窗⼝Context Window内的内容。例如你们刚刚聊的对话、当前⽤⼾提供的临时指令“帮我查⼀下明天北京的天⽓”都会被放在这个“⼯作台”上。特点容量有限受限于模型⽀持的最⼤ tokens 数如 4K、128K、1M。⽣命周期短对话结束时这部分记忆通常被直接清除不保存到数据库。访问极快直接作为输⼊的⼀部分传给模型⽆需检索。短期记忆你正和朋友坐在咖啡厅聊天。你们正在说的这⼏句话以及前五分钟聊过的话题。因为都在脑⼦⾥转所以你说话⾮常连贯不会前⾔不搭后语。b.⻓期记忆⻓期记忆指的是跨会话、持久化存储的信息包括⽤⼾的历史⾏为、偏好、事实知识等。核⼼作⽤实现个性化、持续学习与知识积累。技术本质通常通过外部向量数据库如 Chroma、Pinecone或传统数据库实现。Agent 会在需要时根据当前问题去检索相关的历史记忆⽚段。特点容量近乎⽆限理论上可以存储海量信息。⽣命周期⻓可以保存数天、数⽉甚⾄永久。访问较慢需要经过“检索-排序”的过程不能直接使⽤。⻓期记忆在⼼理学上⼜分为以下⼏类1.语义记忆定义存储客观事实、概念、知识与个⼈经历⽆关。特点就像⼤脑⾥的百科全书告诉你“世界是什么样的”。Agent 例⼦助⼿知道“勾股定理是 a² b² c²”、“⽔的沸点是 100°C”、“Paris 是法国的⾸都”。这些知识是通⽤的不关⼼“是谁、什么时候”学到的。2.程序记忆定义存储如何做某件事的技能、流程、习惯。特点通常难以⽤语⾔说清楚内隐记忆是“知道怎么做”⽽不是“知道是什么”。Agent 例⼦助⼿如何调⽤天⽓ API先获取城市代码 -- 拼接 URL -- 解析 JSON 返回温度。这些“操作流程”就是程序记忆。3.情景记忆定义存储个⼈经历的特定事件包括时间、地点、情绪。特点⾃传体式的记忆告诉你“我经历过什么”。Agent 例⼦助⼿记得“昨天下午3点⼩明问过我⼀个⽅程 2x515他当时要求我解释每⼀步。”或者“上周⼆⽤⼾抱怨过推荐算法不准后来他⼿动选了⼀部科幻⽚。”简单理解语义记忆 What是什么程序记忆 How怎么做情景记忆 When/Where/Who/What在什么时间、地点谁经历了什么事4.短期记忆与⻓期记忆的区别5.短期记忆的处理短期记忆就是当前对话的⼯作台。策略的核⼼是在有限的窗⼝⾥只放最精华的信息。常⻅的处理策略:滑动窗⼝只保留最近 N 轮对话更早的⼀⼑切扔掉。Token 截断只保留最近 N 个 token摘要不直接扔掉旧对话⽽是让模型定期把“⽼对话”压缩成⼀段简短摘要。保留摘要 最近⼏轮原始对话。过滤不按轮数或 token 数切⽽是识别关键信息实体、指令、数字、偏好单独提取出来存到⼀个“关键信息⼝袋”⾥普通对话内容直接删在真正的⽣产环境中这四种逻辑单独使⽤都有缺陷但组合起来就是⽆敌的。当前最先进的短期记忆处理范式是“三层记忆架构”底层缓存层使⽤ 滑动窗⼝ 保留最近 5-10 轮原始对话保证模型对当前话题的流畅接话。中间层摘要层对窗⼝之外的较早对话采⽤ 滑动摘要每隔 N 轮将旧摘要新对话合并⽣成新摘要。顶层事实层贯穿全程使⽤ 信息过滤实时维护⼀个“事实⼝袋”User Profile并随对话动态更新。这张图展示了一种大模型分层记忆方案整个流程分为记忆更新和模型推理两个阶段。在记忆更新阶段用户发来新消息后由消息分发器分成三路处理缓存层保存最近 5‑10 轮原始对话轮数过多就删掉最早的记录摘要层把旧摘要和新对话合并压缩生成简短的对话梗概事实层提取实体、爱好、关键数字保存成结构化的用户画像。在模型推理阶段上下文组装器按照优先级调取记忆优先读取事实层其次读取摘要层最后读取缓存层再加上固定系统提示词一起交给大模型生成回答并返回给用户。简单来说系统把对话分成短期原始记录、中期对话梗概、长期用户信息三类记忆提问时按重要程度加载记忆让大模型在长对话里记住更多内容。⼀个特别值得警惕的坑“Token 截断”和“滑动窗⼝”会导致“顺序反转”问题。如果从最早的消息开始截断模型会丢失“初始系统指令”System Prompt。所以通常的⼯程做法是System Prompt 和“关键信息⼝袋”永远锚定在窗⼝最前⾯绝不参与滑动或截断只把⽤⼾和助⼿的普通聊天内容拿去滚动。6.⻓期记忆的基本⼯作流程⻓期记忆是跨会话的、持久化存储的信息⽬标是在未来的、新的对话中能够被检索并注⼊到上下⽂窗⼝⾥。它的处理⽅式不只是在当前窗⼝⾥“裁剪”或“压缩”⽽是围绕 “存储、更新、检索、遗忘” 这些个核⼼动作展开。1.存储/写⼊⽬标将对话中的关键信息、⽤⼾偏好和任务进度经结构化处理后持久化写⼊对应的记忆存储层如向量库、图数据库或关系型数据库供后续跨会话检索使⽤。触发时机触发类型具体场景处理方式结合三层记忆架构示例显式指令用户主动要求系统记住某条信息提取关键信息存入事实层更新用户结构化画像“记住我叫小明”、“我喜欢科幻片帮我记一下”短期记忆溢出上下文窗口即将满载容纳不下更多对话自动提取对话核心要点压缩后存入摘要层多轮长对话后系统提炼重点保存到长期梗概中会话终止用户结束对话或者聊天超时对本次全部对话生成完整摘要归档保存至摘要层用户发送 “再见”系统自动整理本次对话摘要存档高频信号同一偏好、事实在对话里反复多次出现识别稳定不变的信息写入事实层长期保存多次提到使用 Python达到次数后自动记录用户偏好定期反思每日或者每周定时执行复盘任务分析历史日志总结用户习惯与需求模式更新事实层每周复盘发现用户常在周日询问理财问题记录周期性需求注意所有类型触发后都会进入记忆更新阶段由消息分发器完成分层存储模型推理时系统按事实层摘要层缓存层的优先级读取记忆拼接系统提示词交给大模型生成回答。写⼊动作具体怎么存每个写⼊操作都需要经过以下⼏步类型归类语义/情景/程序。冲突检测与合并保持不变。差异化索引构建根据类型分流若为 固定属性标量→ 构建 B-Tree索引存SQL若为 模糊偏好/⻓⽂本需理解含义→ 构建 向量索引存Vector DB若为 实体关系数据→ 构建 知识图谱存图数据库库。存储数据库向量数据库这个后面会有具体的章节在讲关系数据库图数据库DB-Engines Ranking - popularity ranking of graph DBMS2.更新⽬标修正或取代Agent⻓期记忆中的过时、错误或⽤⼾偏好变更的信息同时保留历史变更轨迹确保记忆的准确性与可追溯性。触发时机⼯作过程1. 找到要修改的那条旧记忆系统会从所有存储的记忆中把⽤⼾提及的那条旧记忆精准找出来⽐如通过关键词、时间、场景等。2. 判断新信息属于哪⼀类新来的更正信息需要先判断它是什么类型是客观事实如姓名、⽣⽇、城市是主观偏好喜欢的⻝物、讨厌的⻛格还是可重复使⽤的⽅法⽐如“做PPT时先列⼤纲”不同类型的信息后续处理⽅式会略有不同。3. 决定如何处理冲突如果新旧信息有⽭盾系统按以下顺序做决定a. ⽤⼾今天亲⼝说的优先于过去说的因为⼈可能改变主意。b. 如果新信息更加具体⽐如“我不喜欢《流浪地球》”⽽旧信息⽐较宽泛“我喜欢科幻⽚”那我们会保留宽泛的同时把具体的特例记下来。c. 如果新旧信息的来源可信度不同⽐如来⾃权威资料 vs ⽤⼾随⼝⼀提取更可信的个。d. 如果以上都差不多则以时间最新的为准。4. 保存更新并保留历史我们不会直接覆盖旧记忆⽽是把旧记忆标记为“已过期”同时写⼊⼀条新记忆并附上“本条替代了哪条旧记忆”的说明。这样任何时候都能回头查看这条记忆的演变过程。如果新信息只是对旧记忆的补充没有⽭盾就直接附加进去不影响原有的。3.检索/读取⽬标根据当前⽤⼾查询和上下⽂从⻓期记忆中⾼效、精准地检索出最相关的历史信息并注⼊到短上下⽂窗⼝中以⽀持当前对话。触发时机检索⽅式在实际⼯程中常采⽤混合策略结合向量相似度检索和结构化查询前者通过嵌⼊匹配找到语义相近的记忆⽚段后者可针对知识图谱执⾏精确匹配有效降低漏检⻛险。降级策略检索失败时的处理4.遗忘⽬标通过主动或被动策略淘汰过时、低价值或违反隐私规定的记忆控制存储规模维持检索的信噪⽐。触发时机触发类型主动 / 被动具体场景处理方式结合三层记忆架构示例精确删除主动用户要求遗忘某一条具体记忆定位并删除事实层 / 摘要层中指定的单条记忆保留其余内容“忘掉我刚才说的那个地址”、“把刚才那条记录删了”遗忘全部主动用户要求删除所有个人信息清空事实层全部用户画像数据清除本次会话摘要触发隐私合规流程需要二次确认“忘记所有关于我的事”触发隐私合规流程需二次确认时间衰减被动某条记忆超过 90 天未被访问后台扫描将长期不用的记忆标记为待清理候选逐步淘汰陈旧信息系统每日后台扫描自动标记长期未使用的记忆为候选低访问频率被动某条记忆每月被调取不足 1 次识别长期很少用到的记忆降低优先级列入清理候选低频记忆可能价值较低进入候选容量限制被动记忆总量达到系统存储上限10^6按照重要性分数从小到大删掉价值最低的多条记忆释放存储空间删除重要性分数最低的 M 条记忆处理步骤1.触发检测检查是否满⾜遗忘条件主动指令或被动策略2.筛选候选根据条件查询出待遗忘的记忆ID列表3.执⾏遗忘硬删除物理删除不可恢复软删除标记为已删除检索时跳过降权降低检索得分系数如乘以0.2但仍可能被召回4.级联处理若删除的记忆存在关联依赖同步处理关联记忆5.⽇志记录可选记录遗忘操作及原因供后续审计追溯7.记忆开发框架名称简介地址Mem0业界广泛应用的核心记忆层专注于长期记忆管理和个性化 AI。它将记忆编排、检索与知识图谱结合能节省 90% 以上的 token 成本并支持细粒度的用户 / 会话隔离和结构化更新GitHubhttps://github.com/mem0ai/mem0官网https://mem0.aiLangMemLangChain 团队推出的专属记忆 SDK深度集成 LangGraph 生态。它同时提供了 “热路径工具” 用于对话中的实时记忆以及 “优化技巧” 用于长期优化 Agent 行为如更新系统提示词GitHubhttps://github.com/langchain‑ai/langmemZep构建动态的 “时序知识图谱”擅长记忆信息间随时间变化的复杂关系并始终保持高效检索GitHubhttps://github.com/getzep/zep官网https://www.getzep.comTencentDB Agent MemoryAgent 记忆服务TencentDB Agent Memory由腾讯云数据库团队从底层完全自研。作为一款独立的记忆管理底座它原生提供自动写入、分层沉淀、按需召回与治理增强等核心能力。强力支撑智能体在跨会话、长周期、多任务场景中持续沉淀业务知识保障上下文的连续性并使记忆资产具备更全局维度的管理与高效复用能力。https://cloud.tencent.com/product/agmPolar Agent MemoryPolar Agent Memory 是部署于 PolarDB for AI 节点的长期记忆引擎通过向量数据库与知识图谱双模存储将历史对话中的关键信息持久化并在后续会话中自动检索、更新和关联使大模型具备跨会话的个性化记忆能力。https://help.aliyun.com/zh/polardb/polardb‑for‑mysql/polardb‑agent‑memory?spma2c4g.11186623.help‑menu‑2249963.d_5_2_4_6.6f4166ea nvPwqXscm20140722.H_3015094…OR_help‑T‑cn~zh‑V_1AgentKit MemoryAgentKit Memory 为 Agent 提供企业级的长期记忆管理能力。通过统一接口对接主流记忆库框架mem0、Viking 等帮助 Agent 实现跨会话的上下文感知、个性化交互和持续学习与演进。https://www.volcengine.com/docs/86681/1844843?langzhLetta (原 MemGPT)借鉴操作系统内存管理思想让 Agent 将上下文窗口视为有限内存通过自主调用 “记忆工具” 实现管理支持跨会话的持久化。作为记忆领域的元老级框架它更具系统架构层面的灵活性GitHubhttps://github.com/letta‑ai/letta官网https://www.letta.comMemOS从 “操作系统” 高度管理 AI 记忆的全栈框架将记忆提升为一级计算资源采用分层架构实现统一调度、更新与演化https://github.com/MemTensor/MemOS大致说明Mem0社区成熟、开箱即用自带记忆增删改查论文 / 毕业设计首选。LettaMemGPT/MemOS主打分层内存管理思想和三层记忆架构理论契合度最高适合做架构分析、原理研究。LangMem仅限 LangChain/LangGraph 项目生态绑定强。Zep优势是时序知识图谱适合带有时间线记忆场景。TencentDB / PolarDB / AgentKit Memory云厂商商用服务适合企业开发不适合本地部署实验。8.实战-Mem0记忆体验1. 登录mem0官⽹(Mem0 - AI Memory Layer for your Agents Apps | Persistent Context)2. 点击Start For Free进⾏注册3. 我们可以使⽤⾕歌账号或者⾃⼰的邮箱完成这是登陆后的界面点击dashboard的页面表示我们发了多少请求因为我是第一次注册所以requets显示为0点击docs点击API reference有各种各样的记忆4. 进⼊后我们点击Playground5. 我们进⼊⼀个体验环境6. 我们输⼊下⾯的提示词我叫hjq。我每天下午17:00有个内部沟通会议给我⼀个会议模板参考点击add memories:点击search memories:可以看到回复信息