一个客服 Agent用户第三轮说我之前说的那个订单Agent 完全不知道那个订单是什么——因为前两轮的对话已经被截断了而且没有做情景摘要。阅读提示适合谁看理解了推理模式和工具调用看完前两篇、现在要解决怎么让 Agent 记住上下文和历史知识的工程师看完能做什么设计三层记忆架构、实现记忆压缩、选择合适的检索策略不适合谁还没理解推理和工具调用的读者先看前两篇先给结论**Agent 的记忆不是把历史消息塞进上下文窗口**——上下文窗口是短期记忆但 Agent 还需要长期记忆知识库和情景记忆历史交互摘要**记忆系统的核心矛盾是检索精度 vs 上下文长度**——塞太多记忆会稀释关键信息塞太少会丢掉重要上下文记忆写入比记忆检索更难——什么时候该存、存什么格式、怎么去重和更新这些问题比怎么检索更关键01 三种记忆类型图 1Agent 三层记忆架构短期记忆上下文窗口当前对话的完整上下文。受 token 上限限制比如 4K / 8K / 128K。对话结束后丢失。长期记忆向量库 知识图谱持久化存储支持语义检索。跨对话保留。存的是事实和知识。情景记忆交互摘要 决策记录历史对话的压缩版本。保留关键决策点和上下文但丢弃冗余细节。跨对话保留。存的是经历和判断。三者的关系短期记忆满了 → 压缩成情景记忆情景记忆积累多了 → 提取关键事实存入长期记忆新对话开始 → 从长期记忆和情景记忆检索相关上下文注入短期记忆02 短期记忆token 预算分配上下文窗口是有限的。怎么在有限的 token 里最大化信息密度推荐的 token 预算分配组件占比说明System Prompt20%角色定义、行为约束、输出格式工具描述15%注册的工具列表和参数 Schema历史消息50%对话历史最新的优先用户输入15%当前轮的用户问题历史消息的截断策略滑动窗口只保留最近 N 轮对话简单但会丢失早期重要信息重要性排序根据消息的重要性是否包含决策、是否被引用选择保留摘要替换把早期对话压缩成摘要替换原始消息03 长期记忆向量检索 vs BM25 vs 混合检索图 2记忆检索策略对比向量检索用 embedding 模型把记忆和查询都转成向量计算余弦相似度。优点语义理解能力强“用户投诉能匹配到客户不满”缺点精确关键词匹配弱订单号 12345可能匹配不到BM25 关键词检索基于词频-逆文档频率的统计方法。优点精确关键词匹配强速度快缺点语义理解弱“投诉匹配不到不满”混合检索推荐向量 BM25 加权融合。def hybrid_retrieve(query, vector_store, bm25_index, alpha0.7): # 向量检索 vector_results vector_store.search(query, top_k20) # BM25 检索 bm25_results bm25_index.search(query, top_k20) # 加权融合 combined {} for r in vector_results: combined[r.id] alpha * r.score for r in bm25_results: combined[r.id] combined.get(r.id, 0) (1 - alpha) * r.score return sorted(combined.items(), keylambda x: -x[1])[:10]04 情景记忆压缩时机和摘要粒度什么时候该压缩token 使用超过 80%触发压缩把早期对话摘要化对话结束时把整轮对话的关键信息提取出来存入情景记忆关键决策点用户做出了重要选择比如就选方案 A立即记录摘要的 Prompt 模板请将以下对话压缩为结构化摘要保留1. 用户的核心需求和偏好2. 做出的关键决策及其原因3. 未解决的问题和待办事项4. 重要的事实信息数字、日期、名称丢弃- 寒暄和无关对话- 已经被后续消息覆盖的信息- 重复的确认对话对话历史{history}输出格式{ user_needs: ..., key_decisions: [...], open_questions: [...], important_facts: [...]}在我们的项目里情景记忆的压缩比约 10:11000 token 的对话压缩成 100 token 的摘要但关键决策点的保留率要保证 95% 以上。05 记忆写入去重 / 更新 / 过期去重相似记忆合并。用户在第 2 轮说我喜欢红色第 5 轮说我偏好红色和蓝色——应该合并为一条用户偏好红色、蓝色而不是存两条。更新旧信息覆盖。用户第 1 轮说我的地址是北京第 3 轮说我搬到上海了——应该更新为用户地址上海。过期时间衰减。三个月前的对话细节可能已经不重要了降低检索权重。优先级重要记忆保留。包含决策、数字、名称的记忆比一般对话更重要。06 最小实验三层记忆 vs 只有短期记忆实验设计一个客服 Agent用户连续对话 10 轮对比两种配置的回答质量。只有短期记忆滑动窗口 5 轮第 6 轮开始用户说我之前说的那个订单——Agent 不知道是哪个订单第 10 轮用户说按之前的方案处理——Agent 完全不知道之前的方案有三层记忆第 6 轮Agent 从情景记忆检索到用户在第 2 轮提到订单号 12345第 10 轮Agent 从情景记忆检索到第 4 轮确定的方案退款 补发效果差异在 10 轮对话中有三层记忆的 Agent 回答准确率约 88%只有短期记忆的约 62%。07 边界什么场景不需要复杂记忆系统单轮任务用户问一句、Agent 答一句不需要记忆系统。比如翻译这段话、“计算这个公式”。无状态服务每次请求独立处理不需要跨请求记忆。比如批量分类 100 条文本。上下文窗口足够大如果模型支持 128K 上下文且对话轮数不超过 20 轮短期记忆就够了。08 给读者一个能用来做决策的结论决策帮助如果你的对话轮数 10 轮短期记忆滑动窗口就够了不需要复杂记忆系统如果你的对话轮数 10 轮加情景记忆压缩摘要解决早期对话被截断问题如果你的Agent 需要跨对话记忆加长期记忆向量库存储用户偏好和历史事实如果你只能先做一步实现一个 token 超 80% 时自动压缩历史的机制——这一步能解决 80% 的记忆丢失问题学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
Agent 的记忆系统:短期、长期、情景记忆怎么设计
一个客服 Agent用户第三轮说我之前说的那个订单Agent 完全不知道那个订单是什么——因为前两轮的对话已经被截断了而且没有做情景摘要。阅读提示适合谁看理解了推理模式和工具调用看完前两篇、现在要解决怎么让 Agent 记住上下文和历史知识的工程师看完能做什么设计三层记忆架构、实现记忆压缩、选择合适的检索策略不适合谁还没理解推理和工具调用的读者先看前两篇先给结论**Agent 的记忆不是把历史消息塞进上下文窗口**——上下文窗口是短期记忆但 Agent 还需要长期记忆知识库和情景记忆历史交互摘要**记忆系统的核心矛盾是检索精度 vs 上下文长度**——塞太多记忆会稀释关键信息塞太少会丢掉重要上下文记忆写入比记忆检索更难——什么时候该存、存什么格式、怎么去重和更新这些问题比怎么检索更关键01 三种记忆类型图 1Agent 三层记忆架构短期记忆上下文窗口当前对话的完整上下文。受 token 上限限制比如 4K / 8K / 128K。对话结束后丢失。长期记忆向量库 知识图谱持久化存储支持语义检索。跨对话保留。存的是事实和知识。情景记忆交互摘要 决策记录历史对话的压缩版本。保留关键决策点和上下文但丢弃冗余细节。跨对话保留。存的是经历和判断。三者的关系短期记忆满了 → 压缩成情景记忆情景记忆积累多了 → 提取关键事实存入长期记忆新对话开始 → 从长期记忆和情景记忆检索相关上下文注入短期记忆02 短期记忆token 预算分配上下文窗口是有限的。怎么在有限的 token 里最大化信息密度推荐的 token 预算分配组件占比说明System Prompt20%角色定义、行为约束、输出格式工具描述15%注册的工具列表和参数 Schema历史消息50%对话历史最新的优先用户输入15%当前轮的用户问题历史消息的截断策略滑动窗口只保留最近 N 轮对话简单但会丢失早期重要信息重要性排序根据消息的重要性是否包含决策、是否被引用选择保留摘要替换把早期对话压缩成摘要替换原始消息03 长期记忆向量检索 vs BM25 vs 混合检索图 2记忆检索策略对比向量检索用 embedding 模型把记忆和查询都转成向量计算余弦相似度。优点语义理解能力强“用户投诉能匹配到客户不满”缺点精确关键词匹配弱订单号 12345可能匹配不到BM25 关键词检索基于词频-逆文档频率的统计方法。优点精确关键词匹配强速度快缺点语义理解弱“投诉匹配不到不满”混合检索推荐向量 BM25 加权融合。def hybrid_retrieve(query, vector_store, bm25_index, alpha0.7): # 向量检索 vector_results vector_store.search(query, top_k20) # BM25 检索 bm25_results bm25_index.search(query, top_k20) # 加权融合 combined {} for r in vector_results: combined[r.id] alpha * r.score for r in bm25_results: combined[r.id] combined.get(r.id, 0) (1 - alpha) * r.score return sorted(combined.items(), keylambda x: -x[1])[:10]04 情景记忆压缩时机和摘要粒度什么时候该压缩token 使用超过 80%触发压缩把早期对话摘要化对话结束时把整轮对话的关键信息提取出来存入情景记忆关键决策点用户做出了重要选择比如就选方案 A立即记录摘要的 Prompt 模板请将以下对话压缩为结构化摘要保留1. 用户的核心需求和偏好2. 做出的关键决策及其原因3. 未解决的问题和待办事项4. 重要的事实信息数字、日期、名称丢弃- 寒暄和无关对话- 已经被后续消息覆盖的信息- 重复的确认对话对话历史{history}输出格式{ user_needs: ..., key_decisions: [...], open_questions: [...], important_facts: [...]}在我们的项目里情景记忆的压缩比约 10:11000 token 的对话压缩成 100 token 的摘要但关键决策点的保留率要保证 95% 以上。05 记忆写入去重 / 更新 / 过期去重相似记忆合并。用户在第 2 轮说我喜欢红色第 5 轮说我偏好红色和蓝色——应该合并为一条用户偏好红色、蓝色而不是存两条。更新旧信息覆盖。用户第 1 轮说我的地址是北京第 3 轮说我搬到上海了——应该更新为用户地址上海。过期时间衰减。三个月前的对话细节可能已经不重要了降低检索权重。优先级重要记忆保留。包含决策、数字、名称的记忆比一般对话更重要。06 最小实验三层记忆 vs 只有短期记忆实验设计一个客服 Agent用户连续对话 10 轮对比两种配置的回答质量。只有短期记忆滑动窗口 5 轮第 6 轮开始用户说我之前说的那个订单——Agent 不知道是哪个订单第 10 轮用户说按之前的方案处理——Agent 完全不知道之前的方案有三层记忆第 6 轮Agent 从情景记忆检索到用户在第 2 轮提到订单号 12345第 10 轮Agent 从情景记忆检索到第 4 轮确定的方案退款 补发效果差异在 10 轮对话中有三层记忆的 Agent 回答准确率约 88%只有短期记忆的约 62%。07 边界什么场景不需要复杂记忆系统单轮任务用户问一句、Agent 答一句不需要记忆系统。比如翻译这段话、“计算这个公式”。无状态服务每次请求独立处理不需要跨请求记忆。比如批量分类 100 条文本。上下文窗口足够大如果模型支持 128K 上下文且对话轮数不超过 20 轮短期记忆就够了。08 给读者一个能用来做决策的结论决策帮助如果你的对话轮数 10 轮短期记忆滑动窗口就够了不需要复杂记忆系统如果你的对话轮数 10 轮加情景记忆压缩摘要解决早期对话被截断问题如果你的Agent 需要跨对话记忆加长期记忆向量库存储用户偏好和历史事实如果你只能先做一步实现一个 token 超 80% 时自动压缩历史的机制——这一步能解决 80% 的记忆丢失问题学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】