Day 30对话中的短期记忆管理 —— 让 Agent 记住上下文欢迎来到第三十天在构建多轮对话的 Agent 时如何有效管理对话历史是一个核心问题。如果将所有历史消息原封不动地发送给模型Token 消耗会迅速膨胀甚至超出上下文窗口。今天我们将学习两种经典的短期记忆管理策略Buffer Memory缓冲记忆和Summary Memory摘要记忆并通过实验对比它们在 Token 消耗和信息保留方面的差异。这将为后续构建带长期记忆的客服 Agent 打下基础。一、今日学习目标理解短期记忆在多轮对话中的重要性模型需要记住之前的对话内容才能做出连贯回复。掌握 LangChain 中ConversationBufferMemory和ConversationSummaryMemory的使用方法。学会在对话链中集成记忆组件实现有状态的聊天机器人。通过实验对比不同记忆策略的 Token 消耗和信息保留能力。了解如何手动管理消息列表裁剪、摘要以实现自定义的短期记忆。二、详细实现步骤步骤 1理解短期记忆的本质在纯 API 调用中多轮对话是通过维护一个消息列表messages来实现的。每轮对话时需要将完整的历史消息或适当裁剪后的历史发送给模型。短期记忆管理的核心问题就是如何存储和利用对话历史同时控制 Token 消耗。LangChain 提供了多种记忆组件可以自动管理这些历史消息并与链无缝集成。今天重点介绍两种ConversationBufferMemory简单地将所有历史消息保存在缓冲区中每轮对话时完整地发送给模型。优点是信息完整缺点是 Token 消耗随对话轮数线性增长容易超出上下文窗口。ConversationSummaryMemory使用 LLM 将历史对话压缩成一段简短的摘要每轮只发送摘要而不是完整历史。优点是 Token 消耗稳定缺点是会丢失细节信息。步骤 2环境准备确保已安装langchain、langchain-openai。如果尚未安装执行pipinstalllangchain langchain-openai新建short_term_memory_demo.py导入所需模块importosfromdotenvimportload_dotenvfromlangchain_openaiimportChatOpenAIfromlangchain.memoryimportConversationBufferMemory,ConversationSummaryMemoryfromlangchain.chainsimportConversationChainfromlangchain_core.promptsimportChatPromptTemplate,MessagesPlaceholder load_dotenv()llmChatOpenAI(modeldeepseek-chat,api_keyos.getenv(DEEPSEEK_API_KEY),base_urlhttps://api.deepseek.com,temperature0.7)步骤 3使用 ConversationBufferMemoryConversationBufferMemory会存储所有对话消息。我们可以将其插入到一个带有MessagesPlaceholder的提示词模板中然后构建ConversationChain。# 创建缓冲记忆buffer_memoryConversationBufferMemory(return_messagesTrue)# 定义提示词模板包含历史消息占位符prompt_templateChatPromptTemplate.from_messages([(system,你是一个友好的聊天机器人。),MessagesPlaceholder(variable_namehistory),(human,{input})])# 创建对话链buffer_chainConversationChain(llmllm,memorybuffer_memory,promptprompt_template,verboseTrue# 打印详细过程便于观察)# 进行几轮对话print( ConversationBufferMemory 对话 )response1buffer_chain.invoke({input:我叫小明我喜欢打篮球。})print(AI:,response1[response])response2buffer_chain.invoke({input:你还记得我叫什么吗})print(AI:,response2[response])response3buffer_chain.invoke({input:我刚才说我喜欢什么运动})print(AI:,response3[response])观察输出模型能够准确记住用户的名字和喜好。同时verboseTrue会打印每次发送给模型的完整提示词你会看到历史消息被完整地包含在history中。步骤 4检查 Token 消耗我们可以通过回调或手动查看消息长度来估算 Token 消耗。为了简单我们可以在对话后访问buffer_memory.chat_memory.messages查看历史消息。print(\n缓冲记忆中的消息数,len(buffer_memory.chat_memory.messages))formsginbuffer_memory.chat_memory.messages:print(f{msg.type}:{msg.content})随着对话轮数增加消息列表会越来越长Token 消耗也随之增加。步骤 5使用 ConversationSummaryMemoryConversationSummaryMemory会使用 LLM 将历史对话总结成一段摘要并在后续对话中只发送摘要而不是完整历史。# 创建摘要记忆summary_memoryConversationSummaryMemory(llmllm,return_messagesTrue,max_token_limit100# 摘要的最大 Token 数可选)# 定义提示词模板历史部分使用摘要summary_prompt_templateChatPromptTemplate.from_messages([(system,你是一个友好的聊天机器人。),MessagesPlaceholder(variable_namehistory),(human,{input})])summary_chainConversationChain(llmllm,memorysummary_memory,promptsummary_prompt_template,verboseTrue)# 进行同样的对话print(\n ConversationSummaryMemory 对话 )response1summary_chain.invoke({input:我叫小明我喜欢打篮球。})print(AI:,response1[response])response2summary_chain.invoke({input:你还记得我叫什么吗})print(AI:,response2[response])response3summary_chain.invoke({input:我刚才说我喜欢什么运动})print(AI:,response3[response])观察输出模型仍然能够回答正确因为摘要保留了关键信息名字和爱好。但此时发送给模型的历史部分不再是完整的对话而是一段摘要文本。你可以通过verboseTrue看到提示词中的history是一段总结而不是多条消息。步骤 6对比 Token 消耗我们可以粗略计算两种记忆策略下的 Token 消耗。由于verboseTrue会打印提示词但为了自动化我们可以访问记忆中的内容并计算 Token。# 计算缓冲记忆的总 Token近似fromlangchain_core.messagesimportHumanMessage,AIMessageimporttiktoken enctiktoken.get_encoding(cl100k_base)defcount_tokens_in_messages(messages):total0formsginmessages:totallen(enc.encode(msg.content))returntotal buffer_tokenscount_tokens_in_messages(buffer_memory.chat_memory.messages)print(f\n缓冲记忆中的 Token 数{buffer_tokens})# 查看摘要记忆中的历史通常是摘要字符串summary_historysummary_memory.chat_memory.messages summary_tokenscount_tokens_in_messages(summary_history)print(f摘要记忆中的 Token 数{summary_tokens})通常摘要记忆的 Token 数远小于缓冲记忆特别是在多轮对话后。步骤 7手动实现对话历史裁剪可选进阶除了使用 LangChain 的记忆组件你也可以手动管理消息列表实现更灵活的裁剪策略。例如只保留最近 N 条消息或者当 Token 超过阈值时自动总结前文。以下是一个简单的手动裁剪函数deftrim_messages(messages,max_tokens2000):保留最近的消息使总 Token 数不超过 max_tokensenctiktoken.get_encoding(cl100k_base)total0trimmed[]# 从后往前累加直到接近上限formsginreversed(messages):msg_tokenslen(enc.encode(msg.content))iftotalmsg_tokensmax_tokens:breaktrimmed.insert(0,msg)totalmsg_tokensreturntrimmed你可以使用这个函数在每轮对话前裁剪消息列表控制 Token 消耗。三、常见问题与调试Q1ConversationBufferMemory在多轮对话后 Token 超限怎么办→ 可以使用ConversationBufferWindowMemory只保留最近 K 轮对话或者使用摘要记忆。也可以手动实现滑动窗口裁剪。Q2ConversationSummaryMemory的摘要是否准确→ 摘要质量取决于 LLM 的能力和max_token_limit的设置。如果摘要过于简短可能会丢失重要细节。你可以调整max_token_limit或使用自定义摘要提示词。Q3如何同时保留最近几轮完整对话和早期摘要→ 可以使用混合策略保留最近 N 轮完整消息同时对更早的消息进行摘要。这需要自定义记忆组件但 LangChain 的ConversationSummaryBufferMemory正是为此设计它结合了缓冲和摘要保留最近的消息并总结更早的内容。Q4记忆组件在多用户场景下如何处理→ 每个用户应有独立的记忆实例。在实际应用中可以使用数据库存储会话状态根据用户 ID 加载对应的记忆。LangChain 提供了多种集成如RedisChatMessageHistory、SQLChatMessageHistory等可以将消息持久化到外部存储。Q5在 Agent 中记忆是如何与工具调用结合的→ 在后续课程中我们会使用AgentExecutor结合记忆组件使 Agent 在多轮对话中记住之前的工具调用结果和用户上下文。通常做法是将记忆作为memory参数传入AgentExecutor或者在每次调用时手动将历史消息添加到输入中。Q6Token 计算不准确怎么办→ 使用tiktoken的cl100k_base编码对 DeepSeek 模型是近似估算。更精确的计算可以使用 DeepSeek 官方提供的 Token 计算工具如果有。在实际项目中通常使用 API 返回的usage字段来精确统计。四、今日总结与作业今天你完成了✅ 理解了短期记忆在多轮对话中的作用。✅ 使用ConversationBufferMemory实现了带记忆的聊天机器人。✅ 使用ConversationSummaryMemory实现了基于摘要的记忆并对比了 Token 消耗。✅ 学习了手动裁剪消息列表的方法。✅ 了解了混合记忆策略如ConversationSummaryBufferMemory的概念。今日作业必做使用ConversationBufferWindowMemory只保留最近 2 轮对话重新实现聊天机器人观察它在多轮对话中的表现并计算 Token 消耗。尝试使用ConversationSummaryBufferMemory设置max_token_limit50进行多轮对话至少 5 轮观察摘要如何动态更新以及模型能否记住早期信息。编写一个函数manage_memory(messages, strategy, max_tokens)根据参数选择不同策略buffer、summary、window来管理消息列表并返回处理后的消息列表。测试不同策略的效果。思考题在构建带记忆的客服 Agent 时你会选择哪种记忆策略为什么请结合客服场景的特点如需要记住用户订单号、历史投诉等进行说明。明日预告我们将构建一个带记忆的聊天机器人结合 RAG 和记忆组件实现一个能记住用户偏好并基于知识库回答的智能助手。请做好准备有任何问题欢迎随时提问
阅读完成 · 觉得有帮助?