1. 引言大语言模型LLM驱动的 Agent 在复杂任务中展现出卓越能力但受限于上下文窗口与单轮推理范式难以在长周期、多轮次的交互中维持稳定一致的记忆。Memory记忆机制由此成为 Agent 领域的前沿研究方向。本文以中医诊断这一典型的长周期、强领域依赖场景为切入点系统梳理 Memory 科研的问题定义、数据构建、对比实验设计与参考文献旨在为研究者提供一套可复现、可扩展的实验框架。2. Memory 科研要解决的核心问题2.1 记忆的存储与组织Agent 需要将对话历史、用户画像、领域知识等多源信息进行结构化存储。其核心问题可归纳为以下三个层面记忆的表示形式自然语言摘要、向量嵌入、知识图谱三元组还是结构化槽位不同表示在可解释性、可扩展性与检索效率上各有取舍。记忆的分层短期记忆当前会话与长期记忆跨会话如何划分与协同记忆的索引与检索如何在海量记忆中快速、精准地定位与当前问题相关的片段### 2.2 记忆的写入与更新写入时机每轮对话后、任务完成后还是达到特定阈值后触发写入冗余与冲突消解同一事实多次出现时如何合并去重矛盾信息如何取舍遗忘机制过时或错误信息如何被淘汰或修正以保持记忆的时效性### 2.3 记忆的检索与利用检索策略基于向量相似度、基于规则、基于 LLM 自主判断还是混合策略检索粒度返回整段记忆、关键句子还是结构化事实注入方式检索结果如何注入 Prompt——直接拼接、重排后拼接还是作为工具调用结果### 2.4 记忆的评估记忆本身的质量准确性、完整性、时效性如何度量记忆对下游任务的影响加入记忆后诊断准确率、用户满意度是否提升记忆评估指标速查表如下指标类别具体指标计算公式数据来源建议评估方式准确性记忆准确率准确率 正确记忆数 / 总记忆数人工标注专家核对记忆与事实的一致性离线评测准确性事实一致性一致性 与金标准一致的事实数 / 总事实数自动比对与病历金标准字段对齐离线评测完整性记忆覆盖率覆盖率 已捕获关键信息数 / 应捕获关键信息总数人工标注对照预设关键信息清单离线评测完整性信息召回率召回率 检索到的相关记忆数 / 全部相关记忆数自动比对与标注的相关记忆集合比对离线评测时效性记忆新鲜度新鲜度 1 - 过时记忆数 / 总记忆数人工标注专家判断记忆是否过时离线评测时效性更新及时率及时率 按时更新的记忆数 / 应更新记忆总数自动比对对比复诊记录与记忆更新时间戳离线评测对下游任务影响诊断准确率增益增益 带记忆诊断准确率 - 无记忆诊断准确率自动计算对比实验输出与金标准在线 A/B 测试对下游任务影响用户满意度满意度 满意评价数 / 总评价数用户反馈患者/医师问卷评分在线 A/B 测试针对上述核心问题可采用的算法与方案如下核心问题可选算法/方案说明记忆的表示形式向量嵌入Sentence-BERT、OpenAI Embedding、知识图谱三元组TransE、RotatE、结构化槽位JSON Schema文本语义用向量领域关系用图谱结构化事实用槽位记忆的分层分层记忆网络Hierarchical Memory Network、短期/长期双缓冲池短期存会话上下文长期存跨会话事实按重要性迁移记忆的索引与检索稠密向量检索DPR、Contriever、BM25 稀疏检索、混合检索RRF 融合、图检索GraphRAG向量召回语义相似片段图谱检索结构化关系记忆的写入与更新增量式写入append-only 去重、LLM 摘要压缩MapReduce、冲突消解置信度投票、时间戳优先新事实追加重复合并矛盾按时间与置信度取舍遗忘机制时效衰减指数衰减权重、基于访问频率的 LRU 淘汰、LLM 定期重写压缩过时记忆降权或删除保持记忆新鲜度记忆的检索与利用RAG检索-增强生成、ReAct推理-行动循环、Reflexion反思-重试检索结果注入 PromptAgent 依据记忆推理与行动3. 中医诊断场景下的 Memory 科研设计3.1 场景特点与科研切入点中医诊断强调「望闻问切」四诊合参且诊疗过程往往跨越多次复诊。这为 Memory 科研提供了独特场景长期性患者多次就诊需要跨会话记忆既往症状、方剂与疗效。多模态舌象、脉象、面色等非文本信息需要与文本记忆关联。领域知识中医辨证论治体系八纲辨证、脏腑辨证等可作为结构化记忆骨架。个性化不同体质、不同证型的患者需要差异化记忆策略。3.2 可研究的 Memory 子问题子问题具体研究点对应 Memory 环节患者画像构建从首诊对话中抽取体质、既往史、过敏史写入与组织复诊记忆召回跨会话检索既往症状与方剂避免重复问诊检索与利用证型演化追踪记录证型随治疗的变化支持动态辨证更新与遗忘四诊信息融合将舌象/脉象描述与文本主诉关联存储多模态记忆记忆冲突消解患者自述与客观检查不一致时如何取舍更新与修正下面以「风寒束肺证」为例展示如何将中医辨证论治体系构建为知识图谱作为 Graph-Memory 的结构化骨架表现为表现为表现为舌象脉象治则主方加减风寒束肺证咳嗽痰白清稀畏寒发热舌淡红、苔薄白脉浮紧辛温解表、宣肺散寒麻黄汤杏仁、桂枝、甘草该图谱以「风寒束肺证」为中心节点通过「表现为」「舌象」「脉象」「治则」「主方」「加减」等关系边将症状、舌象、脉象、方剂等实体组织为三元组结构。作为 Graph-Memory 的结构化骨架它带来三点收益可推理图谱支持沿关系边进行多跳推理例如从「脉浮紧 舌淡红苔薄白」反推「风寒束肺证」再沿「治则」边定位到「麻黄汤」实现辨证到方剂的自动推导。可更新患者复诊时新增的症状或方剂调整只需在对应节点上增删关系边即可完成记忆更新避免整段重写。可检索图谱天然支持按实体或关系检索比纯向量检索更精准能直接回答「该患者既往用过哪些方剂」「证型如何演化」等结构化问题。4. 需要的数据4.1 数据来源公开中医病历数据集如 TCM 电子病历、中医临床科研数据平台。自建模拟数据基于中医教材如《中医诊断学》构造标准化病人对话。真实脱敏数据与医院合作获取脱敏后的门诊记录需伦理审批。4.2 数据字段设计字段说明示例patient_id患者唯一标识P001visit_id就诊序号V1, V2, V3timestamp就诊时间2026-03-01symptoms主诉与症状描述咳嗽、痰白、畏寒tongue舌象描述舌淡红、苔薄白pulse脉象描述脉浮紧diagnosis辨证结果风寒束肺证prescription方剂与用药麻黄汤加减follow_up复诊反馈服药后咳嗽减轻4.3 数据规模建议冷启动阶段500–1000 条模拟对话用于机制验证。完整实验5000 条以上多轮对话覆盖至少 10 种常见证型。每例患者至少 3 次就诊记录以支撑跨会话记忆实验。5. 对比实验设计5.1 基线方法方法说明No-Memory每次诊断仅基于当前对话无历史记忆Full-Context将所有历史对话全部拼入上下文受窗口限制Vector-Retrieval用向量检索召回 Top-K 历史片段Summary-Memory用 LLM 生成历史摘要后注入Graph-Memory用知识图谱存储患者事实与证型关系5.2 实验维度诊断准确率辨证结果与金标准的一致性精确率、召回率、F1。信息利用率诊断过程中是否有效利用了既往史可设计「必须依赖既往史才能正确辨证」的测试样本。效率指标Token 消耗、推理延迟、检索耗时。鲁棒性记忆噪声错误历史对诊断的影响。消融实验分别去掉记忆写入、检索、更新模块观察性能变化。消融实验设计如下消融设置去除模块预期影响的指标实验目的去掉记忆写入记忆写入模块诊断准确率下降 5%–10%Token 消耗略降无需写入开销验证记忆写入对跨会话信息积累的必要性去掉记忆检索记忆检索模块诊断准确率下降 10%–15%信息利用率显著降低Token 消耗上升需拼接全部历史验证检索机制对精准召回既往史的关键作用去掉记忆更新记忆更新/遗忘模块诊断准确率下降 3%–8%记忆冗余与冲突增多鲁棒性下降验证更新与遗忘机制对保持记忆时效性和一致性的贡献完整系统无保留全部模块作为基准诊断准确率最高Token 消耗与延迟处于合理区间作为对照衡量各模块的边际收益5.3 实验流程构造测试集每例患者含首诊与多次复诊标注金标准辨证。对每种方法运行完整诊断流程记录输出。计算指标并做显著性检验如配对 t 检验或 Wilcoxon 检验。人工评估由中医专家对诊断理由的合理性打分。下面是完整的实验流程图通过不通过构造测试集基线方法运行指标计算显著性检验专家评估输出实验结果各步骤的输入输出说明如下构造测试集输入为原始病历数据含首诊与多次复诊记录输出为带金标准辨证标注的测试集每例患者至少包含 3 次就诊记录。基线方法运行输入为测试集与各基线方法No-Memory、Full-Context、Vector-Retrieval、Summary-Memory、Graph-Memory输出为每种方法在每例患者上的诊断结果。指标计算输入为各方法的诊断输出与金标准输出为诊断准确率、信息利用率、Token 消耗等指标。显著性检验输入为各方法的指标结果通过配对 t 检验或 Wilcoxon 检验判断差异是否显著若不显著则回到基线方法运行环节排查问题。专家评估输入为通过显著性检验的诊断结果由中医专家对诊断理由的合理性打分最终输出实验结果。6. 参考文献与链接以下文献覆盖 Memory 机制、RAG、Agent 记忆与医疗 AI 方向可作为实验设计与论文写作的支撑Park et al., “Generative Agents: Interactive Simulacra of Human Behavior”生成式 Agent 的记忆流与反思机制链接https://arxiv.org/abs/2304.03442Lewis et al., “Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks”RAG 基础框架链接https://arxiv.org/abs/2005.11401Zhong et al., “MemoryBank: Enhancing Large Language Models with Long-Term Memory”长期记忆银行与遗忘机制链接https://arxiv.org/abs/2305.10250Modarressi et al., “RET-LLM: Towards a General Read-Write Memory for LLMs”通用读写记忆链接https://arxiv.org/abs/2305.14322Wang et al., “Unleashing the Power of LLMs in Medical Diagnosis”LLM 在医疗诊断中的应用链接https://arxiv.org/abs/2405.16469Zhang et al., “HuatuoGPT: Towards Medical Dialogue Generation”中医/医疗对话生成链接https://arxiv.org/abs/2305.15075Yao et al., “ReAct: Synergizing Reasoning and Acting in Language Models”Agent 推理与行动结合链接https://arxiv.org/abs/2210.03629Shinn et al., “Reflexion: Language Agents with Verbal Reinforcement Learning”反思机制与记忆更新相关链接https://arxiv.org/abs/2303.11366Borgeaud et al., “Improving Language Models by Retrieving from Trillions of Tokens”大规模检索增强链接https://arxiv.org/abs/2112.04426Khattab et al., “Dense Passage Retrieval for Open-Domain Question Answering”稠密检索基础链接https://arxiv.org/abs/2004.049067. 实验落地建议先跑通 No-Memory 与 Vector-Retrieval 两个基线确认数据与评估管线可用。再逐步加入 Summary-Memory 与 Graph-Memory对比记忆表示形式的影响。中医场景建议引入专家标注的辨证金标准并让中医师参与人工评估。若资源有限可先用模拟数据完成机制验证再申请真实脱敏数据做最终实验。8. 总结Agent 的 Memory 科研可从存储、写入、检索、评估四个环节切入中医诊断场景提供了长期性、多模态、领域知识丰富的天然实验场。通过设计清晰的对比实验与消融实验并借助上述参考文献可以形成完整且可复现的研究闭环。
阅读完成 · 觉得有帮助?