Agent 的 Memory 怎么做科研:以中医诊断场景为例

1. 引言

大语言模型(LLM)驱动的 Agent 在复杂任务中展现出卓越能力,但受限于上下文窗口与单轮推理范式,难以在长周期、多轮次的交互中维持稳定一致的记忆。Memory(记忆)机制由此成为 Agent 领域的前沿研究方向。本文以中医诊断这一典型的长周期、强领域依赖场景为切入点,系统梳理 Memory 科研的问题定义、数据构建、对比实验设计与参考文献,旨在为研究者提供一套可复现、可扩展的实验框架。

2. Memory 科研要解决的核心问题

2.1 记忆的存储与组织

Agent 需要将对话历史、用户画像、领域知识等多源信息进行结构化存储。其核心问题可归纳为以下三个层面:

  • 记忆的表示形式:自然语言摘要、向量嵌入、知识图谱三元组,还是结构化槽位?不同表示在可解释性、可扩展性与检索效率上各有取舍。

  • 记忆的分层:短期记忆(当前会话)与长期记忆(跨会话)如何划分与协同?

  • 记忆的索引与检索:如何在海量记忆中快速、精准地定位与当前问题相关的片段?### 2.2 记忆的写入与更新

  • 写入时机:每轮对话后、任务完成后,还是达到特定阈值后触发写入?

  • 冗余与冲突消解:同一事实多次出现时如何合并去重,矛盾信息如何取舍?

  • 遗忘机制:过时或错误信息如何被淘汰或修正,以保持记忆的时效性?### 2.3 记忆的检索与利用

  • 检索策略:基于向量相似度、基于规则、基于 LLM 自主判断,还是混合策略?

  • 检索粒度:返回整段记忆、关键句子,还是结构化事实?

  • 注入方式:检索结果如何注入 Prompt------直接拼接、重排后拼接,还是作为工具调用结果?### 2.4 记忆的评估

  • 记忆本身的质量:准确性、完整性、时效性如何度量?

  • 记忆对下游任务的影响:加入记忆后,诊断准确率、用户满意度是否提升?

记忆评估指标速查表如下:

指标类别 具体指标 计算公式 数据来源 建议评估方式
准确性 记忆准确率 准确率 = 正确记忆数 / 总记忆数 人工标注(专家核对记忆与事实的一致性) 离线评测
准确性 事实一致性 一致性 = 与金标准一致的事实数 / 总事实数 自动比对(与病历金标准字段对齐) 离线评测
完整性 记忆覆盖率 覆盖率 = 已捕获关键信息数 / 应捕获关键信息总数 人工标注(对照预设关键信息清单) 离线评测
完整性 信息召回率 召回率 = 检索到的相关记忆数 / 全部相关记忆数 自动比对(与标注的相关记忆集合比对) 离线评测
时效性 记忆新鲜度 新鲜度 = 1 - 过时记忆数 / 总记忆数 人工标注(专家判断记忆是否过时) 离线评测
时效性 更新及时率 及时率 = 按时更新的记忆数 / 应更新记忆总数 自动比对(对比复诊记录与记忆更新时间戳) 离线评测
对下游任务影响 诊断准确率增益 增益 = 带记忆诊断准确率 - 无记忆诊断准确率 自动计算(对比实验输出与金标准) 在线 A/B 测试
对下游任务影响 用户满意度 满意度 = 满意评价数 / 总评价数 用户反馈(患者/医师问卷评分) 在线 A/B 测试

针对上述核心问题,可采用的算法与方案如下:

核心问题 可选算法/方案 说明
记忆的表示形式 向量嵌入(Sentence-BERT、OpenAI Embedding)、知识图谱三元组(TransE、RotatE)、结构化槽位(JSON Schema) 文本语义用向量,领域关系用图谱,结构化事实用槽位
记忆的分层 分层记忆网络(Hierarchical Memory Network)、短期/长期双缓冲池 短期存会话上下文,长期存跨会话事实,按重要性迁移
记忆的索引与检索 稠密向量检索(DPR、Contriever)、BM25 稀疏检索、混合检索(RRF 融合)、图检索(GraphRAG) 向量召回语义相似片段,图谱检索结构化关系
记忆的写入与更新 增量式写入(append-only + 去重)、LLM 摘要压缩(MapReduce)、冲突消解(置信度投票、时间戳优先) 新事实追加,重复合并,矛盾按时间与置信度取舍
遗忘机制 时效衰减(指数衰减权重)、基于访问频率的 LRU 淘汰、LLM 定期重写压缩 过时记忆降权或删除,保持记忆新鲜度
记忆的检索与利用 RAG(检索-增强生成)、ReAct(推理-行动循环)、Reflexion(反思-重试) 检索结果注入 Prompt,Agent 依据记忆推理与行动

3. 中医诊断场景下的 Memory 科研设计

3.1 场景特点与科研切入点

中医诊断强调「望闻问切」四诊合参,且诊疗过程往往跨越多次复诊。这为 Memory 科研提供了独特场景:

  • 长期性:患者多次就诊,需要跨会话记忆既往症状、方剂与疗效。
  • 多模态:舌象、脉象、面色等非文本信息需要与文本记忆关联。
  • 领域知识:中医辨证论治体系(八纲辨证、脏腑辨证等)可作为结构化记忆骨架。
  • 个性化:不同体质、不同证型的患者需要差异化记忆策略。

3.2 可研究的 Memory 子问题

子问题 具体研究点 对应 Memory 环节
患者画像构建 从首诊对话中抽取体质、既往史、过敏史 写入与组织
复诊记忆召回 跨会话检索既往症状与方剂,避免重复问诊 检索与利用
证型演化追踪 记录证型随治疗的变化,支持动态辨证 更新与遗忘
四诊信息融合 将舌象/脉象描述与文本主诉关联存储 多模态记忆
记忆冲突消解 患者自述与客观检查不一致时如何取舍 更新与修正

下面以「风寒束肺证」为例,展示如何将中医辨证论治体系构建为知识图谱,作为 Graph-Memory 的结构化骨架:
#mermaid-svg-Y4WhnuCBq63jKbsK{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;fill:#333;}@keyframes edge-animation-frame{from{stroke-dashoffset:0;}}@keyframes dash{to{stroke-dashoffset:0;}}#mermaid-svg-Y4WhnuCBq63jKbsK .edge-animation-slow{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 50s linear infinite;stroke-linecap:round;}#mermaid-svg-Y4WhnuCBq63jKbsK .edge-animation-fast{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 20s linear infinite;stroke-linecap:round;}#mermaid-svg-Y4WhnuCBq63jKbsK .error-icon{fill:#552222;}#mermaid-svg-Y4WhnuCBq63jKbsK .error-text{fill:#552222;stroke:#552222;}#mermaid-svg-Y4WhnuCBq63jKbsK .edge-thickness-normal{stroke-width:1px;}#mermaid-svg-Y4WhnuCBq63jKbsK .edge-thickness-thick{stroke-width:3.5px;}#mermaid-svg-Y4WhnuCBq63jKbsK .edge-pattern-solid{stroke-dasharray:0;}#mermaid-svg-Y4WhnuCBq63jKbsK .edge-thickness-invisible{stroke-width:0;fill:none;}#mermaid-svg-Y4WhnuCBq63jKbsK .edge-pattern-dashed{stroke-dasharray:3;}#mermaid-svg-Y4WhnuCBq63jKbsK .edge-pattern-dotted{stroke-dasharray:2;}#mermaid-svg-Y4WhnuCBq63jKbsK .marker{fill:#333333;stroke:#333333;}#mermaid-svg-Y4WhnuCBq63jKbsK .marker.cross{stroke:#333333;}#mermaid-svg-Y4WhnuCBq63jKbsK svg{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;}#mermaid-svg-Y4WhnuCBq63jKbsK p{margin:0;}#mermaid-svg-Y4WhnuCBq63jKbsK .label{font-family:"trebuchet ms",verdana,arial,sans-serif;color:#333;}#mermaid-svg-Y4WhnuCBq63jKbsK .cluster-label text{fill:#333;}#mermaid-svg-Y4WhnuCBq63jKbsK .cluster-label span{color:#333;}#mermaid-svg-Y4WhnuCBq63jKbsK .cluster-label span p{background-color:transparent;}#mermaid-svg-Y4WhnuCBq63jKbsK .label text,#mermaid-svg-Y4WhnuCBq63jKbsK span{fill:#333;color:#333;}#mermaid-svg-Y4WhnuCBq63jKbsK .node rect,#mermaid-svg-Y4WhnuCBq63jKbsK .node circle,#mermaid-svg-Y4WhnuCBq63jKbsK .node ellipse,#mermaid-svg-Y4WhnuCBq63jKbsK .node polygon,#mermaid-svg-Y4WhnuCBq63jKbsK .node path{fill:#ECECFF;stroke:#9370DB;stroke-width:1px;}#mermaid-svg-Y4WhnuCBq63jKbsK .rough-node .label text,#mermaid-svg-Y4WhnuCBq63jKbsK .node .label text,#mermaid-svg-Y4WhnuCBq63jKbsK .image-shape .label,#mermaid-svg-Y4WhnuCBq63jKbsK .icon-shape .label{text-anchor:middle;}#mermaid-svg-Y4WhnuCBq63jKbsK .node .katex path{fill:#000;stroke:#000;stroke-width:1px;}#mermaid-svg-Y4WhnuCBq63jKbsK .rough-node .label,#mermaid-svg-Y4WhnuCBq63jKbsK .node .label,#mermaid-svg-Y4WhnuCBq63jKbsK .image-shape .label,#mermaid-svg-Y4WhnuCBq63jKbsK .icon-shape .label{text-align:center;}#mermaid-svg-Y4WhnuCBq63jKbsK .node.clickable{cursor:pointer;}#mermaid-svg-Y4WhnuCBq63jKbsK .root .anchor path{fill:#333333!important;stroke-width:0;stroke:#333333;}#mermaid-svg-Y4WhnuCBq63jKbsK .arrowheadPath{fill:#333333;}#mermaid-svg-Y4WhnuCBq63jKbsK .edgePath .path{stroke:#333333;stroke-width:2.0px;}#mermaid-svg-Y4WhnuCBq63jKbsK .flowchart-link{stroke:#333333;fill:none;}#mermaid-svg-Y4WhnuCBq63jKbsK .edgeLabel{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-Y4WhnuCBq63jKbsK .edgeLabel p{background-color:rgba(232,232,232, 0.8);}#mermaid-svg-Y4WhnuCBq63jKbsK .edgeLabel rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-Y4WhnuCBq63jKbsK .labelBkg{background-color:rgba(232, 232, 232, 0.5);}#mermaid-svg-Y4WhnuCBq63jKbsK .cluster rect{fill:#ffffde;stroke:#aaaa33;stroke-width:1px;}#mermaid-svg-Y4WhnuCBq63jKbsK .cluster text{fill:#333;}#mermaid-svg-Y4WhnuCBq63jKbsK .cluster span{color:#333;}#mermaid-svg-Y4WhnuCBq63jKbsK div.mermaidTooltip{position:absolute;text-align:center;max-width:200px;padding:2px;font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:12px;background:hsl(80, 100%, 96.2745098039%);border:1px solid #aaaa33;border-radius:2px;pointer-events:none;z-index:100;}#mermaid-svg-Y4WhnuCBq63jKbsK .flowchartTitleText{text-anchor:middle;font-size:18px;fill:#333;}#mermaid-svg-Y4WhnuCBq63jKbsK rect.text{fill:none;stroke-width:0;}#mermaid-svg-Y4WhnuCBq63jKbsK .icon-shape,#mermaid-svg-Y4WhnuCBq63jKbsK .image-shape{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-Y4WhnuCBq63jKbsK .icon-shape p,#mermaid-svg-Y4WhnuCBq63jKbsK .image-shape p{background-color:rgba(232,232,232, 0.8);padding:2px;}#mermaid-svg-Y4WhnuCBq63jKbsK .icon-shape rect,#mermaid-svg-Y4WhnuCBq63jKbsK .image-shape rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-Y4WhnuCBq63jKbsK .label-icon{display:inline-block;height:1em;overflow:visible;vertical-align:-0.125em;}#mermaid-svg-Y4WhnuCBq63jKbsK .node .label-icon path{fill:currentColor;stroke:revert;stroke-width:revert;}#mermaid-svg-Y4WhnuCBq63jKbsK :root{--mermaid-font-family:"trebuchet ms",verdana,arial,sans-serif;} 表现为
表现为
表现为
舌象
脉象
治则
主方
加减
风寒束肺证
咳嗽
痰白清稀
畏寒发热
舌淡红、苔薄白
脉浮紧
辛温解表、宣肺散寒
麻黄汤
杏仁、桂枝、甘草

该图谱以「风寒束肺证」为中心节点,通过「表现为」「舌象」「脉象」「治则」「主方」「加减」等关系边,将症状、舌象、脉象、方剂等实体组织为三元组结构。作为 Graph-Memory 的结构化骨架,它带来三点收益:

  • 可推理:图谱支持沿关系边进行多跳推理,例如从「脉浮紧 + 舌淡红苔薄白」反推「风寒束肺证」,再沿「治则」边定位到「麻黄汤」,实现辨证到方剂的自动推导。
  • 可更新:患者复诊时新增的症状或方剂调整,只需在对应节点上增删关系边,即可完成记忆更新,避免整段重写。
  • 可检索:图谱天然支持按实体或关系检索,比纯向量检索更精准,能直接回答「该患者既往用过哪些方剂」「证型如何演化」等结构化问题。

4. 需要的数据

4.1 数据来源

  • 公开中医病历数据集:如 TCM 电子病历、中医临床科研数据平台。
  • 自建模拟数据:基于中医教材(如《中医诊断学》)构造标准化病人对话。
  • 真实脱敏数据:与医院合作获取脱敏后的门诊记录(需伦理审批)。

4.2 数据字段设计

字段 说明 示例
patient_id 患者唯一标识 P001
visit_id 就诊序号 V1, V2, V3
timestamp 就诊时间 2026-03-01
symptoms 主诉与症状描述 咳嗽、痰白、畏寒
tongue 舌象描述 舌淡红、苔薄白
pulse 脉象描述 脉浮紧
diagnosis 辨证结果 风寒束肺证
prescription 方剂与用药 麻黄汤加减
follow_up 复诊反馈 服药后咳嗽减轻

4.3 数据规模建议

  • 冷启动阶段:500--1000 条模拟对话用于机制验证。
  • 完整实验:5000 条以上多轮对话,覆盖至少 10 种常见证型。
  • 每例患者至少 3 次就诊记录,以支撑跨会话记忆实验。

5. 对比实验设计

5.1 基线方法

方法 说明
No-Memory 每次诊断仅基于当前对话,无历史记忆
Full-Context 将所有历史对话全部拼入上下文(受窗口限制)
Vector-Retrieval 用向量检索召回 Top-K 历史片段
Summary-Memory 用 LLM 生成历史摘要后注入
Graph-Memory 用知识图谱存储患者事实与证型关系

5.2 实验维度

  • 诊断准确率:辨证结果与金标准的一致性(精确率、召回率、F1)。
  • 信息利用率:诊断过程中是否有效利用了既往史(可设计「必须依赖既往史才能正确辨证」的测试样本)。
  • 效率指标:Token 消耗、推理延迟、检索耗时。
  • 鲁棒性:记忆噪声(错误历史)对诊断的影响。
  • 消融实验:分别去掉记忆写入、检索、更新模块,观察性能变化。

消融实验设计如下:

消融设置 去除模块 预期影响的指标 实验目的
去掉记忆写入 记忆写入模块 诊断准确率下降 5%--10%;Token 消耗略降(无需写入开销) 验证记忆写入对跨会话信息积累的必要性
去掉记忆检索 记忆检索模块 诊断准确率下降 10%--15%;信息利用率显著降低;Token 消耗上升(需拼接全部历史) 验证检索机制对精准召回既往史的关键作用
去掉记忆更新 记忆更新/遗忘模块 诊断准确率下降 3%--8%;记忆冗余与冲突增多;鲁棒性下降 验证更新与遗忘机制对保持记忆时效性和一致性的贡献
完整系统 无(保留全部模块) 作为基准,诊断准确率最高;Token 消耗与延迟处于合理区间 作为对照,衡量各模块的边际收益

5.3 实验流程

  1. 构造测试集:每例患者含首诊与多次复诊,标注金标准辨证。
  2. 对每种方法运行完整诊断流程,记录输出。
  3. 计算指标并做显著性检验(如配对 t 检验或 Wilcoxon 检验)。
  4. 人工评估:由中医专家对诊断理由的合理性打分。

下面是完整的实验流程图:
#mermaid-svg-69JgBdiornlO1WwV{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;fill:#333;}@keyframes edge-animation-frame{from{stroke-dashoffset:0;}}@keyframes dash{to{stroke-dashoffset:0;}}#mermaid-svg-69JgBdiornlO1WwV .edge-animation-slow{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 50s linear infinite;stroke-linecap:round;}#mermaid-svg-69JgBdiornlO1WwV .edge-animation-fast{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 20s linear infinite;stroke-linecap:round;}#mermaid-svg-69JgBdiornlO1WwV .error-icon{fill:#552222;}#mermaid-svg-69JgBdiornlO1WwV .error-text{fill:#552222;stroke:#552222;}#mermaid-svg-69JgBdiornlO1WwV .edge-thickness-normal{stroke-width:1px;}#mermaid-svg-69JgBdiornlO1WwV .edge-thickness-thick{stroke-width:3.5px;}#mermaid-svg-69JgBdiornlO1WwV .edge-pattern-solid{stroke-dasharray:0;}#mermaid-svg-69JgBdiornlO1WwV .edge-thickness-invisible{stroke-width:0;fill:none;}#mermaid-svg-69JgBdiornlO1WwV .edge-pattern-dashed{stroke-dasharray:3;}#mermaid-svg-69JgBdiornlO1WwV .edge-pattern-dotted{stroke-dasharray:2;}#mermaid-svg-69JgBdiornlO1WwV .marker{fill:#333333;stroke:#333333;}#mermaid-svg-69JgBdiornlO1WwV .marker.cross{stroke:#333333;}#mermaid-svg-69JgBdiornlO1WwV svg{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;}#mermaid-svg-69JgBdiornlO1WwV p{margin:0;}#mermaid-svg-69JgBdiornlO1WwV .label{font-family:"trebuchet ms",verdana,arial,sans-serif;color:#333;}#mermaid-svg-69JgBdiornlO1WwV .cluster-label text{fill:#333;}#mermaid-svg-69JgBdiornlO1WwV .cluster-label span{color:#333;}#mermaid-svg-69JgBdiornlO1WwV .cluster-label span p{background-color:transparent;}#mermaid-svg-69JgBdiornlO1WwV .label text,#mermaid-svg-69JgBdiornlO1WwV span{fill:#333;color:#333;}#mermaid-svg-69JgBdiornlO1WwV .node rect,#mermaid-svg-69JgBdiornlO1WwV .node circle,#mermaid-svg-69JgBdiornlO1WwV .node ellipse,#mermaid-svg-69JgBdiornlO1WwV .node polygon,#mermaid-svg-69JgBdiornlO1WwV .node path{fill:#ECECFF;stroke:#9370DB;stroke-width:1px;}#mermaid-svg-69JgBdiornlO1WwV .rough-node .label text,#mermaid-svg-69JgBdiornlO1WwV .node .label text,#mermaid-svg-69JgBdiornlO1WwV .image-shape .label,#mermaid-svg-69JgBdiornlO1WwV .icon-shape .label{text-anchor:middle;}#mermaid-svg-69JgBdiornlO1WwV .node .katex path{fill:#000;stroke:#000;stroke-width:1px;}#mermaid-svg-69JgBdiornlO1WwV .rough-node .label,#mermaid-svg-69JgBdiornlO1WwV .node .label,#mermaid-svg-69JgBdiornlO1WwV .image-shape .label,#mermaid-svg-69JgBdiornlO1WwV .icon-shape .label{text-align:center;}#mermaid-svg-69JgBdiornlO1WwV .node.clickable{cursor:pointer;}#mermaid-svg-69JgBdiornlO1WwV .root .anchor path{fill:#333333!important;stroke-width:0;stroke:#333333;}#mermaid-svg-69JgBdiornlO1WwV .arrowheadPath{fill:#333333;}#mermaid-svg-69JgBdiornlO1WwV .edgePath .path{stroke:#333333;stroke-width:2.0px;}#mermaid-svg-69JgBdiornlO1WwV .flowchart-link{stroke:#333333;fill:none;}#mermaid-svg-69JgBdiornlO1WwV .edgeLabel{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-69JgBdiornlO1WwV .edgeLabel p{background-color:rgba(232,232,232, 0.8);}#mermaid-svg-69JgBdiornlO1WwV .edgeLabel rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-69JgBdiornlO1WwV .labelBkg{background-color:rgba(232, 232, 232, 0.5);}#mermaid-svg-69JgBdiornlO1WwV .cluster rect{fill:#ffffde;stroke:#aaaa33;stroke-width:1px;}#mermaid-svg-69JgBdiornlO1WwV .cluster text{fill:#333;}#mermaid-svg-69JgBdiornlO1WwV .cluster span{color:#333;}#mermaid-svg-69JgBdiornlO1WwV div.mermaidTooltip{position:absolute;text-align:center;max-width:200px;padding:2px;font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:12px;background:hsl(80, 100%, 96.2745098039%);border:1px solid #aaaa33;border-radius:2px;pointer-events:none;z-index:100;}#mermaid-svg-69JgBdiornlO1WwV .flowchartTitleText{text-anchor:middle;font-size:18px;fill:#333;}#mermaid-svg-69JgBdiornlO1WwV rect.text{fill:none;stroke-width:0;}#mermaid-svg-69JgBdiornlO1WwV .icon-shape,#mermaid-svg-69JgBdiornlO1WwV .image-shape{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-69JgBdiornlO1WwV .icon-shape p,#mermaid-svg-69JgBdiornlO1WwV .image-shape p{background-color:rgba(232,232,232, 0.8);padding:2px;}#mermaid-svg-69JgBdiornlO1WwV .icon-shape rect,#mermaid-svg-69JgBdiornlO1WwV .image-shape rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-69JgBdiornlO1WwV .label-icon{display:inline-block;height:1em;overflow:visible;vertical-align:-0.125em;}#mermaid-svg-69JgBdiornlO1WwV .node .label-icon path{fill:currentColor;stroke:revert;stroke-width:revert;}#mermaid-svg-69JgBdiornlO1WwV :root{--mermaid-font-family:"trebuchet ms",verdana,arial,sans-serif;} 通过
不通过
构造测试集
基线方法运行
指标计算
显著性检验
专家评估
输出实验结果

各步骤的输入输出说明如下:

  • 构造测试集:输入为原始病历数据(含首诊与多次复诊记录),输出为带金标准辨证标注的测试集,每例患者至少包含 3 次就诊记录。
  • 基线方法运行:输入为测试集与各基线方法(No-Memory、Full-Context、Vector-Retrieval、Summary-Memory、Graph-Memory),输出为每种方法在每例患者上的诊断结果。
  • 指标计算:输入为各方法的诊断输出与金标准,输出为诊断准确率、信息利用率、Token 消耗等指标。
  • 显著性检验:输入为各方法的指标结果,通过配对 t 检验或 Wilcoxon 检验判断差异是否显著;若不显著则回到基线方法运行环节排查问题。
  • 专家评估:输入为通过显著性检验的诊断结果,由中医专家对诊断理由的合理性打分,最终输出实验结果。

6. 参考文献与链接

以下文献覆盖 Memory 机制、RAG、Agent 记忆与医疗 AI 方向,可作为实验设计与论文写作的支撑:

  1. Park et al., "Generative Agents: Interactive Simulacra of Human Behavior"(生成式 Agent 的记忆流与反思机制)

  2. Lewis et al., "Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks"(RAG 基础框架)

  3. Zhong et al., "MemoryBank: Enhancing Large Language Models with Long-Term Memory"(长期记忆银行与遗忘机制)

  4. Modarressi et al., "RET-LLM: Towards a General Read-Write Memory for LLMs"(通用读写记忆)

  5. Wang et al., "Unleashing the Power of LLMs in Medical Diagnosis"(LLM 在医疗诊断中的应用)

  6. Zhang et al., "HuatuoGPT: Towards Medical Dialogue Generation"(中医/医疗对话生成)

  7. Yao et al., "ReAct: Synergizing Reasoning and Acting in Language Models"(Agent 推理与行动结合)

  8. Shinn et al., "Reflexion: Language Agents with Verbal Reinforcement Learning"(反思机制,与记忆更新相关)

  9. Borgeaud et al., "Improving Language Models by Retrieving from Trillions of Tokens"(大规模检索增强)

  10. Khattab et al., "Dense Passage Retrieval for Open-Domain Question Answering"(稠密检索基础)

7. 实验落地建议

  • 先跑通 No-Memory 与 Vector-Retrieval 两个基线,确认数据与评估管线可用。
  • 再逐步加入 Summary-Memory 与 Graph-Memory,对比记忆表示形式的影响。
  • 中医场景建议引入专家标注的辨证金标准,并让中医师参与人工评估。
  • 若资源有限,可先用模拟数据完成机制验证,再申请真实脱敏数据做最终实验。

8. 总结

Agent 的 Memory 科研可从存储、写入、检索、评估四个环节切入,中医诊断场景提供了长期性、多模态、领域知识丰富的天然实验场。通过设计清晰的对比实验与消融实验,并借助上述参考文献,可以形成完整且可复现的研究闭环。

相关推荐
归秋1421 小时前
人声节奏对齐软件推荐:从专业DAW到AI人声制作工具怎么选
人工智能
databook1 小时前
面向数据工程师的正则表达式:从日志清洗到字段提取
python·正则表达式·数据分析
2601_962966642 小时前
数学与应用数学专业想进管理咨询,2027届秋招需要补哪些商业知识和技能?
人工智能
ss2732 小时前
AI全栈实战 | 3.2-01 Python 基础:四大数据容器怎么选,推导式为什么是 Pythonic 的灵魂
开发语言·人工智能·python
计算机毕业编程指导师2 小时前
【大数据毕设选题推荐】基于Spark的WTA职业网球赛事演变与竞技格局分析系统源码 毕业设计 选题推荐 毕设选题 数据分析 机器学习 深度学习
大数据·python·计算机·spark·毕业设计·课程设计·wta网球
Sweet锦2 小时前
不调 Python,不装向量库:我用纯 Java 写了一套以图搜图引擎
java·人工智能·开源·图搜索
fpcc2 小时前
AI和大模型—JEV模型
人工智能
weixin_446260852 小时前
面向演进式企业AI智能体技能的持续流程级评估
人工智能
言乐62 小时前
Python区分广度优先深度优先宽度优先的区别
python·算法·深度优先·广度优先·宽度优先