COVE:记忆-参数双通道协调自进化

这篇论文由 Tianyun Ji、Zhenya Huang 等人完成,2026 年 8 月 2 日提交到 arXiv(编号 2608.01234),针对的是 LLM 智能体在部署后面对工具接口、API、用户需求持续变化时,如何做"自进化"这一核心问题。下面把它的动机、框架设计、实验结论和意义分层拆开讲。

背景:两条自进化路线的根本矛盾

论文把现有的自进化方法归为两个范式:

  • Harness 路线(记忆/技能外部化):把反馈写成可编辑的记忆或技能,优势是灵活、能快速适应变化,但学习偏"浅"------每次都得靠检索把经验调出来用,模型自身能力并未真正提升。

  • Parameter 路线(经验内化到权重):通过训练把经验烧进参数,能力内化得更深,但一旦固化就难以修改,且训练成本高 。

只用其中任何一种,都会在"灵活性"和"性能"之间妥协。论文的核心提问是:智能体能不能把两条通道协调起来,该外化的外化、该内化的内化?

💡 这其实是"经验该记在笔记本上还是背在脑子里"的问题------笔记本来灵活但要翻,背在脑子里快但改不掉,且脑容量有限。

COVE 框架:三个核心机制

COVE 的全称体现的是 C oordination of O ne V ersatile self-Evolution,通过一个统一框架把上述两路学习方法结合起来,包含三个关键设计 :

1. 任务感知路由(Task-aware Routing)

决定"这条经验走哪条通道"。不是所有经验都值得训进参数------路由器的判断标准包括任务类型、知识类型、样本质量与非平凡程度。论文在实验中发现了一个反直觉现象:在 MATH 任务上,路由器反而把更多样本分给 harness 通道。原因是 MATH 虽然包含定理类知识,但模型在推理阶段已经表现得不错,把这类样本硬训进参数并不划算 。

2. 阶段感知调度(Stage-aware Scheduling)

不同进化阶段动态调整两通道的比重与配合方式。这是一种时序上的协调------并非一次性决定,而是随自进化推进不断重新平衡。

3. 知识优化(Knowledge Optimization)

对外部记忆/技能与内部参数更新做优化,避免"无差别积累经验"带来的记忆膨胀和训练浪费。这一步是把 COVE 与"全都记下来"的简单策略区分开的关键。

整体设计理念是:自进化不是经验的 indiscriminate accumulation(无差别累积),而是把任务和知识类型匹配到合适学习机制的协调过程​ 。

实验:协调的收益有多大

论文在 Lean4、APPS、HotpotQA、MATH、TableQA 等多类任务上做了评测,基线选得很全:

基线 路线
Qwen3-8B(无自进化) 原始基座
Evo-Memory harness 路线
Self-Challenging parameter 路线
Harness-only / Parametric-only COVE 的两个消融变体

几个关键发现 :

  • 整体性能:COVE 在 Lean4、APPS、HotpotQA、MATH 上取得最佳,TableQA 上仍有竞争力。

  • 训练成本 :相比"无差别参数学习",COVE 节省了 86% 的训练 token,却拿到了更好的效果。

  • 路由器的性价比 :对比三种路由策略------Always-Both(最贵)、Random-Route、Task-aware Router。Always-Both 性能最高但每个样本都付全价;Random-Route 成本减半但性能大幅下降;COVE 的路由器仅用 Always-Both 的 0.16× 参数训练 token,就达到 65.0 的平均性能,效率(Eff)飙到 28.83,远高于另外两个。

  • 混合子集验证 :论文专门挑出路由器判定为"高质且非平凡"的样本组成混合测试子集,COVE 在这里拿到 **24.1%**​ 成功率,超过基座的 15.6% 和最强单通道变体 Parametric-only 的 21.3%。这说明双通道联合训练真正的红利就来自"路由器激活双通道的那些样本",而不是简单的任务级平均提升。

📌 路由器一致性也做了交叉验证:用 Qwen3-8B、GPT-4o-mini、DeepSeek-v3.2 三种不同骨干做路由判断,在这些任务上一致性超过 95% 。

这项工作为什么重要

理论层面 :首次系统性地把"记忆外部化 vs 参数内化"的权衡问题形式化,并提出了一个可学习的协调方案。过去的自进化工作大多默认走一条路------要么不断往记忆库里写,要么不断做参数更新。COVE 证明这两条路不是互斥的,而是互补的,且互补的收益集中在"难而值得学"的样本上。

工程层面:86% 的训练 token 节省是直接的经济账。对于部署后需要持续适应的智能体来说,这意味着可以用远低的迭代训练成本维持演化能力。

方法论层面 :task-aware routing 的设计挑战了一个常见直觉------我们可能以为"数学定理就该内化进参数",但实验表明路由器会针对不同任务动态分配通道,MATH 任务上反而更多走 harness。这说明**"什么该记住、什么该内化"没有一成不变的答案,必须是数据驱动、任务感知的**。

局限与未解问题

从现有材料看,有几个点论文可能还需要在后续工作中进一步回答:

  • 阶段感知调度的具体时间表(schedule)是怎么定的?是预设的还是自适应的?

  • 当环境发生剧烈分布偏移时,harness 侧的记忆如何失效/淘汰?知识优化模块对记忆退化的处理机制细节公开得还不够。

  • 目前评测主要在 Qwen3-8B 上进行,更大规模模型上路由器的决策边界是否会漂移,还需要进一步验证。

⚠️ 注意:arXiv 上另有一篇同期发布的 CoEvo-Mem(2608.01739),做的是检索策略与记忆库的协同演化,与 COVE 思路相关但问题设定不同------前者聚焦长期记忆智能体的"检索-记忆"闭环,COVE 聚焦"外部记忆-内部参数"的双通道协调,不要混淆。

论文链接:2608.01234 Learning What to Remember and What to Internalize in LLM Self-Evolution via Adaptive Memory-Parameter Coordination

相关推荐
动物园猫15 分钟前
行人细分目标检测数据集:3类别、4,000张图像 | 目标检测
人工智能·目标检测·计算机视觉
船厂电气自动化ai大模型28 分钟前
AI大模型与数学·第57课 傅里叶全套工具链综合实战:串联级数/连续变换/DFT/FFT,图像、音频、扩散模型完整例题
数据结构·人工智能·深度学习·算法·机器学习
v:ychya201835 分钟前
2026 外贸 GEO 实操:4 步让独立站被 ChatGPT 优先引用
人工智能·chatgpt
cd_9492172139 分钟前
角色模型用AI生成纹理靠谱吗,能直接用于游戏吗?
人工智能·游戏
YOLO数据集集合42 分钟前
车牌目标检测数据集 | 车牌检测 智能交通 车辆识别 目标检测8003期
人工智能·目标检测·计算机视觉·车牌检测·非机动车车牌
IT_陈寒1 小时前
SpringBoot自动配置失效?你可能漏了这个小开关
前端·人工智能·后端
磁场转动100万匹1 小时前
OpenCV 答题卡识别判卷实战:从图像预处理到自动评分
人工智能·opencv·计算机视觉
cd_949217211 小时前
AI自动生成纹理能保持角色不同部位风格一致吗?
人工智能
人工智能培训1 小时前
人工智能数据安全下的个人信息保护实践方案
大数据·人工智能·算法·生活
大象AI共学1 小时前
# 【AI成本治理】额度缩水 44%-76% 之后的自查清单:10 题体检表 + 三档模型组合 + 免费/本地化实测方案
人工智能