这篇论文由 Tianyun Ji、Zhenya Huang 等人完成,2026 年 8 月 2 日提交到 arXiv(编号 2608.01234),针对的是 LLM 智能体在部署后面对工具接口、API、用户需求持续变化时,如何做"自进化"这一核心问题。下面把它的动机、框架设计、实验结论和意义分层拆开讲。
背景:两条自进化路线的根本矛盾
论文把现有的自进化方法归为两个范式:
-
Harness 路线(记忆/技能外部化):把反馈写成可编辑的记忆或技能,优势是灵活、能快速适应变化,但学习偏"浅"------每次都得靠检索把经验调出来用,模型自身能力并未真正提升。
-
Parameter 路线(经验内化到权重):通过训练把经验烧进参数,能力内化得更深,但一旦固化就难以修改,且训练成本高 。
只用其中任何一种,都会在"灵活性"和"性能"之间妥协。论文的核心提问是:智能体能不能把两条通道协调起来,该外化的外化、该内化的内化?
💡 这其实是"经验该记在笔记本上还是背在脑子里"的问题------笔记本来灵活但要翻,背在脑子里快但改不掉,且脑容量有限。
COVE 框架:三个核心机制
COVE 的全称体现的是 C oordination of O ne V ersatile self-Evolution,通过一个统一框架把上述两路学习方法结合起来,包含三个关键设计 :
1. 任务感知路由(Task-aware Routing)
决定"这条经验走哪条通道"。不是所有经验都值得训进参数------路由器的判断标准包括任务类型、知识类型、样本质量与非平凡程度。论文在实验中发现了一个反直觉现象:在 MATH 任务上,路由器反而把更多样本分给 harness 通道。原因是 MATH 虽然包含定理类知识,但模型在推理阶段已经表现得不错,把这类样本硬训进参数并不划算 。
2. 阶段感知调度(Stage-aware Scheduling)
不同进化阶段动态调整两通道的比重与配合方式。这是一种时序上的协调------并非一次性决定,而是随自进化推进不断重新平衡。
3. 知识优化(Knowledge Optimization)
对外部记忆/技能与内部参数更新做优化,避免"无差别积累经验"带来的记忆膨胀和训练浪费。这一步是把 COVE 与"全都记下来"的简单策略区分开的关键。
整体设计理念是:自进化不是经验的 indiscriminate accumulation(无差别累积),而是把任务和知识类型匹配到合适学习机制的协调过程 。
实验:协调的收益有多大
论文在 Lean4、APPS、HotpotQA、MATH、TableQA 等多类任务上做了评测,基线选得很全:
| 基线 | 路线 |
|---|---|
| Qwen3-8B(无自进化) | 原始基座 |
| Evo-Memory | harness 路线 |
| Self-Challenging | parameter 路线 |
| Harness-only / Parametric-only | COVE 的两个消融变体 |
几个关键发现 :
-
整体性能:COVE 在 Lean4、APPS、HotpotQA、MATH 上取得最佳,TableQA 上仍有竞争力。
-
训练成本 :相比"无差别参数学习",COVE 节省了 86% 的训练 token,却拿到了更好的效果。
-
路由器的性价比 :对比三种路由策略------Always-Both(最贵)、Random-Route、Task-aware Router。Always-Both 性能最高但每个样本都付全价;Random-Route 成本减半但性能大幅下降;COVE 的路由器仅用 Always-Both 的 0.16× 参数训练 token,就达到 65.0 的平均性能,效率(Eff)飙到 28.83,远高于另外两个。
-
混合子集验证 :论文专门挑出路由器判定为"高质且非平凡"的样本组成混合测试子集,COVE 在这里拿到 **24.1%** 成功率,超过基座的 15.6% 和最强单通道变体 Parametric-only 的 21.3%。这说明双通道联合训练真正的红利就来自"路由器激活双通道的那些样本",而不是简单的任务级平均提升。
📌 路由器一致性也做了交叉验证:用 Qwen3-8B、GPT-4o-mini、DeepSeek-v3.2 三种不同骨干做路由判断,在这些任务上一致性超过 95% 。
这项工作为什么重要
理论层面 :首次系统性地把"记忆外部化 vs 参数内化"的权衡问题形式化,并提出了一个可学习的协调方案。过去的自进化工作大多默认走一条路------要么不断往记忆库里写,要么不断做参数更新。COVE 证明这两条路不是互斥的,而是互补的,且互补的收益集中在"难而值得学"的样本上。
工程层面:86% 的训练 token 节省是直接的经济账。对于部署后需要持续适应的智能体来说,这意味着可以用远低的迭代训练成本维持演化能力。
方法论层面 :task-aware routing 的设计挑战了一个常见直觉------我们可能以为"数学定理就该内化进参数",但实验表明路由器会针对不同任务动态分配通道,MATH 任务上反而更多走 harness。这说明**"什么该记住、什么该内化"没有一成不变的答案,必须是数据驱动、任务感知的**。
局限与未解问题
从现有材料看,有几个点论文可能还需要在后续工作中进一步回答:
-
阶段感知调度的具体时间表(schedule)是怎么定的?是预设的还是自适应的?
-
当环境发生剧烈分布偏移时,harness 侧的记忆如何失效/淘汰?知识优化模块对记忆退化的处理机制细节公开得还不够。
-
目前评测主要在 Qwen3-8B 上进行,更大规模模型上路由器的决策边界是否会漂移,还需要进一步验证。
⚠️ 注意:arXiv 上另有一篇同期发布的 CoEvo-Mem(2608.01739),做的是检索策略与记忆库的协同演化,与 COVE 思路相关但问题设定不同------前者聚焦长期记忆智能体的"检索-记忆"闭环,COVE 聚焦"外部记忆-内部参数"的双通道协调,不要混淆。
论文链接:2608.01234 Learning What to Remember and What to Internalize in LLM Self-Evolution via Adaptive Memory-Parameter Coordination