COBRA‑Skills:基于上下文赌博机引导进化的智能体技能优化框架
摘要
大语言模型智能体可以利用从历史任务经验中蒸馏得到的可复用技能提升性能。但现有的技能优化方法往往开销巨大,需要大量基于执行的评估与海量任务样本。本文提出COBRA‑Skills 高效框架:将技能优化建模为在动态演化候选空间上带预算约束的序列优化问题。COBRA‑Skills结合上下文赌博机优先排序 与证据驱动的技能进化,选择性地把评估资源分配给高潜力、高信息增益的候选技能,同时利用执行反馈持续迭代优化技能种群。
在6个异构智能体基准、3个目标大模型上开展实验:对比SkillOpt基线,COBRA‑Skills优化开销降低55‑58%;每个基准仅使用50条独立优化样本即可取得最优平均性能。额外实验表明,该框架在不同智能体执行脚手架下具备鲁棒性;也支持直接使用目标模型自身完成技能生成与迭代(自教学模式)。
关键词
大模型智能体、智能体技能、上下文多臂赌博机、技能进化、样本高效优化
目录
- 引言
- 相关工作
- 方法
- [3.1 问题定义](#3.1 问题定义)
- [3.2 COBRA‑Skills整体流程](#3.2 COBRA‑Skills整体流程)
- [3.3 上下文赌博机:候选技能优先排序](#3.3 上下文赌博机:候选技能优先排序)
- [3.4 证据驱动进化算子](#3.4 证据驱动进化算子)
- [3.4.1 再生算子 Regeneration](#3.4.1 再生算子 Regeneration)
- [3.4.2 轨迹变异算子 Rollout (\mathcal{M})utation](#3.4.2 轨迹变异算子 Rollout (\mathcal{M})utation)
- [3.4.3 交叉算子 Crossover](#3.4.3 交叉算子 Crossover)
- 实验
- [4.1 实验配置](#4.1 实验配置)
- [4.1.1 评测基准](#4.1.1 评测基准)
- [4.1.2 模型设置](#4.1.2 模型设置)
- [4.1.3 对比基线](#4.1.3 对比基线)
- [4.1.4 实现与评测协议](#4.1.4 实现与评测协议)
- [4.2 主要实验结果](#4.2 主要实验结果)
- [4.2.1 整体性能](#4.2.1 整体性能)
- [4.2.2 优化开销与样本效率](#4.2.2 优化开销与样本效率)
- [4.2.3 跨智能体脚手架泛化](#4.2.3 跨智能体脚手架泛化)
- [4.2.4 优化动态过程](#4.2.4 优化动态过程)
- [4.1 实验配置](#4.1 实验配置)
- 消融实验
- [5.1 赌博机模块、进化模块有效性](#5.1 赌博机模块、进化模块有效性)
- [5.2 对教学模型的依赖(自教学模式)](#5.2 对教学模型的依赖(自教学模式))
- [5.3 跨模型技能迁移](#5.3 跨模型技能迁移)
- [5.4 探索‑利用权衡超参数(\nu)敏感性](#5.4 探索‑利用权衡超参数(\nu)敏感性)
- 相关工作
- [6.1 智能体技能与技能优化](#6.1 智能体技能与技能优化)
- [6.2 用于自适应优化的赌博机算法](#6.2 用于自适应优化的赌博机算法)
- 结论
- 参考文献
- [附录A 实验完整配置](#附录A 实验完整配置)
- [A.1 COBRA‑Skills超参数完整配置](#A.1 COBRA‑Skills超参数完整配置)
- [A.2 基线实现细节](#A.2 基线实现细节)
- [A.3 各个基准数据集细节](#A.3 各个基准数据集细节)
- [附录B 补充实验结果](#附录B 补充实验结果)
- [B.1 优化开销计算](#B.1 优化开销计算)
- [B.2 自教学模式完整结果](#B.2 自教学模式完整结果)
- [B.3 多checkpoint中间结果](#B.3 多checkpoint中间结果)
- [附录C Prompt模板脚本](#附录C Prompt模板脚本)
- [C.1 再生算子Prompt](#C.1 再生算子Prompt)
- [C.2 轨迹变异算子Prompt](#C.2 轨迹变异算子Prompt)
- [C.3 交叉算子Prompt](#C.3 交叉算子Prompt)
1 引言
智能体技能(Agent Skill)是从历史任务经验中蒸馏出的可复用过程化知识;以文本SKILL.md形式注入智能体系统提示,改变大模型推理行为。现有工作Trace2Skill、SkillOpt依靠大量轨迹样本、频繁执行评估迭代进化技能,存在两大痛点:
- 评估开销昂贵:每一条候选技能都需要在大量任务样本上执行智能体,token与API成本很高;
- 样本需求量大 :需要大量训练样本,资源受限场景难以落地。

本文提出COBRA‑Skills,核心思路:
- 将技能优化建模为带预算约束的上下文赌博机序列决策问题;把每一条候选技能当作赌博机臂,技能语义Embedding作为上下文特征;
- 结合神经网络奖励预测器+LinearUCB置信上界,平衡探索‑利用,优先评估高潜力、高不确定的候选,减少无效评估;
- 设计证据驱动的进化算子:再生、轨迹变异、交叉,周期性更新技能种群;全部进化修改基于真实执行轨迹证据,避免无依据空想。
本文贡献
- 将智能体技能优化建模为预算受限、动态候选空间下的上下文赌博机序列优化问题;
- 实现COBRA‑Skills框架:上下文赌博机优先排序 + 证据驱动技能进化算子;
- 在6个异构智能体基准、3个目标模型完成评测,相比SkillOpt,开销降低55‑58%,仅用每个基准50条优化样本取得更优性能;
- 消融验证各模块作用;验证自教学模式、跨脚手架、跨模型技能迁移能力;公开代码仓库。
2 相关工作
2.1 智能体技能与技能优化
智能体技能将可复用流程、启发式规则封装为文本,注入系统提示,无需微调模型参数。
- Trace2Skill:从失败/成功轨迹蒸馏技能;
- SkillOpt:迭代反射编辑、进化优化技能;
- CoEvoSkills、(\mathcal{M})eta‑Skills:协同进化、记忆库等方案。
现有方法大多不做评估资源分配,对全部候选无差别执行评估,开销高。COBRA‑Skills重点解决评估资源预算约束,使用上下文赌博机做候选筛选。
2.2 赌博机算法用于自适应优化
上下文多臂赌博机(Contextual Bandit),臂带有上下文特征,平衡探索‑利用,广泛用于Prompt优化、超参数调优。
COBRA‑Skills将技能Embedding作为上下文特征;不仅用于选择待评估候选,还利用得分做种群修剪,和证据进化算子闭环联动。
3 方法
3.1 问题定义
- 目标模型KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{M}\)};任务分布KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{D}\)};
- 优化集KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{D}\)}...:小规模带预算样本集合;测试集KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{D}\)}...用于泛化评估;
- 技能 s s s:文本SKILL.md,注入系统提示改变KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{M}\)}行为;
- 优化目标:从有限预算中,得到技能 s ∗ s^* s∗,最大化在未知测试分布KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{D}\)}上任务指标KaTeX parse error: Can't use function '\(' in math mode at position 31: ...y)\sim\mathcal{\̲(̲\mathcal{D}\)}}...。
约束:评估一次技能意味着在KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{D}\)}_...全部样本运行智能体,开销昂贵;总评估轮次 T T T有限。
3.2 COBRA‑Skills整体流程
算法1 COBRA‑Skills主循环伪代码
输入:优化集\(\mathcal{D}\)_opt,无技能原始轨迹T0,种群规模K,总轮次T;
超参数:d,η,\(\nu\);
初始化:
利用T0生成初始种群P_1;
历史记录H_0 = ∅
A_0 ← λI
t_last = 0
神经网络奖励预测器 f_θ0,初始输出0.5
for t in 1 ... T:
# ----------步骤1:赌博机计算每条候选优先分数 ----------
for s ∈ P_t:
z_s = φ(s) # φ:Embedding模型,将技能转为向量
U_t(s) = f_{θ_{t‑1}}(z_s) + \(\nu\) * sqrt(z_s^T A_{t‑1}^{-1} z_s)
# ----------步骤2:选出优先分数最高的候选进行完整评估 ----------
s_t ← argmax_{s∈P_t} U_t(s)
(r_t, T_t) = Evaluate(\(\mathcal{M}\), s_t, \(\mathcal{D}\)_opt) # 在全部优化集执行,获得得分、轨迹
# ----------更新赌博机历史、设计矩阵、重拟合奖励预测网络 ----------
H_t = H_{t‑1} ∪ {(s_t, z_{s_t}, r_t)}
A_t = A_{t‑1} + z_{s_t} z_{s_t}^T
f_{θ_t} ← FitNN(H_t) # 在全部历史样本上训练\(\mathcal{M}\)LP奖励预测器
# ----------周期性触发种群进化(对数调度) ----------
if t - t_last >= d and log(t / t_last) >= η:
P_{t+1} = Evolve(P_t, H_t, T0, s_t, T_t) # 证据驱动进化算子
t_last = t
else:
P_{t+1} = P_t
# 输出:历史记录H_T中平均奖励最高的技能
return argmax_{s∈H_T} mean_reward(s)
3.3 上下文赌博机:候选技能优先排序
- 技能Embedding :固定Embedding模型 ϕ \phi ϕ,将文本技能 s s s映射为向量 z s z_s zs;本工作使用Qwen3‑Embedding‑4B。
- 神经网络奖励预测器 :两层(\mathcal{M})LP,输入 z s z_s zs,输出标量预测奖励;损失(\mathcal{M})SE+L2正则。
L ( θ ) = 1 ∣ H t ∣ ∑ ( s i , z i , r i ) ∈ H t ( f θ ( z i ) − r i ) 2 + β ∥ θ ∥ 2 2 \mathcal{L}(\theta)=\frac{1}{|\mathcal{H}t|}\sum{(s_i,z_i,r_i)\in\mathcal{H}t}(f\theta(z_i)-r_i)^2+\beta\|\theta\|_2^2 L(θ)=∣Ht∣1(si,zi,ri)∈Ht∑(fθ(zi)−ri)2+β∥θ∥22 - LinearUCB置信奖金(探索项)
b t ( z s ) = ν z s ⊤ A t − 1 − 1 z s , A t − 1 = λ I + ∑ i z s i z s i ⊤ b_t(z_s)=\nu\sqrt{z_s^\top A_{t-1}^{-1} z_s},\quad A_{t-1}=\lambda I+\sum_{i}z_{s_i}z_{s_i}^\top bt(zs)=νzs⊤At−1−1zs ,At−1=λI+i∑zsizsi⊤
ν \nu ν控制探索强度; A A A为正则化设计矩阵;向量空间访问越少,置信奖金越高。 - 综合优先分数( exploitation + exploration)
U t ( s ) = f θ t − 1 ( z s ) + b t ( z s ) U_t(s)=f_{\theta_{t-1}}(z_s)+b_t(z_s) Ut(s)=fθt−1(zs)+bt(zs)
每一轮选择 U t ( s ) U_t(s) Ut(s)最大的技能执行完整评估。评估完成,将样本加入历史,重训练(\mathcal{M})LP、更新 A A A矩阵。
该优先分数同时用于两件事:①挑选本轮待评估技能;②种群进化阶段修剪低分候选。
3.4 证据驱动进化算子
进化触发条件满足时:
- 重新计算种群内全部技能 U t ( s ) U_t(s) Ut(s);
- 修剪掉 m m m个优先分数最低的技能;
- 使用三类算子生成新技能补齐种群空位。
进化全部基于真实执行轨迹证据,禁止凭空编造规则。
3.4.1 再生算子 Regeneration
直接从无技能原始轨迹集合 T 0 \mathcal{T}_0 T0采样多条轨迹,生成全新独立候选技能。
- 作用:引入新搜索方向,维持种群多样性,防止早熟收敛。