基于熵的选择性智能体引导:从非完美视觉语言模型教师学习自主策略
arXiv:2609.01567v1
摘要
视觉语言模型(VLM)可以为交互式决策任务提供强大先验,但直接将VLM当做策略使用存在开销高、鲁棒性差的缺陷:每一步都需要调用模型、无法从环境交互中迭代提升,还会反复出现系统性错误。本文研究如何从在线、开销昂贵、存在缺陷但具备信息增益的VLM教师中,训练轻量化自主强化学习(RL)策略。本文提出**(\mathcal{S})(\mathcal{A})GE((\mathcal{S})elective (\mathcal{A})gent Guidance via Entropy)**框架:仅当学习者智能体处于不确定性较高状态时才向VLM发起查询,训练阶段执行VLM给出的动作,再将引导知识蒸馏到轻量化RL策略中。
由于VLM给出的建议并非全部可靠,(\mathcal{S})(\mathcal{A})GE利用环境得到的优势值对教师动作蒸馏做加权,而不是将全部建议同等看待。在稀疏奖励视觉推理、导航类任务上,(\mathcal{S})(\mathcal{A})GE训练得到的策略在推理阶段完全不需要VLM引导;相比无引导的RL基线在多个环境取得性能提升,部分场景下学习得到的策略性能甚至超过作为教师的VLM本身。
实验结果表明:当VLM能够帮助智能体发现高回报轨迹时,选择性引导收益最大;当无引导探索本身就可以解决任务、或者教师输出无法提供有效信息时,引导带来的收益有限。(\mathcal{S})(\mathcal{A})GE仅在训练过程部分步骤调用VLM,部署阶段完全不需要VLM调用,显著降低VLM使用成本。本工作说明VLM不必直接作为执行策略,可充当临时、存在缺陷的信息引导源,智能体通过环境交互检验并内化这些引导信息。
图1:(\mathcal{S})(\mathcal{A})GE双架构RL示意图:智能体置信度高时自主执行动作;不确定性高时向VLM请求引导,并执行VLM给出的动作。
1 引言
强化学习(RL)允许智能体通过试错完成学习,但存在显著短板:智能体从零开始学习,缺少环境先验知识。在稀疏奖励环境下,随机探索很难采样得到成功轨迹,学习效率极低。该问题在需要视觉感知、符号推理、多步规划的交互式环境中尤为突出,智能体需要理解视觉状态、选择一连串正确动作之后,才能获得有效奖励信号。
视觉语言模型VLM具备大规模预训练得到的视觉、语言先验知识,可以理解物体、指令、空间关系与符号结构,因此非常适合交互式智能体场景。但直接把VLM当做执行策略有明显缺点:每一个决策步都需要向模型发起提示,部署成本高、速度慢;冻结的VLM无法通过环境交互自我迭代,如果出现感知、推理类系统性错误,会反复犯下同类错误。
基于以上背景,本文提出新的问题范式:不把VLM直接当做智能体,而是将其作为在线、开销昂贵、存在缺陷但有信息增益的教师,用于探索阶段的定向干预。VLM提供先验知识,帮助智能体跳出稀疏奖励探索瓶颈;RL负责在环境中检验教师给出的动作,并且通过试错实现超越教师本身的性能。最终目标是训练得到轻量化自主策略:训练阶段使用VLM,评估阶段不再依赖VLM;由于不能假设教师输出完全正确,学习者不能单纯盲目的模仿,需要结合环境反馈,强化有效的干预行为。
本文实现(\mathcal{S})(\mathcal{A})GE框架,轻量化RL智能体以VLM作为临时教师。训练过程中监控策略熵,将熵作为不确定性的轻量代理指标;当熵超过阈值,就向VLM查询动作并执行;利用带优势加权的目标函数,将教师引导蒸馏到学习者策略中。
实验环境包含多组稀疏奖励视觉决策环境:FrozenLake、MiniGrid套件(Fetch、GoToDoor、LavaGap)、EZPoints算术推理、本文新提出的感知符号匹配任务CardMaze,以及(\mathcal{A})LFWorld家庭交互仿真。评估时全部在未见过的环境种子上执行,不接入VLM引导,以此衡量轻量化策略的泛化能力。
在多个环境中(\mathcal{S})(\mathcal{A})GE显著优于普通PPO基线;部分场景学习得到的策略性能优于VLM教师本身。对比VLM‑as‑Policy、LVLM2P、D(\mathcal{A})gger系列在线模仿学习基线,(\mathcal{S})(\mathcal{A})GE只在训练的一小部分步骤调用VLM,部署阶段零VLM调用。Oracle教师对照实验表明:(\mathcal{S})(\mathcal{A})GE可以利用高质量引导解决PPO长时间训练也无法解决的任务;教师质量分析也可以定位性能缺陷来自VLM本身输出无效信息,而非学习框架本身。
本文主要贡献
- 提出(\mathcal{S})(\mathcal{A})GE:基于策略熵做触发条件的选择性VLM引导RL框架,将VLM作为训练阶段临时教师,评估阶段策略完全自主运行。
- 提出分区损失目标:区分学习者自身采样轨迹、教师引导轨迹;引入优势加权行为克隆(\mathcal{A})W(\mathcal{B})C,对VLM输出做环境反馈加权,不完全盲模仿教师。
- 构建CardMaze新的感知符号匹配测试环境;在多套稀疏奖励视觉环境完成验证;实验证明:即便VLM直接执行策略效果一般,仍然可以作为有效的训练引导源。
- 完整开源代码、环境资产、实验配置。
2 相关工作
模仿学习与在线监督
模仿学习通过将演示行为迁移给学习策略,加速强化学习训练。行为克隆(\mathcal{B})C让学习者拟合专家状态‑动作对,但当学习者访问演示集之外的状态,会遭遇分布偏移。专家源可以是人类演示、预训练策略、学习过程中在线查询得到的教师。D(\mathcal{A})gger通过迭代在学习者访问的状态上查询专家,聚合样本缓解分布偏移。交互式模仿学习研究策略执行过程中获取反馈的场景。RCMP使用多个价值头的标准差衡量不确定性,触发更强智能体的查询。
(\mathcal{S})(\mathcal{A})GE与以上工作的区别:在线教师是开销高、存在缺陷的VLM,并非可靠完美专家;选择性触发教师查询,并且不会同等信任全部引导样本。
因为VLM教师会输出错误,本工作也和从不完美演示中学习的研究相关:(\mathcal{A})WR、(\mathcal{A})W(\mathcal{A})C、CRR利用估计价值对动作加权,允许次优先验行为辅助学习,而不是对每个动作无差别克隆。(\mathcal{S})(\mathcal{A})GE将该思想应用在线VLM引导RL场景:在不确定状态按需获取教师监督,在环境中执行,再根据环境得到的优势做蒸馏加权。
基础模型用于交互式决策
基础模型在交互式环境有三类用法:作为学习信号源、直接当做策略、作为小智能体的教师。
第一类:大语言/视觉语言模型输出偏好标签、标量奖励、代码形式奖励函数、嵌入奖励、学习得到的奖励模型,为RL提供反馈信号。RL‑VLM‑F属于该路线,让VLM对轨迹对做偏好对比,训练奖励模型。(\mathcal{S})(\mathcal{A})GE不同之处在于,直接获取动作级引导,帮助学习者到达稀疏奖励,最终策略由RL优化得到。
第二类:将基础模型直接作为策略:提示模型输出动作、生成代码策略、视觉‑动作VL(\mathcal{A})模型。也有工作直接在环境交互下微调VLM,RL4VLM使用PPO结合思维链微调VLM智能体。(\mathcal{S})(\mathcal{A})GE采用不同路线:部署运行的是轻量化RL策略,VLM仅在训练阶段临时充当教师,避免每一步控制都调用或微调大模型。
和本文最接近的是将基础模型监督蒸馏到更小策略的工作。LM4TE(\mathcal{A})CH使用LLM专家,对齐RL策略与动作对应的token logit;LVLM2P提示VLM输出动作概率分布文本,再蒸馏到策略。(\mathcal{S})(\mathcal{A})GE的差异:向VLM只请求单个优选动作,生成任务更简单;仅在高熵状态查询教师;评估阶段策略不再依赖教师。Merler等人2025前期工作研究不确定性触发VLM引导RL,发现随着策略熵下降VLM查询次数变少;(\mathcal{S})(\mathcal{A})GE进一步研究:仅熵下降不足以保证策略能力变强(智能体可以变得自信但是依旧犯错),增加显式的教师动作蒸馏,在未见过任务上验证泛化,并通过Oracle、消融实验分离教师质量与学习框架各自的影响。
3 方法

图2 (\mathcal{S})(\mathcal{A})GE总览:每一步训练,如果归一化策略熵H^\hat{\mathcal{H}}H^低于阈值ν\nuν,学习者自行采样动作;否则查询冻结VLM教师并执行教师给出动作。轨迹打上标记gtg_tgt,分为学习者生成集合KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{B}\)}...、教师引导集合KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{B}\)}...。PPO仅在KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{B}\)}...更新(\mathcal{A})ctor;(\mathcal{B})C/(\mathcal{A})W(\mathcal{B})C在KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{B}\)}...;价值函数在全部缓冲区KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{B}\)}训练。
3.1 问题建模
环境建模为马尔可夫决策过程MDP KaTeX parse error: Can't use function '\(' in math mode at position 29: ...langle\mathcal{\̲(̲\mathcal{S}\)},...。KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{S}\)}状态空间,KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{A}\)}离散动作空间,RRR环境奖励,TTT状态转移,γ\gammaγ折扣因子,ρ0\rho_0ρ0初始状态分布。每个时间步学习者观测状态sts_tst,从随机策略πθ(at∣st)\pi_\theta(a_t \mid s_t)πθ(at∣st)采样动作,使用PPO算法训练。实验中sts_tst包含RG(\mathcal{B})图像,部分环境附带文本任务信息。
可以访问在线教师策略πT(⋅∣st)\pi^T(\cdot\mid s_t)πT(⋅∣st),由VLM实现。教师可以在任意状态查询,但有三个限制:调用开销大、不会通过环境交互更新、会输出错误动作,但需要具备一定任务能力才能提供有效信号。
目标: 训练轻量化策略πθ\pi_\thetaπθ,评估阶段不调用πT\pi^TπT,最大化环境回报;同时尽量减少训练阶段教师查询次数。
3.2 基于熵门控的选择性引导
使用智能体自身策略的熵作为不确定性轻量代理指标:
KaTeX parse error: Can't use function '\(' in math mode at position 75: ..._{a\in\mathcal{\̲(̲\mathcal{A}\)}}...
做归一化 KaTeX parse error: Can't use function '\(' in math mode at position 40: ...{\log|\mathcal{\̲(̲\mathcal{A}\)}|...,保证任意离散动作空间下 H^t∈0,1\hat H_t\in0,1H^t∈0,1。该方法模型无关,不需要额外计算开销,在深度强化学习中已经被证明可以作为有效的不确定性信号。
当 H^t>ν\hat H_{t}>\nuH^t>ν(ν\nuν 为固定阈值),学习者查询VLM教师,执行教师返回动作;否则从自身策略采样动作:
at∼μ(⋅∣st)={πT(⋅∣st)if H^t>νπθ(⋅∣st)otherwise a_{t}\sim\mu(\cdot\mid s_{t})= \begin{cases} \pi^{T}(\cdot\mid s_{t})&\text{if }\hat{H}{t}>\nu\\ \pi{\theta}(\cdot\mid s_{t})&\text{otherwise} \end{cases} at∼μ(⋅∣st)={πT(⋅∣st)πθ(⋅∣st)if H^t>νotherwise
每条转移记录指示标记 gt∈{0,1}g_{t}\in\{0,1\}gt∈{0,1},标记动作来自学习者还是教师。维护缓存CCC存储模型返回的状态‑动作对,相同状态下可以减少VLM提示调用开销。
图3 实验使用的RL环境:(i)FrozenLake;(ii)EZPoints;(iii)CardMaze(本文新环境);(iv)(\mathcal{A})LFWorld;(v)MiniGrid Fetch;(vi)GoToDoor;(vii)LavaGap
3.3 分区损失函数
教师引导得到的动作不是学习者策略采样得到的,如果直接当做普通PPO动作会产生离策略不匹配问题。尤其当教师选择学习者概率很低的动作,重要性权重比值会很大,PPO裁剪会过度压制信号。
因此对策略目标做分区。经验缓冲区KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{B}\)}:KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{B}\)}...学习者生成的轨迹;KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{B}\)}...教师引导轨迹。标准PPO裁剪损失Lclip\mathcal{L}\text{clip}Lclip仅在KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{B}\)}...执行:
KaTeX parse error: Can't use function '\(' in math mode at position 60: ...{t\in\mathcal{\̲(̲\mathcal{B}\)}...
教师引导的转移样本不参与PPO策略损失,改为第3.4节行为克隆目标。该做法保留PPO同策略解释,同时允许教师通过独立监督信号影响学习者。
价值函数在全部轨迹(学习者+教师引导样本)上训练。虽然引导样本会改变状态分布,但Critic目标完全来自环境奖励,不依赖教师标签。在稀疏奖励任务中,训练早期教师引导轨迹往往是智能体唯一能观测到的成功轨迹。
3.4 优势加权行为克隆((\mathcal{A})W(\mathcal{B})C)
标准行为克隆损失会无差别模仿全部教师动作:
KaTeX parse error: Can't use function '\(' in math mode at position 74: ...{t\in\mathcal{\̲(̲\mathcal{B}\)}...
但VLM教师并不完美:VLM输出视觉上合理但实际错误的动作,如果直接克隆,会让学习者策略在错误动作上置信度变高,后续遇到相似状态不再请求引导,损害策略性能。
受CRR启发,本文提出优势加权行为克隆(\mathcal{A})W(\mathcal{B})C :
KaTeX parse error: Can't use function '\(' in math mode at position 90: ...{t\in\mathcal{\̲(̲\mathcal{B}\)}...
权重 KaTeX parse error: Can't use function '\(' in math mode at position 14: w_{t}=f(\hat \̲(̲\mathcal{A}\)_t...,由教师动作估计优势得到非负权重;本文采用 KaTeX parse error: Can't use function '\(' in math mode at position 8: f(\hat \̲(̲\mathcal{A}\)_t...,τ\tauτ为温度参数;权重裁剪上限为20保证数值稳定性。
优势估计来自基于环境奖励训练得到的Critic网络。(\mathcal{A})W(\mathcal{B})C利用环境反馈调节教师动作蒸馏强度:预估能带来高回报轨迹的教师动作权重更大;效果差的动作权重被压低。训练早期还没有观测到成功轨迹时,Critic输出信息有限,此时(\mathcal{A})W(\mathcal{B})C行为近似普通(\mathcal{B})C,不能完全过滤教师错误。因此(\mathcal{A})W(\mathcal{B})C作为(\mathcal{B})C的可选改进,不是万能过滤器,需要通过实验验证效果。
(\mathcal{S})(\mathcal{A})GE完整目标函数:
KaTeX parse error: Can't use function '\(' in math mode at position 162: ...t{on }\mathcal{\̲(̲\mathcal{B}\)}_...
Lvalue\mathcal{L}_\text{value}Lvalue为环境回报M(\mathcal{S})E价值损失;β\betaβ控制教师蒸馏强度;cvc_vcv价值损失系数;cHc_HcH熵正则系数。
4 实验设置
4.1 环境介绍
- FrozenLake 8×8:Gymnasium确定性视觉版本,每episode程序随机生成地图。智能体需要避开冰洞到达终点;只有成功到达才会获得奖励,无法记忆固定路线。
- MiniGrid套件:LavaGap、GoToDoor、Fetch,需要视觉导航、障碍物规避、物体交互。
- EZPoints:根据两张卡牌数字构造算术表达式得到结果12;动作空间包含卡牌数值与算术运算符;奖励稀疏,非法动作会被惩罚。
- CardMaze(本文新增):全新感知符号匹配任务。每个状态提供4张候选卡牌+1张提示卡牌;正确动作选择花色和提示卡匹配的候选卡,存在数字相同但花色不同的干扰卡牌;需要连续5次选择正确才获得奖励。
- (\mathcal{A})LFWorld:家庭交互基准,视觉观测、文本目标、文本格式合法动作。仿真与VLM推理开销高,作为探索性压力测试。
全部环境样例截图参考图3。
4.2 基线方法
- PPO:仅在视觉观测上训练,无任何外部引导,作为基准。
- VLM‑as‑Policy:VLM直接充当策略,CoT提示,每一步都调用VLM;不会通过环境交互迭代优化。
- RL‑VLM‑F:VLM输出轨迹对偏好,训练奖励模型做奖励塑形。
- LVLM2P:每一步提示VLM输出动作概率分布文本,监督蒸馏到策略。
- D(\mathcal{A})gger‑VLM:VLM充当在线专家标注器;学习者与VLM混合收集轨迹,所有访问过的状态交给VLM打标签,(\mathcal{B})C训练学习者。
4.3 (\mathcal{S})(\mathcal{A})GE变体(消融实验组)
- (\mathcal{S})(\mathcal{A})GE w/o (\mathcal{B})C:熵门控查询、执行教师动作,但移除(\mathcal{B})C/(\mathcal{A})W(\mathcal{B})C蒸馏损失;仅依靠探索,不做监督蒸馏。
- (\mathcal{S})(\mathcal{A})GE w/o (\mathcal{A})W(\mathcal{B})C:保留(\mathcal{B})C蒸馏,移除优势加权,使用普通行为克隆。
- (\mathcal{S})(\mathcal{A})GE + Oracle:把VLM替换为规则完美Oracle教师,仅用于诊断实验,看性能瓶颈来自教师质量还是学习算法本身。
5 实验结果
除(\mathcal{A})LFWorld使用Gemma3‑27(\mathcal{B}),其余VLM基线与(\mathcal{S})(\mathcal{A})GE均使用Qwen3.5‑27(\mathcal{B})。评估全部在训练未见过的随机种子上运行,推理阶段不使用VLM,衡量自主策略性能。大部分环境训练总环境步数100k;(\mathcal{A})LFWorld因为开销限制训练40k;D(\mathcal{A})gger‑VLM调用VLM代价高,训练步数25k。每个实验组3个随机种子。超参数见附录(\mathcal{A}),超参扫描见附录(\mathcal{B}),VLM调用开销统计见附录C,VLM提示模板见附录F。
5.1 主实验结果
表1:各环境性能对比,单元格为3种子平均episode峰值回报(括号内标准差);每列粗体最优;下划线为非Oracle条件下最优。
| Method | FrozenLake | EZPoints | CardMaze | Fetch | GoToDoor | LavaGap | (\mathcal{A})LFWorld |
|---|---|---|---|---|---|---|---|
| PPO | 0.000 (0.000) | 0.000 (0.000) | 0.007 (0.006) | 0.075 (0.034) | 0.131 (0.015) | 0.945 (0.000) | 0.111 (0.019) |
| VLM‑as‑Policy | \underline{0.117} (0.065) | \underline{0.175} (1.488) | 0.000 (0.000) | \underline{0.310} (0.044) | 0.127 (0.019) | 0.083 (0.143) | 0.108 (0.000) |
| LVLM2P | 0.000 (0.000) | −2.868 (2.618) | 0.000 (0.000) | 0.036 (0.040) | 0.020 (0.026) | 0.000 (0.000) | --- |
| RL‑VLM‑F | 0.007 (0.012) | −0.450 (0.507) | 0.037 (0.064) | 0.062 (0.006) | 0.111 (0.040) | 0.190 (0.329) | --- |
| D(\mathcal{A})gger | 0.007 (0.012) | −3.970 (0.165) | 0.993 (0.012) | 0.099 (0.000) | 0.052 (0.028) | 0.000 (0.000) | --- |
| (\mathcal{S})(\mathcal{A})GE (Ours) | 0.103 (0.111) | 0.000 (0.000) | 1.000 (0.000) | 0.122 (0.025) | \underline{0.147} (0.017) | 0.688 (0.212) | 0.150 (0.017) |
| (\mathcal{S})(\mathcal{A})GE + Oracle | 0.697 (0.127) | 10.000 (0.000) | 0.663 (0.574) | 0.456 (0.107) | 0.268 (0.029) | 0.945 (0.000) | 0.100 (0.027) |
核心观察:
- 在CardMaze、GoToDoor、Fetch、(\mathcal{A})LFWorld,(\mathcal{S})(\mathcal{A})GE显著优于PPO基线。CardMaze任务上(\mathcal{S})(\mathcal{A})GE得到满分1.000,但是直接把VLM当做策略VLM‑as‑Policy回报为0.000:VLM直接执行策略效果很差,但作为训练引导源,(\mathcal{S})(\mathcal{A})GE可以学习得到超越教师本身的自主策略。D(\mathcal{A})gger在CardMaze同样效果好,但D(\mathcal{A})gger每一步训练都必须调用VLM。
- (\mathcal{S})(\mathcal{A})GE大幅降低VLM调用开销:6个受控环境中,VLM调用占训练总步数比例仅1.2%‑13.3%;高调用比例出现在CardMaze(13.3%,状态空间更丰富,需要引导的阶段更长)。推理阶段零VLM调用。对比VLM‑as‑Policy / LVLM2P / D(\mathcal{A})gger训练阶段100%每步调用VLM。
- 部分场景(\mathcal{S})(\mathcal{A})GE收益有限:LavaGap任务PPO基线本身就可以很好解决,引导无法带来提升;FrozenLake、EZPoints在Qwen3.5‑27(\mathcal{B})作为教师时,VLM输出引导质量不足,性能受限。
- Oracle教师并不一定全部优于VLM教师:推测Oracle确定性输出会造成策略过拟合特定轨迹;VLM的随机次优输出起到正则效果,缓解价值过估计。
5.2 教师质量的影响
更换Gemma3‑27(\mathcal{B})作为VLM教师做对照实验。发现:VLM直接执行策略的性能,不能完全等价于该VLM作为(\mathcal{S})(\mathcal{A})GE教师的有效性。EZPoints:Gemma直接执行策略回报‑3.400,但作为(\mathcal{S})(\mathcal{A})GE教师,(\mathcal{S})(\mathcal{A})GE可以到达最优10.000;Qwen直接执行策略有0.175,但(\mathcal{S})(\mathcal{A})GE使用Qwen反而无法解决EZPoints。随机教师对照组证明:完全无效的随机动作引导不能带来任何收益,甚至会破坏已经学会的策略。
结论:(\mathcal{S})(\mathcal{A})GE适合存在缺陷但仍含有任务有效信息的教师;完全无信息、系统性误导的引导无法带来收益。
5.3 消融实验
表2消融实验(峰值episode回报,3种子均值±标准差)
| Method | FrozenLake | EZPoints | CardMaze | Fetch | GoToDoor | LavaGap |
|---|---|---|---|---|---|---|
| (\mathcal{S})(\mathcal{A})GE | 0.103 (0.111) | 0.000 (0.000) | 1.000 (0.000) | 0.122 (0.025) | 0.147 (0.017) | 0.688 (0.212) |
| (\mathcal{S})(\mathcal{A})GE w/o (\mathcal{A})W(\mathcal{B})C | 0.180 (0.167) | 0.000 (0.000) | 0.977 (0.032) | 0.112 (0.021) | 0.160 (0.049) | 0.670 (0.320) |
| (\mathcal{S})(\mathcal{A})GE w/o (\mathcal{B})C | 0.000 (0.000) | −2.410 (3.408) | 0.000 (0.000) | 0.060 (0.010) | 0.069 (0.036) | 0.000 (0.000) |
| (\mathcal{S})(\mathcal{A})GE + Oracle | 0.697 (0.127) | 10.000 (0.000) | 0.663 (0.574) | 0.456 (0.107) | 0.268 (0.029) | 0.945 (0.000) |
| (\mathcal{S})(\mathcal{A})GE + Oracle w/o (\mathcal{B})C | 0.000 (0.000) | −3.037 (2.632) | 0.000 (0.000) | 0.020 (0.034) | 0.000 (0.000) | 0.000 (0.000) |
关键消融结论:
- (\mathcal{B})C蒸馏损失是必不可少的核心组件:移除(\mathcal{B})C之后,即便训练过程仍然执行教师给出的动作,全部环境性能都会大幅崩塌;哪怕使用完美Oracle教师,去掉(\mathcal{B})C之后性能也近乎归零。仅仅靠探索采样轨迹是不够的,教师动作必须提供显式监督信号,策略才能内化行为。
- (\mathcal{A})W(\mathcal{B})C(优势加权)对比普通(\mathcal{B})C,没有稳定一致收益,性能差异处于种子随机波动范围内。(\mathcal{A})W(\mathcal{B})C是可选改进,框架的核心是行为克隆蒸馏本身。
5.4 长周期5M环境步数实验(Oracle教师)
表3,5M环境步长实验,验证引导带来的提升不只是样本效率加速,而是学到更好策略。
| Environment | PPO | (\mathcal{S})(\mathcal{A})GE + Oracle |
|---|---|---|
| FrozenLake | 0.003 (0.006) | 0.997 (0.006) |
| EZPoints | 0.000 (0.000) | 10.000 (0.000) |
| CardMaze | 0.007 (0.006) | 1.000 (0.000) |
| Fetch | 0.137 (0.055) | 0.470 (0.208) |
| GoToDoor | 0.180 (0.020) | 0.283 (0.116) |
| LavaGap | 0.945 (0.000) | 0.945 (0.000) |
在FrozenLake、EZPoints、CardMaze,PPO训练5M步性能依旧接近0;(\mathcal{S})(\mathcal{A})GE+Oracle几乎达到最优。证明引导改变智能体能够发现的轨迹集合,而不只是加快已经找到奖励后的收敛速度。
6 结论与局限性
本文提出(\mathcal{S})(\mathcal{A})GE框架,从开销昂贵、在线、存在缺陷但具备信息增益的VLM教师,训练轻量化自主RL策略。(\mathcal{S})(\mathcal{A})GE训练阶段基于策略熵判断不确定性,高熵状态选择性查询VLM,执行教师动作;分区RL目标结合行为克隆(可选优势加权(\mathcal{A})W(\mathcal{B})C),将引导蒸馏到学习者;评估阶段策略完全自主,不再需要VLM。
在稀疏奖励视觉决策任务上,(\mathcal{S})(\mathcal{A})GE可以把有缺陷的VLM教师转化为有效的训练信号;多个环境优于无引导PPO,部分任务学到的策略性能超越VLM教师本身。教师质量实验证明:VLM直接执行策略好坏不等于作为教师的好坏;部分直接表现很差的VLM仍然可以提供干预信号,帮助智能体发现高回报行为。
局限性
- 使用策略熵作为不确定性代理指标:简单开销低,但会混淆真实不确定性与动作多模态;无法直接估计教师在该状态下是否有用。未来可以集成集成模型、价值估计分歧、可学习查询策略获得更精准触发条件。
- 实验聚焦离散动作空间;扩展连续控制存在难点,当前VLM很难输出精确底层数值动作;更可行方向:VLM输出高层子目标/技能抽象。
- (\mathcal{S})(\mathcal{A})GE假设教师需要具备一定任务能力;完全无信息、系统性误导引导会带来负向效果;本框架不能保证在该条件下鲁棒;未来工作需要开发执行前评估教师输出有效性的机制。
- (\mathcal{A})LFWorld仅作为初步压力测试,训练预算有限;受控测试环境聚焦稀疏‑奖励探索问题,不完全等价真实世界具身交互。更大规模具身实验、更强教师、交互式模仿学习基线对比属于未来方向。
潜在风险
当VLM教师输出存在系统性偏差、不安全行为,但依旧得到看起来成功的轨迹,(\mathcal{S})(\mathcal{A})GE会将偏差蒸馏进入学习策略。(\mathcal{A})W(\mathcal{B})C相比普通(\mathcal{B})C没有展现稳定鲁棒增益;如果奖励函数本身存在错误、不完备,不能保证学习策略安全对齐。部署前必须经过人工评估,尤其安全关键场景。
制品与许可证
实验构建在Gymnasium、MiniGrid、(\mathcal{A})LFWorld、Qwen、Gemma公开环境与模型之上,遵循各自许可。代码、提示词、CardMaze环境资产将在开源仓库发布,第三方组件遵循对应许可。
致谢
Giovanni (\mathcal{B})onetta、(\mathcal{B})ernardo Magnini得到意大利PNRR‑MUR项目PE0000013‑F(\mathcal{A})IR((\mathcal{S})poke2)项目资助。
参考文献
完整参考文献参见arXiv原文页面。
附录
附录(\mathcal{A}) 实验超参数
表4 (\mathcal{S})(\mathcal{A})GE各环境关键超参
| Parameter | FrozenLake | EZPoints | CardMaze | Fetch | GoToDoor | LavaGap | (\mathcal{A})LFWorld |
|---|---|---|---|---|---|---|---|
| Guidance VLM | Qwen/Qwen3.5‑27(\mathcal{B}) | Qwen/Qwen3.5‑27(\mathcal{B}) | Qwen/Qwen3.5‑27(\mathcal{B}) | Qwen/Qwen3.5‑27(\mathcal{B}) | Qwen/Qwen3.5‑27(\mathcal{B}) | Qwen/Qwen3.5‑27(\mathcal{B}) | google/gemma‑3‑27b‑it |
| Entropy threshold (ν\nuν) | 0.75 | 0.75 | 0.25 | 0.75 | 0.75 | 0.75 | 0.25 |
| (\mathcal{B})C coefficient (β\betaβ) | 1.0 | 1.0 | 1.0 | 1.0 | 1.0 | 1.0 | 1.0 |
| (\mathcal{A})W(\mathcal{B})C temperature (τ\tauτ) | 0.5 | 0.5 | 0.5 | 0.5 | 0.5 | 0.5 | --- |
表5 PPO通用训练超参数
| Parameter | Value |
|---|---|
| (\mathcal{A})gent type | CNN (+ L(\mathcal{S})TM text encoder for (\mathcal{A})LFWorld) |
| Convolution channels | 16, 32, 32 |
| Conv head out features | 256 |
| (\mathcal{A})ctor std init | 0.01 |
| Critic std init | 1 |
| Gamma (γ\gammaγ) | 0.99 |
| G(\mathcal{A})E lambda (λ\lambdaλ) | 0.95 |
| Value loss coef | 0.5 |
| Entropy coef | 0.01 |
| Clip coef | 0.2 |
| Clip value loss | true |
| (\mathcal{A})dvantage normalization | true |
| Learning rate | 1×10−31\times10^{-3}1×10−3 |
| Learning rate annealing | true |
| Max gradient norm | 0.5 |
| PPO epochs | 8 |
| Minibatches | 4 |
| (\mathcal{B})atch size | 512 |
附录(\mathcal{B}) 超参扫描
CardMaze环境扫描(\mathcal{B})C系数β\betaβ、熵阈值ν\nuν,每个设置3种子。
- β\betaβ最优在1.0附近;
- ν\nuν有效区间约0.05‑0.45。
附录C VLM训练查询开销
统计训练阶段真实VLM调用次数,缓存命中不会产生新调用。统计每个环境总VLM调用数目与调用占总环境步比例。
| Environment | (\mathcal{S})teps | VLM calls | Rate |
|---|---|---|---|
| FrozenLake | 100k | 1708±5311708\pm5311708±531 | 1.7% |
| EZPoints | 100k | 1160±2781160\pm2781160±278 | 1.2% |
| CardMaze | 100k | 13251±129513251\pm129513251±1295 | 13.3% |
| Fetch | 100k | 2718±10592718\pm10592718±1059 | 2.7% |
| GoToDoor | 100k | 2144±8422144\pm8422144±842 | 2.1% |
| LavaGap | 100k | 1963±6171963\pm6171963±617 | 2.0% |
附录D VLM提示词模板(F)
完整VLM提示模板、示例,见开源仓库与arXiv附录F。
附录E 计算资源
硬件:单张RTX‑3090;完整实验总GPU耗时约220小时。
