基于熵的选择性智能体引导:从非完美视觉语言模型教师学习自主策略

基于熵的选择性智能体引导:从非完美视觉语言模型教师学习自主策略

arXiv:2609.01567v1

摘要

视觉语言模型(VLM)可以为交互式决策任务提供强大先验,但直接将VLM当做策略使用存在开销高、鲁棒性差的缺陷:每一步都需要调用模型、无法从环境交互中迭代提升,还会反复出现系统性错误。本文研究如何从在线、开销昂贵、存在缺陷但具备信息增益的VLM教师中,训练轻量化自主强化学习(RL)策略。本文提出**(\mathcal{S})(\mathcal{A})GE((\mathcal{S})elective (\mathcal{A})gent Guidance via Entropy)**框架:仅当学习者智能体处于不确定性较高状态时才向VLM发起查询,训练阶段执行VLM给出的动作,再将引导知识蒸馏到轻量化RL策略中。

由于VLM给出的建议并非全部可靠,(\mathcal{S})(\mathcal{A})GE利用环境得到的优势值对教师动作蒸馏做加权,而不是将全部建议同等看待。在稀疏奖励视觉推理、导航类任务上,(\mathcal{S})(\mathcal{A})GE训练得到的策略在推理阶段完全不需要VLM引导;相比无引导的RL基线在多个环境取得性能提升,部分场景下学习得到的策略性能甚至超过作为教师的VLM本身。

实验结果表明:当VLM能够帮助智能体发现高回报轨迹时,选择性引导收益最大;当无引导探索本身就可以解决任务、或者教师输出无法提供有效信息时,引导带来的收益有限。(\mathcal{S})(\mathcal{A})GE仅在训练过程部分步骤调用VLM,部署阶段完全不需要VLM调用,显著降低VLM使用成本。本工作说明VLM不必直接作为执行策略,可充当临时、存在缺陷的信息引导源,智能体通过环境交互检验并内化这些引导信息。

图1:(\mathcal{S})(\mathcal{A})GE双架构RL示意图:智能体置信度高时自主执行动作;不确定性高时向VLM请求引导,并执行VLM给出的动作。

1 引言

强化学习(RL)允许智能体通过试错完成学习,但存在显著短板:智能体从零开始学习,缺少环境先验知识。在稀疏奖励环境下,随机探索很难采样得到成功轨迹,学习效率极低。该问题在需要视觉感知、符号推理、多步规划的交互式环境中尤为突出,智能体需要理解视觉状态、选择一连串正确动作之后,才能获得有效奖励信号。

视觉语言模型VLM具备大规模预训练得到的视觉、语言先验知识,可以理解物体、指令、空间关系与符号结构,因此非常适合交互式智能体场景。但直接把VLM当做执行策略有明显缺点:每一个决策步都需要向模型发起提示,部署成本高、速度慢;冻结的VLM无法通过环境交互自我迭代,如果出现感知、推理类系统性错误,会反复犯下同类错误。

基于以上背景,本文提出新的问题范式:不把VLM直接当做智能体,而是将其作为在线、开销昂贵、存在缺陷但有信息增益的教师,用于探索阶段的定向干预。VLM提供先验知识,帮助智能体跳出稀疏奖励探索瓶颈;RL负责在环境中检验教师给出的动作,并且通过试错实现超越教师本身的性能。最终目标是训练得到轻量化自主策略:训练阶段使用VLM,评估阶段不再依赖VLM;由于不能假设教师输出完全正确,学习者不能单纯盲目的模仿,需要结合环境反馈,强化有效的干预行为。

本文实现(\mathcal{S})(\mathcal{A})GE框架,轻量化RL智能体以VLM作为临时教师。训练过程中监控策略熵,将熵作为不确定性的轻量代理指标;当熵超过阈值,就向VLM查询动作并执行;利用带优势加权的目标函数,将教师引导蒸馏到学习者策略中。

实验环境包含多组稀疏奖励视觉决策环境:FrozenLake、MiniGrid套件(Fetch、GoToDoor、LavaGap)、EZPoints算术推理、本文新提出的感知符号匹配任务CardMaze,以及(\mathcal{A})LFWorld家庭交互仿真。评估时全部在未见过的环境种子上执行,不接入VLM引导,以此衡量轻量化策略的泛化能力。

在多个环境中(\mathcal{S})(\mathcal{A})GE显著优于普通PPO基线;部分场景学习得到的策略性能优于VLM教师本身。对比VLM‑as‑Policy、LVLM2P、D(\mathcal{A})gger系列在线模仿学习基线,(\mathcal{S})(\mathcal{A})GE只在训练的一小部分步骤调用VLM,部署阶段零VLM调用。Oracle教师对照实验表明:(\mathcal{S})(\mathcal{A})GE可以利用高质量引导解决PPO长时间训练也无法解决的任务;教师质量分析也可以定位性能缺陷来自VLM本身输出无效信息,而非学习框架本身。

本文主要贡献

  1. 提出(\mathcal{S})(\mathcal{A})GE:基于策略熵做触发条件的选择性VLM引导RL框架,将VLM作为训练阶段临时教师,评估阶段策略完全自主运行。
  2. 提出分区损失目标:区分学习者自身采样轨迹、教师引导轨迹;引入优势加权行为克隆(\mathcal{A})W(\mathcal{B})C,对VLM输出做环境反馈加权,不完全盲模仿教师。
  3. 构建CardMaze新的感知符号匹配测试环境;在多套稀疏奖励视觉环境完成验证;实验证明:即便VLM直接执行策略效果一般,仍然可以作为有效的训练引导源。
  4. 完整开源代码、环境资产、实验配置。

2 相关工作

模仿学习与在线监督

模仿学习通过将演示行为迁移给学习策略,加速强化学习训练。行为克隆(\mathcal{B})C让学习者拟合专家状态‑动作对,但当学习者访问演示集之外的状态,会遭遇分布偏移。专家源可以是人类演示、预训练策略、学习过程中在线查询得到的教师。D(\mathcal{A})gger通过迭代在学习者访问的状态上查询专家,聚合样本缓解分布偏移。交互式模仿学习研究策略执行过程中获取反馈的场景。RCMP使用多个价值头的标准差衡量不确定性,触发更强智能体的查询。

(\mathcal{S})(\mathcal{A})GE与以上工作的区别:在线教师是开销高、存在缺陷的VLM,并非可靠完美专家;选择性触发教师查询,并且不会同等信任全部引导样本。

因为VLM教师会输出错误,本工作也和从不完美演示中学习的研究相关:(\mathcal{A})WR、(\mathcal{A})W(\mathcal{A})C、CRR利用估计价值对动作加权,允许次优先验行为辅助学习,而不是对每个动作无差别克隆。(\mathcal{S})(\mathcal{A})GE将该思想应用在线VLM引导RL场景:在不确定状态按需获取教师监督,在环境中执行,再根据环境得到的优势做蒸馏加权。

基础模型用于交互式决策

基础模型在交互式环境有三类用法:作为学习信号源、直接当做策略、作为小智能体的教师。

第一类:大语言/视觉语言模型输出偏好标签、标量奖励、代码形式奖励函数、嵌入奖励、学习得到的奖励模型,为RL提供反馈信号。RL‑VLM‑F属于该路线,让VLM对轨迹对做偏好对比,训练奖励模型。(\mathcal{S})(\mathcal{A})GE不同之处在于,直接获取动作级引导,帮助学习者到达稀疏奖励,最终策略由RL优化得到。

第二类:将基础模型直接作为策略:提示模型输出动作、生成代码策略、视觉‑动作VL(\mathcal{A})模型。也有工作直接在环境交互下微调VLM,RL4VLM使用PPO结合思维链微调VLM智能体。(\mathcal{S})(\mathcal{A})GE采用不同路线:部署运行的是轻量化RL策略,VLM仅在训练阶段临时充当教师,避免每一步控制都调用或微调大模型。

和本文最接近的是将基础模型监督蒸馏到更小策略的工作。LM4TE(\mathcal{A})CH使用LLM专家,对齐RL策略与动作对应的token logit;LVLM2P提示VLM输出动作概率分布文本,再蒸馏到策略。(\mathcal{S})(\mathcal{A})GE的差异:向VLM只请求单个优选动作,生成任务更简单;仅在高熵状态查询教师;评估阶段策略不再依赖教师。Merler等人2025前期工作研究不确定性触发VLM引导RL,发现随着策略熵下降VLM查询次数变少;(\mathcal{S})(\mathcal{A})GE进一步研究:仅熵下降不足以保证策略能力变强(智能体可以变得自信但是依旧犯错),增加显式的教师动作蒸馏,在未见过任务上验证泛化,并通过Oracle、消融实验分离教师质量与学习框架各自的影响。

3 方法

图2 (\mathcal{S})(\mathcal{A})GE总览:每一步训练,如果归一化策略熵H^\hat{\mathcal{H}}H^低于阈值ν\nuν,学习者自行采样动作;否则查询冻结VLM教师并执行教师给出动作。轨迹打上标记gtg_tgt,分为学习者生成集合KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{B}\)}...、教师引导集合KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{B}\)}...。PPO仅在KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{B}\)}...更新(\mathcal{A})ctor;(\mathcal{B})C/(\mathcal{A})W(\mathcal{B})C在KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{B}\)}...;价值函数在全部缓冲区KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{B}\)}训练。

3.1 问题建模

环境建模为马尔可夫决策过程MDP KaTeX parse error: Can't use function '\(' in math mode at position 29: ...langle\mathcal{\̲(̲\mathcal{S}\)},...。KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{S}\)}状态空间,KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{A}\)}离散动作空间,RRR环境奖励,TTT状态转移,γ\gammaγ折扣因子,ρ0\rho_0ρ0初始状态分布。每个时间步学习者观测状态sts_tst,从随机策略πθ(at∣st)\pi_\theta(a_t \mid s_t)πθ(at∣st)采样动作,使用PPO算法训练。实验中sts_tst包含RG(\mathcal{B})图像,部分环境附带文本任务信息。

可以访问在线教师策略πT(⋅∣st)\pi^T(\cdot\mid s_t)πT(⋅∣st),由VLM实现。教师可以在任意状态查询,但有三个限制:调用开销大、不会通过环境交互更新、会输出错误动作,但需要具备一定任务能力才能提供有效信号。

目标: 训练轻量化策略πθ\pi_\thetaπθ,评估阶段不调用πT\pi^TπT,最大化环境回报;同时尽量减少训练阶段教师查询次数。

3.2 基于熵门控的选择性引导

使用智能体自身策略的熵作为不确定性轻量代理指标:

KaTeX parse error: Can't use function '\(' in math mode at position 75: ..._{a\in\mathcal{\̲(̲\mathcal{A}\)}}...

做归一化 KaTeX parse error: Can't use function '\(' in math mode at position 40: ...{\log|\mathcal{\̲(̲\mathcal{A}\)}|...,保证任意离散动作空间下 H^t∈0,1\hat H_t\in0,1H^t∈0,1。该方法模型无关,不需要额外计算开销,在深度强化学习中已经被证明可以作为有效的不确定性信号。

当 H^t>ν\hat H_{t}>\nuH^t>ν(ν\nuν 为固定阈值),学习者查询VLM教师,执行教师返回动作;否则从自身策略采样动作:

at∼μ(⋅∣st)={πT(⋅∣st)if H^t>νπθ(⋅∣st)otherwise a_{t}\sim\mu(\cdot\mid s_{t})= \begin{cases} \pi^{T}(\cdot\mid s_{t})&\text{if }\hat{H}{t}>\nu\\ \pi{\theta}(\cdot\mid s_{t})&\text{otherwise} \end{cases} at∼μ(⋅∣st)={πT(⋅∣st)πθ(⋅∣st)if H^t>νotherwise

每条转移记录指示标记 gt∈{0,1}g_{t}\in\{0,1\}gt∈{0,1},标记动作来自学习者还是教师。维护缓存CCC存储模型返回的状态‑动作对,相同状态下可以减少VLM提示调用开销。

图3 实验使用的RL环境:(i)FrozenLake;(ii)EZPoints;(iii)CardMaze(本文新环境);(iv)(\mathcal{A})LFWorld;(v)MiniGrid Fetch;(vi)GoToDoor;(vii)LavaGap

3.3 分区损失函数

教师引导得到的动作不是学习者策略采样得到的,如果直接当做普通PPO动作会产生离策略不匹配问题。尤其当教师选择学习者概率很低的动作,重要性权重比值会很大,PPO裁剪会过度压制信号。

因此对策略目标做分区。经验缓冲区KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{B}\)}:KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{B}\)}...学习者生成的轨迹;KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{B}\)}...教师引导轨迹。标准PPO裁剪损失Lclip\mathcal{L}\text{clip}Lclip仅在KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{B}\)}...执行:

KaTeX parse error: Can't use function '\(' in math mode at position 60: ...{t\in\mathcal{\̲(̲\mathcal{B}\)}...

教师引导的转移样本不参与PPO策略损失,改为第3.4节行为克隆目标。该做法保留PPO同策略解释,同时允许教师通过独立监督信号影响学习者。

价值函数在全部轨迹(学习者+教师引导样本)上训练。虽然引导样本会改变状态分布,但Critic目标完全来自环境奖励,不依赖教师标签。在稀疏奖励任务中,训练早期教师引导轨迹往往是智能体唯一能观测到的成功轨迹。

3.4 优势加权行为克隆((\mathcal{A})W(\mathcal{B})C)

标准行为克隆损失会无差别模仿全部教师动作:

KaTeX parse error: Can't use function '\(' in math mode at position 74: ...{t\in\mathcal{\̲(̲\mathcal{B}\)}...

但VLM教师并不完美:VLM输出视觉上合理但实际错误的动作,如果直接克隆,会让学习者策略在错误动作上置信度变高,后续遇到相似状态不再请求引导,损害策略性能。

受CRR启发,本文提出优势加权行为克隆(\mathcal{A})W(\mathcal{B})C

KaTeX parse error: Can't use function '\(' in math mode at position 90: ...{t\in\mathcal{\̲(̲\mathcal{B}\)}...

权重 KaTeX parse error: Can't use function '\(' in math mode at position 14: w_{t}=f(\hat \̲(̲\mathcal{A}\)_t...,由教师动作估计优势得到非负权重;本文采用 KaTeX parse error: Can't use function '\(' in math mode at position 8: f(\hat \̲(̲\mathcal{A}\)_t...,τ\tauτ为温度参数;权重裁剪上限为20保证数值稳定性。

优势估计来自基于环境奖励训练得到的Critic网络。(\mathcal{A})W(\mathcal{B})C利用环境反馈调节教师动作蒸馏强度:预估能带来高回报轨迹的教师动作权重更大;效果差的动作权重被压低。训练早期还没有观测到成功轨迹时,Critic输出信息有限,此时(\mathcal{A})W(\mathcal{B})C行为近似普通(\mathcal{B})C,不能完全过滤教师错误。因此(\mathcal{A})W(\mathcal{B})C作为(\mathcal{B})C的可选改进,不是万能过滤器,需要通过实验验证效果。

(\mathcal{S})(\mathcal{A})GE完整目标函数:

KaTeX parse error: Can't use function '\(' in math mode at position 162: ...t{on }\mathcal{\̲(̲\mathcal{B}\)}_...

Lvalue\mathcal{L}_\text{value}Lvalue为环境回报M(\mathcal{S})E价值损失;β\betaβ控制教师蒸馏强度;cvc_vcv价值损失系数;cHc_HcH熵正则系数。

4 实验设置

4.1 环境介绍

  1. FrozenLake 8×8:Gymnasium确定性视觉版本,每episode程序随机生成地图。智能体需要避开冰洞到达终点;只有成功到达才会获得奖励,无法记忆固定路线。
  2. MiniGrid套件:LavaGap、GoToDoor、Fetch,需要视觉导航、障碍物规避、物体交互。
  3. EZPoints:根据两张卡牌数字构造算术表达式得到结果12;动作空间包含卡牌数值与算术运算符;奖励稀疏,非法动作会被惩罚。
  4. CardMaze(本文新增):全新感知符号匹配任务。每个状态提供4张候选卡牌+1张提示卡牌;正确动作选择花色和提示卡匹配的候选卡,存在数字相同但花色不同的干扰卡牌;需要连续5次选择正确才获得奖励。
  5. (\mathcal{A})LFWorld:家庭交互基准,视觉观测、文本目标、文本格式合法动作。仿真与VLM推理开销高,作为探索性压力测试。

全部环境样例截图参考图3。

4.2 基线方法

  1. PPO:仅在视觉观测上训练,无任何外部引导,作为基准。
  2. VLM‑as‑Policy:VLM直接充当策略,CoT提示,每一步都调用VLM;不会通过环境交互迭代优化。
  3. RL‑VLM‑F:VLM输出轨迹对偏好,训练奖励模型做奖励塑形。
  4. LVLM2P:每一步提示VLM输出动作概率分布文本,监督蒸馏到策略。
  5. D(\mathcal{A})gger‑VLM:VLM充当在线专家标注器;学习者与VLM混合收集轨迹,所有访问过的状态交给VLM打标签,(\mathcal{B})C训练学习者。

4.3 (\mathcal{S})(\mathcal{A})GE变体(消融实验组)

  1. (\mathcal{S})(\mathcal{A})GE w/o (\mathcal{B})C:熵门控查询、执行教师动作,但移除(\mathcal{B})C/(\mathcal{A})W(\mathcal{B})C蒸馏损失;仅依靠探索,不做监督蒸馏。
  2. (\mathcal{S})(\mathcal{A})GE w/o (\mathcal{A})W(\mathcal{B})C:保留(\mathcal{B})C蒸馏,移除优势加权,使用普通行为克隆。
  3. (\mathcal{S})(\mathcal{A})GE + Oracle:把VLM替换为规则完美Oracle教师,仅用于诊断实验,看性能瓶颈来自教师质量还是学习算法本身。

5 实验结果

除(\mathcal{A})LFWorld使用Gemma3‑27(\mathcal{B}),其余VLM基线与(\mathcal{S})(\mathcal{A})GE均使用Qwen3.5‑27(\mathcal{B})。评估全部在训练未见过的随机种子上运行,推理阶段不使用VLM,衡量自主策略性能。大部分环境训练总环境步数100k;(\mathcal{A})LFWorld因为开销限制训练40k;D(\mathcal{A})gger‑VLM调用VLM代价高,训练步数25k。每个实验组3个随机种子。超参数见附录(\mathcal{A}),超参扫描见附录(\mathcal{B}),VLM调用开销统计见附录C,VLM提示模板见附录F。

5.1 主实验结果

表1:各环境性能对比,单元格为3种子平均episode峰值回报(括号内标准差);每列粗体最优;下划线为非Oracle条件下最优。

Method FrozenLake EZPoints CardMaze Fetch GoToDoor LavaGap (\mathcal{A})LFWorld
PPO 0.000 (0.000) 0.000 (0.000) 0.007 (0.006) 0.075 (0.034) 0.131 (0.015) 0.945 (0.000) 0.111 (0.019)
VLM‑as‑Policy \underline{0.117} (0.065) \underline{0.175} (1.488) 0.000 (0.000) \underline{0.310} (0.044) 0.127 (0.019) 0.083 (0.143) 0.108 (0.000)
LVLM2P 0.000 (0.000) −2.868 (2.618) 0.000 (0.000) 0.036 (0.040) 0.020 (0.026) 0.000 (0.000) ---
RL‑VLM‑F 0.007 (0.012) −0.450 (0.507) 0.037 (0.064) 0.062 (0.006) 0.111 (0.040) 0.190 (0.329) ---
D(\mathcal{A})gger 0.007 (0.012) −3.970 (0.165) 0.993 (0.012) 0.099 (0.000) 0.052 (0.028) 0.000 (0.000) ---
(\mathcal{S})(\mathcal{A})GE (Ours) 0.103 (0.111) 0.000 (0.000) 1.000 (0.000) 0.122 (0.025) \underline{0.147} (0.017) 0.688 (0.212) 0.150 (0.017)
(\mathcal{S})(\mathcal{A})GE + Oracle 0.697 (0.127) 10.000 (0.000) 0.663 (0.574) 0.456 (0.107) 0.268 (0.029) 0.945 (0.000) 0.100 (0.027)

核心观察:

  1. 在CardMaze、GoToDoor、Fetch、(\mathcal{A})LFWorld,(\mathcal{S})(\mathcal{A})GE显著优于PPO基线。CardMaze任务上(\mathcal{S})(\mathcal{A})GE得到满分1.000,但是直接把VLM当做策略VLM‑as‑Policy回报为0.000:VLM直接执行策略效果很差,但作为训练引导源,(\mathcal{S})(\mathcal{A})GE可以学习得到超越教师本身的自主策略。D(\mathcal{A})gger在CardMaze同样效果好,但D(\mathcal{A})gger每一步训练都必须调用VLM。
  2. (\mathcal{S})(\mathcal{A})GE大幅降低VLM调用开销:6个受控环境中,VLM调用占训练总步数比例仅1.2%‑13.3%;高调用比例出现在CardMaze(13.3%,状态空间更丰富,需要引导的阶段更长)。推理阶段零VLM调用。对比VLM‑as‑Policy / LVLM2P / D(\mathcal{A})gger训练阶段100%每步调用VLM。
  3. 部分场景(\mathcal{S})(\mathcal{A})GE收益有限:LavaGap任务PPO基线本身就可以很好解决,引导无法带来提升;FrozenLake、EZPoints在Qwen3.5‑27(\mathcal{B})作为教师时,VLM输出引导质量不足,性能受限。
  4. Oracle教师并不一定全部优于VLM教师:推测Oracle确定性输出会造成策略过拟合特定轨迹;VLM的随机次优输出起到正则效果,缓解价值过估计。

5.2 教师质量的影响

更换Gemma3‑27(\mathcal{B})作为VLM教师做对照实验。发现:VLM直接执行策略的性能,不能完全等价于该VLM作为(\mathcal{S})(\mathcal{A})GE教师的有效性。EZPoints:Gemma直接执行策略回报‑3.400,但作为(\mathcal{S})(\mathcal{A})GE教师,(\mathcal{S})(\mathcal{A})GE可以到达最优10.000;Qwen直接执行策略有0.175,但(\mathcal{S})(\mathcal{A})GE使用Qwen反而无法解决EZPoints。随机教师对照组证明:完全无效的随机动作引导不能带来任何收益,甚至会破坏已经学会的策略。

结论:(\mathcal{S})(\mathcal{A})GE适合存在缺陷但仍含有任务有效信息的教师;完全无信息、系统性误导的引导无法带来收益。

5.3 消融实验

表2消融实验(峰值episode回报,3种子均值±标准差)

Method FrozenLake EZPoints CardMaze Fetch GoToDoor LavaGap
(\mathcal{S})(\mathcal{A})GE 0.103 (0.111) 0.000 (0.000) 1.000 (0.000) 0.122 (0.025) 0.147 (0.017) 0.688 (0.212)
(\mathcal{S})(\mathcal{A})GE w/o (\mathcal{A})W(\mathcal{B})C 0.180 (0.167) 0.000 (0.000) 0.977 (0.032) 0.112 (0.021) 0.160 (0.049) 0.670 (0.320)
(\mathcal{S})(\mathcal{A})GE w/o (\mathcal{B})C 0.000 (0.000) −2.410 (3.408) 0.000 (0.000) 0.060 (0.010) 0.069 (0.036) 0.000 (0.000)
(\mathcal{S})(\mathcal{A})GE + Oracle 0.697 (0.127) 10.000 (0.000) 0.663 (0.574) 0.456 (0.107) 0.268 (0.029) 0.945 (0.000)
(\mathcal{S})(\mathcal{A})GE + Oracle w/o (\mathcal{B})C 0.000 (0.000) −3.037 (2.632) 0.000 (0.000) 0.020 (0.034) 0.000 (0.000) 0.000 (0.000)

关键消融结论:

  1. (\mathcal{B})C蒸馏损失是必不可少的核心组件:移除(\mathcal{B})C之后,即便训练过程仍然执行教师给出的动作,全部环境性能都会大幅崩塌;哪怕使用完美Oracle教师,去掉(\mathcal{B})C之后性能也近乎归零。仅仅靠探索采样轨迹是不够的,教师动作必须提供显式监督信号,策略才能内化行为。
  2. (\mathcal{A})W(\mathcal{B})C(优势加权)对比普通(\mathcal{B})C,没有稳定一致收益,性能差异处于种子随机波动范围内。(\mathcal{A})W(\mathcal{B})C是可选改进,框架的核心是行为克隆蒸馏本身。

5.4 长周期5M环境步数实验(Oracle教师)

表3,5M环境步长实验,验证引导带来的提升不只是样本效率加速,而是学到更好策略。

Environment PPO (\mathcal{S})(\mathcal{A})GE + Oracle
FrozenLake 0.003 (0.006) 0.997 (0.006)
EZPoints 0.000 (0.000) 10.000 (0.000)
CardMaze 0.007 (0.006) 1.000 (0.000)
Fetch 0.137 (0.055) 0.470 (0.208)
GoToDoor 0.180 (0.020) 0.283 (0.116)
LavaGap 0.945 (0.000) 0.945 (0.000)

在FrozenLake、EZPoints、CardMaze,PPO训练5M步性能依旧接近0;(\mathcal{S})(\mathcal{A})GE+Oracle几乎达到最优。证明引导改变智能体能够发现的轨迹集合,而不只是加快已经找到奖励后的收敛速度。

6 结论与局限性

本文提出(\mathcal{S})(\mathcal{A})GE框架,从开销昂贵、在线、存在缺陷但具备信息增益的VLM教师,训练轻量化自主RL策略。(\mathcal{S})(\mathcal{A})GE训练阶段基于策略熵判断不确定性,高熵状态选择性查询VLM,执行教师动作;分区RL目标结合行为克隆(可选优势加权(\mathcal{A})W(\mathcal{B})C),将引导蒸馏到学习者;评估阶段策略完全自主,不再需要VLM。

在稀疏奖励视觉决策任务上,(\mathcal{S})(\mathcal{A})GE可以把有缺陷的VLM教师转化为有效的训练信号;多个环境优于无引导PPO,部分任务学到的策略性能超越VLM教师本身。教师质量实验证明:VLM直接执行策略好坏不等于作为教师的好坏;部分直接表现很差的VLM仍然可以提供干预信号,帮助智能体发现高回报行为。

局限性

  1. 使用策略熵作为不确定性代理指标:简单开销低,但会混淆真实不确定性与动作多模态;无法直接估计教师在该状态下是否有用。未来可以集成集成模型、价值估计分歧、可学习查询策略获得更精准触发条件。
  2. 实验聚焦离散动作空间;扩展连续控制存在难点,当前VLM很难输出精确底层数值动作;更可行方向:VLM输出高层子目标/技能抽象。
  3. (\mathcal{S})(\mathcal{A})GE假设教师需要具备一定任务能力;完全无信息、系统性误导引导会带来负向效果;本框架不能保证在该条件下鲁棒;未来工作需要开发执行前评估教师输出有效性的机制。
  4. (\mathcal{A})LFWorld仅作为初步压力测试,训练预算有限;受控测试环境聚焦稀疏‑奖励探索问题,不完全等价真实世界具身交互。更大规模具身实验、更强教师、交互式模仿学习基线对比属于未来方向。

潜在风险

当VLM教师输出存在系统性偏差、不安全行为,但依旧得到看起来成功的轨迹,(\mathcal{S})(\mathcal{A})GE会将偏差蒸馏进入学习策略。(\mathcal{A})W(\mathcal{B})C相比普通(\mathcal{B})C没有展现稳定鲁棒增益;如果奖励函数本身存在错误、不完备,不能保证学习策略安全对齐。部署前必须经过人工评估,尤其安全关键场景。

制品与许可证

实验构建在Gymnasium、MiniGrid、(\mathcal{A})LFWorld、Qwen、Gemma公开环境与模型之上,遵循各自许可。代码、提示词、CardMaze环境资产将在开源仓库发布,第三方组件遵循对应许可。

致谢

Giovanni (\mathcal{B})onetta、(\mathcal{B})ernardo Magnini得到意大利PNRR‑MUR项目PE0000013‑F(\mathcal{A})IR((\mathcal{S})poke2)项目资助。

参考文献

完整参考文献参见arXiv原文页面。

附录

附录(\mathcal{A}) 实验超参数

表4 (\mathcal{S})(\mathcal{A})GE各环境关键超参

Parameter FrozenLake EZPoints CardMaze Fetch GoToDoor LavaGap (\mathcal{A})LFWorld
Guidance VLM Qwen/Qwen3.5‑27(\mathcal{B}) Qwen/Qwen3.5‑27(\mathcal{B}) Qwen/Qwen3.5‑27(\mathcal{B}) Qwen/Qwen3.5‑27(\mathcal{B}) Qwen/Qwen3.5‑27(\mathcal{B}) Qwen/Qwen3.5‑27(\mathcal{B}) google/gemma‑3‑27b‑it
Entropy threshold (ν\nuν) 0.75 0.75 0.25 0.75 0.75 0.75 0.25
(\mathcal{B})C coefficient (β\betaβ) 1.0 1.0 1.0 1.0 1.0 1.0 1.0
(\mathcal{A})W(\mathcal{B})C temperature (τ\tauτ) 0.5 0.5 0.5 0.5 0.5 0.5 ---

表5 PPO通用训练超参数

Parameter Value
(\mathcal{A})gent type CNN (+ L(\mathcal{S})TM text encoder for (\mathcal{A})LFWorld)
Convolution channels 16, 32, 32
Conv head out features 256
(\mathcal{A})ctor std init 0.01
Critic std init 1
Gamma (γ\gammaγ) 0.99
G(\mathcal{A})E lambda (λ\lambdaλ) 0.95
Value loss coef 0.5
Entropy coef 0.01
Clip coef 0.2
Clip value loss true
(\mathcal{A})dvantage normalization true
Learning rate 1×10−31\times10^{-3}1×10−3
Learning rate annealing true
Max gradient norm 0.5
PPO epochs 8
Minibatches 4
(\mathcal{B})atch size 512

附录(\mathcal{B}) 超参扫描

CardMaze环境扫描(\mathcal{B})C系数β\betaβ、熵阈值ν\nuν,每个设置3种子。

  • β\betaβ最优在1.0附近;
  • ν\nuν有效区间约0.05‑0.45。

附录C VLM训练查询开销

统计训练阶段真实VLM调用次数,缓存命中不会产生新调用。统计每个环境总VLM调用数目与调用占总环境步比例。

Environment (\mathcal{S})teps VLM calls Rate
FrozenLake 100k 1708±5311708\pm5311708±531 1.7%
EZPoints 100k 1160±2781160\pm2781160±278 1.2%
CardMaze 100k 13251±129513251\pm129513251±1295 13.3%
Fetch 100k 2718±10592718\pm10592718±1059 2.7%
GoToDoor 100k 2144±8422144\pm8422144±842 2.1%
LavaGap 100k 1963±6171963\pm6171963±617 2.0%

附录D VLM提示词模板(F)

完整VLM提示模板、示例,见开源仓库与arXiv附录F。

附录E 计算资源

硬件:单张RTX‑3090;完整实验总GPU耗时约220小时。

相关推荐
夜雪一千22 分钟前
如何写一个数据分析 Skill
人工智能·数据挖掘·数据分析
桃西西呀22 分钟前
RAG 接个向量库就完事?从切块到重排的 7 步流水线,我替你踩了 8 个深坑
人工智能·llm·ai编程
幸运小圣26 分钟前
JavaScript 关键字与保留字学习笔记详细讲解,一篇get ✅【JavaScript查缺补漏】
javascript·笔记·学习
YOLO数据集集合27 分钟前
无人机屋顶与地物分割数据集 | 屋顶分割 航拍识别 城市规划 材质分类 实例分割9036期
人工智能·分类·无人机·材质·中国城市建筑·建筑识别
zhangfeng113333 分钟前
CodeBuddy‑CLI 默认授权(权限模式)命令行参数
人工智能·ai编程
道可云41 分钟前
工赋·青听 | 从AI素养到专属智能体,共探化工行业数字化转型新路径
人工智能
baopixiaoz42 分钟前
BeeQuant × BeeAgent:AI量化新范式
大数据·人工智能·python·区块链
海兰1 小时前
【部署】升级现有的 OpenClaw 到最新版(v2026.8.2)
人工智能·openclaw
Raas1001 小时前
AI网关在架构中的位置?MAI Gateway(魔芋企业级AI网关)给出企业级答案
大数据·网络·人工智能·架构·gateway·ai网关·mai gateway