Motivation
在不采用人工干预的情况下,降低强化学习中奖励设计的人工成本。
许多机器人任务很难手写有效奖励,尤其是布料、绳索等难以用少量几何变量描述的任务。VLM 可以理解图像与任务描述,但直接要求它给出绝对分数,容易出现尺度不一致和噪声。
核心主张
让 VLM 判断"哪个更好",再从比较中学习奖励,比直接让 VLM 打分更有效。
这个主张不要求 VLM 准确估计完成百分比,而要求其比较能够提供足够有用的监督;它并不保证视觉判断始终正确。原文引言与方法
训练流程
-
采集与比较。 策略与环境交互,从图像缓冲区随机抽取两张图,结合任务描述查询 VLM。先生成比较分析,再提取"第一张更好/第二张更好/无法区分";无法区分的样本不参与奖励训练。
-
从偏好学习奖励。 奖励网络 r ψ ( I ) r_\psi(I) rψ(I) 输出标量,用 Bradley--Terry 模型表示偏好概率:
P ψ ( I 1 ≻ I 0 ) = sigmoid ( r ψ ( I 1 ) − r ψ ( I 0 ) ) P_\psi(I^1\succ I^0) = \operatorname{sigmoid}\!\left(r_\psi(I^1)-r_\psi(I^0)\right) Pψ(I1≻I0)=sigmoid(rψ(I1)−rψ(I0))
以 VLM 标签为监督,最小化交叉熵,使偏好图像获得相对更高的奖励。
-
用学习奖励训练策略。 使用 SAC 更新 critic 和 actor;奖励模型每次更新后,重新计算整个 replay buffer 的奖励。不断交替进行环境探索、偏好采集、奖励学习与策略学习。原文 §3--§5、算法 1
图像偏好 → 奖励模型 → critic → 策略 \boxed{ \text{图像偏好} \rightarrow \text{奖励模型} \rightarrow \text{critic} \rightarrow \text{策略} } 图像偏好→奖励模型→critic→策略
需要保留的实验边界是:比较单位是单张图像,奖励模型使用图像,策略使用状态输入 ;因此论文并未直接验证纯视觉策略或同起点下的动作优劣比较。附录 A.1
可能存在的问题
- VLM可能并不能区分一些精细任务的图像好坏,只能区分一些很明显的远近关系(如果是小型的本地VLM的话,可能连这个都做不到)。
- 理想上对于图像来说,VLM判断出来的并不一定是严格的偏序关系,可能会成环导致环上奖励互相抬高/降低,而奖励是量化的,存在偏序关系的,存在矛盾。
- 奖励的复杂化,稠密化可能会导致RL尝试在小区域内不断刷奖励,而不是追求最好的目标。