RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback

Portal

Motivation

在不采用人工干预的情况下,降低强化学习中奖励设计的人工成本。

许多机器人任务很难手写有效奖励,尤其是布料、绳索等难以用少量几何变量描述的任务。VLM 可以理解图像与任务描述,但直接要求它给出绝对分数,容易出现尺度不一致和噪声。

核心主张

让 VLM 判断"哪个更好",再从比较中学习奖励,比直接让 VLM 打分更有效。

这个主张不要求 VLM 准确估计完成百分比,而要求其比较能够提供足够有用的监督;它并不保证视觉判断始终正确。原文引言与方法

训练流程

  1. 采集与比较。 策略与环境交互,从图像缓冲区随机抽取两张图,结合任务描述查询 VLM。先生成比较分析,再提取"第一张更好/第二张更好/无法区分";无法区分的样本不参与奖励训练。

  2. 从偏好学习奖励。 奖励网络 r ψ ( I ) r_\psi(I) rψ(I) 输出标量,用 Bradley--Terry 模型表示偏好概率:

    P ψ ( I 1 ≻ I 0 ) = sigmoid ⁡  ⁣ ( r ψ ( I 1 ) − r ψ ( I 0 ) ) P_\psi(I^1\succ I^0) = \operatorname{sigmoid}\!\left(r_\psi(I^1)-r_\psi(I^0)\right) Pψ(I1≻I0)=sigmoid(rψ(I1)−rψ(I0))

    以 VLM 标签为监督,最小化交叉熵,使偏好图像获得相对更高的奖励。

  3. 用学习奖励训练策略。 使用 SAC 更新 critic 和 actor;奖励模型每次更新后,重新计算整个 replay buffer 的奖励。不断交替进行环境探索、偏好采集、奖励学习与策略学习。原文 §3--§5、算法 1

图像偏好 → 奖励模型 → critic → 策略 \boxed{ \text{图像偏好} \rightarrow \text{奖励模型} \rightarrow \text{critic} \rightarrow \text{策略} } 图像偏好→奖励模型→critic→策略

需要保留的实验边界是:比较单位是单张图像,奖励模型使用图像,策略使用状态输入 ;因此论文并未直接验证纯视觉策略或同起点下的动作优劣比较。附录 A.1

可能存在的问题

  1. VLM可能并不能区分一些精细任务的图像好坏,只能区分一些很明显的远近关系(如果是小型的本地VLM的话,可能连这个都做不到)。
  2. 理想上对于图像来说,VLM判断出来的并不一定是严格的偏序关系,可能会成环导致环上奖励互相抬高/降低,而奖励是量化的,存在偏序关系的,存在矛盾。
  3. 奖励的复杂化,稠密化可能会导致RL尝试在小区域内不断刷奖励,而不是追求最好的目标。
相关推荐
β添砖java9 小时前
机器学习7:朴素贝叶斯、情感分类案例、聚类算法、Kmeans实现流程、模型评估方法、案例顾客数据聚类分析法
人工智能·机器学习
迷路爸爸1809 小时前
梯度消失和梯度爆炸
人工智能·深度学习·机器学习
Omics Pro9 小时前
微软:多模态生物世界模型
数据库·人工智能·算法·microsoft·机器学习·自然语言处理
Rocky Ding*10 小时前
深度解析LlamaGen核心基础知识
论文阅读·人工智能·深度学习·机器学习·aigc·ai-native·llamagen
hai31524754310 小时前
语言学矩阵原理
人工智能·机器学习·矩阵
Omics Pro10 小时前
~30,000+引用!理论2005,R包2008,多组学集成AI增强
开发语言·数据库·人工智能·算法·机器学习·自然语言处理·r语言
袖清暮雨11 小时前
机器学习之逻辑回归
人工智能·机器学习·ai
β添砖java11 小时前
机器学习8:数据挖掘案例-南方电网电力负荷预测 ---完结!
人工智能·机器学习·数据挖掘
薛定e的猫咪11 小时前
(AISTATS 2023)BaCaDI:未知干预下的贝叶斯因果发现
人工智能·深度学习·算法·机器学习
每天都要写算法(努力版)20 小时前
【行业前沿报告】DAgger:让智能体在自己走到的状态上学习
人工智能·学习·机器学习