RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback

Portal

Motivation

在不采用人工干预的情况下,降低强化学习中奖励设计的人工成本。

许多机器人任务很难手写有效奖励,尤其是布料、绳索等难以用少量几何变量描述的任务。VLM 可以理解图像与任务描述,但直接要求它给出绝对分数,容易出现尺度不一致和噪声。

核心主张

让 VLM 判断"哪个更好",再从比较中学习奖励,比直接让 VLM 打分更有效。

这个主张不要求 VLM 准确估计完成百分比,而要求其比较能够提供足够有用的监督;它并不保证视觉判断始终正确。原文引言与方法

训练流程

  1. 采集与比较。 策略与环境交互,从图像缓冲区随机抽取两张图,结合任务描述查询 VLM。先生成比较分析,再提取"第一张更好/第二张更好/无法区分";无法区分的样本不参与奖励训练。

  2. 从偏好学习奖励。 奖励网络 r ψ ( I ) r_\psi(I) rψ(I) 输出标量,用 Bradley--Terry 模型表示偏好概率:

    P ψ ( I 1 ≻ I 0 ) = sigmoid ⁡  ⁣ ( r ψ ( I 1 ) − r ψ ( I 0 ) ) P_\psi(I^1\succ I^0) = \operatorname{sigmoid}\!\left(r_\psi(I^1)-r_\psi(I^0)\right) Pψ(I1≻I0)=sigmoid(rψ(I1)−rψ(I0))

    以 VLM 标签为监督,最小化交叉熵,使偏好图像获得相对更高的奖励。

  3. 用学习奖励训练策略。 使用 SAC 更新 critic 和 actor;奖励模型每次更新后,重新计算整个 replay buffer 的奖励。不断交替进行环境探索、偏好采集、奖励学习与策略学习。原文 §3--§5、算法 1

图像偏好 → 奖励模型 → critic → 策略 \boxed{ \text{图像偏好} \rightarrow \text{奖励模型} \rightarrow \text{critic} \rightarrow \text{策略} } 图像偏好→奖励模型→critic→策略

需要保留的实验边界是:比较单位是单张图像,奖励模型使用图像,策略使用状态输入 ;因此论文并未直接验证纯视觉策略或同起点下的动作优劣比较。附录 A.1

可能存在的问题

  1. VLM可能并不能区分一些精细任务的图像好坏,只能区分一些很明显的远近关系(如果是小型的本地VLM的话,可能连这个都做不到)。
  2. 理想上对于图像来说,VLM判断出来的并不一定是严格的偏序关系,可能会成环导致环上奖励互相抬高/降低,而奖励是量化的,存在偏序关系的,存在矛盾。
  3. 奖励的复杂化,稠密化可能会导致RL尝试在小区域内不断刷奖励,而不是追求最好的目标。
相关推荐
qq_214782612 小时前
再见Visio,再见draw.io,又一个画图Skill
人工智能·机器学习·draw.io
倔强的石头1062 小时前
【深度学习】词嵌入技术_从Word2Vec到现代Embedding
人工智能·深度学习·机器学习
宣宣猪的小花园.3 小时前
【机器学习】神经网络与表征:为什么深度学习能自动提取特征
人工智能·嵌入式硬件·算法·机器学习
来让爷抱一个4 小时前
2026 表示工程实战:八帧跳跃不许特征乱漂,百智云精灵图把激活引导写进素材包
人工智能·机器学习
tellmewhoisi4 小时前
机器学习:概述2(建模流程,特征工程和鸢尾花案例)
机器学习
明志数科4 小时前
机器人商业化验证中 真工业场景数据与训练场数据的差异分析
人工智能·机器学习
tellmewhoisi6 小时前
机器学习:线性回归2(前置知识,导数,矩阵)
机器学习
nagualky1237 小时前
AI Agent上线后怎么升级?先建立一套可回滚的变更控制
人工智能·机器学习·语言模型·软件工程
宁渡AI大模型9 小时前
河南宁渡科技有限公司|宁渡课堂 AI 全栈面试分享,RAG 项目面试深挖问题解析
人工智能·机器学习·rag