论文:VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning(The University of Hong Kong / Shanghai AI Lab,arXiv 预印本,cs.CV)
发布时间:2025 年 6 月 20 日(arXiv v1)
作者:Zhangyang Qi、Zhixiong Zhang、Yizhou Yu、Jiaqi Wang、Hengshuang Zhao(共 5 人;Jiaqi Wang、Hengshuang Zhao 为通讯作者)
核心一句话:用 Qwen2-VL 这类 LVLM 直接把第一人称视频流翻译成 FORWARD/TURN-LEFT/TURN-RIGHT/STOP 连续动作,受 DeepSeek-R1 启发做 GRPO 强化微调,并设计时间衰减奖励(TDR)对多步未来动作按距当前时刻指数衰减地加权------在 VLN-CE R2R 上 7B 模型拿到 30.2% 成功率,2B 模型经 RFT 反超 7B 的 SFT,证明 LVLM 能靠奖励驱动的后训练驱动具身导航。
配套资源
- 项目主页(方法说明、定性视频与补充材料入口):vlnr1.github.io
核心关键词
- 连续环境视觉语言导航(VLN-CE):把 VLN 从"视点间跳转"的离散拓扑图推进到连续空间------agent 不再在预定义节点间瞬移,而是输出前进距离、转向角度这类低层运动控制,在仿真器里自由移动。
- VLN-Ego 数据集:本文为训练 LVLM 而自建的数据引擎,用 Habitat 在 Matterport3D 场景里沿 R2R/RxR 轨迹采集第一人称视频流与对应未来动作对,分别得到 630K 与 1.2M 训练样本,是让 LVLM 学会连续导航的"语料地基"。
- Long-Short Memory Sampling:本文提出的历史帧采样策略------近 M 步用细采样率 δ₁ 保留细节,更早的历史用粗采样率 δ₂(δ₂>δ₁)保住长程上下文,刻意对冲"均匀采样忽略近期"与"指数衰减丢失长程"两端短板。
- Group Relative Policy Optimization(GRPO):DeepSeek 系列使用的策略优化算法,对同一问题生成一组响应、做组内归一化得相对优势,在线、无需 critic 也无需离线偏好数据,是本文 RFT 阶段的优化器。
- Reinforcement Fine-Tuning(RFT):本文两阶段训练的第二阶段------在 SFT 之后用 GRPO 进一步优化模型,用可验证的导航奖励而非人类偏好做信号,是连续导航决策上首次系统应用 RFT。
- Time-Decayed Reward(TDR):本文为多步动作预测设计的奖励函数,对 n 步未来动作按 γ^k 指数衰减加权,越靠近当前时刻的动作权重越高,把"整段文本是否匹配"的粗粒度监督细化成"逐动作、且带时序优先级"的信号。
- 第一人称(egocentric)视频流:模型唯一的感知输入------只用 RGB 第一人称视频,不依赖深度图、导航地图或 CLIP 这类额外模态/对齐模块,这是 VLN-R1 相对多数 VLN-CE 方法的关键简化。
- Qwen2-VL 作为导航骨架:选 2B 与 7B 两档 LVLM 做基座,把"导航动作的文本预测"当成 LVLM 的生成任务来训练,验证 LVLM 可作为具身导航的统一策略头。
带着问题阅读
- VLN 早有离散导航图方案,VLN-CE 也已支持连续动作,为什么非要把 LVLM 直接接到第一人称视频上?这一步省掉了什么、又新增了什么代价?
- DeepSeek-R1/GRPO 是为数学、代码这类"有客观答案"的任务设计的,导航动作哪来的"可验证奖励"?TDR 又怎么把一串多步动作变成可优化的标量信号?
- SFT 已经能把模型输出对齐到专家动作序列,为什么还要再叠一层 RFT?RFT 全程只用 20K 样本却能让 2B 反超 7B,凭的是什么?
- 2B 经 RFT 反超 7B 的 SFT,到底是"小模型靠 RL 匹敌大模型"在具身导航上的又一次复现,还是 VLN-CE 评测口径下的某种巧合?
- 论文只评模拟室内、动作仍离散成四类原子动作------这套范式离真机连续控制还差几步?
一、核心导读
视觉语言导航(VLN)的难点从来不只是"看懂图像、听懂话",而是要把一段自然语言指令、一连串实时第一人称画面、一组要自己决定何时停下的动作三者在线咬合。早期 VLN 把可通行区域建模成视点图、让 agent 在节点间跳转;后来 VLN-CE 把动作推进到连续空间,却往往要搭上深度图、导航地图和 CLIP 这类额外模态才跑得动。再往后,大语言模型进场当"规划师",可它们仍要把视觉先转成文本再规划,误差一路累积,而且大多仍绑在离散导航图上。VLN-R1 想做的事可以压成一句:让 LVLM 直接吃第一人称视频、直接吐出连续动作,并用 DeepSeek-R1 式的强化微调来校准它。

如上图所示,作者用一张对照图把本文的站位讲得非常直白:以前的 LLM/LVLM 方案站在离散位置上、用第三人称视角做路径规划;VLN-R1 则直接在连续环境里用第一人称视频探索,训练分 SFT(监督输出文本对齐专家)与 RFT(强化微调)两阶段。这个"从离散图到连续动作、从第三人称规划到第一人称端到端"的位移,就是全文的技术拐点。而支撑这一位移的,是三块拼图:自建的 VLN-Ego 数据集解决"LVLM 没有连续导航语料"的问题、Long-Short Memory 解决"长视频历史帧怎么选"的问题、GRPO + TDR 解决"导航动作怎么变成可验证奖励信号"的问题。本文最终的判断也不在"我们刷新了数字",而在两层证据:其一,7B 模型在 VLN-CE R2R Val-Unseen 上仅用 RGB 就拿到 30.2% 成功率;其二,2B 模型经 RFT 反而超过 7B 的 SFT------这与 DeepSeek-R1 "小模型靠 RL 追平大模型"的结论在具身导航上同构。
二、问题背景:作者站在什么技术拐点上
2.1 LLM 当规划师的"视觉被抽象掉"老路与误差累积
把大语言模型接进 VLN,主流做法是让它当"规划师":先用视觉基础模型把环境观测转成文字描述,再让 LLM 基于文本做路径规划。这条路线把"看"这一步外包给了现成的视觉模型,看似省事,实则把误差前置并累积------视觉描述一旦失真或漏掉关键地标,后续规划再聪明也救不回来。更关键的是,这些方法大多仍绑在预定义导航图 上,agent 在节点间跳转,谈不上真正连续的具身交互。NaVid、Uni-Navi 等工作虽把 LVLM 引入连续导航,是重要进步,但仍依赖相当复杂的模块化视觉处理流水线,可扩展性与泛化性都被这条流水线卡住。VLN-R1 的立场很明确:与其让 LVLM 间接地"读"环境,不如让它直接"看"第一人称视频并生成动作。
2.2 VLN-CE 的连续化与额外模态依赖
VLN-CE 已经把 VLN 从离散视点推进到连续空间,支持转角、步长这类低层控制,让 agent 能在仿真器里自由移动。但既有 VLN-CE 方法往往要额外喂深度图、导航地图,并依赖 CLIP 之类的专用模型做视觉-语言对齐------这些额外模态和模块在人机交互的真实场景里并不总能拿到,也限制了方法的可迁移性。VLN-R1 的取舍是反过来的:只用第一人称 RGB 视频,把额外传感器和外部对齐模块全部砍掉,让 LVLM 自己把视觉、语言、动作三者端到端打通。这个简化是有代价的------模型要独自扛起原本由深度图和地图承担的空间推理------但它换来的是更干净、更接近"人怎么走"的输入接口。
三、核心思路:用一条主线串起来
整篇工作的主线可以压成一句:把连续导航动作的生成当成 LVLM 的文本生成任务来训------先 SFT 让模型学会像专家一样"说"出多步动作文本,再用 GRPO 做强化微调,以时间衰减奖励把"整段文本对不对"细化成"每一步动作对不对、且越近的越重要",从而在没有人类偏好标注的情况下用可验证信号把 LVLM 校准成导航策略。 三块拼图各司其职:VLN-Ego 提供"视频---动作"语料,Long-Short Memory 决定历史帧怎么喂进 LVLM,GRPO+TDR 决定 RFT 阶段的优化目标。作者自陈三条主要贡献:
| 序号 | 贡献 | 原文依据 | 解读 |
|---|---|---|---|
| 1 | 提出 VLN-Ego 数据集 | 3.2 节、Figure 2 | 首个面向 LVLM 连续导航训练的第一人称视频---动作对数据引擎,填上"LVLM 不会导航"的语料缺口 |
| 2 | 提出 VLN-R1 端到端框架 | 1 节贡献列表、Figure 1 | LVLM 直接处理 egocentric 视频、输出实时连续动作,去掉导航图与额外传感器 |
| 3 | 首次把 GRPO+RFT 用于 VLN,并设计 TDR | 3.4 节、公式(9) | 把 DeepSeek-R1 式的"可验证奖励后训练"移植到连续导航决策,并量身定制时序加权奖励 |
四、方法展开:沿着论文原始逻辑拆解
4.1 预备:从 RLVR 到 GRPO,"可验证奖励"是怎么进来的
要理解 RFT 为什么能用,得先看它依赖的两个前置概念。第一个是RLVR(Reinforcement Learning with Verifiable Rewards) :和依赖人类反馈学"什么是对的"的 RLHF 不同,RLVR 针对数学、代码这类有客观 ground-truth 的任务,奖励函数可以写得很简洁------输出等于真值就给 1、否则给 0------而且更贴任务本身的内在评判标准。其优化目标是策略期望奖励减去一个相对参考模型的 KL 惩罚:
公式(1):
max π θ E o ∼ π θ ( q ) R R L V R ( q , o ) = R ( q , o ) − β K L π θ ( o ∣ q ) ∥ π r e f ( o ∣ q ) \max_{\pi_{\theta}}\; \mathbb{E}{o\sim\pi{\theta}(q)}\!\left\\,R_{\\mathrm{RLVR}}(q,o)\\,\\right = R(q,o) - \beta\,\mathrm{KL}\!\left\\pi_{\\theta}(o\|q)\\,\\\|\\,\\pi_{\\mathrm{ref}}(o\|q)\\right πθmaxEo∼πθ(q)RRLVR(q,o)=R(q,o)−βKLπθ(o∣q)∥πref(o∣q)
其中 π r e f \pi_{\mathrm{ref}} πref 是优化前的参考模型, β \beta β 控制 KL 惩罚的比重。最朴素的 R ( q , o ) R(q,o) R(q,o) 是硬奖励:输出恰好等于真值得 1、否则 0。VLN-R1 正是要在这个"硬奖励"太粗、不足以监督一串时序动作的痛点上做文章------它后来引入的 TDR 本质上就是把 0/1 硬奖励改造成带时序权重的"软奖励"。
第二个是 GRPO ,也是 R1-Zero 用的策略优化算法。它相对 PPO(需要 critic 模型)和 DPO(需要离线偏好数据)的优势在于:在线、无显式 reward model、只做组内归一化 。对同一个问题 q q q,策略 π θ \pi_{\theta} πθ 生成一组 G G G 个响应 { o 1 , ... , o G } \{o_1,\dots,o_G\} {o1,...,oG} 并打分 { r 1 , ... , r G } \{r_1,\dots,r_G\} {r1,...,rG},然后按组内均值方差归一化得到相对优势:
公式(3):
A i = r i − μ { r 1 , ... , r G } σ { r 1 , ... , r G } A_i = \frac{r_i - \mu\{r_1,\dots,r_G\}}{\sigma\{r_1,\dots,r_G\}} Ai=σ{r1,...,rG}ri−μ{r1,...,rG}
GRPO 鼓励模型在同组里偏爱奖励更高的响应。它的完整目标函数是在带 clip 的比率项上做 min 操作、再减 KL------ratio 大于 1 表示更偏爱该响应,clip 和 min 让更新保守(高奖励响应适度加码、低奖励响应谨慎惩罚),KL 项防止偏离参考模型太远、避免 reward-hacking。这套机制原本服务于"有标准答案"的推理任务,VLN-R1 要做的是把"导航动作序列"变成它能消化的形式。
4.2 VLN-Ego 数据引擎:给 LVLM 准备连续导航语料
要让 LVLM 学会连续导航,第一道坎是"没有合适的语料"------既有 VLN-CE 方法要么在离散环境、要么依赖深度图和全局地图,没有"纯第一人称视频 + 未来动作"这种 LVLM 友好的格式。作者因此设计了 VLN-Ego:用 Meta 的 Habitat 仿真平台(建立在 Matterport3D 场景之上),把 90 个场景切成 61 训练 / 11 val-seen / 18 val-unseen,并沿用 R2R 与 RxR 在这些场景里的轨迹。R2R 主要是跨房间导航、共 7,189 条路径;RxR 路径长度约为 R2R 的三倍,作者取其英文指令、共 42,023 条轨迹。最终从 R2R 得到 630K、从 RxR 得到 1.2M 训练样本,全部来自 61 个训练场景。

如上图所示,VLN-Ego 的标注按"逐动作"采集,结构清晰分成三部分。指令部分 含系统消息与自然语言指令;视觉部分 含全部历史帧(History Memory)与当前观测(Current Observation);动作部分给出四个选项 {FORWARD, TURN-LEFT, TURN-RIGHT, STOP},而真值包含接下来 6 步动作。这个"四选一 + 预测未来 6 步"的设计是后续 SFT 与 TDR 的共同前提------前者要模型学会生成这串动作文本,后者要在这串动作上逐位打分。
4.3 SFT 阶段:把动作生成当成文本生成来监督
任务形式化。 在每个时刻 t t t,给定自然语言指令 I I I 和由历史观测组成的 egocentric 视频流 V 0 : t − 1 = { v 0 , v 1 , ... , v t } V_{0:t-1}=\{v_0,v_1,\dots,v_t\} V0:t−1={v0,v1,...,vt},模型预测未来 n n n 步动作 { A t , ... , A t + n − 1 } \{A_t,\dots,A_{t+n-1}\} {At,...,At+n−1}。动作空间是四个原子动作 {FORWARD, TURN-LEFT, TURN-RIGHT, STOP};若 agent 在目标阈值距离内停下则判成功。
历史帧选择与 Long-Short Memory。 怎么从一段长视频里挑历史帧喂给 LVLM,是个被低估的难点。均匀采样把所有过去帧等权对待,忽略了近期观测的相关性;指数衰减又过度优先近处、丢了导航里至关重要的长程上下文。作者提出的 Long-Short Memory 用两段采样率来平衡:
公式(6):
H t = { v t − 1 ⋅ δ 1 , v t − 2 ⋅ δ 1 , ... , v t − M } ⏟ 短期记忆(采样率 δ 1 ) ∪ { v t − M − δ 2 , v t − M − 2 δ 2 , ... , v 0 } ⏟ 长期记忆(采样率 δ 2 , δ 2 > δ 1 ) \mathcal{H}t = \underbrace{\{\,v{t-1\cdot\delta_1},\, v_{t-2\cdot\delta_1},\, \dots,\, v_{t-M}\,\}}{\text{短期记忆(采样率 }\delta_1\text{)}} \;\cup\; \underbrace{\{\,v{t-M-\delta_2},\, v_{t-M-2\delta_2},\, \dots,\, v_{0}\,\}}_{\text{长期记忆(采样率 }\delta_2,\; \delta_2>\delta_1\text{)}} Ht=短期记忆(采样率 δ1) {vt−1⋅δ1,vt−2⋅δ1,...,vt−M}∪长期记忆(采样率 δ2,δ2>δ1) {vt−M−δ2,vt−M−2δ2,...,v0}
短期记忆在近 M 步内每 δ 1 \delta_1 δ1 帧取一帧、保住细节;长期记忆在剩余历史里每 δ 2 \delta_2 δ2 帧取一帧( δ 2 > δ 1 \delta_2>\delta_1 δ2>δ1)、把视野一路拉回起点、保住长程脉络。这个设计随后在消融里被验证优于均匀采样与指数衰减。

如上图所示,架构上 VLN-R1 用 Long-Short Memory 组织视觉输入,训练明显分两段。SFT 阶段只监督输出文本 ------把多步动作预测写成一段文本,让模型自回归生成。形式上,预测序列是各步"动作选项标识符 + 其运动描述"的拼接: A ^ t : t + n = C o n c a t k = 0 n − 1 ( α t + k , ϕ ( α t + k ) ) \hat{\mathcal{A}}{t:t+n}=\mathrm{Concat}{k=0}^{n-1}(\alpha_{t+k},\,\phi(\alpha_{t+k})) A^t:t+n=Concatk=0n−1(αt+k,ϕ(αt+k)),其中 α t + k \alpha_{t+k} αt+k 是动作选项标识符(如 α t = B \alpha_t=B αt=B 表示选第二个动作), ϕ \phi ϕ 是选项到描述的确定性映射(如 ϕ ( B ) \phi(B) ϕ(B) 得到 "Turn left 30 degrees")。模型逐 token 预测,并对整段文本与真值做交叉熵:
公式(8):
L S F T = − ∑ k = 0 n − 1 ∑ j = 1 L k log P ( w j ∗ | w 1 : j − 1 ∗ , H t , v t , I ) \mathcal{L}{\mathrm{SFT}} = -\sum{k=0}^{n-1}\sum_{j=1}^{L_k}\log P\!\left(w_j^{*}\,\middle|\, w_{1:j-1}^{*},\, \mathcal{H}_t,\, v_t,\, \mathcal{I}\right) LSFT=−k=0∑n−1j=1∑LklogP(wj∗ w1:j−1∗,Ht,vt,I)
其中 L k L_k Lk 是第 k k k 个动作文本的 token 长度(如 "C. Turn right 30 degrees" 共 6 token)。值得注意:这个损失同时监督动作选项标识符(A/B/C/D)和其运动描述,模型是在"联合生成离散符号与上下文连贯的动作语言"中学会组合式推理的------这是 LVLM 式导航区别于传统策略网络的地方。
4.4 RFT 阶段:时间衰减奖励把"整段对不对"细化成"每步对不对"
SFT 的局限也很明显:它只能优化整段文本的似然,没法对动作序列的生成提供逐位、带时序的精确引导。RFT 阶段就是来补这一刀的。作者沿用同样的指令数据格式,但换上一套自创的奖励函数------Time-Decayed Reward(TDR) 。做法是先从预测文本元组 ( α t + k , ϕ ( α t + k ) ) (\alpha_{t+k},\phi(\alpha_{t+k})) (αt+k,ϕ(αt+k)) 里抽出动作组件 α t + k \alpha_{t+k} αt+k,组成 n n n 步序列预测 A t : t + n A_{t:t+n} At:t+n,再对每位动作施加指数衰减 γ \gamma γ 的时序加权:
公式(9):
R n a v = ∑ k = 0 n − 1 γ k ⋅ I ( α t + k = α t + k ∗ ) R_{\mathrm{nav}} = \sum_{k=0}^{n-1} \gamma^{k}\cdot \mathbb{I}\!\left(\alpha_{t+k} = \alpha_{t+k}^{*}\right) Rnav=k=0∑n−1γk⋅I(αt+k=αt+k∗)
其中 I \mathbb{I} I 是指示函数------预测动作命中真值为 1、否则 0。 γ k \gamma^k γk 这一项让越靠近当前时刻的动作权重越高,刻意把"近端动作必须对"的优先级抬到"远端动作"之上。这个设计直接克服了 SFT 的粗粒度:把"整段文本是否匹配"细化成"逐动作是否命中、且按距当前时刻衰减计权",使得奖励既能区分好坏响应、又尊重导航"近期决策更致命"的时序本性。配合 GRPO 的组内归一化,模型在同指令的一组采样里,会向"TDR 更高的那几个响应"靠拢。
五、实验与证据:结果能支撑到什么程度
实现细节。 SFT 阶段用 R2R+RxR 共 1.8M 样本;RFT 阶段从两者各随机取 10K、共 20K。评测在 18 个 val-unseen 场景上、用 VLN-CE 指标:SR↑(成功率)、OS↑(Oracle 成功率)、SPL↑(路径加权成功率)量导航精度,NE↓(导航误差)、TL↓(轨迹长度)量效率。作者训了 Qwen2-VL-2B 与 7B 两档;7B 部署在 8 张 A800、用 DeepSpeed ZeRO-3。SFT 用 lr=5e-6、cosine 调度(10% warmup)、单卡 batch 2、4 步梯度累积到全局 batch 64、1 epoch 约 36 小时;RFT 降到 lr=1e-6、weight decay 0.01、β=0.04、GRPO 每条 prompt 8 个采样、单卡 batch 1(不做梯度累积)、约 12 小时一个 epoch。图像最大 65,536 像素、每实例 16 张图(约 4.1K token)。
主结果一:VLN-CE R2R。 关键数字集中在下表,对比"用 Map/Odom./Depth 的任务专用方法"与"仅 RGB 的 LVLM 方法":
| 方法 | 观测输入 | SR↑ | OS↑ | SPL↑ | NE↓ | TL |
|---|---|---|---|---|---|---|
| AG-CMTP | Map/Odom/Depth | 23.1 | 39.2 | 19.1 | 7.90 | --- |
| R2R-CMTP | Map/Odom/Depth | 26.4 | 38.0 | 22.7 | 7.90 | --- |
| VLN(SFT, Qwen2-VL-2B) | 仅 RGB | 21.2 | 33.0 | 15.9 | 8.27 | 11.9 |
| VLN(SFT, Qwen2-VL-7B) | 仅 RGB | 24.9 | 37.1 | 17.5 | 7.92 | 15.0 |
| VLN-R1(Qwen2-VL-2B) | 仅 RGB | 25.6 | 37.5 | 20.5 | 10.2 | 16.8 |
| VLN-R1(Qwen2-VL-7B) | 仅 RGB | 30.2 | 41.2 | 21.8 | 7.0 | 10.0 |
这张表承载了几个判断。其一,只用 RGB 就拿到 SOTA ------VLN-R1(7B)SR 30.2、SPL 21.8,整体压过依赖地图/里程计/深度的任务专用方法,说明砍掉额外模态不仅没拖后腿,反而靠 LVLM 的端到端能力吃下了更多红利。其二,2B 经 RFT 反超 7B 的 SFT(25.6 vs 24.9)------这与 DeepSeek-R1 "RFT 让小模型追平更大模型"的结论在具身导航上同构,是本文最想强调的一点。需要客观指出的是,VLN-R1(2B)的 NE 反而高于其 SFT 版(10.2 vs 8.27)、TL 也更长(16.8 vs 11.9),说明 RFT 主要抬高了"能在阈值内停下"的成功率,代价是平均轨迹更长、终点误差在某些档位更大------RFT 优化的是"成功与否"这一可验证奖励,而非轨迹效率。
主结果二:VLN-CE RxR 与跨域迁移。 RxR 表的看点不在"全面碾压",而在中段那四行带 ‡ 标的配置:SFT 只用 630K R2R 样本、RFT 只用 10K RxR 样本。结果是 VLN-R1(2B)‡ 拿到 SR 20.7、(7B)‡ 拿到 22.7,仅凭 10K RxR 样本做 RFT,竟超过在完整 RxR 数据上训练的同档 SFT 模型。作者据此主张:RFT 能做高效的跨域适应------在一个域上打好底子后,只要一小撮新域数据就能把性能迁移过去。这是比单纯刷分更实质的结论。
消融:四个旋钮各自的贡献。 作者用 Qwen2-VL-7B、仅在 R2R 上做了一组消融:
| 消融维度 | 变体 | SR↑ | OS↑ |
|---|---|---|---|
| 动作空间(a) | 单动作 | 15.1 | 33.6 |
| 动作空间(a) | 4 步离散集 | 21.4 | 29.6 |
| 动作空间(a) | 6 步离散集 | 24.9 | 31.7 |
| 动作空间(a) | 8 步离散集 | 22.7 | 30.4 |
| 历史记忆(b) | 均匀采样(8) | 20.8 | 28.9 |
| 历史记忆(b) | 均匀采样(16) | 22.0 | 31.3 |
| 历史记忆(b) | 指数衰减 | 23.8 | 34.3 |
| 历史记忆(b) | Long-Short | 24.9 | 31.7 |
| RFT 采样数© | k=2(暖启动) | 24.7 | 32.5 |
| RFT 采样数© | k=4 | 26.5 | 35.4 |
| RFT 采样数© | k=6 | 28.4 | 37.2 |
| RFT 采样数© | k=8(收敛) | 30.2 | 41.2 |
| 奖励函数(d) | 硬奖励 | 23.8 | 32.3 |
| 奖励函数(d) | 均匀加权 | 25.0 | 33.0 |
| 奖励函数(d) | 线性距离加权 | 28.3 | 33.6 |
| 奖励函数(d) | 指数衰减(TDR) | 30.2 | 41.2 |
四组消融各自指向一个设计选择:预测 6 步动作最优 (单动作最差、8 步反而回落,说明多步依赖有用但不宜过长);Long-Short Memory 最优 ,印证了"既要近期细节又要长程上下文"的判断;GRPO 采样数 k=8 收敛 (6→8 提升已边际,故选 8);指数衰减奖励(即 TDR)最优,把硬奖励、均匀加权、线性加权都压在身后------这是 TDR 这一创新点最直接的证据。把这些消融串起来看,VLN-R1 的性能不是单点爆破,而是"6 步预测 + Long-Short Memory + GRPO 8 采样 + TDR"四个旋钮各自最优的叠加。

如上图所示,定性案例直观展示了 VLN-R1 的工作方式:输入一段长指令与第一人称视频流,模型在连续环境里一边走、一边逐步生成动作,最终停在目标附近。这类案例图能说明"端到端确实跑得通",但要客观指出,定性图本身不构成对泛化或鲁棒性的统计证据------它展示的是成功样本,且只在模拟室内场景内。
六、这篇工作的边界与可复现性
- 评测仅限模拟室内。 作者明确承认只在与训练同源的 Matterport3D 模拟室内环境里评测,真实世界泛化未被检验------这是最实质的边界,也是从仿真到真机之间未跨过的鸿沟。
- 动作仍离散为四类原子动作。 虽号称"连续环境",但模型输出仍是 FORWARD/TURN-LEFT/TURN-RIGHT/STOP 这四个离散选项及其描述,转向角度、前进距离都是模板化的。所以"连续"指的是环境与运动空间,不是模型输出的动作分辨率------真机所需的精细控制仍未打开。
- RFT 的"跨域迁移"证据需谨慎读。 10K RxR 样本反超全数据训练很漂亮,但 R2R 与 RxR 同属 Matterport3D、同属室内、同用 Habitat------这是"同构域内换指令集"的迁移,而非跨模态/跨场景类型的迁移,外推到真正异构域时未必成立。
- 指标对"过程理解"是宽容的。 SR 只判终点是否在阈值内,不评整条轨迹与参考路径的吻合度;TL 与 NE 能反映绕远,但成功率这一主指标仍可能把"乱走但碰巧停对"的 agent 判成功。
- 奖励仍依赖真值对齐。 TDR 的指示函数 I ( α = α ∗ ) \mathbb{I}(\alpha=\alpha^*) I(α=α∗) 依赖逐动作真值,而真值来自 Habitat 沿参考轨迹的采集------本质上仍是"模仿专家"的信号,并非从任务成败端到端回传的奖励,离真正的任务级 RL(以成功率为奖励)还有一步。
- 可复现性中等偏上。 数据引擎(VLN-Ego 的采集流程)、两阶段训练超参、GRPO 与 TDR 的形式都写明了,基座是开源 Qwen2-VL,平台是开源 Habitat------具备复现条件;但 8×A800 的训练成本对多数实验室不低,且 VLN-Ego 的生成脚本是否随项目页完全开放仍需核实。
七、如果继续研究/落地,应该关注什么
- 把奖励从"逐动作对齐"升到"任务成败"。 TDR 仍以专家动作真值为锚,可进一步用成功率、SPL 这类任务级指标做稀疏奖励,结合分层/层次化 RL 让模型自己探索更长视野的决策,而不只是复刻专家。
- 打开真正的连续动作分辨率。 把四类原子动作替换成连续的转向角与步长回归(或扩散/流式动作头),让"连续环境"配上"连续动作",是通往真机最直接的一步。
- 跨域与 sim-to-real。 既然 RFT 在同构域间迁移高效,下一步应测真正异构域(合成→真实、室内→室外、Matterport→HM3D 等不同场景集),并引入域随机化、仿真器多样化来检验迁移是否还成立。
- 历史记忆与上下文长度的协同优化。 Long-Short Memory 是手工分两段采样,可探索让模型自己学习"何时回看、回看多远"的可学习采样/注意力,与 LVLM 不断增长的原生上下文窗口对齐。
- 评测要向"过程理解"延伸。 在 SR/SPL 之外引入轨迹级对齐(如 DTW)、子目标达成率、停靠决策置信度,让"真的听懂了"与"碰巧停下"在指标上分开,倒逼方法向理解靠拢。
- 落地形态:把 VLN-R1 嵌入可问可指的交互回路。 LVLM 天然支持多轮对话,遇到指令歧义可主动提问、接受人类手势/语言提示,从单轮指令执行扩展到对话式导航,既是产品形态也重新定义评测。
八、术语与概念速查
| 类别 | 术语 | 一句话定位 |
|---|---|---|
| 评测指标 | SR(Success Rate)↑ | 终点在目标阈值距离内的 episode 占比,主指标 |
| 评测指标 | OS(Oracle Success)↑ | 假设在轨迹最接近目标处停下的成功率,分离"找到目标"与"知道该停" |
| 评测指标 | SPL(Success weighted by Path Length)↑ | 成功率按路径长度加权,兼顾准与不绕远 |
| 评测指标 | NE(Navigation Error)↓ | 终点到目标的距离(米),量终点误差 |
| 评测指标 | TL(Trajectory Length)↓ | agent 实际走过的轨迹长度(米),量是否绕远 |
| 数据/平台 | Matterport3D | 90 栋真实建筑 RGB-D 场景集,VLN-Ego 与 R2R/RxR 的视觉地基 |
| 数据/平台 | Habitat | Meta 的具身 AI 仿真平台,VLN-Ego 据此在 Matterport3D 上采第一人称视频 |
| 数据/平台 | R2R / RxR | Room-to-Room(跨房间、7,189 路径)与 Room-across-Room(约 3 倍长、英文 42,023 轨迹)导航轨迹集 |
| 基座模型 | Qwen2-VL-2B / 7B | 本文两档 LVLM 骨架,2B 用以验证"小模型+RL 追平大模型",7B 创 SOTA |
| 训练基建 | DeepSpeed ZeRO-3 | 7B 训练用的显存优化策略,部署在 8×A800 |
| 对照算法 | PPO | 需 critic 模型的策略优化,GRPO 旨在避开它 |
| 对照算法 | DPO | 依赖离线偏好数据,GRPO 旨在避开它 |
| 对照奖励 | 硬奖励 / 均匀 / 线性距离加权 | 消融中 TDR 的三种对照奖励,分别得 23.8 / 25.0 / 28.3,均低于指数衰减的 30.2 |
| 前置概念 | RLVR | 针对有客观真值任务的可验证奖励后训练,RFT 在 VLN 上的移植母体 |
| 前置概念 | R1-Zero / DeepSeek-R1 | 证明 RL alone 能提升 LLM 推理,是 VLN-R1 强化微调范式的灵感来源 |
九、拓展思考:值得继续扩展研究与思考的创新点
- 把"可验证奖励"重新定义给导航。 数学有标准答案、代码能跑测试,导航的"可验证"目前只能借专家动作真值。若把"到达目标"本身做成可验证终端奖励、再用 TDR 做过程稠密化,就能在不需要逐动作标注的弱监督下做 RFT,把数据采集成本压到最低------这是把 RLVR 范式真正本土化到具身任务的关键创新。
- "小模型 RL 追平大模型"在具身上的边界刻画。 DeepSeek-R1 的这一结论在 VLN-R1 上再次显形(2B 反超 7B SFT)。值得系统地刻画:在多少训练数据、多长视野、何种奖励形态下,RFT 对小模型的相对增益会饱和或反转?这比单点报告更有方法论价值。
- 从导航到 Embodied QA 的统一后训练。 论文提到 EQA 结果在附录,说明同一 LVLM 经导航后训练后能顺带回答环境问题。若把导航、EQA、物体目标导航等多个具身任务做成共享同一套可验证奖励的 RFT 多任务,有望复现"通用模型 + 任务可验证奖励"的具身版 R1。
- 第一人称视频的长程记忆架构创新。 Long-Short Memory 是显式两段采样的工程解。若结合分层注意力、检索式记忆或可学习的回看策略,让 LVLM 在数分钟级第一人称视频上保住长程目标不漂移,是把"端到端视频导航"推向真实长程任务的结构性方向。
- 真机闭环的产品形态。 既然只用 RGB 第一人称视频、不依赖深度图/地图,VLN-R1 的输入接口天然贴近真机摄像头。把 RFT 的奖励换成真机任务成败、用 sim-to-real 桥接仿真训练与真实部署,是把这套范式从论文搬进产品的最后一公里。