【论文解读】VLN-R1:让大视觉语言模型直接吃第一人称视频走出连续动作,用 GRPO 强化微调和时间衰减奖励把“导航“做成 LVLM 的可验证后训练任务论文:VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning(The University of Hong Kong / Shanghai AI Lab,arXiv 预印本,cs.CV) 发布时间:2025 年 6 月 20 日(arXiv v1) 作者:Zhangyang Qi、Zhixiong Zhang、Yizhou Yu、Jiaqi Wang、Hengshuang Zhao(共 5 人;Jiaqi Wang、Hengshua