前言
ReferTrack,一种在单个前向摄像头条件下实现EVT 落地的" 指代-再跟踪" 范式。该模型首先从一个索引化的边界框集合中选出目标,然后在这一基于图像决策的条件下解码跟踪航点
EVT 是 Embodied Visual Tracking 的缩写,中文通常译为具身视觉跟踪。
在这篇文章中,它指:机器人只依靠自身搭载的摄像头,根据自然语言描述识别目标人物,并持续规划运动轨迹进行跟随。
例如指令是"跟着穿黑色 T 恤和短裤的人",机器人需要同时完成两件事:
目标识别:从多个人中找出正确的目标
轨迹规划:控制自身移动,与目标保持合适距离,同时避免碰撞
简单来说,EVT 就是让机器人做到:"听懂要跟谁、在画面中认出谁、并亲自移动着跟上谁"
为在时间上保留目标运动线索,ReferTrack 维护一个先前所选边界框的滑动窗口队列,并通过时间-视角-边界框指示符(TVBI)token 将它们的几何特征注入视觉历史中
第一部分 ReferTrack: Referring Then Tracking for EmbodiedVisual Tracking
1.1 引言与相关工作
1.1.1 引言
具身视觉跟踪(Embodied Visual Tracking, EVT)
- TrackVLA
- TrackVLA++
- AD-VAT+
- Empowering Embodied Visual Tracking with Visual Foundation Models and Offline RL
- Instance-Level Visual Active Tracking with Occlusion-Aware Planning(2026):面向实例级视觉主动跟踪,引入遮挡感知规划,以改善目标短暂不可见时的持续跟随能力]
要求一个移动智能体在仅依赖机载视觉的条件下,持续跟随由自然语言描述的特定目标。在拥挤且动态的环境中,成功关键在于两种紧密耦合的能力:
- 目标识别------判断哪一位行人符合给定指令
- 以及轨迹规划------生成避免碰撞的运动轨迹,同时将目标保持在合适的跟随距离内
具体而言
-
早期的处理流程通常将这两个阶段分开处理,利用视觉基础模型
6-Segment Anything
7-SAM 2
8-Grounding DINO ,详见本博客中的解读《IDEA-Research推出的一系列检测、分割模型:从DINO(改进版DETR)、Grounding Dino、DINO-X到Grounded SAM2》
进行目标识别,再采用后续的基于学习的规划器进行导航 4,5 -
最新的视觉-语言-行动(vision-language-action, VLA)模型将目标识别与路径规划统一到一个单一策略中,并采用大语言模型(LLMs)
1,2
9-NavFoM
10-CoMaTrack: Competitive Multi-Agent Game-Theoretic Tracking with Vision-Language-Action Models
11-Uni-NaVid ,详见本博客中的解读《》
12-VLingNav: Embodied Navigation with Adaptive Reasoning and Visual-Assisted Linguistic Memory
13-ABot-N0: Technical Report on the VLA Foundation Model for Versatile Embodied Navigation
的"下一 token预测"范式一些方法 9,10,11,12,13 将
EVT
与
其他导航任务
例如,视觉-语言导航14-Beyond the Nav-Graph: Vision-and-Language Navigation in Continuous Environments
目标物体导航 15-HM3D-OVON
点目标导航 16-SocialNav: Training Human-Inspired Foundation Model for Socially-Aware Embodied Navigation进行联合训练,使模型能够学习通用的导航先验,并仅凭海量数据就获得基础的 EVT 能力
-
相比之下,专门化方法 1,2 则专注于 EVT 和以目标识别为驱动的问答(QA)数据集构建。通过显式地针对识别与规划进行优化,它们在只需少量训练数据的情况下,就能取得相当甚至更优的性能
在此基础上,TrackVLA++ 2 通过在动作预测之前引入具备空间感知能力的 token,加入链式思维(chain-of-thought, CoT)推理
然而,只在抽象的空间潜在空间中进行推理,往往难以在复杂、拥挤的场景中实现精确的视觉对齐(visual grounding)
为了解决这一问题
- 来自的研究者提出了一种互补的范式:先指代(referring),再跟踪(tracking)。即并非依赖抽象的空间编码,而是将目标识别表述为:从自我视角图像中检测到的一组图像空间边界框(bboxes)中,选择一个带索引的条目
这样就把识别问题转化为一个受约束的多选问题 *** *17-Referring to Any Person* ***,更易于监督训练,也更符合 VLM 的语义对齐(grounding)机制 - 在这一表述基础上,作者提出了 ReferTrack ,这是一种 VLA 模型,它将当前检测结果组织成一个带索引的 bbox 目录,预测单个 Refer-CoT token(包括⟨NO EXIST⟩),并通过滑动窗口队列传播所选目标的 bboxes,在轨迹预测之前注入运动线索

为了在在线跟踪之前进一步增强这种指代能力,作者在一个自构建的 Refer-QA 数据集上对 ReferTrack 进行联合训练------该数据集源自一个行人 ReID 数据集 ***18-PLIP: Language-Image Pre-training for Person Representation Learning*** ------并采用与上述相同的带索引 bbox 选择接口
因此,ReferTrack 建立了一条紧凑的、以图像为基础的 CoT 通路,将自然语言、视觉检测和运动线索无缝集成到一个端到端策略中
1.1.2 相关工作
首先,对于视觉-语言导航
视觉与语言导航(Vision-and-language navigation, VLN)要求智能体在自然语言指令的引导下到达指定目标。早期方法利用场景的文本描述对现成的大型语言模型(LLMs)进行提示式调用 *19-LM-Nav,20-NavGPT*
而最近的模型则在导航轨迹上对视觉-语言模型(VLMs)进行端到端微调 *11,21-NaVid,22-NaVILA,23-StreamVLN,13*
例如
-
Uni-NaVid 11 通过跨任务模仿学习泛化的导航能力
-
NavFoM 9 则通过时间-视点指示(temporal-viewpoint indicator, TVI)token 对视觉历史进行结构化建模,从而显式编码时空上下文
ReferTrack 延续了这种结构化视觉历史建模思路,但进一步通过时间-视点-边界框指示(temporal-viewpoint-bboxindicator, TVBI)token 注入被指称目标的几何特征。一旦通过 Refer-CoT token 完成目标识别,其历史边界框就会被排队并进行融合进入视觉流
该机制有效地将通用的时空索引转化为一种以目标为条件的记忆,用于持续跟踪
其次,对于具身视觉跟踪
-
具身视觉跟踪(Embodied Visual Tracking, EVT)要求一个移动智能体持续追踪由自然语言指定的动态目标
早期方法通常将感知和控制解耦,将视觉基础模型 6,8 与后端的强化学习
或
模仿学习*24-Towards Distraction-Robust Active Visual Tracking(2021):通过多智能体混合博弈等机制,提升主动视觉跟踪在外观相似干扰者存在时的鲁棒性,4* 进行组合尽管这类模块化流水线在可解释性上具有优势,但识别阶段的错误不可避免地会累积并传递到规划模块
-
近期的 VLA 模型则将语言、视觉与控制统一起来以解决 EVT 问题 1,25-LOVON,2,10:
TrackVLA 1 将目标识别与轨迹规划整合为单一策略;
LOVON 25 采用分层式LLM 规划器并配合低层控制器;
TrackVLA++ 2 在利用极坐标 token 进行航点预测之前,引入时序记忆和具备空间感知的推理机制ReferTrack 同样采用"先推理、后行动"的范式,但其推理所使用的词汇是在已索引的图像空间 bbox 之间进行选择,而非抽象的极坐标
这样的设计与 VLM 自然使用的、以及机载检测器输出的以 bbox为中心的表征形式显式对齐,从而将推理过程锚定在直接的视觉证据之上,并最大限度地减少由抽象带来的瓶颈
最后,指代、定位与基于目录的识别
-
指代表达理解(Referring Expression Comprehension,REC)基于自由形式的自然语言对目标进行定位 *26-ReferItGame,27-RefCrowd*
开放词表检测器和定位(grounding)模型 *8,28-Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V* 进一步在语言与图像区域之间建立桥梁,并且愈来愈多的多模态大模型(multimodal LLM)被设计为将边界框(bbox)作为 token 输出,或在候选区域提议之间进行选择
29-Shikra
30-Ferret
31-Groma
32-ChatRex
33-LISA++ -
在以人为中心的场景中,像 RexSeek 17 这样的框架可以检测出所有与给定描述匹配的个体,这启发了作者的 Refer-QA 协同训练:即在离线阶段强化基于目录的指代表达能力,并将这一能力迁移到在线 EVT 跟踪中
总体来看,这些工作表明,从离散候选中进行选择是视觉-语言模型(VLM)的自然交互方式。更重要的是,将 EVT 识别表述为在带索引的图像空间边界框之上的指代任务,也解锁了稀缺的专家级跟踪轨迹之外的监督信号 :互联网提供了大规模的指代与定位数据 26,8,17,而机器人学 34,35 和自动驾驶 36,37 则提供了大量带有二维行人标注的自中心视频,可以用来填充候选目录
这种兼容性为在 EVT 驱动的视觉-语言智能体(VLA)中扩展识别能力提供了一条可扩展途径,而无需完全依赖昂贵的闭环导航数据
在本文中,为了与先前 EVT 工作 1,2 进行公平比较,作者使用相同的人体重识别(person ReID)数据集18 来生成 Refer-QA 数据,并将由此学到的带索引 bbox 选择能力迁移到在线跟踪中
1.2 方法
1.2.0 问题表述与概述
首先是任务表述
具身视觉跟踪(EVT)要求一个移动智能体仅依靠机载视觉,持续跟随由自然语言描述的特定人物,这一能力是建立长期陪伴关系和具备社会感知交互的基础
- 在每个时间步
,给定关于目标外观的指令
和一串前向视角的RGB 观测
,智能体预测一条连续轨迹
- 每个航路点
表示在地面平面上的自中心位移和朝向变化
遵循既定的评估协议,当智能体在保持规定的跟随距离(1-3 米)的同时,将目标持续保持在其视野内时,该回合被视为成功
其次,对于模型概述
ReferTrack 将最新的VLA 框架1, 2, 9 扩展为一个为同时执行导航和问答而定制的双分支架构
-
对于导航,作者使用鲁棒的视觉编码器和跨模态投影器38 对前视观察历史
进行编码,以获得视觉token
,然后使用受NavFoM 风格TVI 编码9 启发的时序-视角-边界框指示符(TVBI)token 对其进行结构化
与此同时,时间步T 的行人检测结果被组织成一个带索引的候选目录
。每个条目对应一个通过基于MLP 的投影器P bbox 编码的检测到的行人边界框。指令
按照标准多模态训练实践被标记化为语言嵌入
视觉tokens、catalog 和 language tokens 被连接起来,并在两阶段顺序地输入到一个大型语言模型中:
其中 E 指的是 T ∈ {⟨ped1⟩, . . . , ⟨pedK⟩, ⟨NO EXIST⟩},用于选择一个带索引的 bbox 条目。其中的 ⟨NO EXIST⟩该 token 明确表示当前前向视野中不存在目标
作者采用这种图像空间的指代策略------选择与匹配的索引 bbox 条目------因为它通过一个紧凑的单 token 选择,将目标识别与 VLM 的指代/对齐机制自然衔接在一起
-
对于问答任务,作者复用同样的目录接口,引导模型基于自构建的 Refer-QA 数据集,选择与目标描述相匹配的索引 bbox 条目
导航数据与 Refer-QA 样本进行联合训练。图 2 总结了完整的 EVT 推理流程
的
ReferTrack 首先通过从当前检测结果中选择一个带索引的边界框(bbox),对语言指令和视觉流进行对齐与关联,然后在该 Refer-CoT 决策的条件约束下预测跟踪航点。被选中的边界框会作为目标特定记忆进行存储,并通过 TVBI 标记注入到后续的视觉历史中
1.2.1 ReferTrack 架构
第一,对于观测编码
-
作者处理在线前视流
,采用双编码器架构,从SigLIP 39 和DI-NOv240 中提取并拼接视觉特征
之后,应用grid pooling 策略21 生成细粒度tokens
以捕获当前观测的细节信息,以及粗粒度tokens
以保留更广泛的历史上下文,其中C 表示通道维度
-
为在长程上下文和推理延迟之间取得最佳平衡,维护最近H 帧的滑动窗口
因此视觉流被组织为一个两层MLP 投影器
将视觉流映射到LLM 潜空间,生成
在输入LLM 之前,作者在帧视觉token 组之间交错插入时间-视角-边界框指示符(TVBI)tokens,从而将目标几何显式注入到视觉历史中
-
给定一个有效的归一化框
,然后通过共享的两层MLP
对其进行嵌入(稍后在目录编码中复用),并将其加到TVI token 上9:
如果在历史帧中目标未被观测到,作者将
设为一个确定性的缺失哨兵
这表明该帧没有可靠的目标几何信息可用,从而使TVBI 能够区分可见的目标运动和目标缺失的历史 -
在导航过程中,长度为H 的参考目标边界框队列对历史TVBI 流进行显式条件建模,而当前帧的精细token 严格依赖仅由TVI 提供的指示信息
通过剥夺在当前观测中不再显式注入边界框的情况下,模型被迫只能依赖历史 TVBI 线索和原始视觉特征,对目标进行空间和时间上的定位,从而为后续的指代表达任务建立稳健的表示
第二,对于候选目录
// 待更