ReferTrack——面向具身视觉跟踪的“先指代,再跟踪”方法

前言

ReferTrack,一种在单个前向摄像头条件下实现EVT 落地的" 指代-再跟踪" 范式。该模型首先从一个索引化的边界框集合中选出目标,然后在这一基于图像决策的条件下解码跟踪航点

EVT 是 Embodied Visual Tracking 的缩写,中文通常译为具身视觉跟踪。

在这篇文章中,它指:机器人只依靠自身搭载的摄像头,根据自然语言描述识别目标人物,并持续规划运动轨迹进行跟随。

例如指令是"跟着穿黑色 T 恤和短裤的人",机器人需要同时完成两件事:

  1. 目标识别:从多个人中找出正确的目标

  2. 轨迹规划:控制自身移动,与目标保持合适距离,同时避免碰撞

简单来说,EVT 就是让机器人做到:"听懂要跟谁、在画面中认出谁、并亲自移动着跟上谁"

为在时间上保留目标运动线索,ReferTrack 维护一个先前所选边界框的滑动窗口队列,并通过时间-视角-边界框指示符(TVBI)token 将它们的几何特征注入视觉历史中

第一部分 ReferTrack: Referring Then Tracking for EmbodiedVisual Tracking

1.1 引言与相关工作

1.1.1 引言

具身视觉跟踪(Embodied Visual Tracking, EVT)

  1. TrackVLA
  2. TrackVLA++
  3. AD-VAT+
  4. Empowering Embodied Visual Tracking with Visual Foundation Models and Offline RL
  5. Instance-Level Visual Active Tracking with Occlusion-Aware Planning(2026):面向实例级视觉主动跟踪,引入遮挡感知规划,以改善目标短暂不可见时的持续跟随能力]

要求一个移动智能体在仅依赖机载视觉的条件下,持续跟随由自然语言描述的特定目标。在拥挤且动态的环境中,成功关键在于两种紧密耦合的能力:

  1. 目标识别------判断哪一位行人符合给定指令
  2. 以及轨迹规划------生成避免碰撞的运动轨迹,同时将目标保持在合适的跟随距离内

具体而言

  1. 早期的处理流程通常将这两个阶段分开处理,利用视觉基础模型
    6-Segment Anything
    7-SAM 2
    8-Grounding DINO ,详见本博客中的解读《IDEA-Research推出的一系列检测、分割模型:从DINO(改进版DETR)、Grounding Dino、DINO-X到Grounded SAM2

    进行目标识别,再采用后续的基于学习的规划器进行导航 4,5

  2. 最新的视觉-语言-行动(vision-language-action, VLA)模型将目标识别与路径规划统一到一个单一策略中,并采用大语言模型(LLMs)
    1,2
    9-NavFoM
    10-CoMaTrack: Competitive Multi-Agent Game-Theoretic Tracking with Vision-Language-Action Models
    11-Uni-NaVid ,详见本博客中的解读《》
    12-VLingNav: Embodied Navigation with Adaptive Reasoning and Visual-Assisted Linguistic Memory
    13-ABot-N0: Technical Report on the VLA Foundation Model for Versatile Embodied Navigation

    的"下一 token预测"范式

    一些方法 9,10,11,12,13
    EVT

    其他导航任务

    例如,视觉-语言导航14-Beyond the Nav-Graph: Vision-and-Language Navigation in Continuous Environments
    目标物体导航 15-HM3D-OVON
    点目标导航 16-SocialNav: Training Human-Inspired Foundation Model for Socially-Aware Embodied Navigation

    进行联合训练,使模型能够学习通用的导航先验,并仅凭海量数据就获得基础的 EVT 能力

  3. 相比之下,专门化方法 1,2 则专注于 EVT 和以目标识别为驱动的问答(QA)数据集构建。通过显式地针对识别与规划进行优化,它们在只需少量训练数据的情况下,就能取得相当甚至更优的性能

    在此基础上,TrackVLA++ 2 通过在动作预测之前引入具备空间感知能力的 token,加入链式思维(chain-of-thought, CoT)推理

    然而,只在抽象的空间潜在空间中进行推理,往往难以在复杂、拥挤的场景中实现精确的视觉对齐(visual grounding)

为了解决这一问题

  1. 来自的研究者提出了一种互补的范式:先指代(referring),再跟踪(tracking)。即并非依赖抽象的空间编码,而是将目标识别表述为:从自我视角图像中检测到的一组图像空间边界框(bboxes)中,选择一个带索引的条目
    这样就把识别问题转化为一个受约束的多选问题 *** *17-Referring to Any Person* ***
    ,更易于监督训练,也更符合 VLM 的语义对齐(grounding)机制
  2. 在这一表述基础上,作者提出了 ReferTrack ,这是一种 VLA 模型,它将当前检测结果组织成一个带索引的 bbox 目录,预测单个 Refer-CoT token(包括⟨NO EXIST⟩),并通过滑动窗口队列传播所选目标的 bboxes,在轨迹预测之前注入运动线索

    为了在在线跟踪之前进一步增强这种指代能力,作者在一个自构建的 Refer-QA 数据集上对 ReferTrack 进行联合训练------该数据集源自一个行人 ReID 数据集 ***18-PLIP: Language-Image Pre-training for Person Representation Learning*** ------并采用与上述相同的带索引 bbox 选择接口
    因此,ReferTrack 建立了一条紧凑的、以图像为基础的 CoT 通路,将自然语言、视觉检测和运动线索无缝集成到一个端到端策略中

1.1.2 相关工作

首先,对于视觉-语言导航

视觉与语言导航(Vision-and-language navigation, VLN)要求智能体在自然语言指令的引导下到达指定目标。早期方法利用场景的文本描述对现成的大型语言模型(LLMs)进行提示式调用 *19-LM-Nav,20-NavGPT*

而最近的模型则在导航轨迹上对视觉-语言模型(VLMs)进行端到端微调 *11,21-NaVid,22-NaVILA,23-StreamVLN,13*

例如

  • Uni-NaVid 11 通过跨任务模仿学习泛化的导航能力

  • NavFoM 9 则通过时间-视点指示(temporal-viewpoint indicator, TVI)token 对视觉历史进行结构化建模,从而显式编码时空上下文

    ReferTrack 延续了这种结构化视觉历史建模思路,但进一步通过时间-视点-边界框指示(temporal-viewpoint-bboxindicator, TVBI)token 注入被指称目标的几何特征。一旦通过 Refer-CoT token 完成目标识别,其历史边界框就会被排队并进行融合进入视觉流
    该机制有效地将通用的时空索引转化为一种以目标为条件的记忆,用于持续跟踪

其次,对于具身视觉跟踪

  1. 具身视觉跟踪(Embodied Visual Tracking, EVT)要求一个移动智能体持续追踪由自然语言指定的动态目标

    早期方法通常将感知和控制解耦,将视觉基础模型 6,8 与后端的强化学习

    模仿学习*24-Towards Distraction-Robust Active Visual Tracking(2021):通过多智能体混合博弈等机制,提升主动视觉跟踪在外观相似干扰者存在时的鲁棒性,4* 进行组合

    尽管这类模块化流水线在可解释性上具有优势,但识别阶段的错误不可避免地会累积并传递到规划模块

  2. 近期的 VLA 模型则将语言、视觉与控制统一起来以解决 EVT 问题 1,25-LOVON,2,10
    TrackVLA 1 将目标识别与轨迹规划整合为单一策略;
    LOVON 25 采用分层式LLM 规划器并配合低层控制器;
    TrackVLA++ 2 在利用极坐标 token 进行航点预测之前,引入时序记忆和具备空间感知的推理机制

    ReferTrack 同样采用"先推理、后行动"的范式,但其推理所使用的词汇是在已索引的图像空间 bbox 之间进行选择,而非抽象的极坐标
    这样的设计与 VLM 自然使用的、以及机载检测器输出的以 bbox为中心的表征形式显式对齐,从而将推理过程锚定在直接的视觉证据之上,并最大限度地减少由抽象带来的瓶颈

最后,指代、定位与基于目录的识别

  1. 指代表达理解(Referring Expression Comprehension,REC)基于自由形式的自然语言对目标进行定位 *26-ReferItGame,27-RefCrowd*

    开放词表检测器和定位(grounding)模型 *8,28-Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V* 进一步在语言与图像区域之间建立桥梁,并且愈来愈多的多模态大模型(multimodal LLM)被设计为将边界框(bbox)作为 token 输出,或在候选区域提议之间进行选择
    29-Shikra
    30-Ferret
    31-Groma
    32-ChatRex
    33-LISA++

  2. 在以人为中心的场景中,像 RexSeek 17 这样的框架可以检测出所有与给定描述匹配的个体,这启发了作者的 Refer-QA 协同训练:即在离线阶段强化基于目录的指代表达能力,并将这一能力迁移到在线 EVT 跟踪中

    总体来看,这些工作表明,从离散候选中进行选择是视觉-语言模型(VLM)的自然交互方式。更重要的是,将 EVT 识别表述为在带索引的图像空间边界框之上的指代任务,也解锁了稀缺的专家级跟踪轨迹之外的监督信号 :互联网提供了大规模的指代与定位数据 26,8,17,而机器人学 34,35 和自动驾驶 36,37 则提供了大量带有二维行人标注的自中心视频,可以用来填充候选目录

    这种兼容性为在 EVT 驱动的视觉-语言智能体(VLA)中扩展识别能力提供了一条可扩展途径,而无需完全依赖昂贵的闭环导航数据

    在本文中,为了与先前 EVT 工作 1,2 进行公平比较,作者使用相同的人体重识别(person ReID)数据集18 来生成 Refer-QA 数据,并将由此学到的带索引 bbox 选择能力迁移到在线跟踪中

1.2 方法

1.2.0 问题表述与概述

首先是任务表述

具身视觉跟踪(EVT)要求一个移动智能体仅依靠机载视觉,持续跟随由自然语言描述的特定人物,这一能力是建立长期陪伴关系和具备社会感知交互的基础

  • 在每个时间步 ,给定关于目标外观的指令 和一串前向视角的RGB 观测,智能体预测一条连续轨迹
  • 每个航路点表示在地面平面上的自中心位移和朝向变化

遵循既定的评估协议,当智能体在保持规定的跟随距离(1-3 米)的同时,将目标持续保持在其视野内时,该回合被视为成功

其次,对于模型概述

ReferTrack 将最新的VLA 框架1, 2, 9 扩展为一个为同时执行导航和问答而定制的双分支架构

  • 对于导航,作者使用鲁棒的视觉编码器和跨模态投影器38 对前视观察历史进行编码,以获得视觉token ,然后使用受NavFoM 风格TVI 编码9 启发的时序-视角-边界框指示符(TVBI)token 对其进行结构化

    与此同时,时间步T 的行人检测结果被组织成一个带索引的候选目录 。每个条目对应一个通过基于MLP 的投影器P bbox 编码的检测到的行人边界框。指令 按照标准多模态训练实践被标记化为语言嵌入

    视觉tokens、catalog 和 language tokens 被连接起来,并在两阶段顺序地输入到一个大型语言模型中:



    其中 E 指的是 T ∈ {⟨ped1⟩, . . . , ⟨pedK⟩, ⟨NO EXIST⟩},用于选择一个带索引的 bbox 条目。其中的 ⟨NO EXIST⟩该 token 明确表示当前前向视野中不存在目标
    作者采用这种图像空间的指代策略------选择与 匹配的索引 bbox 条目------因为它通过一个紧凑的单 token 选择,将目标识别与 VLM 的指代/对齐机制自然衔接在一起

  • 对于问答任务,作者复用同样的目录接口,引导模型基于自构建的 Refer-QA 数据集,选择与目标描述相匹配的索引 bbox 条目

    导航数据与 Refer-QA 样本进行联合训练。图 2 总结了完整的 EVT 推理流程


    ReferTrack 首先通过从当前检测结果中选择一个带索引的边界框(bbox),对语言指令和视觉流进行对齐与关联,然后在该 Refer-CoT 决策的条件约束下预测跟踪航点。被选中的边界框会作为目标特定记忆进行存储,并通过 TVBI 标记注入到后续的视觉历史中

1.2.1 ReferTrack 架构

第一,对于观测编码

  1. 作者处理在线前视流,采用双编码器架构,从SigLIP 39 和DI-NOv240 中提取并拼接视觉特征

    之后,应用grid pooling 策略21 生成细粒度tokens 以捕获当前观测的细节信息,以及粗粒度tokens 以保留更广泛的历史上下文,其中C 表示通道维度

  2. 为在长程上下文和推理延迟之间取得最佳平衡,维护最近H 帧的滑动窗口
    因此视觉流被组织为

    一个两层MLP 投影器将视觉流映射到LLM 潜空间,生成

    在输入LLM 之前,作者在帧视觉token 组之间交错插入时间-视角-边界框指示符(TVBI)tokens,从而将目标几何显式注入到视觉历史中

  3. 给定一个有效的归一化框,然后通过共享的两层MLP 对其进行嵌入(稍后在目录编码中复用),并将其加到TVI token 上9

    如果在历史帧中目标未被观测到,作者将设为一个确定性的缺失哨兵
    这表明该帧没有可靠的目标几何信息可用,从而使TVBI 能够区分可见的目标运动和目标缺失的历史

  4. 在导航过程中,长度为H 的参考目标边界框队列对历史TVBI 流进行显式条件建模,而当前帧的精细token 严格依赖仅由TVI 提供的指示信息

    通过剥夺在当前观测中不再显式注入边界框的情况下,模型被迫只能依赖历史 TVBI 线索和原始视觉特征,对目标进行空间和时间上的定位,从而为后续的指代表达任务建立稳健的表示

第二,对于候选目录

// 待更

相关推荐
帅得不敢出门2 年前
智能硬件从零开始的设计生产流程
智能硬件·mp·结构·硬件生产·evt·pvt·模具