26年6月来自南大、中科院自动化所、中科院大学、中科第五记(FiveAges)、国防大学和极佳科技(GigaAI)的论文"WAM-Nav: Asymmetric Latent World-Action Modeling for Unified Visual Navigation"。
视觉导航需要在复杂的几何和物理约束下生成平滑且无碰撞的轨迹。现有的直接将观测结果映射到动作的反应式策略缺乏预测推理能力,限制了其主动避障的能力。虽然视觉想象能够提供预测性预判,但传统的模块化方法将场景预测与策略学习分离,这往往会导致误差累积和推理效率低下。为了解决这些局限性,提出WAM-Nav,一种用于具身视觉导航的潜世界动作模型,它联合学习动作生成和潜视觉预判,从而在不影响推理效率的前提下,实现更稳健、更具前瞻性的导航决策。具体而言,WAM-Nav利用共享的扩散Transformer进行非对称联合扩散,从而同时生成长时程动作和短时程视觉预判,降低多步自回归展开中固有的推理延迟和视觉误差累积。为了进一步促进流畅一致的轨迹生成,引入一种双流上下文条件化机制,该机制将事件级自我运动历史与序列视觉观察相结合。结合统一的目标对齐模块(该模块能够保持不同目标类型之间的平衡表征),WAM-Nav 自然地支持在单一策略内进行图像目标、点目标和无目标探索。在具有挑战性的 ClutterScenes 和 InternScenes 基准测试中进行的大量实验表明,WAM-Nav 具有很强的泛化能力,尤其是在图像目标和点目标导航方面,其成功率分别提高 15.7% 和 3.3%。实际部署进一步验证其有效的零样本仿真到真实环境迁移能力,在各种室内外环境中均实现了平均 85% 的任务成功率。
如图1 所示WAM-Nav范式及性能概述。(a) 方法论比较:与传统的纯反应式或解耦模块化流程不同,WAM-Nav在一个统一的框架内联合建模动作生成和潜视觉预测。(b) 量化性能:该方法在各种评估设置下均取得了与现有基线方法相当的结果。

WAM-Nav,是一种用于具身视觉导航的潜在世界动作模型。该模型联合学习动作生成和潜视觉预测,从而在不影响推理效率的前提下,实现更稳健、更具前瞻性的导航决策,WAM-Nav并非依赖于顺序解耦的模块,而是利用共享的扩散Transformer(DiT)进行非对称联合扩散,以同时生成长时程动作和短时程视觉预测。这种联合建模降低多步自回归展开中固有的推理延迟和视觉误差累积,同时确保视觉特征和控制动态之间的深度耦合,使策略能够预测环境变化并主动避开障碍物。为了进一步指导动作生成并保持轨迹一致性,引入双流上下文条件化(DSCC),它将片段级的自我运动历史与顺序视觉观测相结合。 WAM-Nav 结合统一的目标对齐模块,能够保持不同目标类型之间的平衡表示,因此无需复杂的架构切换,即可在单一策略中自然地支持图像目标、点目标和无目标探索。
如图 2 所示,WAM-Nav 由三个关键组件组成:(1)统一目标对齐,(2)双流上下文条件化,以及(3)非对称动作预见生成。具体来说,为了在各种导航任务中实现平衡表现,首先将异构的目标规格投影到一个统一的对齐空间。然后,通过联合编码机器人的连续视觉观测和情节级自运动历史,构建双流时空上下文。两个流都明确地受到目标相关信息的调制,并聚合成紧凑的条件上下文 C。在 C 的条件下,共享的 DiT 通过非对称去噪共同生成未来动作轨迹和潜在视觉预见。

1 统一目标对齐
为了在单一策略中实现图像目标(Image-Goal)、点目标(Point-Goal)和无目标探索(No-Goal)的平衡表现,WAM-Nav 引入统一目标对齐机制。与以往将所有任务重新定义为点目标导航的导航方法不同,设计保留特定模态的目标信息,以在不同的导航场景中维持任务特定的表达能力。给定目标输入 g,WAM-Nav 将其编码为两个互补的目标嵌入:用于视觉记忆检索的视觉语义查询 g_V,以及用于轨迹级方向指导的几何查询 g_G。
形式上,目标输入 g 首先通过特定模态的特征提取器 E_φ(·) 转换为基础嵌入 e_g,然后投影到两个功能 token 空间,其中E_φ(·) 根据目标模态实例化,包括为图像目标从零开始训练的视觉 Transformer、用于相对坐标的正弦位置编码,以及用于无目标探索的掩码零状态表示。投影算子 ψ_V(·) 和 ψ_G(·) 是可学习的线性映射,分别将基础嵌入映射到视觉语义空间和几何空间。
这种对齐设计在保留特定模态目标信息的同时,为异构导航任务提供了统一接口,使不同目标设置下的表现更加平衡,并生成后续动作与视觉预见联合建模的目标条件化上下文。
2 双流上下文条件化
虽然视觉历史为避障提供了空间线索,但仅仅依赖视觉条件化往往会导致运动学不一致或抖动轨迹,这是由于缺乏明确的动量约束。为了解决这个问题,WAM-Nav 引入双流上下文条件化(DSCC),其历史滑动窗口从 t − k + 1 到 t。通过融合目标调节的视觉记忆流(捕捉局部空间几何信息)和轨迹-觉察的运动学历史流(捕捉物理动量)来动态构建条件上下文 C。融合这些流为共享的 DiT 提供一个时空条件上下文,从而确保生成的动作轨迹在几何上无碰撞且在运动学上平滑。
目标调节的视觉记忆。历史 RGB 观测值 O_t 由 DINO-v2 34 处理成一个记忆张量 V,其中 B 表示批次大小,k 是历史窗口长度,P 是每帧的图像块数量。为了选择性地强化与目标相关的空间tokens,视觉查询 g_V 通过缩放点积计算每个图像块token的独立相关性得分。然后对视觉记忆进行残差更新。
轨迹-觉察运动历史。为了融入智体的运动学动量并确保鲁棒的零样本泛化能力,运动轨迹流处理已执行的姿态序列 St。绝对姿态被转换为当前以自我为中心的坐标系中的坐标不变相对位移和航向变化,从而产生相对运动学序列 S̃_t。
该相对运动序列 S̃_t 被嵌入并由因果 Transformer 编码器 H 处理,以捕获时间运动学轮廓。为了将过去的动量与当前目标方向对齐,我们通过交叉注意力机制,利用几何目标嵌入 g_G 查询 H,以提取整合的运动学向量 o_kin。向量 o_kin 从数学角度概括了智体相对于其目标方向的历史运动连续性。
基于交叉注意机制的条件融合。为了在结构上强制执行运动学动量以指导空间视觉检索,视觉流和轨迹流通过多层 Transformer 解码器进行整合,以构建统一的条件上下文 C。具体而言,提取的运动学token o_kin 被投影到一组可学习的查询嵌入 Q_c 上。
从架构上看,这种融合机制利用智体的运动学动量 (o_kin) 主动查询目标调制的视觉空间上下文 (Ṽ)。由此得到的条件上下文 C 明确地约束后
续的生成,从而确保了物理执行的流畅性和几何安全性。
3 非对称动作-前瞻生成
在统一的条件上下文 C 的条件下,WAM-Nav 在共享的表示空间内,联合建模了长规划范围 H_act 内的未来动作轨迹 A_t = {a_t, . . . , a_t+H_act −1 } 及其对应的短预测范围 H_vis (H_vis ≤ H_act) 内的潜视觉前瞻 Z_t+1:t+H_vis = {z_t+1,...,z_t+H_vis}。未来视觉状态 z_i = E(o_i) 通过预训练的稳定扩散 VAE 35 压缩成 N 个潜在块的紧凑网格。
为了优化这一生成过程,采用流匹配36训练策略,通过非对称联合扩散来学习联合条件分布p_θ(A,Z | C)。该策略将连续概率路径表示为直线,将标准高斯先验(A_0,Z_0)∼N(0,I)映射到经验数据流形。
这种非对称生成进展的架构基础是一个共享的 DiT。带噪的序列 A_τ 和 Z_τ 会被token化、拼接,然后通过多层 DiT 处理。关键是,在每个 DiT 块中,这些异质的 token 会进行共享自注意处理,从而在每一层实现物理动作路径和潜视觉表示之间的时空约束动态交换。两个流都会交叉关注条件上下文 C,并且通过自适应 LayerNorm(adaLN)层调节时间步 τ,以回归联合速度场。
这种共享参数化使得潜预测能够作为基于感知的约束来影响动作生成,并通过视觉速度匹配损失来惩罚动作与场景的不一致性。与面向操作的WAM19, 20(其中未来的视觉变化通常是局部的且以物体为中心)不同,导航涉及以自我为中心的大范围视角变化;长时间的自回归视觉扩展会引入推理延迟和累积的视觉误差,从而可能误导动作生成。因此,WAM-Nav采用一种非对称设计:长时程动作保持轨迹的连续性,而短时程潜在预测则提供可靠的近期几何约束,同时避免过度扩展视觉预测。
4 模型训练与推理
通过最小化一个联合目标函数来训练 WAM-Nav,该联合目标函数由流匹配速度回归和多模态目标对齐组成。
通过最大化等效目标在不同空间投影之间的互信息,该对齐约束确保不同目标模态之间的一致性,从而有助于提取统一的方向和视觉线索,而无需考虑原始输入格式。
在在线部署期间,WAM-Nav 遵循滚动时域控制循环。与 NAVDP 13 一致,在每个步骤中,根据当前条件上下文 C,策略会采样 16 条候选轨迹。遵循先前的生成式导航策略 11,选择第一个采样的轨迹执行。
1 仿真实验
训练数据集和设置。与之前的研究12, 13一致,WAM-Nav 使用大规模视觉导航数据集 VLN-N1 33, 38 进行训练。VLN-N1 由六类 3D 场景资源构成,包括 Replica 39、Matterport3D 40、Gibson 41、3D-FRONT 42、HSSD 43 和 HM3D 44。该数据集利用广泛的域随机化流程,提供了超过 400 小时的无碰撞且平滑的第一人称导航轨迹,这些轨迹均在仿真中采集,总计超过 20 万条。WAM-Nav 的学习率为 1.5 × 10⁻⁴,总训练成本约为 8 × 120 GPU 小时。
零样本评估平台。在基于 IsaacSim 构建的仿真基准测试平台上,使用 ClearPath Dingo 轮式机器人作为导航器,在零样本设置下评估 WAM-Nav 和所有基线方法。所有方法均直接使用其原始预训练权重进行评估,无需额外的微调。该基准测试平台包含两类环境:杂乱场景 (ClutterScenes) 和室内场景 (InternScenes) 13, 33, 45。杂乱场景包含 10 个简单场景和 10 个困难场景。两者均由随机生成的包含杂乱障碍物的布局构成,其中困难场景的障碍物分布更为密集。室内场景包含 20 个家庭场景和 20 个商业场景。家庭场景的特点是通道狭窄、布局杂乱,而商业场景涵盖了典型的室内场所,例如超市和餐厅。对于每个场景,随机抽取 100 个导航回合,总共得到 6,000 个评估回合。
评估指标。对于图像目标和点目标导航,评估成功率 (SR) 和路径长度加权成功率 (SPL) 来衡量任务完成情况和导航效率。对于无目标探索,报告回合时间和探索区域来评估探索能力。回合时间上限为 120 秒,局部卡死的回合将提前终止。所有指标的数值越高,性能越好。
2 真实环境部署
采用零样本部署方式,将 WAM-Nav 应用于配备 Intel RealSense D455 摄像头的 Unitree G1 人形机器人上。评估在四种室内外环境中进行:会议室、仓库、大厅和停车场,每个场景进行 10 次试验。