360CityArena:用于具身智能体的逼真虚拟城市导航基准

作者 :Kenta Watanabe, Atsuyuki Miyai, Mizuki Takenawa, Kiyoharu Aizawa, Toshihiko Yamasaki

机构 :日本东京大学

邮箱 :{k_watanabe, miyai, yamasaki}@cvm.t.u-tokyo.ac.jp, {takenawa, aizawa}@hal.t.u-tokyo.ac.jp

项目主页https://360mm-team.github.io/360CityArena/

摘要

我们提出了 360CityArena,这是一个用于评估具身智能体在由 360° 视频构建的逼真环境中的城市探索能力的基准。现有的室外基准要么缺乏足够的逼真度,要么缺乏复杂性,导致与真实的城市环境存在巨大差距。360CityArena 建立在日本东京秋叶原地区的逼真重建之上,使用了 602 个 360° 视频片段,覆盖 85 条街道,并包含 175 个精心人工设计的任务。它涵盖三个任务类别:环境理解(Environment Understanding)、路径推理(Path Reasoning)和空间推理(Spatial Reasoning),涵盖了城市探索所需的基本能力,如定位、地标搜索、路径规划和关系空间推理,从而能够在逼真的城市场景中进行全面评估。我们使用最先进的大型多模态模型(LMM)智能体进行的评估表明,即使是最强的模型 Gemini 2.5 Flash,其表现也远低于人类水平(人类:77.3%77.3\%77.3% vs. Gemini 2.5 Flash:17.1%17.1\%17.1%),揭示了在城市尺度的具身导航和推理方面仍然存在巨大挑战。360CityArena 为逼真城市街区导航和空间推理提供了一个必要且充满挑战的测试平台。

关键词:具身 AI · 城市导航基准 · 逼真虚拟环境


1. 引言

想象一个未来,AI 助手成为城市生活自然的一部分。它可以在你迷路时提供帮助,引导盲人到达目的地,并在任何人需要时提供支持。这种助手将使城市更加无障碍,减少旅行的困难,并帮助创造一个更具包容性的社会。实现这一愿景的一个有前途的方法是具身 AI(Embodied AI),即智能体基于对周围环境的感知来执行复杂任务 1, 8, 10, 26。实现这一愿景需要在反映真实街道视觉复杂性的逼真城市环境中,对这类系统进行广泛的任务评估和测试。

城市探索研究的一个核心问题是,缺乏能够在真实反映广阔城市空间导航的环境中评估智能体的基准。现有的 3D 模拟器在重建具有足够逼真度和复杂性的城市场景方面存在不足 9, 12, 17, 44。虽然基于 Google 街景(GSV)构建的环境提供了逼真的图像 6, 11, 30, 49,但它们缺乏动态元素,且不提供连续、完全可导航的空间。为了解决这些问题,最近的研究探索了将真实城市视频转换为模拟环境,以实现更逼真和交互式的体验 45。然而,该方法中使用的视频片段较短,不适合探索扩展的真实街道网络。

与此同时,最近的工作研究了从不同模态和视角进行的导航,例如城市上空的航空视觉语言导航(VLN)和纯地图的路线规划评估 22, 34, 46。这些研究方向是互补的,但它们仍然没有捕捉到在具有丰富动态的真实街道场景中进行的地面级、自我中心(egocentric)的城市探索。为了进一步推动该领域的发展,我们需要一个基准,该基准涵盖高度逼真和动态的城市街道环境中的任务,同时支持平滑的自我中心导航。

在本文中,我们提出了 360CityArena ,这是一个用于评估具身智能体的基准,其环境是一个逼真的真实世界城市街区,表示为 360° 视频轨迹的互连位姿图(pose graph)。360CityArena 构建于重现东京主要城市街区秋叶原的逼真虚拟世界(Realistic Virtual World, RVW)环境之上 41,包含 175 个手动创建的任务。该环境南北跨度约 750750750 米,东西跨度约 650650650 米,覆盖 85 条互连街道。每个任务都扎根于真实的城市结构和地标,鼓励智能体执行基于探索的实用活动。

如图 2 所示,360CityArena 包含三种任务类型:(i) 环境理解,(ii) 路径推理,(iii) 空间推理。(i) 环境理解针对视觉识别和自我定位,衡量智能体对环境的感知理解。(ii) 路径推理侧重于在环境真实空间布局内的路径规划和决策能力。(iii) 空间推理通过导航评估地理空间推理。在更细的粒度上,该基准系统地测量了七种不同的能力。此外,每个任务被分为简单(Easy)、中等(Medium)和困难(Hard),使得可以根据难度级别评估智能体。通过这些系统构建的任务,360CityArena 能够对具身智能体在真实世界城市环境中感知、推理和行动的能力进行全面评估。

我们的实验表明,最先进的基于 LMM 的智能体在所有任务上的表现都远低于人类水平,特别是在地图导航、物体计数和关系空间推理方面。这既证明了 360CityArena 作为逼真城市环境综合基准的价值,也表明了对更强城市尺度智能体的需求。我们还评估了移除显式自我位置信息(例如地图)的影响。性能并未出现一致的下降,甚至在某些任务中有所提高,这表明提供位置先验的方式会影响探索策略和失败模式,从而为未来的模型设计提供信息。

我们论文的贡献总结如下:

  • 提出 360CityArena:我们引入了 360CityArena,这是一个基于 360° 视频重建的东京秋叶原街区逼真虚拟世界的城市街区基准。该基准提供了跨越环境理解、路径推理和空间推理三个类别的七种任务类型,使得能够在具有互连街道网络的逼真城市环境中对具身智能体进行全面评估。除了评估之外,360CityArena 还可作为在逼真虚拟世界中为具身 AI 构建训练数据的实用指南。
  • 对近期 LMM 进行基准测试:我们基于几个专有 LMM 和开源视觉语言模型构建了具身智能体,并在 360CityArena 上进行了基准测试。结果揭示了在所有任务中与人类相比存在巨大的性能差距,并且随着任务难度的增加,性能明显下降。
  • 全面分析:通过广泛的定性和定量分析,我们研究了输入模态(语言与图像)、自我位置信息的存在与否,以及特定模型和任务的失败模式如何影响智能体的行为和性能。这些分析提供了关于视觉线索和自我定位在城市具身任务中作用的见解。

2. 相关工作

具身智能体:具身智能体是一种遵循语言指令并通过相机视角和传感器信息感知环境来完成任务的 AI 系统。LMM 的最新进展极大地改善了多模态集成和推理,使其成为具身智能体的强大基础 15, 16, 24, 56。具身智能体研究涵盖真实机器人 19, 39, 52、室内模拟器 21, 37, 51 和室外模拟器 6, 45。虽然真实机器人最逼真,但数据收集成本高昂且通常特定于环境,限制了泛化能力。因此,模拟环境因其多样性和可重复性而受到关注 10。室内模拟器易于收集数据,但规模有限且布局简单 37,这促使研究转向具有行人和车辆等动态元素的更大、更复杂的室外环境 30, 49

室外环境中的导航智能体:模拟环境的最新进展将具身导航研究从室内设置 21, 28, 35--37, 51 扩展到了大规模室外环境。室外导航任务通常根据目标的指定方式进行区分:点目标导航(给定目标坐标)25, 30, 44;图像目标导航(提供参考图像)17, 18;对象目标导航(用语言描述目标,如地标)5, 14;以及视觉语言导航(VLN,智能体遵循自然语言指令)6, 23, 49。有些工作直接在地图上进行路线规划评估,而不使用具身模拟 34, 46, 49。与此同时,CityNav 22 研究了从航空视角进行的真实世界导航,这是互补的,但不同于具有自我中心街道场景的地面级探索。另外,地图理解也在具身导航之外进行了探索,包括用于 grounding LLM 规划的基于文本的地图表示(Tag Map 54)和用于高级地图查询的 VLM 基准(MAPWise 32)。

虽然点目标、图像目标和对象目标任务强调通过视觉或语义线索高效到达目标,但 VLN 还需要更高层次的推理来解决语言歧义和地标引用。然而,航空 VLN 数据集和纯地图评估并未共同捕捉到逼真街道环境中的自我中心导航和城市推理。为了填补这一空白,我们引入了一个城市街区基准,将以下三点统一起来:(i) 逼真的、动态的街道级观测,(ii) 涵盖环境理解、路径推理和空间推理的多任务诊断,以及 (iii) 在匹配条件下对语言和图像目标地标搜索的受控比较。

真实世界模拟环境:先前的工作探索了 3D 场景重建、基于 Google 街景的环境和 3D 模拟器,以构建真实世界的模拟设置。对于 3D 场景重建,基于神经辐射场(NeRF)29 和高斯溅射(Gaussian Splatting)20 的方法催生了许多扩展 4, 47, 48, 53。尽管取得了这些进展,但大多数方法仍局限于生成静态场景,不提供完全交互的环境 45。传统 3D 模拟器中的城市级重建可以程序化地生成多样的变化并支持丰富的智能体-环境交互,但在逼真度和结构复杂性方面存在不足 12, 17, 27, 44

基于 Google 街景(GSV)构建的环境实现了传统 3D 模拟难以企及的多样且高度逼真的城市级表示 6, 11, 30, 42, 49。然而,这些 GSV 环境不包含动态元素,且全景图之间固有的不连续性造成了与真实世界连续导航的差距 30。为了解决这个问题,最近的一项工作尝试将真实城市视频转换为交互式模拟环境 45。虽然这种方法很有前景,但该环境依赖于短视频片段,不适合大规模城市探索。Takenawa 等人 41 引入了从大量 360° 视频生成的逼真虚拟世界(RVW),提供了一个具有真实行人和车辆动态的逼真且动态的城市级环境。我们利用此 RVW 构建了一个用于具身智能体逼真城市尺度探索的基准。虽然在每个拍摄轨迹内的导航是连续且平滑的,但在轨迹边界处会出现不连续性,并且由于环境是由预录视频构建的,因此不支持物理交互。我们在表 1 中总结了代表性真实世界城市环境的关键属性。

3. 360CityArena

我们引入了 360CityArena,这是一个精心设计的新型基准,旨在通过广泛的任务评估智能体探索逼真城市街区的能力(见图 3)。该基准建立在从日本秋叶原实际街区重建的逼真虚拟世界之上,包含分为三个主要类别和七个子类别的 175 个任务。

我们首先在 3.1 节描述秋叶原虚拟环境。然后在 3.2 节详细说明每个任务类别。任务构建过程在 3.3 节概述,随后是 3.4 节的评估协议。

3.1 秋叶原虚拟环境

360CityArena 中使用的环境是从秋叶原实际街区构建的逼真虚拟世界,包含 85 条街道上的 602 个 360° 视频片段 41。视频被投影到球面上,并在 Unity 中组织成可导航的位姿图,使智能体能够 traversing 捕获的区域。因此,智能体沿着表示为位姿图的预录 360° 视频轨迹导航,而不是自由移动到任意 3D 位置或与环境进行物理交互。生成的位姿图形成一个包含 193 个节点和 305 条边的单一连通分量,平均分支度为 3.163.163.16。

在地理覆盖范围上,360CityArena 围绕秋叶原站南北跨度约 750750750 m,东西跨度约 650650650 m。秋叶原最初是一个电子区,现已发展成为主要的商业和文化中心,拥有密集的电子和动漫/游戏相关零售及旅游景点。

该地区具有多样化的街景,包括狭窄的人行道、复杂的建筑布局、丰富的户外广告和电子标志牌,创造了视觉密集、信息丰富的场景。每条街道被拍摄两次(每个方向一次),反映了依赖于方向的视觉变化。这些特征使秋叶原非常适合在逼真的城市模拟中评估具身智能体的感知和导航能力。

尽管 360CityArena 目前仅包含一个城市,但其表示是通用的。遵循 Movie Map 范式 40,可以通过使用 GPS/SLAM 和地图对 360° 帧进行地理定位、识别交叉路口并将片段连接成可遍历的位姿图,来构建类似的城市级环境。我们带有 360° 观测值的城市无关图与此类环境直接兼容。

3.2 任务类别

我们的基准包含三个主要类别和七个子类别,示例如图 2 所示。每个子类别包含 25 个任务。我们详细描述每个类别如下。

  1. 环境理解 :此类别评估智能体感知和理解周围环境的能力,涵盖视觉感知、记忆和基于语言的场景理解。它包括三个子类别:定位(Localization)、语言地标搜索(Landmark Search with Language,对象目标)和图像地标搜索(Landmark Search with Image,图像目标)。在定位任务中,智能体从视觉观测中推断其在 5×55 \times 55×5 网格上的初始位置。与从场景预测广阔区域的 GeoGuessr 式地理定位 13 不同,我们的任务在更小的尺度上运行,并依赖于城镇布局和本地地标。两个地标搜索任务要求导航到指定的地标,该地标以自然语言或图像形式提供;除了输入模态外,它们共享相同的设置,从而能够对模态效应进行受控比较。
  2. 路径推理:此类别评估智能体基于空间理解进行规划和探索的能力。它不仅衡量智能体的规划和决策能力,还衡量其根据环境空间布局执行这些计划的能力。此任务的子类别是地图导航(Map Navigation)和视觉语言导航(VLN)。地图导航要求智能体使用地图信息选择最佳路线,并从指定的起点导航到指定的目标点。视觉语言导航要求智能体解释并遵循多步自然语言指令,并相应地移动到目标。
  3. 空间推理:此类别评估智能体理解环境中物体的结构布局和地标之间位置关系的能力。它衡量核心的空间感知和逻辑推理能力。此任务的子类别是关系空间推理(Relational Spatial Reasoning)和物体计数(Object Count)。关系空间推理要求智能体推断地标之间的相对空间关系。给定一个参考地标和指定的关系,智能体必须识别满足该关系的地标。物体计数是一个数量估计任务,智能体必须准确计算指定区域内特定对象的数量。

3.3 基准构建

我们的构建过程涉及 8 名标注者。我们为七个子任务中的每一个分配了两名标注者。为了确保不同任务之间任务质量的一致性,一名作者被分配参与所有任务。为了确保基准的质量,我们选择了实际亲自去过秋叶原的标注者。他们在 Unity 中直接与环境交互并创建任务,并验证每个任务是否可解。整体任务构建过程需要约 60 小时。

每个任务由标注者根据距离、指令歧义、地标可见性和所需的探索程度标记为简单、中等或困难,而不是固定的步数阈值。为了支持这些标签,与任务相关的统计数据表明,从简单到困难呈单调增加:地图导航的路径长度和决策点分别为 124/247/347124/247/347124/247/347 m 和 3.3/6.4/9.03.3/6.4/9.03.3/6.4/9.0,物体计数的真实计数为 3.5/4.6/9.03.5/4.6/9.03.5/4.6/9.0,VLN 指令步数为 4.4/5.9/7.44.4/5.9/7.44.4/5.9/7.4。边界情况可能仍涉及主观性。

3.4 评估协议

我们定义了一组评估标准来评估智能体的性能。我们的基准采用四种评估协议,每种协议旨在捕捉任务成功的不同方面。我们在下面详细说明每种协议及其对应的任务类别。

  1. exact_match(精确匹配):适用于输出明确定义为数值(网格坐标)或文本字符串的任务 31, 55。在此指标下,评估智能体的最终文本输出,仅当其与答案文本完全匹配时,预测才被视为正确。在我们的基准中,定位任务使用此评估指标。
  2. fuzzy_match(模糊匹配) :利用语言模型(在我们的实现中为 GPT-5)评估输出是否与真实答案在语义上等价 31, 55。重要的是,GPT-5 评估器与智能体完全隔离,仅将最终输出与真实答案进行比较,防止任何信息泄露。在关系空间推理任务中,我们采用了此评估指标,并额外进行了人工验证。GPT-5 评判者与人类多数投票的一致性达到 97.9%97.9\%97.9% (κ=0.937\kappa=0.937κ=0.937),接近标注者间的一致性 (κ=0.984\kappa=0.984κ=0.984),支持其用于评估自动化。
  3. coordinate_match(坐标匹配) :用于智能体必须在环境中移动后输出其最终位置的任务。坐标直接从 Unity 中获取。此指标应用于地图导航、VLN 以及图像/语言地标搜索。对于所有这些任务,通过测量与目标位置的欧几里得距离来评估智能体的最终位置,如果距离在阈值 ϵ\epsilonϵ 内,则预测被视为正确。对于距离阈值 ϵ\epsilonϵ,除地图导航外,所有任务的阈值设为 ϵ=10\epsilon = 10ϵ=10 m,地图导航使用较大的阈值 ϵ=20\epsilon = 20ϵ=20 m,以考虑地图上标记大小引起的噪声。阈值敏感性检查表明,在 0.75×0.75\times0.75× 到 1.5×1.5\times1.5× 阈值范围内模型排名稳定(Kendall's τ≥0.89\tau \ge 0.89τ≥0.89),即使在 ϵ=30\epsilon = 30ϵ=30 m 时,人类与最佳 LMM 的差距仍超过 36 个百分点,且地图导航在 ϵ=15--25\epsilon = 15\text{--}25ϵ=15--25 m 时的变化在 ±2\pm 2±2 个百分点以内。
  4. mean_relative_accuracy (MRA, 平均相对准确率) :这是一种灵活的评估指标,适用于涉及数值估计的任务 50。在我们的基准中,这对应于物体计数任务。MRA 在一系列评估阈值 C={0.5,0.55,...,0.95}C=\{0.5, 0.55, ..., 0.95\}C={0.5,0.55,...,0.95} 上平均相对准确率:
    MRA=110∑θ∈C1(∥y^−y∥<1−θ)MRA = \frac{1}{10} \sum_{\theta \in C} \mathbb{1}(\|\hat{y} - y\| < 1 - \theta)MRA=101θ∈C∑1(∥y^−y∥<1−θ)
    其中 y^\hat{y}y^ 表示预测值,yyy 表示真实值。MRA 考虑了误差的大小,因此比简单的二元正确/错误分类提供了更合适的评估。

4. 导航智能体

4.1 问题公式化

环境-智能体交互可以建模为部分可观测的序列决策过程:E=(S,A,Ω,T)E=(S, A, \Omega, T)E=(S,A,Ω,T),其中 SSS 表示状态集,AAA 表示动作集,Ω\OmegaΩ 表示观测集。转移函数定义为 T:S×A→ST: S \times A \rightarrow ST:S×A→S,状态之间的转移在给定动作的条件下是确定性的。在每个时间步 ttt,环境处于某个状态 sts_tst(例如,特定的位置和观察方向)。智能体接收部分观测 ot∈Ωo_t \in \Omegaot∈Ω,该观测由在时间 ttt 捕获的视觉输入以及可选的当前位置信息(显示为带有标记的图像,指示智能体在地图上的位置和方向)组成。智能体还维护一个记忆缓冲区 Mt∈MM_t \in MMt∈M,用于存储直到 t−1t-1t−1 步的重要信息。然后,智能体基于 oto_tot 和存储的记忆 MtM_tMt 发出动作 at∈Aa_t \in Aat∈A,这会导致新状态 st+1∈Ss_{t+1} \in Sst+1∈S 和来自更新视点的新观测 ot+1∈Ωo_{t+1} \in \Omegaot+1∈Ω。同时,来自 oto_tot 和思想的相关信息被写入记忆,将其更新为 Mt+1M_{t+1}Mt+1。

4.2 基线智能体

在我们的实验中,我们评估了多个 LMM 作为基线智能体:GPT-5 33、Claude Sonnet 4.5 (20250929) 2、Gemini 2.5 Flash 7、Qwen2.5-VL-32B-Instruct 3 以及 InternVL3.5-8B 和 InternVL3.5-38B 43。在这些模型中,GPT-5、Claude Sonnet 4.5 和 Gemini 2.5 Flash 是闭源的,而 Qwen2.5-VL-32B-Instruct、InternVL3.5-8B 和 InternVL3.5-38B 是开源的。

对于开源模型的推理,我们使用了八块 NVIDIA A100 80GB GPU。此外,所有任务均在运行于 macOS 的 Unity 6000.0.30f1 (Unity 6 LTS) 中执行。

在我们的设置中,动作空间 AAA 包含 7 个离散动作:向前移动、向上倾斜视点、向下倾斜视点、向右旋转视点、向左旋转视点、重置视点以与当前行进方向对齐,以及输出答案。在分支点,动作空间会增加对应于可用可遍历方向的移动动作,例如直行、走右侧分支或走左侧分支。


5. 实验

5.1 实验结果

人类表现 :我们在获得机构审查委员会(IRB)批准后进行了人类评估。我们招募了 5 名参与者,包括本科生和研究生。我们选择了以前去过秋叶原或经常去该地区的参与者。由于在特定城市街区的真实世界部署可以从本地熟悉度中受益,我们将此结果报告为本地专家人类基线,它作为域内上限参考,而不是通用人类基线。

如表 2 所示,人类参与者的准确率高于当前的 LMM。对于地图导航、图像地标搜索、视觉语言导航和关系空间推理等任务,人类达到了约 90%90\%90% 的准确率。相比之下,定位、语言地标搜索和物体计数的表现较为温和,分别为 68%68\%68%、64%64\%64% 和 45%45\%45%。在地标搜索中,语言和图像变体的任务配置除了输入模态外完全相同。参与者在图像条件下达到更高准确率的事实表明,视觉输入包含比文本描述丰富得多的信息,包括有关外观、位置和整体场景上下文的线索。

接下来,我们的主要发现如下:

  • F1:LMM 的表现远低于人类水平。如表 2 所示,所有 LMM 在整个基准测试中都远未达到人类表现。Gemini 2.5 Flash 在评估的模型中取得了最高的整体表现,而最强的模型在不同任务中有所变化(例如,GPT-5 在图像地标搜索和关系推理中表现最佳)。这些结果表明,尽管取得了渐进式进展,但在达到人类水平的环境理解和空间推理方面仍存在巨大差距。
  • F2:基于图像的地标搜索可能比基于语言的搜索更容易 。跨模型来看,图像地标搜索通常优于语言地标搜索(例如,GPT-5:48.048.048.0 vs. 16.016.016.0;Claude:16.016.016.0 vs. 4.04.04.0;Qwen:20.020.020.0 vs. 16.016.016.0),这表明视觉输入提供了更直接支持导航的具体线索(外观、纹理和周围上下文)。然而,这种改善并非普遍存在。InternVL 并未显示出从图像输入中获得明显增益(8B:20.020.020.0 vs. 20.020.020.0;38B:0.00.00.0 vs. 16.016.016.0),表明其在有效利用地标图像方面存在局限性。通过同时包含基于图像和基于语言的变体,我们的基准能够分析模型如何利用不同的输入模态。
  • F3:随着任务难度增加,性能下降 。如图 4 所示,模型性能通常随着任务难度的增加而下降。例如,GPT-5 在环境理解中的准确率从简单、中等和困难设置的 28.0→25.0→18.528.0 \rightarrow 25.0 \rightarrow 18.528.0→25.0→18.5 下降,在路径推理中从 11.1→0.0→0.011.1 \rightarrow 0.0 \rightarrow 0.011.1→0.0→0.0 下降。这证明了该基准允许在不同难度级别上对模型性能进行有意义的比较。

5.2 分析

位置信息的影响 :如表 3 所示,我们检查了明确向智能体提供其当前位置如何影响其空间理解和推理能力,发现添加位置先验并未在不同任务中带来一致的性能提升。在环境理解中,语言地标准确率从 24.0%24.0\%24.0% 下降到 16.0%16.0\%16.0%,而图像地标没有显示出有意义的变化(在误差范围内)。路径推理任务(地图导航和 VLN)几乎没有差异,表明静态位置信息无法帮助路径规划或指令解释。在空间推理中,物体计数略有改善,但关系推理从 48.0%48.0\%48.0% 下降到 32.0%32.0\%32.0%。这些性能下降表明,智能体难以将基于地图的位置和关系信息与从视觉输入中得出的真实世界线索对齐,而不是位置信息本身没有帮助。虽然先前的工作解决了基于地图的推理 34, 38, 46,但地图到视觉对齐过程的影响仍未得到充分检验。未来的研究应独立评估这种对齐能力,并在必要时提供学习它的机制。

不同模型的独特失败模式 :为了更好地理解三个主要模型(GPT-5、Gemini 2.5 Flash 和 InternVL3.5-38B)的失败因素,我们使用 Gemini 3 Flash 分析了来自视点图像、地图和思考历史的失败案例,将每个案例分配给五个类别之一:动作(Action)、定位(Grounding)、感知(Perception)、探索(Explore)和规划(Planning),然后让人类验证标签并选择单一的主导原因。动作表示低级动作错误(例如, overshoot、错误动作、过早回答);定位表示自我定位/方向不一致;感知表示对象识别失败;探索表示停滞或循环;规划表示错过指令或要求。

按模型和任务类别得出的细分结果如图 5 所示。这些结果应被解释为诊断集成的具身城市性能,而不是隔离纯粹的空间推理:动作和探索失败表明,当前的 LMM 智能体在将感知和推理转化为导航决策时,也存在控制器和提示脆弱性的问题。

结果揭示了反映模型能力的独特失败模式。首先,GPT-5 与其他模型形成鲜明对比:它显示出极少的动作失败(在环境理解中为 12%12\%12%),但探索失败占主导地位(55%55\%55%),表明其基本执行有效,但探索策略较差。相反,Gemini 2.5 Flash 和 InternVL3.5-38B 主要在动作失败(约 40%40\%40%)上挣扎,指出低级控制存在缺陷。其次,在所有模型的空间推理中,感知失败激增(Gemini 达到 38%38\%38%),证实了忽略微小视觉细节对空间任务是致命的。此外,Gemini 在各类别中表现出一致的定位错误(15--21%15\text{--}21\%15--21%),表明其在将地图数据与第一人称视角对齐方面存在持续困难。

成功与失败的案例研究 :对于语言变体失败但图像变体成功的"地标搜索"任务,我们使用 GPT-5 分析了个别案例,检查了智能体的视觉观测。此处显示的示例是一个智能体必须定位 Jonathan 餐厅的任务。

在图 6 的语言地标搜索失败案例中,智能体经过 Hotto Motto,并假设 Jonathan 位于其上方,促使它向上看。在未能找到目标后,它将视线向右移动并继续扫描。结果,智能体停留在同一位置,反复改变视点,直到由于步数限制而导致 episode 结束。

相比之下,如图 7 所示,在图像地标搜索中,目标图像提供了诸如街角位置以及带有红色标志的独特的蓝白垂直立面等线索。因此,智能体忽略了 Hotto Motto,向主要十字路口移动,并成功找到了目标建筑。


6. 限制与未来工作

探索受限与交互有限 :由于 360CityArena 由预录的 360° 视频构建,智能体只能沿着捕获的轨迹探索,而不能自由移动到任意位置。因此,跨越轨迹边界的过渡可能会引入在完全交互的 3D 模拟器或真实世界中不会出现的不连续性。在我们的日志中,边界过渡动作占所有动作的 11.3%11.3\%11.3%,并且在动作或探索失败中并未过度代表;人工检查也没有发现明显的由不连续性引起的失败。尽管如此,我们认为在高度逼真的城市环境中进行情境视觉导航和空间推理,对于当前基于 LMM 的智能体来说仍然是具有挑战性且重要的。扩展环境以支持更自由的探索和丰富的交互是未来工作的重要方向。

城市多样性有限:当前基准的一个局限性是它仅限于单一城市街区,这可能会限制城市多样性以及关于跨区域泛化的结论。然而,我们认为 360CityArena 提供了一个独特的逼真、大规模设置,促进了比现有基准更真实的城市评估。我们将跨区域泛化留作未来工作的重要方向。


7. 结论

我们提出了 360CityArena,这是一个旨在评估具身智能体在由 360 度视频构建的逼真环境中的城市探索能力的基准。我们的实验结果表明,最先进的基于 LMM 的智能体在理解和推理城市环境方面仍面临重大挑战。我们相信,提供接近真实世界条件的基准将进一步推动适用于真实城市环境的具身智能体的发展。

相关推荐
大熊背5 小时前
IspPipeline色相旋转模块实现
人工智能·算法·计算机视觉
羞儿6 小时前
【读点论文】From Coarse to Fine-Grained Open-Set Recognition
人工智能·深度学习·计算机视觉·细粒度·开集识别
matlab代码7 小时前
基于直方图优化的图像去雾技术【源码71期】
人工智能·深度学习·计算机视觉
ADAI_Bowen8 小时前
2026 年 8 月建筑设计 AI 工具分析:基于几何保真、可控与编辑能力
人工智能·机器学习·计算机视觉
2601_962293538 小时前
第3.7章 机器人第三方库实战总结(七):OpenCV视觉SLAM核心库详解:API速查+源码实例+避坑指南
图像处理·opencv·计算机视觉·slam·第三方库
论文复现现场9 小时前
工业缺陷检测训练选 YOLO11 还是 RT-DETR?一张 24GB RTX 4090 跑通 PoC 的完整方案
yolo·计算机视觉·rtx4090
hhzz9 小时前
【OpenCV 入门到精通 04】视频入门与绘图交互:从摄像头到鼠标画笔
人工智能·python·opencv·计算机视觉·音视频·交互
棣廷10 小时前
初识OpenCV——人脸检测与识别实战
人工智能·opencv·计算机视觉
qq_5260991311 小时前
视觉检测工控机丢帧、掉线、卡顿,分别是什么原因?按这张表查
数码相机·计算机视觉