概览篇:世界模型、空间智能与地理空间智能是什么关系

语料口径:以下数字是本地筛选表的过程记录,不是会议官方主题统计。

CVPR 2026 共 4,068 篇:关键词初筛 942 篇,二次筛选 299 篇;本领域命中约 22 篇,精读 12 篇。

SIGSPATIAL 2026 共 128 篇:筛出 44 篇,命中 21 篇;其中预印本可读 12 篇,精读 6 篇。

arXiv 2026 年 1---8 月过筛 519 篇,下载 336 篇,聚为 8 类,精读 24 篇。另补搜地球嵌入 39 篇(精读 18 篇)和本地地理定位论文 36 篇。标题计数、摘要阅读与精读结论在各篇分别标明,不能相互替代。

先给结论:三个概念不是并列关系

世界模型、空间智能和地理空间智能回答三个递进的问题:

  1. 世界模型问:系统能否表示环境,并预测时间或动作使环境怎样变化?
  2. 空间智能问:这个表示里是否包含可用的形状、位置、尺度、视角和运动关系?
  3. 地理空间智能问:这些空间关系能否进一步接到地球参照系,并处理真实地理数据的尺度、传感器和计算规则?

因此,三者可按"动态环境目标 → 空间能力切面 → 地球坐标约束"理解。它们有交集,但不能凭名称互相替代。一个模型能恢复三维点云,不等于它能预测下一状态;一个模型能识别城市,不等于它能输出可配准的经纬度。
#mermaid-svg-wtzFgVP75fHsJlvj{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;fill:#333;}@keyframes edge-animation-frame{from{stroke-dashoffset:0;}}@keyframes dash{to{stroke-dashoffset:0;}}#mermaid-svg-wtzFgVP75fHsJlvj .edge-animation-slow{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 50s linear infinite;stroke-linecap:round;}#mermaid-svg-wtzFgVP75fHsJlvj .edge-animation-fast{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 20s linear infinite;stroke-linecap:round;}#mermaid-svg-wtzFgVP75fHsJlvj .error-icon{fill:#552222;}#mermaid-svg-wtzFgVP75fHsJlvj .error-text{fill:#552222;stroke:#552222;}#mermaid-svg-wtzFgVP75fHsJlvj .edge-thickness-normal{stroke-width:1px;}#mermaid-svg-wtzFgVP75fHsJlvj .edge-thickness-thick{stroke-width:3.5px;}#mermaid-svg-wtzFgVP75fHsJlvj .edge-pattern-solid{stroke-dasharray:0;}#mermaid-svg-wtzFgVP75fHsJlvj .edge-thickness-invisible{stroke-width:0;fill:none;}#mermaid-svg-wtzFgVP75fHsJlvj .edge-pattern-dashed{stroke-dasharray:3;}#mermaid-svg-wtzFgVP75fHsJlvj .edge-pattern-dotted{stroke-dasharray:2;}#mermaid-svg-wtzFgVP75fHsJlvj .marker{fill:#333333;stroke:#333333;}#mermaid-svg-wtzFgVP75fHsJlvj .marker.cross{stroke:#333333;}#mermaid-svg-wtzFgVP75fHsJlvj svg{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;}#mermaid-svg-wtzFgVP75fHsJlvj p{margin:0;}#mermaid-svg-wtzFgVP75fHsJlvj .label{font-family:"trebuchet ms",verdana,arial,sans-serif;color:#333;}#mermaid-svg-wtzFgVP75fHsJlvj .cluster-label text{fill:#333;}#mermaid-svg-wtzFgVP75fHsJlvj .cluster-label span{color:#333;}#mermaid-svg-wtzFgVP75fHsJlvj .cluster-label span p{background-color:transparent;}#mermaid-svg-wtzFgVP75fHsJlvj .label text,#mermaid-svg-wtzFgVP75fHsJlvj span{fill:#333;color:#333;}#mermaid-svg-wtzFgVP75fHsJlvj .node rect,#mermaid-svg-wtzFgVP75fHsJlvj .node circle,#mermaid-svg-wtzFgVP75fHsJlvj .node ellipse,#mermaid-svg-wtzFgVP75fHsJlvj .node polygon,#mermaid-svg-wtzFgVP75fHsJlvj .node path{fill:#ECECFF;stroke:#9370DB;stroke-width:1px;}#mermaid-svg-wtzFgVP75fHsJlvj .rough-node .label text,#mermaid-svg-wtzFgVP75fHsJlvj .node .label text,#mermaid-svg-wtzFgVP75fHsJlvj .image-shape .label,#mermaid-svg-wtzFgVP75fHsJlvj .icon-shape .label{text-anchor:middle;}#mermaid-svg-wtzFgVP75fHsJlvj .node .katex path{fill:#000;stroke:#000;stroke-width:1px;}#mermaid-svg-wtzFgVP75fHsJlvj .rough-node .label,#mermaid-svg-wtzFgVP75fHsJlvj .node .label,#mermaid-svg-wtzFgVP75fHsJlvj .image-shape .label,#mermaid-svg-wtzFgVP75fHsJlvj .icon-shape .label{text-align:center;}#mermaid-svg-wtzFgVP75fHsJlvj .node.clickable{cursor:pointer;}#mermaid-svg-wtzFgVP75fHsJlvj .root .anchor path{fill:#333333!important;stroke-width:0;stroke:#333333;}#mermaid-svg-wtzFgVP75fHsJlvj .arrowheadPath{fill:#333333;}#mermaid-svg-wtzFgVP75fHsJlvj .edgePath .path{stroke:#333333;stroke-width:2.0px;}#mermaid-svg-wtzFgVP75fHsJlvj .flowchart-link{stroke:#333333;fill:none;}#mermaid-svg-wtzFgVP75fHsJlvj .edgeLabel{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-wtzFgVP75fHsJlvj .edgeLabel p{background-color:rgba(232,232,232, 0.8);}#mermaid-svg-wtzFgVP75fHsJlvj .edgeLabel rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-wtzFgVP75fHsJlvj .labelBkg{background-color:rgba(232, 232, 232, 0.5);}#mermaid-svg-wtzFgVP75fHsJlvj .cluster rect{fill:#ffffde;stroke:#aaaa33;stroke-width:1px;}#mermaid-svg-wtzFgVP75fHsJlvj .cluster text{fill:#333;}#mermaid-svg-wtzFgVP75fHsJlvj .cluster span{color:#333;}#mermaid-svg-wtzFgVP75fHsJlvj div.mermaidTooltip{position:absolute;text-align:center;max-width:200px;padding:2px;font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:12px;background:hsl(80, 100%, 96.2745098039%);border:1px solid #aaaa33;border-radius:2px;pointer-events:none;z-index:100;}#mermaid-svg-wtzFgVP75fHsJlvj .flowchartTitleText{text-anchor:middle;font-size:18px;fill:#333;}#mermaid-svg-wtzFgVP75fHsJlvj rect.text{fill:none;stroke-width:0;}#mermaid-svg-wtzFgVP75fHsJlvj .icon-shape,#mermaid-svg-wtzFgVP75fHsJlvj .image-shape{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-wtzFgVP75fHsJlvj .icon-shape p,#mermaid-svg-wtzFgVP75fHsJlvj .image-shape p{background-color:rgba(232,232,232, 0.8);padding:2px;}#mermaid-svg-wtzFgVP75fHsJlvj .icon-shape rect,#mermaid-svg-wtzFgVP75fHsJlvj .image-shape rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-wtzFgVP75fHsJlvj .label-icon{display:inline-block;height:1em;overflow:visible;vertical-align:-0.125em;}#mermaid-svg-wtzFgVP75fHsJlvj .node .label-icon path{fill:currentColor;stroke:revert;stroke-width:revert;}#mermaid-svg-wtzFgVP75fHsJlvj :root{--mermaid-font-family:"trebuchet ms",verdana,arial,sans-serif;} 考察其中的空间结构
加入地理参照与领域约束
世界模型

表示环境并预测状态演化

时间变化 · 动作后果
空间智能

处理空间结构

形状 · 位置 · 尺度 · 视角 · 运动
地理空间智能

把空间结果接到地球参照系

经纬度 · 地面分辨率 · 多源数据 · GIS 工具

这张图表达的是本文采用的分析顺序,不是三个集合的严格包含关系。生成式环境同时属于世界模型与空间智能;只做静态三维重建的几何模型属于空间表征,却达不到本文对世界模型"必须预测状态演化"的判定标准。

一张照片为什么会得到两种互补答案

给几何视觉模型输入同一座教堂的多张照片,它可以恢复相机姿态、深度图和建筑点云。输出通常位于局部坐标系,未必包含地点名称和经纬度。

给多模态大语言模型相同照片,它可以根据建筑形式和文字线索判断可能的国家或地区,却常不能稳定给出墙面距离、朝向和尺寸。前者把图像接到几何量,后者把图像接到语言符号。

若任务要求回答"这是哪里、相机在哪里、建筑离相机多远、沿某个动作移动后会看到什么",系统至少要连接四类能力:

问题 所需能力 仅凭什么还不够
建筑和相机的三维关系是什么 空间表征与度量 只识别语义类别不够
这个地点在地球上的哪里 地理定位与地理配准 只有局部点云不够
换一个视角会看到什么 视角变换或生成 单幅识别不够
执行动作后环境怎样变化 动作条件下的状态预测 静态三维重建不够

这四问也解释了为什么同一篇论文即使使用"空间""世界"或"地理"字样,仍需按输入、输出和评测逐项判断其技术身份。

三个概念各自的最小判定标准

世界模型:必须预测下一状态

本文采用强化学习与预测模型语境中的窄定义:世界模型学习环境的内部表征,并预测时间推进或动作施加后的状态。12 语言模型保存了大量世界知识,不因此自动算作世界模型。静态重建模型能恢复场景结构,也不因此自动算作世界模型。

三条主要路径的分歧在于预测位置与对象。隐空间动力学预测压缩状态,联合嵌入预测架构(JEPA)预测表征,生成式环境直接生成可交互画面。详见《01 世界模型篇》

空间智能:必须表示并使用空间结构

空间智能是感知、表征和变换空间关系,并据此推理或行动的能力。认知科学常用"物体内/物体间 × 静态/动态"的 2×2 分类。3 AI 评测则把它操作化为计数、相对位置、距离、尺寸和时空记忆等任务。4

2026 年的公开工作主要分为多模态大语言模型、几何视觉模型和生成式世界模型三条路线。三者的输入输出和评测指标不同,不能只凭综合得分横向替代。详见《02 空间智能篇》

地理空间智能:结果必须显式使用地理位置

学术语境的 GeoAI 强调"空间显式":位置必须进入模型或分析过程并实际起作用。5 情报与测绘语境的 GEOINT 强调开发和分析影像与地理空间信息。6 其对象是地球上或近地的物理地物及有地理参照的活动。

两种定义的共同判据是结果有地理参照 。把室内图像换成卫星图并不足以完成概念转换;还要处理地理配准、跨尺度与地面分辨率、多源异构数据,以及 PostGIS、GDAL、路网算法等确定性工具。详见《03 地理空间智能篇》

概念边界:用输入、状态、输出和证据判断

类型 典型输入 内部处理对象 典型输出 证明能力的证据
世界模型 观测、历史、动作 可演化状态 未来状态、策略或可交互环境 动作条件预测、模型内规划或交互一致性
空间智能系统 图像、视频、深度、点云、语言 空间结构与关系 深度、位姿、关系、路径、动作 几何误差、关系题、导航或操作结果
地理空间智能系统 遥感、地图、轨迹、地名、地球嵌入 带地理参照的对象与过程 坐标、地图要素、空间查询或地理行动 配准误差、GIS 可验证答案、真实工具执行结果

边界案例按主输出归类:

  • VGGT 从多视图恢复静态几何,属于空间智能的表征路线,不属于本文窄定义的世界模型。7
  • Genie 3 生成可实时导航的动态环境,同时落入生成式世界模型和空间智能。8
  • AlphaEarth 把全球陆表预计算成向量图层,属于地理空间表征。9 若下游只做分类或回归,不能据此声称系统已有行动或生成能力。
  • GeoMMAgent 通过外部工具提升系统结果,证明的是"模型加工具的系统能力"。这不等于基础模型参数内部已经获得同等能力。10

系列地图:按问题选读

篇目 核心问题 建议读者
本篇 三个概念如何区分与连接 需要建立全局框架
01 世界模型篇 三条路径分别产出什么,如何证明 关注预测、机器人、生成环境
02 空间智能篇 三条技术路线和五层能力如何对应 关注空间评测、VGGT、多模态模型
03 地理空间智能篇 地理参照为何改变方法 关注遥感、GIS、定位和智能体
04 维度与缺口篇 分类是否齐全、语料落点与缺口是什么 关注综述框架与研究选题
07 定义篇 心理学、AI、产业定义如何异同 需要核查概念出处

推荐顺序是 00 → 01 → 02 → 03 → 04;已熟悉世界模型的读者可从 02 开始。每篇独立交代口径和边界,不要求先读其他篇目。

这批语料给出的总体分布

在上述限定语料中,工作主要集中在感知、表征和推理。行动层已有工具编排系统,但模型能力与系统能力需要分开报告。

按标题关键词统计,519 篇 arXiv 样本中有 28 篇明确带时序词。标题含 "world model" 的有 5 篇。生成相关标题有 30 篇,但"generation"可能指数据、代码或方案生成。这 30 篇尚未逐篇核验,不能直接计为环境或影像生成工作。

这组统计只能说明本系列采集范围内的分布,不能代表整个地理空间智能领域。尤其是文本与地名方向受检索式限制,属于已知漏采项(后续补充)。

小结

世界模型的硬标准是预测状态演化;空间智能的核心是表示并使用空间结构;地理空间智能再要求空间结果具有地理参照,并遵守地理数据与地理计算的约束。下一篇从第一个标准出发,比较隐空间动力学、表征空间预测和生成式环境三条路径,并用公开项目图片说明三者最终产出的差异。


参考文献

1 Ha, D.; Schmidhuber, J. World Models . 2018. https://arxiv.org/abs/1803.10122

2 LeCun, Y. A Path Towards Autonomous Machine Intelligence . 2022. https://openreview.net/forum?id=BZ5a1r-kVsf

3 Newcombe, N. S.; Shipley, T. F. Thinking About Spatial Thinking: New Typology, New Assessments . 2015. https://doi.org/10.1007/978-94-017-9297-4_10

4 Yang, J. et al. Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces (VSI-Bench) . 2025. https://arxiv.org/abs/2412.14171

5 Janowicz, K.; Gao, S.; McKenzie, G.; Hu, Y.; Bhaduri, B. GeoAI: spatially explicit artificial intelligence techniques for geographic knowledge discovery and beyond . 2020. https://geography.wisc.edu/geods/wp-content/uploads/sites/28/2022/05/2020_IJGIS_GeoAI_editorial.pdf

6 U.S. House of Representatives. 10 U.S.C. §467: Definitions (含 GEOINT 法定定义). 现行法条页面. https://uscode.house.gov/view.xhtml?req=granuleid%3AUSC-prelim-title10-section467&num=0&edition=prelim

7 Wang, J. et al. VGGT: Visual Geometry Grounded Transformer . 2025. https://arxiv.org/abs/2503.11651

8 Google DeepMind. Genie 3: A new frontier for world models . 2025. https://deepmind.google/blog/genie-3-a-new-frontier-for-world-models/

9 Brown, C. F. et al. AlphaEarth Foundations: An embedding field model for accurate and efficient global mapping from sparse label data . 2025. https://arxiv.org/abs/2507.22291

10 Xiao, A. et al. GeoMMBench and GeoMMAgent: Toward Expert-Level Multimodal Intelligence in Geoscience and Remote Sensing . 2026. https://arxiv.org/abs/2604.08896

术语表

术语 白话解释
世界模型 学习环境状态,并预测时间推进或动作发生后状态如何变化的模型。
空间智能 表示和使用形状、位置、尺度、视角与运动关系的能力。
地理空间智能 把空间结果接到地球参照系,并处理真实地理数据与计算约束的能力。
GeoAI 让位置在模型、关系、约束或评价中实际起作用的空间显式人工智能。
GEOINT 开发和分析影像与地理空间信息,以描述有地理参照的地物与活动。
多模态大语言模型 同时处理语言与图像、视频等输入,并用语言输出结果的模型。
地理空间基础模型 在大规模地球观测数据上预训练、再适配多类下游任务的模型。
潜在状态 把高维观测压缩后得到、供模型预测和决策使用的数字表示。
JEPA 在表征空间预测目标状态,而不是逐像素重建目标的架构。
空间接地 把图像或语言判断落实到距离、方向、尺寸、坐标等可量算对象。
地理配准 建立局部数据坐标与经纬度或投影坐标之间的变换。
地面采样距离 一个影像像素在地面上对应的实际长度。
SAR 主动发射微波并利用回波成像的合成孔径雷达。
点云 用大量三维点记录物体或场景表面的几何表示。
GIS 存储、查询、计算和展示地理空间数据的系统。
地球嵌入 按位置和时间把多源地球观测压缩成可复用向量。
混合系统 由模型负责理解与编排、由确定性工具完成部分计算的系统。
智能体 能分解任务、调用工具、读取反馈并继续决策的系统。

修订记录

  • 补全世界模型、空间智能与地理空间智能定义的正文编号引用。
  • 为四个边界案例补充一手论文或官方项目来源。
  • 拆分长句并收紧"系统能力"与"模型内生能力"的表述。
  • 新增按出现顺序编号的参考文献和核心术语表。
相关推荐
fly76327851 小时前
免费篮球高光剪辑开源工具
人工智能
爱写代码的小朋友1 小时前
从工具嵌入到范式重构:人工智能与基础教育融合的深层逻辑与路径审思
人工智能·百度·重构
极新1 小时前
百度 AI 选择免费:一场关于流量与变现的战略博弈
人工智能·百度
昌原的儿子LEO1 小时前
Linux进程知识点总结
linux·服务器·c语言·数据库
欧阳天羲1 小时前
【开源答疑】激光灭蚊机器人|全套硬件资料说明、BOM选型、价格参考、避坑清单
机器人·开源
新新学长搞科研1 小时前
【经济、管理、大数据可接收】第二届人工智能、业务转型和数据科学创新国际学术会议(ICBTDS 2026)
大数据·人工智能
向哆哆1 小时前
中草药检测数据集分享(适用于目标检测任务已标注+划分)
人工智能·目标检测·计算机视觉
Csvn1 小时前
从 POC 到上线,AI 应用差的不只是代码——30 篇《AI 应用生产化手册》免费连载
aigc·agent·ai编程