语料口径:以下数字是本地筛选表的过程记录,不是会议官方主题统计。
CVPR 2026 共 4,068 篇:关键词初筛 942 篇,二次筛选 299 篇;本领域命中约 22 篇,精读 12 篇。
SIGSPATIAL 2026 共 128 篇:筛出 44 篇,命中 21 篇;其中预印本可读 12 篇,精读 6 篇。
arXiv 2026 年 1---8 月过筛 519 篇,下载 336 篇,聚为 8 类,精读 24 篇。另补搜地球嵌入 39 篇(精读 18 篇)和本地地理定位论文 36 篇。标题计数、摘要阅读与精读结论在各篇分别标明,不能相互替代。
先给结论:三个概念不是并列关系
世界模型、空间智能和地理空间智能回答三个递进的问题:
- 世界模型问:系统能否表示环境,并预测时间或动作使环境怎样变化?
- 空间智能问:这个表示里是否包含可用的形状、位置、尺度、视角和运动关系?
- 地理空间智能问:这些空间关系能否进一步接到地球参照系,并处理真实地理数据的尺度、传感器和计算规则?
因此,三者可按"动态环境目标 → 空间能力切面 → 地球坐标约束"理解。它们有交集,但不能凭名称互相替代。一个模型能恢复三维点云,不等于它能预测下一状态;一个模型能识别城市,不等于它能输出可配准的经纬度。
#mermaid-svg-wtzFgVP75fHsJlvj{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;fill:#333;}@keyframes edge-animation-frame{from{stroke-dashoffset:0;}}@keyframes dash{to{stroke-dashoffset:0;}}#mermaid-svg-wtzFgVP75fHsJlvj .edge-animation-slow{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 50s linear infinite;stroke-linecap:round;}#mermaid-svg-wtzFgVP75fHsJlvj .edge-animation-fast{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 20s linear infinite;stroke-linecap:round;}#mermaid-svg-wtzFgVP75fHsJlvj .error-icon{fill:#552222;}#mermaid-svg-wtzFgVP75fHsJlvj .error-text{fill:#552222;stroke:#552222;}#mermaid-svg-wtzFgVP75fHsJlvj .edge-thickness-normal{stroke-width:1px;}#mermaid-svg-wtzFgVP75fHsJlvj .edge-thickness-thick{stroke-width:3.5px;}#mermaid-svg-wtzFgVP75fHsJlvj .edge-pattern-solid{stroke-dasharray:0;}#mermaid-svg-wtzFgVP75fHsJlvj .edge-thickness-invisible{stroke-width:0;fill:none;}#mermaid-svg-wtzFgVP75fHsJlvj .edge-pattern-dashed{stroke-dasharray:3;}#mermaid-svg-wtzFgVP75fHsJlvj .edge-pattern-dotted{stroke-dasharray:2;}#mermaid-svg-wtzFgVP75fHsJlvj .marker{fill:#333333;stroke:#333333;}#mermaid-svg-wtzFgVP75fHsJlvj .marker.cross{stroke:#333333;}#mermaid-svg-wtzFgVP75fHsJlvj svg{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;}#mermaid-svg-wtzFgVP75fHsJlvj p{margin:0;}#mermaid-svg-wtzFgVP75fHsJlvj .label{font-family:"trebuchet ms",verdana,arial,sans-serif;color:#333;}#mermaid-svg-wtzFgVP75fHsJlvj .cluster-label text{fill:#333;}#mermaid-svg-wtzFgVP75fHsJlvj .cluster-label span{color:#333;}#mermaid-svg-wtzFgVP75fHsJlvj .cluster-label span p{background-color:transparent;}#mermaid-svg-wtzFgVP75fHsJlvj .label text,#mermaid-svg-wtzFgVP75fHsJlvj span{fill:#333;color:#333;}#mermaid-svg-wtzFgVP75fHsJlvj .node rect,#mermaid-svg-wtzFgVP75fHsJlvj .node circle,#mermaid-svg-wtzFgVP75fHsJlvj .node ellipse,#mermaid-svg-wtzFgVP75fHsJlvj .node polygon,#mermaid-svg-wtzFgVP75fHsJlvj .node path{fill:#ECECFF;stroke:#9370DB;stroke-width:1px;}#mermaid-svg-wtzFgVP75fHsJlvj .rough-node .label text,#mermaid-svg-wtzFgVP75fHsJlvj .node .label text,#mermaid-svg-wtzFgVP75fHsJlvj .image-shape .label,#mermaid-svg-wtzFgVP75fHsJlvj .icon-shape .label{text-anchor:middle;}#mermaid-svg-wtzFgVP75fHsJlvj .node .katex path{fill:#000;stroke:#000;stroke-width:1px;}#mermaid-svg-wtzFgVP75fHsJlvj .rough-node .label,#mermaid-svg-wtzFgVP75fHsJlvj .node .label,#mermaid-svg-wtzFgVP75fHsJlvj .image-shape .label,#mermaid-svg-wtzFgVP75fHsJlvj .icon-shape .label{text-align:center;}#mermaid-svg-wtzFgVP75fHsJlvj .node.clickable{cursor:pointer;}#mermaid-svg-wtzFgVP75fHsJlvj .root .anchor path{fill:#333333!important;stroke-width:0;stroke:#333333;}#mermaid-svg-wtzFgVP75fHsJlvj .arrowheadPath{fill:#333333;}#mermaid-svg-wtzFgVP75fHsJlvj .edgePath .path{stroke:#333333;stroke-width:2.0px;}#mermaid-svg-wtzFgVP75fHsJlvj .flowchart-link{stroke:#333333;fill:none;}#mermaid-svg-wtzFgVP75fHsJlvj .edgeLabel{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-wtzFgVP75fHsJlvj .edgeLabel p{background-color:rgba(232,232,232, 0.8);}#mermaid-svg-wtzFgVP75fHsJlvj .edgeLabel rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-wtzFgVP75fHsJlvj .labelBkg{background-color:rgba(232, 232, 232, 0.5);}#mermaid-svg-wtzFgVP75fHsJlvj .cluster rect{fill:#ffffde;stroke:#aaaa33;stroke-width:1px;}#mermaid-svg-wtzFgVP75fHsJlvj .cluster text{fill:#333;}#mermaid-svg-wtzFgVP75fHsJlvj .cluster span{color:#333;}#mermaid-svg-wtzFgVP75fHsJlvj div.mermaidTooltip{position:absolute;text-align:center;max-width:200px;padding:2px;font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:12px;background:hsl(80, 100%, 96.2745098039%);border:1px solid #aaaa33;border-radius:2px;pointer-events:none;z-index:100;}#mermaid-svg-wtzFgVP75fHsJlvj .flowchartTitleText{text-anchor:middle;font-size:18px;fill:#333;}#mermaid-svg-wtzFgVP75fHsJlvj rect.text{fill:none;stroke-width:0;}#mermaid-svg-wtzFgVP75fHsJlvj .icon-shape,#mermaid-svg-wtzFgVP75fHsJlvj .image-shape{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-wtzFgVP75fHsJlvj .icon-shape p,#mermaid-svg-wtzFgVP75fHsJlvj .image-shape p{background-color:rgba(232,232,232, 0.8);padding:2px;}#mermaid-svg-wtzFgVP75fHsJlvj .icon-shape rect,#mermaid-svg-wtzFgVP75fHsJlvj .image-shape rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-wtzFgVP75fHsJlvj .label-icon{display:inline-block;height:1em;overflow:visible;vertical-align:-0.125em;}#mermaid-svg-wtzFgVP75fHsJlvj .node .label-icon path{fill:currentColor;stroke:revert;stroke-width:revert;}#mermaid-svg-wtzFgVP75fHsJlvj :root{--mermaid-font-family:"trebuchet ms",verdana,arial,sans-serif;} 考察其中的空间结构
加入地理参照与领域约束
世界模型
表示环境并预测状态演化
时间变化 · 动作后果
空间智能
处理空间结构
形状 · 位置 · 尺度 · 视角 · 运动
地理空间智能
把空间结果接到地球参照系
经纬度 · 地面分辨率 · 多源数据 · GIS 工具
这张图表达的是本文采用的分析顺序,不是三个集合的严格包含关系。生成式环境同时属于世界模型与空间智能;只做静态三维重建的几何模型属于空间表征,却达不到本文对世界模型"必须预测状态演化"的判定标准。
一张照片为什么会得到两种互补答案
给几何视觉模型输入同一座教堂的多张照片,它可以恢复相机姿态、深度图和建筑点云。输出通常位于局部坐标系,未必包含地点名称和经纬度。
给多模态大语言模型相同照片,它可以根据建筑形式和文字线索判断可能的国家或地区,却常不能稳定给出墙面距离、朝向和尺寸。前者把图像接到几何量,后者把图像接到语言符号。
若任务要求回答"这是哪里、相机在哪里、建筑离相机多远、沿某个动作移动后会看到什么",系统至少要连接四类能力:
| 问题 | 所需能力 | 仅凭什么还不够 |
|---|---|---|
| 建筑和相机的三维关系是什么 | 空间表征与度量 | 只识别语义类别不够 |
| 这个地点在地球上的哪里 | 地理定位与地理配准 | 只有局部点云不够 |
| 换一个视角会看到什么 | 视角变换或生成 | 单幅识别不够 |
| 执行动作后环境怎样变化 | 动作条件下的状态预测 | 静态三维重建不够 |
这四问也解释了为什么同一篇论文即使使用"空间""世界"或"地理"字样,仍需按输入、输出和评测逐项判断其技术身份。
三个概念各自的最小判定标准
世界模型:必须预测下一状态
本文采用强化学习与预测模型语境中的窄定义:世界模型学习环境的内部表征,并预测时间推进或动作施加后的状态。12 语言模型保存了大量世界知识,不因此自动算作世界模型。静态重建模型能恢复场景结构,也不因此自动算作世界模型。
三条主要路径的分歧在于预测位置与对象。隐空间动力学预测压缩状态,联合嵌入预测架构(JEPA)预测表征,生成式环境直接生成可交互画面。详见《01 世界模型篇》。
空间智能:必须表示并使用空间结构
空间智能是感知、表征和变换空间关系,并据此推理或行动的能力。认知科学常用"物体内/物体间 × 静态/动态"的 2×2 分类。3 AI 评测则把它操作化为计数、相对位置、距离、尺寸和时空记忆等任务。4
2026 年的公开工作主要分为多模态大语言模型、几何视觉模型和生成式世界模型三条路线。三者的输入输出和评测指标不同,不能只凭综合得分横向替代。详见《02 空间智能篇》。
地理空间智能:结果必须显式使用地理位置
学术语境的 GeoAI 强调"空间显式":位置必须进入模型或分析过程并实际起作用。5 情报与测绘语境的 GEOINT 强调开发和分析影像与地理空间信息。6 其对象是地球上或近地的物理地物及有地理参照的活动。
两种定义的共同判据是结果有地理参照 。把室内图像换成卫星图并不足以完成概念转换;还要处理地理配准、跨尺度与地面分辨率、多源异构数据,以及 PostGIS、GDAL、路网算法等确定性工具。详见《03 地理空间智能篇》。
概念边界:用输入、状态、输出和证据判断
| 类型 | 典型输入 | 内部处理对象 | 典型输出 | 证明能力的证据 |
|---|---|---|---|---|
| 世界模型 | 观测、历史、动作 | 可演化状态 | 未来状态、策略或可交互环境 | 动作条件预测、模型内规划或交互一致性 |
| 空间智能系统 | 图像、视频、深度、点云、语言 | 空间结构与关系 | 深度、位姿、关系、路径、动作 | 几何误差、关系题、导航或操作结果 |
| 地理空间智能系统 | 遥感、地图、轨迹、地名、地球嵌入 | 带地理参照的对象与过程 | 坐标、地图要素、空间查询或地理行动 | 配准误差、GIS 可验证答案、真实工具执行结果 |
边界案例按主输出归类:
- VGGT 从多视图恢复静态几何,属于空间智能的表征路线,不属于本文窄定义的世界模型。7
- Genie 3 生成可实时导航的动态环境,同时落入生成式世界模型和空间智能。8
- AlphaEarth 把全球陆表预计算成向量图层,属于地理空间表征。9 若下游只做分类或回归,不能据此声称系统已有行动或生成能力。
- GeoMMAgent 通过外部工具提升系统结果,证明的是"模型加工具的系统能力"。这不等于基础模型参数内部已经获得同等能力。10
系列地图:按问题选读
| 篇目 | 核心问题 | 建议读者 |
|---|---|---|
| 本篇 | 三个概念如何区分与连接 | 需要建立全局框架 |
| 01 世界模型篇 | 三条路径分别产出什么,如何证明 | 关注预测、机器人、生成环境 |
| 02 空间智能篇 | 三条技术路线和五层能力如何对应 | 关注空间评测、VGGT、多模态模型 |
| 03 地理空间智能篇 | 地理参照为何改变方法 | 关注遥感、GIS、定位和智能体 |
| 04 维度与缺口篇 | 分类是否齐全、语料落点与缺口是什么 | 关注综述框架与研究选题 |
| 原07 定义篇 | 心理学、AI、产业定义如何异同 | 需要核查概念出处 |
推荐顺序是 00 → 01 → 02 → 03 → 04;已熟悉世界模型的读者可从 02 开始。每篇独立交代口径和边界,不要求先读其他篇目。
这批语料给出的总体分布
在上述限定语料中,工作主要集中在感知、表征和推理。行动层已有工具编排系统,但模型能力与系统能力需要分开报告。
按标题关键词统计,519 篇 arXiv 样本中有 28 篇明确带时序词。标题含 "world model" 的有 5 篇。生成相关标题有 30 篇,但"generation"可能指数据、代码或方案生成。这 30 篇尚未逐篇核验,不能直接计为环境或影像生成工作。
这组统计只能说明本系列采集范围内的分布,不能代表整个地理空间智能领域。尤其是文本与地名方向受检索式限制,属于已知漏采项(后续补充)。
小结
世界模型的硬标准是预测状态演化;空间智能的核心是表示并使用空间结构;地理空间智能再要求空间结果具有地理参照,并遵守地理数据与地理计算的约束。下一篇从第一个标准出发,比较隐空间动力学、表征空间预测和生成式环境三条路径,并用公开项目图片说明三者最终产出的差异。
参考文献
1 Ha, D.; Schmidhuber, J. World Models . 2018. https://arxiv.org/abs/1803.10122。
2 LeCun, Y. A Path Towards Autonomous Machine Intelligence . 2022. https://openreview.net/forum?id=BZ5a1r-kVsf。
3 Newcombe, N. S.; Shipley, T. F. Thinking About Spatial Thinking: New Typology, New Assessments . 2015. https://doi.org/10.1007/978-94-017-9297-4_10。
4 Yang, J. et al. Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces (VSI-Bench) . 2025. https://arxiv.org/abs/2412.14171。
5 Janowicz, K.; Gao, S.; McKenzie, G.; Hu, Y.; Bhaduri, B. GeoAI: spatially explicit artificial intelligence techniques for geographic knowledge discovery and beyond . 2020. https://geography.wisc.edu/geods/wp-content/uploads/sites/28/2022/05/2020_IJGIS_GeoAI_editorial.pdf。
6 U.S. House of Representatives. 10 U.S.C. §467: Definitions (含 GEOINT 法定定义). 现行法条页面. https://uscode.house.gov/view.xhtml?req=granuleid%3AUSC-prelim-title10-section467&num=0&edition=prelim。
7 Wang, J. et al. VGGT: Visual Geometry Grounded Transformer . 2025. https://arxiv.org/abs/2503.11651。
8 Google DeepMind. Genie 3: A new frontier for world models . 2025. https://deepmind.google/blog/genie-3-a-new-frontier-for-world-models/。
9 Brown, C. F. et al. AlphaEarth Foundations: An embedding field model for accurate and efficient global mapping from sparse label data . 2025. https://arxiv.org/abs/2507.22291。
10 Xiao, A. et al. GeoMMBench and GeoMMAgent: Toward Expert-Level Multimodal Intelligence in Geoscience and Remote Sensing . 2026. https://arxiv.org/abs/2604.08896。
术语表
| 术语 | 白话解释 |
|---|---|
| 世界模型 | 学习环境状态,并预测时间推进或动作发生后状态如何变化的模型。 |
| 空间智能 | 表示和使用形状、位置、尺度、视角与运动关系的能力。 |
| 地理空间智能 | 把空间结果接到地球参照系,并处理真实地理数据与计算约束的能力。 |
| GeoAI | 让位置在模型、关系、约束或评价中实际起作用的空间显式人工智能。 |
| GEOINT | 开发和分析影像与地理空间信息,以描述有地理参照的地物与活动。 |
| 多模态大语言模型 | 同时处理语言与图像、视频等输入,并用语言输出结果的模型。 |
| 地理空间基础模型 | 在大规模地球观测数据上预训练、再适配多类下游任务的模型。 |
| 潜在状态 | 把高维观测压缩后得到、供模型预测和决策使用的数字表示。 |
| JEPA | 在表征空间预测目标状态,而不是逐像素重建目标的架构。 |
| 空间接地 | 把图像或语言判断落实到距离、方向、尺寸、坐标等可量算对象。 |
| 地理配准 | 建立局部数据坐标与经纬度或投影坐标之间的变换。 |
| 地面采样距离 | 一个影像像素在地面上对应的实际长度。 |
| SAR | 主动发射微波并利用回波成像的合成孔径雷达。 |
| 点云 | 用大量三维点记录物体或场景表面的几何表示。 |
| GIS | 存储、查询、计算和展示地理空间数据的系统。 |
| 地球嵌入 | 按位置和时间把多源地球观测压缩成可复用向量。 |
| 混合系统 | 由模型负责理解与编排、由确定性工具完成部分计算的系统。 |
| 智能体 | 能分解任务、调用工具、读取反馈并继续决策的系统。 |
修订记录
- 补全世界模型、空间智能与地理空间智能定义的正文编号引用。
- 为四个边界案例补充一手论文或官方项目来源。
- 拆分长句并收紧"系统能力"与"模型内生能力"的表述。
- 新增按出现顺序编号的参考文献和核心术语表。