Geo + AI:【时空智能体】技术剖析

你直觉猜的三个底层技术------RAG、MCP、地理数据训练------都对,但只占底下一半。把 GeoGPT、超图 AgentX、莫干·玄衍、高德 ABot-Earth 这批应用拆开,底下其实是五层:数据层 (地理数据怎么喂)、模型层 (GeoFM 怎么训)、能力层 (RAG/MCP/算子怎么接)、Agent 层 (怎么编排干活)、应用层(你看到的产品)。

这篇回答你那个更底层的问题:这些 Geo+AI 应用,底下到底用了哪些技术。

一张五层技术栈图

先把分层摆出来,你再对照自己手里的应用,看它卡在哪一层:

一句话点评:越往上越值钱(产品形态),越往下越吃资源(预训练成本),而 2026 年的分水岭在能力层和 Agent 层------RAG 让模型会「想」空间、MCP 让模型会「调」空间工具。 下面逐层拆。

地理数据训练:GeoFM 预训练,已经范式转移

先答你最直接的猜测:地理数据训练------是,而且这一层已经完成一次范式转移。

2026 年 7 月一篇综述(arXiv 2607.12177)把这个范式叫「预训练职责分离」:大规模模型提供商承担计算密集的预训练,领域专家拿一小片标注数据微调就行,不用从头训。好处很直接------微调要的标注比从头训练少一个数量级,保密场景还能本地部署。

预训练本身走两条路:

  • 掩码自编码(MAE):把图像块盖住再重建,学通用表征。一脉是 SatMAE(斯坦福,给时间/光谱位置编码)、ScaleMAE(尺度感知位置编码)、Cross-Scale MAE;量级大的有 Prithvi-EO-2.0(IBM/NASA,30m 全球 HLS 影像)、Clay(多传感器、分辨率和波段都能吃)、TerraMind(生成式)。
  • 视觉-语言对比:最大化图像和文本嵌入的相似度,建联合嵌入空间,换来零样本开放词汇------没显式训练过的类别也能认。这是 GeoVLM、OlmoEarth 那类多模态模型的底座。

DeepMind 的 AlphaEarth Foundations 则是第三种混合:重建、自蒸馏、文本对比三路损失一起上,吃光学/雷达/LiDAR/文本/气候数据,输出时间连续的「嵌入场」。

训练数据来源很集中:Sentinel-1/2、Landsat 8/9、NAIP 航拍、DEM、土地利用覆盖,加全球尺度的 HLS。另外发现(Meta 的 DINOv3):在数十亿张自然图像上预训练的模型,只要规模够大,能泛化到 0.6m 卫星影像的俯视视角,性能超过不少领域专用模型。

但别急着选型。GEO-Bench-2(2026 年 2 月,19 个数据集、分类/分割/回归/检测全覆盖)的结论很冷静:没有任何模型在所有任务上占主导。做农业/灾害等多光谱应用的,EO 专用模型(TerraMind/Prithvi/Clay)更强;高分辨率任务的,自然图像预训练的反而赢。选哪个,得拿你自己的数据实测。

国产这条线的训练实例我也帮你对上了:GeoGPT(之江实验室)三阶段训------持续预训练(CPT,从 Common Crawl 抽地学语料,约 140B token 建基础地质知识)→ 多阶段监督微调 → 偏好学习对齐;莫干·玄衍用亿级多模态数据样本训出准千亿参数。结论:这一层别自己训,用开源的(Prithvi/Clay/OlmoEarth)或行业底座(莫干·玄衍),微调是你的活。

位置嵌入:坐标升级成「地点指纹」

地理数据训练里有一支容易被漏掉,但它正在变成一层独立技术:位置嵌入(location embeddings)。Esri 在 2026 年 7 月用户大会上正式把它并进 ArcGIS 的地理空间基础模型三件套里,当一种新的 GIS 数据类型对待。

逻辑很朴素:经纬度坐标只告诉你「在哪儿」,不告诉你「这是个什么地方」。Esri 的 Location Encoder 把地点编码成捕捉自然环境、建成区形态、社会经济背景的嵌入向量------每个地点一个「指纹」,环境相似的地点指纹相似,哪怕隔着半个地球。

两个版本:自然环境嵌入用 Sentinel-2 影像训练,统计嵌入基于美国普查/ACS/住房/环境数据训练(GDFM 更进一步,多视图自编码器把四类数据集揉成 5000+ 变量的地点刻画)。落地效果是直观的:以索诺兰沙漠为查询,能跨洲匹配出智利阿塔卡马沙漠这种「环境相似而非地理邻近」的区域;无监督聚类画出的簇和真实大型景观带高度吻合,不按行政边界走。

判断:位置嵌入是把地理信息变成向量、喂给机器学习的那座桥,2026 年刚到 Beta 但方向明确。 它和 065 里说的「embeddings 作为新 GIS 数据类型」是同一件事。

空间 RAG:不是聊天兜底,是拓扑空间推理

你的第二个猜测------RAG------是,但空间领域里它不是聊天兜底,是让 LLM 学会「空间推理」。

普通 RAG 检索的是文本相关,空间 RAG 检索的是空间关系,这是完全不同的难题。2026 年 2 月发表于 ACM TSAS 的 SpaRAGraph 是这条路的代表:先把空间数据经 SpaTex 转成 RDF 图,建图索引,推理时用图遍历加空间关系组合矩阵,只预计算最小子集的空间关系、其余靠组合推导。在 SRB 基准(三类真实世界合成数据集)上,不同 LLM 的 F1 平均提高 36 个百分点,响应时间几乎无感。

同门兄弟 Spatial-RAG (ACL 2026 Findings)走混合检索:稀疏空间过滤(空间索引)加密集语义匹配(嵌入),把问答建模成空间相关性和语义相关性的多目标优化,挑 Pareto 最优候选。Spatial-Agent 更进一步,把「哪条河在哪个城市东边」这类问题形式化成 GeoFlow Graphs(有向无环图,节点是空间概念、边是转换),生成可执行的地理空间工作流,比 ReAct/Reflexion 显著更强、还可解释。

产业里也已经接上了:超图 AgentX 用 RAG+GraphRAG 提升 GIS 工具调用的准确率;GeoGPT 自带 RAG 增强阅读器,能从论文和地图里检索再回答。

判断:空间 RAG 是「让 LLM 想清楚空间关系」的关键,2026 年从论文往平台里长。 纯文本 RAG 解决不了「相邻」「包含」「穿过」这些拓扑问题,这是空间 RAG 存在的理由。

MCP:把 GIS 能力开放给 AI 调用

你的第三个猜测------MCP------是,而且是这条栈里国产和海外走法最不一样的一层。

Esri 在 2026 年 6 月 29 日给 ArcGIS Location Platform 加了 MCP 支持(Beta):外部 AI Agent 能通过标准协议调用地理编码、路径规划、高程解析、静态地图这些云端轻量服务,还能在单次对话里串联多个服务(「找到最近的仓库并给出路线」)。这是 Esri UC 2026「Agentic GIS」战略的一部分------但行业分析看得很清楚,Esri 走的是「助手优先」:AI 被接进 ArcGIS 体系,却没拿到重构核心系统的权限,工程文件、桌面核心工作流不对外开放。

国产这边激进得多。超图 SuperMap GIS 2026 的 AgentX Server 集成 500 余项工具,原生支持 MCP 和 Function Calling,还适配 DeepSeek-R1、通义千问、Qwen2.5;桌面 AgentX 走「智能体完成任务」替代「人找工具」,内置专业 Skills 技能库和 GIS 专家库;ClientX 更直接------一套 API 统一二三维能力,适配 AgentX、Trae、CodeX、Claude Code 这些 AI 环境。社区也出了 arcpy-mcp-server,把 ArcGIS Pro 1300+ 个工具(15 个模块)全量 MCP 化,Claude Code、Codex 直接就能使唤 ArcGIS。

判断:MCP 是「GIS 给 AI 递工具」的标准姿势,2026 年两端都开放了。 差异在开放度:Esri 只开云端轻量服务,超图把全套工具交出来。你接谁的,取决于你想要「助手」还是「自主智能体」。

Agent 编排:从「助手」到「自主规划」

能力层之上是 Agent 层------模型拿到工具之后,怎么编排干活。这是 2026 年学术和产业共同的终点范式,综述里叫 Agentic Geospatial Reasoning:LLM 当编排器,把 GeoFM 当工具,用自然语言响应高层查询、自动化复杂分析工作流。

产业里的形态已经分层。超图 AgentX 三类模式对应不同可靠度需求:工作流模式(确定性最高,标准化业务)、长规划模式(自主规划+受控执行平衡,复杂选址)、循环推理模式(边探索边响应)。SuperMap Copilot 直接对话调用 100+ 行业分析算子,平均 5 秒完成深度思考,任务成功率 80%+。莫干·玄衍的八大能力里明确带着「任务编排与工具调度」,配合「时空专业技能库」,是「地理空间大模型+技能库」的组合打法。GeoGPT 给的是 Agent Builder------科学工作者可以自定义数百个科学智能体。

判断:Agent 编排决定应用是「问答机」还是「能干活的」,三模式/技能库/Agent Builder 是三种落地封装。 你要可靠性选工作流模式,要探索选循环推理,要开放性用 Agent Builder。

视觉语言模型与生成式空间模型:VLM / 3DGS / 影像生成

上面五层里有三块你没问但实际在用的,补上。

视觉语言模型(模型层):把自然语言和空间视觉对齐的那层。GeoVLM(Esri)用自然语言提示「Segment roads」就能提要素;GeoGPT 的 MapChat 拖入地质图、遥感资料,数秒完成解析、关联、推理;莫干·玄衍是多模态一体。这一层让「用嘴指挥空间操作」成为可能。

3DGS 生成(能力层) :空间世界的生成侧,我在 066 那篇拆过它的工具链。落到 Geo+AI 应用上:高德 ABot-Earth0.5 用 3DGS 直接训练 3D 城市世界模型,Voxelmaps 用 3DGS+Cosmos Reason 2 做圣何塞数字孪生的自然语言查询,莫干·玄衍 V1.5 用生成式 3DGS 融合建模------几张照片几分钟重建单体建筑,数据量降 90%、效率提 10 倍。这一层是「空间数据训练」和「空间生成」的接缝,也是 2026 年最陡峭的新曲线。

影像生成(能力层) :你说的「造影像数据」就是这一支------用生成模型合成遥感影像,专治标注稀缺。单个 OpenEarthMap 分割瓦片平均要人工标注 2.5 小时,合成数据成了补数据缺口的关键手段。2026 年的代表模型一水儿是扩散模型:DiffusionSat 是第一个大规模卫星影像生成基础模型;EarthSynth 用反事实组合训练加规则过滤,只挑「有用」的合成数据喂给分类/检测/分割,开放词汇理解显著提升;TerraDiT-Ω (ECCV 2026)让任意地理基元(多边形/折线/框/点)控制生成------你给一块特定形状的区域,它按这个形状造出影像;COP-GEN 跨模态合成,SAR 输入直接生成光学影像,还能补云洞、做模态补全;Text2Earth 是 13 亿参数的扩散基础模型。成熟度判断:2026 年的重心已经从「生成逼真影像」转向「精细空间可控生成 + 下游任务验证」------Text2AIRS 用这类合成数据把 Fair1M 飞机检测抬了 6.12 个百分点。它能当训练数据的补充,但还没到完全替代真实影像的程度。

同一个应用,五层各用什么

拿最常见的「自然语言问 GIS 一个问题并出图」做例子,把五层串起来看:

技术 实例
应用层 产品形态 AgentX / MapChat / GeoVLM 助手
Agent 层 任务规划、工具调度 AgentX 三模式、Agent Builder、莫干·玄衍任务编排
能力层 空间 RAG + MCP + GIS 算子 + 影像/3D 生成 SpaRAGraph 式检索、Location Platform MCP、100+ Copilot 算子、EarthSynth/TerraDiT
模型层 GeoFM 预训练 + 位置嵌入 + VLM Prithvi/Clay、Location Encoder、GeoVLM/MapChat
数据层 遥感影像、矢量栅格、知识图谱 Sentinel-2、普查数据、地学语料库

你问它「评估这几个地块的洪水风险」,走的是:数据层取影像和地形 → 模型层用 GeoFM 解译 + 位置嵌入补上下文 → 能力层空间 RAG 确定空间关系、MCP 调高程/路径算子 → Agent 层编排成工作流 → 应用层把结果和地图交给你。

落地建议:五层里哪些自建,哪些用现成

  • 模型层:别训。用开源 GeoFM(Prithvi/Clay/OlmoEarth)或闭源行业底座(莫干·玄衍),你的活是微调和评测(拿自己数据跑 GEO-Bench 风格基准)。
  • 数据层:别全攒。用平台现成数据(Esri Living Atlas、行业数据集),自己补的只有业务私有数据。
  • 能力层:RAG 值得自建(空间 RAG 是差异化点),MCP 用平台现成的(Esri/超图都已开放),3DGS 生成按需(066 有完整工具链)。
  • Agent 层:用现成框架(Agent Builder / AgentX / ClientX),别从零写编排。
  • 应用层:这是你唯一必须自己写的层------产品形态和业务闭环在这里。

结论

Geo+AI 应用的底层,收束成一句话:「预训练底座 + 检索增强 + 工具协议 + Agent 编排」四件套,加位置嵌入和生成式空间模型(3DGS/影像生成)两块新能力。 地理数据训练负责「懂空间」,空间 RAG 负责「想空间」,MCP 负责「调空间工具」,Agent 编排负责「替你把活干完」,影像/3D 生成负责「补你缺的数据和场景」。这四件套加两块里,前几件已经成熟到可以抄作业,Agent 编排和生成式模型正在快速定型------2026 年做 Geo+AI 应用,就是在这一层上比谁接得早。

参考来源

相关推荐
吨吨ai1 小时前
2026年9月8日|GPT‑6 Astra + Codex:Pro 开发者的 AI Agent 工具链
人工智能·gpt
leoZ2311 小时前
2026-09-09-springboot-cloud-deploy-pitfalls
java·前端·javascript·vue.js·人工智能·spring boot·后端
程xu袁1 小时前
不会编曲只用微信小程序写中文歌,选「AI音乐生成」、MELO音乐、魔兔音乐还是AI写歌?
ai·suno·ai音乐·ai音乐生成·ai写歌·ai创作歌曲
dozenyaoyida2 小时前
AI与大模型新闻日报 | 2026-09-09
人工智能·ai·chatgpt·大模型·新闻
xqqxqxxq2 小时前
AI Agent学习:主动工具发现(李博杰《深入理解 AI Agent》4.8观后总结)
人工智能·学习
VIP_CQCRE2 小时前
Visual Studio 也能接入云端大模型:用 LMLocal 连接 Ace Data Cloud
ai·开发工具·visual studio·ace data cloud·lmlocal
海上彼尚2 小时前
Cursor 模型的强度实测排行
前端·人工智能·后端
ai小陈2 小时前
PyTorch Profiler性能分析实战:定位GPU训练中的慢算子
人工智能·深度学习·机器学习·ai·性能优化·gpu算力
罗西的思考3 小时前
[Agent Memory / 强化学习] MemPO源码学习笔记 ---(1)--- 总体
人工智能·算法·机器学习