一、基本概念
时空 Transformer(Spatiotemporal Transformer)是基于自注意力机制、专门用来建模空间 + 时间联合依赖关系的一类神经网络架构,属于 Transformer 在时空数据领域的扩展。 原始 Transformer 诞生于自然语言处理,只处理一维文本 token 序列;时空 Transformer 的输入不再是文字,而是带空间位置与时间先后的多维数据:视频帧序列、连续多帧 BEV 鸟瞰特征、3D 体素占用场、交通传感器时序网格等。
核心思想:将空间上的像素 / 网格 / 体素,以及时间维度上的连续历史帧,统一转化为时空 token;利用自注意力,让每一个 token,既能和同一时刻空间内其他位置的 token 交互(空间交互),也能和历史不同时间帧的 token 交互(时间交互),一次性建模物体空间位置关系与运动演化规律arXiv。
二、原理简介
1. 基础流程
-
时空序列化(Token 化) 把连续多帧的空间特征(图像 patch、BEV 网格、3D 体素)切分成一组向量 token,每个 token 同时携带空间坐标信息 (x,y 或者 x,y,z 物理位置)与时间戳信息。
-
时空位置编码 和 LLM 的一维位置编码不同,时空 Transformer 使用二维 / 三维空间位置编码 + 时间位置编码,把物理空间坐标、时间先后顺序编码进 token 向量,让模型知道每个 token 在真实世界的位置与所属时刻。
-
时空注意力计算(核心) 主流两种实现方案:
-
联合时空注意力:一次性对全部空间 + 全部时间的所有 token 做全局自注意力,全局建模长距离时空依赖;缺点是 token 数量大,算力开销高。
-
分解时空注意力(工程主流) :分开计算空间注意力 与时间注意力。空间注意力:同一时间帧内部,不同空间网格之间交互;时间注意力:同一个空间网格,跨历史帧做时序交互。代表:BEVFormer,使用空间交叉注意力聚合多相机图像特征,时间自注意力融合历史 BEV 特征,大幅降低计算量,适合智驾实时推理arXiv。
- 多层编码器堆叠 + 任务头输出 经过多层时空 Transformer Encoder 做特征融合之后,接入不同任务头,输出对应的结果:3D 检测、地图分割、未来多帧 BEV / 占用场时序预测。
2. 核心优势对比传统方案
-
对比 CNN/ConvLSTM:CNN 只能捕捉局部空间感受野;ConvLSTM 串行处理时序,长时序梯度衰减。时空 Transformer 支持全局长距离时空依赖,训练并行度更高,可以捕捉远距离物体交互、长时间运动趋势。
-
对比纯空间 ViT:ViT 只处理单张静态图像;时空 Transformer 原生支持连续时序输入,能够建模物体运动、遮挡变化。
三、时空 Transformer 与大语言模型 Transformer 架构的区别
两者底层组件相同(多头注意力、残差连接、层归一化、FFN),但输入表征、注意力设计、建模目标、输出范式完全不一样。
| 对比维度 | 时空 Transformer | LLM 大语言模型 |
|---|---|---|
| 输入载体 | 空间网格 / 体素 / 图像 patch 构成的时空 token,token 带有物理米级坐标,代表真实物理空间 | 文本 token,是词典离散符号,没有原生物理空间含义 |
| 位置编码 | 2D/3D 空间位置编码 + 时间编码,编码真实几何坐标 | 一维位置编码,只代表文字在句子里的先后顺序 |
| 注意力类型 | 以 Encoder 为主,双向注意力;可以分解空间、时间注意力;一般没有掩码限制未来帧(感知场景) | Decoder 为主,带因果掩码,自回归生成,不能看到未来 token |
| 建模目标 | 回归 / 分类任务:预测空间网格类别、体素占用、未来空间场;学习物理空间演化 | 下一个离散 token 概率预测,学习自然语言符号序列分布 |
| 输出形式 | 稠密空间张量(BEV 特征图、3D 占用体素场) | 离散文本 token 序列,逐 token 自回归生成 |
| 归纳偏置 | 内置几何、空间、运动先验 | 内置语言、语义、语法先验 |
| 参数量规模 | 轻量为主,几百万~几千万参数,可车规部署 | 超大参数量,几十亿~万亿参数,通用语义能力强 |
一句话总结:共享自注意力算子,但建模对象一个是物理时空,一个是离散语言符号;时空 Transformer 大多是 Encoder 结构,做空间表征预测;LLM 是因果 Decoder 结构,做符号序列生成。
四、当前主流时空 Transformer 模型
-
BEVFormer(智驾领域标杆) 2022 ECCV,面向多相机智驾 BEV 感知。采用网格 BEV Query,空间交叉注意力融合多相机图像,时间自注意力融合历史 BEV 特征,提升遮挡物体检测与速度估计;原生用于 3D 检测、地图分割;产业界大量基于 BEVFormer 扩展,增加占用头与时序预测头,构建占用时序预测网络arXiv。
-
TimeSformer(视频理解经典) 视频领域时空 Transformer,把视频拆成帧内空间 patch 和帧间时间 patch,提出多种时空注意力分解方案,用于视频动作识别、视频分类。
-
ViViT 视频时空 Transformer,提出多种时空 token 分解策略,在视频分类、动作识别任务取得 SOTA,兼顾精度与算力开销。
-
Traffic Transformer / ASTGCN(交通流时空预测) 面向城市路网传感器时序数据,用于道路流量、车速预测,属于交通时空预测方向。
-
STFormer(各类自研变体) 大量企业自研轻量时空 Transformer,多用于占用时序预测、场景世界模型底层,结构参考 BEVFormer,针对车载算力做量化、稀疏注意力优化。
五、主要应用场景及效果
1. 智能驾驶(当前最重要产业落地场景)
-
任务:多相机 BEV 特征编码、3D 障碍物检测、语义地图、3D 占用预测、场景时序预测(世界模型底层)。
-
效果:相比 LSS 等 BEV 方案,引入时序注意力后,对遮挡物体、运动目标速度估计显著提升;可以统一静态环境感知与动态物体运动建模;在 nuScenes 数据集上,纯相机方案 NDS 指标大幅提升;经过轻量化改造,可满足车载端实时推理需求。
-
局限:原始 BEVFormer 只做感知;时序预测需要额外扩展预测头;全局时空注意力算力开销大,必须做稀疏、可变形注意力优化。
2. 计算机视觉:视频理解、动作识别
-
任务:视频分类、行为检测、异常事件识别。
-
效果:相比 3D CNN,远距离时空依赖建模能力更强,长视频识别精度提升;缺点是原始全局注意力算力高,工程上普遍采用分解时空注意力降低开销。
3. 城市交通时空预测
-
任务:道路车流量、拥堵状态预测。
-
效果:可同时捕捉空间路网关联和周期性时序变化,优于传统 ARIMA、LSTM。
4. 遥感、机器人具身感知
-
遥感:多时相卫星影像地物变化检测;
-
具身智能:机器人连续观测场景重建、物体运动预测,作为机器人世界模型的底层表征。
六、总结
时空 Transformer 不是对 LLM 的简单移植,而是把 Transformer 自注意力机制改造适配物理时空数据的架构。它继承了 Transformer 全局依赖建模的优势,通过空间 + 时间双维度注意力,解决 CNN、LSTM 难以建模长距离时空交互的痛点。
在智能驾驶领域,以 BEVFormer 为代表的时空 Transformer 已经成为主流感知底座;在此基础上扩展时序预测头,就可以实现未来 3D 占用场推演,作为智驾世界模型的底层空间表征模块。但要区分:时空 Transformer 只是空间表征与时序预测骨干,本身不具备 LLM 那种语言、常识推理能力;完整世界模型,往往需要在时空 Transformer 之上,叠加 VLA 多模态大模型,补充因果推理与假设推演能力。