时间序列处理是研究按时间顺序排列的观测数据序列的数学理论与方法的学科,广泛应用于金融、气象、信号处理、工业监控、生物医学等领域。以下从基础概念到前沿方法,系统梳理该领域的理论体系。
基础概念与数学表征
时间序列的定义与分类
时间序列是将随机变量按时间索引排列形成的随机序列 {X_t, t ∈ T},其核心理论基础是随机过程理论。
- 连续时间序列:T 为连续区间,如传感器连续采样的模拟信号。
- 离散时间序列:T 为整数集,如每日股票收盘价、月度经济指标。
- 单变量 vs 多变量:单变量序列仅含一个观测维度;多变量序列(向量时间序列)同时记录多个相关变量,需建模变量间的动态耦合关系。
基本统计特性
- 均值函数 μ(t) = EX_t:描述序列的中心趋势。
- 方差函数 σ²(t) = Var(X_t):描述序列的波动幅度。
- 自协方差函数 γ(t₁, t₂) = Cov(X_{t₁}, X_{t₂}):刻画不同时刻观测值之间的线性相关程度。
- 自相关函数(ACF) ρ(k) = γ(k)/γ(0):归一化后的自协方差,是识别模型阶数的核心工具。
- 偏自相关函数(PACF):剔除中间变量影响后,两个时刻观测值之间的直接相关性,用于判定 AR 模型阶数。
平稳性理论
平稳性是时间序列建模的基本假设:
- 严平稳:序列的联合概率分布不随时间平移而改变。
- 宽平稳(弱平稳):均值恒定、方差有限且自协方差仅依赖于时间间隔 k 而非绝对时刻。
- 差分平稳:对非平稳序列进行 d 阶差分后变为平稳序列,是 ARIMA 模型的理论前提。
- 趋势平稳:序列围绕确定性趋势波动,去除趋势后残差平稳。
- 单位根检验:ADF 检验、PP 检验、KPSS 检验等,用于判断序列是否含有单位根(即是否为差分平稳过程)。
经典统计模型体系
ARMA 族模型
ARMA 族模型是时间序列分析的基石,由 Box-Jenkins 方法论系统化:
- 自回归模型 AR§:当前值表示为过去 p 个值的线性组合加上白噪声,X_t = φ₁X_{t-1} + ... + φ_pX_{t-p} + ε_t。其平稳性要求特征方程的根全部落在单位圆外。
- 移动平均模型 MA(q):当前值表示为当前及过去 q 个白噪声的线性组合,X_t = ε_t + θ₁ε_{t-1} + ... + θ_qε_{t-q}。其可逆性要求特征方程的根全部落在单位圆外。
- ARMA(p,q):AR 与 MA 的组合,兼具两者特性。
- ARIMA(p,d,q):对非平稳序列先进行 d 阶差分使其平稳,再拟合 ARMA 模型,是处理单变量非平稳序列的标准方法。
- SARIMA(p,d,q)(P,D,Q)_s:引入季节性差分和非季节性差分,专门处理具有周期性模式的序列(如月度销售数据、气象数据)。
条件异方差模型族
针对金融时间序列中普遍存在的波动率聚集现象(大波动后跟随大波动,小波动后跟随小波动):
- ARCH(q):条件方差表示为过去 q 个残差平方的线性组合。
- GARCH(1,1):条件方差同时依赖于过去的残差平方和过去的条件方差,是金融建模的标准工具。
- EGARCH:指数 GARCH,能够捕捉杠杆效应(负面冲击对波动率的影响大于同等幅度的正面冲击)。
- GJR-GARCH:通过引入指示函数区分正负冲击的不对称效应。
- TGARCH、APARCH:更一般的非对称 GARCH 族模型。
- 多元 GARCH(BEKK、DCC):建模多个时间序列之间的动态协方差结构,用于投资组合风险分析。
状态空间模型与卡尔曼滤波
状态空间模型将观测序列表示为不可观测的状态变量的函数:
- 状态方程:α_t = Tα_{t-1} + Rη_t,描述隐含状态的动态演化。
- 观测方程:y_t = Zα_t + ε_t,描述观测值与状态之间的关系。
- 卡尔曼滤波:在状态空间框架下,通过递推计算状态的最优线性无偏估计,广泛应用于信号跟踪、导航制导、经济预测。
- 卡尔曼平滑:利用全部观测数据对状态进行回溯估计,精度优于滤波。
- 结构时间序列模型:将趋势、季节、周期等成分分别建模为状态变量,通过状态空间框架统一处理。
频域与信号处理理论
谱分析方法
将时间序列从时域转换到频域,分析其频率结构:
- 功率谱密度(PSD):自协方差函数的傅里叶变换,描述序列能量在不同频率上的分布。
- 周期图:功率谱的经验估计,用于识别序列中的主导频率成分。
- 平滑周期图:通过窗函数平滑降低估计方差。
- 多窗谱估计(Thomson 方法):使用多个正交窗函数提高谱估计的分辨率和稳定性。
时频分析方法
适用于非平稳序列,同时刻画时间和频率的局部特征:
- 短时傅里叶变换(STFT):通过滑动窗函数实现时频局部化,但受限于海森堡不确定性原理。
- 连续/离散小波变换:使用可伸缩平移的小波基函数,实现多分辨率时频分析。
- Hilbert-Huang 变换(HHT):通过经验模态分解(EMD)将序列分解为固有模态函数(IMF),再进行 Hilbert 变换获取瞬时频率,特别适合非线性非平稳信号。
数字滤波理论
- FIR 滤波器:有限脉冲响应,保证线性相位,通过窗函数法或等波纹法设计。
- IIR 滤波器:无限脉冲响应,效率高但相位非线性,通过双线性变换从模拟滤波器设计。
- 自适应滤波:LMS(最小均方)、RLS(递推最小二乘)算法,系数随输入信号自适应调整,用于噪声消除和系统辨识。
时间序列的分解与预处理
经典分解方法
将时间序列拆解为若干可解释的成分:
- 加法分解:Y_t = T_t + S_t + R_t(趋势 + 季节 + 残差),适用于季节波动幅度恒定的序列。
- 乘法分解:Y_t = T_t × S_t × R_t,适用于季节波动幅度随趋势增长的序列。
- STL 分解:基于 LOESS 的鲁棒分解方法,能处理任意类型的季节性,且季节成分可随时间变化。
- X-13ARIMA-SEATS:美国人口普查局开发的标准季节调整方法,结合 ARIMA 建模和季节调整。
缺失值与异常值处理
- 插值方法:线性插值、样条插值、KNN 插值。
- 异常值检测:基于 Z-score、IQR 规则、孤立森林、LOF(局部异常因子)等。
- 鲁棒估计:使用 Huber 损失、分位数回归等降低异常值对模型的影响。
特征工程
- 统计特征:均值、方差、偏度、峰度、自相关系数、近似熵、样本熵。
- 时域特征:过零率、峰值数量、脉冲因子、裕度因子。
- 频域特征:频谱质心、频谱带宽、频谱滚降点。
- 非线性特征:关联维数、Lyapunov 指数、递归量化分析(RQA)。
机器学习方法
传统机器学习模型
- 支持向量回归(SVR):利用核函数映射到高维空间进行非线性回归,对异常值有一定鲁棒性。
- 随机森林与梯度提升树:通过构造滞后特征将时间序列问题转化为监督学习问题,XGBoost、LightGBM 在时序预测竞赛中表现优异。
- KNN 回归:基于历史相似模式进行预测,简单直观但计算量大。
- 高斯过程回归:提供预测的置信区间,适合小样本场景。
集成学习方法
- Stacking:组合多个基模型的预测结果,通过元学习器融合。
- Temporal Fusion Transformer 中的集成策略:结合变量选择网络和门控机制实现自适应集成。
深度学习方法
循环神经网络族
利用循环结构天然适配序列数据的时序依赖:
- 基础 RNN:隐藏状态 h_t = f(W_hh · h_{t-1} + W_xh · x_t + b),但存在梯度消失/爆炸问题。
- LSTM(长短期记忆网络):引入遗忘门、输入门、输出门三个门控机制和细胞状态,有效解决长程依赖问题。
- GRU(门控循环单元):LSTM 的简化版本,将遗忘门和输入门合并为更新门,参数更少但性能相当。
- 双向 RNN/LSTM/GRU:同时利用过去和未来信息,适合离线分析任务。
- 深层循环网络:Stacked LSTM、多层 GRU,逐层提取更高阶的时序特征。
卷积神经网络方法
将一维卷积应用于时间序列,捕捉局部时序模式:
- TCN(时间卷积网络):使用因果卷积(保证不"看到"未来信息)和膨胀卷积(指数扩大感受野),配合残差连接,训练速度远快于 RNN。
- WaveNet:DeepMind 提出的膨胀因果卷积架构,最初用于语音生成,后广泛应用于时序预测。
- InceptionTime:借鉴 Inception 模块的多尺度卷积思想,在 UCR 时间序列分类基准上达到顶尖水平。
Transformer 与注意力机制方法
利用自注意力机制建模全局时序依赖,突破 RNN 的顺序计算瓶颈:
- 标准 Transformer:将时间序列视为 Patch 序列,通过多头自注意力捕捉任意时刻之间的依赖关系。
- Temporal Fusion Transformer(TFT):专为多变量时序预测设计,集成变量选择网络、门控残差网络、时间融合注意力,同时提供预测值和可解释性。
- Informer:引入 ProbSparse 自注意力机制,将注意力计算复杂度从 O(L²) 降至 O(L·logL),专门针对长序列预测优化。
- Autoformer:基于自相关机制(Auto-Correlation)替代标准注意力,利用频域信息加速长序列依赖建模。
- PatchTST:将时间序列切分为 Patch,利用通道独立性策略和掩码预训练,在长期预测任务上表现卓越。
- iTransformer:对变量维度而非时间维度应用注意力,更好地捕捉多变量间的相关性。
- TimesNet:将一维时间序列转换为二维张量,利用 2D 卷积同时建模周期内和周期间的变化模式。
生成模型方法
- TimeGAN:结合自监督损失和对抗训练,学习真实时间序列的潜在动态,生成高保真合成时序数据。
- 时间序列扩散模型:如 CSDI(Conditional Score-based Diffusion Models),将扩散模型应用于时序插补和概率预测。
- VAE 变体:如 VRNN(Variational Recurrent Neural Network),将 VAE 的随机性与 RNN 的时序建模结合。
图神经网络方法
适用于具有空间拓扑结构的多变量时间序列(如交通网络、传感器网络):
- DCRNN:结合扩散卷积和 GRU,建模交通网络的时空依赖。
- STGCN:时空图卷积网络,交替使用图卷积和标准卷积提取时空特征。
- Graph WaveNet:自适应邻接矩阵学习 + 图卷积 + 膨胀因果卷积。
概率预测与不确定性量化
现代时间序列分析不仅关注点预测,更强调概率预测:
- 分位数回归:直接估计条件分位数,提供预测区间。
- 深度 AR 模型(DeepAR):自回归 RNN 框架,输出参数化的条件概率分布(如高斯、负二项分布)。
- 共形预测:基于分布无关的有限样本保证,为任意预测模型提供有效的预测区间。
- 蒙特卡洛 Dropout:利用 Dropout 的随机性近似贝叶斯推断,获取预测不确定性。
因果推断与结构发现
从观测时间序列中发现变量间的因果关系:
- Granger 因果检验:如果变量 X 的过去值能显著改善对变量 Y 的预测,则称 X "Granger 导致" Y。
- PC 算法 / FCI 算法:基于条件独立性检验发现因果图结构。
- PCMCI:结合 PC 算法和 MCI(条件互信息)检验,专门针对高维时间序列的因果发现。
- 神经因果发现:利用神经网络参数化因果机制,通过可微优化学习因果图。
评估与验证体系
评估指标
| 指标类型 | 常用指标 |
|---|---|
| 误差类 | MAE、MSE、RMSE、MAPE、sMAPE |
| 相对类 | MASE(平均绝对标度误差)、相对 MAE |
| 概率类 | CRPS(连续排序概率得分)、对数似然、Winkler 得分 |
| 分类类 | 准确率、F1、AUC-ROC(用于时序分类任务) |
验证策略
- 滚动窗口交叉验证:训练窗口固定,逐步向前滚动。
- 扩展窗口交叉验证:训练窗口逐步扩大,模拟实际部署场景。
- 时间序列分割:严格按时间顺序划分训练/验证/测试集,禁止随机打乱(避免未来信息泄露)。
📌 总结来说,时间序列处理的理论体系可以按照"统计基础 → 经典模型 → 信号处理 → 机器学习 → 深度学习 → 概率预测 → 因果推断"的层次递进理解。经典统计方法(ARIMA、GARCH、状态空间模型)提供了可解释性强、理论基础扎实的分析框架;深度学习方法(TCN、Transformer 变体、图神经网络)则在大规模、高维、非线性场景中展现了强大的建模能力。两者并非替代关系,而是互补共存------在实际应用中,往往需要结合领域知识、数据特性和任务需求选择合适的方法组合。