使用 SciPy 库进行时间序列分析

时间序列分析听起来有点学术,但其实干起来挺直接的。

你有一串按时间排列的数据,想知道里面有没有趋势、有没有周期性、噪声有多大,或者两个序列之间有没有延迟关系。

SciPy 这个库在信号处理、统计检验方面提供了不少现成的工具,配合 Matplotlib 画图,基本能覆盖日常分析的大部分需求。

本文不是单纯的介绍知识点,而是直接造一组模拟的全年每日温度数据,然后一步步用它演示:

  • 怎么平滑
  • 怎么滤波
  • 怎么去趋势
  • 怎么找周期
  • 怎么看自相关和互相关

每一步都配上代码和图表,你跟着跑一遍,自然就知道 SciPy 里这些函数该怎么用了。

1. 先造一组有季节性和趋势的温度数据

我在项目上有不少真实的数据,可能会违反甲方的隐私保护,所以我们直接用 NumPy 模拟。

假设一年 365 天,温度由三部分组成:一个周期为 365 天的正弦波代表季节性,一个缓慢上升的线性趋势,再加上一点随机噪声。

这样既有规律可循,又不会太干净。

python 复制代码
import numpy as np
import matplotlib.pyplot as plt

# 设置中文字体,避免图表中的中文显示为方框
plt.rcParams['font.sans-serif'] = ['SimHei']
plt.rcParams['axes.unicode_minus'] = False

np.random.seed(0)                     # 固定随机种子,保证结果可复现
days = np.arange(365)                 # 天数
seasonal = 10 * np.sin(2 * np.pi * days / 365)  # 季节性成分
trend = 0.05 * days                   # 线性趋势
noise = np.random.normal(0, 2, 365)   # 随机噪声
temperature_data = 20 + seasonal + trend + noise  # 合成温度数据

plt.plot(days, temperature_data)
plt.xlabel('天数')
plt.ylabel('温度')
plt.title('模拟的每日温度数据')
plt.show()

画出来能看到一条上下波动、整体略微上升的曲线,噪声让线条有点毛刺。

这就是我们后面所有分析的输入。

2. 用移动平均把噪声压一压

原始数据里的高频噪声会干扰我们对趋势的判断。最简单的平滑方法就是移动平均:取一个窗口,比如 7 天,算平均值,然后窗口往后滑。

NumPy 的 convolve 可以很方便地实现。

python 复制代码
def moving_average(data, window_size):
    return np.convolve(data, np.ones(window_size) / window_size, mode='valid')

smoothed = moving_average(temperature_data, 7)

plt.plot(days, temperature_data, label='原始数据', alpha=0.5)
plt.plot(days[6:], smoothed, label='7天移动平均', linewidth=2)
plt.legend()
plt.show()

窗口取 7 天是因为温度数据通常以周为周期有波动,7 天平均能抹掉大部分随机噪声,同时保留季节性的轮廓。

从图上能明显看出平滑后的曲线更干净,上升趋势和正弦波动都清晰了。

3. 低通滤波器:比移动平均更灵活的选择

移动平均本质上是个简单的低通滤波器,但如果你想更精确地控制截止频率,SciPy 的 signal.butter 和 filtfilt 更好用。

Butterworth 滤波器可以把高于某个频率的成分衰减掉,filtfilt 做双向滤波,避免相位偏移。

python 复制代码
from scipy.signal import butter, filtfilt

def lowpass_filter(data, cutoff, fs, order=4):
    nyquist = 0.5 * fs
    normal_cutoff = cutoff / nyquist
    b, a = butter(order, normal_cutoff, btype='low', analog=False)
    return filtfilt(b, a, data)

filtered = lowpass_filter(temperature_data, cutoff=0.1, fs=1)

plt.plot(days, temperature_data, alpha=0.5, label='原始数据')
plt.plot(days, filtered, label='低通滤波后', linewidth=2)
plt.legend()
plt.show()

这里采样频率 fs=1(每天一个点),截止频率设成 0.1,意思是保留周期大于 10 天的成分,把更快的波动滤掉。

结果和移动平均类似,但边缘处理更平滑,没有移动平均那种两端缺数据的问题。

4. 去趋势:把长期上升拿掉,只看季节性

温度数据里有个线性上升趋势,如果我们只想看季节性的正弦波动,可以用 scipy.signal.detrend 把线性趋势减掉。

python 复制代码
from scipy.signal import detrend

detrended = detrend(temperature_data)

plt.plot(days, detrended)
plt.xlabel('天数')
plt.ylabel('去趋势后的温度')
plt.title('去趋势结果')
plt.show()

去趋势后的曲线围绕 0 上下波动,正弦形状更明显了。

不过要注意,如果原始数据里的趋势不是线性的,detrend 默认只去线性趋势,效果可能不够。

我们这里恰好是线性趋势,所以结果很干净。

注 :细心的朋友可能发现这个【去趋势结果 】图和第 1 小节创建模拟数据后的【模拟的每日温度数据 】图几乎一样。那么,去趋势结果 (detrend)究竟做了什么呢?

一般来说,做频谱分析(FFT)、自相关、或找周期性之前,通常先去趋势。

否则线性趋势会在低频段产生很强的能量,掩盖真正的周期信号;去趋势也让数据的均值趋于稳定(平稳性),是很多时序分析方法的前置步骤。

简单来说:我们上面的 detrend 没有改变数据的"形状",只是把数据整体平移并拉平,让它围绕 0 波动------相当于减掉了 20 + 0.05·days 这条背景直线。

仔细看可以发现,【去趋势结果 】图中 Y 轴是围绕 0 左右波动的,第 1 小节中的【模拟的每日温度数据 】图是围绕 30 左右波动的。

5. 频谱分析:找出主要周期

想知道数据里到底有哪些周期成分,频谱分析是最直接的办法。

scipy.signal.periodogram 可以计算功率谱密度,横轴是频率,纵轴是功率。

频率的倒数就是周期。

python 复制代码
from scipy.signal import periodogram

frequencies, power = periodogram(temperature_data, fs=1)

plt.semilogy(frequencies, power)
plt.xlabel('频率(周期/天)')
plt.ylabel('功率')
plt.title('周期图')
plt.show()

图上会在频率 1/365 ≈ 0.00274 附近出现一个明显的峰值,对应 365 天的年周期。

用对数纵轴是因为功率差异可能很大。

如果你看到其他小峰值,可能是噪声或者谐波,但主峰的位置直接告诉了你数据里最强的周期。

6. 自相关:看当前值和过去值的关系

自相关衡量的是时间序列和它自己延迟若干天后的相关性。如果数据有季节性,自相关会在滞后 365 天附近出现高点。

我们用 scipy.stats.pearsonr 算滞后 1 到 30 天的相关系数。

python 复制代码
from scipy.stats import pearsonr

lags = range(1, 31)
autocorrs = [pearsonr(temperature_data[:-lag], temperature_data[lag:])[0] for lag in lags]

plt.stem(lags, autocorrs)
plt.xlabel('滞后(天)')
plt.ylabel('自相关')
plt.title('30天内的自相关')
plt.show()

因为我们的数据有正弦季节性,自相关会呈现波浪形,滞后越接近 365 的整数倍,相关性越高。

这里只画了 30 天,能看到相关性逐渐下降然后可能回升,这反映了短期的周期结构。

7. 互相关:分析两个序列之间的延迟关系

有时候我们关心两个序列是否相关,以及一个是否领先另一个。互相关就是干这个的。

我们生成一组模拟湿度数据,让它跟温度有 5 天的延迟关系,然后计算不同偏移下的相关系数。

python 复制代码
humidity_data = 70 + 0.5 * temperature_data[:-5] + np.random.normal(0, 1, 360)

shifts = range(-10, 11)
cross_corrs = [pearsonr(temperature_data[:360], np.roll(humidity_data, shift))[0] for shift in shifts]

plt.stem(shifts, cross_corrs)
plt.xlabel('偏移量')
plt.ylabel('互相关')
plt.title('温度与湿度的互相关')
plt.show()

结果会在偏移 +5 或 -5 附近出现峰值,具体方向取决于 np.roll 的定义。

这告诉我们湿度对温度有大约 5 天的滞后响应。

实际分析中,互相关能帮你判断因果方向或者找到最佳对齐方式。

8. 小结

到这里,我们用 SciPy 走了一遍时间序列分析的典型流程:

  1. 造数据
  2. 移动平均
  3. 低通滤波
  4. 去趋势
  5. 频谱分析
  6. 自相关
  7. 互相关

每个函数都不复杂,关键是知道什么时候用哪个。

移动平均和低通滤波适合平滑和去噪,去趋势帮你分离长期和周期成分,频谱和自相关能揭示周期,互相关则用于两个序列的延迟分析。

这些技术是更高级建模(比如 ARIMA、傅里叶拟合)的基础。你可以在自己的数据上试试,把参数调一调,看看结果怎么变。

相关推荐
java资料站1 小时前
十一、评估测试
开发语言·人工智能·python
szial1 小时前
网络爬虫与 CDP 实战(二):浏览器能访问,Python 却被拒绝?拆开登录态与 CSRF
爬虫·python·csrf
wang_yb1 小时前
使用 SciPy 库进行时间序列分析
数据分析·databook
对空六课2 小时前
支持注意力分析的热力图工具有哪些?
前端·数据库·数据分析
青少儿编程课堂2 小时前
后缀自动机解析:本质不同子串与最长重复片段统计
c++·python·算法·bfs·信息学竞赛
怕浪猫3 小时前
LLM 面试必问的 8 个问题,答不上来直接淘汰
人工智能·python·面试
老歌老听老掉牙4 小时前
从三维旋转的深度解析到Python实现:绕任意轴旋转的奥秘
python·三维旋转
打工仔折腾 AI4 小时前
工业场景下时序库与实时计算一体化架构选型实践对比
java·开发语言·后端·python·性能优化·架构·ai agent 实战
梦幻精灵_cq4 小时前
sumdir——一个伪python.built-in的“术法”打造
python