林火预测顶会数据集分享|WildfireSpreadTS 多模态时序林火数据集完整使用指南(附45G网盘直链)

引言:野火预测领域的数据集痛点

全球极端高温加剧山林野火灾害,基于遥感+时序深度学习的野火蔓延预测成为防灾减灾核心研究方向。

但目前开源野火数据集普遍存在几大短板:

  1. 仅单张静态影像,缺少连续时序观测,无法建模火灾动态蔓延过程;
  2. 特征维度单一,仅含火情掩码,缺失气象、地形、植被多模态耦合信息;
  3. 分辨率粗糙、数据量小,难以支撑Transformer、U-Net、ConvLSTM等复杂时空模型训练;
  4. 配套训练代码、基线实验缺失,拿到数据也无法快速复现论文结果。

2023年NeurIPS数据集赛道发布的 WildfireSpreadTS 完美解决以上痛点,是目前野火时序预测领域公认标准Benchmark数据集。本文完整拆解数据集信息、开源代码环境部署、训练流程、已知坑点修复,同时放出完整45G原始数据集网盘下载链接,开箱即用。

一、WildfireSpreadTS 数据集核心信息

1. 基础概况

数据集由瑞典皇家理工学院KTH团队发布,收录2018.01--2021.10美国西部607场真实野火完整生命周期时序数据:

  • 总影像数量:13607张每日多通道遥感图
  • 统一空间分辨率:375m
  • 总存储大小:45G(WildfireSpreadTS.zip
  • 时序粒度:24小时单步预测,支持自定义多日历史输入、多日未来推演
  • 开源协议:CC-BY-4.0(商用/学术均可)

2. 23维多模态通道特征(四大类)

数据集全部数据对齐时空坐标,无需手动配准,四大维度覆盖野火蔓延全部影响因子:

  1. 火情掩码:当日活跃火区、过火区域标注(标签真值)
  2. 气象时序特征:风速、湿度、温度、降水、大气压力等逐日观测
  3. 地形静态特征:海拔、坡度、坡向(存在已知角度特征Bug)
  4. 植被燃料特征:植被类型、可燃物含水率、地表覆盖密度

读取到它的 23 个波段名如下(按 band 顺序):

bash 复制代码
- 1 M11
- 2 I2
- 3 I1
- 4 NDVI_last
- 5 EVI2_last
- 6 total precipitation
- 7 wind speed
- 8 wind direction
- 9 minimum temperature
- 10 maximum temperature
- 11 energy release component
- 12 specific humidity
- 13 slope
- 14 aspect
- 15 elevation
- 16 pdsi
- 17 LC_Type1
- 18 total_precipitation_surface_last
- 19 forecast wind speed
- 20 forecast wind direction
- 21 forecast temperature
- 22 forecast specific humidity
- 23 active fire

3. 数据集核心优势

  1. 原生时序结构:每场火灾完整生命周期连续观测,支持ConvLSTM、时空Transformer、UTAE等时序模型训练;
  2. 多模态融合:23通道高维混合特征,贴近真实防灾系统输入;
  3. 真实噪声场景:包含云雾遮挡、火情检测误差等真实干扰,训练模型泛化能力更强;
  4. 标准评测方案:官方12折逐年交叉验证,训练集/测试集按年份隔离,模拟真实落地推演场景;
  5. 完整开源配套:数据预处理、HDF5加速转换、U-Net基线、WandB网格搜索全套Python代码。

4. 适用研究方向

  • 时空深度学习:ConvLSTM、UNet+LSTM、时空注意力模型、扩散生成式野火预测
  • 遥感多模态融合、噪声鲁棒分割、不平衡语义分割
  • 灾害不确定性预测、时序风险推演、防灾应急决策AI
  • 卫星遥感地球观测大模型微调

二、官方开源资源汇总(可直接访问)

1. 主项目代码仓库(训练/推理/基线实验)

仓库地址:https://github.com/SebastianGer/WildfireSpreadTS

  • Star:学术高星基准项目,Python 100%实现
  • 核心目录说明
    | 目录 | 功能 |
    |------|------|
    | src/dataloader/ | 官方PyTorch Dataset、Lightning DataModule,可直接导入训练 |
    | src/preprocess/ | 原始数据集转HDF5高速缓存脚本(训练提速数倍) |
    | cfgs/ | YAML配置文件,单GPU训练、WandB网格搜索全部基线参数 |
    | train.py | 一键启动训练入口,支持命令行覆盖配置参数 |

2. 数据集生成GEE源码(自行扩充区域可用)

https://github.com/SebastianGer/WildfireSpreadTSCreateDataset

基于Google Earth Engine批量导出全球野火时序遥感数据,可自定义区域、时间范围生成私有数据集。

3. 论文原文引用

论文链接:https://openreview.net/forum?id=RgdGkPRQ03

bibtex 复制代码
@inproceedings{
 gerard2023wildfirespreadts,
 title={WildfireSpread{TS}: A dataset of multi-modal time series for wildfire spread prediction},
 author={Sebastian Gerard and Yu Zhao and Josephine Sullivan},
 booktitle={Thirty-seventh Conference on Neural Information Processing Systems Datasets and Benchmarks Track},
 year={2023},
 url={https://openreview.net/forum?id=RgdGkPRQ03}
}

三、45G完整数据集网盘下载(国内直下,无需科学上网)

原始Zenodo官方地址下载速度极慢,整理完整压缩包分享至夸克网盘,解压即用:

网盘获取方式

  1. APP内口令直达:/~a3203Zij6o~:/
  2. 链接地址:https://pan.quark.cn/s/a7b33f71091a?pwd=NW7S
  3. 提取码:NW7S
    文件:WildfireSpreadTS.zip,总大小45G,包含全部原始时序遥感数据。

下载&解压注意事项

  1. 磁盘预留至少100G空间(原始包45G + HDF5转换后翻倍占用);
  2. 解压路径避免中文、空格,防止预处理脚本读取失败;
  3. 建议SSD存储,HDF5训练IO密集,机械硬盘会严重拖慢训练速度。

四、环境部署与数据预处理完整流程

1. 依赖安装

shell 复制代码
# 克隆代码仓库
git clone https://github.com/SebastianGer/WildfireSpreadTS.git
cd WildfireSpreadTS

# 安装全部依赖
pip3 install -r requirements.txt

依赖包含:PyTorch、Pytorch-Lightning、LightningCLI、WandB、h5py、rasterio、torchmetrics等遥感深度学习常用库。

2. 原始数据转HDF5(关键提速步骤)

原始遥感文件读取速度极低,官方推荐转换为HDF5格式加速训练:

shell 复制代码
# 替换参数为你的解压目录与HDF5输出目录
python3 src/preprocess/CreateHDF5Dataset.py \
--data_dir /your/unzip/WildfireSpreadTS \
--target_dir /your/hdf5/output
  • 可选跳过转换:训练时添加参数 --data.load_from_hdf5=False,但训练速度下降5~10倍;
  • 转换耗时:单台PC约2~4小时,建议后台运行。

3. 基线U-Net模型一键训练示例

shell 复制代码
python3 train.py \
--config=cfgs/unet/res18_monotemporal.yaml \
--trainer=cfgs/trainer_single_gpu.yaml \
--data=cfgs/data_monotemporal_full_features.yaml \
--seed_everything=0 \
--trainer.max_epochs=200 \
--do_test=True \
--data.data_dir /your/hdf5/output
  • 关闭WandB日志(无账号可用):执行前设置环境变量
shell 复制代码
export WANDB_MODE=disabled
  • 参数优先级:命令行参数 > yaml配置文件,可自由覆盖学习率、批次、输入时序长度。

五、官方已知Bug与修复方案(2026最新更新)

仓库2026年2月更新README,披露两处关键数据缺陷,复现实验必须注意:

Bug1:数据集类原始逻辑错误

早期代码Dataset读取存在索引偏移,修复commit:ab3c8f35c5ec8c52c306a4488eaeb71a5a13d0de

  • 影响:原始未修复代码模型精度偏低;
  • 处理:拉取main最新分支代码,如需复现论文原始结果可回滚至该commit。

Bug2:角度特征仅使用sin丢失相位信息(未修复)

坡向等角度特征当前代码仅做sin变换,缺少cos分量,会丢失完整角度信息;

  • 临时解决方案:在特征预处理层手动拼接sin(angle)、cos(angle)双通道输入模型;
  • 官方说明:因项目排期暂未推送修复补丁,做地形相关消融实验需自行修改。

额外踩坑点补充

  1. torchmetrics新版本PR曲线绘图报错:仓库已修复src绘图代码,更新代码即可;
  2. 超大文件夹读取内存溢出:分批转换HDF5,不要一次性加载全部607场火灾;
  3. 标签极度不平衡:训练推荐使用Focal Loss、Dice Loss替代原生BCE。

六、数据集拓展与二次开发

  1. 时序长度自定义:原生支持输入1~N天历史观测,预测未来1/3/7天火灾蔓延,适配短期/中长期推演任务;
  2. 区域扩充:使用配套GEE导出脚本,下载国内山林野火遥感数据,构建本土化野火预测数据集;
  3. 多模型适配:官方DataModule直接输出标准PyTorch DataLoader,可无缝对接ConvLSTM、U-TAE、时空Transformer、扩散模型;
  4. 消融实验快速搭建:cfgs目录提供多组特征子集配置(仅植被/植被+地形/全模态),快速对比不同特征贡献度。

下图是测试结果示例,效果一般。从算法角度来说有很大改进空间。

七、总结与拓展资源

WildfireSpreadTS是野火时空预测领域唯一同时具备大规模真实时序、多模态遥感、完整开源基线、标准化评测的公开数据集,不管是硕士课题、遥感顶会论文、防灾AI落地项目都具备极高复用价值。

配套资源清单

  1. 45G完整数据集:夸克网盘(链接+提取码上文已给出)
  2. 训练/预处理源码:https://github.com/SebastianGer/WildfireSpreadTS
  3. GEE数据生成脚本:https://github.com/SebastianGer/WildfireSpreadTSCreateDataset
  4. 论文原文:https://openreview.net/forum?id=RgdGkPRQ03
  5. 引用bibtex:文中已附,论文发表NeurIPS 2023 Datasets Benchmark Track

后续研究建议

  1. 针对角度特征Bug优化特征工程,提升地形相关预测精度;
  2. 基于该数据集搭建扩散、时序Transformer生成式野火预测模型;
  3. 结合国内卫星遥感数据,迁移学习构建本土化野火预警系统。

附录:快速复制下载信息

网盘口令:/a3203Zij6o😕

链接:https://pan.quark.cn/s/a7b33f71091a?pwd=NW7S

提取码:NW7S

文件:WildfireSpreadTS.zip(45G)

相关推荐
沐欣工作室_lvyiyi4 个月前
基于单片机的机房火灾预警系统(论文+源码)
单片机·嵌入式硬件·云平台·火灾预警
无锡布里渊1 年前
分布式光纤应变监测是一种高精度、分布式的监测技术
分布式·温度监测·分布式光纤测温·厘米级·火灾预警·线型感温火灾监测·分布式光纤应变