S4D-dPL 论文阅读整理:摘要翻译、主要图表与问题辨析
论文 :Benchmarking structured state space models for differentiable parameter learning: A large-scale evaluation on accuracy and physical consistency
作者 :Xin Jing, Jungang Luo, Xue Yang, Ganggang Zuo
期刊 :Expert Systems With Applications 329 (2026) 133040
1. 论文摘要中文翻译
在可微分参数学习(Differentiable Parameter Learning,dPL)中,神经序列编码器将历史气象信息映射为随时间变化的水文参数,并由这些参数驱动基于过程的径流模拟。然而,不同编码器的选择会如何影响预测性能以及所学习参数的动态行为,目前仍不清楚。
本研究基于 CAMELS-US 数据集,在 dPL 框架中对结构化状态空间对角模型(Structured State Space Diagonal,S4D)进行了基准评估。与长短期记忆网络(LSTM)基线相比,S4D 将中位数 NSE 从 0.742 提高到 0.756,并且在积雪主导流域中的提升更加明显。
然而,不同编码器之间的比较表明,较高的径流模拟精度并不一定意味着所学习参数轨迹具有更好的时间一致性或更强的水文合理性。参数层面的高频波动在传播到最终模拟径流之前,会被基于过程的水文解码器部分削弱,这表明在 dPL 中,参数行为与径流预测精度之间存在一定程度的解耦。
为进一步研究这一问题,作者提出了 S5D,即一种修改后的 S4D 编码器。该模型加入基于 Conv1D 的局部归纳偏置、LayerNorm 和基于 Softsign 的有界激活函数,以促进更加稳定的时间参数学习。其中一种 S5D 变体能够降低参数波动,并得到更连贯的季节性参数轨迹;性能最好的另一种变体则将中位数 NSE 提高到 0.763。
总体而言,编码器结构既影响 dPL 的预测性能,也影响动态参数的行为;与此同时,基于过程的水文解码器能够在一定程度上缓冲参数层面的不规则变化,使其不完全传递到最终径流模拟中。
2. 论文核心技术路线
论文可以概括为以下流程:
text
历史气象 forcing + 流域静态属性
↓
序列编码器
LSTM / TCN / Transformer
TimeMixer / S4D / S5D
↓
动态水文参数
β、γ、K0
↓
HBV1.1p
可微分过程水文解码器
↓
Q + SWE + SM + ET
+ 其他内部状态/通量
↓
预测性能 + 参数行为
+ 内部过程一致性诊断
文中明确指出,采用的过程模型结构为 HBV1.1p。详细 HBV1.1p 数学公式放在论文的 Supplementary Text S1 中。
动态编码器主要预测三个随时间变化的参数:
β:与有效降雨/入渗-产流分配有关;γ:与蒸散过程有关;K0:与快速出流/退水过程有关。
其他水文参数被设置为静态参数,并由单独的 MLP 根据流域静态属性生成。
3. 主要表格
Table 1:不同序列编码器的结构比较
| 模型 | 类别 | 主要特点 |
|---|---|---|
| LSTM | 循环神经网络 | 通过输入门、遗忘门和输出门建模时间依赖 |
| TCN | 卷积神经网络 | 因果卷积 + 扩张卷积 + 残差连接 |
| Transformer | 注意力模型 | 多头自注意力 + 位置编码 |
| TimeMixer | MLP-based decomposition | 多尺度时间混合与趋势/季节成分分解 |
| S4D | 状态空间模型 | S4 的对角化版本,利用状态空间结构和 FFT 卷积建模长序列 |
作用:说明本文不是只比较 S4D 和 LSTM,而是把 S4D 放入多种时序编码器中进行统一 benchmark。
Table 2:预测性能汇总
531 个 CAMELS 流域
| 模型 | NSE | KGE |
|---|---|---|
| δMG-LSTM | 0.742 | 0.755 |
| δMG-S4D | 0.756 | 0.778 |
| δMG-TCN | 0.732 | 0.759 |
| δMG-TimeMixer | 0.742 | 0.748 |
| δMG-Transformer | 0.741 | 0.742 |
S4D 相比 LSTM 的中位 NSE 提升为:
0.756−0.742=0.014 0.756-0.742=0.014 0.756−0.742=0.014
因此这里应该理解为:
S4D 相比 LSTM 有小幅总体优势,而不是大幅性能跃升。
作者自己在正文中也使用了 "modest but consistent predictive gains" 这样的表述。
671 个 CAMELS 流域
δMG-S4D 的 NSE 为 0.752,δMG-LSTM 为 0.735。
S5Dv2 的 NSE 达到 0.763,是表中作者实现模型中最高的 NSE。
4. 主要图件
Fig. 1:dPL 的 Encoder--Decoder 框架
text
气象 forcing + 流域属性
↓
神经网络 Encoder
↓
静态参数 + 动态参数
↓
参数范围映射
↓
可微分过程水文模型 Decoder
↓
径流和内部水文通量
↓
Q误差反向传播

Fig. 2:S4D 与 S5D 的网络结构
展示:
- S4D backbone;
- 原始 S4D encoder;
- S5Dv1;
- S5Dv2。
S5D 主要通过 Conv1D、LayerNorm 和 Softsign 有界映射,尝试改善 S4D 动态参数的高频波动。

Fig. 3:不同编码器的 NSE / KGE 累积分布
使用 CDF 比较 LSTM、TCN、Transformer、TimeMixer 和 S4D 在大样本流域上的总体性能分布。

Fig. 4:S4D 与 LSTM 的空间性能差异
- Fig. 4a:比较
ΔNSE - Fig. 4b:比较
Δ|FHV| - Fig. 4c--e:三个代表流域的实测与模拟径流过程
marker 大小与模型差异幅度有关。

Fig. 5:PUB / PUR 空间泛化实验
- PUB:Prediction in Ungauged Basins
- PUR:Prediction in Ungauged Regions
通过不同测试流域组或水文气候区的 NSE / KGE 箱线图比较 S4D 与 LSTM 的空间泛化能力。

Fig. 6:径流分配与基流过程诊断
使用三个 hydrologic signatures:
- RR:Runoff Ratio
- BFI:Baseflow Index
- SR:Surface Runoff Ratio
图中试图说明:即使两个模型最终总径流相近,内部快流/慢流分配仍可能明显不同。

Fig. 7:SWE、SM 和 ET 的内部状态/通量诊断
使用 ERA5-Land 作为参考,比较:
- SWE;
- Soil Moisture;
- Actual ET。
注意:ERA5-Land 是再分析参考,不是直接地面观测真值。

Fig. 8:降雨主导流域的动态参数轨迹
展示 USGS 1466500 中:
βγK0
随时间的变化。
灰线对应 16 个 components 的参数轨迹;彩色实线表示从这些 components 中选出的代表性参数轨迹。(HBV的16个并行运算单元是默认配置,也可以自己改)

Fig. 9:积雪主导流域的动态参数轨迹
结构与 Fig. 8 相同,但研究对象为雪融主导流域 USGS 6431500。

Fig. 10:Effective Receptive Field(ERF)
采用 Temporal Integrated Gradients 分析当前动态参数估计受多长历史气象信息影响。
主要结果:
- LSTM 的高贡献历史主要集中在最近约 30--50 天;
- S4D 的有效历史范围明显更长;
- 某些参数可受到 100 天甚至更长历史信息影响。

Fig. 11:参数扰动与过程层缓冲
图本身实际包含五行:
text
β
γ
Soilwater
Wetness
ET
左列为 LSTM,中列为 S4D,右列为相邻时间步变化量的统计分布。
作者想表达:
text
动态参数 β、γ 高频波动很大
↓
进入 HBV 水量平衡和储量递推
↓
Soilwater / Wetness 波动被削弱
↓
ET 仍保持较平滑的季节变化
作者将这一现象描述为 process-layer buffering 或概念性的 low-pass filtering effect 。

Fig. 12:多流域动态参数稳定性诊断
针对 β、K0、γ 统计:
- short-term variability;
- roughness;
- boundary saturation ratio。

Fig. 13:S5D 对参数轨迹的改善
比较原始 S4D 与 S5Dv1 在降雨主导和积雪主导代表流域中的:
βγK0
主要说明 S5D 是否能让参数变化更平滑、更具有季节组织性。

5. 这篇论文真正比较稳妥的结论
更稳妥的结论不是:
S4D 全面优于 LSTM。
而是:
S4D 可以作为 dPL 中具有竞争力的长序列编码器,相比 LSTM 在总体性能上取得小幅提升,并且这种优势在部分具有明显长记忆、积雪和季节储存-释放过程的流域中更加突出。
同时,论文更有价值的一点是揭示:
径流预测准确,并不代表动态参数轨迹一定稳定、唯一或具有直接可观测的物理意义。
S4D 虽然能够取得略高的径流模拟性能,但它生成的部分动态参数存在:
- 高频振荡;
- 参数边界饱和;
- 时间轨迹不够平滑。
这些变化经过 HBV 的储量、状态和通量计算后可能被部分削弱,因此最终 Q 仍然保持较稳定。
6. 阅读这篇论文时建议区分的三个层次
第一层:预测层
关注:
- NSE;
- KGE;
- FHV;
- PUB / PUR。
回答:
最终径流预测是否更准确?
第二层:过程层
关注:
- RR;
- BFI;
- SR;
- SWE;
- SM;
- ET。
回答:
模型内部的水量分配和状态是否更加合理?
第三层:参数层
关注:
- β;
- γ;
- K0;
- 参数短期波动;
- roughness;
- boundary saturation;
- S5D 参数平滑效果。
回答:
神经网络学出来的动态水文参数是否具有稳定、可解释的时间行为?
8. 总结
该论文最值得关注的并不是 "S4D 将 NSE 从 0.742 提高到了 0.756",而是它提出并展示了一个值得讨论的问题:
在可微分参数学习中,序列编码器可以通过非常不同、甚至不够平滑的动态参数轨迹获得相似或更好的径流结果,因此评价 dPL 模型不能只看最终 Q,还需要同时检查参数层、状态层和通量层。