从相关到因果:预测科学的因果转向与可识别性挑战

复制代码
2025---2026年,预测科学正在经历一场深层的方法论转向:从"在相关性中寻找预测信号"到"在因果结构中理解预测机制"。这一转向的驱动力来自两个相互交织的力量:一方面,传统深度学习预测模型在分布偏移下的脆弱性日益暴露,促使研究者追问"模型学到的到底是因果规律还是虚假相关";另一方面,高 stakes 决策场景对反事实预测------即"如果干预某个变量,结果会如何变化"------的刚性需求,使因果推断从统计学的边缘话题走向预测科学的中心。本文系统梳理因果预测的前沿进展,从因果发现与预测的融合、干预与反事实预测的生成式建模、以及因果基础模型的兴起三条技术路线展开分析。本文的核心论点是:因果预测的范式意义不在于替代相关性预测,而在于为预测赋予"可干预性"和"可迁移性"两项新能力;但这一能力的前提是因果结构的可识别性,而可识别性在非平稳、部分可观测的现实系统中面临根本挑战。本文进一步指出,因果预测的实践中存在"反事实幻觉"的风险------模型输出的因果解释可能缺乏统计保证,而保形预测等务实工具为约束这一风险提供了可能路径。

关键词:因果预测;反事实推断;时间序列因果发现;可识别性;保形预测

一、引言:一个被回避的问题

前文已系统梳理了预测科学的两大前沿:基础模型追求泛化能力的规模扩张,可解释架构试图重建模型与理论之间的桥梁。然而,无论模型多么精确、多么透明,一个根本性的问题始终悬而未决------预测模型学到的究竟是什么?

这个问题的尖锐性在分布偏移(distribution shift)场景中暴露无遗。一个在历史数据上表现优异的电力负荷预测模型,当极端天气事件或突发政策变化打破了历史分布时,可能急剧失效。一个在训练集上准确率高达95%的交通流量预测器,面对疫情后通勤模式的持久改变时,可能不如一个简单的历史均值。这些失效的共同根源是:模型捕捉的是数据中的统计相关,而非产生数据的因果机制。相关关系在分布变化时会"漂移",而因果关系------如果被正确识别------则具有跨分布的稳定性。

这正是因果预测(causal forecasting)兴起的根本动因。它追问的不是"什么变量与预测目标相关",而是"什么变量导致了预测目标的变化,以及如果干预这些变量,结果会怎样"。这一追问在纯粹的预测精度竞赛中似乎多余,但在决策场景中却是不可或缺的:政策制定者不仅需要知道"感染人数会上升",还需要知道"如果实施封锁,感染人数会下降多少";电网调度员不仅需要知道"明天负荷会达到峰值",还需要知道"如果提前调度储能,峰值能否被削平"。

本文将论证,因果预测正在成为预测科学中一条与"基础模型路线"和"可解释性路线"并行且互补的新前沿。它的核心贡献不在于更高的预测精度,而在于为预测赋予了两项新能力:可干预性------回答"如果改变某个输入,输出会怎样";以及可迁移性------在分布变化时保持预测的稳健性。但这一能力的前提是因果结构的可识别性(identifiability),而可识别性在现实系统的复杂性面前面临着深刻的挑战。

二、因果发现与预测的融合:当预测模型"学会"因果结构

2.1 从"后门调整"到因果注意力

因果预测的第一条技术路线,是在预测模型中显式地建模和利用因果结构。这不同于传统的"特征选择"------后者的目标是找到与目标最相关的变量,而前者的目标是找到导致目标变化的变量,并在预测中排除混杂因素的干扰。

Caformer(Causal Transformer)是这一路线在2026年最具代表性的工作之一。其核心洞察是:非平稳时间序列中的环境因素会引入虚假相关,掩盖有意义的时序特征。例如,在电力负荷预测中,某个工业区的负荷可能与某支股票的价格高度相关,但这种相关完全由共同的宏观经济环境驱动------当经济周期改变时,这种相关就会断裂。

Caformer的解决方案是一个四模块架构。动态学习器揭示特征间的动态交互,时序学习器在因果约束下推断跨时间依赖。关键在于环境学习器与分解学习器的协同:它们从时间序列中提取环境因素,并施加后门调整(backdoor adjustment)------一种经典的因果推断技术,通过控制混杂变量来阻断"后门路径",从而估计真正的因果效应。

其实验结果具有说服力:在交通数据集上MSE降低26.2%,电力数据集上降低21.8%,相比PatchTST------当前最先进的时间序列Transformer之一。在M4竞赛的全部15个短期预测类别中排名第一。更重要的是,Caformer"提供了对所学依赖关系的可解释洞察"------这意味着模型不仅能预测,还能告诉使用者"为什么这样预测"。

2.2 因果发现作为预测的前置步骤

第二条路径将因果发现(causal discovery)视为预测的独立前置任务:先推断变量之间的因果图,再基于这一图结构构建预测模型。这一路径的代表是ARCausal,它通过传递熵(transfer entropy)估计从向量自回归学习中提取因果关系,并将其编码为Transformer注意力掩码中的因果掩码(causal mask)。

ARCausal的设计逻辑清晰地反映了因果预测的核心假设:如果变量A确实导致变量B,那么A的历史信息应当包含关于B未来变化的"额外"信息,而这种额外信息无法从B自身的历史或其他变量的历史中推断出来。 传递熵正是量化这一"额外信息"的 principled 工具。将传递熵估计得到的因果结构转化为注意力掩码,意味着Transformer被"告知"哪些变量对之间应当存在信息流动,哪些应当被阻断。

Mask2Cause则更进一步:它将因果图的恢复嵌入预测的前向传播过程中,使因果发现与预测学习在同一框架内联合进行。该工作报告了一个引人注目的效率发现:利用推断出的因果结构来约束预测模型,可以将参数量平均减少70%以上,同时维持预测精度。这一结果的深层含义是:因果结构本身就是一种极致的参数压缩------它告诉模型"哪些连接是必要的,哪些是冗余的",从而在架构层面实现了奥卡姆剃刀。

2.3 大语言模型作为因果推理引擎

第三条路径将因果发现的任务交给了大语言模型。Augur框架"利用大语言模型的因果推理能力来发现和使用协变量之间的有向因果关联"。这一思路的激进之处在于:它将因果结构的先验知识从数据中"解放"出来,转而依赖LLM在预训练中吸收的世界知识。

LLM是否真的具备"因果推理能力"仍是一个开放问题。但Augur的架构设计------一个"强大的教师LLM"推断因果关联,一个"学生"预测模型利用这些关联------暗示了一种务实的策略:LLM不需要"真正理解"因果,它只需要能够识别文本中隐含的因果叙事("利率上升导致债券价格下降"),并将这种叙事转化为可操作的变量间约束。

Causal-LLM进一步将这一思路推向神经符号基础模型的层面。该工作明确指出其目标是解决时空图神经网络的"固有黑箱性"------"无法解释其预测的底层驱动因素,在高风险领域(如气象学和城市规划)中造成了关键的可信瓶颈"。Causal-LLM的核心创新是因果数据合成训练范式:通过构造带有已知因果结构的合成数据,教模型将数值预测与"人类可理解的因果叙事"对齐。

三、干预与反事实:从"会怎样"到"如果......会怎样"

因果发现回答的是"什么导致什么",而干预和反事实预测回答的是更困难的问题:"如果我们改变某个变量,结果会怎样?"这两个问题在数学上有着根本的区别:前者是关于观测分布的推断,后者是关于干预分布的推断。Pearl的因果层级(causal hierarchy)将这一区别形式化为三个层次:关联(P(Y|X))、干预(P(Y|do(X)))、反事实(P(Y_{X=x}|X=x', Y=y'))。传统预测模型只在第一层运作,而因果预测的价值恰恰体现在第二层和第三层。

3.1 干预预测的生成式建模

DoFlow是ICLR 2026上出现的一个关键工作,它将连续归一化流(continuous normalizing flows, CNF)应用于时间序列的干预和反事实预测。DoFlow的设计逻辑是:流模型天然定义了从潜在空间到观测空间的可逆映射,这种可逆性恰好对应于因果推断中"从观测到干预"的"自然编码-解码机制"。

DoFlow的目标是提供"连贯的观测预测、干预预测和反事实预测"。这一目标的实现依赖于对时间序列生成过程的因果建模:观测预测是"让系统按自然规律运行",干预预测是"在某个时间点施加外部干预后让系统运行",反事实预测是"在另一个可能的世界中让系统运行"。流模型的优势在于,这三种预测共享同一个生成过程,只是在条件化时使用了不同的输入。

3.2 流行病学中的因果混合建模

流行病预测是因果干预预测最具紧迫性的应用场景。公共卫生决策者需要的不是"下周感染人数会是多少"(观测预测),而是"如果现在实施社交距离措施,感染人数会减少多少"(干预预测)。EpiNode的工作精确地回应了这一需求。

EpiNode的论文标题本身就极具方法论意义:"如何(不)混合神经模型与机制模型进行流行病预测"。它首先诊断了朴素混合模型的失败模式:在部分可观测和持续变化的传播动态下,许多看似合理的"神经+机制"耦合方式会失效。EpiNode的解决方案是将感染序列分解为趋势、季节和残差三个分量,用这些可解释的信号驱动一个受控的神经ODE,该ODE与流行病学模型(SEIR类)耦合。

其结果令人印象深刻:在所有五个数据集上RMSE最低(相比最强基线降低最多57%),在五个中的四个上峰值时间预测误差在一个时间步以内,并且恢复出了在真实范围内的时变传播率、恢复率和免疫损失率。最后一点尤为关键------这意味着模型不仅预测了"会发生什么",还推断出了系统内部的因果参数。这正是因果预测区别于纯统计预测的本质:它试图重建产生数据的机制,而非仅仅拟合数据的外观。

3.3 因果预测的决策价值

干预预测的终极价值在于反事实决策分析。一个能够回答"如果我这样做,会发生什么"的模型,本质上是一个策略评估引擎。这在能源系统中体现得尤为明显:因果推理与机器学习在电力能源系统中的综述明确指出,因果方法在"改进时间序列预测"和"反事实预测"方面都取得了进展。风电功率预测中的因果增强LLM预报器、光伏功率预测中的因果自监督图学习、以及智能能源预测中的因果模糊神经算子------这些工作共同构成了一个信号:能源系统的预测正在从"预测负荷/出力"走向"预测干预效果" 。

四、因果基础模型的兴起:一条通向"可迁移预测"的道路

4.1 Prior-Data Fitted Networks与因果先验

因果预测与基础模型的结合产生了当前最具理论野心的方向:因果基础模型(causal foundation model)。这一方向的核心思想是:与其在特定数据集上学习因果结构,不如在合成因果数据上预训练一个基础模型,使其学会"因果推理的一般能力",然后在测试时通过in-context learning进行零样本因果预测。

这一思路的技术基础是Prior-Data Fitted Networks(PFN):在从解析先验采样的数据集上预训练Transformer,测试时执行in-context推断。Do-PFN和CausalFM已经将这一框架扩展到干预性表格预测,而最新的工作正在将其扩展到时间序列。

Towards Continuous-time Causal Foundation Models提出了一个关键的理论问题:当我们将离散时间的因果PFN扩展到连续时间时,什么构成了"真正的连续时间先验"?论文给出了一个精确的判据------轨迹律对观测时间表的不变性(trajectory-law invariance to the observation schedule)。直观地说,如果一个因果过程的联合分布在"在时间点A观测"和"在时间点B观测"下不同,那么它就不是真正的连续时间过程,而只是"披着SDE外衣的离散时间马尔可夫模型"。

论文提出了一个三层分类法:离散层、朴素观测网格积分层、以及细网格积分与解耦观测层。只有第三层满足连续时间的严格标准。实验表明,细网格积分在所有8个测试单元上优于朴素方法,且差距随评估网格的细化而增大。这一技术细节的重要性在于:因果基础模型的可迁移性依赖于其预训练先验的正确性,而先验的正确性需要严格的数学判据来保证。

4.2 因果基础模型的能力边界

PCFM(Probabilistic Causal Foundation Model)从另一个角度切入:它利用显式的结构先验(有向拓扑)进行拓扑约束的预测,且计算量随边数线性扩展。这一设计回应了因果基础模型面临的一个核心张力:因果结构提供了可迁移性,但也引入了对结构正确性的依赖。如果预训练先验中的因果图与测试时的真实因果结构不匹配,因果基础模型的优势可能消失甚至反转。

五、反思:可识别性、反事实幻觉与务实约束

5.1 可识别性的根本挑战

因果预测的所有技术路线都面临同一个根本约束:因果效应只有在特定假设下才可识别。最核心的假设是无未观测混杂(no unobserved confounding)------所有同时影响处理变量和结果变量的变量都被观测到。在受控实验中,随机化处理分配保证了这一假设;但在观测性的时间序列数据中,这一假设几乎不可能被验证,更不可能被保证。

Caformer的后门调整、ARCausal的传递熵估计、EpiNode的受控神经ODE------这些技术都依赖于某种形式的无混杂假设。在电力系统中,因果推理与机器学习的综述明确将"假设检验"作为核心议题之一。这意味着,因果预测的实践者不仅需要技术工具,还需要假设的自觉:清楚地知道自己的因果结论在什么条件下成立,以及在什么条件下会失效。

5.2 反事实幻觉的风险

可识别性挑战的一个更危险的衍生是反事实幻觉(counterfactual hallucination):模型输出看似合理的反事实预测和因果解释,但这些输出缺乏统计保证。一个模型可能报告"如果实施政策A,感染人数将下降30%",但这个数字可能是模型在训练数据中"编造"出来的,而非从真实的因果结构中推断出的。

这一风险在LLM驱动的因果预测中尤为突出。Augur依赖LLM的"因果推理能力",但LLM的因果知识来自预训练文本中的叙事模式,而非受控实验或因果发现算法。LLM可能从一篇新闻报道中"学会""加息导致股市下跌"这一叙事,但这一叙事在特定的经济条件下可能完全失效。将这种叙事性的因果知识直接用于预测,是一种认知上的越界------把"文本中频繁共现的因果表述"等同于"数据生成过程中的因果机制"。

5.3 保形预测作为务实约束

在这一背景下,保形预测(conformal prediction)提供了一个重要的务实约束。保形预测的核心贡献是无分布假设的有限样本覆盖保证:无论模型多么不完美,无论因果假设是否成立,保形预测都能构造出具有名义覆盖率的预测区间。

2026年的一项工作提出了一个令人警醒的论点:"最简单的保形区间------一个最后值点预测包裹在有限样本分裂保形残差分位数中,无参数、无训练------是一个远比其在近期学习预测文献中的几乎完全缺席所暗示的更强的基线"。在2217条真实序列上的测试中,这个"平凡"的保形基线在一步预测中击败了NPTS家族的73%的序列和已发表的Conformal Seasonal Pools方法的71%的序列。更关键的是其校准质量:在六个数据集上,平凡保形区间在名义95%下的实际覆盖率是84-85%,而训练过的神经预测器DeepNPTS只有66%。

这一发现对因果预测的启示是深远的:因果预测的价值主张是"更好的可迁移性和可干预性",而非"更好的精度"。 如果因果预测模型在精度上不能超越甚至不能匹配简单的保形基线,那么它的价值必须通过反事实预测的质量和分布偏移下的稳健性来证明------而这两者恰恰是当前评估体系中最难量化的维度。

5.4 从"因果预测"到"因果-informed预测":一个务实的中间道路

面对可识别性的根本挑战,一个务实的立场是:不宣称完全的因果识别,而是利用因果结构作为归纳偏置来改进预测的稳健性和可解释性。 Caformer的后门调整、ARCausal的因果掩码、Mask2Cause的结构约束------这些技术的贡献不在于"证明了因果关系",而在于用因果假设约束了模型的假设空间,从而在分布偏移下获得更稳健的泛化。

这条中间道路的哲学基础是因果结构的认识论谦逊:我们不需要证明我们的因果图是"正确的",我们只需要它比无约束的统计模型更接近正确。在大多数现实场景中,这个弱条件是可以满足的------领域知识(物理定律、经济机制、生物约束)提供了强有力的因果先验,即使这些先验在细节上不完美,它们在结构层面上的约束力也远强于纯粹的统计学习。

六、结语

预测科学的因果转向标志着这门学科正在从"预测精度竞赛"走向"预测认知深度"的追求。Caformer用后门调整剥离环境混杂,DoFlow用生成式建模统一观测、干预与反事实预测,EpiNode用机制模型约束神经ODE------这些工作的共同目标不是让预测更"准",而是让预测更"真":更接近产生数据的真实机制,更能够在分布变化时保持稳健,更能够回答决策者真正关心的问题。

但这一转向也暴露了预测科学的一个深层困境。因果推断的可识别性要求------无未观测混杂------在复杂的社会-技术-生态系统中几乎不可能被严格满足。这意味着因果预测的"因果"标签需要被谨慎对待:它更准确地说是"因果-informed"的预测,即用因果假设约束的统计预测,而非从数据中"读出"因果真理。在这一认识下,因果预测的前沿不在于宣称"我们找到了因果",而在于诚实地界定因果假设的适用范围,并用保形预测等工具为因果结论加上统计护栏。

预测的终极理想或许不是"知道未来",而是"理解系统,从而在不确定性中做出更好的决策"。因果预测是通向这一理想的一条道路------不是唯一的道路,但是一条迫使我们对"理解"本身保持诚实和警觉的道路。

参考文献

1 Zhang K, Zou X, Yen G G, et al. Caformer: Rethinking Time-Series Forecasting From Causal PerspectiveJ. IEEE Transactions on Cybernetics, 2026, 56(3): 1611-1624.

2 Zhou C, et al. Causal Mask in Transformer via Transfer Entropy Estimation from Vector Autoregressive Learning for Multivariate Time Series ForecastingJ. International Journal of Neural Systems, 2026.

3 Mask2Cause: Causal Discovery via Adjacency Constrained Causal AttentionC. 2026.

4 Cui Z. Causal-LLM: towards predictive and interpretable spatiotemporal foundation modelsC. AAAI, 2026.

5 DoFlow: Flow-based Generative Models for Interventional and Counterfactual Forecasting on Time SeriesC. ICLR, 2026.

6 Su Y, Lee R, Cui J, et al. How (Not) to Hybridize Neural and Mechanistic Models for Epidemiological ForecastingC. ICML, 2026.

7 Thumm D, Wiedemann R, Chen Y. Towards Continuous-time Causal Foundation ModelsJ. arXiv:2605.28880, 2026.

8 Probabilistic Causal Foundation Model (PCFM)C. Big Data Analytics and Knowledge Discovery, 2026.

9 Causal inference and machine learning in power and energy systems: A review of assumptions, applications and opportunitiesJ. Energy and AI, 2026, 25: 100774.

10 Report the Floor: A Training-Free Conformal Interval Is a Mandatory Baseline for Probabilistic Time-Series ForecastingJ. Zenodo, 2026.

11 Augur: Modeling Covariate Causal Associations in Time Series via Large Language ModelsC. ACL, 2026.

相关推荐
2601_956319882 小时前
用示例和练习,把量化规则先练清楚
人工智能·python
TDengine (老段)2 小时前
TDgpt 使用 — 部署、SQL、算法
大数据·数据库·sql·算法·时序数据库·tdengine·涛思数据
Behaviour2 小时前
ChatGPT Images2.5 全面开放
人工智能·chatgpt
智能运维指南2 小时前
2026年企业自动化运维选型:从场景反推架构,四类产品的边界在哪
运维·架构·自动化
墨染天姬2 小时前
[AI] 递归自我改进(RSI):从思想实验到实证子领域
人工智能
宣宣猪的小花园.2 小时前
【嵌入式】故障与降级:看门狗、保护机制和工程可靠性的底线
开发语言·人工智能·嵌入式硬件·机器学习
不会就选b2 小时前
数据结构之树&&二叉树(四)
数据结构·算法
运筹说2 小时前
运筹说 第160期 | 大模型如何“思考”? Transformer架构图解
人工智能·深度学习·transformer
pjj198542 小时前
深度学习-训练,评估与数据增强
人工智能·深度学习·机器学习