2025至2026年,销量预测领域经历了从"模型精度竞赛"到"系统能力建设"的深刻转型。本文从系统融合的视角,系统梳理了这一时期的六个核心方向:(1)时序基础模型的规模化验证与适用边界------Toto 2.0验证了规模化定律,Timer-S1将MoE架构引入时序领域,但快速商业场景的实证揭示了基础模型在高周转商品与间歇性需求段之间的显著性能分化;(2)Mamba架构从单一模型演变为多尺度、图增强、分解对齐、延迟感知的专业化变体生态系统;(3)间歇性需求预测的两阶段XGBoost框架被验证为最强方案,元学习为冷启动场景提供了新路径;(4)LLM事件推理与数值预测的协同机制,EventCast证明了"LLM用于事件推理而非数值预测"的设计原则;(5)概念漂移应对从被动检测演进为主动适应,ShifTS与DynaME分别代表了方法无关框架与双轨专家策略;(6)预测区间校准的工业化,共形预测凭借分布自由的有限样本覆盖保证成为最可靠的方案。研究发现,领域共识正在从"寻找单一最优模型"转向"为不同问题匹配合适的工具组合"。
关键词:销量预测、时序基础模型、Mamba、间歇性需求、大语言模型、概念漂移、预测区间校准
1 引言
销量预测是零售供应链优化、库存管理和采购计划的核心技术。2025至2026年间,该领域经历了从"模型竞赛"到"系统融合"的深刻转型。时序基础模型(Time Series Foundation Models, TSFMs)的崛起验证了规模化定律;Mamba架构以线性复杂度挑战Transformer的平方复杂度;扩散模型为概率预测提供了新工具;大语言模型与预测系统的融合开辟了从"数值预测"到"事件推理"的新范式;概念漂移应对从被动检测演进为主动适应;预测区间校准为风险感知决策提供了理论基础。
然而,这些技术的适用边界正在被重新审视。一项针对快速商业需求的系统研究发现,TimesFM在整体精度上排名第一,但其优势集中高周转商品;在占SKU多数的间歇性需求段中,最优模型随评估指标而变化。另一项涵盖约150篇论文、800余行定量结果的元分析发现,基础模型在分布性指标上的优势最强,在点预测指标上则相对较小。
这些发现指向一个核心命题:销量预测的技术选择,已不再是"哪个模型最好"的问题,而是"如何为不同需求模式匹配合适的工具"的问题。本文旨在系统梳理2025至2026年销量预测领域的关键进展,从六个核心方向提炼技术演进的内在逻辑,为研究者与从业者提供技术全景图与决策参考。
2 时序基础模型:规模化验证与适用边界
2.1 规模化定律的验证
2026年,时序基础模型领域的两项工作确立了该领域的基本格局。Toto 2.0验证了时间序列基础模型遵循规模化定律------从400万到25亿参数,单一训练配方持续产生可靠的预测质量提升。其技术突破包括连续块掩码(替代自回归解码,实现单次并行预测)和分位数输出头(替代Student-T混合,提升大规模稳定性)。值得注意的是,Toto 2.0在预训练阶段完全基于可观测性指标和合成数据训练,却在通用基准上领先------这证明了合成数据在时序预训练中的巨大潜力。
Timer-S1则将混合专家(MoE)架构引入时序基础模型,总参数达83亿,每个token激活7.5亿参数,上下文长度达11.5K。其核心创新在于"串行缩放"的三个维度:集成稀疏TimeMoE块和通用TimeSTP块的模型架构、含一万亿时间点的TimeBench语料库、以及包含持续预训练和长上下文扩展的训练流程。Timer-S1的意义在于证明了MoE架构在时序领域的可行性。
2.2 多任务统一与能力拓展
TSFM的能力正在从单一的"预测"向多任务统一扩展。TS-ICL将预测和插值(imputation)统一为timestamp-aligned regression,通过上下文学习机制在合成数据上训练,在插值任务上达到SOTA,同时在预测任务上与领先TSFM保持竞争力。Falcon-X将变量解耦并映射到统一的潜在原型空间,通过统一原型差异注意力机制显式评估正负语义亲和性,解决了异构多变量建模问题。GraFT通过构建异构图谱关系图(静态边表示通用时序原则,动态自适应边表示实例特定模式),将关系先验系统地嵌入预训练骨干网络,在八个标准基准上实现了平均MSE降低14.4% 的SOTA性能。
2.3 适用边界:来自快速商业与元分析的实证
基础模型的优势并非无条件成立。针对快速商业微履行中心的研究,使用超过25,000个SKU的三年日度数据,在SBC需求分类框架下系统评估了TimesFM、Chronos-Bolt与八个基准模型。关键发现:TimesFM在池化精度上排名第一,证明基础模型在无需微调的情况下即可具有竞争力。然而,这一优势集中高周转商品;在占SKU多数的间歇性需求段中,最优模型随评估指标而变化。
一项PRISMA-informed的系统综述,筛查了2020至2026年间约150篇论文,提取了超过800行定量结果。模型层面的元回归分析发现:基础模型在分布性指标上的优势最强,在点预测指标上则相对较小。核心启示:基础模型更适合概率性决策支持(如库存风险分析),而非单纯的点预测精度竞赛。
3 Mamba架构:从单一模型到专业化变体生态系统
2026年,Mamba架构已从单一模型演变为一个包含多种专业化变体的生态系统。一篇系统性综述从模型、任务、数据和应用四个正交视角对Mamba在时序分析中的应用进行了全面梳理,从模型视角形式化了五轴设计空间------tokenization、通道策略、方向扫描、混合化和分解。
3.1 多尺度处理:ms-Mamba
现有架构通常在单一时间尺度上处理输入,而时序数据往往包含日、周、月等多个尺度的信号。ms-Mamba通过使用多个不同采样率的Mamba块同时处理多个时间尺度。对销量预测的启示:畅销品与长尾品的时间尺度需求截然不同------畅销品关注日度/周度模式,长尾品可能关注月度/季度模式。多尺度Mamba为这种差异化需求提供了统一的架构基础。
3.2 图增强的时空建模:G-Mamba
Mamba将多变量预测纯粹视为序列任务,未能充分利用变量间的结构关系。G-Mamba通过图条件的选择性状态更新,将邻域上下文注入状态演化,通过静态拓扑锚定学习和数据驱动的动态邻接补充,减少时间动态与结构表示之间的干扰。对销量预测的启示:品类内替代效应、品类间互补效应、门店间空间关联------这些结构关系是销量预测的天然先验。
3.3 分解增强的对齐:DMamba
现有Mamba架构在处理非平稳模式的数据集时存在困难。DMamba的出发点是:趋势分量和季节性分量中变量间关系的统计性质根本不同。趋势关系由少数共同随机因子驱动,位于低维流形;季节性关系涉及动态、高维的交互。DMamba的策略是显式对齐架构复杂度与分量特征:变量方向Mamba编码器捕获季节性分量中丰富的跨变量动态,简单MLP学习趋势分量中的低维关系。核心启示:不是所有分量都需要复杂建模------将模型复杂度精准匹配数据复杂度,比盲目堆叠参数更有效。
3.4 延迟感知的双路径建模:DeMa
DeMa针对Mamba的三个关键局限:缺乏显式跨变量建模、难以解缠序列内时间动态与序列间交互、潜在时滞交互效应建模不足。DeMa提出了双路径架构:时间路径(Mamba-SSD模块)捕获每个独立序列内的长程动态;变量路径(Mamba-DALA模块)集成延迟感知线性注意力,建模跨变量依赖。对销量预测的启示:促销传播、替代效应和供应链延迟本质上都是"时滞交互" ------DeMa的延迟感知机制为这类问题提供了专门的建模工具。
4 间歇性需求预测:从两阶段XGBoost到元学习框架
间歇性销售模式------由大量零值和偶发的正值组成------在快时尚零售中普遍存在,对传统预测方法构成严峻挑战。
4.1 两阶段XGBoost:被验证的最强方案
Yılmaz Sucuoğlu等人在快时尚零售间歇性销售数据上,系统对比了一阶段与两阶段机器学习框架及经典基准(Croston、SBA)。两阶段方法的核心是将预测任务分解为两个独立的子任务:第一阶段使用随机森林分类器预测"需求是否发生",第二阶段使用回归模型(RF、GBM、XGBoost、LightGBM)估计"需求大小"。研究纳入了产品属性、定价、天气和特殊事件等丰富外生特征。
结论:Two-Stage XGBoost取得了最低的WRMSSE,确立了特征工程化的两阶段框架作为间歇性零售场景中最强整体方案。两阶段框架的独特优势在于:SHAP分析可以分别揭示特征对"需求发生"与"需求大小"的不同贡献。
4.2 元学习:冷启动场景的突破路径
间歇性需求的核心困境是数据稀疏性------新品上市初期可能仅有数天观测数据。元学习(Meta-Learning),即"学会学习",为此提供了系统的技术路径。其核心思想是:在多个预测任务(每个商品构成一个任务)上训练,使模型学会提取跨任务的通用知识。当新商品出现时,模型可利用已习得的元知识,从极少量样本中快速适应。
动态异构图学习与任务条件化元学习框架,将产品-门店-时间图作为前置关系上下文,通过任务条件化元学习从有限的支持观测中快速适应预测模型。在k=1的极端少样本设置下实现了低至0.1269的MAE,单SKU在线适应时间仅2.8ms。元学习的理论优势在于显式的跨任务知识迁移------当元训练任务与目标任务的SBC类别匹配时,元学习在极度稀疏的数据条件下可能优于依赖大规模预训练的基础模型。
5 LLM事件推理与数值预测的协同机制
2025至2026年,LLM与销量预测的融合取得了突破性进展。EventCast框架首次系统性地验证了LLM在需求预测中的工业价值。
5.1 EventCast:模块化的事件驱动预测
EventCast提出了一个模块化预测框架:LLM仅用于事件驱动的推理,非结构化业务数据(促销活动、假日安排、卖家激励)经LLM处理转化为可解释的文本摘要,再与历史需求特征在双塔架构中融合。在跨越4个国家160个地区的真实电商场景中部署10个月后,EventCast在事件驱动期间相比最优工业基线实现了MAE降低57.0%,MSE降低83.3%。
EventCast的关键设计原则是关注点分离:LLM处理其擅长的事务(理解复杂事件描述、推理业务上下文、生成结构化语义摘要),专用预测模块处理数值预测。这一设计避免了直接LLM预测方法中困扰系统的阻抗失配问题。EventCast证明了LLM在销量预测中的最佳角色是"事件理解器"而非"数值预测器"。
5.2 三种LLM融合范式
2026年,LLM与时间序列的融合从"特征提取"走向了"深度集成",形成了三种不同的融合范式:
范式一:外生变量深度集成(ExoTimer) 。通过Exo-Aware内源编码器动态融合外生变量信息,多属性提示嵌入模块将异构时间特征转换为LLM可解释的文本提示。LLM不再是被动的特征提取器,而是主动的"语义理解器"------将外部知识(如促销文案、市场评论)与数值时序深度融合。
范式二:自回归推理激活(LAMP) 。通过动态提示检索和自回归推理利用冻结的预训练LLM,证明LLM的自回归能力不是需要"克服"的局限,而是可以"利用"的优势。
范式三:因果语义对齐。将因果推断引入LLM-based时序预测,使LLM不仅学习时间序列中的相关模式,还能识别和利用变量间的因果结构。这为销量预测中的"促销究竟有没有用"这类因果问题提供了新的技术路径。
6 概念漂移:从被动检测到主动适应
概念漂移------数据分布随时间的动态变化------是销量预测从实验室走向生产环境时最隐蔽的杀手。据McKinsey分析,模型漂移是AI项目难以在企业中规模化落地的核心原因之一。
6.1 概念漂移的多维分类体系
2025至2026年,概念漂移的分类从传统单一维度扩展为多维度体系。
时序漂移 vs 概念漂移(ShifTS框架) :ICLR 2026收录的ShifTS框架首次明确区分了时序漂移(Temporal Shift) ------边缘分布随时间变化但条件分布不变,与概念漂移(Concept Drift) ------条件分布本身发生变化。ShifTS的策略是先治时序漂移、再治概念漂移,通过软注意力机制从回看窗与预测窗中提取稳定的不变模式。
宏观漂移 vs 微观漂移(LEAF框架) :宏观漂移是稳定的长期变化(如品类因社交媒体种草需求持续上升),微观漂移是突发的短期波动(如周年庆活动销量暴增但仅持续两天)。LEAF采用两阶段元学习架构分别应对两类漂移。
周期性漂移 vs 突发性漂移(DynaME框架) :周期性漂移(Recurring Drift) 是历史中出现过的模式再次出现,突发性漂移(Emergent Drift) 是全新的、从未出现过的模式。DynaME采用双轨策略:针对周期性漂移维护多专家委员会,针对突发性漂移调用通用专家。
6.2 适应策略的匹配理论
不同漂移类型需要差异化的适应策略。宏观漂移的最佳策略是定期重训------捕捉长期趋势;微观漂移的最佳策略是在线学习------快速响应短期波动;周期漂移的最佳策略是多专家集成(专家委员会)------记忆并复用历史模式;突发漂移的最佳策略是多专家集成(通用专家)------依赖强泛化能力。
核心理论命题:概念漂移的应对不应采用"一刀切"的策略,而应根据漂移的类型特征选择差异化的适应策略。
6.3 理论界限
概念漂移的理论研究揭示了一个重要界限:在概念漂移的情况下,任何在线学习器的泛化误差下限取决于漂移速率,而非单纯的数据量。这意味着当环境变化太快时,再多的数据也无法弥补------这一定理为自适应预测系统的能力设定了根本性的上限。
7 预测区间校准:从点预测到风险感知决策
预测区间的校准与不确定性量化是销量预测从"点预测"走向"风险感知决策"的关键一步。
7.1 三种概率预测方法的对比
分位数回归虽然能产生最尖锐的区间(最窄),但系统性欠校准------实际覆盖率显著偏离名义置信水平。其优势在于区间锐度,代价是覆盖率的不可靠性。
扩散模型在2025至2026年间被引入时间序列概率预测,在高度噪声和随机数据集上展现出鲁棒性优势。然而,针对沃尔玛周度销售数据的基准测试发现,扩散式生成模型不适合结构化表格-时序数据,因为其缺乏高维潜在变异性。
共形预测凭借分布自由的有限样本覆盖保证,提供了理论上有保障的预测区间。CoRAL-RF在M5数据集上实现了90%区间覆盖率0.923。HSML-CP在WTI数据集上实现了97.80%的预测区间覆盖率。LightGBM在Kaggle Store Sales数据集上交付了校准良好的80%预测区间(覆盖率=79.8%)。
核心结论:在零售销量预测场景中,共形预测是目前最可靠的概率预测方案。
7.2 区间校准质量的评估框架
传统的PICP(预测区间覆盖概率)和MPIW(平均预测区间宽度)存在显著局限------PICP只关注"是否覆盖",忽略了覆盖的均匀性;MPIW只关注"多宽",忽略了宽度与覆盖率之间的权衡。本文提出"区间校准质量"的四维评估框架:边际可靠性(覆盖率与名义水平的偏差)、条件校准(不同特征条件下的覆盖率稳定性)、锐度-可靠性权衡(CWC覆盖宽度准则)、嵌套一致性(更高置信水平的区间是否包含更低水平的区间)。
7.3 轻量级后处理校准器
基于共形预测的理论保证,可设计模型无关的"后处理校准器" ------在任意点预测模型上叠加轻量级校准模块,输出校准良好的预测区间。其核心设计是:在标定集上计算预测残差的分位数,构建预测区间。这一设计的部署成本显著低于从头训练概率模型------仅需标定集上的少量计算,无需重新训练,使其成为工业化部署的理想选择。
8 结论与展望
2025至2026年,销量预测领域形成了六个核心共识:
第一,时序基础模型已成熟但需选择性部署。 Toto 2.0验证了规模化定律,Timer-S1将MoE架构引入时序领域。但快速商业场景的实证表明,基础模型的优势集中高周转商品,在间歇性需求段中性能随指标变化。基础模型应根据需求模式选择性部署,而非统一应用。
第二,Mamba已从单一架构演变为专业化变体生态系统。 多尺度(ms-Mamba)、图增强(G-Mamba)、分解对齐(DMamba)、延迟感知(DeMa)等变体从不同维度深化了状态空间模型的能力边界。
第三,两阶段XGBoost是间歇性零售场景中被验证的最强方案,SHAP分析可分别揭示特征对"需求发生"与"需求大小"的不同贡献。元学习为冷启动场景提供了少样本快速适应的新路径。
第四,LLM在预测中的最佳角色是"事件推理"而非"数值预测" 。EventCast在事件驱动期间实现了MAE降低57.0%。ExoTimer、LAMP和因果语义对齐代表了三种不同的融合范式。
第五,概念漂移应对正在从"被动检测"演进为"主动适应" 。ShifTS区分了时序漂移与概念漂移,DynaME区分了周期性漂移与突发性漂移。策略与漂移类型的精准匹配,是自适应预测系统设计的核心原则。
第六,共形预测是零售场景中最可靠的概率预测方案,分布自由的有限样本覆盖保证使其成为预测区间校准的工业化首选。
面向未来,销量预测的技术演进将围绕三个方向展开:(1)基础模型的轻量化与领域适配------Kairos和Reverso已指明方向;(2)Mamba与扩散模型的深度融合------将线性效率与概率生成能力结合;(3)从"预测数值"走向"理解业务" ------LLM的事件推理能力与数值预测的深度集成。
销量预测的技术选择,已不再是"哪个模型更好"的问题,而是"如何为你的业务场景设计最合适的模型组合"的问题。2025至2026年的工具箱前所未有的丰富,而真正的挑战在于如何将它们组合成一个可持续运转的系统。