销量预测是零售供应链优化的核心任务。2025至2026年间,该领域经历了从"模型竞赛"到"系统融合"的深刻转型。本文系统梳理了这一时期的学术进展与工业实践,从四个维度展开分析:(1)时序基础模型(TSFM)的规模化验证与适用边界------Toto 2.0验证了规模化定律,Timer-S1将MoE架构引入时序领域,而针对快速商业场景的实证则揭示了基础模型在高周转商品与间歇性需求段之间的显著性能分化;(2)Mamba架构从单一模型演变为多尺度、图增强、分解对齐的专业化变体生态系统;(3)扩散模型在点预测与概率预测之间找到平衡,TS-DiT与SimDiff代表了两种互补的技术路线;(4)LLM与时间序列的融合从特征提取走向深度集成,EventCast与ExoTimer提供了不同的融合范式;(5)概念漂移应对从被动检测演进为主动适应,ShifTS与DynaME分别代表了方法无关框架与双轨专家策略。研究发现,领域共识正在从"寻找单一最优模型"转向"为不同问题匹配合适的工具组合"。本文进一步提出了面向零售场景的预测系统架构蓝图,并讨论了未来研究方向。
关键词:销量预测、时序基础模型、Mamba、扩散模型、大语言模型、概念漂移
1 引言
准确的销量预测是零售企业优化库存、降低运营成本、提升客户满意度的关键能力。然而,真实零售场景中的销量数据面临多重挑战:间歇性需求模式、大量缺失值、频繁的商品更替以及促销与节假日等复杂外部因素的持续干扰。传统统计模型在捕捉现代零售复杂性方面力不从心,而机器学习与深度学习的进展为这一领域提供了新的机遇。
2025至2026年间,销量预测领域经历了从"模型竞赛"到"系统融合"的深刻转型。时序基础模型(Time Series Foundation Models, TSFMs)的崛起验证了规模化定律;Mamba架构以线性复杂度挑战Transformer的平方复杂度;扩散模型为概率预测提供了新工具;大语言模型(LLM)与预测系统的融合开辟了从"数值预测"到"事件推理"的新范式。
然而,这些技术的适用边界正在被重新审视。一项针对快速商业(Quick-Commerce)需求的系统研究发现,TimesFM在整体精度上排名第一,但其优势集中高周转商品;在占SKU多数的间歇性需求段中,最优模型随评估指标而变化。另一项涵盖约150篇论文、800余行定量结果的元分析发现,基础模型在分布性指标上的优势最强,在点预测指标上则相对较小。
这些发现指向一个核心命题:销量预测的技术选择,已不再是"哪个模型最好"的问题,而是"如何为不同需求模式匹配合适的工具"的问题。本文旨在系统梳理2025至2026年销量预测领域的关键进展,为研究者与从业者提供技术全景图与决策参考。
2 时序基础模型:规模化验证与适用边界
2.1 规模化定律的验证
2026年,时序基础模型领域的两项工作确立了该领域的基本格局。
Toto 2.0验证了时间序列基础模型遵循规模化定律------从400万到25亿参数,单一训练配方持续产生可靠的预测质量提升。其技术突破包括连续块掩码(替代自回归解码,实现单次并行预测)和分位数输出头(替代Student-T混合,提升大规模稳定性)。值得注意的是,Toto 2.0在预训练阶段完全基于可观测性指标和合成数据训练,却在通用基准上领先,这证明了合成数据在时序预训练中的巨大潜力。
Timer-S1则将混合专家(MoE)架构引入时序基础模型,总参数达83亿,每个token激活7.5亿参数,上下文长度达11.5K。其核心创新在于"串行缩放"的三个维度:集成稀疏TimeMoE块和通用TimeSTP块的模型架构、含一万亿时间点的TimeBench语料库、以及包含持续预训练和长上下文扩展的训练流程。Timer-S1的意义在于证明了MoE架构在时序领域的可行性------通过稀疏激活,用较少的激活参数实现了超大模型的建模能力。
2.2 基础模型的适用边界:来自快速商业的实证
一项针对快速商业微履行中心(MFC)的研究,使用超过25,000个SKU的三年日度销售数据,在Syntetos-Boylan-Croston框架下将需求分为Smooth、Erratic、Intermittent和Lumpy四类。研究者比较了TimesFM、Chronos-Bolt与八个基准模型,在12轮滚动起点上评估。
关键发现:TimesFM在池化精度上排名第一,证明基础模型在无需微调的情况下即可具有竞争力。然而,这一优势集中高周转商品;在占SKU多数的间歇性需求段中,最优模型随评估指标而变化。结论是:基础模型应根据需求模式和运营目标选择性部署,而非统一应用。
2.3 基础模型优势的系统性量化
一项PRISMA-informed的系统综述,筛查了2020至2026年间约150篇论文,提取了超过800行定量结果,涵盖九个零售数据集。模型层面的元回归分析(基于543对基础模型与传统基线的配对比较)发现:基础模型在分布性指标上的优势最强,在点预测指标上则相对较小。
核心启示:基础模型更适合概率性决策支持(如库存风险分析),而非单纯的点预测精度竞赛。如果你的业务场景需要的是"最可能的销量数字",传统方法可能仍然足够;但如果需要"销量落在什么范围内的概率是多少",基础模型的优势才能充分体现。
3 Mamba架构:从单一模型到专业化变体生态系统
2026年,Mamba架构已从单一模型演变为一个包含多种专业化变体的生态系统。一篇系统性综述从模型、任务、数据和应用四个正交视角对Mamba在时序分析中的应用进行了全面梳理,从模型视角形式化了五轴设计空间------tokenization、通道策略、方向扫描、混合化和分解。Mamba-based时序模型已覆盖预测、异常检测、插补、分类和统一多任务分析等所有典型时序分析任务。
3.1 多尺度处理:ms-Mamba
现有架构通常在单一时间尺度上处理输入,而时序数据(如销量)往往包含日、周、月等多个尺度的信号。ms-Mamba通过使用多个不同采样率的Mamba块同时处理多个时间尺度。在Solar-Energy数据集上,ms-Mamba以更少的参数、更少的内存和更少的计算量超越了S-Mamba。
对销量预测的启示:畅销品与长尾品的时间尺度需求截然不同------畅销品关注日度/周度模式,长尾品可能关注月度/季度模式。多尺度Mamba为这种差异化需求提供了统一的架构基础。
3.2 分解增强的对齐:DMamba
现有Mamba架构在处理非平稳模式的数据集时存在困难。DMamba的出发点是:趋势分量和季节性分量中变量间关系的统计性质根本不同。趋势关系由少数共同随机因子驱动,位于低维流形;季节性关系涉及动态、高维的交互。
DMamba的策略是显式对齐架构复杂度与分量特征:变量方向Mamba编码器捕获季节性分量中丰富的跨变量动态,简单MLP学习趋势分量中的低维关系。核心启示:不是所有分量都需要复杂建模------将模型复杂度精准匹配数据复杂度,比盲目堆叠参数更有效。
3.3 双路径延迟感知:DeMa
多变量时间序列分析中,Mamba面临三个关键局限:缺乏显式跨变量建模、难以解缠序列内时间动态与序列间交互、潜在时滞交互效应建模不足。DeMa提出了双路径架构:时间路径(Mamba-SSD模块)捕获每个独立序列内的长程动态;变量路径(Mamba-DALA模块)集成延迟感知线性注意力,建模跨变量依赖。
对销量预测的启示:促销传播、替代效应和供应链延迟本质上都是"时滞交互"------DeMa的延迟感知机制为这类问题提供了专门的建模工具。
3.4 Mamba架构的工程实践
从工程角度看,Mamba架构继承了RNN的训练速度慢和Transformer的二次复杂度的双重局限,通过选择性信息保留和高效计算,尤其适用于长序列处理。Mamba在时序领域的应用已形成三种主要架构模式:纯Mamba作为编码器、双向或多方向扫描、以及与注意力/MLP/信号处理前端结合的混合设计。
4 扩散模型:点预测与概率预测的平衡
2026年,扩散模型在时间序列预测中经历了从"概率专用"到"点预测竞争力"的演进。
4.1 TS-DiT:生成式扩散Transformer
TS-DiT将Transformer与扩散模型结合,专为长周期时间序列预测设计。其技术特点包括自适应归一化注意力、内部渐进分解和简化的条件机制。在八个基准模型上实现了平均7.1%的预测误差降低,同时在高度随机数据上保持了鲁棒性。TS-DiT证明了扩散模型在高度噪声和随机数据集上的优势。
4.2 SimDiff:更简单的点预测扩散模型
扩散模型在点估计性能上往往落后于回归方法。SimDiff提出了一个单阶段、端到端的框架,用一个统一的Transformer网络同时充当去噪器和预测器。通过多次推理集成利用内在输出多样性、改进均方误差精度,SimDiff在点预测上显著超越了现有方法。
4.3 EADiff:能量自适应扩散
EADiff指出,现有扩散模型对所有频率分量采用统一腐蚀速率,忽略了一个事实:时间序列的不同频率分量具有不同的能量水平。EADiff在小波域中提出了能量自适应的扩散框架,以解决这种频率-能量不平衡。
4.4 扩散模型在零售场景的适用性
值得注意的是,针对沃尔玛周度销售数据的基准测试发现,扩散式生成模型不适合该数据集的结构化表格-时序特性,因为其缺乏高维潜在变异性。这一发现至关重要:扩散模型擅长处理高维、非结构化的生成任务,但在结构化表格-时序数据上可能并不天然适配。零售销量数据本质上更接近"结构化表格"而非"高维潜在空间"------这一特性决定了扩散模型在零售预测中的适用性需要谨慎评估。
5 LLM与时间序列的深度融合
2026年,LLM与时间序列预测的融合从"特征提取"走向了"深度集成"。一篇系统性文献综述(SLR)遵循PRISMA指南,筛选了78项研究进行深入分析。
5.1 EventCast:事件驱动的模块化预测
EventCast提出了一个模块化预测框架:LLM仅用于事件驱动的推理,非结构化业务数据(促销活动、假日安排、卖家激励)经LLM处理转化为可解释的文本摘要,再与历史需求特征在双塔架构中融合。在4个国家160个地区的真实电商场景中部署10个月后,相比最优工业基线,事件驱动期间MAE降低57.0%,MSE降低83.3%。
EventCast证明了LLM在销量预测中的最佳角色是"事件理解器"而非"数值预测器" ------让LLM理解"发生了什么事件",让时序模型负责"预测数字是多少"。
5.2 ExoTimer:外生变量的深度集成
ExoTimer提出了一种深度集成LLM的框架:Exo-Aware内源编码器动态融合外生变量信息;多属性提示嵌入模块将异构时间特征、上下文信息和任务规范转换为LLM可解释的文本提示。在12个真实世界数据集上,ExoTimer在少样本和零样本场景中均达到SOTA性能。
ExoTimer代表的方向是:LLM不再是被动的特征提取器,而是主动的"语义理解器" ------将外部知识(如促销文案、市场评论)与数值时序深度融合。
5.3 LLM-TSF的系统性分类
2026年的系统性综述将LLM在时序预测中的作用归纳为三种主要类型,并进一步抽象了其统一工作流。研究者指出,LLM-TSF的研究正在从"能否用"走向"如何用得好"------包括架构设计、数据集构建、评估指标和部署实践的全面规范化。
6 概念漂移:从被动检测到主动适应
概念漂移------数据分布随时间的动态变化------是销量预测从实验室走向生产环境时最隐蔽的杀手。
6.1 概念漂移的重新定义
ICLR 2026收录的ShifTS框架,将分布偏移拆解为两类:
· 时序漂移(Temporal Shift) :边缘分布随时间变化,条件分布不变
· 概念漂移(Concept Drift) :条件分布本身随时间变化
ShifTS的策略是先治时序漂移、再治概念漂移,通过软注意力机制从回看窗与预测窗中提取稳定的不变模式。在多个数据集上,ShifTS一致性地提升了多种模型的预测精度。
6.2 周期性漂移与突发性漂移的双轨应对
DynaME将概念漂移重新定义为两种类型:
· 周期性漂移(Recurring Drift) :历史中出现过的模式再次出现
· 突发性漂移(Emergent Drift) :全新的、从未出现过的模式
DynaME采用双轨策略:针对周期性漂移,维护一个由多个专业专家组成的委员会,每个专家动态适配到当前时间步最相关的历史周期模式;针对突发性漂移,检测高不确定性场景,将预测任务转移给一个稳定、通用的专家。在多个基准数据集上,DynaME有效适应了两种概念漂移并显著超越了现有基线。
6.3 DeepBooTS:偏差-方差视角的理论突破
DeepBooTS从偏差-方差视角分析概念漂移,证明了加权集成可以在不增加偏差的情况下降低方差。基于这一理论洞察,DeepBooTS提出了一种端到端的双流残差递减提升方法。
6.4 周期性漂移的专门应对
Continuous Evolution Pool框架专门应对在线时序预测中的周期性概念漂移------底层数据生成过程在一小套状态间反复交替。该框架解决了在线时序预测中的两个核心挑战:缓解灾难性遗忘和在隐私约束下无法保留历史数据。
7 系统架构:从模型到平台
2026年,领先的零售预测实践已从"训练一个模型"演变为"构建一个平台"。Databricks提出的零售需求预测参考架构展示了现代预测系统的分层设计:
· 数据层:整合交易、促销、天气等多源数据
· 特征层:自动化特征工程与数据质量监控
· 模型层:多模型并行与动态路由
· 治理层:通过Unity Catalog实施安全、血缘和发现管理
一个成熟的预测系统应包含以下核心层次:
层次 功能 代表技术
零样本层 冷启动、新品预测 Toto 2.0 / Timer-S1
效率层 长序列、大规模预测 ms-Mamba / DeMa
概率层 不确定性量化 TS-DiT / SimDiff
事件层 业务事件理解 EventCast / ExoTimer
自适应层 概念漂移应对 ShifTS / DynaME
协调层 动态路由与集成 系统级编排
8 结论与展望
2025至2026年,销量预测领域形成了五个核心共识:
第一,时序基础模型已成熟但需选择性部署。 Toto 2.0验证了规模化定律,Timer-S1将MoE架构引入时序领域。但快速商业场景的实证表明,基础模型的优势集中高周转商品,在间歇性需求段中性能随指标变化。基础模型应根据需求模式选择性部署,而非统一应用。
第二,Mamba已从单一架构演变为专业化变体生态系统。 多尺度(ms-Mamba)、分解对齐(DMamba)、延迟感知(DeMa)等变体从不同维度深化了状态空间模型的能力边界。Mamba架构继承了O(L)线性复杂度,尤其适用于长序列处理。
第三,扩散模型在点预测与概率预测之间找到平衡。 TS-DiT实现了7.1%的平均误差降低,SimDiff证明了"更简单"可以"更好"。但扩散模型在结构化表格-时序数据上的适用性需谨慎评估。
第四,LLM在预测中的最佳角色是"事件推理"而非"数值预测"。 EventCast在事件驱动期间实现了MAE降低57.0%。LLM-TSF的研究正在从"能否用"走向"如何用得好"。
第五,概念漂移应对正在从"被动检测"演进为"主动适应"。 ShifTS区分了时序漂移与概念漂移,DynaME区分了周期性漂移与突发性漂移。共同方向是:让模型不仅"适应"变化,还能区分"变化发生在哪里"。
面向未来,销量预测的技术演进将围绕三个方向展开:(1)基础模型的轻量化与领域适配------降低部署门槛的同时提升在间歇性需求上的表现;(2)Mamba与扩散模型的深度融合------将线性效率与概率生成能力结合;(3)从"预测数值"走向"理解业务" ------LLM的事件推理能力与数值预测的深度集成。
销量预测的技术选择,已不再是"哪个模型更好"的问题,而是 "如何为你的业务场景设计最合适的模型组合" 的问题。2026年的工具箱前所未有的丰富,而真正的挑战在于如何将它们组合成一个可持续运转的系统。
参考文献
1 When Do Foundation Models Pay Off for Retail Demand Forecasting? A Systematic Review and Cross-Benchmark Meta-Analysis. Zenodo, 2026.
2 Kim, I., & Song, S. When Time-Series Foundation Models Work for Quick-Commerce Demand Forecasting. Journal of Industrial Distribution & Business, 17(3): 89-97, 2026.
3 Mamba for Time Series Analysis: A Contemporary Survey. Preprints, 2026.
4 Zhao, Z., Liu, H., & Prakash, B. A. Tackling Time-Series Forecasting Generalization via Mitigating Concept Drift. ICLR, 2026.
5 Hong, S., Chae, S., Kim, S., Jang, S., & Yu, H. Dynamic Multi-period Experts for Online Time Series Forecasting. In Proceedings of the ACM Web Conference (WWW), 2026.
6 DeepBooTS: Dual-Stream Residual Boosting for Drift-Resilient Time-Series Forecasting. AAAI, 2026.
7 TS-DiT: A diffusion transformer model for time series forecasting. ScienceDirect, 2026.
8 SimDiff: Simpler Yet Better Diffusion Model for Time Series Point Forecasting. AAAI, 2026.
9 EADiff: Energy-Adaptive Diffusion for Time Series Forecasting. ICML, 2026.
10 Continuous Evolution Pool: Taming Recurring Concept Drift in Online Time Series Forecasting. arXiv, 2026.
11 How do large language models bring disruptive change to time series forecasting? A survey and framework. Journal of Management Analytics, 13(1): 17-42, 2026.
12 Leveraging Large Language Models for time series forecasting: A systematic literature review. Knowledge-Based Systems, 343, 2026.
13 Databricks. Retail Demand Forecasting Reference Architecture. 2025.
14 A comprehensive survey of deep learning for time series forecasting: architectural diversity and open challenges. Artificial Intelligence Review, 2025.