****论文题目:****Mantis: Lightweight Foundation Model for Time Series Classification(时间序列分类的轻量级基础模型)
会议:ICLR 2026
****摘要:****虽然基础模型已经给各个领域带来了革命性的变化,但它们在时间序列分类中的应用仍然很少被探索,现有的文献主要集中在预测上。为了弥补这一差距,我们引入了Mantis,这是一个基于变压器的基础模型,通过自我监督的对比学习专门根据合成数据进行预训练。我们提出了一种新的令牌生成单元,证明了有效的令牌化是解锁变压器全部潜力的关键。此外,我们引入了一种增强的测试时间方法,通过利用中间层表示、自集成和跨模型嵌入融合,弥合了Mantis和强大的专业方法之间的性能差距。广泛的实验表明,Mantis建立了一种新的最先进的基础模型,在覆盖不同应用领域的四个不同的数据集集合中表现优于现有的基础模型。
Mantis:专为时间序列分类设计的轻量级基础模型
一、背景:时间序列基础模型的"分类盲区"
过去三年,时间序列基础模型(Time Series Foundation Models,TSFM)呈爆发式增长。然而翻阅文献会发现一个明显的失衡:几乎所有模型都在盯着预测(forecasting)任务,真正为分类(classification)量身定做的模型寥寥无几。
这个问题不是表面上的"分工不同"那么简单。预测任务和分类任务依赖的信号特征在本质上就不一样:
- 预测关注的是低频、全局趋势------明天股价会涨还是跌?
- 分类关注的是高频、局部模式------这段脑电信号是癫痫发作还是正常波?
把一个为预测设计的模型强行用于分类,就像用望远镜看显微镜下的东西,结构性劣势无法靠微调来弥补。
现有分类基础模型的另一个痛点是数据泄露。NuTime(目前最接近的对比工作)用189万条真实时间序列预训练,但这批数据与UCR/UEA等主流评测集存在重叠。在这种情况下报告的"零样本"性能,究竟有多少来自模型能力、有多少来自数据记忆,根本无法区分。
Mantis 正是为了解决这些问题而生的。
二、核心思路:三个互相配合的创新
Mantis 的设计围绕三个核心想法展开,彼此相互配合,缺一不可。
2.1 多视角 Token 生成器(Token Generator Unit)

【图2------Mantis整体架构图】
时间序列的分类任务需要同时捕捉三类信息:归一化后的局部形态 (用于判别类别差异)、一阶差分信息 (去除趋势干扰,强调瞬态变化)、原始幅度统计(保留物理量纲,提供绝对尺度线索)。
标准的单分支卷积 patch 方案只能得到其中一类,Mantis 专门设计了一个三分支并行结构:
分支 a:原始信号 patch 特征 先对输入做实例归一化(减去该样本自身的均值,除以标准差),然后用一个卷积层(kernel size 最优为 41)加均值池化,生成 32 个 patch 嵌入,每个维度 256。
分支 b:一阶差分 patch 特征 对相邻时间步做差分,得到一阶差分序列,再做完全相同的卷积+均值池化操作。这一路鼓励模型关注信号的"变化率",对平稳性更友好,能有效减少长期趋势的干扰。
分支 c:Patch 级统计编码 跳过归一化,直接在原始信号上划分 32 个不重叠 patch,对每个 patch 计算均值和标准差,通过 Multi-Scaled Scalar Encoder 编码成数值嵌入。这一路专门保留物理量纲信息。
三路输出拼接后,通过线性投影加 Layer Norm,输出 32 个维度为 256 的 token,送入 Transformer。

【图8------Token Generator Unit各分支消融结果】
消融实验清楚地证明每一路都有贡献:只用分支 a 的基线准确率为 0.7697;加上统计分支(分支 c)提升到 0.7740;加上差分分支(分支 b)进一步提升到 0.7808;三路完整方案达到 0.7880。值得注意的是,把分支 b 替换为"复制分支 a"的控制实验(排除参数量增加的影响)准确率只有 0.7744,证明提升确实来自差分信息本身而非模型容量。
为什么固定 token 数而不固定 patch 长度? Self-attention 的计算复杂度与 token 数的平方成正比。固定 patch 长度意味着长序列会产生大量 token,推理代价随序列长度急剧膨胀;而固定 token 数(32个)则将 attention 的计算量控制为常数,对部署场景更友好。
2.2 合成数据上的对比学习预训练
为什么用合成数据?
真实世界数据存在两个根本缺陷:
- 数据泄露:公开数据集往往已经进入了 UCR、UEA 等评测基准,用它们预训练的模型在评测时有"作弊"嫌疑。
- 多样性受限:真实采集的数据受采集场景、设备、协议约束,分布相对集中。
Mantis 使用 CauKer 生成的合成时间序列预训练,天然规避泄露,且可以无限扩展数据多样性。

【表7------不同预训练数据集对比结果】
消融实验证明:10万条合成数据超过了10万条真实数据(0.7881 vs 0.7829),接近使用189万条真实数据的 NuTime 语料效果(0.7921)。这背后的原理在于:对比学习的 InfoNCE 目标函数天然追求表示的均匀分布(uniformity),而实现均匀分布需要极高的数据多样性------这恰恰是合成数据的强项。
对比损失,而不是重建损失
预测模型通常用 masked autoencoder 或 decoder-only 等重建范式预训练。Mantis 对这三种方案做了比较:

【表9------不同预训练范式对比】
对比学习(InfoNCE)UCR 准确率 0.788,远超 Masked Autoencoder(0.716)和 Decoder-only(0.707)。作者认为这与架构设计有关:Mantis 的 Token Generator Unit 对分辨局部模式做了优化,天然更适合判别性对比目标,而非重建目标。
数据增强:Random Crop Resize(RCR)

【图3------RCR增强示意图】
增强策略的选择同样经过系统比较:

【表11------不同增强策略对比】
RCR(0.788)显著优于加白噪声(0.751)、傅里叶变换代理(0.768)和随机掩码(0.698)。RCR 随机裁剪 0%~20% 的序列片段再还原到原始长度,鼓励编码器对时间轴的小幅拉伸和压缩保持不变性,同时保留全局时序结构------这也为测试时的多尺度插值集成打下了基础。
2.3 测试时增强特征提取(Enhanced Test-Time Feature Extraction)
预训练完成后,编码器权重完全冻结,不参与任何下游微调。但 Mantis 在这个"零样本"框架内引入了四项测试时优化策略,逐步逼近有监督方法的性能上限。
策略一:中间层表示优于最终层

【图11------不同预训练数据量下各层性能随训练轮次的变化曲线】
这是本文最有意思的发现之一。直觉上,越靠近输出的层应该越"精炼"。但实验显示恰恰相反:随着预训练数据量增加,最终层性能趋于饱和甚至下降,而中间层性能持续单调提升。
原因在于:经过大量训练更新后,最终层开始过拟合 InfoNCE 对比目标本身,而不是泛化性的特征表示。中间层则更像是"通用特征提取器",越训练越有效。

【图12------NuTime/MOMENT/TiRex/Chronos2的层级性能曲线】
这一现象并非 Mantis 独有------对 NuTime、MOMENT、TiRex、Chronos2 做同样的层级分析,都能找到比最终层更好的中间层。其中 Mantis 第3层表现最优,MOMENT 在第10层左右达到峰值,TiRex 和 Chronos2 的判别信息集中在早期层(这正是因为它们的后半段主要在做预测任务的特化)。
作者将这一发现总结为:"中间层表示解锁了预训练的规模收益"。
策略二:CLS Token 与非分类 Token 联合聚合
标准 Transformer 分类器通常只取 CLS token 的隐藏状态作为最终表示,其他 token 的信息被丢弃。

【图14------第3层输出时不同token聚合策略对比】
实验表明,将 CLS token 与所有非分类 token 的均值 拼接,准确率比只用 CLS token 提升了 0.8%(0.8195 vs 0.8113)。这种效果仅出现在中间层,在最终层 CLS 已经充分聚合了全局信息,额外拼接反而无益。
策略三:自集成(Self-Ensembling)

【图17------自集成消融结果】
核心思路:由于 Mantis 固定 token 数为 32,将输入插值到不同长度(128、256、512、1024)时,每个 token 的感受野大小不同------序列越短,相邻 patch 重叠越多,感受野越大。这意味着同一输入在不同插值尺度下得到的嵌入捕捉了不同粒度的特征,具有互补性。
将四个尺度的嵌入拼接后准确率提升 0.55% ;再加上对一阶差分序列做同样操作后拼接,进一步提升 0.29%,合计 SE-Mantis 比 Mantis 提升约 0.84%。
作者特别指出:差分特征的增益很有意思------Token Generator Unit 本身已经有差分分支,理论上差分信息已被编码进去了,但测试时的多尺度差分集成仍能带来额外提升,说明这种互补性源于尺度的变化而非特征类型的重复。
策略四:跨模型嵌入融合

【图6------Mantis与各模型融合的UCR准确率对比】
将 Mantis 的嵌入与其他预训练模型的嵌入直接拼接,作为联合特征送给分类器。实验显示:
- 与任何模型融合都有提升,即使是与统计特征 Catch22+ 融合(从 0.8195 → 0.8255)
- 与 TiConvNext 融合效果最佳(0.8283),因为视觉预训练模型与时间序列对比模型的特征空间互补性最强
- 与 NuTime 融合提升最小(0.8211),原因是两者都是分类导向的 TSFM,表示空间有较多重叠
三、实验结果
3.1 模型规模与推理速度

【表6------各模型参数量对比(原始/剪枝后)】

【图4------UCR准确率 vs 模型参数量的帕累托图】
Mantis 是所有 Foundation Model 中规模最小、性能最高 的。原始参数量 4.2M,对中间层做剪枝后仅需 2.2M 参数,与 NuTime 相当,仅为 MOMENT 的 1/150、TiViT-H 的 1/280。

【图5------各模型在不同样本量下的推理时间对比(对数坐标)】
推理速度同样出色。在10万个样本的推理测试中:
- Tabular FMs(TabPFN、TabICL):超过10小时
- Vision FMs(TiViT-H、TiConvNext):数小时
- MOMENT、TiRex:约40分钟级别
- Mantis:与 Catch22+(纯统计方法)相当,秒级完成
这意味着 Mantis 可以部署在算力受限的边缘设备上,而不需要 GPU 集群。
3.2 UCR 通用基准(零样本特征提取)

【图1------UCR-91基准最终性能对比柱状图】

【图19------UCR-91基准完整性能对比(含更多基线)】
在 91 个 UCR 数据集上与 25 个模型的全面比较:
| 模型类别 | 代表模型 | UCR-91准确率 |
|---|---|---|
| 自监督(单数据集训练) | TS2Vec | 0.8516 |
| 统计特征 | Catch22+ | 0.8145 |
| 预测基础模型 | TiConvNext | 0.8458 |
| 分类基础模型 | NuTime | 0.8121 |
| Mantis | - | 0.8584 |
| SE-Mantis | - | 0.8582 |
| Mantis & TiConvNext | - | 0.8620 |
Mantis 超越了 TS2Vec------这是一个对每个数据集单独训练的自监督基线,而 Mantis 的编码器完全冻结,不接触任何下游数据。这是论文宣称的零样本特征提取领域的新 SOTA。
3.3 全量 UCR(128个数据集)和 UEA-27(多变量)

【表1------UCR和UEA-27准确率汇总表】
- UCR(128数据集):Mantis 0.8195,远超第二名 TiConvNext(0.8029)
- UEA-27(多变量) :Mantis 0.7420,超越第二名 NuTime(0.7199)超过 2.2个百分点
多变量场景下 NuTime 排名第二,作者推测这与其隐藏维度较小(128维)有关------多通道独立拼接后总维度随通道数线性增长,较小的单通道维度使其对维度灾难更不敏感。
3.4 HAR 和 EEG 领域特定基准

【表2------HAR和EEG全部数据集详细结果】
人体活动识别(HAR,7个数据集):
- Mantis 平均 0.7562,领先 NuTime(0.7382)
- 差距最显著的数据集是 Ego4D(0.5258 vs 0.5108)和 MP8(0.6857 vs 0.6504)
- 视觉模型 TiViT-H 和 TiConvNext 在 HAR 上表现差(均值约 0.645),远低于 Mantis
脑电信号分类(EEG,11个数据集):
- Mantis 平均 0.7363,排名第一
- EEG 任务整体更难,各模型差距缩小;Tabular FMs 在大型 EEG 数据集(CAP、PCL、SEDFx)上因内存/时间超限无法运行
3.5 Mantis 与 TabPFN 的深入对比

【表13------Mantis vs TabPFN 胜出数据集的平均特征统计】



【表14~16------按样本数/序列长度/类别数分层的性能对比】
TabPFN 在 UCR-91 上的胜出次数("Best Counts")甚至高于 Mantis,但平均准确率低于 Mantis。深入分析揭示了两者的互补关系:
- Mantis 在样本数少、序列长、类别多的数据集上占优
- TabPFN 在样本数多、序列短的数据集上占优(短序列更像表格数据,正中 TabPFN 的擅长区间)
- 在类别数 ≥ 20 的极端场景下,TabPFN 准确率急剧下滑至 0.529,而 Mantis 保持 0.713
3.6 微调(Fine-tuning)

【图18------零样本 vs 微调性能对比】
虽然 Mantis 的主要贡献在零样本范式,作者也展示了微调后的效果:
- 零样本(第3层):0.8113
- 微调(第3层后截断):0.8409
- 微调(保留全部层):0.8500
有意思的是,微调时不截断(即保留"零样本无用"的后几层)反而更好,说明这些层在微调中仍能增加模型容量。
四、关键设计选择的消融
卷积核大小

【图9------卷积核大小消融曲线】
对卷积 kernel size 在 {9, 17, 25, 33, 41, 49} 上做消融,性能单调提升至 kernel=41,之后趋于饱和。41 是 Token Generator Unit 的最优配置。
Transformer 架构现代化

【图10------不同Transformer配置对比柱状图】

【表8------两个版本Transformer在各层的UCR准确率】
将标准 Transformer(sinusoidal PE + LayerNorm + GELU)升级为现代设计(RoPE + RMSNorm + SwiGLU)后,准确率从 0.788 提升到 0.790,差异虽小但跨种子稳定。Mantis 最终采用现代设计。
多变量适配器

【表12------PCA/Linear适配器 vs 无适配器的多变量数据集性能】
对于多变量时间序列,Mantis 默认对每个通道独立提取特征后拼接。加入轻量级通道混合适配器后(PCA 或可训练线性层将 d 个通道映射为10个虚拟通道),在10个 UEA 数据集上平均有显著提升,尤以 Handwriting(0.281 → 0.514)和 EigenWorms(0.814 → 0.863)最为明显。
五、深层洞察:为什么中间层更好?
这一现象值得单独展开,因为它不仅是 Mantis 的工程技巧,更是一个关于基础模型预训练规律的普遍发现。

【图13------100K数据集训练1000轮时各层性能变化曲线】
论文通过控制实验排除了"数据集大小"的混淆因素:将 100K 数据集训练 1000 个 epoch(更新步数等同于 1M 数据集训练 100 epoch),结果同样出现了中间层超越最终层的现象。这说明决定因素是梯度更新次数,而非数据量本身。
作者的解释是:充分训练后,最终层开始过拟合 InfoNCE 对比目标------它学会了"如何让正对更相似、负对更不相似",但这种特化反而损害了表示的通用性。中间层没有直接承受损失函数的梯度压力,保持了更泛化的特征。
这个结论对整个 TSFM 领域都有启示:评测一个基础模型时,不应只报告最终层的性能,中间层分析应当成为标准流程。
六、总结与展望
Mantis 的贡献可以总结为一句话:在完全冻结编码器的零样本范式下,仅凭 2.2M 参数,在时间序列分类任务上超越了参数量百倍以上的对手。
它的成功依赖三个相互咬合的设计选择:
- 面向分类任务特设的多视角 tokenizer,有效捕捉局部判别模式
- 合成数据的对比预训练,兼顾高多样性和零泄露
- 测试时的系统化特征增强,将冻结编码器的能力压榨到极限
论文指出几个值得继续探索的方向:
- 多模态架构:结合文本、图像等其他模态
- 上下文学习(in-context learning):实现不需要任何标注的零样本分类
- 分类与预测联合基础模型:目前两类任务依然需要独立设计
- 可解释性和校准性:使模型输出的置信度更可靠,支持无监督的性能评估
对于研究者而言,Mantis 最重要的提示或许是:不要把基础模型当作黑盒,中间层和测试时策略都是可以挖掘的金矿。