一、模型速览
Xiaomi-TabLDM 由小米于 2026-09-05 正式发布并开源,是一个通用表格数据基础模型 ,参数量 70M ,许可证 Apache 2.0 (Copyright 2026 Xiaomi)。它提供 TabLDMClassifier(分类)与 TabLDMRegressor(回归)两个 scikit-learn 风格 estimator,GitHub(xiaomi-research/xiaomi-tabldm)与 HuggingFace(occams/Xiaomi-TabLDM)均已开放权重与代码,技术报告见 arXiv:2609.03880。一句话定位:把"一次预训练、跨任务使用"的基础模型范式,正式带进金融、医疗、制造、物流的结构化数据领域------从此一个模型、一套默认配置,直接适配不同表格,告别"一表一模型"的苦日子。
这正是表格数据领域的"Scaling Law"时刻:过去十年表格预测依赖手工特征与逐数据集建模,而 TabLDM 证明,在大规模合成数据上预训练的小模型,也能像 NLP/CV 基础模型一样"预训练一次、下游通吃"。70M 的参数规模意味着它能直接进边缘设备、进浏览器、进实时流水线,而不必依赖 GPU 集群。
二、核心亮点
亮点一:一次预训练,跨任务通用。 传统表格 ML(XGBoost/LightGBM/CatBoost)面对新数据集要重训、调参、集成,生产和部署代价高。TabLDM 用单一预训练模型 + 统一默认配置即可完成分类与回归,无需针对每个任务重新训练或后置集成。
亮点二:大规模合成数据预训练。 模型完全基于**结构因果模型(SCM)**生成的大规模合成表格任务预训练,覆盖不同数据规模、变量类型与函数依赖关系,把预训练的任务分布撑大,让模型提前见过多样模式。SCM 的关键在于"因果"而非"相关"------合成数据按变量间的因果结构生成,使模型学到的是稳健的依赖关系而非训练集里的虚假相关,这也是它在跨工况(生产条件变化)时仅需 30 条新样本就能再降 62% 误差的原因:它理解表格背后的机理,而非死记分布。
亮点三:架构三件套顶容量。 引入双流特征分组 (多粒度建模特征关联)、轻量级注意力残差 (深层网络选择性复用历史信息)、稀疏混合专家 MoE(用稀疏专家扩容量而不等比增算力)。这让它 70M 参数就能在四大基准挤进第一梯队。双流特征分组把数值列与类别列分开建模再融合,避免类别型高基数特征淹没数值信号;注意力残差让深层网络能"回头看"浅层特征,缓解表格任务里常见的信息丢失;稀疏 MoE 则在推理时只激活部分专家,使容量与算力解耦------三者叠加,是 70M 小模型能压过动辄数百 M 乃至上 G 的传统集成模型的根本原因。
亮点四:Test-Time Scaling,参数不动提性能。 推理阶段不修改预训练权重,靠不同特征排列、数据变换、预测视角产生互补结果,再按数据集自适应选择融合,持续抬升预测性能------这是大模型里流行的 TTS 在表格域的落地。
亮点五:scikit-learn 兼容,pip 即装。 对 ML 工程师零学习成本,接口与 fit/predict 完全一致。
三、部署实战
3.1 环境准备与安装
bash
# 1) 克隆仓库并安装(含 PyTorch 依赖)
git clone https://github.com/xiaomi-research/xiaomi-tabldm.git
cd xiaomi-tabldm
pip install .
# 可选:分位数分布层 JIT 加速;Intel Mac 若 PyTorch 装不上先 conda install pytorch -c pytorch
pip install .[numba]
3.2 推理代码(上下文学习,fit 不训练)
关键点:fit 不会训练模型,仅对带标签的上下文数据做预处理并加载预训练权重,预测完全通过上下文学习在单次前向传播完成。首次使用若本地无权重,会自动从 HuggingFace Hub 下载。
python
import numpy as np
import pandas as pd
from tabldm import TabLDMRegressor, TabLDMClassifier
# 1) 准备一份示例表格(数值型特征即可,无需独热编码)
X = pd.DataFrame({
"age": [23, 45, 31, 52, 38, 29, 61, 47],
"income": [3.1, 8.4, 5.0, 11.2, 6.7, 4.2, 13.5, 9.1],
"score": [0.7, 0.9, 0.6, 0.95, 0.8, 0.55, 0.99, 0.88],
})
y = np.array([0, 1, 0, 1, 1, 0, 1, 1]) # 二分类标签示例
# 2) 回归 / 分类都走 scikit-learn 风格接口
reg = TabLDMRegressor(model_path="checkpoints/reg_default.ckpt") # 自动下载
clf = TabLDMClassifier(model_path="checkpoints/clf_default.ckpt")
# fit 仅做上下文预处理 + 载入权重,不更新参数
reg.fit(X, y)
clf.fit(X, y)
# 3) 预测(上下文学习,单次前向)
X_new = pd.DataFrame({"age": [34, 56], "income": [5.5, 10.0], "score": [0.72, 0.93]})
print("回归预测:", reg.predict(X_new))
print("分类预测:", clf.predict(X_new))
print("分类概率:", clf.predict_proba(X_new)) # 形状 (n_test, n_classes)
# 4) 可选:Test-Time Scaling------增推理算力提性能(按数据集自适应融合多次变换结果)
# reg.fit(X, y, test_time_scaling=True)
提示:
model_path还可设为None,则按checkpoint_version从 HF 缓存检索;clf.save("c.pkl", save_training_data=True)/TabLDMClassifier.load("c.pkl")可持久化含 KV 缓存的 estimator。
四、性能测评
说明:TabLDM 是表格基础模型,没有"tok/s"概念;下文把模板三维度适配为推理速度 / 显存占用 / 预测质量。数据来源:小米官方发布、arXiv:2609.03880、BestHub/IT之家/网易报道,均标注;本机未实测。
推理速度 :TabArena 回归任务上,Xiaomi-TabLDM 取得 1900 Elo 第二高分,仅 3.12 秒 / 每 1k 验证样本 ,而榜首 TabFM 需 9.67 秒 ------训练时间较 TabFM 减少 82%,预测时间缩短 68%。跑得更快、活儿不差。
显存占用 :70M 参数,BF16 权重仅约 280MB,纯 CPU 或任意边缘设备都能跑,不存在显存门槛。
预测质量:四大公开基准排名(来源:官方发布):
| 基准 | 任务 | Xiaomi-TabLDM 排名 | 对比强基线 |
|---|---|---|---|
| OpenML-CTR23 | 回归 | 第 1 | 登顶回归榜 |
| TALENT | 二分类 | 第 1 | --- |
| TabArena | 回归 | 第 2(1900 Elo) | 超 TabPFN-3 / AutoGluon 1.5 / TabPFN-2.6 |
| BCCO | 回归 | 第 2 | 总体排名第 2 |
与传统表格方案的效率对比(来源:官方 / arXiv:2609.03880):
| 方案 | 是否逐数据集训练 | TabArena 回归 Elo | 每 1k 样本耗时 |
|---|---|---|---|
| Xiaomi-TabLDM | 否(上下文学习) | 1900 | 3.12s |
| TabFM | 是 | 榜首(约 1900+) | 9.67s |
| TabPFN-3 / AutoGluon 1.5 / TabPFN-2.6 | 部分需训练/调参 | 低于 TabLDM 回归分 | 更高 |
工业实测(来源:官方,非本机构):材料性能预测无需微调精度 +130%、无效试模 -90%;零件重量预测失误样本较 XGBoost -31%;生产组分预测平均误差较 XGBoost -54%;工况变动后仅补约 30 条新样本作上下文,误差再降 62%(传统 ML 补 200 条仍误差更高)。
五、使用建议
适合:金融风控、医疗诊断、制造质检、物流预测等表格预测;少样本/跨工况场景(补 30 条样本即可快速适配新分布);希望用一套模型替代多套 XGBoost 的工程团队。
不适合:文本/图像/语音生成等生成式任务(它是结构化数据预测模型,不是 LLM);需要可解释特征重要性的严格监管场景(基础模型黑箱性较强)。
调优提示 :开 test_time_scaling=True 增推理算力换精度,但会增加延迟,按业务取舍;新工况优先"补少量样本作上下文"而非重训;生产部署建议 save_training_data=True 缓存 KV 提升复用速度。
一个常见误区是把 TabLDM 当传统监督模型用------反复 fit 并不会让它"学得更好",因为 fit 只做上下文预处理与权重加载。真正提升效果的两招是:开 Test-Time Scaling 增算力,以及给更相关的上下文样本(同一业务域的历史数据)作为 X_train/y_train。另外,分类与回归是两个独立权重,别混用同一 checkpoint。
表格数据占了企业数据的绝大多数,但一直被"一表一模型"拖累。你觉得表格基础模型会像 LLM 一样走向"一个模型通吃"吗?你的场景里最头疼的表格任务是什么?
数据来源声明 :本文数据来自小米官方发布、GitHub
xiaomi-research/xiaomi-tabldm、HuggingFaceoccams/Xiaomi-TabLDM、技术报告 arXiv:2609.03880 及 IT之家/网易/BestHub 报道;API 用法引自官方 README。作者环境未做本地实测,所有性能数字均标注来源,未做任何数值编造。
往期文章: