小米表格数据基础模型-Xiaomi-TabLDM 部署测评,70M表格基础模型开源,一套配置通吃分类回归

一、模型速览

Xiaomi-TabLDM 由小米于 2026-09-05 正式发布并开源,是一个通用表格数据基础模型 ,参数量 70M ,许可证 Apache 2.0 (Copyright 2026 Xiaomi)。它提供 TabLDMClassifier(分类)与 TabLDMRegressor(回归)两个 scikit-learn 风格 estimator,GitHub(xiaomi-research/xiaomi-tabldm)与 HuggingFace(occams/Xiaomi-TabLDM)均已开放权重与代码,技术报告见 arXiv:2609.03880。一句话定位:把"一次预训练、跨任务使用"的基础模型范式,正式带进金融、医疗、制造、物流的结构化数据领域------从此一个模型、一套默认配置,直接适配不同表格,告别"一表一模型"的苦日子。

这正是表格数据领域的"Scaling Law"时刻:过去十年表格预测依赖手工特征与逐数据集建模,而 TabLDM 证明,在大规模合成数据上预训练的小模型,也能像 NLP/CV 基础模型一样"预训练一次、下游通吃"。70M 的参数规模意味着它能直接进边缘设备、进浏览器、进实时流水线,而不必依赖 GPU 集群。

二、核心亮点

亮点一:一次预训练,跨任务通用。 传统表格 ML(XGBoost/LightGBM/CatBoost)面对新数据集要重训、调参、集成,生产和部署代价高。TabLDM 用单一预训练模型 + 统一默认配置即可完成分类与回归,无需针对每个任务重新训练或后置集成。

亮点二:大规模合成数据预训练。 模型完全基于**结构因果模型(SCM)**生成的大规模合成表格任务预训练,覆盖不同数据规模、变量类型与函数依赖关系,把预训练的任务分布撑大,让模型提前见过多样模式。SCM 的关键在于"因果"而非"相关"------合成数据按变量间的因果结构生成,使模型学到的是稳健的依赖关系而非训练集里的虚假相关,这也是它在跨工况(生产条件变化)时仅需 30 条新样本就能再降 62% 误差的原因:它理解表格背后的机理,而非死记分布。

亮点三:架构三件套顶容量。 引入双流特征分组 (多粒度建模特征关联)、轻量级注意力残差 (深层网络选择性复用历史信息)、稀疏混合专家 MoE(用稀疏专家扩容量而不等比增算力)。这让它 70M 参数就能在四大基准挤进第一梯队。双流特征分组把数值列与类别列分开建模再融合,避免类别型高基数特征淹没数值信号;注意力残差让深层网络能"回头看"浅层特征,缓解表格任务里常见的信息丢失;稀疏 MoE 则在推理时只激活部分专家,使容量与算力解耦------三者叠加,是 70M 小模型能压过动辄数百 M 乃至上 G 的传统集成模型的根本原因。

亮点四:Test-Time Scaling,参数不动提性能。 推理阶段不修改预训练权重,靠不同特征排列、数据变换、预测视角产生互补结果,再按数据集自适应选择融合,持续抬升预测性能------这是大模型里流行的 TTS 在表格域的落地。

亮点五:scikit-learn 兼容,pip 即装。 对 ML 工程师零学习成本,接口与 fit/predict 完全一致。

三、部署实战

3.1 环境准备与安装

bash 复制代码
# 1) 克隆仓库并安装(含 PyTorch 依赖)
git clone https://github.com/xiaomi-research/xiaomi-tabldm.git
cd xiaomi-tabldm
pip install .
# 可选:分位数分布层 JIT 加速;Intel Mac 若 PyTorch 装不上先 conda install pytorch -c pytorch
pip install .[numba]

3.2 推理代码(上下文学习,fit 不训练)

关键点:fit 不会训练模型,仅对带标签的上下文数据做预处理并加载预训练权重,预测完全通过上下文学习在单次前向传播完成。首次使用若本地无权重,会自动从 HuggingFace Hub 下载。

python 复制代码
import numpy as np
import pandas as pd
from tabldm import TabLDMRegressor, TabLDMClassifier
​
# 1) 准备一份示例表格(数值型特征即可,无需独热编码)
X = pd.DataFrame({
    "age":        [23, 45, 31, 52, 38, 29, 61, 47],
    "income":     [3.1, 8.4, 5.0, 11.2, 6.7, 4.2, 13.5, 9.1],
    "score":      [0.7, 0.9, 0.6, 0.95, 0.8, 0.55, 0.99, 0.88],
})
y = np.array([0, 1, 0, 1, 1, 0, 1, 1])  # 二分类标签示例
​
# 2) 回归 / 分类都走 scikit-learn 风格接口
reg = TabLDMRegressor(model_path="checkpoints/reg_default.ckpt")  # 自动下载
clf = TabLDMClassifier(model_path="checkpoints/clf_default.ckpt")
​
# fit 仅做上下文预处理 + 载入权重,不更新参数
reg.fit(X, y)
clf.fit(X, y)
​
# 3) 预测(上下文学习,单次前向)
X_new = pd.DataFrame({"age": [34, 56], "income": [5.5, 10.0], "score": [0.72, 0.93]})
print("回归预测:", reg.predict(X_new))
print("分类预测:", clf.predict(X_new))
print("分类概率:", clf.predict_proba(X_new))  # 形状 (n_test, n_classes)
​
# 4) 可选:Test-Time Scaling------增推理算力提性能(按数据集自适应融合多次变换结果)
# reg.fit(X, y, test_time_scaling=True)

提示:model_path 还可设为 None,则按 checkpoint_version 从 HF 缓存检索;clf.save("c.pkl", save_training_data=True) / TabLDMClassifier.load("c.pkl") 可持久化含 KV 缓存的 estimator。

四、性能测评

说明:TabLDM 是表格基础模型,没有"tok/s"概念;下文把模板三维度适配为推理速度 / 显存占用 / 预测质量。数据来源:小米官方发布、arXiv:2609.03880、BestHub/IT之家/网易报道,均标注;本机未实测。

推理速度 :TabArena 回归任务上,Xiaomi-TabLDM 取得 1900 Elo 第二高分,仅 3.12 秒 / 每 1k 验证样本 ,而榜首 TabFM 需 9.67 秒 ------训练时间较 TabFM 减少 82%,预测时间缩短 68%。跑得更快、活儿不差。

显存占用 :70M 参数,BF16 权重仅约 280MB,纯 CPU 或任意边缘设备都能跑,不存在显存门槛。

预测质量:四大公开基准排名(来源:官方发布):

基准 任务 Xiaomi-TabLDM 排名 对比强基线
OpenML-CTR23 回归 第 1 登顶回归榜
TALENT 二分类 第 1 ---
TabArena 回归 第 2(1900 Elo) 超 TabPFN-3 / AutoGluon 1.5 / TabPFN-2.6
BCCO 回归 第 2 总体排名第 2

与传统表格方案的效率对比(来源:官方 / arXiv:2609.03880):

方案 是否逐数据集训练 TabArena 回归 Elo 每 1k 样本耗时
Xiaomi-TabLDM 否(上下文学习) 1900 3.12s
TabFM 榜首(约 1900+) 9.67s
TabPFN-3 / AutoGluon 1.5 / TabPFN-2.6 部分需训练/调参 低于 TabLDM 回归分 更高

工业实测(来源:官方,非本机构):材料性能预测无需微调精度 +130%、无效试模 -90%;零件重量预测失误样本较 XGBoost -31%;生产组分预测平均误差较 XGBoost -54%;工况变动后仅补约 30 条新样本作上下文,误差再降 62%(传统 ML 补 200 条仍误差更高)。

五、使用建议

适合:金融风控、医疗诊断、制造质检、物流预测等表格预测;少样本/跨工况场景(补 30 条样本即可快速适配新分布);希望用一套模型替代多套 XGBoost 的工程团队。

不适合:文本/图像/语音生成等生成式任务(它是结构化数据预测模型,不是 LLM);需要可解释特征重要性的严格监管场景(基础模型黑箱性较强)。

调优提示 :开 test_time_scaling=True 增推理算力换精度,但会增加延迟,按业务取舍;新工况优先"补少量样本作上下文"而非重训;生产部署建议 save_training_data=True 缓存 KV 提升复用速度。

一个常见误区是把 TabLDM 当传统监督模型用------反复 fit 并不会让它"学得更好",因为 fit 只做上下文预处理与权重加载。真正提升效果的两招是:开 Test-Time Scaling 增算力,以及给更相关的上下文样本(同一业务域的历史数据)作为 X_train/y_train。另外,分类与回归是两个独立权重,别混用同一 checkpoint。


表格数据占了企业数据的绝大多数,但一直被"一表一模型"拖累。你觉得表格基础模型会像 LLM 一样走向"一个模型通吃"吗?你的场景里最头疼的表格任务是什么?

数据来源声明 :本文数据来自小米官方发布、GitHub xiaomi-research/xiaomi-tabldm、HuggingFace occams/Xiaomi-TabLDM、技术报告 arXiv:2609.03880 及 IT之家/网易/BestHub 报道;API 用法引自官方 README。作者环境未做本地实测,所有性能数字均标注来源,未做任何数值编造。

往期文章:

相关推荐
海盗12342 小时前
AI 新闻日报 2026-09-11:SWE-2 逼近前沿、宇树开源具身基座、中国自动驾驶欧洲载客
人工智能·开源·自动驾驶
tedcloud12310 小时前
Wand-Enhancer 怎么搭建?开源 Wand 客户端增强与远程控制工具介绍
大数据·服务器·人工智能·开源·音视频
嘉琪coder11 小时前
我做了一个 Chrome 扩展,把 YouTube 播放列表批量变成 AI 可读的本地 Markdown
chrome·开源·浏览器
冬奇Lab14 小时前
一天一个开源项目(第214篇):AstronRPA —— 科大讯飞开源的企业级 RPA + AI Agent 自动化平台
人工智能·开源·资讯
DolphinScheduler社区17 小时前
Apache DolphinScheduler 8 月报:权限安全加固,调度补火上线,性能与稳定性持续提升
大数据·安全·开源·apache·任务调度·海豚调度
T型码农要学习17 小时前
开源项目11|Stable Diffusion WebUI:本地自建AI绘图,无限免费出图,彻底告别AI绘画会员次数限制
开源·ai绘画
小弥儿18 小时前
GitHub今日热榜 | 2026-09-02:i-have-adhd 登顶
学习·开源
分布式存储与RustFS18 小时前
RustFS 多协议接入全景:S3 之外,Swift/Keystone 与 SFTP/FTPS 怎么选
云原生·开源·对象存储·分布式存储·s3·rustfs·性能基准