【NeurIPS 2025】ConTextTab:语义感知的表格上下文学习模型|从表格基础模型研究者视角

摘要

本文解读 NeurIPS 2025(Spotlight)论文《ConTextTab: A Semantics-Aware Tabular In-Context Learner》。该论文提出语义感知的表格上下文学习模型 ConTextTab ,通过融合LLM 文本语义嵌入类型专属编码 (文本/日期/数值)与真实世界数据预训练 (T4 数据集 218 万张表),让表格原生 ICL 模型零微调即可利用列名与类别值的真实含义。实验表明在语义丰富的 CARTE 基准上取得 rank 1.55 的新 SOTA(Acc 76.9%、R² 72.4%),对 TabPFN 胜率 96%,且 2048 样本以内的低数据场景超越 AutoGluon,为表格基础模型研究提供了语义路线的关键借鉴。

视频讲解点击观看 B 站视频

论文基本信息

项目 内容
标题(英文) ConTextTab: A Semantics-Aware Tabular In-Context Learner
标题(中文) 语义感知的表格上下文学习模型
作者 Marco Spinaci, Marek Polewczyk, Maximilian Schambach, Sam Thelin
机构 SAP France · SAP SE
会议 NeurIPS 2025
arXiv https://arxiv.org/abs/2506.10707
项目网站 https://github.com/SAP-samples/contexttab

背景与动机

表格数据是现实世界中占比最大的数据形态,但长期以来预测任务被梯度提升树(XGBoost、LightGBM、CatBoost)主导------它们性能强但需要为每个数据集单独训练,无法利用预训练。近年来**表格上下文学习(ICL)**范式打破了这一格局:TabPFN 在合成数据上预训练,用行级 ICL 在千样本以内的小表分类上超越提升树;TabPFNv2(Nature 2025)、TabICL、TabDPT 进一步把这一路线扩展到万级样本、cell 级编码与真实数据检索。

然而,论文精准地指出两条路线的结构性短板:

  • 表格原生 ICL(TabPFN/TabICL) :架构高效、适配表格结构,但只用合成数值数据训练,类别特征靠索引编码,列名完全不被使用,也无法利用时间、日期等真实数据类型------模型对真实世界的语义信息"视而不见"。
  • LLM 表格 ICL(TabLLM/LIFT/TabuLa-8B):有深度语义理解与世界知识,低数据场景表现优异,但需要把表格序列化为文本,token 效率极低(TabuLa-8B 仅支持 32 条上下文),难以扩展到中等规模以上的表格。

ConTextTab 的核心动机正是桥接这两条路线:保持表格原生架构的零微调泛化能力,同时首次用 LLM 语义嵌入系统性利用列名与类别值的真实含义

研究主线:从问题到结论

图 1:ConTextTab 研究主线(Mermaid 流程图)

基准/方法设计

ConTextTab 的方法由四个模块构成,核心思想是"每种数据类型都用最适合的方式嵌入,让语义信息进得来":

  • 文本/类别单元格:用预训练文本嵌入模型 all-MiniLM-L6-v2 逐单元格嵌入------类别标签不再被映射为整数索引,而是保留其真实含义(如 "chinos" 与 "trousers" 语义相近)。
  • 日期 :把日、月、年三个数字分别嵌入后求和,既保留相对时间比较能力("哪一天更早"),又保留特殊日期语义(节日),且比 AutoGluon 的多特征展开更 token 高效。
  • 数值:先裁剪到 2%~98% 分位数,再零均值单位方差标准化(Chebyshev 不等式保证落在 (-7.1, 7.1) 区间避免梯度爆炸),乘可学习向量加偏置;NaN 用 0 代替,偏置兼任 "is-NaN" 标志。
  • 列头 :用同一文本嵌入模型编码列名,过独立线性层映射到目标维度,与单元格嵌入求和后 LayerNorm------列头扮演位置编码的角色,同时携带列语义。

骨干网络沿用 TabPFN 的横向(跨列)/纵向(跨行)交错注意力架构,权重共享降低参数量。分类用交叉熵 + MLP 头,回归直接预测归一化浮点值 + L2 损失。

图 2:ConTextTab 架构------类型专属嵌入 + 交错注意力骨干 + 定制输出头

分类全景

图 3:表格 ICL 方法分类全景(Mermaid 流程图)

方法细节

训练设置 :在 T4 数据集(TabLib 衍生的约 310 万张真实表)上预训练,丢弃少于 150 行的表后剩 218 万张(中位 750 行 9 列);每表随机采样 1000 行,50~900 行作 query 其余作 context,随机选一个目标列(排除日期列、>50% NaN 的数值列、>20% 唯一值的列),上采样非数值列使回归/分类任务比例均衡。训练 400~1000 万步(2~5 epoch),微批 1 + 梯度累积模拟 batch 256。

推理设置:8-fold bagging,每袋采样 c=8192 行上下文(训练时 c\\le950,推理可外推),列数超过 500 时每袋随机采样 500 列。由于行/列置换等变性,模型对 bagging 的依赖远小于 TabPFN。

三个替代架构(附录 B 详述,均未超过主架构):

  • soft-binning 数值编码:按分位数分成 16 个软箱做线性组合,解码时箱平均------回归转分类技巧。
  • 监督聚类头:计算 query/context 行嵌入的余弦相似度 + 二元交叉熵,保留目标标签语义、支持任意类别数(超越 TabPFN 的 10 类限制),但现有基准上增益未显现。
  • ISAB 诱导注意力:用诱导点压缩上下文把二次复杂度降下来,大上下文推理快 10 倍,回归任务有微小掉点。

实验设计与结果

评测协议:5 大基准、203 个任务(91 回归 + 112 分类),样本 400~40 万行、5~3000 列;固定 70-10-20 分层划分、不做交叉验证;指标 = 平均准确率 + 软裁剪 R²(负值经 \\tanh 映射到 \[-1,0))+ 平均 rank(0.005 以内记为平局)。基线覆盖 TabPFN、TabICL、TabDPT、CARTE、RealMLP、TabM、提升树三件套(含 HPO/CV 集成版)与 AutoGluon。

主结果(CARTE 上按 rank 排序):

模型 CARTE Acc CARTE R² CC18 Acc CTR23 R²
AutoGluon v1.2 78.7 73.8 88.5 68.6
ConTextTab 76.9 72.4 86.6 73.3
CARTE v0.0.26 76.1 68.5 --- ---
TabPFN v2.1.0 72.3 65.0 87.4 75.1
TabICL v0.1.1 72.5 --- 88.0 ---
TabDPT v1.1 72.7 65.1 87.8 73.2

ConTextTab 在 CARTE 上 rank 1.55 (全局 2.96),Acc/R² 全面超越所有 ICL 方法,仅 AutoGluon 这种堆叠集成系统略胜;对 TabPFN 胜率 96%(p 值极小,统计显著)。非语义基准(CC18/CTR23/TabReD/TALENT)上与最强 HPO+CV 树基线差异不显著------语义编码没有牺牲通用性。

图 4:CARTE 低数据 regime------ConTextTab 全程领先,≤2048 样本超越 AutoGluon

图 5:CARTE 基准关键差异图(CD diagram)

数据集构成(附录 D):CARTE 51 任务(11 分类 + 40 回归,object 列占比 80.7%)、CC18 72 分类、CTR23 35 回归、TabReD 8 任务、TALENT-Tiny 37 任务。

语义消融(附录 F,CARTE 专属)------全文主张的最强证据:

  • 特征语义:换成 ordinal 编码 Acc −2.7 / R² −4.8;MinHash −1.7/−3.3;Gap −1.4/−4.3;AutoGluon 编码器最差 −4.8/−7.3(rank 1.24 → 4.27)。
  • 列名语义:去掉列名 Acc −1.2 / R² −2.1,胜率 92% 显著;用 gemma3-12b 生成列描述增强仅 rank 1.24 → 1.20(胜率 57%、p=0.4,不显著)。

图 6:语义消融胜率矩阵(列名与 cell 值编码)

预训练规模 (附录 E):训练表数从 10 张增至 100 万张,约 10 万张是性能门槛,之后趋平------瓶颈在 T4 数据多样性而非模型容量。

图 7:预训练规模影响曲线

运行时(附录 G):推理 0.1~9 秒(随表大小),因 LLM 嵌入开销通常比 TabPFN/TabICL 略慢,10K 行时约 2 倍;HPO+CV 树模型总耗时(fit+predict)高两个数量级。

图 8:运行时对比(预测延迟与含训练总时间)

结果对比总结

图 9:结果对比总结(Mermaid 流程图)

关键发现

  • CARTE 新 SOTA:rank 1.55(Acc 76.9%、R² 72.4%),显著优于除 CatBoost/AutoGluon 外的全部模型;对 TabPFN 胜率 96%(统计显著)。
  • 低数据 regime 是主场:≤2048 训练样本即超越 AutoGluon;128 样本时差距最大,体现表格 ICL 的独特价值。
  • 特征语义是核心杠杆:去掉语义(ordinal 编码)→ Acc −2.7、R² −4.8,rank 从 1.24 恶化到 4.27。
  • 列名语义独立贡献:去掉列名 → Acc −1.2、R² −2.1,胜率 92%;LLM 增强列名增益不显著(57%、p=0.4)。
  • 通用性不牺牲:203 个任务上全局 rank 2.96,非语义基准与最强 HPO+CV 树模型差异不显著。
  • 预训练数据规模门槛:约 10 万张表即可训出 SOTA 质量,100 万张后收益趋平,瓶颈是数据多样性。

局限性

  • 污染风险:真实数据预训练可能包含评测任务;作者用嵌入相似度匹配检查,未发现 CARTE 污染(OpenML 污染已有 TabuLa 原研究)。
  • 大表扩展性:上下文受限于 950~8192 行,推理二次复杂度,10K 行时约为 TabPFN 2 倍慢;所有表格 ICL 模型(含 TabPFN/TabDPT/TabICL)在超大表上仍输给传统方法。
  • 数据瓶颈:预训练增至 100 万张表后收益停滞,需要更多样化的真实语义数据;合成数据训练如何融入语义对齐仍是开放问题。
  • 目标语义未解锁:监督聚类头未能带来增益------缺乏高基数、语义丰富的分类基准来发挥其潜力。

常见问题(FAQ)

ConTextTab 与 TabPFN 的区别是什么?

ConTextTab 沿用 TabPFN 的骨干架构,但把类别索引编码与位置编码替换为 LLM 语义嵌入(列名 + 单元格),并在真实世界 T4 数据(218 万张表)上预训练而非合成数据,因此能利用真实语义与跨表知识迁移。

为什么 ConTextTab 在 CARTE 上特别强?

CARTE 的 object/文本列占比高达 80.7%,语义信息密度最大;ConTextTab 的语义嵌入恰好发挥价值,Acc 76.9% 对 TabPFN 的 72.3% 提升 4.6 个点。

ConTextTab 需要微调吗?

不需要。作为 ICL 模型,它开箱即用:推理时把训练数据作为上下文(8-fold bagging、每袋最多 8192 行),无需针对新数据集训练或调参;低数据场景(≤2048 样本)甚至超越 AutoGluon。

语义嵌入带来多少额外开销?

推理延迟 0.1~9 秒(随表大小),比 TabPFN/TabICL 略慢(10K 行时约 2 倍),来自 LLM 嵌入前处理;但相比 HPO+CV 树模型总耗时高两个数量级,ICL 的零训练优势仍然明显。

类别数很多怎么办?

ConTextTab 支持任意类别数(分类头输出维度 ≥ 类别数),还探索了监督聚类头方案------保留目标标签语义、彻底解除类别数限制,但现有基准上增益未显现,需要更语义丰富的基准验证。

代码和模型开源了吗?

开源了。代码在 GitHub(SAP-samples/contexttab),模型权重在 Hugging Face 发布,论文 arXiv: 2506.10707。

参考链接


给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟 复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群白拾的小屋 (750365700)

⭐B站账号白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页YhbCode000(工程文件)

相关推荐
白拾2 天前
【NeurIPS 2025】PKD:偏好驱动的知识蒸馏,少样本节点分类|从少样本图学习视角
大语言模型·图神经网络·知识蒸馏·少样本学习·neurips 2025·pkd 论文分享
CV炼丹术10 个月前
NeurIPS 2025 | 港中文提出COS3D:多模态融合语言与分割,创造开放词汇3D分割新范式!
人工智能·计算机视觉·neurips 2025
脚踏实地的大梦想家1 年前
【ICL】上下文学习
语言模型·大模型·prompt·提示词·上下文学习·提示词工程·icl
Code_流苏1 年前
AI知识补全(十四):零样本学习与少样本学习是什么?
人工智能·元学习·少样本学习·零样本学习·语义嵌入
木亦汐丫2 年前
大模型从零开始——提示工程 Prompt
大模型·prompt·cot·思维链·上下文学习·icl·post-training
叶庭云2 年前
ExpertPrompting:指导大语言模型成为杰出专家
大语言模型·提示工程·上下文学习·expertprompting·expertllama
TechBeat人工智能社区3 年前
AAAI 2024 | Adobe提出全新上下文提示学习框架CoPL,高效提升下游性能
计算机视觉·提示学习·aaai·clip·上下文学习
TechBeat人工智能社区3 年前
ICCV 2023|PViC:构建交互谓词视觉上下文,高效提升HOI Transformer检测性能
计算机视觉·transformer·iccv·hoi·上下文学习