行业资讯

【ICML 2025】TabICL:面向大数据量表格的上下文学习基础模型|从表格基础模型视角

发布时间:2026/8/20 10:10:32
【ICML 2025】TabICL:面向大数据量表格的上下文学习基础模型|从表格基础模型视角 摘要本文解读 ICML 2025 论文《TabICL: A Tabular Foundation Model for In-Context Learning on Large Data》。该论文提出TabICL一个可扩展的表格分类基础模型通过融合分布感知列嵌入、上下文感知行交互与数据集级上下文学习ICL把表格 ICL 的处理规模从 1 万样本推到50 万样本、500 特征其特别之处在于先嵌入、后 ICL的两阶段架构用列维度坍缩把复杂度从 $\mathcal{O}(m^2 n n^2 m)$ 降到 $\mathcal{O}(m^2 n n^2)$。实验表明在 TALENT 的200 个分类数据集上 TabICL 中位精度最佳、零超参调优比 TabPFNv2 快至10 倍并在 53 个大数据集上超越 TabPFNv2 与 CatBoost为表格基础模型提供了重要借鉴。视频讲解点击观看 B 站视频摘要论文基本信息背景与动机研究主线从问题到结论基准/方法设计分类全景方法细节实验设计与结果结果对比总结关键发现局限性常见问题FAQTabICL 与 TabPFNv2 的核心区别是什么TabICL 需要调参吗TabICL 如何处理超过 10 类的分类问题为什么列嵌入能跨表迁移表示坍缩是什么RoPE 为什么能解决参考链接论文基本信息项目内容标题英文TabICL: A Tabular Foundation Model for In-Context Learning on Large Data标题中文TabICL面向大数据量表格的上下文学习基础模型作者Jingang Qu, David Holzmüller, Gaël Varoquaux, Marine Le Morvan机构SODA 团队 INRIA Saclay · Sierra 团队 INRIA Paris · ENS PSL会议ICML 2025PosterarXivhttps://arxiv.org/abs/2502.05564项目网站https://github.com/Qu-Jingang/TabICL背景与动机表格数据在医疗、金融等工业场景中无处不在但梯度提升决策树GBDT长期统治这一领域CatBoost、XGBoost 精度高但需要超参调优RealMLP、ModernNCA 等深度模型的差距在收窄但仍需验证集调参。TabPFNICLR 2023开创了表格上下文学习范式——把训练数据作为上下文、单次前向完成预测TabPFNv2NeurIPS 2024把它推到 1 万样本但其交替列-行注意力在原始维度上计算复杂度 $\mathcal{O}(m^2 n n^2 m)$ 随样本量和特征数同时爆炸30K 以上样本就容易显存溢出。TabICL 的切入点是一个尖锐的问题ICL 能否有效扩展到大数据量表格作者给出的答案是架构性重设计而非堆算力——先把表格压缩成固定维度的行嵌入再在嵌入上做 ICL让 ICL 的成本不再随原始表格规模线性增长。历史脉络上表格 ICL 走过了清晰的三步TabPFN2022上限 ~1K 样本→ TabPFNv22024交替注意力推到 10K 样本/500 特征→ TabICL2025两阶段维度坍缩扩到 500K 样本大表超越 GBDT。后续的 TabDPT真实数据预训练、TabForestPFN树型先验、LoCalPFN/TuneTables上下文蒸馏都沿着让 ICL 更可扩展的主线演进。研究主线从问题到结论图 13TabICL 研究主线流程图Mermaid——问题→动机→设计→方法→实验→结论基准/方法设计TabICL 由三个 Transformer 组成标签只在最后阶段参与计算晚期融合TF col分布感知列嵌入把特征嵌入重新表述为集合输入问题用 Set Transformer 的诱导自注意力块ISAB$k128$ 个诱导向量把每列单元格映射为逐单元仿射参数 $W, B$嵌入为 $e_j W \odot c_j B$维度 $d128$。所有列共享参数因此跨表可迁移且能捕获列内分布统计。TF row上下文感知行交互3 层 8 头 Transformer 逐行处理特征交互每行前置 4 个可学习 [CLS] token拼接输出得到 512 维固定行嵌入引入 RoPE缩放因子 100,000打破同分布特征的表示坍缩。TF icl数据集级 ICL12 层 4 头 Transformer 在行嵌入上做注意力训练嵌入互相关注、测试嵌入只关注训练嵌入2 层 MLP 输出类别概率单次前向预测整个测试集。图 1TabICL 架构总览——列嵌入 TFcol → 行交互 TFrow4 个 CLS token→ 数据集级 ICL TFicl单次前向输出测试集预测图 2分布感知列嵌入——Set TransformerISAB把每列视为集合输出逐单元仿射参数 W、B嵌入 e_j W⊙c_j B分类全景表格学习的方法版图大致分四支梯度提升树XGBoost、CatBoost、LightGBM、深度表格模型RealMLP、ModernNCA、TabM、跨表迁移方法XTab、CARTE、上下文学习基础模型TabPFN、TabPFNv2、TabICL、TabDPT、TabForestPFN。TabICL 处于第四支的最前沿。图 14表格学习方法分类全景Mermaid——TabICL 位于 ICL 基础模型最前沿方法细节预训练完全基于合成数据约 8,200 万数据集3×A100 共 20 天用结构因果模型SCM按 $c f(\mathrm{Pa}(c)) \epsilon$ 生成依赖关系新增树型 SCMXGBoost 回归70% SCM 30% 树型注入树模型归纳偏置激活函数从 4 种扩到 15 种含高斯过程采样的随机函数。课程学习三阶段① 固定 1,024 样本跑 160K 步② 1K–40K 样本对数均匀采样跑 2K 步10K 开启激活检查点③ 40K–60K 均匀采样跑 50 步、只训练 TF icl。平均排名随课程推进从 11.4第 9→ 7.46第 2→ 6.95第 1。10 类问题的层次分类递归切分成 ≤10 类子树深度 $r \lceil \log_{10} k \rceil$所有子任务共享行嵌入与 TF icl最终概率为根到叶路径概率乘积。显存优化FlashAttention 动态 batch 调节激活显存按多项式回归建模 CPU/磁盘激活卸载使 100K 样本/500 特征仅需 5GB 显存 32GB 内存。图 3学习到的列嵌入编码分布属性——4 万特征 PCA 投影相似偏度/峰度的特征聚集图 4balance scale 上的表示坍缩——无 RoPE 时行嵌入几乎塌成一点RoPE 恢复三分类簇实验设计与结果评测协议TALENT 基准 200 个分类数据集120 二分类 80 多分类排除 15 个 TabPFNv2 调参用过的数据集聚焦 171 个 ≤10 类数据集64%/16%/20% 划分TabICL 与 TabPFNv2 仅用训练集、各做 32 次列/类置换集成其余基线来自 TALENT 原基准含调参。方法中位相对精度平均 Rank每 1K 样本耗时需调参TabICL最佳6.95第 11.1 sA100否TabPFNv2相当无显著差异慢 1.5–10×否CatBoost高–~3 minCPU是RealMLP / ModernNCA中–~7 minGPU是对比维度TabICLTabPFNv2核心机制两阶段嵌入后 ICL列维度坍缩交替列-行注意力无中间坍缩复杂度$\mathcal{O}(m^2 n n^2)$$\mathcal{O}(m^2 n n^2 m)$标签融合晚期仅 ICL 阶段早期从头拼接预训练~82M 合成数据集课程至 60K 样本~130M上限 2,048 样本推理上限500K 样本 / 任意类数10K 样本 / 10 类图 5TALENT 相对 MLP 精度与耗时——TabICL 中位精度最佳且快 1–2 个数量级图 6加速比——小表 1.5×大表 3–10×10K×100 特征时 20 s vs 1 min 40 s图 7按样本量排名的模型等级——TabICL 在 10K–100K 样本区间保持第一梯队图 810 类数据集归一化精度——TabICL 层次分类第二TabPFNv2 无法原生处理时间拟合附录 D以 $nm(nm)$ 为横轴拟合 time $ \alpha \beta (nm(nm))^\gamma$$\gamma0.8$大表渐近加速比趋近 5×、小表 1.4×与复杂度分析吻合。元特征分析特征数增大时 TabICL 表现稳健类别特征占比高时两者都略降但 TabICL 仍优于先验生成更复杂的 TabPFNv2。图 9时间拟合——TabICL 曲线整体低于 TabPFNv2差距随规模扩大图 10Rank 对特征数的依赖——TabICL 高维特征下依然稳健消融附录 E加入 30% 树型 SCM 后 200 数据集相对精度全面提升课程学习把平均 rank 从 11.4 提升到 6.95代价是小数据集轻微回退。图 11树型 SCM 消融——绝大多数数据集提升为正图 12课程学习消融——大数据集显著获益小数据集略有回退结果对比总结图 15TabICL 结果对比总结Mermaid——效率与大数据量的双重优势关键发现规模跳变TabICL 把表格 ICL 的处理上限从 1 万样本推到 50 万样本500 特征~20GB 显存100K 样本/500 特征仅需 5GB 显存。精度-效率兼得200 个 TALENT 数据集上中位相对精度最佳、平均 Rank 6.95 第一每 1K 样本仅 1.1 秒全程零超参调优。大表制胜53 个 10K 样本数据集上同时超越 TabPFNv2 与 CatBoost证明 ICL 在大数据 regime 的竞争力。系统性加速小表比 TabPFNv2 快 1.5 倍、大表快 3–10 倍10K×100 特征20 s vs 1 min 40 s与复杂度分析 $\mathcal{O}(m^2 n n^2)$ vs $\mathcal{O}(m^2 n n^2 m)$ 吻合。概率可靠不调参的 log loss 显著优于精度调参型竞争者概率输出更适合决策场景。多类扩展层次分类让 TabICL 在 12 个 10 类数据集上取得平均归一化精度第二TabPFNv2 原生不支持。局限性推理速度与其他基础模型一样偏慢缓存可缓解目前仅支持分类回归需类似 TabPFNv2 的扩展。列置换不变性RoPE 使模型对列顺序敏感只能靠多次列排列集成近似恢复——表格数据本应天然满足置换不变性。评测方法学继承自 TALENTholdout 单模型 均值插补缺失值交叉验证集成理论上更强但计算成本高。基线未拉满未给 TabPFNv2 提供类别信息、未让其内部处理缺失值对手可能未达最佳状态作者也坦诚调参时间按 ×100 近似估计。常见问题FAQTabICL 与 TabPFNv2 的核心区别是什么架构上 TabICL 是两阶段嵌入后 ICL列维度坍缩TabPFNv2 是交替列-行注意力无坍缩标签融合上 TabICL 晚期、TabPFNv2 早期。结果是复杂度从 $\mathcal{O}(m^2 n n^2 m)$ 降到 $\mathcal{O}(m^2 n n^2)$TabICL 能处理 500K 样本而 TabPFNv2 上限约 10K。TabICL 需要调参吗不需要。它和 TabPFNv2 一样是零调参基础模型预训练后直接单次前向预测这也是它比 CatBoost~3 min/1K 样本调参快近两个数量级的原因之一。TabICL 如何处理超过 10 类的分类问题用层次分类递归把类别切分成 ≤10 类的子树深度 $r \lceil \log_{10} k \rceil$所有子任务共享行嵌入和 ICL 模型最终概率为根到叶路径乘积。12 个 10 类数据集上平均归一化精度第二。为什么列嵌入能跨表迁移因为 TF col 把特征嵌入建模为集合函数而非逐列专属模块同一列集合经共享 Set Transformer 输出分布感知的仿射参数PCA 可视化显示嵌入按偏度/峰度聚类这种分布级语义不依赖具体表格。表示坍缩是什么RoPE 为什么能解决当所有特征服从同一分布时置换不变自注意力无法区分不同样本行嵌入塌缩成一点。RoPE 给特征位置编码相对信息打破对称性代价是损失列置换不变性靠集成近似恢复。参考链接arXiv 论文页https://arxiv.org/abs/2502.05564项目网站代码 预训练权重https://github.com/Qu-Jingang/TabICLTabPFNICLR 2023https://arxiv.org/abs/2207.01848TabPFNv2NeurIPS 2024https://arxiv.org/abs/2501.01439TALENT 基准https://github.com/zyphan/TALENT给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件