MulTaBench: Benchmarking Multimodal Tabular Learning with Text and Image¶
会议: NeurIPS2026 Spotlight(按提供清单元数据)
arXiv: 2605.10616
论文: https://arxiv.org/abs/2605.10616
代码: https://github.com/alanarazi7/MulTaBench
领域: 多模态 VLM
关键词: 多模态表格学习、目标感知表示、基准筛选、冻结嵌入、表格基础模型
一句话总结¶
MulTaBench 用“多模态确有互补收益”和“目标感知表示优于冻结嵌入”两道经验筛选,构建包含 20 个图像–表格与 20 个文本–表格任务的基准,并发现表示适配的收益可推广到新学习器,但并非每个入选数据集都稳定受益。
研究背景与动机¶
表格基础模型已经能处理数值与类别列,却通常不能直接消费图像或长文本。常见解决办法是先用预训练编码器抽取固定向量,再把向量当作额外特征列交给 TabPFN 或树模型。这条路线保留了强表格学习器,但把非结构化输入压缩成了一份与预测目标无关的摘要:同一张影像用于判断病变、估计年龄或识别扫描类型,需要保留的信息并不相同。
已有多模态表格基准往往先检查“有没有文本或图像”,没有系统区分“模态存在”与“模态提供额外信号”,更没有区分“通用嵌入已经足够”与“必须按目标重新组织表示”。如果结构列已经解释了几乎全部标签,或者冻结编码器已经保留了必要信息,联合适配模型的优势自然难以显现。较强的编码器和轻量适配技术使这种区别现在可以被实际测量,而不只是概念上的倡议。
本文因此没有提出新的融合网络,而是改变测试集的组织方式:先让不同学习器在受控输入条件下竞争,再保留同时需要模态互补和表示适配的任务。核心 idea:用可复现的双重筛选,专门隔离冻结嵌入遗漏目标相关信息的多模态表格问题,而不是把所有含多种输入的数据集混成一个通用排行榜。
方法详解¶
整体框架¶
MulTaBench 是一个基准及其筛选协议,而不是一个端到端模型。候选任务的每行包含数值/类别结构列,以及文本或图像;输出仍是该行的分类标签或回归目标。作者在同一任务上比较结构单模态、非结构单模态、联合冻结表示、联合目标感知表示四种条件,再利用跨学习器的一致性决定是否入选。
基准的三个关键区分是:冻结表示能否补充结构列,结构列能否补充非结构输入,以及按标签适配后的表示能否进一步提升联合预测。它们分别排除退化为纯表格任务、纯文本/视觉任务、或仅需通用嵌入的简单融合任务。由于核心贡献是任务筛选与分析,这里不把实验条件画成网络结构图。
目标感知表示(Target-Aware Representations,TAR)的实现只用于提供一个可测量的适配探针。编码器先仅凭非结构输入和训练标签适配,随后其输出与结构列拼接交给下游表格学习器;结构列不参与这一编码器适配过程,也没有来自下游学习器的联合反向传播。
关键设计¶
1. 互补信号检验:联合预测必须胜过最强单模态基线
一份表里同时有照片、描述和价格,并不证明模型需要多模态推断。例如,描述可能只是重复已有类别列,或结构列已经完全透露目标。作者固定非结构化表示,比较四种条件中的前三种:结构单模态只保留数值和类别列;非结构单模态只保留冻结编码器生成的向量;联合冻结条件同时使用两者。三者共用下游学习器,避免把融合收益与更换学习器混为一谈。
所谓联合信号,不是联合模型胜过任意一个较弱基线,而是必须胜过两种单模态中较强的一种。这说明去掉任一模态都会损失预测能力,但并不要求证明某种特定的跨模态交互机制;简单的互补信号也能满足条件。设 \(S_m\) 为学习器 \(m\) 在各运行上平均的 AUC 或 \(R^2\),原文的联合增益为:
这个定义尤其重要:如果图像已能独立预测标签,而结构列只是一组无关元数据,联合图像–表格结果即使很高,也不能据此称为有代表性的多模态表格任务。
2. 目标感知表示探针:用标签适配测出冻结压缩的盲区
文本使用 e5-small-v2,图像使用 DINO-v3-small;小模型输出 384 维表示。冻结条件直接抽取通用嵌入,TAR 条件则在编码器最后 3 层加入 LoRA,用预测目标训练一个线性分类头。适配只发生于训练划分内部,使用 90/10 的训练/验证划分选择检查点,测试集不参加表示学习。这一步对各下游学习器共享,目的在于尽量隔离“换了表示”本身的作用。
回归任务并非直接以连续目标回归来训练编码器。作者先把训练目标划成 20 个等频区间,再用区间分类的交叉熵进行适配,以降低异常值造成的不稳定;最终的表格学习器仍预测原来的回归目标。因此,回归标签离散化是 TAR 的预处理训练策略,不是把整个基准的回归评测改成分类。
文本可能有多列,作者为效率共用一个 e5 编码器。每个“行–文本列”组合形成一个训练样本,输入由列名与列值组成,监督标签取该行目标;编码器在所有文本列上共同适配。这样可以学到列语境,但也可能使不同文本字段之间互相干扰,不能等同于每列都有独立专用编码器。
冻结和 TAR 表示默认都经 PCA 压到 30 维,再作为特征交给表格学习器。联合 TAR 条件保留同样的结构列,只替换非结构表示;两者之差定义目标感知增益:
这是一种算法相关的操作性定义:测出的是当前通用编码器及适配方案在这个任务上的不足,不是证明所有可能的冻结编码器都必然失败。作者的更长远目标是让表示受到目标及其他模态的共同影响,但本文探针没有实现后者。
3. 跨学习器共同通过:避免一套算法单独决定任务价值
筛选委员会包含 LightGBM、CatBoost、TabM、TabPFNv2 和 TabPFN-2.5,覆盖树模型、MLP 与表格基础模型。每个候选都运行 4 条件、5 学习器、5 随机种子;每次运行控制样本规模,上限为 10,000,附录进一步表述为每折训练样本上限。分类使用 AUC,回归使用 \(R^2\)。
两项要求必须在同一个学习器上同时成立,才计一票;不能由三种模型通过联合信号、另三种模型通过目标感知,再拼成通过结论。默认最小增益为 \(\delta=0.001\),至少 3/5 学习器支持。原文先把平均分数舍入到三位小数,因而这个阈值也是规则能够表达的最小正增益。
这一“通过”是经验增益阈值与多数共识,不等于对每个候选单独完成统计显著性检验。附录随后针对更广模型池做配对检验,并发现有三个入选任务的 TAR 收益并不显著,正好说明两种判定不能混用。
4. 分层任务集合:把目标感知难例与普通融合任务分开
文本候选来自 4 个已有基准,去重后有 56 个:23 个通过双重条件,即 41%,最终取其中 20 个。图像候选从既有工作中整理出 16 个可用且唯一的任务,只有 5 个通过;作者再从公开数据中整理候选,补足 20 个图像–表格任务。核心 40 个任务覆盖 400–114,000 行、1–245 个结构特征,而不是所有实验都在全量数据上训练。
图像数据统一为每行一个图像,多图记录只保留一张,缺失或损坏图像的行被移除。筛选还可能改变目标或特征,例如将 PetFinder 年龄划成 8 类、删除泄漏标签或过度主导图像信号的结构列。发布版本的任务因此必须连同预处理定义理解,不能直接视为原始数据集的默认任务。数据与图像统一上传到 Kaggle,表中用相对路径关联图像,降低外链失效和原始处理流程不明确的问题。
作者额外发布 40 个满足联合信号的候选,构成总计 80 个任务的扩展集合;它们并不全部缺乏目标感知,其中一些只是较弱通过或为了平衡规模而未进入核心集。这个扩展集合使未来模型可以同时检查“困难适配任务上的提升”和“冻结嵌入已经足够时是否退步”。
三模态则另设更严格的门槛:文本和图像各自都要提供互补信号,各自适配都要改善联合冻结结果,而且同时适配必须优于只适配其中一方。核心图像子集中 9 个任务含文本,只有 PetFinder 和 Amazon Packages 满足全部条件。不能把“存在三个模态字段”的 9 个任务全称为严格三模态基准;整个 80 个任务集合虽有 22 个三模态候选,也未全部完成相同筛选。
损失函数 / 训练策略¶
LoRA 的固定配置为秩 16、缩放系数 32、dropout 0.1;使用 AdamW,权重衰减 0.01、batch size 256。e5 学习率为 \(10^{-4}\),最多 50 个 epoch;DINO 学习率为 0.001,最多 100 个 epoch;验证损失连续 3 个 epoch 不改善时早停。分类目标与回归目标的分箱标签均通过交叉熵监督编码器。
论文没有逐数据集做编码器或下游学习器的超参数优化。冻结/TAR 比较检验的是固定预算下的表示价值,不是每个方法充分调参后的最优排名。跨任务汇总图对分数做 min–max 归一化;逐数据集结果表仍报告原始 AUC 或 \(R^2\),且汇总前截断负 \(R^2\),两种呈现不应混用。
实验关键数据¶
主实验¶
下表节选原文附录表 11–12,展示联合冻结与联合 TAR 的逐数据集结果。图像侧平均 12 个学习器、文本侧平均 10 个学习器,每个包含 5 次运行;并非仅筛选委员会,也不是新模型与前 SOTA 的对比。增益列照录原文报告值。
| 数据集 | 指标 | Joint Frozen | Joint TAR | 原文增益 | 校正后 p 值 |
|---|---|---|---|---|---|
| Mango Mass | \(R^2\) | 0.533 | 0.653 | +0.120 | <0.001 |
| CheXpert | AUC | 0.762 | 0.803 | +0.041 | <0.001 |
| CS:GO Skins | AUC | 0.871 | 0.870 | −0.001 | 0.763 |
| Jigsaw Toxicity | AUC | 0.806 | 0.926 | +0.119 | <0.001 |
| Video Games Sales | \(R^2\) | 0.348 | 0.385 | +0.036 | 0.004 |
| Fake Job Postings | AUC | 0.916 | 0.918 | +0.002 | 0.459 |
原文显示值存在舍入不一致:Jigsaw Toxicity 的 0.926−0.806 为 0.120,但增益列报告 0.119;Video Games Sales 的显示值差为 0.037,但报告 0.036。这里保留原文各列,不自行修成一致,也不把报告增益说成从显示值精确计算所得。
对每个任务,作者按相同学习器和相同折配对 TAR/Frozen 结果,做单侧配对 t 检验,再对全部 40 项检验进行 Benjamini–Hochberg 校正,显著性水平 0.05。37/40 个任务显著受益:图像 18/20、文本 19/20;例外是 Painting Price、CS:GO Skins 和 Fake Job Postings。统计结果支持总体趋势,但不支持“所有任务都提升”。
消融实验¶
PetFinder 的年龄八分类分析直接比较三模态冻结与不同适配组合。下表节选原文表 2 的完整五个学习器行;数字为 AUC 百分数,不是跨数据集归一化分数。
| 学习器 | S+I+T 全冻结 | 仅图像 TAR | 仅文本 TAR | 图像与文本均 TAR |
|---|---|---|---|---|
| LightGBM | 81.1 | 82.8 | 84.2 | 85.7 |
| CatBoost | 83.2 | 83.9 | 85.2 | 86.4 |
| TabM | 84.2 | 84.8 | 86.3 | 87.0 |
| TabPFNv2 | 83.9 | 84.5 | 86.3 | 87.1 |
| TabPFN-2.5 | 84.9 | 85.3 | 87.3 | 88.0 |
S、I、T 分别指结构列、图像和文本。两个编码器的 TAR 各自使用行标签适配,不表示它们与结构列一起端到端训练;同时适配最好,意味着两个适配收益在这个任务上没有完全冗余。
筛选阈值的敏感性见原文表 15。下表是核心 40 个任务中仍被保留的数量,提供的是任务集合分析,而非某个网络模块的消融。
| 最小增益 \(\delta\) | 共识 3/5 | 共识 4/5 | 共识 5/5 |
|---|---|---|---|
| 0.001 | 40 | 33 | 23 |
| 0.002 | 36 | 30 | 20 |
| 0.005 | 30 | 21 | 13 |
| 0.01 | 21 | 12 | 2 |
| 0.02 | 7 | 3 | 2 |
关键发现¶
- 更换学习器仍能得到 TAR 收益,但强弱不同:跨全部任务的运行级胜率,CatBoost 为 91.5%,RandomForest 为 87.5%,TabICLv2 为 65.0%。胜率不是 AUC,也不是最优模型的排名。
- 更大的编码器不能替代目标适配:Large 版本约有 10 倍参数、输出 1024 维,TAR 仍优于冻结版本;原文还报告 Small TAR 优于 Large Frozen。
- PCA 不是唯一原因:15、30、60 维下均有收益;无 PCA 的验证仅覆盖 CatBoost、LightGBM 和 33 个任务,排除了超过 5 个文本特征的数据集,不应扩称为所有模型的全量验证。
- 换筛选委员会的分析只在 56 个文本候选上展开:10 个学习器组成的 252 种五模型委员会中,17 个任务始终通过,16 个始终失败,仍有 4 个任务通过率为 50.0%,边界案例没有消失。
亮点与洞察¶
- 把“多模态”变成可检验性质。 一份输入里有多个模态不再足以入选,移除任一模态必须真正造成预测损失。这能避免融合模型在实际上不需要融合的任务上被误判。
- 把表示问题与表格问题分开观察。 用共享适配嵌入替换冻结嵌入后,树模型同样受益,说明瓶颈不完全在下游神经网络融合能力。改进表格基础模型时,检查非结构化信息是否在进入表格模型前就丢失,同样重要。
- 核心集与扩展集共同约束模型。 只在经过适配筛选的核心集上获胜可能是针对性优化;同时在扩展集保持强表现,才能更有力地支持通用多模态表格能力。
局限与展望¶
- 筛选依赖指定编码器、LoRA 探针和学习器,任务性质与算法能力有意纠缠。筛选模型的排名存在选择偏差,MulTaBench 不能被当作无偏通用 SOTA 排行榜。
- 表示适配成本很高。单 A100 40GB、8 CPU 核条件下,LightGBM 搭配小图像编码器的中位总耗时从 141 秒增至 287 秒;小文本编码器从 223 秒增至 2,417 秒,大文本编码器从 1,284 秒增至 10,867 秒。交叉验证及调参还会放大重复适配开销。
- 图像单列化、目标分箱和删除强结构特征塑造了基准难度,不等于未经干预的部署分布。医疗任务也只是基准预测,不能据此推断临床泛化效果。
- 没有评测自回归 LLM/VLM;TIME 和 MultiModalPFN 也因代码可用性或接口问题未纳入。注意力可视化支持“关注区域变化”,但不是信息被保留的因果证明。
- 后续值得研究在不频繁更新参数的情况下,让上下文学习同时条件化图像/文本表示,并在核心集和扩展集、多个数据划分下共同验证。更严格的筛选与专门的三模态集合也能减少边界案例。
相关工作与启发¶
- vs CARTE / TextTabBench:前者主要包含短字符串和高基数类别,后者强调文本与结构列均有信号;MulTaBench 进一步要求目标适配有收益。因此在旧基准领先,不保证在这里仍领先。
- vs TabSTAR / AutoGluon-Multimodal:这些方法具有联合建模或适配能力,MulTaBench 提供检验这类能力的任务,而不是再提出一个同类模型。本文 TAR 预处理不能与这些系统的端到端训练混称。
- vs ConTextTab / MultiModalPFN:静态表示可保留通用语义,却未必保留当前预测目标需要的细节。可迁移的启发是先确定编码器摘要丢了什么,再讨论更复杂的融合架构是否值得。
评分¶
- 新颖性: 4/5。把目标感知纳入数据集筛选,而不是仅强调模态共存。
- 实验充分度: 4/5。覆盖多学习器、规模、维度与阈值,但缺少部分相关系统及充分调参。
- 写作质量: 4/5。概念与操作判据清晰,部分表格显示值和报告增益存在舍入差异。
- 价值: 4/5。适合作为多模态表格表示研究的针对性测试,不宜替代通用表格排行榜。