跳转至

Binding Multiple Modalities via Multimodal Wasserstein Barycenter

会议: NeurIPS 2026 Oral(据 arXiv comment,未独立核验官方录用页)
arXiv: 2609.33800
领域: 多模态 VLM
关键词: 多模态对齐、Wasserstein 重心、最优传输、体积对比学习、缺失模态

一句话总结

BaryBind 用可学习的 Wasserstein 重心映射替代固定模态锚点,再围绕重心对多模态差向量做体积对比学习,在 VAST 骨干上的零样本检索与分类实验中取得提升,但其公开公式的对偶推导、势函数抵消及部分实验数字存在需要核实的不一致。

研究背景与动机

CLIP 式对比学习擅长处理图文两种模态,扩展到文本、视频、音频、字幕和深度后,问题不只是多加几个编码器。ImageBind 以视觉为连接枢纽,LanguageBind 以语言为连接枢纽;在这种组织方式下,其他模态主要学习靠近某个既有模态的表示。不同传感器捕捉的语义并不完全相同:文本可能漏掉声音,声音也不一定描述视觉实体。把某一种模态当作唯一参照,可能让它容易表达的内容主导共同空间,而弱模态的信息被压缩。VAST 是本文直接基线,作者将双向检索召回率的不对称视为这种偏置的一种经验信号,但召回率差也会受候选集和标注结构影响,不能直接等同于偏置大小。

GRAM、Triangle 等方法已经尝试用多向量几何量替代两两余弦相似度,不过本文认为仅改变相似度还不够:如果几何结构仍依赖一个未经优化的特定模态参照,其他模态仍须向它适应。BaryBind 因而把“参照是什么”和“怎样围绕参照对齐”分开处理。前者借助最优传输,寻找相对于多个特征分布较居中的分布;后者借助重心与模态差向量共同构成的几何结构,建立批内正负样本对比。这里的“共同语义中心”是表示学习的目标和解释,不是已经被证明唯一存在、能消除所有模态差异的真实语义对象。

重心也不能简单理解为把一个样本的文本、视频和音频向量平均。平均向量只是映射的可选输入,论文真正要学习的是一个输出分布及其产生方式;附录比较了直接平均、从平均向量学习映射、从文本或视频学习映射,意图说明收益来自优化后的参照而非输入选择本身。核心 idea:先学习一个由多模态分布共同约束的重心参照,再用围绕该参照的体积对比目标联合组织多模态表示,而不让固定文本或图像表示永久充当唯一中心。

方法详解

整体框架

输入是同一事件的多模态数据,输出是可供检索、分类等任务使用的对齐特征与重心表示。文本由 BERT-B 编码,音频由 BEATs 编码,视觉由 EVA-CLIP-ViT-G 编码;模型延续 VAST 的骨干,但移除其模态融合层,增加轻量 MLP。字幕可作为额外模态,深度由 ChronoDepth 生成,并通过视觉编码器上的额外轻量头接入。

训练先以可用模态特征的平均值或某个指定模态作为 initializer,经重心映射得到参照;MWB 目标尝试把这一输出分布推向多模态 Wasserstein 重心。随后 BVC 使用参照向量和各模态到参照的差向量计算体积,比较同一样本与批内错配样本。DAM 则另用匹配判别监督,补充实例级对应关系;它不是重心求解器。

推理不需要运行势函数的交替最大化。模型使用学到的编码器及重心映射形成查询、候选或分类所需表示;附录展示了“查询→重心空间→其他模态”的检索路径。缺少某种模态时只能利用实际可见输入,不能把训练时的完整模态平均值当作测试时必然可获得的特征。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["可用模态输入"] --> E["模态编码器"]
    E --> W["MWB"]
    W -->|训练:重心与差向量| C["BVC"]
    E -->|训练:模态特征| C
    E -->|训练:匹配与错配输入| M["DAM"]
    W -.->|重心目标| O["联合更新编码器与映射"]
    C -.->|对比监督| O
    M -.->|匹配监督| O
    W -->|推理:学习后的重心表示| I["检索或分类"]
    E -->|推理:学习后的模态表示| I

关键设计

1. MWB:学习分布层面的几何参照,而非直接平均样本

设各模态编码特征的分布为 \(\mathbb{P}_k\),论文希望找到一个分布 \(\mathbb{Q}\),使它到各模态分布的加权 Wasserstein 距离最小。本文采用欧氏范数运输成本,而不是默认的平方欧氏成本;这一区别会影响重心性质,不能把所有 Wasserstein-2 重心的直觉直接搬过来。论文的目标可写为:

\[ \mathbb{Q}^{*}\in\arg\min_{\mathbb{Q}}\sum_{k=1}^{K}\lambda_k W(\mathbb{P}_k,\mathbb{Q}),\qquad \lambda_k=1/K. \]

它优化的是概率分布之间的运输关系,不是每组配对特征的逐坐标算术均值。实践中模型并不显式保存完整运输计划,而是用 MLP 映射 \(T_\theta\) 把 initializer \(\bm m_0\) 转换为重心特征 \(\bm b\),由大量输出特征形成近似重心分布。正文说 initializer 默认取所有可用特征的平均值;实验说明和若干附录实验又以文本为输入。两种选择都在论文中出现,因此应按具体表格的协议理解,不把它们混成一个确定配置。

为近似求解该目标,作者引入各模态的神经势函数,并以减去加权平均势函数的方式硬性满足零和约束。各个原始势函数由两层 MLP 参数化,势函数执行梯度上升,映射执行梯度下降;这一设计意图避免使用固定原始锚点,并让多个模态都影响参照的更新。

\[ f_{\omega_k}(\bm b)=g_{\omega_k}(\bm b)-\sum_{\ell=1}^{K}\lambda_\ell g_{\omega_\ell}(\bm b),\qquad \sum_{k=1}^{K}\lambda_k f_{\omega_k}(\bm b)=0. \]

但公开文本存在关键可复现性疑点。式 (5) 对所有模态使用同一个 \(T_\theta(\bm m_0)\) 评估势函数;如果各项按同一配对样本或同一重心分布取期望,那么加权势函数项会按上述约束精确抵消。按字面实现,MWB 中的势函数最大化就不再产生非平凡作用,不能未经核实写成一个已被确认有效的对偶博弈。若作者实现实际使用模态依赖运输映射或不同采样机制,需要代码或进一步说明才能确认;笔记不补造这样的实现。

附录 A.1 先从含逐模态成本变换的对偶出发,随后把下确界移到积分外,并以共享重心及线性为理由交换求和与下确界。这些交换一般不能仅凭线性成立;使用边缘分布的期望也不自动等价于在合法运输耦合上的优化。附录还把势函数的同余条件一度写成 1,随后又恢复为 0。这些都是当前文本中的推导疑点,不能用读者自行修正的公式替代作者的精确算法。

定理 3.2 将近似输出分布的误差联系到映射优化误差与对偶误差,但前提是“运输成本减势函数”关于重心变量满足强凸性。普通 MLP、欧氏范数成本或权重衰减并不自动满足这一前提;欧氏范数在某些方向上本就不具严格曲率。附录证明还依赖一个共享的最优映射与相应运输关系,不能据此宣称真实训练必然收敛到唯一正确的全局语义中心。理论应作为有条件的分析,而不是所有实践配置的质量保证。

2. BVC:用重心与差向量的联合体积组织正负样本

有了参照之后,作者不再只比较文本与视频、文本与音频各自的相似度,而是先计算每个模态相对重心的差向量 \(\bm r_k\),再将重心向量本身和这些差向量排成矩阵。重心向量保留参照方向,差向量表达模态偏离参照的方向;它们的 Gram 行列式提供一个同时依赖多向量关系的几何量。

\[ \bm r_k=\bm b-\bm m_k,\qquad R=(\bm b,\bm r_1,\ldots,\bm r_K),\qquad V^2=\det(R^{\top}R). \]

这里沿用正文式 (9) 的简洁记法。附录 A.3 实际讨论的是归一化向量之间的余弦 Gram 矩阵:采用这种约定时,构造 Gram 前还须归一化各列,不能把原始向量内积和余弦相似度不加区分地混用。普通 Gram 行列式给出平行多面体体积的平方;论文称其为重心单纯形体积,而真正单纯形的体积还涉及阶乘因子。附录 B.8 专门比较了体积归一化,因此笔记把 \(V\) 理解为论文使用的几何评分,不将其绝对数值视为跨模态数量可直接比较的物理体积。

BVC 把同一个样本的重心与整组差向量作为正例,把“当前重心配其他样本的整组差向量”以及反向组合作为负例。评分取负体积再除以温度,因此低体积对应较高相似度;两项批内对比分别在固定重心和固定差向量组的方向上进行。它不是枚举所有可能的多模态错配,也不是要求每条模态边分别达到某个余弦阈值。

更高阶的几何量可以感知两两评分遗漏的联合结构,但“小体积”并不等价于“所有模态语义都正确对齐”。只要列向量线性相关,行列式就可能退化为零,即使有些向量夹角很大;方向相反也可能给出退化结构。若采用归一化差向量,还需明确零差向量的数值处理。正负样本对比、MWB 和 DAM 因而不是可有可无的装饰,而是让这个几何评分与实例语义产生关联的训练条件。

作者展示了较小体积与 MSR-VTT 检索表现的负相关,附录报告相关系数为 -0.9844。这是特定实验轨迹或采样下的经验关联,不是体积指标在任意数据上都能保证语义正确的定理。特别是新增字幕和估计深度可能增加的是已有视频的派生信息,不能据此推断对任意独立传感器都同样有效。

3. DAM:用实例匹配监督补充几何对齐

体积评分概括的是特征布局,仍需要告诉网络哪些输入真正对应同一事件。DAM 沿用 VAST 的匹配判别思路:将指定锚点的编码结果与拼接的非锚点特征通过交叉注意力结合,再用两层 MLP 输出匹配概率。配对输入作为正样本,错配输入作为负样本,二分类监督提供比单一几何评分更直接的实例对应信号。

DAM 是训练侧的辅助判别路径,不意味着推理必须拿到全部模态,也不意味着它会重建缺失音频。其作用在消融中可观察:保留 MWB+BVC 而移除 DAM 后,MSR-VTT 的 T2V/V2T 从 56.1/53.6 变为 54.8/51.1。这个对照支持辅助匹配有贡献,但也说明不能把完整系统的全部提升都归因于重心求解器。

正文式 (11) 写的是没有负号的二元对数似然,式 (12) 却把它加进最小化目标。按常见二分类训练语义,需要负对数似然或相反优化方向;当前文本没有明确消除这处符号冲突。笔记仅说明作者意图与报告的消融结果,不自行添加负号并称之为作者原式。

一个完整示例

考虑同一段“猫叫”的视频、音频和文本描述,以及批内另一段“海浪”的多模态样本。编码器分别产生特征,模型可以用猫叫样本的三模态平均特征作为 initializer,经 MLP 得到猫叫样本的重心参照;也可以在指定协议中从文本特征出发。平均输入与学习后的输出是两步,不能跳过 MLP 后直接把平均值称为已求得的 Wasserstein 重心。

BVC 将猫叫参照和猫叫的差向量组组成正例,将猫叫参照和海浪的差向量组组成负例,再做反向对比。DAM 同时检查输入是否匹配,给出实例级监督。这个例子解释训练数据流,不暗示几何体积为零就一定能识别猫,也没有给原文未报告的单样本体积编造数字。

若在后续继续训练中拿掉音频,重心优化只能由文本和视频驱动;在 AudioCaps 音频检索测试时,音频输入又是实际可用的查询或候选。这样的实验测试的是已有系统在特定阶段缺模态后的跨模态迁移,不能理解为从未接触过声音的模型凭空获得听觉语义。

损失函数 / 训练策略

总体训练联合 MWB、BVC 和 DAM。默认 BVC 权重为 1,DAM 权重为 0.1,温度为 0.07,模态分布权重均匀。算法 1 对势函数使用上升更新,对编码器和重心映射使用下降更新;它把势函数的步长写成其他网络的两倍。这里描述的是论文给出的更新流程,其有效性仍受前述抵消和符号疑点约束。

主实验是在已有 VAST 模型上,用 VAST-27M 的 150,000 样本子集继续预训练,因为完整数据不可获得。继续训练使用每例一帧和 10 秒音频,10,000 步、批量 256、初始学习率 1e-4 与线性衰减;硬件为两张 A100。另有从头训练实验,每例八帧、批量 64、四个 epoch,不能与继续预训练的零样本表混为同一训练预算。

“零样本”表示报告的下游评估不再针对该任务做常规微调,并不表示骨干没有预训练、多模态从未配对,或完全没有使用目标测试集信息。附录 B.2 明确写到每 100 步在 MSR-VTT 测试集评估并选取最好 checkpoint;这带来测试集参与模型选择的风险,应与严格测试集隔离的零样本结果区别看待。

实验关键数据

主实验

以下百分数直接取自正文表 1、表 2。T2V/V2T 列为两个方向的 R@1,T-VA 表示文本与视频、音频组合的评估配置;不能把加入字幕或深度后的结果当作相同输入预算。

数据集与配置 指标 VAST BaryBind 提升(百分点)
MSR-VTT,T-VA T2V / V2T R@1 49.3 / 43.7 56.1 / 53.6 +6.8 / +9.9
DiDeMo,T-VA T2V / V2T R@1 49.5 / 48.2 56.3 / 54.0 +6.8 / +5.8
ActivityNet,T-VA T2V / V2T R@1 51.4 / 46.8 60.6 / 57.2 +9.2 / +10.4
VATEX,T-VA T2V / V2T R@1 80.0 / 77.3 84.7 / 81.8 +4.7 / +4.5
VGGSound5K,A Acc@1 / Acc@5 40.3 / 71.7 45.7 / 75.2 +5.4 / +3.5
VGGSound5K,V Acc@1 / Acc@5 46.3 / 72.7 48.3 / 76.4 +2.0 / +3.7
VGGSound5K,A+V Acc@1 / Acc@5 48.1 / 79.6 55.6 / 83.4 +7.5 / +3.8

MSR-VTT 的双向差距由 5.6 缩小为 2.5 个百分点,即缩小 3.1;这是由表 2 的 56.1 与 53.6 直接计算。正文却写 BaryBind 差距为 2.8,并把 DiDeMo T2V 写成 56.1,而表 2 为 56.3;本笔记采用表格数值并保留冲突说明,不把正文数字悄悄改成一致。

消融实验

下表取正文表 5 的部分配置,分类列全部为 Acc@1,检索列全部为 R@1。TV+TA CL 指文本—视频与文本—音频两两对比;每行对应独立训练配置,不是测试时删除输入模态。

配置 VGGSound A / V / A+V MSR-VTT T2V / V2T
TV+TA CL 38.1 / 42.8 / 44.5 46.8 / 40.1
TV+TA CL + DAM 40.3 / 43.6 / 46.3 49.3 / 43.7
TV+TA CL + MWB + DAM 44.3 / 46.8 / 49.8 50.6 / 48.8
BVC + DAM 42.9 / 47.1 / 50.1 51.5 / 46.8
MWB + BVC 45.2 / 47.8 / 54.7 54.8 / 51.1
MWB + BVC + DAM 45.7 / 48.3 / 55.6 56.1 / 53.6

表 5 的“TV+TA CL + DAM”分类值与表 1 的 VAST 不同:前者 V/A+V 为 43.6/46.3,后者为 46.3/48.1。因此上述消融只在表 5 内比较,不能套用表 1 的分类基线计算其增益。原文消融说明把 55.6 称为音频分类,表 5 实际对应 A+V;本笔记保留正确列归属。

缺失模态结果则来自正文表 3、表 4,必须分清训练缺失和推理缺失。

任务与协议 指标 VAST BaryBind
AudioCaps,训练含 T-VA T2A / A2T R@1 32.1 / 26.1 35.7 / 32.5
AudioCaps,训练只含 T-V T2A / A2T R@1 10.4 / 6.7 21.2 / 14.5
VGGSound5K,训练含 A+V,推理含 A+V Acc@1 / Acc@5 48.1 / 79.6 55.6 / 83.4
VGGSound5K,训练含 A+V,推理只含 A Acc@1 / Acc@5 40.8 / 71.6 49.4 / 78.3

关键发现

  • 在表 5 的固定协议内,加入 MWB 后,TV+TA CL+DAM 的 V2T 从 43.7 到 48.8;完整配置相对 BVC+DAM 的 V2T 从 46.8 到 53.6,支持重心学习与几何对齐互补。
  • 缺音频训练时 BaryBind 的 T2A/A2T 为 21.2/14.5,低于完整训练的 35.7/32.5;优势是相对基线退化更小,而非缺模态没有代价。已有 VAST 音频预训练知识的保留方式未在该协议中完整交代。
  • 扩展至 T-VASD 后,正文表 2 的 MSR-VTT 达到 57.8/54.6;但附录表 11、表 22 在类似配置下数字不同,不能把所有附录结果当作同一次评估的完全复现。
  • 附录表 24 的 TA2I FID 为 38.6,VAST 为 50.6;生成使用单独的 CLIP ViT-H/14、ImageBind 音频编码器和 Stable UnCLIP 解码器,不是直接证明主检索骨干已具备生成能力。

亮点与洞察

  • 将“学习参照”与“围绕参照对齐”拆开,比只替换相似度函数更明确。附录的平均特征 initializer 对照尤其重要,它提醒读者不要把对称融合输入误当作完成了分布重心优化。
  • 同时报告双向检索与单模态、联合模态分类,能观察收益是否只偏向一种查询方向。但这些只是模态平衡的代理指标,需要结合候选分布、标注粒度和任务难度解释。
  • 缺模态实验提供了两种不同压力测试:继续训练没有音频,以及推理没有视频。两者不应合并成笼统的“任意模态缺失鲁棒性”。

局限与展望

  • 理论与实现的接口尚不清晰:共享重心处的硬零和势函数会抵消,对偶推导的下确界交换也需补充条件。应先公开可执行代码与采样细节,再判断求解器是否实现了声明的分布运输目标。
  • BVC 的退化体积不保证所有模态对都语义正确。可进一步报告最差模态对表现、错配和矛盾输入测试,以及归一化、零向量和行列式数值稳定性的具体处理。
  • 结果存在多处正文—表格或表格—附录冲突,且没有误差条。附录承认只使用固定随机种子;固定种子并不能替代多次运行的统计显著性分析。
  • 测试集参与 checkpoint 选择削弱严格零样本泛化结论。应采用独立验证集,并明确缺音频训练时哪些预训练音频模块被冻结、更新或保留。
  • 附录表 19 的单步时间从 VAST 约 8.8 秒增加到 BaryBind 约 9.7 秒,参数从 1.28B 到 1.34B;增加并非完全为零。向大多模态语言模型、重建目标和真实独立传感器迁移仍是展望,不是已验证能力。

相关工作与启发

  • vs VAST:VAST 提供本文的预训练骨干与主要比较基础;BaryBind 移除融合层,加入重心映射及联合几何目标。结果应首先理解为该骨干和数据预算上的继续训练改进。
  • vs ImageBind / LanguageBind:它们以指定模态绑定其他模态,BaryBind 希望优化参照本身。initializer 仍可以来自文本,这与“最终参照不再固定为原始文本特征”并不矛盾,但也不构成无偏保证。
  • vs GRAM / Triangle:都利用多向量几何关系;本文的区别是增加重心优化,并以重心和差向量构造评分。真正需要验证的是优化后的参照是否带来额外、稳定的收益,而不只是改变几何名称。

评分

  • 新颖性: 4/5 — 学习几何参照与体积对齐的组合有辨识度,但需澄清对偶求解实现。
  • 实验充分度: 3/5 — 任务与消融较广,测试集模型选择、无误差条和数字冲突降低证据强度。
  • 写作质量: 2/5 — 主线清晰,但公式、列归属与跨表数字一致性存在实质问题。
  • 价值: 4/5 — 对多模态锚点偏置提供有用研究视角,实践复用应以实现核验为前提。