跳转至

MultiMem: Measuring and Mitigating Memorization in Multi-Modal Contrastive Learning

会议: ECCV 2026
arXiv: 2606.22220
论文: ECCV 原文
领域: 多模态VLM
关键词: 多模态对比学习, 样本记忆, 跨模态一致性, 泛化性, 记忆缓解

一句话总结

提出了首个面向任意模态组合对比学习的通用样本记忆度量 MultiMem,揭示跨模态语义失配是引发异常高记忆的核心根源,并基于此设计了训练中自适应定向加噪与后训练子集微调的记忆缓解策略,显著改善多模态检索与零样本泛化能力。

研究背景与动机

多模态对比学习(如 CLIP、VideoCLIP、AudioCLIP、ImageBind 等)通过在统一表征空间中对齐图像、文本、音频和视频等异构输入,在零样本分类、跨模态检索与多模态问答等任务中取得了巨大突破。以往在单模态视觉领域的监督学习(SL)与自监督学习(SSL)研究表明,模型对训练集中长尾或非典型样本的“记忆(Memorization)”对于泛化至关重要,但对噪声、离群点或错误标注样本的过度记忆则会严重损害模型的鲁棒性与泛化边界。然而,当输入扩展到多种异构模态时,跨模态信息天然存在语义粒度不对齐、信噪比差异悬殊以及多模态联合分布复杂等挑战,多模态对比学习中模型究竟“记住了什么”、其记忆机制与泛化能力之间存在何种内在关联,此前在学术界依然处于空白。

现有的样本记忆度量范式均无法直接适配复杂的多模态对比学习场景。监督学习依赖标签预测翻转概率(如基于留一法 Feldman 框架),自监督学习依赖单模态增广视图间表征距离的变化,而双模态领域的代表性工作(如 CLIPMem 和 déjà vu)仅能孤立计算图像与文本成对间的余弦相似度变化。这种在孤立模态对或单模态子集上测量的记忆度量,完全无法捕捉多模态模型全局联合对齐的内在动力学;将已有双模态度量生搬硬套到多模态模型时,甚至会出现局部度量与下游泛化毫无规律的矛盾现象。此外,多模态数据集中大量存在跨模态内容相互矛盾、语义毫无关联的低质样本,这些样本强行拉近会导致表征坍缩与过度记忆。

本文切入的角度在于:多模态对比学习的核心学习目标是在共享空间中最大化多模态表征的跨模态一致性,并拉开与不相关负样本的距离。核心 idea:基于留一法框架构建任意模态通用的全局跨模态一致性度量 MultiMem,精确量化多模态训练样本引起的表征对齐差异,并据此设计训练中动态重组加噪与后训练精调两阶段记忆缓解方案。

方法详解

整体框架

MultiMem 提供了一套从“度量评估”到“靶向缓解”的完整闭环。在评估阶段,系统针对包含 \(n\) 种模态的对比学习模型,基于留一法(Leave-One-Out)训练全量样本模型 \(f\) 与剔除目标样本 \(x_i\) 的对比模型 \(g\)。MultiMem 提出跨模态一致性(Cross-Modal Consistency, CMC)代理,通过联合计算样本 \(x_i\) 内部全模态对之间的表征相似度总和,并扣除该样本与留出无关测试集样本之间的跨模态表征重叠,进而以模型 \(f\)\(g\) 的 CMC 差值定义多模态记忆程度。在缓解阶段,MultiMem 支持训练中自适应加噪与后训练清洗微调两种机制,精准打散过度记忆样本的模态间伪对齐。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["多模态输入样本<br/>音频 / 视频 / 图像 / 文本"] --> B["跨模态一致性代理 CMC 计算<br/>全模态对成对表征内积总和"]
    B --> C["MultiMem 记忆度量判定<br/>全量模型与留一模型 CMC 差异"]
    C -->|高记忆样本识别| D["记忆缓解策略"]
    D --> E["训练中靶向扰动<br/>按周期重组 top 5% 样本加高斯噪声"]
    D --> F["后训练子集微调<br/>剔除高记忆离群样本并在余量集上 fine-tune"]
    E --> G["模态间距恢复与高泛化多模态表征"]
    F --> G

关键设计

1. MultiMem 记忆度量:全模态联合交互的留一评估

以往研究仅孤立考察特定模态对(如图像-文本),无法反映三模态(如 AudioCLIP 的音-图-文)或四模态(如 AVIT-CLIP 的音-视-图-文)全局交互。MultiMem 构建在留一法框架上,设模型包含 \(n\) 种模态,输入样本 \(x_i\) 在各模态编码器输出并经 \(\ell_2\) 归一化后的表征矩阵堆叠为 \(\Phi_{x_i} = [\hat{\phi}_1, \hat{\phi}_2, \dots, \hat{\phi}_n]^\top \in \mathbb{R}^{n \times d}\)。为刻画该样本在共享表征空间的全局语义对齐质量,MultiMem 定义了基于留出参考集 \(H\) 的跨模态一致性代理 \(\text{CMC}(i, H)\)

\[\text{CMC}(i, H) = \underset{(\cdot)' \sim \text{Aug}}{\mathbb{E}} \mathbf{1}_{n}^\top (\Phi_{x_i'} \Phi_{x_i'}^\top) \mathbf{1}_n - \frac{1}{2|H|} \sum_{h \in H} \underset{(\cdot)' \sim \text{Aug}}{\mathbb{E}} \mathbf{1}_{n}^\top (\Phi_{x_i'} \Phi_{h'}^\top) \mathbf{1}_n\]

其中 \(\mathbf{1}_n\) 为全 1 向量,第一项对样本各模态表征间的所有成对余弦相似度求和,第二项消除与无关负样本的背景虚假相关。在此基础上,样本 \(x_i\) 的 MultiMem 分数定义为在完整训练集 \(S\) 上训练的模型 \(f\) 与在剔除样本集合 \(S \setminus \{i\}\) 上训练的模型 \(g\) 的 CMC 得分之差:

\[\text{MultiMem}(i, H, f) = \underset{f \sim S}{\text{CMC}}(i, H) - \underset{g \sim S \setminus \{i\}}{\text{CMC}}(i, H)\]

该指标彻底摆脱了单模态或成对约束,能直接敏感地测定多模态联合优化下每个样本的全局记忆贡献。

2. 训练中靶向扰动:动态重组与自适应表示加噪

直接对全量训练集施加增广或高斯噪声会导致模型整体表征质量下降,并带来巨大的计算开销。基于 MultiMem 揭示的高记忆样本特性,作者设计了训练中的动态拦截机制。在设定的周期节点(如每 10 个 epoch),计算当前阶段所有样本的 MultiMem 分数,筛选出记忆程度最高的前 5% 样本(该比例在消融实验中证实最优)。将这些过度记忆样本重新聚合为独立的 mini-batch,在后续训练步骤中仅对这些 mini-batch 的多模态中间表征注入均值为 0、标准差 \(\sigma = 0.1\) 的高斯噪声作为定向增广,而其余 95% 的常规样本保持原样训练。此设计在不破坏主要语义分布的前提下,特异性地打破了极端语义失配样本在多模态空间的虚假紧贴。

3. 后训练子集微调:高记忆样本离群清洗与再对齐

对于已完成预训练的多模态大模型,重新从头训练成本过高。后训练缓解策略利用 MultiMem 在预训练收敛后对全量训练样本进行系统排查,精准定位并剔除 MultiMem 分数最高的前 \(K\) 个样本(通常 \(K \in [50, 500]\))。研究发现,这些被剔除的样本在跨模态内容上往往呈现严重的语义脱节甚至冲突(如一段街道嘈杂音频硬配上烹饪视频或完全风马牛不相及的文字)。将这些毒化泛化边界的高记忆样本移出后,在剩余干净样本构成的子集上使用极小的微调步数(如 25 个 epoch)进行继续优化,能够平滑恢复原本被畸变压缩的模态间距(Modality Gap),从而大幅度挽回因强制拟合离群样本而损失的泛化精度。

损失函数 / 训练策略

论文所探讨的多模态对比学习基线模型(如 AudioCLIP、AVT-CLIP、AVIT-CLIP)均基于全模态成对 InfoNCE 损失进行端到端联合训练。以 \(n\) 个模态为例,总训练目标为所有模态二元组对称损失的加权和: $\(\mathcal{L} = \sum_{1 \le j < k \le n} w_{jk} \left( \mathcal{L}_{\text{InfoNCE}}(\hat{\phi}_j, \hat{\phi}_k) + \mathcal{L}_{\text{InfoNCE}}(\hat{\phi}_k, \hat{\phi}_j) \right)\)$ 在常规基线中权重均等分配;而在作者提出的模态平衡训练策略中,为纠偏各模态记忆贡献的不均衡性,赋予贡献过大模态对较低的优化权重,使多模态表征空间的记忆分布维持均衡。

实验关键数据

主实验

论文在 AudioCLIP、VideoCLIP、AVT-CLIP 与 AVIT-CLIP 等模型上系统验证了不同缓解策略对下游跨模态检索(TOP@5, T@5)、线性探测(Linear Probing)以及零样本分类(Zero-Shot)的表现。下表汇总了 AudioCLIP(在 UrbanSound8K 训练)在后训练与训练中应用各缓解策略的核心效果:

评估阶段 缓解策略 多模态检索 T@5 (%) 线性探测 Acc (%) 零样本分类 Acc (%) 记忆度量 MultiMem ↓
基线状态 无缓解 (None) 36.9% 76.7% 25.4% 0.332
后训练 随机剔除 (Random) 37.1% 76.8% 25.5% 0.330
后训练 梯度挑选 (Gradient) 38.1% 77.8% 29.4% 0.307
后训练 损失挑选 (Loss) 38.4% 77.9% 29.6% 0.308
后训练 MultiMem (most) 39.3% 78.6% 30.5% 0.282
训练中 随机加噪 (Random) 37.2% 76.9% 25.5% 0.329
训练中 梯度挑选加噪 (Gradient) 40.4% 78.8% 31.1% 0.281
训练中 模态特定增广 (Augmentation) 42.5% 80.1% 34.0% 0.269
训练中 MultiMem (most) 43.3% 80.8% 35.1% 0.262

(数据来源于原文 Table 3: Regulation verification by comparing MultiMem with other mitigation strategies)

消融实验

为了探究对不同模态施加增广(高斯噪声 \(\mu=0, \sigma=0.1\))对模型记忆分布及跨模态检索的具体影响,作者在 AudioCLIP(音频 A、图像 I、文本 T)上进行了系统消融分析:

增广模态配置 IT MultiMem AT MultiMem AI MultiMem AIT MultiMem ↓ T@5 I-T (%) T@5 A-T (%) T@5 A-I (%) T@5 AI-T (%) ↑
无增广 (None) 0.222 0.227 0.214 0.332 33.1 30.8 26.5 36.9
仅音频 (Audio) 0.235 0.201 0.204 0.320 32.2 31.3 27.1 38.2
仅图像 (Image) 0.201 0.235 0.188 0.312 33.8 30.0 28.3 39.0
仅文本 (Text) 0.181 0.191 0.216 0.294 34.4 32.1 26.3 39.8
音频 + 图像 0.200 0.199 0.199 0.299 33.9 31.8 27.5 39.4
音频 + 文本 0.187 0.187 0.192 0.283 34.9 32.6 28.0 40.7
图像 + 文本 0.180 0.189 0.174 0.271 35.4 32.3 29.1 42.1
全部 (Audio+Image+Text) 0.177 0.184 0.169 0.264 35.7 33.0 29.5 43.1

(数据来源于原文 Table 2: Adding augmentations to different modalities in AudioCLIP)

关键发现

  • 局部记忆不能代表全局记忆:在多模态模型中,仅测量双模态对(如 CLIPMem)与模型最终的检索或分类泛化能力无明确单调相关性,只有涵盖所有模态联合交互的全局 MultiMem 展现出与泛化性能高度一致的负相关性。
  • 跨模态语义失配而非单纯标注错误是记忆主因:在双模态 CLIP 中,高记忆样本主要是图像与字幕不符;而在三模态与四模态模型中,高记忆样本往往在所有模态间都不具备相关性,模型为了强行缩小距离而发生严重的过度记忆。
  • 记忆机制从标签驱动演化为跨模态模式驱动:基于 UnitMem 逐层分析发现,随着音频等模态的加入,模型记忆表征向 SSL(自监督学习)对齐而非监督学习,说明文本弱监督的单一支配地位被稀释,模型更加依赖多模态跨维度的底层共有模式。

亮点与洞察

  • 提出首个真正的任意模态记忆度量公式:通过内积全模态交互矩阵与留出集对比项,巧妙将 leave-one-out 范式推广至任意 \(n\) 个模态,兼具严密的统计定义与高效的计算可行性。
  • 揭示了多模态记忆与 Modality Gap 之间的内在规律:高记忆样本表现出极端狭窄的样本内模态距离(强行过拟合),而 MultiMem 靶向缓解不仅能降低有害记忆,还能精准恢复合理的模态间距。
  • 通用性极高的轻量缓解策略:训练中仅需重组 5% 的高记忆样本进行轻微增广,便能在几乎不增加算力成本的前提下,使检索指标飙升 6.4 个百分点(从 36.9% 提升至 43.3%)。

局限与展望

  • 计算复杂度受留一法限制:严格的 MultiMem 需要针对模型训练一对独立模型(\(f\)\(g\)),在大规模数亿级图文多模态预训练场景下直接计算代价高昂,未来需探索基于影响函数(Influence Functions)或一阶梯度近似的极速单模型估计方法。
  • 对模态不对称性缺乏细粒度区分:当前 CMC 采用全模态等权矩阵求和,然而不同模态的信息密度(如视频帧 vs 简短文本标签)存在天然差异,设计自适应模态权重的度量矩阵是后续可优化的方向。

相关工作与启发

  • vs CLIPMem / déjà vu: 后者仅针对双模态图像-文本进行配对分析,无法衡量加入音频、视频后的复杂交叉干扰;MultiMem 泛化到任意模态数量并引入了留出集归一化,能更敏锐地区分全局记忆。
  • vs Feldman 监督学习记忆: 监督学习关注特定离散标签的预测概率突变,而 MultiMem 针对连续跨模态表征空间的余弦一致性展开量化,顺应了现代无监督/自监督多模态表示学习的本质特征。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次系统填补了多模态(>2模态)对比学习中的样本记忆度量与缓解空白,洞察深远。
  • 实验充分度: ⭐⭐⭐⭐⭐ 覆盖双模态至四模态架构,设计了详尽的局部与全局消融、正交增广对比以及逐层机理解释。
  • 写作质量: ⭐⭐⭐⭐⭐ 结构清晰紧凑,数学表达严谨,问题陈述与实验论证高度闭环。
  • 价值: ⭐⭐⭐⭐⭐ 为多模态表征学习的数据清洗、模型鲁棒性增强以及隐私泄露防范提供了理论依据与实用工具。