General Incomplete Multimodal Learning via Dynamic Quality Perception¶
会议: ECCV 2026
论文: ECCV 2026 Poster
代码: https://github.com/Yu-Five/GIML
领域: 多模态 VLM
关键词: 多模态学习、动态质量感知、模态缺失、噪声语义解耦、不完整多模态学习
一句话总结¶
针对真实场景中模态完全缺失与模态内严重噪声污染共存的难题,提出统一不完整多模态学习框架 GIML,将异构缺失模式抽象为连续信息退化,结合噪声-语义解耦表征与可控注入校准的噪声感知质量估计器实现动态自适应融合。
研究背景与动机¶
多模态学习在音视频分析、情感识别以及多模态感知任务中展现出卓越的泛化能力,但在实际部署中,传感器硬件故障、带宽传输瓶颈或恶劣天气往往导致输入数据不完整。现有不完整多模态学习主要聚焦于“模态间缺失(inter-modality missing)”,即假设某些模态在输入端完全丢失,并通过插补生成或联合嵌入对齐来补齐信息。然而在现实物理环境中,模态不完整性更多表现为“模态内退化(intra-modality degradation)”,例如图像模糊、局部遮挡、环境噪声污染等,此时模态虽未彻底丢失但信噪比极低。近期部分工作(如 T2DR、TMDC)尝试分两阶段分别处理模态内去噪和模态间缺失,但跨阶段优化容易引发目标冲突,且依赖针对特定噪声(如纯高斯退化)的确定性特征表示,一旦遇到未见过的噪声模式就会发生语义坍塌。
这种失败的核心矛盾在于:离散的二值缺失假设(缺失为 0、完整为 1)无法刻画现实中从微弱扰动到完全不可用的连续质量衰减,而现有的无监督不确定性估计(如能量分数或简单的特征分布方差)在重度污染下极易对噪声过度自信,使得受污染模态反向主导融合决策。此外,常规编码器提取的确定性向量将任务语义与噪声特征强行缠绕,使得分类器在面对分布外噪声扰动时缺乏鲁棒性。
本文的切入角度是打破离散缺失与阶段式去噪的边界,将模态内质量退化与跨模态完全丢失统一建模为连续谱系上的信息衰减过程。核心 idea:将多模态不完整性建模为连续质量退化谱,通过噪声-语义解耦概率分布显式剥离干扰以提取抗噪语义,并利用可控噪声注入监督校准质量估计器,依据动态感知到的可靠度平滑衰减低质模态权重。
方法详解¶
整体框架¶
GIML 的核心流程涵盖数据退化模拟、特征概率解耦、质量强度感知以及动态自适应融合四个环节。系统首先通过退化注入函数向输入模态施加受控强度的连续噪声(覆盖微扰到全黑遮挡);各模态编码器提取特征后,送入噪声-语义解耦模块(NSD),将表征参数化为高斯分布,其中均值承载任务判别语义,方差捕捉退化不确定性;随后,噪声感知质量估计器(NQE)接收解耦出的不确定性方差并预测真实噪声强度;最后,融合模块根据校准后的退化强度计算逆方差连续权重,对各模态解耦语义进行动态加权聚合。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["多模态输入与连续退化注入<br/>x_i = f_n(x̃_i, η_i)"] --> B["模态编码器提取特征<br/>z_i = f_e(x_i)"]
B --> C["噪声语义解耦模块<br/>高斯参数化与先验约束剥离噪声"]
C --> D["噪声感知质量估计器<br/>轻量映射预测退化强度并梯度截断"]
D --> E["质量感知动态融合<br/>连续指数衰减赋权与自适应汇聚"]
E --> F["下游分类决策与多目标联合优化"]
关键设计¶
1. 噪声语义解耦模块:消除特征缠绕并提取抗噪语义表征
传统确定性特征抽取会将噪声特有的模式编码进隐空间,导致模型过拟合于特定退化类型而在未知扰动下崩溃。为了切断这种负迁移,该设计将每个模态的隐空间嵌入 \(z_i^{(v)}\) 建模为多维高斯概率分布,分别通过全连接网络预测语义均值 \(\mu_i^{(v)} = f_\mu^{(v)}(z_i^{(v)})\) 和对数方差 \(\log \sigma_i^{(v)} = f_\sigma^{(v)}(z_i^{(v)})\)。语义信息由均值显式承担,而退化引发的不确定性则由方差捕获。为保证梯度可微,采用重参数化采样得到随机表征 \(s_i^{(v)} = \mu_i^{(v)} + \sigma_i^{(v)} \odot \epsilon\)(其中 \(\epsilon \sim \mathcal{N}(0, I)\))。
为了杜绝语义均值与退化方差发生模式混淆,该模块引入了两项互补约束:首先在采样特征 \(s_i^{(v)}\) 上施加单模态分类交叉熵损失 \(\mathcal{L}_{cls}^{(v)}\),迫使均值 \(\mu_i^{(v)}\) 在随机扰动下依然保持对类别标签的判别力;其次引入退化感知先验正则化项:
通过将先验均值锚定在零向量,消除了额外的类别先验偏置,同时将隐空间方差 \(\sigma_i^{(v)}\) 与真实的退化严重度 \(\eta_i^{(v)}\) 对齐。这使得任务语义与数据不确定性被严格约束在不同的统计维度上,赋予了语义均值在未知噪声类型和未见强度下的高度不变性。
2. 噪声感知质量估计器:基于受控注入实现全谱系不确定性校准
依赖模型输出方差或能量分数的无监督质量推导在信噪比极低时极易失效,经常赋予严重受损的模态不可忽略的融合权重。针对这一缺陷,轻量估计器 \(f_t^{(v)}\) 直接建立从解耦方差 \(\sigma_i^{(v)}\) 到数据内在退化强度 \(\hat{\eta}_i^{(v)}\) 的参数化回归映射:
该估计器在训练阶段直接使用注入退化的真值标量 \(\eta_i^{(v)}\) 作为监督信号,最小化均方误差:
在反向传播时,估计器与特征解耦模块之间施加梯度截断(gradient detach),避免回归损失干扰表示学习的特征分布。这种显式监督校准使得网络在连续退化谱系(从 \(\eta=0\) 完好无损平滑过渡到 \(\eta=1\) 完全不可用)上的每一个工作点都能输出绝对可信的质量评价,解决了以往不确定性估计在极端噪声下严重虚高的系统性缺陷。
3. 质量感知动态融合:基于方差倒数原则的平滑衰减机制
在获得各模态的退化预测标量 \(\hat{\eta}_i^{(v)}\) 后,系统需要将其转换为一组归一化且对噪声敏感的融合系数 \(w_i^{(v)} \in [0, 1]\)。遵循统计学中的逆方差加权法则,高噪声模态的可靠度随退化强度呈指数级衰减,加权系数定义为:
当某一模态完全缺失时,其退化强度预测值趋近极大,对应权重 \(w_i^{(v)} \to 0\),多模态联合表征平滑退化为传统缺失设置下的剩余模态表征;而当模态轻微受损时,该系数平滑调整贡献比例,有效抑制受损特征污染最终决策。
损失函数 / 训练策略¶
GIML 的多任务联合训练目标涵盖多模态融合分类损失、单模态解耦分类损失、退化正则先验损失以及噪声强度回归损失,公式定义如下:
其中 \(\mathcal{L}_{cls}^f\) 表示在加权融合表征 \(z_{\tau i} = f_f(\sum_{v=1}^V w_i^{(v)} s_i^{(v)})\) 上计算的主任务交叉熵损失,\(\mathcal{L}_{cls}^{(k)}\) 为第 \(k\) 个模态解耦语义表征上的单模态交叉熵损失。训练过程采用带动量的 SGD 优化器(动量 0.9,权重衰减 1e-4,初始学习率 1e-3),训练批次中 50% 为干净样本,50% 为随机采样遮蔽率在 \([0.0, 1.0]\) 区间(步长 0.1)的受损样本,使模型在单阶段端到端训练中兼顾正常表征与任意缺失程度下的鲁棒性。
实验关键数据¶
主实验¶
在音视频情感识别基准 CREMA-D 与动作识别基准 Kinetics-Sounds (KS) 上,对比两阶段去噪补全 SOTA 方法 TMDC 与 T2DR。实验设置涵盖模态内随机遮蔽缺失率(\(r_a, r_v\))与模态间跨模态缺失测试。
| 数据集 | 模态可用性 (inter) | 模态内受损比例 \((r_a, r_v)\) | TMDC Acc (%) | T2DR Acc (%) | GIML (本文) Acc (%) | 本文较次优提升 (Gain) |
|---|---|---|---|---|---|---|
| CREMA-D | AV (全模态) | (0.0, 0.0) | 66.99 | 67.93 | 73.94 | +6.01% |
| CREMA-D | AV (全模态) | (0.5, 0.5) | 61.69 | 62.69 | 67.80 | +5.11% |
| CREMA-D | AV (不均衡) | (0.1, 0.5) | 61.85 | 63.82 | 68.18 | +4.36% |
| CREMA-D | AV (严重受损) | (0.3, 0.7) | 57.23 | 59.89 | 62.93 | +3.04% |
| CREMA-D | A (仅音频) | (0.0, –) | 52.66 | 53.92 | 55.57 | +1.65% |
| CREMA-D | V (仅视觉) | (–, 0.0) | 46.80 | 48.95 | 60.38 | +11.43% |
| CREMA-D | V (仅视觉受损) | (–, 0.5) | 41.68 | 42.63 | 55.30 | +12.67% |
| KS | AV (全模态) | (0.0, 0.0) | 60.40 | 62.73 | 69.51 | +6.78% |
| KS | AV (全模态) | (0.5, 0.5) | 58.08 | 60.31 | 63.54 | +3.23% |
| KS | AV (不均衡) | (0.1, 0.5) | 57.67 | 59.62 | 65.20 | +5.58% |
| KS | AV (严重受损) | (0.3, 0.7) | 56.75 | 59.03 | 61.68 | +2.65% |
| KS | V (仅视觉受损) | (–, 0.5) | 43.04 | 40.85 | 50.67 | +7.63% |
消融实验¶
为了剖析 NSD 模块中各损失函数以及 NQE 质量权重的独立贡献,在 CREMA-D 数据集上进行系统性消融。
| 模块配置变体 | 准确率 Acc (%) | \(\rho(\mathrm{var}, \Delta f)\) (A / V) | \(\rho(\hat{\eta}, \Delta f)\) (A / V) | 机制作用与性能表现说明 |
|---|---|---|---|---|
| GIML Full Model | 67.41 | 0.927 / 1.000 | 0.991 / 0.991 | 完整模型:方差与退化严格对齐,退化估计极度精准 |
| w/o \(\mathcal{L}_{reg}\) (去正则项) | 65.83 | 0.336 / 0.273 | 1.000 / 1.000 | 方差与退化距离解耦失败,不确定性估计丧失物理意义 |
| w/o \(\mathcal{L}_{mse}\) (去回归项) | 64.01 | 1.000 / 1.000 | 0.018 / 0.527 | 质量估计器未被真值校准,融合权重退化为随机分配 |
| GIML-NQE (\(w^{(v)} = 1\)) | 63.39 | - | - | 禁用动态感知赋权,不均衡受损下准确率显著下滑 3.95% |
| GIML-NSD (原始特征融合) | 48.95 | - | - | 移除高斯解耦直接输入 \(z^{(v)}\),高斯噪声下准确率断崖暴跌 5.13% |
关键发现¶
- 对不均衡受损高度鲁棒:在非对称噪声场景(如 \((0.1, 0.5)\) 或 \((0.5, 0.1)\))下,基线方法往往因噪声模态的误导而大幅掉点,而 GIML 依靠样本级质量评分主动抑制受损模态,提升幅度普遍超过 4.3% 以上。
- 未知噪声分布泛化极佳:仅在 Mask 噪声上训练的 GIML,在测试集面临未见过的连续强度(如 0.3、0.7)以及完全未见过的噪声模式(高斯噪声、雨、雪、雾)时,性能衰减幅度远低于 TMDC 与 T2DR。在高斯噪声 \((2, 5)\) 极限分布偏移下,GIML 在 CREMA-D 取得 61.82% 准确率,大幅领先 T2DR 的 14.11%。
- 双损失协同机制明确:\(\mathcal{L}_{reg}\) 负责将特征方差约束在数据退化维度,保证了语义表征的纯净度;\(\mathcal{L}_{mse}\) 则将隐空间不确定性与物理退化真值锚定,二者缺一不可。
亮点与洞察¶
- 将模态不完整性统一为连续谱:摒弃传统离散“在或不在”的刻板二值划分,用连续退化系数平滑过渡微扰与全失,从数学形式上将模态缺失统一为退化强度的极限特例。
- 可控注入下的显式校准估计:不盲目依赖无监督模型置信度作为融合凭据,而是通过人工控制的扰动真值强监督校准质量估计器,赋予融合权重可解释的物理含义。
- 概率高斯解耦防止语义坍塌:利用重参数化均值承担判别任务、方差承担噪声吸收,有效阻断了未见噪声向语义分类空间的渗透。
局限与展望¶
- 受控噪声先验假设:训练阶段高度依赖人工设定的退化函数(如随机掩码或高斯扰动)生成真值强度,对于极度复杂的结构化非线性退化(如真实复杂传感器故障、光照伪影),先验注入形式可能与实际存在分布差异。
- 超参数敏感度平衡:单模态分类损失权重 \(\beta_1\) 和正则项权重需要精细调节,过高的单模态监督可能轻微削弱多模态深层跨模态交互的表示能力。
- 可扩展至大模型范式:当前主实验基于 ResNet 和轻量 Transformer,未来可将连续质量感知思想迁移至基于 MLLM 的视觉-语言端到端 Token 级门控抑制中。
相关工作与启发¶
- vs TMDC / T2DR: 既往工作将模态内去噪与模态间补齐割裂为级联两阶段,不仅推理开销增加且容易发生阶段间优化目标冲突;GIML 通过连续退化谱在一阶段端到端网络内同时完成两类不完整场景的统一适配。
- vs 传统概率嵌入 (Probabilistic Embeddings): 传统方法缺乏真实噪声强度监督,仅靠聚类或重构损失约束方差,导致高噪声下不确定性估计失准;GIML 引入真值 MSE 监督校准,实现了全域退化下的单调可靠估计。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次将模态缺失与模态内噪声退化统一为连续谱,并提出解耦与质量感知协同方案。
- 实验充分度: ⭐⭐⭐⭐⭐ 覆盖 5 个多模态基准(音视频、图文、三模态),涵盖未知强度、未知噪声类型及真实恶劣天气模拟。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密,动机推导与数学形式化表达高度自洽。
- 价值: ⭐⭐⭐⭐⭐ 为复杂真实工况下的鲁棒多模态感知与自动驾驶/具身智能多传感器融合提供了极具工程落地价值的范式。