跳转至

Progressive Representation Learning for Multimodal Sentiment Analysis with Incomplete Modalities

会议: ECCV 2026
论文: ECCV 原文
领域: 音频/语音
关键词: 多模态情感分析、缺失模态、Fisher 信息、渐进式交互、跨模态对齐

一句话总结

PRLF 把「此刻哪个模态可信」拆成分类置信度与 Fisher 信息两个互补信号、逐样本选出主导模态,再让辅助模态经过 4 步迭代先自我精炼、后与主导模态做投影对齐与残差去噪,在 CMU-MOSI / CMU-MOSEI / SIMS 的模态间与模态内缺失设定下分别取得 77.02 / 76.24 / 81.19 的平均 F1。

研究背景与动机

多模态情感分析(MSA)要综合语言、声学、视觉三路异构信号去判断说话人的情绪倾向,主流路线一直在打磨融合机制本身:MISA 把表示拆成模态不变与模态特有分量,MMIM 用层次化互信息最大化约束融合,Self-MM 给每个模态配自监督辅助任务,TETFN 走文本主导的跨模态映射。这些方法默认推理时三路模态齐全。但真实场景里环境噪声、硬件故障、传输丢包、隐私限制都会让某一路模态整体或局部消失,输入往往是不完整甚至损坏的。围绕这个缺口,近年出现两条主线:一是生成式补全,如 DiCMoR 用类条件归一化流对齐「恢复出来的特征」与真实特征的分布、MRAN 把缺失模态对齐并重建回来;二是蒸馏式,如 UMDF 与 CorrKD 让完整模态训练的教师模型把跨模态知识传给学生模型。

这两条线都还没回答一个问题:缺失发生时,各个模态对当前样本的价值是不一样的,而它们仍然沿用传统融合范式,把缺失模态和完整模态一视同仁地丢进同一个注意力里。作者用两个测量说明了这种「一视同仁」的代价。其一是 Fisher 信息矩阵(FIM):丢掉某模态里的关键数据会让该模态的信息含量断崖式下跌,而丢掉非关键数据几乎没有影响——也就是说模态重要性是逐样本变化的,不存在一个全局的模态权重表。其二是特征相位:他们取 300 个样本,比较不同缺失率下提取的特征与完整模态特征在高维空间中的角度偏差,发现缺失率越高、相位偏移越大;这解释了为什么直接融合会出事——缺失模态的特征方向已经漂了,硬融进去会把本来学得好好的完整模态表示也拽偏。

更棘手的是,模型自己往往意识不到模态已经不可靠。论文给出的证据(图 3)是:视觉模态在第 10–14 个 epoch 输入完整,第 15 个 epoch 关键帧被拿掉,此时分类置信度依旧很高——疑似模型记住了人脸特征而不依赖真正的输入内容;与此同时 FIM 的迹却明显下滑。也就是说,「用置信度挑主导模态」这条常见做法在缺失场景下会失效,必须补一个反映「输入里到底还有多少有效信息」的信号。本文的核心 idea 是不补全、不蒸馏,而是先逐样本估计模态可靠性、选出主导模态,再让其余模态在迭代中一步步向主导模态的特征方向对齐:早期迭代只做模态内精炼以避开噪声,后期迭代才放开跨模态交互,使融合强度随训练进程渐进升高。⚠️ 论文把这一「渐进」明确定义在迭代步数上(交互深度随时间步加深),而不是让缺失率随训练课程式上升——缺失率在训练中保持恒定。

方法详解

整体框架

PRLF 的输入是一个视频片段的三路模态序列 \(S=[X^V, X^A, X^L]\),其中 \(X^V, X^A, X^L\) 分别是视觉、声学、语言序列。整条管线分两支:AMRE(Adaptive Modality Reliability Estimator)负责回答「这个样本里哪个模态最可信」,ProgInteract(Progressive Interaction)负责在已知主导模态的前提下,把辅助模态渐进地对齐过去。三路模态先各自过一个专用编码器 \(f_m=\mathcal{E}_m(X^m)\) 得到单模态特征,这些特征同时被 AMRE(用于算可靠性)和 ProgInteract(用于交互)使用。AMRE 融合分类置信度与 Fisher 信息,输出每个模态的重要性 \(\mu\)\(\mu\) 最大的即主导模态、其余为辅助模态。ProgInteract 迭代 \(T=4\) 步:每一步先做模态内自精炼,再做被 \(\mu\) 加权的跨模态交互,然后按时间系数 \(\lambda_t\) 把自精炼特征与跨模态特征混合(早期偏自精炼、后期偏跨模态);混合后的主导/辅助特征进入 Decomposer,把主导模态投影到辅助模态空间、对残差做正交相位约束与去噪,产出的辅助特征回流到下一轮迭代。4 步结束后,三路最终表示拼接、过分类头用交叉熵做情感预测。

缺失的建模方式值得先说清:论文区分两类缺失——模态间缺失(整路模态完全消失,评测时对应 \(\{l\},\{a\},\{v\},\{l,a\},\{l,v\},\{a,v\}\) 六种组合)与模态内缺失(模态序列内部的部分帧级特征被随机丢弃,用缺失率 \(p\in\{0,0.1,\dots,0.9\}\) 控制)。缺失位置直接以零向量填充,模型不做任何重建,靠可靠性估计与方向对齐来抗噪。训练时每个 epoch 重新采样缺失模式(种子随 epoch 变化,因此同一样本每轮遇到的缺失图样都不同),缺失率保持恒定、以整模态为单位缺失。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["三模态输入<br/>语言 / 声学 / 视觉"] --> B["单模态编码<br/>f_L, f_A, f_V"]
    B --> C["模态可靠性估计<br/>置信度 + Fisher 信息"]
    C --> D["渐进式交互<br/>λ_t 由单模态转向跨模态"]
    D --> E["解耦对齐器<br/>投影 + 残差去噪"]
    E -->|t < 4 回流| D
    E -->|t = 4| F["拼接三模态表示<br/>交叉熵情感预测"]

关键设计

1. 模态可靠性估计:用 Fisher 信息补上置信度会「撒谎」的那一块

路由器(router network)给每个模态配一个独立的分类头 \(\hbar_m\),取该样本在正确类别上的分类置信度 \(\alpha^{(i)}_m\),三路置信度拼接后做 L1 归一化得到 \(\hat{\alpha}^{(i)}\)。这一步对应一个逐模态的交叉熵损失 \(\mathcal{L}_{uni}\),把「每个模态自己也要能判对」写进训练目标。但论文的实验证据表明单靠置信度会误判:关键帧缺失时视觉头仍然给出高置信度,说明它可能在靠记忆而非靠输入。于是引入第二个信号——Fisher 信息矩阵的迹。对单模态编码器与其分类头,参数梯度 \(g_m\) 的 FIM 迹可以直接写成梯度平方范数的期望:

\[\mathrm{Tr}(F_m^{(i)}) = \mathbb{E}\left[g_m g_m^\top\right] = \left\|g_m\right\|_2^2\]

它衡量输出对参数扰动的敏感度,也就近似衡量「这个模态的输入给模型提供了多少有效信息」。论文进一步给了理论解释:把第 \(m\) 路模态看作 16 帧,模型对参数的梯度可近似分解为各帧贡献之和;缺失时引入二值掩码 \(\delta_t\) 后变成 \(\sum_t \delta_t g_t\)。关键帧的梯度范数远大于非关键帧(\(|g_t^{key}|_2^2 \gg |g_t^{non}|_2^2\)),关键帧一被掩掉,梯度的主导贡献消失,\(\mathrm{Tr}(F_m)\) 显著下降——这正是图 3b 观察到的现象。把三路 FIM 迹归一化得到 \(\hat{\beta}^{(i)}\)

两个信号各自的失效区间是互补的:训练早期梯度响应弱、所有模态的 FIM 都低,FIM 无法排序,但此时相对更高的置信度至少说明该模态的特征空间里有更可分的模式;训练中后期 FIM 变得可靠,比会「自我欺骗」的置信度更准。因此作者用相邻 epoch 之间 FIM 迹的相对增量 \(\Delta^{(t,i)}_m\) 动态决定两者权重,\(\mu\) 由置信度分量与 Fisher 分量加权得到,其中权重随 FIM 的增长而向 Fisher 侧倾斜。⚠️ 缓存中公式 (11)(权重 \(w^{(t,i)}\) 的具体形式)排版已损坏,只可读出它是 \(\Delta\) 过 Sigmoid 的形式,精确表达式以原文为准。

\[\mu^{(t,i)} = (1-w^{(t,i)})\,\hat{\alpha}^{(i)} + w^{(t,i)}\,\hat{\beta}^{(i)}\]

这样得到的 \(\mu\) 既是「主导模态的选取依据」,也是后面跨模态交互的加权系数——同一个量同时回答了「谁可信」和「该向谁对齐」,不需要额外训练一个门控。

2. 渐进式交互:让融合从「只听自己」过渡到「只听别人」

既然缺失会让辅助模态的特征方向漂移,一上来就做全量跨模态融合反而会污染完整模态的表示。ProgInteract 因此不做一次性融合,而是把交互拆成 \(T\) 步迭代,每一步内部又分三层。第一层是模态内自精炼\(f_m^{self} = f_m + \mathrm{Dropout}(\cdot)\),即先在自己模态内部再抽一次判别性信息(⚠️ 公式 (13) 在缓存中仅能辨认出残差结构与 Dropout,具体形式以原文为准)。第二层是跨模态交互,且模态重要性 \(\mu\) 在交互中显式生效——做注意力时辅助模态被 \(\mu\) 调制,主导模态(\(\mu\) 最大)自然获得更高权重;得到的两个跨模态特征拼接后再过一次 softmax 注意力,形成该步的 \(f_m^{cross}\)。第三层是时间相关的混合系数 \(\lambda_t\):把自精炼特征与跨模态特征按 \(\lambda_t\) 线性混合作为该步输出,\(\lambda_t\) 随迭代步数 \(t\) 单调下降,早期 \(\lambda_t\to 1\)(几乎只用模态内特征)、后期 \(\lambda_t\to 0\)(几乎全用跨模态特征)。⚠️ 原文给出的 \(\lambda_t\) 表达式在缓存中排版丢失,只能确认它是随 \(t\) 线性衰减、在 \(t=1\) 时取 1、在 \(t=T\) 时取 0 的调度,精确写法以原文为准。

这一调度正是「渐进」二字的落点:训练早期模型还没收敛,缺失模态贡献的跨模态信号里噪声占大头,此时把 \(\lambda_t\) 压在自精炼一侧等于给融合装了「渐进解冻」的闸门;随着迭代推进、模态内表示变稳,\(\lambda_t\) 下降、跨模态交互放开,辅助模态才被允许向主导模态靠拢。相比固定融合权重的方法,它用几乎零成本的超参(一个线性调度 + 迭代步数)换来了一条「先稳后融」的优化路径。

3. 解耦对齐器 Decomposer:把主导模态投影进辅助模态,残差去噪后再回流

光靠注意力加权还不能保证辅助模态真的「转向」主导模态,因为注意力调的是幅度而不是方向。Decomposer 的做法是把主导模态特征显式分解成「能由辅助模态解释的部分」和「解释不了的部分」:把主导特征与辅助特征拼接后送入门控网络,输出一个与特征同维的投影权重 \(g^t_{aux}\),用它对主导特征逐维加权得到投影 \(\mathrm{proj}=g^t_{aux}\odot f^{fuse,t}_{dom}\);辅助特征减去投影就是残差 \(\mathrm{res}=f^{fuse,t}_{aux}-\mathrm{proj}\),代表辅助模态独有的、主导模态无法覆盖的互补信息。

为了让「对齐」和「互补」两边都不塌,论文在投影与残差之间加了一个正交性约束,作为相位一致性损失:

\[\mathcal{L}_{phase} = \frac{1}{N}\sum_{t,n}\left[(\mathrm{proj}_n^t)^\top \mathrm{res}_n^t\right]^2\]

最小化它等于让投影项与残差项尽量正交:投影负责把辅助模态拉向主导模态的方向,残差则被推去承载独立的互补成分,避免两者纠缠在一起——论文称之为「适度的相位收敛」。剩下的残差还可能夹带噪声,于是再过一个去噪网络估计残差中的噪声分量(ReLU 后接 Dropout),最终的辅助特征用「投影 + 去噪后的残差」更新并流入下一轮迭代,其中系数 \(\gamma\)(实验中取 0.8)控制残差信息的贡献比例;主导模态特征在该步保持不变,充当整轮迭代的锚点。这样辅助模态每一轮都在「被主导模态牵引」和「保留自身独有信息」之间取一个受约束的折中,而这种折中是靠损失函数而不是靠人工设计的融合公式实现的。

一个完整示例

以一个三模态齐全、语言模态被判为主导的样本走一遍(\(T=4\)):AMRE 先算出 \(\mu_L>\mu_A>\mu_V\)(例如三路归一化后约 0.52 / 0.28 / 0.20),于是 \(f_L\) 为主导、\(f_A\)\(f_V\) 为辅助。第 1 步迭代 \(\lambda_1=1\)\(\lambda_1 f^{self}\) 完全压过跨模态项,模型基本只做三路模态内自精炼;Decomposer 仍会把 \(f_L\) 投影到 \(f_A\)\(f_V\) 的空间并产出残差,但由于此时特征不稳定,残差里噪声占比高,去噪网络削掉的幅度也大。第 2、3 步 \(\lambda_t\) 依次降到约 0.67、0.33,跨模态注意力开始接管,辅助模态的投影分量逐轮增大、残差逐轮变「干净」,\(\mathcal{L}_{phase}\) 推动投影与残差走向正交。第 4 步 \(\lambda_4=0\),该步输出完全由跨模态特征决定,辅助模态此时已被牵引到主导模态的特征方向附近;三路最终表示拼接后过分类头得到情感预测。⚠️ 上述 \(\lambda\) 数值依赖公式 (16) 的线性调度形式,缓存中该式排版损坏,具体数值以原文为准。与「一步融合」的基线相比,同一份模型参数在第 1 步和第 4 步看到的是完全不同的融合深度,这正是渐进设计的实际效果。

损失函数 / 训练策略

总损失由三项组成:情感分类的交叉熵 \(\mathcal{L}_{task}\)(作用在最终拼接表示上)、逐模态分类头的交叉熵 \(\mathcal{L}_{uni}\)(对应公式 (2),让每个模态的单模态表示保持判别性)、以及 Decomposer 的相位一致性损失 \(\mathcal{L}_{phase}\)

\[\mathcal{L}_{total} = \mathcal{L}_{task} + \eta_1 \mathcal{L}_{uni} + \eta_2 \mathcal{L}_{phase}\]

关键超参:平衡系数 \(\gamma=0.8\),损失权重 \(\eta_1=0.5\)\(\eta_2=0.1\),迭代步数 \(T=4\);语言模态用 300 维 GloVe 与 768 维 BERT-base-uncased 隐状态,视觉用 Facet 的 35 维面部动作单元特征,声学用 COVAREP 的 74 维描述子。缺失部分以零向量填充,训练时每个 epoch 换种子、重采样缺失图样,缺失率恒定;测试沿用 CorrKD 的评测设置,所有结果取 5 个随机种子的平均。⚠️ 损失消融一节把 \(\mathcal{L}_{uni}\) 称作 "feature uniformity loss"(特征一致性损失),但公式 (2) 给出的是逐模态分类的交叉熵,两处表述不一致,本文按公式 (2) 理解,确切含义以原文为准。

实验关键数据

主实验

模态间缺失(整路模态消失)下在 CMU-MOSI / CMU-MOSEI / SIMS 上的 F1:

数据集 评估设定 之前 SOTA PRLF 提升
MOSI 六种缺失组合平均 HRLF 76.74 77.02(消融表记 77.11 ⚠️) +0.28
MOSI 全模态 EMOE 85.40 85.78 +0.38
MOSEI 六种缺失组合平均 HRLF 75.63 76.24 +0.61
MOSEI 全模态 EMOE 85.30 85.44 +0.14
SIMS 六种缺失组合平均 LNLN 80.86 81.19 +0.33

单模态与双模态格子并非全胜(论文正文称「在所有模态设定上一致超越」,实际有例外,需按表核对):MOSI 仅视觉 {v} 上 HRLF 64.59 高于 PRLF 64.05(−0.54),{l,a} 上 UMDF 85.63 高于 PRLF 84.98(−0.65);MOSEI 仅视觉 {v} 上 HRLF 64.90 高于 PRLF 63.67(−1.23);SIMS 仅声学 {a}(81.74 对 LNLN 81.91)与仅视觉 {v}(81.63 对 81.91)也略低。其余格子 PRLF 领先,且平均分与全模态设定均最高,说明其优势主要来自「模态缺失 + 多模态协同」的组合场景,而非单模态本身更强。

消融实验

MOSI 跨模态缺失下的模块、损失与迭代步数消融(平均 F1,基准 PRLF \(T=4\) = 77.11):

配置 平均 F1 变化
PRLF (Step = 4) 77.11
w/o CMI(只用 Fisher 信息) 76.12 −0.99
w/o FIMI(只用置信度) 76.09 −1.02
w/o AMRE(两个信号都不用) 74.96 −2.15
w/o ProgInteract (PI) 71.32 −5.79
w/o \(\mathcal{L}_{uni}\) 75.73 −1.38
w/o \(\mathcal{L}_{phase}\) 76.63 −0.48
Step = 1 72.29 −4.82
Step = 2 74.72 −2.39
Step = 3 76.49 −0.62
Step = 5 75.80 −1.31

模态内缺失(按缺失率 \(p\) 随机丢弃帧级特征)下的迭代步数消融,MOSI 上的 F1:

迭代步数 p=0 p=0.3 p=0.5 p=0.7 p=0.9
Step = 1 81.14 72.25 69.58 60.73 55.37
Step = 2 83.08 73.88 70.65 62.06 56.39
Step = 3 85.21 75.28 71.97 64.62 57.59
Step = 4 85.78 75.89 73.05 65.31 58.64
Step = 5 84.49 75.19 71.24 64.16 57.48

关键发现

  • ProgInteract 是绝对主力:去掉它平均 F1 掉 5.79,且在损坏最重的 {a,v} 设定上从 76.03 掉到 68.49(−7.54),而 AMRE 整块去掉只掉 2.15。这说明「渐进式跨模态对齐」扛的是主要收益,可靠性估计更像是让对齐发生在正确对象上的前提。
  • CMI 与 FIMI 互补但 FIMI 略重要:单独去掉 FIMI(−1.02)比单独去掉 CMI(−0.99)掉得略多,两者同时去掉的损失(−2.15)大于各自之和的一半,符合「早期靠置信度、后期靠 Fisher 信息」的互补设计。
  • 迭代步数存在明确的最优点:跨模态与模态内两条线一致地在 \(T=4\) 达到峰值,\(T=5\) 开始回落(MOSI 上 77.11 → 75.80)。步数太少(\(T=1\) 只有 72.29)等于放弃了渐进调度;步数太多则过度交互、伤泛化。
  • 缺失率越高相对优势越大:把 \(p\) 从 0 扫到 0.9,所有方法都在掉,但 PRLF 掉得最慢;\(p=0.9\) 时 MOSI 仍有 60、MOSEI 仍有 70 的 F1。平均 F1 上 PRLF / EMOE / LNLN 分别为 MOSI 72.48 / 71.21 / 71.25、MOSEI 78.82 / 74.60 / 75.65、SIMS 75.04 / 71.25 / 73.13。EMOE 这类纯融合方法在低缺失率下表现不错但随缺失率上升快速退化,LNLN 这类缺失数据方法更稳但仍低于 PRLF。
  • 特征分布更紧致:T-SNE 上带 AMRE 与不带 AMRE 的聚类方差分别为 1.205 与 1.367,去掉 PI 后类别边界明显模糊,说明 AMRE 压住了不可靠模态的噪声、PI 强化了跨模态语义对齐。

亮点与洞察

  • 把 Fisher 信息的迹当作「模态还剩多少有效信息」的探针,并给出了为什么关键帧消失会导致 \(\mathrm{Tr}(F)\) 骤降的梯度分解解释。巧妙之处在于它是逐样本、前向即可近似计算的量,且与置信度恰好互补(早期 FIM 不可靠、后期置信度不可靠),用一个动态权重就把两者的失效区间缝上了。
  • 「渐进」被定义在融合深度而不是数据难度上:不改缺失率、不加课程学习,只让 \(\lambda_t\) 随迭代步线性衰减,就让模型在早期少受缺失模态噪声的干扰。这个 trick 可以搬到任何「输入可能被污染的多模态融合」上——早期压住跨模态项、后期放开,几乎零成本。
  • 用正交性约束把「对齐」和「保留互补」变成可优化的目标:投影项拉方向、残差项承载独有信息,\(\mathcal{L}_{phase}\) 惩罚两者的内积平方。相比靠注意力隐式学对齐的做法,这个约束直接把「方向对齐到什么程度」变成了可控旋钮,可迁移到任何跨模态特征对齐任务(如跨模态检索、多视图聚类)。
  • 每个 epoch 重采样缺失图样、但缺失率恒定,等价于免费的缺失模式数据增强,让模型见过足够多的模态组合,这解释了它在六种缺失组合与全模态设定上都不掉点。

局限与展望

  • 不做重建意味着信息无法找回。缺失区域一律零填充,模型只能在「用可用信息加权 + 对齐方向」的范围内缓解损害;对关键帧丢失这类信息量真的消失的场景,理论上界由剩余模态决定。生成式补全与 PRLF 并不互斥,把补全模块接到 AMRE 之前是一个直接的改进方向。
  • FIM 的逐样本梯度开销未报告。按样本计算梯度平方范数需要额外的反向传播,论文没有给出相对基线的训练时间或显存对比,而这直接影响方法的实用价值。
  • 关键公式在论文中不可读。融合权重 \(w^{(t,i)}=\sigma(\cdot[\Delta])\) 与时间系数 \(\lambda_t\)、自精炼式 (13) 在缓存文本中排版损坏,本文只能按上下文推断其形式并已标注;复现前需要对照原文。
  • 「渐进」的语义有限:缺失率在训练中恒定,\(\lambda_t\) 是手工设定的线性衰减,\(T\) 也是网格搜出来的固定值(\(T=5\) 即退化)。缺一个「收敛了就停」的自适应终止准则,也没有把缺失率与交互强度联动起来(例如缺失越重、越应该晚一点放开跨模态交互)。
  • 评测口径需注意:主表只报 F1,ACC-7 / ACC-5 / ACC-2 / MAE 放在补充材料;测试协议沿用 CorrKD 的设置,跨论文比较时要注意缺失图样的采样方式是否一致。另外 Table 1 中 MOSI 的平均值写作 77.02,而 Table 4/5/6 在完全相同的分项数字下写作 77.11(按分项算平均应为 77.11),推测是主表笔误,引用时需以原文核对。

相关工作与启发

  • vs 生成式方法(DiCMoR / MRAN): 他们从可观测模态出发重建缺失模态的特征或语义,寄望于「补出真值」;PRLF 完全不重建,转而在融合阶段对模态价值做加权、对特征方向做对齐。前者在缺失率不太高时能找回信息,但重建本身的误差会被后续融合放大;后者不承担重建风险,但信息确实丢了。二者组合(先补全、再用 AMRE 评估补全结果的可信度)是很自然的下一步。
  • vs 蒸馏式方法(UMDF / CorrKD / HRLF): 他们用完整模态训练的教师来指导学生模型,知识来自外部模型;PRLF 是单模型,靠逐样本的置信度 + Fisher 信息在线估计模态可靠性,且把「谁的可靠性高」直接用作交互权重。相对劣势是 PRLF 没有教师提供的完整模态先验,因此在仅视觉这类单模态设定上略逊于 HRLF(MOSI −0.54、MOSEI −1.23)。
  • vs 传统融合方法(MISA / MMIM / Self-MM / TETFN): 这些方法假定模态齐全,在缺失场景下退化严重(例如 TETFN 在 MOSI 仅声学设定下只有 39.32);PRLF 与它们的差别不在融合算子本身,而在融合之前先做了一次「该信谁」的判断。
  • vs EMOE: 同为动态专家的融合思路,EMOE 在低缺失率下很强、随缺失率上升快速退化,而 PRLF 的退化曲线最平缓——差异来源是 PRLF 把可靠性估计显式写进了交互权重与迭代调度,而不是让网络隐式适应。

评分

  • 新颖性: ⭐⭐⭐⭐ [把 Fisher 信息与分类置信度互补地用作模态可靠性信号、并用线性调度把融合深度做成「渐进解冻」,角度少见;但整体仍是「可靠性加权 + 跨模态对齐」框架内的组合创新]
  • 实验充分度: ⭐⭐⭐⭐ [三个基准 × 模态间/模态内两类缺失 × 缺失率扫描 + 模块/损失/步数消融 + T-SNE 与重要性可视化,覆盖面很足;减分项是主表只报 F1、缺 FIM 的开销分析、且平均分有一处笔误]
  • 写作质量: ⭐⭐⭐ [动机链条(置信度失效 → 引入 FIM → 两者互补融合)讲得很清楚,图 3 的证据也很扎实;但公式排版损坏较多,损失命名前后不一致,正文「一致超越所有设定」与表格存在出入]
  • 价值: ⭐⭐⭐⭐ [对「模态缺失 + 融合会污染完整模态」这一实际问题给出的方案不依赖重建或教师模型,训练开销可控,渐进调度与正交对齐两个 trick 都容易迁移到其他多模态任务]