跳转至

SemMSA: Latent Semantic-Aided Robust Multimodal Sentiment Analysis with Incomplete Data

会议: NeurIPS 2026(任务清单归属;本文依据 arXiv v1)
arXiv: 2609.30238
领域: 多模态 VLM(多模态情感分析)
关键词: 模态缺失、潜在语义、连续隐状态、核谱对齐、实例分离

一句话总结

SemMSA 将残缺的文本、视觉和音频证据送入冻结 LLM,递归追加连续隐状态获得辅助语义,再用实例内核谱对齐和实例间分离学习稳健表示,在十档模态内缺失率平均评测中取得 MOSI Acc-2 74.36/73.91、MOSEI 79.61/79.38、SIMS 75.46。

研究背景与动机

多模态情感分析利用视频片段的语言内容、视觉表达和声学线索预测标注的情感极性与强度。完整输入下,模态之间可以互补;但实际数据可能只丢失部分词、帧或音频片段,也可能整条模态不可用。本文重点处理前一种模态内缺失:三个序列同时留下不连续的证据,模型不能简单假定某一路始终可靠。这里讨论的是标准数据集上的情感标签预测,不是根据个人数据诊断精神健康或推断敏感属性。

现有方法大致沿着两条路径前进。TFR-Net 等重建方法试图补回缺失特征,但相同文本可能对应不同语调和视觉表达,补出统计上合理的特征并不保证保留原片段的情感含义。LNLN、P-RMF 等方法强调融合或主导模态引导,能够利用可见证据,却可能在主导模态严重受损时把噪声传给其他分支。两类方法的共同难点是:低层证据已经不足,如何补充与任务有关的语义,同时不再依赖一个固定、可能同样残缺的对齐锚点。

LLM 的上下文表征提供了另一种补偿来源,但让它输出自然语言描述会引入额外解码成本,描述也未必准确。本文选择保留 LLM 的隐空间运算,把语义当作可训练下游利用的连续表示,而不是可读解释。核心 idea:先以连续隐状态补充残缺多模态证据的任务语义,再对同一样本的四路表示联合施加无固定锚点的核谱约束,并以跨样本分离避免表示塌缩。

方法详解

整体框架

输入是残缺的语言、视觉和声学序列,输出是一个连续情感分数,再按数据集协议计算分类指标。系统保留两条相互配合的表示路径:原模态经过特征处理器得到三路任务表示;跨模态语义细化(Cross-modal Semantic Refinement,CSR)从同一份证据构造第四路语义表示。随后,跨模态谱对齐(Cross-modal Spectral Alignment,CSA)在训练时约束四路表示的联合结构。

CSR 内部先通过视觉与音频适配器,将变长非语言序列压缩为冻结 LLM 能接收的前缀;语言直接使用该 LLM 的词嵌入。冻结 LLM 对更新后的前缀反复前向计算,每次取最后位置的隐状态追加回输入,最后汇聚这些连续状态。四路任务表示逐元素相加,交给线性预测头;并不是让 LLM 自己直接输出情感答案。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    I["残缺文本、视觉、音频"] --> A["证据适配<br/>非语言前缀与语言嵌入"]
    A --> R["连续语义细化<br/>冻结 LLM 递归追加状态"]
    I --> M["原模态任务表示"]
    R --> F["四路表示相加<br/>线性情感预测"]
    M --> F
    R -.->|仅训练:语义表示| C["核谱对齐与实例分离"]
    M -.->|仅训练:三路模态表示| C
    Y["训练标签"] -.-> L["回归损失与联合优化"]
    F -.-> L
    C -.-> L
    F --> O["推理:情感分数"]

图中虚线表示训练约束,实线表示预测数据流。CSA 不是推理时必须执行的特征变换:根据论文公式,最终融合直接使用四路表示的和,谱分解用于计算训练损失。

关键设计

1. 证据适配:先压缩残缺非语言序列,再进入 LLM 空间

视觉与声学输入并不能直接当作语言词嵌入使用。每个非语言适配器设置 8 个可学习提示向量,并对输入序列加入可学习位置编码,以保留帧或片段的顺序。提示向量作为查询,通过交叉注意力从可见序列提取证据,再以自注意力交换提示之间的信息;经过 2 个轻量 Transformer 块,输出固定数量的紧凑向量,并线性投影到冻结 LLM 的嵌入维度。

这里的“提示”是可学习连续向量,不是人工写出的文字指令。其作用是把长短不同、局部缺失的序列变成固定预算的非语言前缀,并让任务监督学习哪些线索值得汇聚,而不是逐帧恢复完整数据。语言分支直接在 LLM 中嵌入,初始前缀按语言、视觉、音频的固定顺序连接。因此,“无锚点”描述的是后面的对齐目标,不表示 CSR 的序列顺序完全对称。

还应区分两种编码器:论文先使用冻结的 BERT、OpenFace 和 Librosa 所提供的特征,再使用含线性层与 Transformer 层的模态处理器形成下游任务表示。语言进入 CSR 的路径则使用冻结 LLM 的嵌入;不能将 BERT 特征提取和 LLM 词嵌入说成同一个操作。

2. 连续语义细化:把末位置隐状态追加成下一轮输入

初始前缀同时包含三种模态的可见证据。LLM 每次处理当前前缀,取最后一层、最后位置的隐状态作为一个新的连续语义状态,再把它连接到已有前缀末尾。下一轮不仅看原始证据,还看上一轮产生的状态;之前追加的状态也保留。这不是先生成一句解释再编码,也不是离散词 token 的文字思维链。

用论文的记号,\(\mathcal{F}_{\theta}\) 是冻结 LLM,\(\mathbf{U}^{(0)}\) 是初始前缀,机制由以下递推承载:

\[ \mathbf{z}_{k}=\mathcal{F}_{\theta}(\mathbf{U}^{(k-1)})_{|\mathbf{U}^{(k-1)}|},\qquad \mathbf{U}^{(k)}=[\mathbf{U}^{(k-1)};\mathbf{z}_{k}],\quad k=1,\ldots,O. \]

默认细化 4 次,每次增加一个与 LLM 嵌入同维的连续状态。所有状态汇聚后再投影为下游语义表示,与三路模态表示保持维度一致。原文只写 pooling,没有明确其具体类型,因此不能补成作者使用均值或最大池化的确定实现。

冻结的是 LLM 参数,而不是它的计算。适配器与下游模块仍需学习如何借助该固定变换完成任务;每一步细化都会增加一次 LLM 前向计算。附录显示从 1 步增加到 4 步有益,再增加到 5、6 步反而稍降。所谓 token-efficient 是避免展开长篇自然语言描述,不是零成本语义生成,也不能据此保证每个隐状态都是忠实、可解释的推理步骤。

3. 核谱对齐与实例分离:样本内形成共识,样本间保留区别

只有多出一条语义分支还不够:它需要与原始模态学到可联合使用的结构。CSA 将同一样本的语义、视觉、声学、语言表示归一化,作为 \(\mathbf{V}=[\mathbf{h}_{s},\mathbf{h}_{v},\mathbf{h}_{a},\mathbf{h}_{l}]\) 的四列,再用 RBF 核构造一个 \(4\times4\) Gram 矩阵。这里的“全局”是指这四路表示的联合关系,不是把整个 batch 的所有模态混成一个巨大核矩阵。

\[ K_{pq}=\exp\left(-\frac{\|\mathbf{h}_{p}-\mathbf{h}_{q}\|_{2}^{2}}{2\sigma^{2}}\right),\qquad \mathcal{L}_{\mathrm{csa}}=-\frac{1}{N}\sum_{i=1}^{N}\log\frac{\exp(\lambda_{1}^{i}/\tau)}{\sum_{j=1}^{4}\exp(\lambda_{j}^{i}/\tau)}. \]

每个样本分别分解核矩阵,得到降序排列的四个非负特征值。训练把最大特征值当作 softmax 中应占优势的项,而不是指定语言或语义分支为锚点,再逐个拉近其他分支。RBF 核的对角线恒为 1,因此谱的总和为 4;附录证明完全对齐对应秩一矩阵,其谱为 \((4,0,0,0)\)。这个结果解释了为什么增强主导谱成分是合理目标,但实际损失是温度缩放的特征值 softmax,不能把它等同于直接最小化残余谱能量、最大化 \(\lambda_1/4\),或已经达到秩一的保证。

如果只强调样本内一致,不同样本可能一起坍缩到相似表示。作者取每个核矩阵的主特征向量,作为四路表示的组合系数,再回到原表示空间构造方向;对 batch 中不同样本方向的内积平方求平均:

\[ \mathbf{u}_{1}^{i}=\frac{\mathbf{V}^{i}\mathbf{q}_{1}^{i}}{\|\mathbf{V}^{i}\mathbf{q}_{1}^{i}\|_{2}},\qquad \mathcal{L}_{\mathrm{sep}}=\frac{1}{N(N-1)}\sum_{i=1}^{N}\sum_{j\ne i}\left[(\mathbf{u}_{1}^{i})^{\top}\mathbf{u}_{1}^{j}\right]^2. \]

主特征向量只有四个组合系数,不能直接当成高维语义向量比较。更严格地说,核矩阵的系数反映 RKHS 内的结构,但论文实际用这些系数加权原空间的四路向量;这不是显式构造 RKHS 主方向,也没有展示核空间到原空间的精确逆映射。平方内积则既惩罚同向也惩罚反向的高相关方向,引导不同实例接近正交,不是按情感类别组织正负样本的监督对比损失。

一个完整示例

设一个待预测片段只剩部分评论文本、若干视频帧和不连续声学片段。下面只是流程示意,不是论文公布的单例测量。视觉和声学适配器各产生 8 个前缀向量;它们接在语言嵌入之后。第一次 LLM 前向取末位置隐状态,追加一个连续状态;第二次在更新前缀上重复该操作,直到收集 4 个状态,而不是生成 4 个词或 4 句解释。

这些状态汇聚为一条语义表示,原模态处理器另行给出视觉、声学与语言表示。预测时直接把四路表示相加,再回归情感分数。训练时,额外构造这个片段自己的 \(4\times4\) 核矩阵,鼓励其最大特征值相对突出;同时,把该样本的投影方向与其他训练样本比较,避免所有片段都学到相同方向。

这个例子说明“补偿”的对象是判别所需的语义表示,而不是丢失帧、声音或词的真实复原。如果剩余证据本身都不可靠,模型仍可能输出错误分数;隐状态循环不会凭空恢复事实。

损失函数 / 训练策略

联合目标为情感分数 MSE、核谱对齐损失与实例分离损失三项之和,原文公式没有额外权重。最终融合是未归一化任务表示的逐元素相加;CSA 的归一化表示用于正则计算,不能把最终融合误写成谱加权投票。

训练配置为 AdamW、学习率 \(10^{-4}\)、batch size 64、最多 200 epochs,并采用 warm-up、余弦退火与早停;冻结 LLM 为 Qwen3-1.7B。默认 \(M=8\)、\(B=2\)、\(O=4\)、\(\sigma=1.0\)、\(\tau=0.1\),硬件为 NVIDIA RTX 6000 Ada。

训练时按实例施加 Bernoulli 缺失掩码,50% 样本保持完整。视觉和音频缺失位置以零向量替换,语言缺失位置以 [UNK] 替换;测试在各模态独立随机抽取缺失位置,缺失率为 0.0 至 0.9,步长 0.1,报告种子 1111、1112、1113 的平均结果。

原文第 3 节以 \(d\) 表示 LLM 嵌入维度,但实验配置又将 \(d=128\) 列为 hidden dimension;二者的记号存在歧义,本文不把 128 宣称为 Qwen3-1.7B 的词嵌入维度。部署复现还需核实内部特征尺寸、pooling 和循环缓存等具体实现。

实验关键数据

主实验

MOSI、MOSEI 的标注区间为 \([-3,+3]\),SIMS 为 \([-1,+1]\)。三者训练/验证/测试样本数分别为 1,284/229/686、16,326/1,871/4,659、1,368/456/457。以下主表摘自原文 Tables 1–2,所有成绩都是十档模态内缺失率的平均,不是完整数据成绩。

MOSI 与 MOSEI 的 Acc-2、F1 使用两种协议,斜杠前为 negative/non-negative,斜杠后为 negative/positive;分类指标单位为百分数,MAE 越低越好,Corr 越高越好。

数据集 方法 Acc-2 F1 MAE Corr
MOSI LNLN 70.94/72.55 71.25/72.73 1.046 0.527
MOSI P-RMF 71.53/72.81 71.69/72.93 1.038 0.525
MOSI TF-Mamba 73.46/72.54 73.59/72.57 1.035 0.548
MOSI SemMSA 74.36/73.91 74.18/73.82 1.011 0.550
MOSEI P-RMF 78.83/78.14 80.39/79.33 0.658 0.589
MOSEI TF-Mamba 77.34/77.61 77.18/77.43 0.673 0.578
MOSEI SemMSA 79.61/79.38 80.62/79.87 0.648 0.601
SIMS P-RMF 73.64 74.65 0.500 0.414
SIMS TF-Mamba 74.68 72.20 0.512 0.386
SIMS SemMSA 75.46 77.50 0.474 0.501

在第一种 Acc-2 协议下,MOSI 相对 TF-Mamba 提高 0.90 个百分点,MOSEI 相对 P-RMF 提高 0.78 个百分点;SIMS 相对 TF-Mamba 也提高 0.78 个百分点。SIMS Corr 相对 P-RMF 提高 0.087。不同指标的最佳基线未必是同一个方法,不能把这些差值概括成统一的相对百分比提升。

模态间缺失另在 MOSEI 上测试。原文 Table 3 的集合表示保留的模态,而非被删除的模态:仅保留语言时 SemMSA F1 为 83.61,仅音频为 66.59,仅视觉为 65.91,保留音频与视觉、没有语言时为 72.68;七种保留组合平均为 77.89,CorrKD 为 75.18,相差 2.71 个百分点。包含三模态的该表结果为 86.32,不能与前面的十档缺失率平均混用。

消融实验

下表摘自原文 Table 4,Acc-2 仅使用 MOSI 斜杠前协议;省略存在列名冲突的 SIMS Acc-3/Acc-5,保留可明确对应的指标。

配置 MOSI Acc-2 MOSI F1 MOSI MAE SIMS Acc-2 SIMS F1 SIMS Corr
无 CSR、无两项谱损失 67.49 63.28 1.085 66.83 57.92 0.387
仅 CSR 73.36 73.04 1.040 74.18 76.21 0.450
CSR + 核谱对齐 73.94 73.83 1.024 74.92 76.88 0.493
CSR + 核谱对齐 + 实例分离 74.36 74.18 1.011 75.46 77.50 0.501

CSR 带来最大的首步增益:MOSI Acc-2 增加 5.87 个百分点,SIMS 增加 7.35 个百分点。加入核谱对齐后,SIMS Corr 从 0.450 到 0.493;再加入实例分离达到 0.501。这支持“语义补偿负责主要信息增益,对齐与分离进一步整理表示”的解释,但增量式消融不等于完整的模块交互因果分析。

效率表摘自原文 Table 6;可训练参数与 Task GFLOPs 仅统计情感分析任务优化模块,显存和延迟则统计包含冻结 LLM 的整个管线。

方法 可训练参数 Task GFLOPs 显存 GB 延迟 ms
LNLN 116M 9.0 12.8 25.1
P-RMF 117M 9.7 13.5 67.0
SemMSA 113M 4.8 13.0 30.6

SemMSA 的任务 FLOPs 小于两种对照,延迟也低于 P-RMF,但高于 LNLN;因此不能说它是三者中端到端最快的方法,也不能用 4.8 GFLOPs 代表冻结 LLM 的总计算量。

关键发现

  • 细化深度并非越大越好。附录 Table 11 中,SIMS 1/4/6 步的 F1 为 75.94/77.50/76.84,Corr 为 0.468/0.501/0.489;作者推测过多状态增加冗余或噪声,但没有直接验证这个解释。
  • 无锚点对齐并非所有指标都最好。Table 5(b) 中 SemMSA 的 SIMS F1 为 77.50,高于 Volume 的 76.35,但 Corr 0.501 低于 Volume 的 0.506。
  • 平均领先不代表每档缺失率都领先。MOSI 在缺失率 0.9 时,SemMSA Acc-2 为 58.97/55.95,TF-Mamba 为 60.20/60.37;语义补偿不能消除极端证据不足。
  • 原文数值/表头存在冲突:Table 2、Table 11 将 SIMS Acc-3/Acc-5 写为 58.84/35.68,但 Table 4、Table 5 的部分表头与对应行次序相反;本文不擅自修正这些表。主文还把 MOSI Acc-5/Acc-7 相对 TF-Mamba 的增益写为 2.43/2.23,而 Table 1 中 TF-Mamba 为 37.74/33.95、SemMSA 为 40.93/36.49,实际差值为 3.19/2.54 个百分点;2.43/2.23 更接近逐指标最佳基线差值,不能沿用该文字归因。

亮点与洞察

  • 语义补偿不必等于自然语言生成。本文让冻结 LLM 参与连续表示计算,输出仍由任务模型承担,这给低解码预算下利用语言先验提供了可迁移思路。
  • “样本内一致、样本间区分”被拆成两种几何约束。小型核矩阵处理四路表示的共识,跨实例方向正则抑制塌缩,避免把模态一致性误当成判别能力本身。
  • 适配器的作用不只是维度匹配。Table 5(a) 中线性投影与本文适配器的 SIMS F1 为 73.62 与 77.50,说明聚合序列证据的方式值得与 LLM 规模一同考虑。

局限与展望

  • 作者承认评测主要覆盖视频意见片段,不能据此宣称已泛化到对话情绪识别、讽刺检测或长时交互。三个数据集分别训练评测也不是零样本跨语言迁移证据。
  • 连续语义状态没有自然语言解释,难以检查具体证据如何影响预测;当可见线索大多不可靠时,CSR 与 CSA 都不能保证补偿成功。
  • 固定前缀顺序、各模态独立随机缺失、50% 完整训练样本是明确的协议假设。真实系统可能出现成段丢失、关联传感故障或非随机缺失,需要补充结构化缺失评测。
  • CSA 鼓励接近单一共享方向,可能压缩互补的模态特有信息;实例分离又不区分情感类别,可能把同标签样本也推开。可进一步检查类内结构、谱分布与任务性能的关系,而不只报告分类增益。
  • 部分基线成绩采用既有论文报告,缺少统一复现及统计显著性材料;维度记号、SIMS 列名和文字差值冲突也提高复现成本。Task GFLOPs 与端到端开销应分别审计。
  • 任务成绩只说明对数据集标签的预测能力,不应扩展为个人精神健康、敏感属性或高风险个体决策依据;实际数据使用还需要知情同意、隐私保护与偏差审计。

相关工作与启发

  • vs TFR-Net:前者重建缺失模态特征,SemMSA 则补充隐空间任务语义。后者避免把重建质量直接当作情感信息质量,但也不能证明隐语义忠于原始证据。
  • vs LNLN / P-RMF:这类方法强调主导模态或代理引导,SemMSA 的 CSA 不预设单一路径作为锚点。区别限定在对齐目标,CSR 仍采用固定语言—视觉—音频前缀顺序。
  • vs InfoNCE / Volume:本文比较的是特定替换对齐目标的实现;核谱损失联合观察同实例四路表示,并增加实例分离。不能据此宣称所有对比学习都必须依赖单一锚点,或所有体积目标都无法联合建模。
  • vs 直接调用多模态 LLM 预测:Table 7 的 Qwen2.5-Omni-7B 直接预测 MOSI F1 为 69.92/71.58,而 Qwen3-1.7B 作为 SemMSA 语义来源达到 74.18/73.82。比较同时改变模型与任务适配方式,支持的是该实验设置下辅助表示路线有效,不是所有 LLM 直接预测路线普遍更差。

评分

  • 新颖性: 4/5 — 将连续语义细化与实例内核谱目标结合,具有清楚的方法特色。
  • 实验充分度: 4/5 — 包含三数据集、两种缺失粒度、消融与效率分析,但缺少统一复现和真实缺失模式验证。
  • 写作质量: 3/5 — 主流程明确,谱解释与实际目标边界、表头和数值归因仍需校准。
  • 价值: 4/5 — 为残缺多模态证据下利用冻结 LLM 提供可操作路线,实际价值仍受可靠性与总计算成本约束。