跳转至

Learning to Mask: Cross-Modal Noise Modulation for Hallucination Mitigation in Multi-modal Large Language Models

会议: ECCV 2026
论文: ECCV 原文
代码: 暂无官方开源链接
领域: 多模态VLM / 幻觉抑制
关键词: 多模态大模型, 幻觉抑制, 跨模态噪声调制, Value Cache 动态掩码, 朗之万动力学正则化

一句话总结

针对多模态大模型在 Prefill 与自回归解码过程中冗余特征引发幻觉的问题,本文提出了轻量级实时自校正框架 HalMask,通过跨模态噪声调制模块自适应生成掩码系数向特征与 Value Cache 注入高斯噪声,并结合朗之万动力学正则化在保留关键语义的同时大幅消除幻觉。

研究背景与动机

多模态大语言模型(MLLM)在图像描述、视觉问答和多模态复杂推理等任务中取得了显著进展,但其生成文本频繁偏离真实视觉证据的幻觉现象,始终是制约多模态系统迈向高可靠与安全应用的核心瓶颈。现有幻觉抑制手段主要聚焦于后处理自精炼(Self-Refinement)与特定解码策略(如对比解码、回溯重采样)。然而,自精炼方法通常依赖高性能外部辅助模型进行多阶段循环检验,而特定解码策略在自回归过程中频繁引入多轮前向遍历与动态分支比对,带来了极高的时间延迟与吞吐损耗,严重阻碍了实际在线交互场景下的实时部署。

深入探究 MLLM 的推理全链路可以发现,自回归解码中前序生成的 Token 会逐步积累偏差并向后级联放大,进而诱发严重的新实体或属性幻觉。更关键的是,隐藏状态中的信息冗余不仅存在于 Prefill 阶段的图像 Token 中,更会持续渗透并驻留在解码阶段的视觉 Value Cache 与文本 Value Cache 之内。实证分析表明,对这些具有幻觉诱发倾向的冗余特征注入适度的高斯噪声能够有效阻断错误传播并压制幻觉;但简单的静态噪声注入极易破坏核心视觉线索与文本语义,导致模型退化。

本文的切入角度是:不再依赖重量级重采样或外部检验器,而是通过轻量级网络自适应感知跨模态冗余度,并在隐藏层特征与注意力缓存中精准执行随机噪声掩码。核心 idea:构建包含图像与文本噪声调制模块的 HalMask 框架,利用过阻尼朗之万动力学正则化防止语义崩塌,并在 Prefill 输入特征与解码期多层 Value Cache 上动态注入受控高斯噪声,实现兼顾高吞吐与高保真的轻量级实时自校正。

方法详解

整体框架

HalMask 的核心机制是将幻觉消除抽象为受控的特征压缩与随机噪声平滑过程。整体架构分为训练期的调制模块优化与推理期的全链路两阶段动态掩码:在训练阶段,模型引入图像噪声调制模块(In-Mod)与文本噪声调制模块(Tn-Mod),基于合成的图文三元组利用交叉注意力与融合网络预测逐维度的连续控制系数,并引入过阻尼朗之万动力学约束损失函数,促使冗余特征分布平滑趋向标准高斯而不损伤关键拓扑;在推理阶段,模型在 Prefill 阶段利用 In-Mod 对底层视觉 Token 执行高斯噪声扰动,而在解码阶段启动动态 Value Cache 掩码(Dynamic Value Cache Masking, VCM),每步聚合最新生成历史计算双模态调制系数,直接作用于 Transformer 各层的视觉与文本 Value Cache。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入数据与嵌入<br/>图像 Tokens Xv + 指令/生成文本"] --> B["跨模态噪声调制模块<br/>In-Mod 与 Tn-Mod 交叉注意力计算"]
    B --> C["朗之万动力学正则化<br/>过阻尼方程与切片 Wasserstein 距离约束"]
    C --> D["两阶段动态掩码推理策略<br/>Prefill 阶段视觉 Token 特征扰动"]
    D --> E["动态 Value Cache 掩码机制<br/>解码阶段全层 KV Cache 实时自校正"]
    E --> F["输出无幻觉的高质量回答"]

关键设计

1. 跨模态噪声调制模块:自适应生成特征掩码系数 针对多模态特征维度高且冗余分布不均的问题,静态阈值或全局丢弃极易误伤关键目标特征。HalMask 设计了专用的图像噪声调制模块(In-Mod)与文本噪声调制模块(Tn-Mod)。对于图像分支,In-Mod 以图像 Token 序列 \(\mathbf{X}_v \in \mathbb{R}^{N \times d}\) 作为注意力 Query,以文本 Token 序列(训练期为真实描述 \(\mathbf{X}_{gt}\),推理期为指令或累积答案)作为 Key 和 Value,通过缩放点积注意力将可变长的文本线索投影对齐至图像维度: $\(\mathbf{X}_{gt}^{attn} = \mathrm{Softmax}\left(\frac{\mathbf{X}_v \mathbf{X}_{gt}^T}{\sqrt{d}}\right) \mathbf{X}_{gt}\)$ 将对齐后的文本特征与原始图像特征在通道维度拼接为 \(\mathbf{X}_{merge} \in \mathbb{R}^{N \times 2d}\),送入由五层线性层与 ReLU 组成的 Fusion-Net,最终由 Sigmoid 函数输出各 Token 各维度的连续控制系数 \(\Lambda_{image} = \{\lambda_1^v, \dots, \lambda_N^v\} \in \mathbb{R}^{N \times d}\)。文本分支 Tn-Mod 则对称地以幻觉/生成文本为 Query、以视觉 Token 为 Key/Value 执行交互并输出 \(\Lambda_{text} \in \mathbb{R}^{K \times d}\)。该设计使两种模态能够以彼此的上下文语义作为参考基准,精确识别出与跨模态一致性无关的孤立冗余信息。

2. 朗之万动力学正则化:从动力学分布约束防止语义过度平滑 直接使用传统变分信息瓶颈(VIB)等方法强行拉近特征与高斯先验的 KL 散度,通常会导致严重的过正则化现象,使网络丢失细粒度判别性特征。为此,HalMask 引入物理驱动的过阻尼朗之万动力学(Overdamped Langevin Dynamics)作为特征演化的平滑约束。系统状态方程表述为: $\(dx = \left( -M(x)\nabla V(x) + \mathrm{div}(M(x)) \right) dt + \sqrt{2} M^{1/2}(x) dW_t\)$ 其中 \(M(x)\) 表示扩散网络(Diffusion Net),\(-\nabla V(x)\) 由力网络(Force Net)参数化建模。通过欧拉-马山(Euler-Maruyama)方法以步长 \(dt=1\) 进行数值离散化,驱使特征动态演化向标准高斯平滑靠近。为准确捕捉受扰动特征在多维球面上的一维投影差异,模型引入切片沃瑟斯坦距离(Sliced Wasserstein Distance, SWD)构建动态损失: $\(\mathcal{L}_{dynamic} = \frac{1}{L} \sum_{l=1}^{L} \left( \frac{1}{N} \sum_{n=1}^{N} |a_{(n),l}^v - b_{(n),l}^v| + \frac{1}{K} \sum_{k=1}^{K} |a_{(k),l}^{hal} - b_{(k),l}^{hal}| \right)\)$ 其中 \(\theta_l\) 为单位球面 \(S^{d-1}\) 上的随机投影向量。结合余弦相似度监督项 \(\mathcal{L}_{sup}\) 确保扰动后的特征与真实语义保持紧密对齐,该设计促使网络在隐空间中自适应识别并抹除高阶扰动,既实现了对冗余信息的定向擦除,又有效维护了潜变量表示的拓扑结构(RTD 指标显著下降)。

3. 动态 Value Cache 掩码机制:解码阶段无噪声累积的实时自校正 在自回归解码过程中,传统自校正方法若对历史状态做多次破坏性修改,会导致误差不可逆累积与表征退化。HalMask 提出了即时作用于注意力层 Value Cache 的动态掩码机制(VCM)。具体而言,对于自回归生成的第 \(t\) 个新 Token,模型将其与历史答案 Token 拼接成上下文序列 \(\mathbf{X}_a\),并输入 In-Mod 与 Tn-Mod 实时刷新当前时刻的视觉与文本调制参数 \(\Lambda_{image}\) 和 \(\Lambda_{text}\)。随后在各解码层计算注意力加权时,对底层缓存执行临时高斯注入: $\(\mathbf{C}_v \leftarrow \Lambda_{image} \odot \mathbf{C}_v + (1 - \Lambda_{image}) \odot \epsilon, \quad \mathbf{C}_t \leftarrow \Lambda_{text} \odot \mathbf{C}_t + (1 - \Lambda_{text}) \odot \epsilon\)$ 极为关键的一点在于:Value Cache 在物理显存中始终持久化保存未受污染的原始真实隐状态,每次掩码仅在当前 Token 计算前向注意力的计算图内临时生效。这种“物理留存、前向动态加噪”的机制完全切断了噪声跨时间步的级联污染,使得每一个生成步都能基于最新的全局上下文重新评估全序列的冗余程度,确保了解码过程的数值稳定与实时性。

4. 渐进式多阶段掩码推理策略:Prefill 与 Decoding 全链路协同抑制 多模态推理包含 Prefill(提示与图片一次性编码)与 Decoding(自回归生成)两个截然不同的阶段。HalMask 针对两阶段特征的生成特点实施分层协作策略:在 Prefill 阶段,模型结合输入指令与视觉特征,通过 In-Mod 得到视觉 Token 级掩码 \(\Lambda_{image}\),对输入进入主干 LLM 之前的原始视觉 Token \(\mathbf{X}_v\) 执行空间特征平滑 \(\mathbf{Z}_v = \Lambda_{image} \odot \mathbf{X}_v + (1 - \Lambda_{image}) \odot \epsilon\),从源头上切断底层图像编码器中不可靠背景斑块的幻觉激励;进入 Decoding 阶段后,转入由 VCM 驱动的双模态缓存掩码模式,协同调整长程视觉上下文记忆与文本生成路径。两阶段协同使得静态感知输入与动态演化记忆均处于最优冗余过滤状态。

损失函数 / 训练策略

HalMask 在训练时冻结底层视觉编码器与主干 LLM 的所有原始权重,仅更新 In-Mod、Tn-Mod、Force Net 与 Diffusion Net 对应的轻量线性层参数。模型基于包含真实图像描述、合成共现错误、属性错配三元组的数据集进行端到端优化。联合优化目标函数为: $\(\mathcal{L}_{all} = \beta \mathcal{L}_{dynamic} + \mathcal{L}_{base} + \mathcal{L}_{sup} + \mathcal{L}_{ce}\)$ 其中 \(\mathcal{L}_{ce}\) 为基础语言建模自回归交叉熵损失,\(\mathcal{L}_{base}\) 为扩散与力网络的似然最大化负对数损失,\(\mathcal{L}_{sup}\) 约束扰动后特征与真实描述的余弦相似度,\(\beta\) 为动态正则化项的平衡超参数(实验表明取 \(\beta=0.5\) 效果最佳)。

实验关键数据

主实验

在 MSCOCO 图像描述评估中(采用句子级 \(\text{CHAIR}_S\) 与实例级 \(\text{CHAIR}_I\),越低越好;BLEU 衡量生成语言质量,越高越好),HalMask 在 LLaVA-1.5 与 MiniGPT-4 上均取得了超越所有对比基线的显著效果。特别是在 LLaVA-1.5 上,\(\text{CHAIR}_S\) 相比 Greedy 基线下降了 64.15%(从 21.20 降至 7.60),同时 BLEU 分数提升至 19.48。

主干模型 策略 / 方法 \(\text{CHAIR}_S \downarrow\) \(\text{CHAIR}_I \downarrow\) \(\text{BLEU} \uparrow\)
LLaVA-1.5-7B Greedy 21.20 6.84 16.25
Beam Search 19.40 6.55 17.24
Woodpecker 23.85 7.50 17.05
LURE 19.48 6.50 15.97
OPERA 17.50 6.07 16.02
HALC 16.90 5.72 16.02
HACL 18.27 5.90 17.09
DeGF 18.40 6.10 –
Nullu 15.20 5.30 15.69
HalMask (Ours) 7.60 3.06 19.48
MiniGPT-4-7B Greedy 32.40 12.20 14.57
Beam Search 19.50 6.84 15.99
Woodpecker 28.87 10.20 15.30
LURE 27.88 10.20 15.03
OPERA 29.70 11.96 14.82
HALC 25.20 9.42 14.91
HACL 24.47 9.57 15.84
Nullu 21.40 8.99 14.81
HalMask (Ours) 16.20 5.96 15.40

在离线幻觉评测基准 OPOPE 上的对比中,HalMask 在全类别设定下均取得最优的 Precision 与 \(F_{0.2}\) 指标:

模型架构 评测方法 Random (\(F_{0.2} \uparrow\)) Popular (\(F_{0.2} \uparrow\)) Adversarial (\(F_{0.2} \uparrow\))
LLaVA-1.5 Greedy 96.42 89.71 85.22
OPERA 96.58 90.30 85.26
HALC 95.89 90.05 87.81
Nullu 96.05 92.36 86.97
HalMask (Ours) 96.67 92.79 90.04
MiniGPT-4 Greedy 94.25 88.53 87.32
OPERA 94.55 89.28 88.22
HALC 94.26 90.01 88.61
Nullu 94.82 92.19 89.21
HalMask (Ours) 95.62 91.91 90.70

在推理效率与 POPE 平均指标对比中,HalMask 展现出巨大的实用价值:LLaVA-1.5 的单 Token 生成延迟为 0.021s,对比解码方法 HALC 延迟高达 0.283s(平均 F1 为 76.73%),而 HalMask 仅需 0.034s/token(比 HALC 快 8.3 倍),POPE 平均准确率/F1 分别达到 87.72% 与 87.52%,实现了精度与效率的最佳平衡。

消融实验

消融实验系统验证了各个组件在 CHAIR 与 OPOPE 上的贡献。当仅启用 In-Mod 时,\(\text{CHAIR}_S\) 即从 21.20 降至 12.80;当仅启用 Tn-Mod 时降至 20.40;两者结合达到 7.60,表明双模态协同抑制具有显著的乘法互补效益。

配置 \(\text{CHAIR}_S \downarrow\) \(\text{CHAIR}_I \downarrow\) OPOPE Random (\(F_{0.2} \uparrow\)) OPOPE Popular (\(F_{0.2} \uparrow\)) OPOPE Adv (\(F_{0.2} \uparrow\)) 平均 \(F_{0.2} \uparrow\) 说明
LLaVA-1.5 (Baseline) 21.20 6.84 96.42 89.71 85.22 90.45 原始贪心解码基线
+ In-Mod 12.80 4.45 96.52 91.98 89.69 92.73 仅执行视觉 Token 与视觉 Cache 掩码
+ Tn-Mod 20.40 6.74 96.79 89.31 87.30 91.13 仅执行文本 Value Cache 掩码
+ Tn-Mod + In-Mod (Full) 7.60 3.06 96.67 92.79 90.04 93.17 完整双模态噪声调制框架

在正则化项的消融中,对比移除与保留朗之万动力学正则项的表现:

配置 POPE 平均 Recall \(\uparrow\) POPE 平均 F1 \(\uparrow\) RTD 拓扑散度 \(\downarrow\) 说明
w/o. 动力学正则化项 82.76% 87.11% 56.13 简单高斯先验导致表征拓扑受损
HalMask (含动力学正则) 84.98% 87.52% 50.15 平均召回率提升 2.22%,拓扑散度显著降低

关键发现

  • 视觉与文本双模态调制的互补性:消融实验显示视觉冗余过滤贡献了主要的幻觉抑制幅度(\(\text{CHAIR}_S\) 降 8.4 点),而文本 Value Cache 掩码则在抑制错误链式推导中起到托底作用,两者结合实现了超线性的抑制效果。
  • 动力学正则化的保真作用:引入朗之万动力学正则化后,POPE 召回率直接提升了 2.22%,表征拓扑发散度(RTD)由 56.13 降至 50.15。这证明了平滑动力学演化有效规避了简单高斯噪声抹杀真实微小语义实体的缺陷。
  • 极高的计算吞吐比:相比于目前主流基于多轮前向对比的解码方法(如 HALC 的 0.283s/token),HalMask 仅需 0.034s/token,以不到 15ms 的轻微额外开销实现了大幅度性能提升,满足生产环境部署要求。

亮点与洞察

  • 将特征截断平滑转变为受控噪声注入:传统特征剪枝或稀疏化多采用硬阈值掩码,极易破坏注意力权重的连续性;HalMask 创新性地将噪声控制系数引入高斯扰动项,以连续概率插值平滑冗余特征,实现了软性语义遗忘。
  • 解耦物理存储与前向掩码的无状态 Value Cache 设计:在自回归全过程中始终持久化纯净的原始隐状态,仅在每次前向传播时临时加噪计算,从根本上杜绝了噪声在长程生成中的递增退化问题。
  • 具备极佳的模型即插即用迁移性:In-Mod 与 Tn-Mod 仅包含数层 MLP,参数增量微乎其微且不改变 LLM 主干权重,这种结构极易迁移到包括 Qwen2.5-VL、InternVL 等在内的各类现代架构中。

局限与展望

  • 作者承认的局限:方法依赖于离线合成的图文三元组进行噪声模块训练,虽然能够覆盖常见的目标共现与位置错误,但在极端长尾实体或专业领域(如复杂医疗报告、密集遥感影像)上的泛化先验可能存在不足。
  • 潜在的研究局限:噪声调制直接作用于所有注意力层的 Value Cache,未针对不同 Transformer 层级语义抽象深度的差异进行自适应分层加权;此外,控制系数仅在通道级别建模,缺乏空间几何注意力先验。
  • 未来改进思路:可探索将朗之万动力学的扩散矩阵参数与跨层自适应门控机制相结合,实现深浅层差异化的噪声扩散;同时结合测试时少样本自适应(Test-Time Adaptation)动态微调掩码强度。

相关工作与启发

  • vs Woodpecker / LURE:这类外部纠错管线通过额外的目标检测器或大模型在文本生成后执行多轮问答与重写,存在严重的级联延迟与显存开销;HalMask 为单模型内的单次自回归前向机制,无外部调用。
  • vs OPERA / HALC / DeGF:基于对比解码或回溯重采样的策略需要维护多个候选解码流或在注意力过载时回退重算;HalMask 直接在底层 Token 与 Value Cache 层消除冗余,保持标准贪心/采样解码流程不变,吞吐提升 8 倍以上。
  • vs Nullu / VASparse:零样本投影视角或稀疏化裁剪主要集中在 Prefill 视觉 Token 阶段,忽略了自回归解码期累积在文本 Value Cache 中的错误;HalMask 首创 Prefill 与 Decoding 全链路联合调制。

评分

  • 新颖性: ⭐⭐⭐⭐☆ 提出通过受控高斯噪声注入与朗之万动力学正则化消除 Value Cache 冗余,理论构思新颖巧妙。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 MSCOCO、POPE、OPOPE、AMBER、MMBench、ScienceQA 等六大标准评测集与详细消融,证据扎实。
  • 写作质量: ⭐⭐⭐⭐⭐ 动机阐述深刻,动力学离散化推导严谨,图表表达直观清晰。
  • 价值: ⭐⭐⭐⭐⭐ 兼顾大幅度幻觉降低(CHAIR 降 64%)与极低延迟开销(0.034s/token),工业落地价值极高。