DARE to Mitigate Hallucination: Dual-path Auto-Regressive-aware Editing¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/KU-VGI/DARE
领域: 幻觉缓解 / 多模态VLM
关键词: 大型视觉语言模型、目标幻觉、表征编辑、自回归生成动力学、零空间投影
一句话总结¶
DARE 揭示了现有基于教师强制(Teacher-Forcing)的表征编辑难以改变自回归生成时的相对 Logit 决策且损伤视觉注意力的本质瓶颈,通过将文本对比、自回归解码状态转移与图像反事实对比融为一体,在零额外推理开销下显著降低多模态大模型的物体幻觉。
研究背景与动机¶
大型视觉语言模型(LVLMs)如 LLaVA、MiniGPT-4 和 mPLUG-Owl2 在图文理解与多轮对话中展现出强大能力,但目标幻觉(Object Hallucination)——即生成与图像内容矛盾或凭空捏造的物体描述——始终是阻碍其在工业级可靠场景落地的致命顽疾。为克服重新微调模型所需的高昂算力开销,以 Nullu 等为代表的无训练表征编辑(Representation Editing)方法应运而生。这类方法通常在教师强制(Teacher-Forcing, TF)设定下,对比幻觉文本与真实文本的隐层表征,通过奇异值分解(SVD)提取幻觉子空间(HalluSpace),再借助零空间投影将对应权重方向消除,实现即插即用的轻量化抑制。
然而,现有表征编辑方法在实际生成中往往收效受限。深入分析发现其存在两大深层机理缺陷:首先是生成动力学脱节。在教师强制评估下,即便给模型输入包含幻觉词的上下文,真实物体的候选 Token 依然以极高概率排在 Top-5(准确率高达 \(93.48\%\pm 1.47\%\)),表明模型内部表征并未丢失真实视觉知识;但一旦进入实际的自回归(Auto-Regressive, AR)贪心解码,TF 编辑前后的真实词与幻觉词 Logit 差值(Logit Margin)变化几乎集中在 0 附近,未能完成“排名翻转”,幻觉词依然胜出。其次是多模态解耦不足。先前的编辑方向完全由纯文本对比提取,但在多模态深度融合的自注意力层中,文本特征与视觉特征高度纠缠,单纯剔除文本幻觉方向会导致深层网络对图像 Patch 的注意力显著萎缩(视觉注意力平均下降 \(7.53\%\)),进而因视觉线索缺失诱发次生幻觉。
针对这两大瓶颈,本文的核心思考在于:幻觉抑制不仅需要识别静态文本的语义差异,更必须对齐自回归生成步的状态跳变,并利用视觉对比反向锚定跨模态特征。核心 idea:提出 DARE(Dual-path Auto-Regressive-aware Editing),构建包含自回归状态转移与教师强制文本对比的增强幻觉子空间,并引入反事实配对图像的视觉对比子空间,分别对 FFN 下投影层和注意力输出投影层执行模块解耦的零空间投影编辑。
方法详解¶
整体框架¶
DARE 的核心流程由三大核心子空间提取与双模块参数编辑构成,完全在模型参数离线更新阶段执行,无需任何解码期额外计算。整体架构包含三个表征挖掘模块: 1. 教师强制文本对比(TF HalluSpace):提取图文上下文中幻觉描述与真实描述的全局文本差异; 2. 自回归生成感知(AR HalluSpace):在自回归解码轨迹上定位幻觉首次出现的步长,捕获其前序状态转移增量 \(\Delta h\); 3. 视觉差异对比(Visual-Difference HalluSpace):借助物体擦除的反事实图对,隔离纯粹由视觉证据缺失诱发的特征方向。
在编辑执行期,DARE 先对 AR 向量进行基于 TF 子空间的正交残差化,经 QR 分解得到正交基构成的增强子空间 \(V_\omega^{Aug}\),并将其投影消除于 FFN 模块的下投影矩阵(\(W_{\omega, down}\));同时将提取自图像对比的视觉幻觉子空间 \(V_{\omega, k_{vis}}^{vis}\) 投影消除于自注意力输出矩阵(\(W_{\omega, o}\)),形成双路径协同编辑架构。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入图像与配对样本<br/>LURE文本对 + BEAF反事实图对"] --> B["自回归解码感知子空间<br/>捕获幻觉出现前 temporal window 状态跃迁"]
A --> C["教师强制文本对比子空间<br/>提取幻觉与真实文本全局池化表征差异"]
A --> D["反事实图像差异对比子空间<br/>对齐同提示词下物体增删诱发的视觉表征差"]
B --> E["增强幻觉子空间构建<br/>AR向量正交残差化 + 拼接后QR正交分解"]
C --> E
E --> F["FFN下投影层权重编辑<br/>零空间投影 W_down 消除解码与文本幻觉方向"]
D --> G["注意力输出投影层权重编辑<br/>零空间投影 W_o 抑制视觉特征纠缠丢失"]
F --> H["编辑后 LVLM<br/>无推理开销的标准自回归生成"]
G --> H
关键设计¶
1. 自回归解码感知子空间:捕捉解码动态中的状态跃迁 传统的静态 TF 表征仅反映给定完整上下文后的静态分布,无法反映自回归解码中前序 Token 错误累积导致的分数逆转。针对这一缺陷,DARE 利用 LURE 数据集执行自回归贪心生成,并借助 CHAIR 评测工具在生成序列 \(y = (y_1, \dots, y_T)\) 中精确定位幻觉目标词首次出现的 Token 位置 \(t\)。在模型的关键隐藏层 \(\omega\) 处,模型计算相邻步的隐状态转移差分: $\(\Delta h_{\omega, j} = h_{\omega, j} - h_{\omega, j-1}\)$ 对于每个幻觉事件,DARE 截取幻觉发生点前 \(w\) 步的时间滑动窗口序列 \(\{\Delta h_{\omega, t}, \Delta h_{\omega, t-1}, \dots, \Delta h_{\omega, t-w+1}\}\)。将所有样本的状态转移向量行向堆叠构成状态跃迁矩阵 \(G_\omega \in \mathbb{R}^{N_{AR} \times D}\)。对其执行奇异值分解(SVD): $\(G_\omega = U_\omega \Sigma_\omega (V_\omega^{AR})^\top\)$ 选取前 \(k_{AR}\) 个右奇异向量,构成能够表征自回归生成时即将滑向幻觉状态的微观动态子空间 \(V_\omega^{AR} \in \mathbb{R}^{D \times k_{AR}}\)。
2. 增强幻觉子空间构建:正交残差化与 FFN 层解耦编辑 静态 TF 文本对比空间 \(V_\omega^{TF} \in \mathbb{R}^{D \times k_{TF}}\) 与微观 AR 空间 \(V_\omega^{AR}\) 存在一定的语义重合。为避免冗余并纯化 AR 信号中的特异动态信息,DARE 对每个 AR 向量进行基于 TF 子空间正交补的投影残差化: $\(\tilde{v}_j^{AR} = \left( I - V_\omega^{TF} (V_\omega^{TF})^\top \right) v_j^{AR}\)$ 随后将基底矩阵水平拼接 \([V_\omega^{TF}, \tilde{V}_\omega^{AR}]\) 并进行紧凑 QR 分解: $\([V_\omega^{TF}, \tilde{V}_\omega^{AR}] = Q_\omega^{Aug} R_\omega^{Aug}\)$ 正交矩阵 \(Q_\omega^{Aug}\) 即定义了增强幻觉子空间 \(V_\omega^{Aug}\)。由于 FFN 的下投影层(down-projection)在 Transformer 中主要充当“键值记忆库”将隐层状态映射回表征空间,DARE 构造投影算子 \(P_\omega = I - V_\omega^{Aug} (V_\omega^{Aug})^\top\),对 FFN 下投影权重实施零空间编辑: $\(W_{\omega, down}^{edit} = P_\omega W_{\omega, down}^{orig}\)$ 该设计在保持全局表征完整度的前提下,精准剥离了引发自回归幻觉生成的特征激活通道。
3. 反事实图像差异对比:消除视觉注意力坍缩 针对纯文本编辑诱发视觉注意力锐减的缺陷,DARE 引入基于 BEAF 数据集的图像反事实对——两张图像内容相同,仅存在目标物体的真实存在与自然擦除差异。在提取阶段,模型采用严格的教师强制(TF)模式,使正负两张图像在完全相同的提示词文本上下文下前向推理,从而彻底剥离自回归文本差异对视觉特征的干扰,精准提取纯视觉差异。对正负隐状态差异矩阵 \(E_{vis}^\omega = X_H^\omega - X_T^\omega\) 进行 SVD 分解,获得前 \(k_{vis}\) 个主奇异向量 \(V_{\omega, k_{vis}}^{vis}\)。DARE 将该视觉差异子空间专用于自注意力输出投影层(Attention Output Projection)的权重编辑: $\(W_{\omega, o}^{edit} = \left( I - V_{\omega, k_{vis}}^{vis} (V_{\omega, k_{vis}}^{vis})^\top \right) W_{\omega, o}^{orig}\)$ 由于自注意力输出层直接决定了视觉 Token 聚合信息融入残差流的比例与方向,对其进行视觉反事实零空间编辑,能有效阻止注意力机制误把背景噪点放大为虚假物体,同时避免损伤对真实存在物体的视觉聚焦。
损失函数 / 训练策略¶
DARE 属于完全无训练(Training-Free)的参数编辑方法,无需任何基于梯度下降的参数优化过程。其核心计算仅包含: 1. 离线前向传播收集少量隐状态样本(基于 LURE 和 BEAF 数据集); 2. 小规模协方差矩阵的截断奇异值分解(SVD)与 QR 分解; 3. 一次性矩阵乘法更新模型的指定网络层权重。 最终部署模型与原始 LVLM 在网络结构、参数量和推理管线上完全一致,解码阶段保持零额外延迟与零显存消耗。
实验关键数据¶
主实验¶
在标准图像描述生成幻觉基准 CHAIR(测试在 MSCOCO 上的描述幻觉率)以及目标存在性问答基准 POPE 上,DARE 与主流基线(包括标准解码、VCD/OPERA/ONLY 等推理期校准方法、以及表征编辑代表 Nullu)展开全面对比。
表 1: CHAIR 评估结果(对比基线模型及现有幻觉缓解方法,最大 Token 数设为 64,原文 Table 1)
| 方法类别 | 方法名称 | LLaVA-1.5 \(CHAIR_S \downarrow\) | LLaVA-1.5 \(CHAIR_I \downarrow\) | LLaVA-1.5 \(BLEU \uparrow\) | MiniGPT-4 \(CHAIR_S \downarrow\) | mPLUG-Owl2 \(CHAIR_S \downarrow\) |
|---|---|---|---|---|---|---|
| 基线解码 | Greedy | \(24.32 \pm 2.92\) | \(8.91 \pm 0.46\) | \(15.16 \pm 0.30\) | \(35.91 \pm 3.15\) | \(24.96 \pm 1.43\) |
| 基线解码 | Beam Search | \(22.61 \pm 1.64\) | \(7.01 \pm 0.95\) | \(16.17 \pm 0.13\) | \(27.33 \pm 2.08\) | \(21.80 \pm 1.31\) |
| 推理期解码 | VCD (CVPR24) | \(21.15 \pm 1.25\) | \(7.19 \pm 0.26\) | \(14.91 \pm 0.46\) | \(30.60 \pm 1.95\) | \(20.56 \pm 2.40\) |
| 推理期解码 | OPERA (CVPR24) | \(17.61 \pm 1.16\) | \(6.09 \pm 1.11\) | \(15.21 \pm 0.49\) | \(29.64 \pm 0.18\) | \(20.19 \pm 0.15\) |
| 表征干预 | SID (ICLR25) | \(17.95 \pm 1.93\) | \(6.64 \pm 0.11\) | \(15.04 \pm 0.24\) | \(27.16 \pm 2.06\) | \(19.66 \pm 1.43\) |
| 权重编辑 | Nullu (CVPR25) | \(20.53 \pm 1.40\) | \(7.03 \pm 0.86\) | \(15.37 \pm 0.18\) | \(23.93 \pm 0.31\) | \(18.80 \pm 0.72\) |
| 动态解码 | CMI-VLD (NeurIPS25) | \(16.42 \pm 0.75\) | \(6.59 \pm 0.81\) | \(15.40 \pm 0.86\) | \(23.80 \pm 1.73\) | \(17.76 \pm 0.84\) |
| 本文方法 | DARE (Ours) | \(14.93 \pm 1.68\) | \(6.07 \pm 0.82\) | \(15.61 \pm 0.59\) | \(22.64 \pm 1.49\) | \(16.81 \pm 0.43\) |
在 POPE 随机采样评测中,DARE 同样展现出领先表现。在 LLaVA-1.5 上,DARE 取得 Accuracy \(89.74 \pm 0.54\%\)、Precision \(91.40 \pm 0.71\%\)、F1 Score \(90.04 \pm 0.37\%\),大幅优于 Greedy 基线(\(79.53 / 82.64 / 82.47\))与先前的权重编辑方法 Nullu(\(88.73 / 88.70 / 87.56\))。
消融实验¶
为验证三大核心组件(TF 文本对比编辑、AR 解码动态编辑、反事实视觉差异编辑)各自的有效性与协同效应,在 LLaVA-1.5 上进行了详尽的逐项消融。
表 2: DARE 核心模块消融实验(原文 Table 3)
| 配置方案 | \(Editing_{TF}\) | \(Editing_{AR}\) | \(VisualDiff\) | \(CHAIR_S \downarrow\) | \(CHAIR_I \downarrow\) | 相对基线说明 |
|---|---|---|---|---|---|---|
| Base (原始模型) | - | - | - | \(24.32 \pm 2.92\) | \(8.91 \pm 0.46\) | 原始未编辑基线 |
| (A) 单独 TF 编辑 | ✓ | - | - | \(20.53 \pm 1.40\) | \(7.03 \pm 0.86\) | 类似传统 Nullu 做法 |
| (B) 单独 AR 编辑 | - | ✓ | - | \(17.61 \pm 1.64\) | \(6.94 \pm 1.06\) | 单模块效果最强,降低 \(6.71\) 点 |
| (C) 单独 Visual 编辑 | - | - | ✓ | \(17.81 \pm 1.28\) | \(7.20 \pm 0.73\) | 证实纯视觉反事实信号的高价值 |
| (D) TF + AR 联合 | ✓ | ✓ | - | \(15.83 \pm 1.48\) | \(6.47 \pm 1.03\) | 正交残差化合并带来显著互补增益 |
| (E) AR + Visual 联合 | - | ✓ | ✓ | \(15.57 \pm 1.70\) | \(6.41 \pm 0.83\) | 两两组合中的最优配置 |
| (F) TF + Visual 联合 | ✓ | - | ✓ | \(17.17 \pm 1.22\) | \(6.62 \pm 0.50\) | 视觉约束显著修复纯文本编辑缺陷 |
| DARE (完整模型) | ✓ | ✓ | ✓ | \(14.93 \pm 1.68\) | \(6.07 \pm 0.82\) | 综合三维信号,累计下降近 10 个百分点 |
此外,在超参数敏感度测试中(原文 Table 4),实验发现: - 编辑层范围:编辑高层(16–31层)取得最佳效果(\(CHAIR_S=15.11\)),显著优于中低层(0–15层为 \(17.70\)),印证了幻觉决策多在语言解码深层收敛; - 子空间维度:\(k=2\) 时幻觉抑制效果最显著(\(CHAIR_S=15.11\)),当 \(k\) 扩大至 8 时指标反而劣化至 \(17.09\),表明有害表征集中于极低维度的致密流形中; - 时间窗口:截取幻觉发生前 3 个 Token 的跃迁增量表现最优(\(CHAIR_S=15.11\)),过宽的窗口会引入与幻觉无关的常规句法转移扰动。
关键发现¶
- AR 解码动态是单点提升最大的驱动源:消融实验中,单独加入 AR 动态编辑相比基线将 \(CHAIR_S\) 骤降 \(6.71\),大幅领先单独 TF 编辑的降幅(\(3.79\)),有力证实了“脱离自回归时序状态跃迁的静态对比无法触及幻觉发生本质”的核心论断。
- 视觉反事实投影成功阻遏了注意力衰减:在视觉注意力观测中,传统纯文本编辑(如 Nullu)导致深层视觉 Token 注意力平均跌落 \(7.53\%\),而 DARE 引入对注意力输出投影矩阵 \(W_o\) 的视觉差异解耦编辑后,该跌落被抑制至仅 \(2.32\%\),大幅保全了多模态感知通道。
- 前沿大尺度模型上的极佳泛化性:在 Gemma-3-12B 和 Qwen3-VL-8B 等最新大体量骨干上(原文 Table 5),DARE 依旧稳定保持显著优势(例如在 Gemma-3-12B 上将 \(CHAIR_S\) 从基线 \(33.40\) 削减至 \(30.91\)),展现出超越特定架构的普适生命力。
亮点与洞察¶
- 从解码决策 Logit Margin 视角揭示传统编辑的失效机理:论文未停留在“表征距离被拉开”的表面指标,而是敏锐指出教师强制下虽然表征被改动,但解码候选 Token 的 Logit 差值并未跨越阈值,直击现有表征编辑无法纠正最终输出的深层病因。
- 正交残差化与 QR 重建子空间的数学严密性:不是简单粗暴地将 TF 与 AR 方向向量拼在一起做投影,而是先用投影算子剔除 AR 中已被 TF 涵盖的分量,再通过 QR 分解得到紧凑正交基,保证了零空间投影不会过度坍缩模型参数容量。
- 将视觉与语言成分路由至 Transformer 对应组件的分治思想:将语言及解码时序动态对应的增强子空间作用于 FFN 下投影层(调节概念激活),将视觉差异子空间专职作用于自注意力输出层(调节视觉特征融合强度),结构设计与模块机理严密呼应。
局限与展望¶
- 依赖预先标注的幻觉定位与离线样本:AR 子空间的构建依赖于在 LURE 数据集上通过 CHAIR 规则匹配初次幻觉发生的 Token 位置。对于超出 COCO 预定义目标类别的抽象幻觉或复杂属性关系幻觉,目前机制难以自动捕捉精准的 temporal window。
- 固定时间窗口与固定秩假设:目前全局采用统一的时间窗口 \(w=3\) 与秩截断 \(k=2\),然而不同语义复杂度的实体和长尾类别在自回归累积状态转移时的发散跨度可能不同,动态自适应秩选择仍待探索。
- 可拓展至多轮推理与视频理解:未来可探索将这种时序步长转移差分(\(\Delta h\))的思想迁移至多模态长视频推理或具身智能决策中,用于抑制跨帧动作规划中的时序幻觉。
相关工作与启发¶
- vs Nullu (CVPR 2025):Nullu 率先提出了基于教师强制文本对比构建 HalluSpace 并做权重零空间投影的方案。本文继承了其零额外推理延迟的轻量化优势,但针对其“无法翻转自回归决策”和“损伤视觉注意力”的两大核心痛点,通过 AR 动态残差和反事实图像对比实现了全方位升维。
- vs OPERA / VCD 等推理期对比解码方法:OPERA 和 VCD 在自回归生成循环中实时执行多次前向或额外计算(例如视觉降质对比、惩罚聚合注意力),带来明显的推理吞吐下降(DARE 在保持高吞吐的同时,吞吐量比此类解码干预方法高出近 5 倍)。DARE 证明了离线参数编辑完全能在生成质量与速度上兼得。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ [敏锐发现 TF 编辑下的 Logit Margin 停滞与视觉注意力损耗,提出双路多模态对比与解码时序状态结合的表征编辑架构]
- 实验充分度: ⭐⭐⭐⭐⭐ [覆盖主流与最新一代 LVLM(含 LLaVA-1.5、MiniGPT-4、mPLUG-Owl2 以及 Qwen3-VL、Gemma-3),包含 CHAIR、POPE、MME 及丰富的消融与机理分析]
- 写作质量: ⭐⭐⭐⭐⭐ [机理实验深入扎实,动机层层递进,方法设计与问题痛点高度对齐]
- 价值: ⭐⭐⭐⭐⭐ [为多模态大模型的快速、无成本、即插即用安全对齐与幻觉抑制提供了极具实用价值的范式参考]