Contrastive-Guided Self-Supervised Latent Visual Reasoning for Hallucination Mitigation¶
会议: ECCV 2026
论文: ECCV 原文
领域: 多模态VLM / 幻觉抑制 / 隐空间推理
关键词: 幻觉抑制 / 隐式视觉推理 / 自监督学习 / 强化学习 / 对比探针
一句话总结¶
提出自监督隐式视觉推理框架 CoLVR,利用视觉对比探针无监督定位图像关键区域,并通过 GRPO 强化学习将内部隐式推理 token 对齐到显著视觉证据,无需人工标注即可大幅降低 LVLM 幻觉。
研究背景与动机¶
大型视觉语言模型(LVLMs)在各类多模态任务中取得了显著进展,但物体幻觉(Object Hallucination)问题依然严峻,严重削弱了模型在事实性问答中的可靠性。近期研究通过注意力机制分析发现,模型在发生幻觉时往往过度依赖文本语言先验,而忽略了输入图像中的真实视觉线索。为了增强视觉事实性,现有主流去幻觉方法主要依赖于输出 logits 空间的对比后处理、内部注意力引导,或是借助外部检测器/裁剪工具的多轮交互视觉思维链(Visual-CoT)。然而,依赖外部工具的“Thinking with images”范式不仅受限于外部模块的能力和调用延迟,且模型内部依然缺乏自主感知探索机制。
为了摆脱外部工具依赖,隐式视觉推理(Latent Visual Reasoning)尝试将视觉推理过程内化到模型的连续隐空间中,直接在自回归序列中插入连续隐向量以承载“中间视觉思维”。但现有隐式视觉推理方法普遍高度依赖强监督学习:它们需要预先人工标注密集的辅助图像或边界框链条,通过监督微调(SFT)强制隐向量与标注特征对齐。这种范式不仅面临极其昂贵的数据标注成本与可扩展性瓶颈,而且模型的推理与泛化能力被严格限制在人工构造的视觉链粒度上限之中。
核心 idea:利用视觉对比探针消除语言先验以自主挖掘查询相关的关键视觉显著区域,并通过 GRPO 强化学习奖励驱动连续隐式推理 token 与关键视觉特征对齐,构建无需人工标注的端到端自监督隐式视觉去幻觉框架。
方法详解¶
整体框架¶
CoLVR 的整体框架由自回归隐式推理接口与两阶段自监督训练流(SFT 阶段与对比引导 RL 阶段)组成。模型采用统一的自回归架构,在词表中扩展了 ⟨latent⟩、⟨/latent⟩ 和连续向量占位符 ⟨latent_pad⟩。当模型解码出 ⟨latent⟩ 时切入隐式推理模式,自回归生成固定长度 \(K\) 的连续隐向量 \(Z\),随后以 ⟨/latent⟩ 退出隐式推理并继续输出最终文本答案。
在训练阶段,第一阶段 SFT 使用无标注的粗粒度伪区域标签,让模型学会生成控制 token 以及初步将隐向量投影到图像特征子空间;第二阶段 RL 引入基于视觉对比探针的强化学习,通过输入原始图像与受扰动图像并对比交叉注意力分布,自动定位与查询强相关的真实关键区域,利用 GRPO 算法最大化隐向量与显著区域的对齐奖励,促使模型内部自主“凝视”视觉证据。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
In["输入:图像 I 与查询 q"] --> Probing["1. 视觉对比探针:对比原图与扰动图注意力,定位显著区域权重"]
In --> SFTStage["2. 粗粒度隐式 SFT:自监督伪区域对齐与格式热身 (带 stop-gradient)"]
Probing --> RLReward["3. 区域对齐奖励设计:计算隐向量与 Top-M 关键区域余弦相似度"]
SFTStage --> RLReward
RLReward --> GRPOTrain["4. GRPO 策略优化:成组采样无真实标签无监督强化学习"]
GRPOTrain --> Out["输出:隐式视觉推理引导的无幻觉文本回答"]
关键设计¶
1. 视觉对比探针:无监督消除语言先验并定位关键区域 现有注意力分析表明,仅凭单个图像的自注意力分布容易混淆语言先验、位置偏差与真实视觉感知。为了在无需人工标注的前提下精准提取与当前查询直接相关的真实视觉证据,CoLVR 构建了视觉对比探针。给定原始输入对 \((I, q)\),同时输入内容无关的高斯噪声扰动图像 \(\tilde{I}\)(实验证明高斯噪声比纯白或全黑图像能更好地保留低层结构先验并滤除语义)。模型计算全层和多头上从文本查询 token 指向各个图像 patch token 的交叉注意力矩阵,并通过差分获得 patch 级的纯净视觉贡献值: $\(a_t = g_\theta(I, q)_t - g_\theta(\tilde{I}, q)_t\)$ 其中 \(g_\theta(I, q)_t = \frac{1}{LH}\sum_{\ell=1}^L \sum_{h=1}^H \left(\frac{1}{|\mathcal{P}_{\mathrm{q}}|} \sum_{i \in \mathcal{P}_{\mathrm{q}}} \mathbf{A}_{i,t}^{(\ell,h)}\right)\)。随后通过 ReLU 截断负响应并进行归一化,得到每个图像 patch 的无偏显著性权重 \(w_t\)。这一设计使得模型完全摆脱了对外部目标检测器或人工标注 bounding box 的依赖。
2. 粗粒度隐式 SFT 与截断梯度机制:稳健构建内部连续推理空间
在强化学习之前,模型必须具备自主产生与解码隐式推理块的基础语法能力,同时防止优化崩塌。CoLVR 将图像均匀划分为标准规范区域(如左上、右上、中心等),构造完全不需要人工介入的粗粒度伪区域作为先验。在自回归解码中,当遇到连续槽位 ⟨latent_pad⟩ 时,提取模型最后一层隐状态作为隐向量 \(z_k = h_{t_k}^{(L)}\),并计算其与目标粗粒度区域内图像 token 最后一层均值表征 \(r(b)\) 的余弦相似度损失 \(\mathcal{L}_{\mathrm{align}}\)。更为关键的是,为了防止优化时模型偷懒去修改底层的视觉 token 表征(即寻找捷径解),算法对计算流采用了截断梯度(Stop-Gradient)机制:
$\(\widetilde{\mathcal{L}}_{\mathrm{align}} = \sum_{k=1}^K z_k^\top \mathrm{sg}(\nabla_{z_k} \mathcal{L}_{\mathrm{align}})\)$
确保梯度仅沿隐式 token 反向传播更新,强制隐向量去主动适配视觉表征空间,从而彻底杜绝表征退化。
3. 对齐奖励与格式约束驱动的 GRPO 强化学习:摆脱真实标签依赖
通过 SFT 掌握基础隐式推理语法后,模型进入基于组相对策略优化(GRPO)的无监督强化学习阶段。对于每个样本,策略网络采样生成 \(G\) 条候选响应序列。奖励函数包含两大核心部分:格式奖励 \(r_2\) 确保模型必须完整生成有效的 ⟨latent⟩...⟨/latent⟩ 结构(若缺失则惩罚 -1,具备则为 0);对齐奖励 \(r_1\) 则量化隐向量平均嵌入 \(\bar{z}\) 与对比探针提取的关键区域之间的特征契合度。在实验中硬对齐(Hard Alignment)表现最为稳健,即仅取显著度前 \(M\) 的关键 patch 集合 \(\mathcal{S}\) 计算均值归一化余弦相似度:
$\(r_1^{\mathrm{hard}}(I, q, y) = \frac{1}{|\mathcal{S}|} \sum_{t \in \mathcal{S}} \frac{1 + \cos(\bar{z}, h_t^{(L)})}{2}\)$
总奖励 \(R = r_1 + \beta r_2\) 在采样组内计算相对优势 \(A^{(i,g)}\) 并优化策略。整个过程无需标准文本答案或事实标注,模型在奖励驱动下自发学会调整内部隐式思维,主动聚焦于消除幻觉所必需的视觉补丁。
损失函数 / 训练策略¶
在第一阶段 SFT 中,总优化损失为标准文本交叉熵损失与加权对齐损失之和:
$\(\mathcal{L}_{\mathrm{SFT}} = \mathcal{L}_{\mathrm{CE}} + \lambda \widetilde{\mathcal{L}}_{\mathrm{align}}\)$
其中在计算语言模型损失 \(\mathcal{L}_{\mathrm{CE}}\) 时,特殊控制 token ⟨latent⟩ 和 ⟨/latent⟩ 参与计算损失以促使其自主生成,而占位符 ⟨latent_pad⟩ 则予以掩码屏蔽;实验中权重 \(\lambda = 1\)。
在第二阶段 RL 中,采用 GRPO 框架最大化优势加权序列似然并施加轻量 KL 正则散度惩罚:
$\(\mathcal{L}_{\mathrm{GRPO}} = -\mathbb{E}_{i,g} \left[ A^{(i,g)} \sum_{t \in \mathcal{P}_{\mathrm{txt}}} \log p_\theta(y_t^{(i,g)} \mid I^{(i)}, q^{(i)}, y_{<t}^{(i,g)}) \right] + \beta \mathbb{E}_{i,g}[\mathrm{KL}(\pi_\theta \parallel \pi_{\mathrm{ref}})]\)$
训练采用 LoRA 微调方案并冻结视觉编码器,采样组大小 \(G=8\),KL 系数设为 0.01,在 4 块 A800 GPU 上仅耗时约 18 小时即可完成全部训练流程。
实验关键数据¶
主实验¶
在代表性幻觉评测基准 CHAIR、POPE、Hallbench 以及 GPT-4 判别的 MMHal 上,基于 Qwen2.5-VL-7B 和 3B 主干进行全面评测。CoLVR 与免训练方法、依赖外部工具的图像思考方法以及有监督隐式视觉推理方法对比,展现出全面的优势。
| 主干模型 | 方法类别 | 方法 | 训练 | 人工标注 | CHAIR-Cs ↓ | CHAIR-Ci ↓ | CHAIR-F1 ↑ | POPE Acc. ↑ | Hallbench Acc. ↑ | MMHal Score ↑ | MMHal Hal. ↓ |
|---|---|---|---|---|---|---|---|---|---|---|---|
| Qwen2.5-VL-7B | Baseline | Base (原模型) | × | × | 30.8 | 8.1 | 78.3 | 84.9 | 52.5 | 4.86 | 32.3 |
| Qwen2.5-VL-7B | Train-free | VCD | × | × | 34.6 | 8.7 | 78.6 | 86.0 | 52.9 | 4.85 | 33.3 |
| Qwen2.5-VL-7B | Train-free | OPERA | × | × | 31.6 | 8.5 | 78.7 | 85.4 | 52.9 | 5.02 | 31.3 |
| Qwen2.5-VL-7B | Train-free | PAI | × | × | 34.4 | 8.8 | 77.8 | 88.2 | 53.2 | 5.00 | 37.5 |
| Qwen2.5-VL-7B | Tool Visual-CoT | Deepeyes-7B | ✓ | ✓ | 27.6 | 7.3 | 78.6 | 86.1 | 53.9 | 5.10 | 29.2 |
| Qwen2.5-VL-7B | Tool Visual-CoT | Pixel-Reasoner-7B | ✓ | ✓ | 23.2 | 6.7 | 77.1 | 84.8 | 42.6 | 4.77 | 33.3 |
| Qwen2.5-VL-7B | Supervised Latent | LVR-7B | ✓ | ✓ | 33.2 | 9.8 | 79.4 | 84.8 | 50.4 | 4.88 | 37.5 |
| Qwen2.5-VL-7B | Supervised Latent | Monet-7B | ✓ | ✓ | 34.1 | 9.9 | 67.8 | 86.2 | 52.1 | 5.02 | 31.3 |
| Qwen2.5-VL-7B | Ours | CoLVR-7B | ✓ | × | 20.2 | 6.1 | 80.1 | 89.6 | 54.3 | 5.12 | 30.2 |
| Qwen2.5-VL-3B | Baseline | Base (原模型) | × | × | 38.4 | 8.3 | 79.0 | 85.9 | 40.6 | 4.69 | 34.4 |
| Qwen2.5-VL-3B | Train-free | OPERA | × | × | 43.2 | 9.6 | 79.9 | 85.9 | 40.8 | 4.91 | 31.3 |
| Qwen2.5-VL-3B | Ours | CoLVR-3B | ✓ | × | 30.8 | 8.5 | 78.6 | 88.2 | 42.6 | 4.78 | 30.2 |
消融实验¶
基于 Qwen2.5-VL-3B 主干对两阶段训练、梯度截断、对比探针扰动构造以及隐式 token 长度进行系统消融。
| 模块配置 | CHAIR-Cs ↓ | CHAIR-Ci ↓ | CHAIR-F1 ↑ | POPE Acc. ↑ | MMHal Score ↑ | 说明 |
|---|---|---|---|---|---|---|
| Base 初始模型 | 38.4 | 8.3 | 79.0 | 85.9 | 4.69 | 未引入任何隐式推理阶段 |
| 仅 SFT 阶段 (SFT-only) | 38.6 | 8.5 | 78.3 | 86.0 | 4.46 | 仅用粗粒度区域微调,缺乏显著对齐 |
| 完整模型 (SFT + RL) | 30.8 | 8.5 | 78.6 | 88.2 | 4.78 | 完整 CoLVR,去幻觉能力显著提升 |
| 去除梯度截断 (w/o stop-gradient) | — | — | — | 84.6 | 4.28 | 优化发生捷径退化,视觉表征受损 |
| 空白图对比 (Blank contrast) | 36.9 | 8.9 | 76.5 | — | — | 对比参考信息不足,弱于高斯噪声 |
| 原始注意力 (Original-image attn) | 33.3 | 8.3 | 75.9 | — | — | 未做对比消除,受语言先验干扰 |
| 反向对比 (Reverse contrast) | 46.9 | 12.8 | 67.6 | — | — | 奖励强化了无关区域,引发严重幻觉 |
关键发现¶
- RL 对齐阶段是去幻觉的核心:仅依靠粗粒度伪标签的 SFT 只能赋予模型输出隐式格式的能力,但对消除幻觉作用微弱(甚至 MMHal 得分微跌);引入基于对比探针的 RL 之后,POPE 准确率大幅提升至 88.2%,MMHal 幻觉率从 34.4% 降至 30.2%,证明对比对齐机制精准激活了关键视觉注意力。
- 梯度截断不可或缺:若允许对齐梯度回传至整个视觉表征,模型会直接改变底层图像特征来迎合隐式向量(捷径优化),导致通用视觉表征崩塌,POPE 准确率从 88.2% 骤降至 84.6%。
- 高斯对比优于纯色与单图注意力:单纯原图注意力包含严重的文本语义偏差,而反向对比更会导致极端严重的错误定位(CHAIR-Cs 恶化至 46.9%);高斯随机噪声扰动能最有效地隔离高频语义并精准析出纯视觉证据。
- 隐式推理长度具有平台效应:隐式 token 长度 \(K\) 在 \(K=1\) 时表征容量受限,在 \(K=4\) 时达到最优效益平衡;在 \(K \in [2, 32]\) 区间内性能均保持高位稳定,展现出极强的鲁棒性。
亮点与洞察¶
- 视觉对比探针无需任何外部标注:利用原图与扰动图像在交叉注意力上的差异滤除语言模型固有的先验偏差,将复杂的显式区域标注转化为了全自动的注意力差分权重。
- 自监督隐式推理成功超越全监督方案:CoLVR-7B 的 CHAIR-Cs 降至 20.2%,大幅领先依赖人工标注的 Monet-7B(34.1%)和 LVR-7B(33.2%),打破了隐式推理必须依赖高质量人工标注 Visual-CoT 链的瓶颈。
- 优秀的可扩展泛化性(Extensibility):在仅经过自监督对齐的前提下,后续继续在通用多模态数据上微调(CoLVR)能够在 MathVista(73.4%)和 V(83.8%)等通用复杂推理榜单上全面击败强基线,证明自监督对齐为视觉隐空间注入了泛化性极强的空间感知能力。
局限与展望¶
- 计算开销开销略高:视觉对比探针在前向计算中需要额外送入一张扰动的对照图像计算双路注意力矩阵,在训练阶段引入了一定的显存与时间开销。
- 隐式向量的可解释性仍不够直观:虽然隐向量能通过余弦相似度热力图投影回原始像素,但其连续向量内部所包含的具体逻辑推理语义依然缺乏类似离散自然语言 CoT 的透明可解释性。
- 未来展望:可探索自适应调节隐式 token 长度机制(动态推理计算量),并将对比探针拓展到视频长时序帧间差分与空间三维跨视角推理场景中。
相关工作与启发¶
- vs OPERA / PAI (免训练内部特征引导):OPERA 和 PAI 依赖推断阶段的注意力惩罚或硬性引导,无法改变参数底座与潜在推理偏好;CoLVR 将对齐目标转化为内部自监督隐向量强化学习,不仅彻底免去推断期复杂后处理,且泛化效果更加深层稳健。
- vs LVR / Monet (监督式隐式视觉推理):LVR 与 Monet 严重依赖人工精细构造的辅助图像标注和 SFT 损失,存在极高的人力标注成本和数据天花板;CoLVR 首次证明了通过视觉对比差分与 GRPO 自监督学习即可完全替代人工标注。
- vs Deepeyes / Pixel-Reasoner (工具类 Visual-CoT):Deepeyes 等外部工具范式依赖复杂的检测器裁剪与多轮轮询,推理延迟高且缺乏内部连续表征机制;CoLVR 实现了单轮次自回归完成思考与解答,推理速度更快、更自主。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 巧妙利用跨图注意力对比探针作为无监督显著性标签,并首创通过 GRPO 强化学习引导连续隐向量对齐,思路极具创新。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖多个主流幻觉基准、两档主流模型大小、详实的消融实验(探针变体、长度、梯度流)以及泛化推理任务评测。
- 写作质量: ⭐⭐⭐⭐⭐ 动机阐述深刻,方法形式化严谨,架构图与示意图逻辑自洽。
- 价值: ⭐⭐⭐⭐⭐ 为大视觉语言模型摆脱高昂标注成本、实现自主隐式感知推理开辟了全新自监督技术范式。