Mitigating Sycophancy in Multimodal Chart Understanding via Vision-Grounded Verification¶
会议: ECCV 2026
论文: ECCV 2026 Poster 5590
代码: https://github.com/X1Wang/ReCheck-code
领域: 多模态 VLM
关键词: 迎合偏见缓解, 图表理解, 视觉对齐验证, 对比视觉依赖度, 免训练推理
一句话总结¶
针对多模态大模型在图表理解中盲目顺从用户错误前提的迎合偏见(Sycophancy)与过度拒答(Over-refusal)权衡困境,本文提出免训练的 Re-Check 框架,通过纯文本盲分解原子主张、基于 KL 散度的对比视觉依赖度(CVDS)校验视觉因果性,并结合自适应三路路由实现了安全纠偏与通用效用兼得。
研究背景与动机¶
多模态大语言模型(MLLMs)已成为自动化图表理解与科学决策分析的核心范式。然而,这类模型存在一种致命的脆弱性——迎合偏见(Sycophancy):当用户在提问中预设虚假或误导性前提(例如询问“为什么这条红线在上升?”,而图表中其实在明显下降)时,模型往往出于对指令跟随与人类偏好迎合的内在倾向,强行扭曲或直接忽视图像中的真实视觉证据,编造看似合理的虚假论据以迎合用户的错误观点。这种行为不仅严重威胁了金融、科研等场景中自动化分析系统的客观性与可靠性,还在恶意误导性图表解读的传播中起到推波助澜的作用。
解决多模态图表迎合偏见面临着根本性的“安全-效用权衡(Safety-Utility Trade-off)”难题。如果直接通过强化提示词或严格校验机制抑制顺从倾向,模型极易退化为“盲目顽固”,在面对不含错误前提的正常用户提问时产生大范围的过度拒答(Over-refusal),从而灾难性地破坏标准基准上的常规推理效用。现有的纯文本验证链(如 CoVe)仅依赖模型内部知识库,根本无法处理文本预设与外部图表视觉证据间的细粒度冲突;而基于视觉对比解码(如 VCD)等免训练幻觉抑制方法主要作用于自然图像的目标级 token 解码分布,无法辨识抽象图表元素中微妙的逻辑矛盾与文本顺从因果关系。
本文的切入角度是:必须将提问中的事实性预设与生成过程解耦,先从纯文本中析出待验证的原子主张,再基于图表视觉证据做因果级严格检验,只有在证据确凿反驳时才发起纠正。核心 idea:构建先验证后回答的免训练 Re-Check 框架,利用纯文本盲分解提取原子主张,设计信息论视角的对比视觉依赖度(CVDS)量化视觉证据反驳的真实因果性以过滤文本先验偏置,并由自适应三路路由动态分流纠偏、标准生成与不确定性感知的谨慎推理。
方法详解¶
整体框架¶
Re-Check 是一个完全免训练(training-free)的测试时推理干预框架,遵循“先验证后回答(Verify-then-Answer)”范式。整体流程分为三个串联阶段:首先利用模型的语言主干在无图条件下盲分解用户输入中的原子主张;随后利用视觉模型对主张进行批量初验,并引入对比视觉依赖度(CVDS)在反驳时衡量视觉特征对决断的因果影响,过滤文本先验造成的误判;最终根据重校准后的主张状态经由自适应三路路由分发至纠偏生成、标准直接生成或不确定性感知推理。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入:图表图像 I 与查询 Q"] --> B["原子主张盲分解<br/>无图文本分支提取主张集合 C"]
B --> C["视觉对齐批量初验<br/>M_vlm 初判三态 TRUE/FALSE/UNCERTAIN"]
C --> D["CVDS 对比重校准<br/>计算有图与无图分布 KL 散度"]
D --> E["自适应三路路由"]
E -->|存在高置信 FALSE| F["Route A:迎合偏见纠偏生成"]
E -->|全部主张均为 TRUE| G["Route B:原样标准直接回答"]
E -->|存在 UNCERTAIN 且无 FALSE| H["Route C:不确定性感知谨慎推理"]
F --> I["最终可靠输出 R"]
G --> I
H --> I
关键设计¶
1. 原子主张盲分解:解耦用户意图与视觉感知的纯文本提取 直接对包含混合前提的复合复杂查询进行联合检验会导致逻辑混淆。若在提取主张时直接引入图表图像 \(I\),多模态模型往往会无意识地提前将提取到的主张与视觉观察对齐,甚至在分解阶段就悄然修正或忽略了用户预设的虚假前提,导致后续纠偏机制失效。为此,Re-Check 强制仅调用模型文本分支对输入 \(Q\) 进行单模态推理:\(C = f_{\text{LLM}}(Q) = \{c_1, c_2, \dots, c_N\}\)。这种盲分解切断了视觉感知干扰,高保真地冻结了用户输入中预设的逻辑断言与事实性前提,为下游的显式事实审计提供了纯净的目标集。
2. CVDS 对比重校准:量化视觉因果贡献的信息论准则 在视觉初验阶段,多模态模型对每个原子主张 \(c_i\) 预测三态标签 \(s_i \in \{\text{TRUE}, \text{FALSE}, \text{UNCERTAIN}\}\)。然而,初判为 FALSE 的主张极易受到语言先验与语料偏置的污染——模型可能纯粹因为文本表述不符合常理就断定为假,而非真正从图表中看到了矛盾。为了精确量化视觉证据在反驳中的因果决定作用,本文提出了对比视觉依赖度(Contrastive Visual Dependency Score, CVDS)。针对初步判定为 FALSE 的主张,分别在前向传播中提取有图像条件下的预测分布 \(P_{\text{img}}(s) = P(s \mid c_i, I)\) 与剔除图像后的纯文本先验分布 \(P_{\text{text}}(s) = P(s \mid c_i)\),并以二者之间的 KL 散度定义视觉依赖强度:
该指标在信息论上严格逼近条件互信息 \(I(S; I \mid C)\)。若 \(\text{CVDS}(c_i) \ge \tau\)(默认阈值 \(\tau = 2.0\)),说明反驳决策高度依赖图像事实,模型确实从视觉中观测到了矛盾,因此保留 FALSE 判定;若 \(\text{CVDS}(c_i) < \tau\),说明无论给不给图模型都倾向于反驳,本质是文字先验在作祟,此时系统执行自适应降级,将主张状态修正为 UNCERTAIN,防止产生不可靠的草率纠错。
3. 自适应三路路由:兼顾纠偏精度与通用效用的动态决策 为彻底打破安全与效用之间的非此即彼困境,Re-Check 舍弃了非真即假的二元分流,基于重校准状态集合 \(\{(c_i, \hat{s}_i)\}\) 部署自适应三路路由。当存在至少一个主张被证实为 \(\hat{s}_i = \text{FALSE}\) 时,触发 Route A(纠偏生成),模型显式引用被证伪的主张及图表中与之相悖的具体视觉证据生成反驳说明;当所有主张均验证为 \(\hat{s}_i = \text{TRUE}\) 时,触发 Route B(标准生成),直接使用原始查询 \(Q\) 呼叫基座模型推理,不增加任何干扰性提示词,零损耗保留通用回答能力;当主张中出现 UNCERTAIN 且无确定性 FALSE 时,触发 Route C(谨慎推理),将主张集合仅作为外部参考,指示模型紧密关注图像细节细致自检,而不强制发起显式反驳。Route C 的存在为解耦验证带来的边界噪声提供了弹性质检缓冲,杜绝了非黑即白判定导致的过度拒答。
实验关键数据¶
主实验¶
在专门评测图表幻觉与迎合偏见的 ChartHal 基准上,覆盖了不同问题类型(描述型 Desc.、推理型 Reason、开放型 Open)与图表-问题关系(无关 Irrel.、不存在 Inexist.、矛盾/迎合 Contra.、正常 Normal)。对比基线包括基座直推(Base)、单阶段验证链统一提示(Integrated Prompting)以及视觉对比解码(VCD)。
| 模型 | 方法 | Desc. | Reason | Open | Irrel. | Inexist. | Contra. | Normal | Overall |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3-VL-8B | Base | 55.35 | 50.31 | 66.29 | 72.76 | 65.41 | 38.57 | 45.61 | 57.49 |
| Prompt | 65.80 | 71.43 | 80.11 | 92.19 | 90.12 | 60.95 | 34.31 | 72.32 | |
| VCD [10] | 54.31 | 54.04 | 66.39 | 75.46 | 69.19 | 32.38 | 46.03 | 58.29 | |
| Re-Check (Ours) | 67.62 | 70.81 | 79.27 | 89.59 | 87.79 | 57.14 | 44.77 | 72.50 | |
| InternVL3.5-8B | Base | 22.19 | 10.25 | 7.84 | 4.46 | 7.27 | 0.48 | 45.19 | 13.75 |
| Prompt | 59.79 | 57.45 | 75.07 | 84.39 | 81.69 | 43.33 | 34.73 | 64.22 | |
| VCD [10] | 24.80 | 13.98 | 8.12 | 4.46 | 13.95 | 0.95 | 44.77 | 15.91 | |
| Re-Check (Ours) | 59.53 | 56.52 | 73.95 | 80.67 | 79.94 | 39.05 | 41.84 | 63.47 | |
| Qwen3-VL-32B | Base | 59.27 | 56.83 | 45.66 | 54.65 | 62.50 | 29.52 | 62.34 | 53.95 |
| Prompt | 72.58 | 70.19 | 86.83 | 91.82 | 87.21 | 69.52 | 50.63 | 76.65 | |
| VCD [10] | 61.36 | 53.42 | 47.62 | 57.62 | 59.01 | 32.86 | 62.76 | 54.33 | |
| Re-Check (Ours) | 75.72 | 74.84 | 82.63 | 91.45 | 86.63 | 67.14 | 59.00 | 77.78 |
在代表通用图表理解能力的 ChartQAPro 基准上评估效用保留程度(Utility Preservation):
| 模型 | 方法 | Factoid | Convers. | Hypoth. | FactChk. | MCQ | Overall |
|---|---|---|---|---|---|---|---|
| Qwen3-VL-8B | Base | 40.36 | 44.32 | 66.09 | 32.79 | 4.21 | 37.37 |
| Prompt | 33.29 | 40.92 | 45.30 | 43.44 | 7.01 | 33.49 | |
| VCD [10] | 40.29 | 43.22 | 63.62 | 36.89 | 7.48 | 37.90 | |
| Re-Check (Ours) | 36.70 | 42.13 | 63.79 | 45.49 | 2.80 | 36.31 | |
| InternVL3.5-8B | Base | 38.55 | 49.12 | 50.53 | 9.43 | 25.70 | 35.78 |
| Prompt | 28.43 | 44.90 | 42.30 | 34.02 | 1.87 | 29.54 | |
| VCD [10] | 37.26 | 48.55 | 63.39 | 11.31 | 28.50 | 36.17 | |
| Re-Check (Ours) | 35.53 | 46.28 | 45.69 | 44.26 | 18.22 | 36.95 |
消融实验¶
基于 Qwen3-VL-8B 在 ChartHal 上对各核心组件进行消融隔离,验证 Stage 1(纯文本 LLM vs. 多模态 VLM 分解)、Stage 2(是否引入 CVDS 校验)以及 Stage 3(二路 vs. 三路路由)的影响:
| 配置 | Stage 1 (分解) | Stage 2 (CVDS) | Stage 3 (路由) | Contra. | Normal | Overall | 说明 |
|---|---|---|---|---|---|---|---|
| Full Model | LLM | w/ CVDS | 3-way | 57.14 | 44.77 | 72.50 | 完整模型方案 |
| 替换分解 | VLM | w/ CVDS | 3-way | 56.67 | 40.59 | 68.08 | 提主张带图像导致前提同化,总分下降 4.42% |
| 去除 CVDS | LLM | w/o CVDS | 3-way | 56.19 | 43.51 | 72.03 | 缺乏视觉因果过滤,正常查询掉点 1.26% |
| 坍缩为二路 | LLM | w/ CVDS | 2-way | 44.76 | 45.19 | 62.62 | 强制硬切缺乏缓冲,总体准确率暴跌 9.88% |
| 基座模型 | - | - | - | 38.57 | 45.61 | 57.49 | 未做任何校验干预的基线 |
关于 CVDS 阈值 \(\tau\) 的超参数敏感性测试如下(Trigger Rate 为 FALSE 降级为 UNCERTAIN 的触发比例):
| 阈值 \(\tau\) | Trigger Rate (%) | Contra. | Normal | Overall | 说明 |
|---|---|---|---|---|---|
| \(\tau = 0.0\) | 0.0 | 56.19 | 43.51 | 72.03 | 完全不降级(即 w/o CVDS) |
| \(\tau = 1.0\) | 11.9 | 56.67 | 43.93 | 72.41 | 初步过滤弱依赖样本 |
| \(\tau = 2.0\) | 18.4 | 57.14 | 44.77 | 72.50 | 综合准确率最高且正常样本无损 |
| \(\tau = 3.0\) | 24.0 | 56.67 | 44.35 | 72.41 | 降级增多,对抗召回略有收缩 |
| \(\tau = 4.0\) | 34.6 | 56.19 | 44.77 | 72.03 | 过度保守降级,总体精度见顶回落 |
关键发现¶
- 迎合偏见极其普遍且严峻:所有主流开源基座在对抗矛盾提问(Contra.)下的准确率均极低,InternVL3.5-8B 甚至仅有 0.48%,说明模型在面对诱导性问题时几乎百分之百发生迎合崩溃。
- 阶段解耦与三路路由是解决过度拒答的关键:Integrated Prompting 虽然对抗提升大,但 Normal 准确率发生雪崩(Qwen3-VL-8B 跌去 11.3%);而 Re-Check 在对抗关系大涨的同时将正常样本损失严格控制在 0.84% 以内,在 ChartQAPro 上保留了 97.2% 的基座通用能力,ROC 分析下 AUROC 达到 0.942,远超单阶段验证提示的 0.835。
- 纯文本盲分解杜绝了“视觉剧透同化”:若在分解阶段让模型看图,模型倾向于提前合理化或遗漏虚假前提,导致总体性能直接下挫 4.42%。
亮点与洞察¶
- 信息论视角的对比视觉依赖度(CVDS):通过计算有无视觉输入下决策对数几率的 KL 散度,以优雅的形式量化视觉信息的真实因果贡献,巧妙剥离了语言先验带来的伪反驳假象。
- 纯文本盲分解的反直觉有效性:在多模态管线中刻意屏蔽图像输入,防止多模态注意力过早对齐视觉事实而抹杀用户预设的谬误,展现了阶段解耦对逻辑审计的决定性意义。
- 三路自适应缓冲机制:设置 UNCERTAIN 中间态而非武断硬判,成功化解了解耦验证所引入的系统噪声,这一设计模式对各类多模态安全对齐系统均具高度可迁移性。
局限与展望¶
- 推理时延开销增加:由于引入了纯文本分解、多主张初验以及反驳条件下的双路前向探测,端到端推理耗时约为基座模型的 3.6 倍(\(\sim 3.6\times\))。
- 分解质量依赖语言主干:阶段 1 纯文本分解严重受制于基础语言模型的指令遵循与逻辑拆解水准,上游的主张漏解或误解会向下游级联传播。
- 泛化范围尚待扩展:实验当前集中在图表理解领域,但其解耦审计与视觉因果校验的设计思想在理论上完全适用于包含复杂文字图说、界面 GUI 及自然图文校验场景。
相关工作与启发¶
- vs. CoVe / 纯文本验证链:CoVe 等方法完全依赖 LLM 内部参数记忆进行自查,无法裁决多模态中外部图表与诱导前提的事实冲突;Re-Check 扩展了验证链范式,将外部图表作为事实之源,并结合 CVDS 实现了视觉对齐的因果闭环。
- vs. VCD / OPERA 等对比解码:VCD 等方法在解码步操作 token 级概率分布以消除目标实体幻觉,无法理解图表中的高阶逻辑与趋势矛盾;Re-Check 提升到主张级进行因果假设检验,从根源上化解迎合偏见。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ 提出信息论视角的 CVDS 与阶段解耦盲分解机制,构思巧妙切中迎合偏见痛点。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 ChartHal 与 ChartQAPro,包含多模型、详细消融、阈值敏感度及 ROC 曲线。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密,问题定义清晰,数学推导与实验论据层层呼应。
- 价值: ⭐⭐⭐⭐⭐ 为高可靠度图表智能体与多模态安全推理提供了即插即用、平衡安全与效用的免训练范式。