跳转至

Do Vision Language Models Recognize Visual Ambiguity?

会议: ECCV 2026
论文: ECCV 官方
代码: https://github.com/tadeephuy/visual-semantic-entropy
领域: 多模态 VLM
关键词: 视觉语言模型、不确定性估计、视觉歧义、语义熵、原型聚合

一句话总结

针对视觉语言模型在视觉歧义输入下易过度自信的问题,本文提出视觉语义熵(VSE),仅对图像施加局部视觉扰动并在语义原型层面进行加权离散度聚合,在 5 款主流 VLM 和 5 个 VQA 基准上显著超越现有不确定性估计方法。

研究背景与动机

视觉问答(VQA)作为视觉语言模型(VLM)的核心评估任务,其可靠性很大程度上依赖于模型对视觉证据歧义性的感知能力。然而,现有不确定性估计(Uncertainty Estimation, UE)方法大多直接继承自纯文本大语言模型,主要依赖随机解码下的输出多样性(如语义熵 SE)或模型自主汇报的置信度。当面对包含视觉偏见或严重歧义的图像时,VLM 的视觉编码器往往会输出过度自信的视觉表征,使得随后的自回归解码生成高度集中的同质化答案;即使模型预测完全错误,传统 SE 也会误判为高置信度。

为了激发输出多样性,近期工作尝试引入文本改写(paraphrasing)或图文联合扰动(如 C&U、VL-Uncertainty)。但这引发了更为隐蔽的模态混淆问题:自然语言离散且敏感,文本改写会在多模态嵌入空间中诱发剧烈且非局部的语义漂移。聚类分析证明,图文联合扰动下的输出变异绝大部分由文本改写主导(Text Purity 显著高于 Image Purity),导致测得的不确定性主要反映提示词敏感度(prompt sensitivity),而非真实的视觉证据歧义。此外,直接在离散文本空间做成对语义距离聚合(如 SNNE)容易将同一含义的不同句式措辞误判为语义分歧,人为夸大不确定性。

针对这三大缺陷,本文的核心切入点在于:必须将扰动严格限制在连续的视觉输入空间以探测局部视觉邻域的预测不稳定性,并先在语义层面对同义答案聚类以消除句式变异的干扰。核心 idea:提出视觉语义熵(Visual Semantic Entropy, VSE),固定文本查询仅对图像施加保语义的局部高斯扰动,将采样得到的候选答案聚类为语义原型,通过原型间的质量加权成对距离精确量化视觉歧义导致的不确定性。

方法详解

整体框架

视觉语义熵(VSE)的整体评估流程分为三个阶段:局部视觉扰动、跨扰动多视图答案采样,以及原型语义聚合(Prototype Semantic Aggregation, ProtoSem)。首先,针对输入图像生成固定小扰动尺度的局部变体,保持问题文本绝对固定;随后将各扰动视图与原问题输入 VLM 采样候选答案;最后利用语义相似度模型将所有回答归拢为互斥的语义簇并提取原型,以簇的经验质量权重计算原型间的加权成对语义发散度。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入图像与固定查询问题"] --> B["局部视觉扰动<br/>生成 M 个保语义局部图像视图"]
    B --> C["跨扰动视图答案采样<br/>VLM 随机解码生成候选答案集"]
    C --> D["原型语义聚合<br/>层级语义聚类并提取代表原型"]
    D --> E["质量加权原型离散度<br/>输出视觉不确定性得分 VSE"]

关键设计

1. 局部视觉扰动:隔离语言敏感度并探测局部视觉多义性

以往的文本改写或图文混合扰动由于提示词敏感性,会在多模态表征空间产生全局剧烈偏移,掩盖了视觉本身的歧义性。为保证不确定性严格以原始输入 \((q, v)\) 为条件,VSE 定义了图像局部扰动算子 \(\mathcal{T}(v; \xi_m)\),在像素空间注入标准差 \(\sigma = 20\) 的零均值高斯噪声,生成 \(M\) 个受控的局部扰动视图 \(v_m = \mathcal{T}(v; \xi_m)\),同时保持文本查询 \(q\) 严格不变。与以往逐步放大噪声尺度的做法不同,VSE 采用单一且极小的扰动幅度,避免因过大噪声脱离原始图像的局部邻域流形而引入人为输入破坏,确保输出多样性精确反映视觉特征在局部边界上的预测不稳定性。

2. 跨扰动视图答案采样:打破过度自信视觉表征的解码抑制

在原始歧义图像上,VLM 视觉 token 投影到词表空间后的分布往往呈现低熵状态,导致常规随机采样陷入单峰陷阱。VSE 首先在初始输入上以贪婪解码(\(T=0.0\))获得主预测 \(a_0\),随后将其余 \(M\) 个局部扰动视图输入 VLM,在温度 \(T=1.0\) 下分别进行随机解码,收集得到包含 \(M\) 个输出的候选答案集合 \(\{a_m\}_{m=1}^M\)。局部像素的轻微扰动扰动了视觉特征的过拟合状态,迫使处于歧义边界的视觉线索暴露出可替代的语义解释(例如从 "pouch" 中激发隐藏的 "bag" 或 "pocket")。

3. 原型语义聚合:消除同义句式干扰并量化真实语义分歧

直接对文本答案计算成对距离(如 SNNE)会将“同一含义但措辞不同”的表述(例如 "The dog is eating a cucumber" 与 "The puppy is biting into a chunk of cucumber")计入不确定性,造成距离虚增。VSE 提出 ProtoSem 机制:首先使用预训练 NLI 模型(DeBERTa-v2-xlarge-mnli)作为语义距离函数 \(d(\cdot, \cdot)\),通过层次聚类将答案集划分为 \(K\) 个语义簇 \(\{c_k\}_{k=1}^K\);接着在每个簇内选取到其他簇内成员平均距离最小的答案作为该簇的代表语义原型 \(p_k = \arg\min_{a \in c_k} \sum_{a' \in c_k} d(a, a')\)。设各簇的经验概率质量为 \(w_k = \frac{|c_k|}{M}\),最终不确定性得分定义为独立抽样原型间的加权成对距离期望:

\[\tilde{u} = \sum_{k \neq k'} w_k w_{k'} d(p_k, p_{k'})\]

该公式将句式措辞差异约束在簇内消除,仅在存在多个高概率质量且彼此分离的语义原型时才产生显著的不确定性,从而精准反映语义层面的真正冲突。

实验关键数据

主实验

实验采用区分错误预测与正确预测的 ROC 曲线下面积(AUC)作为核心评估指标。在 AOKVQA、OKVQA 和 MMVet 等经典多模态问答基准上,对比了口头汇报(Verb-U)、Logit 熵/概率、一致性方法(SCG、C&U)以及代表性熵基准(SE、SNNE、KLE、VL-U)。

数据集 模型 VSE (本文) 最佳基线 (方法 / AUC) AUC 绝对提升
AOKVQA Qwen2.5-VL-7B 0.783 KLE (0.774) +0.009
AOKVQA Gemma3-4B 0.778 SE (0.732) +0.046
AOKVQA LLaVA-NeXt-8B 0.724 SNNE (0.651) +0.073
AOKVQA Qwen3-VL-8B 0.798 KLE (0.772) +0.026
AOKVQA Intern3.5-VL-8B 0.792 VL-U (0.781) +0.011
OKVQA Qwen2.5-VL-7B 0.767 SCG-Pr (0.767) / SE (0.758) +0.009 (vs SE)
OKVQA LLaVA-NeXt-8B 0.749 AvgEnt (0.729) / C&U (0.718) +0.020
MMVet Qwen2.5-VL-7B 0.781 SNNE (0.758) +0.023
MMVet Gemma3-4B 0.778 SNNE (0.740) +0.038

消融实验与对抗分析

为验证局部视觉扰动(\(+T\))与原型语义聚合(ProtoSem)各自的独立增益,论文在 AOKVQA 上进行了模块解耦评估;并在视觉对抗与偏见基准 VILP 与 VLM-are-biased 上对比了模型识别视觉歧义的极限能力。

配置 / 数据集 Qwen2.5-VL Gemma3 说明
SE (Base) 0.702 0.732 常规语义熵,无图像扰动
SE + \(T\) (加入视觉扰动) 0.761 (+0.059) 0.775 (+0.043) 仅引入图像扰动,显著提升 SE 表现
SNNE (Base) 0.700 0.651 离散文本成对距离,受措辞差异干扰
SNNE + \(T\) (加入视觉扰动) 0.720 (+0.020) 0.746 (+0.095) 视觉扰动对成对距离同样有效
ProtoSem (Base, 无扰动) 0.711 0.745 原型聚合避免措辞膨胀,优于 SE/SNNE Base
VSE (ProtoSem + \(T\), 完整模型) 0.783 (+0.072) 0.778 (+0.033) 扰动与原型聚合协同,达到全场最佳
对抗基准: VILP (SE 基线) 0.535 0.660 视觉对抗样本下传统 SE 近乎失效
对抗基准: VILP (VSE 本文) 0.650 (+0.115) 0.665 (+0.005) 显著拉回视觉对抗样本的不确定性估计
偏见基准: VLM-are-biased (VL-U) 0.783 0.758 图文联合扰动在视觉偏见数据上的表现
偏见基准: VLM-are-biased (VSE 本文) 0.826 (+0.043) 0.776 (+0.018) 彻底规避文本诱导偏差,稳健捕捉视觉多义性

关键发现

  • 视觉扰动直接破解表征过度自信:在 SE 与 SNNE 上叠加图像扰动 \(+T\) 后,各模型 AUC 普涨 2.0% 至 9.5%,直接印证了“过度自信视觉嵌入抑制解码随机性”的假说,扰动成功诱导出了潜在的替代回答。
  • ProtoSem 有效消除措辞变异虚胖:在相同扰动条件下,ProtoSem 稳定领先直接计算成对距离的 SNNE(如 Qwen2.5-VL 达到 0.783 vs 0.720),证实簇内同义词归约能有效切除语言表达层面的伪不确定性。
  • 视觉对抗场景优势极具代差:在专门测试视觉偏见与强歧义的 VILP 数据集上,Qwen2.5-VL 的传统 SE AUC 仅为 0.535(接近随机投骰),而 VSE 一举提升至 0.650(+11.5%),展现出在视觉受阻场景下的高鲁棒性。

亮点与洞察

  • 多模态不确定性的“文本污染”机理揭示:利用核密度估计和纯度(Purity)分析,严谨证明了图文联合扰动中模型输出几乎完全被文本改写绑架,确立了“探测视觉不确定性必须严格固定文本提示”的方法论准则。
  • 原型加权离散度的两级归约范式:巧妙地将离散输出分解为“簇内表述变体”与“簇间本质分歧”,用最小距离代表元代替直接文本比对,既具备成对距离的连续度量优势,又兼具类别熵的语义鲁棒性。
  • 轻量即插即用与黑盒适用性:无需访问 VLM 内部注意力权重或梯度,仅通过黑盒 API 式的图像加噪前向与轻量级 NLI 聚类即可部署,具有极高的工程落地价值。

局限与展望

  • 采样计算开销偏大:单次推理需要前向计算 \(M+1\) 次 VLM 图像编码与自回归生成(\(M=10\)),且依赖额外的 DeBERTa 模型进行层级聚类,在低延迟在线服务中面临吞吐瓶颈。
  • 扰动算子形态较为单一:当前仅采用标准高斯噪声,对遮挡、视角变换、局部模糊等结构化视觉退化的模拟仍显不足,未来可探索自适应或对抗式的视觉微扰策略。
  • 超参敏感性:解码温度 \(T\) 以及聚类语义阈值的设定会直接影响簇的划分粒度,在长文本多模态推理或超大参数量模型上的泛化性仍有待进一步验证。

相关工作与启发

  • vs Semantic Entropy (SE):SE 假设不确定性纯粹源于解码采样随机性,面对视觉过度自信诱发的单一答案束手无策;VSE 通过输入侧视觉扰动主动激发多样性,并在语义原型空间度量发散度。
  • vs VL-Uncertainty / C&U:二者试图通过文本改写或图文多级加噪引入多样性,却落入提示词敏感性的陷阱;VSE 明确了扰动单一性原则(仅扰动图像),彻底剥离了语言变异的混淆。
  • vs SNNE / KLE:SNNE 直接计算离散文本样本间的嵌入距离,极易将同义表述的词汇差异误判为不确定性;VSE 先聚类提炼原型再算簇间距离,成功实现了语义与表述的解耦。

评分

  • 新颖性: ⭐⭐⭐⭐☆ 深刻揭示了 VLM 不确定性估计中被忽视的视觉表征过度自信与文本敏感性混淆,问题洞察极为敏锐。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 5 大主流开源 VLM、5 个标准及对抗 VQA 基准,理论推导、定量纯度分析与消融验证极其扎实。
  • 写作质量: ⭐⭐⭐⭐⭐ 论点层层递进,从失效假设到理论命题再到模块设计严丝合缝,图表与实验支撑非常充分。
  • 价值: ⭐⭐⭐⭐☆ 为多模态可靠性评测与幻觉检测提供了新的有效基准工具,对真实复杂场景下的可信 VLM 落地具有现实指导意义。