跳转至

SPOT-E: Test-Time Entropy Shaping with Visual Spotlights for Frozen VLMs

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/YinBo0927/SPOT-E
领域: 多模态VLM
关键词: 视觉语言模型, 测试时自适应, 熵整形, 视觉聚光灯, 强化学习

一句话总结

针对冻结视觉语言模型在证据密集型任务中细粒度视觉线索易被忽略的问题,SPOT-E提出基于答案跨度熵与低熵锚点保护的熵整形原则,通过轻量级测试时GRPO优化问题条件视觉聚光灯,在不调整主干权重的前提下显著提升模型证据利用能力与鲁棒性。

研究背景与动机

视觉语言模型(VLM)在图表阅读、文档解析和细粒度视觉问答等证据密集型任务中展现出显著的脆弱性。在这些场景下,决定最终答案的关键视觉证据往往极其微小且局部化,例如图表轴刻度数字、表格单元格或复杂文档中的特定标注。模型通常能够生成完全正确的高层推理规划(例如明确指出应当先读取某坐标轴数值再对比柱状高低),却在实际读取底层证据细节时发生误读,导致最终预测崩溃。这种高层推理健全与底层证据读取失败并存的现象揭示了模型的“证据利用差距(evidence utilization gap)”。对于已经部署且参数庞大的冻结模型,如何在免训练、无需人工标注的前提下弥补这一差距成为亟待解决的问题。

现有的测试时视觉干预方法(如FGVP、Set-of-Mark、ViCrop等)尝试通过静态裁剪、添加视觉标记或空间形变来突出潜在关键区域。然而,这类方法本质上属于开环机制,干预策略脱离了模型自身的内部反馈,既无法获知所强调的区域是否真正被后续模型利用,也无法感知干预操作是否意外破坏了原本有效的上下文线索。一旦开环干预发生偏移,模型便无从修正。这促使研究者探寻一种模型内部可用的、无需真实标签的闭环反馈信号。

输出文本的预测不确定性(如预测分布的信息熵)天然能够反映模型对证据的利用状态:当关键视觉线索清晰时,模型在答案跨度上的预测熵显著较低;而当证据被遮挡或模糊时,熵值明显激增。然而,直接最小化答案熵存在严重的病态多义性——低熵既可能源于证据充分下的确定性输出,也可能源于模型完全抹除难样本证据后退化至语言先验或虚假捷径(shortcut collapse)。核心 idea:引入低熵锚点约束构建熵整形目标,在降低答案跨度不确定性的同时惩罚对基线确定性 token 的扰动,以轻量测试时 GRPO 驱动问题条件视觉聚光灯实现即插即用的闭环证据增强。

方法详解

整体框架

SPOT-E 是一种完全即插即用的测试时自适应框架。对于任意给定的输入图像 \(x\) 与问题指令 \(q\),下游视觉语言模型 \(F_\phi\) 的参数保持完全冻结。系统引入一个参数量极小的可调视觉聚光灯模块(基于带 LoRA 适配器的 CLIP 视觉编码器),负责生成问题条件的软掩码 \(m \in [0, 1]^{H \times W}\),并通过聚光灯算子对原图实施局部高亮与背景衰减,得到干预后图像 \(\tilde{x} = \mathcal{S}(x; m)\)

将干预图像 \(\tilde{x}\) 输入冻结 VLM 后,系统从模型输出中提取答案跨度熵与预设的低熵锚点熵增,合成综合的熵整形奖励。在测试阶段,算法针对单个样本启动极短周期的在线优化:通过注入高斯噪声采样一组候选聚光灯掩码,计算组内相对优势(GRPO),仅更新视觉聚光灯模块的 LoRA 参数。迭代结束后,通过 Best-of-N 机制选取最优掩码送入冻结 VLM 得到最终答案,并立刻重置聚光灯参数以避免跨样本漂移。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入图像与指令<br/>$x$ 与 $q$"] --> B["多视点视觉聚光灯生成<br/>CLIP图文相似度+局部裁剪Max融合"]
    B --> C["低熵锚点与熵整形奖励<br/>动态清晰度奖励 + 锚点保留惩罚"]
    C --> D["基于GRPO的轻量测试时优化<br/>组内相对优势更新LoRA + 实例重置"]
    D --> E["冻结VLM最终输出<br/>Best-of-N无捷径答案"]

关键设计

1. 多视点视觉聚光灯生成:结合全局视野与多尺度局域裁剪的高保真线索突出

静态开环标记容易覆盖或扭曲关键文字,且难以自适应任意指令意图。为准确定位与问题紧密相关的局部微小证据,聚光灯模块首先从输入问题 \(q\) 中提取紧凑的视觉短语 \(\bar{q}\)(保留核心实体与关键属性),并将其送入冻结的 CLIP 文本编码器获得文本表征。在视觉侧,模块同时处理整图全局视角 \(x^{(0)} = x\)\(N_c\) 个重叠的局部裁剪视点 \(\{x^{(i)}\}_{i=1}^{N_c}\)。利用带 LoRA 适配器的 CLIP 图像编码器提取各视点的 patch token,计算其与文本表征的归一化余弦相似度:

\[u^{(i)}_j = \left\langle \mathrm{norm}\big(p^{(i)}_j\big), \; \mathrm{norm}\big(t(\bar{q})\big) \right\rangle\]

为了将局部裁剪检测到的细微证据精确映射回整图空间,模块通过坐标逆变换算子 \(\mathcal{W}_i(\cdot)\) 将各裁剪视点的相似度图对齐回全图坐标系,并执行最大值池化融合 \(u = \max\big(u^{(0)}, \max_i \mathcal{W}_i(u^{(i)})\big)\)。融合后的关联图经过双线性插值上采样和带温度系数 \(\tau\) 的 Sigmoid 变换,生成平滑连续的像素级软掩码 \(m = \sigma(\frac{1}{\tau} u^{\uparrow}) \in [0, 1]^{H \times W}\)。最终干预图像由聚光灯算子生成:

\[\tilde{x} = \mathcal{S}(x; m) = m \odot x + (1 - m) \odot \mathcal{B}(x)\]

其中 \(\mathcal{B}(\cdot)\) 为背景衰减变换(如适度变暗)。该设计既完整保留了由聚光灯覆盖的候选证据原貌,又柔和抑制了背景中的显著干扰项,避免引入人为硬边界伪影。

2. 低熵锚点与熵整形奖励:兼顾答案收敛与基线置信稳定性的无标签反馈

纯粹降低答案熵极其危险:若聚光灯不慎把包含关键难证据的区域全部压暗,模型反而可能毫无顾虑地依赖统计先验输出确定性答案,形成“高置信却错误”的捷径坍缩。为从数学上辨别“证据充分带来的置信”与“证据缺失引发的幻觉坍缩”,SPOT-E 提出在基线输入下提取低熵锚点集合 \(\mathcal{I}_{\text{low}}(x, q)\),即冻结模型在原始输入解码序列中下一步预测熵最小的前 \(K\) 个 token 位置。真实有效的证据放大应当在增强关键信息的同时,不破坏模型原本就极度确信的上下文理解。

基于此,综合奖励设计为动态清晰度项与锚点保留项的线性加权:\(R(\tilde{x}) = R_{\text{clarity}}(\tilde{x}) + R_{\text{preserve}}(\tilde{x})\)。其中动态清晰度项衡量答案跨度 \(\mathcal{T}_{\text{ans}}\) 上的平均预测熵降幅 \(\Delta H_{\text{ans}}(\tilde{x}) = H_{\text{ans}}(x, q) - H_{\text{ans}}(\tilde{x}, q)\),并乘以动态门控系数 \(\gamma(x, q)\)

\[R_{\text{clarity}}(\tilde{x}) = \gamma(x, q) \cdot \Delta H_{\text{ans}}(\tilde{x}), \qquad \gamma(x, q) = \frac{H_{\text{ans}}(x, q)}{H_{\text{ans}}(x, q) + c}\]

当基线输出本身已高度确定时,\(\gamma(x, q)\) 趋近于零以抑制盲目探索;而在模型高度困惑时放大幅度鼓励探索。锚点保留奖励则严格惩罚对低熵锚点造成的熵增扰动,防止破坏原本稳固的推理基石:

\[R_{\text{preserve}}(\tilde{x}) = -\lambda \cdot \frac{1}{|\mathcal{I}_{\text{low}}|} \sum_{k \in \mathcal{I}_{\text{low}}} \max\big(0, \; H_k(\tilde{x}, q) - H_k(x, q)\big)\]

3. 基于GRPO的轻量测试时优化:免基线网络的即插即用梯度迭代

为使方法能无缝兼容百亿参数乃至闭源 API(仅需返回 token 级对数概率),主干 VLM 在整个流程中不回传任何梯度。所有参数更新仅作用于聚光灯模块中轻量的 LoRA 矩阵 \(\theta\)。为了在单样本单步推理中以极低开销快速收敛,算法采用组相对策略优化(GRPO),彻底摆脱了传统强化学习对额外 Critic 价值网络的依赖。

在每个测试样本的自适应过程中,策略网络在当前参数周边注入扰动采样 \(N\) 个候选掩码,送入冻结 VLM 分别计算奖励值 \(\{R(\tilde{x}^{(n)})\}_{n=1}^N\)。算法利用样本组内的均值 \(\mu_R\) 与标准差 \(\sigma_R\) 归一化出组相对优势函数:

\[A^{(n)} = \frac{R(\tilde{x}^{(n)}) - \mu_R}{\sigma_R + \epsilon}\]

随后采用标准 PPO-clip 目标函数并附带 KL 散度正则项对 LoRA 参数执行极少步数(默认仅需 8 步)的梯度上升,保证优化始终锚定在初始视觉语义附近。在优化结束后,通过组内最佳(Best-of-N)规则选取奖励最高的聚光灯图像输出最终预测,并立即重置 \(\theta \leftarrow \theta_0\) 恢复纯净初始状态。

实验关键数据

主实验

论文在包括 GPT-4o、Gemini-2.5-Flash、Qwen2.5-VL、InternVL 等 9 种主流闭源与开源主干上进行了全面评估。下表汇总了在代表性闭源与开源多模态模型上应用 SPOT-E 的效果对比(选取代表性基线模型及关键指标):

基础模型 / 方法 TextVQA DocVQA ChartQA MathVista MMMU POPE
GPT-4o (Frozen) 77.4 91.1 86.7 63.5 69.2 86.9
+ SPOT-E (Ours) 79.9 (+2.5) 92.3 (+1.2) 88.2 (+1.5) 65.5 (+2.0) 70.4 (+1.2) 87.9 (+1.0)
GPT-4o-mini (Frozen) 70.0 86.0 80.0 55.0 60.0 84.0
+ SPOT-E (Ours) 73.5 (+3.5) 88.0 (+2.0) 82.5 (+2.5) 58.0 (+3.0) 62.0 (+2.0) 85.2 (+1.2)
Qwen2.5-VL-7B (Frozen) 84.9 85.7 87.3 67.8 55.0 86.4
+ SPOT-E (Ours) 86.9 (+2.0) 86.5 (+0.8) 88.5 (+1.2) 70.8 (+3.0) 58.5 (+3.5) 87.4 (+1.0)
LLaVA-NeXT-7B (Frozen) 78.5 80.0 79.0 47.0 38.0 85.0
+ SPOT-E (Ours) 84.7 (+6.2) 82.0 (+2.0) 81.5 (+2.5) 50.5 (+3.5) 41.0 (+3.0) 86.5 (+1.5)
InternVL2.5-8B (Frozen) 81.0 82.0 83.0 66.0 56.0 89.0
+ SPOT-E (Ours) 84.5 (+3.5) 83.5 (+1.5) 85.0 (+2.0) 69.5 (+3.5) 59.5 (+3.5) 90.0 (+1.0)

在推断期视觉干预基线对比中(以冻结 Qwen2.5-VL-7B 为统一基准),SPOT-E 展现出明显优势:

方法 TextVQA GQA MMMU POPE DocVQA
FGVP-Mask 77.3 55.8 46.0 84.4 56.6
FGVP-RBM 72.3 55.8 46.5 81.3 38.6
Set-of-Mark (SoM) 61.5 47.8 45.1 75.8 57.4
API 81.6 61.1 47.4 85.8 68.4
ViCrop 83.8 60.6 47.1 86.7 82.5
AttWarp 84.7 64.0 50.4 87.4 84.1
SPOT-E (Ours) 86.9 65.0 58.5 87.4 86.5

消融实验

基于 Qwen2.5-VL-7B 主干,作者系统研究了奖励函数各组件以及视觉聚光灯模块设计的有效性:

实验切片 配置 / 变体 TextVQA MathVista POPE 说明
奖励函数设计 仅清晰度奖励 (\(R_{\text{clarity}}\) only) 85.8 69.4 86.9 缺乏锚点约束,易触发捷径,MathVista下降1.4%
仅锚点保留 (\(R_{\text{preserve}}\) only) 84.9 68.6 87.1 缺乏积极降低答案不确定性的动力,性能接近基线
无动态缩放 (w/o dynamic scaling) 86.4 70.1 87.2 无法按基线置信度自适应探索步幅,性能略有下滑
完整奖励 (Full Ours) 86.9 70.8 87.4 双重约束闭环引导最佳平衡
聚光灯模块架构 仅全局视点 (Global only) 84.1 66.9 86.3 丢失细微局部文字与符号,TextVQA大幅落后2.8%
均值融合 (MeanFuse) 85.7 68.5 86.9 局域极小证据被平均平滑稀释
无背景衰减 (NoBgDeg) 85.2 67.8 86.7 干扰项未能被抑制,模型注意力依旧涣散
默认设计 (Default Ours) 86.9 70.8 87.4 多视点Max融合 + 软性背景抑制协同最优

关键发现

  • 证据密集任务增益最显著:在依赖高密度符号与文字的 TextVQA、ChartQA、MathVista 上,SPOT-E 平均提升幅度达到 2.0%~6.2%。这表明主干模型的逻辑推理能力完全足够,误读的关键瓶颈在于早期图像特征提取中微小视觉线索被稀释。
  • 锚点约束是防止捷径崩塌的生命线:消融数据显示,如果单纯通过强化学习最小化答案熵(\(R_{\text{clarity}}\) only),在 MathVista 等逻辑性强的数据集上准确率出现大幅倒退。这是因为模型学会了将图像大面积涂黑以输出最常见的“否”或常识模板,而低熵锚点惩罚彻底截断了这一投机路径。
  • 测试时步数饱和度良好:关于步数预算的分析(0至16步)表明,模型性能在8步迭代时达到稳定平台期,用极低的时延开销捕获了绝大部分性能增益。

亮点与洞察

  • 将内部预测熵转变为自监督控制回路:不依赖外部验证器或人工伪标签,直接利用 VLM 自身的答案预测熵作为反馈,打通了测试时自适应闭环。
  • 揭示并化解无监督熵最小化的捷径多义性:敏锐指出“低熵不等于正确感知”,提出低熵锚点(Low-entropy Anchors)作为“锚”,以非破坏性原则区分出真正利用证据的置信度提升。
  • 架构解耦与即插即用:下游庞大的 VLM 乃至商业黑盒 API 全程冻结,仅以轻量 CLIP 模块作为视觉前端进行可逆调整,极具工程落地价值。

局限与展望

  • 极端微小或物理模糊证据的感知上限:当关键证据尺寸低于 CLIP 图像 patch 的分辨率极限,或者原始图像因剧烈运动模糊导致物理信息永久丢失时,聚光灯无法无中生有。
  • 额外的测试时推理时延:尽管只需 8 步轻量 LoRA 更新,但每次迭代需要对冻结 VLM 进行多候选并行前向计算(Best-of-N 与 GRPO 采样),对于计算资源受限或超低延迟场景构成了开销。
  • 未来改进方向:可探索将聚光灯优化参数蒸馏为通用的轻量引导前馈网络,或结合渐进式动态分辨率缩放技术实现亚像素级特征聚焦。

相关工作与启发

  • vs 开环视觉提示(FGVP / SoM / ViCrop):传统方法采用静态启发式规则圈定或裁剪候选区域,无法评估模型是否真正阅读了高亮线索。SPOT-E 引入熵反馈与强化学习构建闭环自校准机制,大幅优于静态规则。
  • vs 测试时自适应方法(TENT / MEMO):传统 TTA 多用于分类主干的熵最小化微调,易因自确认偏差导致退化崩塌。SPOT-E 不改动骨干网络任何权重,且通过低熵锚点技术解决了生成式任务中的虚假捷径问题。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次提出利用低熵锚点对答案跨度熵进行整形以约束测试时无监督优化的方法,思路极具启发性。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 9 种主流闭源与开源主干,横跨证据密集、通用推理、幻觉评估等多维基准,消融与鲁棒性分析扎实详尽。
  • 写作质量: ⭐⭐⭐⭐⭐ 问题定义清晰,实验论证严谨,逻辑推导自洽且可视化深入透彻。
  • 价值: ⭐⭐⭐⭐⭐ 为冻结多模态大模型的测试时微调与细粒度感知对齐提供了极具通用性与落地潜力的解题范式。