跳转至

Same Pool, Different Answer: Stable Best-of-N Selection for Vision-Language Models

会议: ECCV 2026
论文: ECCV 官方
代码: https://github.com/PengfeiZheng-721/DSPA
领域: 多模态VLM
关键词: 视觉语言模型、Best-of-N选择、测试时选择、稳定性重放、幻觉缓解

一句话总结

针对视觉语言模型在固定候选池下基于似然打分易受微小扰动导致胜出答案频繁翻转的问题,本文提出 DSPA 方法,通过结合冻结参考模型的逐 token 对数似然比均值锚定选择器与训练期多维偏好捷径过滤,将扰动翻转率从 44.3% 降至 24.9%,并将 POPE 目标幻觉率从 9.6% 降至 6.2%。

研究背景与动机

在多模态大模型推理中,Best-of-N(BoN)采样选择被广泛用于拒绝采样对齐、代码生成及复杂推理任务:系统为同一个输入查询采样生成 \(N\) 个候选答案,通过打分函数对各候选进行评估并选出最高分者作为最终输出。在直觉上,当候选答案池与计算预算完全固定时,选择算法选出的胜出答案应当具备严格的可复现性与稳定性。然而,当前的实践中这一基本假设经常被打破。在完全相同的候选池与输入前提下,仅仅因为打分阶段引入极微小的工程差异——例如 softmax 温度参数发生 \(\pm 0.05\) 的校准漂移、top-\(p\) 概率截断尾部逻辑的微调、或是因配置失误导致打分前向传播中保留了 dropout 噪声——便足以使基于似然的标准选择器在高达 41%–47% 的测试样本上彻底改变选出的获胜答案。

这种不稳定性深深植根于基于似然的打分机制设计中。首先,当打分函数对全序列的 token 级对数概率进行简单求和时,答案长度会产生机械性的累积效应:一个原本准确简短的回答,若在末尾附带 20 个低信息量的冗余废话,其累加总分反而可能超过精炼回答,使得排序被文本长度严重绑架。其次,当视觉语言模型经过后训练或对齐微调后,整体输出的对数概率数值绝对尺度会发生系统性偏移,导致顶部候选之间的分差极度收窄,在微小扰动下极易发生顺位倒置。以往文献大多关注候选池急剧扩大时引发的“奖励黑客(reward hacking)”问题,却忽略了即使在候选池规模极小(如 \(N=8\))且完全冻结时,仅打分步骤本身就无法实现自洽。

为系统性地解决此矛盾,本文将关注点从盲目改变解码采样转向规范打分判决本身。针对固定候选池重排的特殊性,本文将打分稳定性与候选池质量解耦为两个独立维度:在测试时引入无漂移的锚定参考尺度与长度平滑,在训练时消除虚假偏好关联。核心 idea:在测试时构建由冻结全上下文参考模型锚定的逐 token 对数似然比均值选择器以固化排序尺度,同时在训练时实施严格的长度、复制与存在性偏好过滤以净化候选池质量。

方法详解

整体框架

本文提出的 DSPA(Dual Stability & Preference Alignment)框架将稳定性保障与事实性提升分别置于测试时和训练时两个独立阶段。在测试时,给定包含图像和提示词的多模态输入 \(x\),候选池生成阶段先由策略模型采样输出固定大小为 \(N\) 的候选集 \(\mathcal{Y}(x)\)。随后,锚定选择器在单次前向传递中,同时利用当前策略模型与预先冻结的基准参考模型评估每个候选答案,计算逐 token 的对数概率比值并进行序列平均,最终输出最高分候选。在训练时,框架通过对偏好数据集施加长度比率约束、输入原样复制过滤与目标存在性幻觉过滤,消除导致生成模型习得捷径特征的偏差。

为了严格评估与复现打分阶段的脆弱性,本文提出了 SRP(Same-pool/Same-budget Replay Protocol)审计协议。SRP 在完全冻结候选池的前提下,对打分前向传播施加预设的温度抖动、top-\(p\) 截断与 dropout 随机性,衡量获胜答案的翻转率与一致性。整体处理流程如下所示:

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["多模态输入 x<br/>(图像 + 文本提示词)"] --> B["候选池固定采样<br/>生成 N=8 个候选答案集 Y(x)"]
    B --> C["锚定对数似然比打分<br/>策略与全上下文冻结基准双路评估"]
    C --> D["逐 Token 均值归一化<br/>消除序列长度累加偏差"]
    D --> E["单次前向决胜输出<br/>选取最大归一化得分候选"]
    F["训练期偏好数据构建"] --> G["多维偏好捷径过滤<br/>约束长度/剔除文本复制/纠正幻觉"]
    G --> H["LoRA-DPO 策略微调<br/>产出高质量策略模型"]
    H -.-> C
    B -.-> I["SRP 稳定性审计重放<br/>受控温度/截断/dropout测试"]
    D -.-> I

关键设计

1. 锚定对数似然比打分:引入全上下文不变基准以消除概率尺度漂移

标准 BoN 选择直接依赖策略模型自身的对数似然 \(\log \pi_\theta(y \mid x)\),当策略经过强化学习或 DPO 微调后,其输出概率分布的峭度与整体尺度会显著波动,导致顶部近邻候选的区分边界脆弱。本文提出锚定打分机制,引入在评估前即冻结且永不更新的参考基准模型 \(\pi_\text{ref}\)(通常直接采用微调前的底座检查点)。特别关键的是,\(\pi_\text{ref}\) 必须完整接收多模态输入上下文 \(x\)(包括完整图像、用户问题以及所有历史生成 token),而非像点互信息(PMI)方法那样剥离图像与文本作为无条件先验。在每个生成步 \(t\),模型计算策略模型与参考模型的对数几率差值: $\(\Delta \ell_t(y \mid x) = \log \frac{\pi_\theta(y_t \mid y_{<t}, x)}{\pi_\text{ref}(y_t \mid y_{<t}, x)}\)$ 该比值直接量化了微调策略相较于基准模型对当前 token 的超额偏好程度。由于分母 \(\pi_\text{ref}\) 具有固定的检查点哈希标识且永不漂移,它为全部候选答案提供了绝对统一且抗微调波动的相对测量标尺,显著拉大了高质量候选与低质量候选之间的安全边界。

2. 逐 Token 均值归一化:平滑词长累积以防止冗余后缀篡改排序

传统序列级打分通常对 token 的对数几率进行直接累加求和,这种加法结构为无意义的冗长文本提供了天然的累积漏洞。若一个正确简短的 20-token 回答平均对数比为 0.15(累加和为 3.0),而模型在末尾胡乱堆砌了 20 个低质量但对数比微弱为正的冗余词(均值 0.02),其累积总分将上升至 3.4,从而导致错误答案胜出。本文坚持采用严格的逐 token 长度均值归一化公式: $\(r_\text{norm}(y \mid x) = \frac{1}{|y|} \sum_{t=1}^{|y|} \log \frac{\pi_\theta(y_t \mid y_{<t}, x)}{\pi_\text{ref}(y_t \mid y_{<t}, x)}\)$ 在这一均值公式下,追加冗余 token 会将平均分从 0.15 稀释至 0.085,从而确保精炼准确的回答稳操胜券。选择过程只需在候选集 \(\mathcal{Y}(x)\) 上执行一次 \(O(N)\) 的求极大值操作 \(\operatorname{argmax}_{y \in \mathcal{Y}(x)} r_\text{norm}(y \mid x)\),无需进行成对排列比较(如 MBR)。

3. 多维偏好捷径过滤:从源头阻断训练期偏好学习对虚假特征的拟合

即使测试时选择器具备极高的抗扰动稳定性,若候选池本身在训练期被系统性污染,选择器也只能“矮子里面挑高个”。为了提升候选池的真实事实质量,本文在构建偏好对时部署了三项专门针对视觉语言模型典型失效模式的清洗规则。首先是文本原样复制过滤(Prompt Copying Filter):许多模型在图像描述任务中通过大段抄袭输入提示词伪装高分,规则规定只要候选与输入的连续最长重合 token 数超过 \(K=12\),即予以剔除。其次是答案长度约束(Answer Length Filter):人工与模型裁判天生偏好长答案,这会导致模型把长度等同于高质量;本文强制要求偏好样本对的长度比率严格限制在 \([0.8, 1.2]\) 区间内。最后是目标存在性幻觉过滤(Object-existence Hallucination Filter):在“图中是否有物体 A”的二元判断中,若偏好的回答在物体不存在时错误地回答了“Yes”,模型将学会脱离视觉信号盲目断言存在;本文基于训练集真值过滤掉包含此类幻觉断言的偏好对。过滤后经由 LLaVA-NeXT-34B 裁判打分后组装为微调偏好对。

4. SRP 审计协议:严格约束计算边界的候选池重放评测基准

为了科学量化打分阶段的脆弱性而不将其与生成阶段的计算量增加混为一谈,本文设立了同候选池/同预算重放审计协议(SRP)。SRP 严格约束四大环境变量:(1) 相同的冻结候选池 \(\mathcal{Y}(x)\);(2) 相同的计算预算(每候选仅前向打分一次,复杂度 \(O(N)\));(3) 预设三组工程常见扰动:softmax 温度微调 \(\tau_0=0.7 \pm 0.05\)、打分时 top-\(p\) 概率截断 \(p_0=0.9 \pm 0.05\) 以及启用前向 dropout 噪声(固定随机种子);(4) 预先指定哈希标识的参考检查点。SRP 定义了两项核心指标:翻转率(Flip-rate,即至少一次重放改变胜出答案的测试项比例)和与原答案一致率(Agreement with original winner)。这一协议如同步入同一台体重秤重复测量,纯粹剥离出了打分机制的固有方差。

一个完整示例

假设用户提问:“图中沙发上是否有狗?”模型生成了两个代表性候选: - 候选 A(精炼准确,长度 20 tokens):“No, there is only a cat sitting on the couch.”(策略相对于参考的平均对数比为 0.15,累积总和为 3.0)。 - 候选 B(冗长附和,长度 40 tokens):“No, there is only a cat sitting on the couch, and the room has bright lighting with a wooden coffee table in front of it.”(前 20 tokens 对数比为 0.15,后 20 tokens 冗余描述对数比仅为 0.02;累积总和达到 3.4,但平均对数比稀释为 0.085)。

在传统的序列求和标准打分下,候选 B 得分 3.4 击败候选 A 的 3.0;当打分温度发生微小扰动 \(\pm 0.05\) 时,候选 B 尾部 20 个低置信度 token 的 logits 重新归一化后剧烈摆动,其总分可能在 2.9 到 3.5 之间大幅跳跃,导致胜出者在 A 与 B 之间频繁切换。而在 DSPA 的逐 token 均值锚定打分下,候选 A 得分 0.15,候选 B 得分 0.085,候选 A 始终拥有高达 0.065 的稳固分差优势,任何轻微的扰动都无法跨越此分差,从而彻底杜绝了翻转现象。

损失函数 / 训练策略

训练阶段采用 LoRA 进行轻量化直接偏好优化(LoRA-DPO)。给定由多维捷径过滤后的成对偏好数据 \((x, y_w, y_l)\),训练优化目标为标准的 DPO 损失: $\(\mathcal{L}_\text{DPO}(\theta; \pi_\text{ref}) = -\mathbb{E}_{(x, y_w, y_l)}\left[\log \sigma\left(\beta \log \frac{\pi_\theta(y_w \mid x)}{\pi_\text{ref}(y_w \mid x)} - \beta \log \frac{\pi_\theta(y_l \mid x)}{\pi_\text{ref}(y_l \mid x)}\right)\right]\)$ 其中超参数 \(\beta\) 控制偏好对隐式奖励的约束强度。在推理阶段,策略模型 \(\pi_\theta\) 与参考基准模型 \(\pi_\text{ref}\) 均使用教师强制(teacher-forcing)并行计算候选 tokens 的前向 logit,单候选打分耗时约增加 1.8 倍;但由于自回归采样占据了端到端推理绝大部分时间,实际端到端运行时间仅增加约 5%–10%。

实验关键数据

主实验

主实验在 LLaVA-1.5 7B 模型上开展,基线涵盖贪婪解码(\(N=1\))、标准序列长度归一化 BoN、近邻分差决胜(\(\epsilon\)-margin tie-break,当顶部二者分差小于 0.02 时选取更短文本)以及独立对齐的 SOTA 模型 RLAIF-V 7B。所有多候选方法共享相同的 \(N=8\) 冻结候选池。

表 1:固定候选池下的标准基准与事实性指标对比(LLaVA-1.5 7B,N=8)

选择器(Selector) VQAv2 ↑ OK-VQA ↑ TextVQA ↑ MME ↑ MMMU ↑ POPE 幻觉率 ↓
Greedy (N=1) 78.5 59.2 58.1 1510.5 35.1 10.5%
BoN + length-norm 79.4 60.8 59.6 1532.8 36.4 9.6%
BoN + \(\epsilon\)-margin tie-break 79.1 60.5 59.3 1528.4 36.2 9.8%
BoN + 锚定选择器 (本文) 79.7 61.2 60.1 1541.0 36.8 6.2%

在不牺牲任何通用视觉问答性能的前提下,仅改变测试时选择规则,POPE 目标幻觉率便从 9.6% 骤降至 6.2%,取得了高达 35% 的相对降幅。

表 2:SRP 协议下受控打分扰动的稳定性测试(n=500 跨扰动族平均)

模型与选择方案 翻转率 (Flip-rate) ↓ 与原胜出者一致率 (Agreement) ↑
BoN + length-norm (LLaVA-1.5 7B) 44.3% 57.2%
BoN + \(\epsilon\)-margin tie-break 37.1% 63.2%
RLAIF-V 7B (length-norm) 35.1% 65.6%
锚定选择器 (本文 DSPA) 24.9% 77.5%

相较于基线 BoN,锚定选择器将扰动导致的翻转率直接降低了 19.4 个百分点,答案一致率提升超过 20 个百分点。

消融实验

表 3:训练期偏好过滤规则消融(采用锚定选择器,n=200)

实验配置 (Setting) 目标幻觉率 (裁判评估) ↓ 综合幻觉率 (裁判评估) ↓ AMBER 准确率 ↑ 成对胜率 ↑ 人工偏好 (胜场/200) ↑
DSPA 完整版 (全部过滤 + 锚定选择) 6.2% 29.7% 81.7 48.2% 192
RLAIF-V 7B (使用锚定选择器) 9.6% 43.9% 80.1 46.8%
关闭三项核心过滤 (全关) 23.6% 36.6% 77.5 45.8% 182

结果表明,若移除长度、复制和存在性过滤,目标幻觉率剧烈恶化四倍(23.6% vs 6.2%),证明了训练期规则组合对保障候选池原生质量具有不可替代的作用。

表 4:选择器设计约束消融(固定训练过滤,n=200,Dropout 扰动族)

选择器变体配置 (Selector Variant) 翻转率 (Flip-rate) ↓ 与原胜出者一致率 ↑
序列级对数比求和(无逐 token 平均) 40.8% 58.6%
逐 token 自锚定(PMI,无上下文分母) 35.4% 64.9%
逐 token 动态同步参考(参考模型随动) 33.6% 66.2%
完整锚定选择器 (固定参考 + 逐 token 平均) 24.1% 78.4%

关键发现

  • 稳定性驱动因子的绝对解耦:表 4 表明,一旦退化回序列求和,翻转率立刻弹回至 40.8%;若使用不含视觉输入的自锚定或动态更新的参考模型,翻转率仍在 33% 以上。只有“固定全上下文参考”与“逐 token 平均”双重约束结合,才能锁定 24.1% 的稳定状态。
  • 残余翻转多为无害近邻近义表达:对锚定选择器遗留的 24.9% 翻转案例进行人工抽样标注(500 例,Cohen's \(\kappa=0.82\)),发现约 71% 的翻转属于同义表达的微小措辞变体(例如“The cat is on the couch”与“There is a cat sitting on the couch”),真正涉及事实性改变的仅占约 29%,折合端到端真实事实翻转风险仅约为 7.2%。
  • 跨规模与跨模型族泛化:在 13B 规模模型上,平均 SRP 翻转率从 38.5% 稳定降低至 22.3%;直接将该选择机制迁移至 Qwen2.5-VL-7B-Instruct,在无需任何架构适配的前提下,裁判评估的目标幻觉率从 38.4% 大幅削减至 8.7%。

亮点与洞察

  • 重新审视可复现性盲区:敏锐地揭示了现代大模型系统中的“暗室效应”——即便候选池、硬件与输入均相同,基于似然的打分步骤仍会因温度或截断的细微差异导致答案大面积更迭。
  • 正交分解打分与生成的职责:明确指出“选择器负责排序稳定性,偏好过滤负责候选池事实性”,打破了试图通过单一微调兼顾二者的传统思路。
  • 极其实用低廉的工业级即插即用收益:锚定选择器仅依赖教师强制并行打分,端到端推理时延仅增加 5%–10%,无需额外训练或服务复杂的奖励模型即可取得 35% 的幻觉削减。

局限与展望

  • 受控扰动空间的边界局限:SRP 协议主要考察了温度、top-\(p\) 截断与 dropout 扰动,尚未涵盖浮点计算精度切换(如 FP16 到 BF16 或 INT8 量化)以及底层算子非确定性实现对 logits 的极端影响。
  • 跨模型参考导致的分差压缩:当采用非同族基准检查点作为参考模型时,对数比分差的区分度有所收窄,对近邻边界的处理略显保守。
  • 未来方向:探索结合多步推理链(Chain-of-Thought)中间步的局部锚定打分,以及将轻量级语义等价聚类引入决胜层以彻底消解剩余 71% 的措辞翻转。

相关工作与启发

  • vs 奖励黑客与正则化 BoN (Gao et al., Jinnai et al.): 以往工作聚焦于候选池样本量过大时模型针对打分器的过拟合博弈;本文聚焦于候选池恒定不变时打分器自身的不可复现性问题。
  • vs 点互信息与对比解码 (MMI, Contrastive Decoding): 传统对比解码在自回归生成时利用两模型概率差进行截断重排;本文将对数似然比引入离线完备序列的静态判定,并证明了“必须保留完整多模态视觉上下文”对稳定性的决定性意义。
  • vs 纯规则重排与大模型裁判 (RLVR, LLM-as-a-Judge): 确定性判决器或大模型裁判虽然稳定或精确,但面临规则覆盖面窄或二次调用开销巨大的困境;本文在纯似然模型内部以极轻量代价实现了高度鲁棒的选择。

评分

  • 新颖性: ⭐⭐⭐⭐☆ 敏锐抓住了被学界普遍忽视的打分不可复现性痛点,设计了优雅纯粹的锚定度量与 SRP 协议。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 7B/13B 模型规模、Qwen 跨架构验证、细致的消融对比与人工双盲语义翻转审计。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑层层推进,实验隔离设计清晰严谨,分析深入透彻。
  • 价值: ⭐⭐⭐⭐⭐ 为所有依赖拒绝采样、BoN 与测试时计算缩放(Test-time Scaling)的工程系统提供了极高参考价值的落地方案。