AutoV: Loss-Oriented Ranking for Visual Prompt Retrieval in LVLMs¶
会议: ECCV2026
Paper: https://eccv.ecva.net/virtual/2026/poster/3550
PDF: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/1940.pdf
代码: https://github.com/Gumpest/AutoV
领域: 多模态VLM
关键词: 视觉提示检索、查询感知、成对排序、损失监督、跨模型迁移
一句话总结¶
AutoV 不再为所有问题固定使用同一种视觉提示,而是用冻结 LVLM 的答案损失自动标注候选优劣、训练轻量排序器逐样本选择提示,使 LLaVA-OneVision 7B 在 VizWiz 上从 58.2 提升到 68.4,同时支持将选择策略迁移到其他模型。
研究背景与动机¶
视觉提示是在输入图像上增加引导线索,例如用红圈突出对象、模糊无关区域,或者叠加文本引导的注意力掩码。它改变模型看到的证据,不需要重新训练整个视觉语言模型。不过,同一操作对不同问题可能产生相反影响:突出主体有助于识别对象,却可能遮蔽 OCR 所需的细小文字;背景模糊可能帮助定位,也可能移除回答场景问题所需的信息。
已有 RedCircle、FGVP 和 API 主要关注提示怎么设计,或者在整个基准上选一个较好的配置。AutoV 将瓶颈定位到选择粒度:真正需要决定的是这张图、这个问题应该使用哪个提示。进一步的问题是如何获得监督。让人挑出最有效的提示未必可靠,而只用答案对错做标签又太粗糙,尤其模型可能依靠语言先验猜对。论文因此利用已有图文问答数据的参考答案,比较各候选对应的条件语言建模损失,而不是新增人工提示标签。
核心 idea:将视觉提示选择建模为查询条件下的相对偏好排序,用下游 LVLM 的答案损失离线产生监督,再用小型排序网络近似这个昂贵的候选比较过程。
方法详解¶
整体框架¶
输入是一张图像和一个文本问题,输出仍是 LVLM 的文本答案。系统先生成多种提示图像;训练时额外利用参考答案给候选排序,推理时则只依靠图像和问题预测分数,最终让完整解码器处理一个选中的候选。
这里的“检索”不查询外部图库,也不是把多个示例拼进上下文。候选来自同一张输入图像的不同提示版本;训练目标是挑出更有助于回答当前问题的视觉输入,而不是选视觉上最相似的图。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
Input["图像与问题"] --> Pool["多样候选表示"]
Pool --> Supervision["损失偏好监督"]
Answer["参考答案<br/>仅离线训练"] --> Supervision
Pool --> Ranker["查询感知排序"]
Supervision -->|训练映射模块| Ranker
Ranker --> Select["稳健单候选推理"]
Pool -->|视觉特征预过滤| Select
Select --> Output["选中提示与问题<br/>完整解码生成答案"]
关键设计¶
1. 多样候选表示:让不同提示提供可选择的视觉证据
主实验候选池包含 6 张提示图:API 从 CLIP 的不同层产生 4 种注意力提示,再加入 RedCircle 和 FGVP 各一种。这些不是新增训练得到的提示生成器,而是对已有视觉提示方法的组合。候选多样性使系统能在突出对象、保留上下文和强调细粒度区域之间逐样本切换,但也意味着它只能利用候选池已经提供的证据,不能恢复所有提示都破坏掉的信息。
每张候选图像经 LVLM 自带的视觉编码器和投影器,变成与语言嵌入同维度的视觉 token。两者直接复用预训练权重并保持冻结。这样排序器不必从像素重学视觉语义,也不必给每一种提示类型训练单独分类头;后续比较的是提示产生的视觉表示与当前问题之间的关系。
2. 损失偏好监督:比较同一问题内的优劣,不回归跨问题的绝对难度
离线构建数据时,将每张提示图与相同问题配对,送入预训练 LVLM,计算相对于参考答案的条件语言建模损失。损失越低,候选越优。这里“无需人工标注”特指无需新增提示级偏好标注,不代表不需要参考答案,更不是在测试时用正确答案来选提示。
作者做了两种过滤:候选间损失方差太低时,样本可能对视觉提示不敏感;平均损失过高时,可能是离群样本或所有候选都难以支持回答,因此也剔除。前一种现象被作者解释为模型可能依赖语言先验,但低方差本身并不能证明这个原因,例如所有候选都保留足够信息时也可能如此。缓存正文未提供过滤阈值,不能据此复现精确的数据筛选。
对留下的每组候选穷举所有无序对,以低损失者为 chosen、高损失者为 rejected。这样训练只要求“当前问题下谁比谁好”,不要求把不同问题的损失校准到一个共同尺度。它尤其适合候选差距很小、问题难度差异又很大的情形;代价是候选数量增加时比较对数按组合数增长。
3. 查询感知排序:复用浅层交互,再训练两个小型映射模块
排序器将候选视觉 token 与问题 token 拼接,经过 LLM 的第 0 层,也就是第一个解码层,得到交互后的表示。然后视觉与文本各经过一个两层线性结构的 FFN,降到共同的低维空间,最后以跨注意力及均值聚合得到每个候选的标量奖励。模型不是只看某种提示在训练集上平均好不好,而是结合当前问题的语境打分。
论文明确说仅视觉映射与文本映射模块需要额外训练,视觉编码器、投影器及复用的 LLM 层不做额外微调。若语言嵌入维度为 \(D\)、映射输出维度为 \(h\),且 \(h\ll D\),作者给出的两映射模块总参数量是 \(2h(D+h+2)\)。轻量性来自复用已有语义表示并压缩映射维度,而不是把整个视觉语言模型再训练一次。
缓存中的原式 (2)、(3) 提取不完整,因此这里保留正文支持的交互、映射、跨注意力和聚合流程,不擅自补写注意力的 Q/K/V 方向、掩码设置或精确张量归约。尤其不能把“跨注意力均值”直接替换成余弦相似度,二者并非同一运算。
4. 稳健单候选推理:先排除特征离群提示,再只解码一次
推理时没有参考答案,也不再逐个候选运行完整 LVLM 来计算监督损失。系统先按视觉特征的余弦距离,移除与其他候选最不相似的一个提示,再在保留候选中选择预测奖励最高者。作者没有在缓存正文中明确该“最远”距离如何在多个候选间聚合,因此这里不将其具体化为到质心距离或平均两两距离。
选中的视觉 token 与文本嵌入交给 LLM 生成答案。因此节省的是多次完整答案解码,不是免除多图编码:仍需产生并编码候选图像,执行浅层交互与打分。论文称预过滤误删最优候选的比例低于 0.5%,这是作者统计,不是对任意分布的保证。迁移到闭源模型时,使用在开放模型上训练的 AutoV 选出的提示图像,而不是访问闭源模型的隐藏层或训练其参数。
一个完整示例¶
正文图 3 的监督示例给出 3 个候选损失:注意力掩码 0.131、模糊掩码 0.178、红圈 0.264。因此形成 3 对偏好:注意力掩码优于模糊掩码,注意力掩码优于红圈,模糊掩码优于红圈。排序器学习的是这些次序,而不是直接输出这几个损失数值。
这里的数值是论文的监督示意,不是新增评测结果。真实测试时只输入问题和候选图,按预测奖励选择提示;参考答案只出现在离线标注阶段,也不保证模型每次都能恢复示意中的正确排序。
损失函数 / 训练策略¶
以下根据第 3.3 节文字及式 (4) 周围定义规范化重述成对奖励损失;缓存原公式存在字符缺损,非逐字恢复。令候选数为 \(n\),\(\mathcal P\) 是按参考答案损失确定的 chosen/rejected 对集合,\(s\) 是排序器分数,\(\sigma\) 是 Sigmoid:
最小化该目标使低答案损失候选获得更高奖励。它借鉴奖励模型的偏好训练,但不是用强化学习更新 LVLM;监督只训练提示排序模块。对于主实验的 6 个候选,每个保留样本可产生 15 个无序候选对;相同损失的处理规则未在缓存正文中说明。
正文报告在 8 张 A100 上训练 40 个 epoch,耗时 6 小时,但 GPU 显存标注有缺损。训练集构成与实现细节被指向附录 A、C,当前缓存仅包含正文和参考文献;因此不补写样本量、学习率、优化器或 \(h\) 的具体值。
实验关键数据¶
主实验¶
以下摘自原表 1,保留原始基准分数,增量为分数的绝对差,不是相对百分比。各行属于各自模型配置,API 是同表的强视觉提示基线,不代表所有公开方法中的历史最优。
| 模型 | 基准 | Base | API | AutoV | 相对 Base 增量 |
|---|---|---|---|---|---|
| LLaVA-1.5 7B | MMMU | 36.3 | 37.4 | 38.7 | +2.4 |
| LLaVA-1.5 7B | VizWiz | 50.0 | 51.3 | 52.1 | +2.1 |
| LLaVA-OneVision 7B | MMMU | 49.4 | 50.8 | 54.0 | +4.6 |
| LLaVA-OneVision 7B | VizWiz | 58.2 | 66.9 | 68.4 | +10.2 |
| InternVL2 8B | VizWiz | 58.6 | 61.2 | 64.8 | +6.2 |
| Qwen2.5-VL 7B | MMMU | 50.1 | 51.0 | 53.9 | +3.8 |
最醒目的 +10.2 是相对于未加提示的 Base;同一行相对于 API 的提升是 +1.5,不能把全部收益归因于排序器。InternVL2 与 Qwen2.5-VL 采用在 LLaVA-OneVision 上训练的检索策略,支持提示选择可以跨架构迁移的结论。
消融实验¶
原表 2 比较相同候选池下的检索策略,骨干为 LLaVA-1.5 7B;Avg. 为表中三个基准的平均分。
| 检索策略 | MMMU | VizWiz | MMVet | Avg. |
|---|---|---|---|---|
| Base | 36.3 | 50.0 | 30.6 | 39.0 |
| 随机选择 | 37.1 | 50.7 | 31.3 | 39.7 |
| 绝对损失回归 | 36.9 | 50.9 | 31.1 | 39.6 |
| MoE / GateNet | 37.6 | 50.7 | 32.0 | 40.1 |
| 列表排序 | 38.0 | 51.3 | 32.4 | 40.6 |
| AutoV 成对排序 | 38.7 | 52.1 | 32.9 | 41.3 |
原表 4 分别考察交互层和预过滤。下面前两行仅改变交互层,其他行显式标出候选池大小,不能把不同池大小的差异当作单独的过滤收益。
| 配置 | MMMU | VizWiz | MMVet |
|---|---|---|---|
| 第 24 层交互 | 38.1 | 51.6 | 32.3 |
| 第 12 层交互 | 38.4 | 51.7 | 32.3 |
| 第 0 层,6 候选,有预过滤(默认) | 38.7 | 52.1 | 32.9 |
| 6 候选,无预过滤 | 38.3 | 52.0 | 32.6 |
| 8 候选,无预过滤 | 38.4 | 52.2 | 32.7 |
| 8 候选,有预过滤 | 38.9 | 52.6 | 33.1 |
关键发现¶
- 成对排序比 MoE 的三任务均分高 1.2,比列表排序高 0.7;学习相对偏好的价值不只是“多生成几张图”。不过这是当前数据与候选池上的实验证据,不是成对排序普遍优于列表排序的证明。
- 默认 6 候选下,预过滤分别带来 +0.4、+0.1、+0.3;8 候选下分别是 +0.5、+0.4、+0.4。候选池扩大时排除离群提示更有价值,但不能从这些局部消融推断所有模块的贡献排序。
- 原表 3 的均分从 6 候选的 41.3 增至 8 候选的 41.6,收益已经趋缓。原表 6 在 4 候选设置下报告额外 0.74T、总计 5.08T FLOPs;正文报告延迟从 254.8 ms 到 261.7 ms,增加 6.9 ms,不能外推为所有分辨率与服务部署的固定开销。
亮点与洞察¶
- 把“哪个提示好”改成“对当前问题,哪个提示更好”,让已有提示方法的互补性成为可学习对象。平均表现不佳的提示仍可能对少数实例有用,检索因此不同于仅保留基准最优提示。
- 用参考答案损失产生密集偏好,而不直接回归损失绝对值,是这里最可复用的思路。它也启发裁剪、分辨率或帧子集选择,但这些迁移应用没有在本文中得到验证。
- 冻结主干、只训练映射模块,并把提示选择结果迁移给其他 LVLM,将训练成本和部署接口分开。闭源适配依赖的是输入图像可替换,而不是闭源模型开放内部表示。
局限与展望¶
- 监督仍依赖有参考答案的数据和一个教师 LVLM;其低损失不等于客观正确,也不保证真正利用视觉证据。可进一步比较不同教师的一致性,并审计被低方差过滤器删除的样本。
- 预过滤假设视觉特征离群者更可能有害,但罕见且正确的提示也可能离群。作者给出的低于 0.5% 误删统计需要跨数据分布复核,不能视为安全保证。
- 候选生成、多图编码和离线逐候选评分都不是免费步骤。推理时间结果属于特定测量设置,缓存没有完整披露候选生成及闭源服务调用的端到端成本。
- 当前缓存缺少附录,无法核实训练数据配比、精确超参和完整多种子统计。正文 MMMU 多种子平均增益 +2.06 与主表单配置 +2.4 的口径不同,不应混用。
- 缓存原表 1 存在算术不一致:InternVL2 的 MathVista 写成 58.3 到 70.5 却标 +2.2;LLaVA-OneVision 的 Circle/MMVet 写成 48.8 到 47.2 却标 +1.6。本文不据这些条目推导结论,也不擅自修正源数据。
相关工作与启发¶
- 与 API、RedCircle、FGVP 比较:这些方法提供不同形式的视觉引导,AutoV 将它们纳入候选池,贡献在于查询相关的选择机制,而不是替代其提示生成过程。
- 与 MoE / GateNet 比较:GateNet 以可微门控学习选择,AutoV 显式利用候选之间的损失次序。控制数据与训练预算后的对照更能支持排序目标本身有价值。
- 与外部检索增强比较:AutoV 不引入外部知识或额外图像证据,只重组同一输入的呈现方式。因此它能改善注意分配,却不解决原图缺失信息或需要外部事实的问题。
评分¶
- 新颖性: 4/5。将答案损失偏好用于实例级视觉提示检索,切入点清晰,但成对奖励建模本身是成熟工具。
- 实验充分度: 4/5。包含多骨干、检索目标、交互层、预过滤与池大小对照;附录缺失限制了本次可核查范围。
- 写作质量: 3/5。主线容易理解,但公式缓存缺损和表格增量冲突增加了复核负担。
- 价值: 4/5。无需微调主干的输入侧增强具有实用性,收益仍需与候选生成成本及强提示基线比较。