ProMSA:Progressive Multimodal Search Agents for Knowledge-Based Visual Question Answering¶
会议: ECCV2026
Paper: https://eccv.ecva.net/virtual/2026/poster/5675
PDF: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/12178.pdf
代码: https://github.com/DingWu1021/Promsa
领域: 智能体 / 知识型视觉问答
关键词: 渐进式检索、多模态工具、检索去重、序列级强化学习、工具预算
一句话总结¶
ProMSA 把知识型视觉问答改成有预算的“检索、核对、再检索或回答”闭环,用拒绝采样 SFT 学会调用工具,再用 TN-GSPO 学习搜索策略,使 Qwen3-VL-8B 在 E-VQA 和 InfoSeek 上分别达到 52.6 与 53.4 的整体得分。
研究背景与动机¶
知识型视觉问答不只是看出图里有什么,还要把图像中的具体实体对应到外部知识,再回答它的属性或关系。例如,认出照片中的湖泊和判断它位于哪个国家,是两个关联但不同的步骤。长尾实体尤其困难:模型可能认识“湖泊”这个类别,却不认识这个具体湖泊;维基百科配图与用户照片的视角、背景又不一致,视觉检索首位结果也可能是另一个相似地点。
EchoSight 一类固定 RAG 流程通常先检索若干页面,再筛选并生成答案。Wiki-PRF 改善检索前处理,ReAG 加入相关性判断,但如果首轮证据根本对应错了实体,仅在现有候选中重排或过滤未必能补救。另一些问题已经知道实体是谁,缺的只是某个属性,此时继续图像检索又没有针对性。问题因此不是统一增大 top-k,而是模型能否根据当前证据判断下一步应该识别实体、补充知识,还是停止。
本文进一步指出,搜索轨迹的训练难度不只取决于生成了多少词,还取决于做了多少次外部决策:同样三次工具调用,解释写得长短不同,不应成为更新尺度的唯一依据。核心 idea:让单个多模态策略在预算内交替选择图像检索、文本检索与停止,通过已访问结果去重支持纠错,并把工具交互深度纳入序列级强化学习的归一化。
方法详解¶
整体框架¶
输入是一张图像及其问题,输出是最终答案。尽管标题使用 Agents,方法中的决策主体是一个多模态大模型策略,而不是多个角色相互讨论:它根据原图、问题、历史推理和已有检索证据生成下一步推理、动作及参数。图像搜索由 EVA-CLIP 完成,文本搜索由 BGE 完成,返回内容经 Qwen3-VL-8B 摘要后进入下一轮上下文。
推理时依次涉及预算内动作选择、去重检索和问题条件摘要,随后回到同一策略继续判断。训练时先筛选可执行且答案正确的轨迹做 SFT,再用 TN-GSPO 优化整段交互;下面的虚线表示训练对策略的作用,不是在线推理额外调用一个训练模块。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["图像与问题"] --> B["预算内动作选择"]
B -->|图像或文本搜索| C["去重检索"]
C --> D["问题条件摘要"]
D -->|更新上下文| B
B -->|停止| E["最终答案"]
F["可执行轨迹训练<br/>与 TN-GSPO"] -.-> B
关键设计¶
1. 预算内动作选择:区分实体未识别和知识尚不完整
策略的动作空间只有 img_search、text_search 和 stop。每轮先产生推理,再输出动作和参数,例如改写后的文本查询、top-k 与排除列表;选择 stop 后进入答案生成。图像里的实体仍不确定时,图像检索可以寻找对应的百科页面;实体基本确认后,文本查询则能直接追问缺失属性或跨页面关系。工具选择因此由当前证据状态决定,而不是按数据集预先指定一种检索方式。
默认配置对图像和文本搜索分别限制最多三次调用,每次分别返回三个页面或三个文本章节。上限限制的是可用次数,并不要求每条轨迹用满六次;模型也可以不检索直接回答。论文设置最多七个交互步骤,与最多六次工具调用后结束的预算设计相对应。这里的“自适应”主要指工具类型、查询内容、检索轮数及停止时机,不能误写成默认实验中每轮 top-k 都由模型自由变化。
2. 去重检索:让再搜一次能够离开错误候选
只允许多轮调用还不够:如果同一图像每次都返回相同的错误页面,后续推理会不断强化初始误识别。ProMSA 维护已检索结果集合,每轮把它传给工具作为排除列表,再把新结果加入集合。图像检索排除已访问页面,框架图中的文本检索排除已访问章节,从而把预算用于新证据。正文用页面集合统一描述这一机制,但页面与章节的具体去重实现仍应以代码为准。
这种处理相当于在已有排序中逐步向后探索,并不意味着训练了更强的检索器,也不是能够保证成功的纠错器。真正决定是否继续搜索的仍是策略:它需要发现当前页面和视觉线索不一致,才会花下一次预算。对于实体已确认但属性不够的情况,模型可以改写文本查询,而不必反复扩大视觉候选。因此,去重提供的是摆脱旧结果的能力,证据是否可信仍由推理和训练来决定。
3. 问题条件摘要:保留能支持下一次决策的证据
图像搜索返回的百科页面可能很长,文本搜索也可能返回长片段;把每一轮原文全部拼接会使上下文迅速膨胀。作者使用与问题相关的摘要,保留实体描述、关键属性和关系线索,再把这些短片段作为工具观察追加到上下文。两种检索由此被转换成统一的文本证据接口,策略不必用不同机制消费整页和章节。
摘要在这里不只是节省 token:下一轮是否继续搜索依赖于它有没有保留“这个实体与图中对象相符吗”和“回答所需属性已经出现了吗”这两类信息。压掉视觉冲突或关键限定词会影响停止决策,这是系统潜在的信息瓶颈。论文明确使用 Qwen3-VL-8B 作为摘要服务,所以 2B 策略版本并不等于整个系统只需要一个 2B 模型;该辅助模型也是复现和成本核算的一部分。
4. 可执行轨迹训练与 TN-GSPO:让更新尺度感知工具深度
冷启动先为每个图像问题采样多条交互轨迹,只保留格式正确、调用可执行、预算未超限且最终答案正确的轨迹,每个问题最多留一条。这样 SFT 学到的是能够实际运行的调用格式和交互模式,而不是只有最终答案的示范。SFT 和 RL 都只在模型生成的 token 上计算训练信号;工具返回内容参与后续条件上下文,但自身被掩码,不作为模型需要预测的目标。
RL 使用整条轨迹的稀疏回报,将答案正确性、格式合规性和工具成本合并。按原文式 (12) 整理记号如下,其中 \(H_{\max}\) 是允许的最大工具调用数,\(\lambda=0.5\);缓存没有给出两个正确性奖励的完整评分细则,因此不额外假设它们一定是某种二值打分。
标准 GSPO 已按生成长度归一化序列概率比,TN-GSPO 进一步纳入工具深度。令 \(L\) 为可训练生成 token 数,\(H=1+\#\mathrm{tool\_calls}\),并记 \(\Delta_t\) 为当前策略与参考策略在同一生成 token 上的对数概率差,核心归一化为:
随后使用中心化优势 \(A(\tau)=R(\tau)-b(x)\),对未裁剪与裁剪后的序列概率比乘优势取较小值并优化,裁剪区间为 \([0.8,1.28]\)。工具调用越深,同样的累计对数概率变化被更大的分母缩放;它改变的是更新尺度,并不是额外奖励多调用工具。与之相反,回报中的成本项会惩罚调用,两者分别作用于优化稳定性与搜索效率,不能混为一个机制。
一个完整示例¶
论文图 1 展示“图中的湖位于哪个国家”的案例:直接回答把它认作土耳其的 Lake Köyceğiz,首次检索又指向 Bay of Kotor。智能体根据图像与返回描述之间的冲突继续检索,后续拿到 Lake Orestiada 的资料并输出 Greece。这个例子说明,纠错的关键不是对第一次结果解释得更长,而是允许新的证据改变实体假设。
但图中最终推理仍把水体称为海岸入口或潟湖,与检索出的湖泊描述不完全一致。因此它展示的是国家答案得到纠正,不能作为每一步实体识别和解释都正确的证据。图 4 另有正确实体排到第十名的检索可视化;默认图像预算三次、每次三个页面,不能据此宣称该案例必然会被默认预算覆盖。
损失函数 / 训练策略¶
SFT 从 E-VQA 与 InfoSeek 训练集抽取 3,000 个实例,冻结视觉编码器和多模态投影层,只微调语言模型,训练三轮、学习率 \(10^{-5}\),实现采用 LLaMA-Factory。RL 抽取 15,000 个实例,用 veRL 训练三轮,全局 batch size 为 128,学习率 \(10^{-6}\)。这些数字是论文描述的抽样规模,不应直接等同于拒绝采样后最终保留的轨迹数量。
每一步最多生成 4,096 token,每条轨迹最多 16,384 token,训练使用八张 A800。策略骨干覆盖 Qwen2.5-VL-7B 和 Qwen3-VL-2B/8B。模型生成长度、摘要长度、工具调用上限是不同约束,论文没有把它们合并成一个可直接比较的总 FLOPs 指标。
实验关键数据¶
主实验¶
E-VQA 包含约 221K 问答对、16.7K 个细粒度实体,知识库约两百万页面,以 BERT-based Matching(BEM)评估答案语义匹配。InfoSeek 包含约 1.3M 图像问答三元组,实验沿用先前工作的十万页面检索子集,而非搜索完整六百万实体知识库;按问题类型使用 VQA Accuracy 或 Relaxed Accuracy。下表沿用原文得分尺度,不能把两个数据集的数值视为完全相同的指标。
| 方法 | 策略 / 生成骨干 | E-VQA 单跳 | E-VQA 全部 | InfoSeek 未见问题 | InfoSeek 未见实体 | InfoSeek 全部 |
|---|---|---|---|---|---|---|
| Qwen3-VL 零样本 | Qwen3-VL-8B | 25.3 | 24.8 | 25.9 | 25.5 | 25.7 |
| MMSearch-R1,本地检索复现 | Qwen2.5-VL-7B | 40.6 | 40.7 | 40.3 | 39.3 | 39.7 |
| DeepEyesV2,本地检索复现 | Qwen2.5-VL-7B | 40.1 | 39.5 | 41.6 | 40.8 | 41.3 |
| CC-VQA | Qwen2.5-VL-7B | 41.4 | 36.1 | 44.7 | 46.1 | 45.1 |
| REAL | Qwen3-VL-8B | 45.5 | 41.4 | 43.1 | 45.1 | 44.1 |
| ProMSA | Qwen2.5-VL-7B | 50.0 | 49.7 | 48.8 | 49.6 | 49.2 |
| ProMSA | Qwen3-VL-2B | 42.4 | 41.2 | 44.1 | 43.0 | 43.6 |
| ProMSA | Qwen3-VL-8B | 52.2 | 52.6 | 53.6 | 53.3 | 53.4 |
数据来自原文表 1。MMSearch-R1 和 DeepEyesV2 的 SerpApi 被替换为本地 BGE + EVA-CLIP 检索,不能把它们当成原始在线服务配置。8B ProMSA 相对同骨干 REAL 的整体得分增加 11.2 和 9.3 分;7B ProMSA 相对同骨干 MMSearch-R1 增加 9.0 和 9.5 分,但这些比较仍包含搜索流程与训练方式的共同变化。
消融实验¶
下表合并原文表 2、3、4 的关键行,使用 Qwen3-VL-8B 主配置;优化器名称后的星号在原文表示使用非对称裁剪,此处直接写明。
| 实验组 | 配置 | E-VQA 全部 | InfoSeek 全部 |
|---|---|---|---|
| 训练阶段 | Base:未训练的搜索框架 | 32.8 | 36.4 |
| 训练阶段 | 拒绝采样 SFT | 38.6 | 42.1 |
| 优化器 | GRPO | 44.2 | 43.7 |
| 优化器 | GRPO + 非对称裁剪 | 49.7 | 50.2 |
| 优化器 | GSPO + 非对称裁剪 | 49.3 | 49.6 |
| 完整模型 | TN-GSPO + 非对称裁剪 | 52.6 | 53.4 |
| 工具可用性 | 仅文本检索 | 27.6 | 36.8 |
| 工具可用性 | 仅图像检索 | 34.7 | 21.4 |
Base 是已有搜索框架但未经训练的模型,不是上表不使用检索的零样本模型。TN-GSPO 相对采用相同裁剪方式的 GSPO 提升 3.3 和 3.8 分,比单纯拿它与原始 GRPO 比较更能体现归一化的增量。工具消融保留各工具原来的调用上限,所以单工具设置也减少了总可用调用数,不能将其全部掉分归因于模态本身。
关键发现¶
- RL 在 SFT 之后继续增加 14.0 和 11.3 分,说明学会合法调用并不足以学会有效搜索;非对称裁剪自身也明显影响结果。
- 每种工具预算从两次变为三次时,得分由 48.2/48.7 变为 52.6/53.4;增至四次则为 52.4/54.3。每轮 top-k 从三增至四时为 52.1/54.1,收益并不单调。
- 表 9 的检索正确率定义为“检索知识包含至少一个正确文档”,三轮为 39.1、48.8、52.7;统计排除直接回答样本。“错误检索后停止”的比例同时为 14.5、43.8、44.1,不能只看召回改善而忽略终止失败,也不能把这些比例当作条件错误率。
- OK-VQA 的额外评测中,ProMSA 7B/8B 得分为 82.7/85.6,CC-VQA 7B 为 78.8。该结果支持跨基准适用性,但不能单独证明所有开放域知识任务上的泛化。
- 原文表 5 的 7B ProMSA 平均每题 1.8 秒、E-VQA 得分 49.7;MMSearch-R1 为 1.7 秒/40.7,DeepEyesV2 为 2.4 秒/39.5。这是本地实验下的端到端报告,不应外推到在线搜索服务延迟。
亮点与洞察¶
- 把“实体找错了”与“属性还没查到”分开处理,使工具选择具有实际语义。可迁移到细粒度商品、地标等检索任务:先判断身份是否可信,再查询属性,而不是无条件拼接更多文档。
- 去重让后续调用获得新信息,避免多轮智能体只是重复同一个检索结果。它也提醒评测者,应分析每次调用新增了什么,而不只统计调用次数。
- TN-GSPO 把工具决策深度引入序列更新尺度,不需要给每个中间动作标注正确答案。其价值是一个容易加入现有序列级 RL 的归一化项,而非全新的检索骨干。
局限与展望¶
- 作者指出工具成本约束和长尾实体判断不确定性会促使模型在证据仍错误时停止;表 9 也显示这一问题。后续可研究证据不足时的拒答与置信度校准,而不是一味增加预算。
- 从实验覆盖看,正文没有单独去掉去重或摘要服务的消融,也没有给出多随机种子的方差。现有实验支持整套系统有效,但不能精确分解每个组件的独立贡献。
- 2B 策略依赖 8B 摘要服务,知识库索引和检索器也有成本;推理时间表没有提供完整成本拆分。因此“小模型策略有效”不能直接解释为同等质量下总部署成本最低。
- InfoSeek 使用十万页面子集,且检索器固定;动态网页噪声、索引更新及全量知识库规模下的表现仍需验证。去重是否排除了应当重新阅读的页面,以及摘要是否丢掉反证,也值得专项评估。
- 图 1 的最终解释存在实体属性不一致,表明答案正确与证据链忠实并非一回事。评价未来系统时,应同时核对实体对齐、证据支持和答案,而不只给最终短答案打分。
相关工作与启发¶
- 对比 EchoSight、Wiki-PRF 与 ReAG:这些工作分别强调固定检索生成、检索前多模态处理、候选内容相关性判断;ProMSA 把何时检索、检索什么和何时结束交给同一个可训练策略。更好的预处理和筛选仍可作为工具侧能力与它结合。
- 对比 MMSearch-R1 与 DeepEyesV2:两者同属多模态搜索智能体,ProMSA 不是首次提出工具交互;本文的针对性在于长尾实体纠错、预算与去重机制,以及考虑工具深度的序列优化。主表的本地检索替换需纳入比较解释。
- 对比 GSPO 与 GRPO:改进不在于生成更长的思维链,而在于如何给整条带工具交互的轨迹分配更新尺度。非对称裁剪已经带来明显收益,因此讨论 TN-GSPO 的贡献应以同裁剪设置为参照。
评分¶
- 新颖性: 4/5。预算化多模态搜索和去重并非全新概念,工具深度归一化提供了具体且可消融的增量。
- 实验充分度: 4/5。覆盖多骨干、两大主基准、外部基准、训练与工具预算消融,但缺少去重独立消融、方差和完整成本拆分。
- 写作质量: 3/5。主线和系统结构清楚,不过示例解释的忠实性及部分实现粒度说明仍可加强。
- 价值: 4/5。为长尾知识型视觉问答提供可复用的搜索训练方案,应用时仍需评估摘要模型成本及错误停止风险。