Eliciting Self-Verification in Multimodal Reasoning Agents with Reinforcement Learning¶
会议: ECCV 2026
论文: ECCV Official
领域: LLM推理
关键词: 多模态智能体, 强化学习, 自验证, 工具调用, 测试时计算
一句话总结¶
针对多模态推理智能体在工具调用时搜索时机失准与检索证据噪声严重的问题,本文提出强化学习自验证框架 SVRL,通过弱能力先验校准搜索时机、引入查询多样性奖励,并将结构化自验证分数嵌入推理轨迹进行对齐优化,在推理阶段摆脱外部验证器并实现测试时搜索预算扩展。
研究背景与动机¶
多模态大语言模型(MLLM)正逐步从静态图像感知系统演化为能够主动调用搜索引擎或代码执行等外部工具的交互式智能体。在真实的多跳视觉问答(Multi-hop VQA)场景中,单靠图像自身所包含的信息往往难以推断出最终答案,模型必须准确识别人、物、场景等视觉实体,并经由外部检索工具补充缺失的事实知识。然而,在现有基于 GRPO 等纯强化学习的微调范式下,训练通常仅依赖最终答案的稀疏结果级奖励(Outcome-level Reward),使得智能体在决定“何时搜索”、“搜索什么”以及“采信哪些检索证据”等关键中间环节上缺乏细粒度的过程反馈,极易产生工具调用失效。
当前工具增强型多模态智能体在实践中频繁暴露两大严重瓶颈。首先是搜索调用的校准能力严重匮乏:智能体要么在需要检索时由于过度自信而漏调工具,要么在内部参数知识足以回答时触发大量非必要搜索;在基线 MMSearch-R1 上,不必要搜索占比超过 30%,而漏调搜索占比超 10%。其次是检索结果噪声极大且缺乏内生过滤机制:网络检索返回的代码片段与网页往往包含大量不相关、过时或相互矛盾的信息(基线中近 45% 的检索结果为无关噪声),模型极易盲目相信前排噪声证据,即使返回结果包含正确事实也有超过 28% 的样本最终回答错误。虽然在测试阶段串联更强的大模型(如 GPT-5)充当外部验证器可以过滤噪声并提升准确率,但这会成倍增加系统延迟与部署成本。
本文的核心思路是:不必在推理阶段引入繁重的外部验证器,而是利用强化学习将证据验证与过滤能力直接内化进智能体自身的推理轨迹中。核心 idea:提出纯强化学习微调框架 SVRL,利用预训练模型的单次前向输出构建“无须搜索”弱能力先验以惩罚冗余调用,引入多查询采样奖励激发检索多样性,并在轨迹内部直接生成结构化证据有用性分数与验证理由,通过 Dr. GRPO 算法实现高效自验证优化与测试时搜索扩展。
方法详解¶
整体框架¶
SVRL 的核心设计是将多模态多跳推理形式化为基于策略优化的决策轨迹生成过程。给定图像 \(I\) 与自然语言问题 \(q\),策略模型 \(\pi_\theta\) 生成包含多步中间推理 \(s_{1:T}\) 与最终答案 \(y\) 的轨迹 \(\tau = (s_{1:T}, y)\)。在每个时间步 \(t\),智能体输出包括包裹在 <reason>...</reason> 标签内的思考链、工具调用动作(如文本搜索或以图搜图)以及对检索证据的显式自验证评估标签 <verify>...</verify>。
在微调阶段,系统首先利用预训练模型自身的前向推理结果构建搜索时机先验;在强化学习采样阶段,智能体不仅自主生成多样化的候选检索查询,还在拿到返回证据后给出二进制有用性向量;训练时使用强语言模型结合真实标签作为 Oracle 验证器提供监督信号,将搜索感知因子、查询多样性因子和验证对齐因子相乘并门控于最终答案正确性上,端到端优化策略模型。在测试阶段,完全丢弃外部验证器,智能体完全依赖内生自验证能力过滤检索噪声。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入多模态数据<br/>(图像 I, 问题 q)"] --> B["弱能力先验标记<br/>预先判断 search_free 属性"]
B --> C["搜索时机校准<br/>识别必要搜索并惩罚冗余调用"]
C --> D["候选查询采样与多样性生成<br/>生成 k 个候选查询并激励有效多样性"]
D --> E["工具检索执行<br/>获取外部文本或图像网页片段"]
E --> F["轨迹内生结构化自验证<br/>输出 binary 验证向量与理由"]
F --> G["Dr. GRPO 策略优化<br/>消除归一化失真稳定长程训练"]
G --> H["最终答案生成与评估<br/>摆脱外部验证器并支持测试时扩展"]
关键设计¶
1. 搜索时机校准:基于弱能力先验的非必要搜索惩罚
通用强化学习往往对每一个工具调用施加固定的步长惩罚,但这在多模态大模型微调中容易导致反效果:它无法区分“模型本来就会做而滥用搜索”与“问题极其困难必须依赖搜索”这两种本质不同的场景,导致模型在真正需要知识补充时过分畏缩。为了解决此问题,SVRL 提出了基于弱能力先验的搜索感知因子。具体而言,在启动 RL 微调前,预先使用预训练策略模型 \(\pi_\theta\) 对训练集样本进行一次无工具的贪婪推理得到预测 \(\hat{y}\);若 \(\hat{y} = y^*\),则将该样本打上 search_free 标签。在后续的在线强化学习采样中,仅当模型在 search_free 样本上调用了搜索工具时才施加降权惩罚:
$\(r_{\mathrm{aware}} = \begin{cases} \lambda_{\mathrm{sa}}, & \text{若样本为 } search\_free \text{ 且轨迹中调用了搜索工具} \\ 1, & \text{其他情况} \end{cases}\)$
其中超参数设为 \(\lambda_{\mathrm{sa}} = 0.1\)。这种条件化惩罚保护了困难样本的搜索积极性,精准抑制了因过度检索带来的计算浪费与幻觉。
2. 候选查询采样与多样性生成:显式提升检索查询质量
多模态智能体常常提出语义模糊或覆盖不全的检索查询,导致一次性检索失败后直接将整条推理轨迹带入死胡同。为了解决单一检索词的信息瓶颈,SVRL 促使智能体在遇到外部知识缺口时,主动构思并提出 \(k\) 个候选查询,系统从中随机执行一条格式有效且内容唯一的查询。为了对查询的生成质量进行直接激励,设计了查询计数因子: $\(r_{\mathrm{count}} = \begin{cases} 1, & \text{若轨迹未执行文本搜索} \\ \max(\epsilon, \hat{k} / k), & \text{若执行了搜索,}\hat{k} \text{ 为格式正确且唯一的候选查询数} \end{cases}\)$ 其中 \(\epsilon > 0\) 为防止奖励完全崩塌的下限阈值。该设计从动作空间上要求模型具备多视角的意图表达能力,极大提升了模型提炼图像实体与关键提问信息的检索命中率。
3. 轨迹内生结构化自验证:将证据去噪内化为可学习信号
外部检索结果充斥着与实体无关或相互矛盾的干扰片段。传统方法要么直接拼接给上下文让模型被动处理,要么在测试阶段接入昂贵的外部裁判模型。SVRL 创造性地让智能体在生成最终回答前,在推理轨迹中输出结构化的二进制有用性向量(例如 <verify> 1, 0, 1, 0 </verify>)并给出自然语言对比裁决理由。在训练阶段,训练专用的 Oracle 验证器结合真实标签 \(y^*\) 对模型提出的查询及检索片段打上标准标签 \(v^*\);系统由此计算查询对齐因子 \(r_{\mathrm{qalign}}\) 与证据片段对齐因子 \(r_{\mathrm{salign}}\):
$\(r_{\mathrm{svrl}} = r_{\mathrm{aware}} \cdot r_{\mathrm{count}} \cdot r_{\mathrm{qalign}} \cdot r_{\mathrm{salign}}\)$
为了严防强化学习模型通过讨好局部验证分数而输出错误答案的“奖励黑客”(Reward Hacking)现象,SVRL 将细粒度的过程反馈项与最终答案正确性进行乘积门控,最终轨迹回报定义为:
$\(r(\tau) = (1 - \alpha) \cdot r_{\mathrm{acc}}(\tau) \cdot r_{\mathrm{svrl}}(\tau) + \alpha \cdot r_{\mathrm{fmt}}(\tau)\)$
在推理阶段,Oracle 验证器被完全剥离,策略模型仅凭自身在强化学习中习得的验证能力完成证据筛选与一致性校验。
4. Dr. GRPO 策略优化:稳定轨迹依赖奖励下的梯度波动
标准 GRPO 依赖同组内样本回报的均值和标准差归一化来估计优势函数 \(\hat{A}_i\)。然而,当引入了依赖轨迹的复杂组合奖励项后,同一组内的奖励分布往往出现剧烈波动或瞬时方差坍缩,标准差归一化和序列长度归一化会急剧放大策略网络的梯度范数,引发训练过程中的响应长度漂移与策略崩塌。SVRL 全面采用 Dr. GRPO 算法,剔除容易失真放大梯度的启发式归一化项,在保持组采样规模 \(G=4\)(大幅低于基线的 \(G=8\))的前提下,实现了单台 8×A100 节点上的高吞吐稳定收敛。
损失函数 / 训练策略¶
微调优化目标采用带 KL 散度惩罚的 Dr. GRPO 目标函数: $\(\max_{\theta} \; \mathbb{E}_{(I, q, y^*) \sim \mathcal{D}} \left[ \mathbb{E}_{\tau \sim \pi_\theta(\cdot \mid I, q)} \left[ r(\tau) \right] - \beta \, D_{\mathrm{KL}}(\pi_\theta(\cdot \mid I, q) \,\|\, \pi_{\theta_{\mathrm{ref}}}(\cdot \mid I, q)) \right]\)$ 其中参考策略 \(\pi_{\theta_{\mathrm{ref}}}\) 为初始化的 Qwen-2.5-VL-7B-Instruct 模型,\(\beta\) 控制偏离度。采用 ReAct 风格系统提示词,训练迭代 400 步,批大小为 32,组大小为 4。所有文本搜索与图像搜索通过统一 API 请求并经由 DynamoDB 进行全局缓存,避免了昂贵的外部网络开销与不可复现的数据漂移。
实验关键数据¶
主实验¶
论文在五大视觉问答基准上进行了系统评测,包括分布内基准 FVQA-test、InfoSeek,以及分布外评测基准 MMSearch、LiveVQA 和 SimpleVQA。评测指标为基于强语言模型裁判的准确率 Acc (%) 与工具搜索比例 SR (%)。
| 模型 | FVQA-test (Acc / SR) | InfoSeek (Acc / SR) | MMSearch (Acc / SR) | LiveVQA (Acc / SR) | SimpleVQA (Acc / SR) |
|---|---|---|---|---|---|
| Direct Answer(无工具直答) | |||||
| Qwen-2.5-VL-7B | 26.7 / 0.0 | 20.1 / 0.0 | 12.8 / 0.0 | 17.8 / 0.0 | 38.4 / 0.0 |
| Qwen-2.5-VL-32B | 24.7 / 0.0 | 25.8 / 0.0 | 15.7 / 0.0 | 18.7 / 0.0 | 40.1 / 0.0 |
| Qwen-2.5-VL-72B | 27.1 / 0.0 | 28.0 / 0.0 | 15.7 / 0.0 | 20.1 / 0.0 | 42.2 / 0.0 |
| GPT-4o | 41.7 / 0.0 | 42.7 / 0.0 | 22.2 / 0.0 | 26.9 / 0.0 | 46.6 / 0.0 |
| RAG Workflow(每题必搜) | |||||
| Qwen-2.5-VL-7B | 51.6 / 100 | 53.7 / 100 | 52.2 / 100 | 48.0 / 100 | 51.6 / 100 |
| Qwen-2.5-VL-32B | 57.0 / 100 | 56.8 / 100 | 57.9 / 100 | 49.6 / 100 | 54.5 / 100 |
| Qwen-2.5-VL-72B | 62.2 / 100 | 59.4 / 100 | 59.6 / 100 | 56.0 / 100 | 61.0 / 100 |
| GPT-4o | 66.0 / 100 | 59.1 / 100 | 62.5 / 100 | 59.6 / 100 | 63.4 / 100 |
| Adaptive Search(自适应工具调用) | |||||
| MMSearch-R1++ | 56.4 / 80.3 | 55.1 / 59.7 | 53.8 / 88.5 | 48.4 / 76.2 | 57.4 / 42.5 |
| SVRL-full-7B(本文) | 65.3 / 61.4 | 64.7 / 52.3 | 60.3 / 82.0 | 57.8 / 48.6 | 58.3 / 27.0 |
消融实验¶
在 FVQA-test 和 InfoSeek 数据集上系统剥离 SVRL 各核心模块以分析其对性能与搜索率的影响:
| 配置 | FVQA-test Acc (%) | FVQA-test SR (%) | InfoSeek Acc (%) | InfoSeek SR (%) | 说明 |
|---|---|---|---|---|---|
| MMSearch-R1 (原始基线) | 51.1 | 64.2 | 49.8 | 63.5 | 原始 GRPO 方案 |
| MMSearch-R1++ | 56.4 | 80.3 | 55.1 | 59.7 | 引入 ReAct 提示词架构 |
| SVRL-query-align | 57.7 | 97.6 | 58.2 | 98.0 | 仅加查询对齐,出现无脑搜索黑客 |
| SVRL-llm-judge | 58.1 | 36.7 | 58.0 | 50.6 | 训练引入 LLM 裁判,回答冗长骑墙 |
| SVRL-search-aware | 59.9 | 80.3 | 57.0 | 85.8 | 引入搜索时机校准,消除盲目调用 |
| SVRL-ttv | 60.6 | 80.3 | 58.3 | 85.2 | 推理期依赖外部 GPT-5 验证器 |
| SVRL-self-verification | 64.2 | 61.2 | 64.1 | 59.2 | 轨迹内生自验证(无需推理期裁判) |
关键发现¶
- 去噪自验证对准确率贡献最大:消融数据显示,从基准 MMSearch-R1++ 到包含自验证机制的模型,准确率跃升接近 8 到 9 个百分点。同时,内生自验证(64.2%)甚至超过了在未微调模型上施加外部验证器的测试时验证方案(60.6%),表明模型不仅学会了证据筛选,还学会了根据筛选后的干净证据组织更加自洽的逻辑推理。
- 搜索时机感知是阻断奖励黑客的关键屏障:若单加查询质量对齐(
SVRL-query-align),模型为了刷高奖励会在近 98% 的题目上强行触发搜索;引入search-aware弱能力先验约束后,模型在内部知识可解的样本上大幅收敛了搜索冲动,搜索率显著降低且整体准确率提升。 - 有效支持测试时计算扩展(Test-Time Scaling):在并行搜索扩展实验中,随着并行检索预算从 1 增加到 15,SVRL 的表现保持持续上升,而基准 MMSearch-R1++ 在检索数超过 5 后迅速饱和停滞。这证明具备自验证能力的智能体能够从更大批量的并发候选信息流中精准淘洗有效事实,而不是被增多的外部噪声所淹没。
亮点与洞察¶
- 将外部验证机制内化为策略自身的生成式标签:通过让模型在思考轨迹内自发吐出
<verify>标签与对比理由,不仅在训练端为强化学习提供了极其清晰的过程级优势信号,更在推理端实现了零额外模型开销的去噪过滤。 - 利用前向弱先验解决自适应工具调用的奖励塑造难题:巧妙借助未微调模型单次前向的正确性作为免搜索先验,打破了以往均匀步长惩罚导致模型畏惧搜索的固有缺陷,优雅实现了精度与搜索成本的最优平衡。
- 验证驱动的测试时扩展范式:揭示了多模态智能体扩展测试时搜索预算的瓶颈不在于搜索工具的调用次数,而在于对海量返回噪声的鉴别力;自验证机制是解锁搜索类智能体 Test-Time Compute 潜力的核心支柱。
局限与展望¶
- 训练端依赖高阶闭源模型与真实标注:在训练阶段的 Oracle 验证环节仍然依赖 GPT-5 提供查询与证据片段的细粒度打分,如果存在标签偏差可能会被小模型继承;未来需探索完全基于规则或弱监督的无裁判对齐方案。
- 对工具格式与提示词设计较为敏感:实验表明系统性能高度依赖于 ReAct 结构规范与特定的结构化标签解析,在跨越不同提示体系或非结构化 API 场景下的泛化鲁棒性仍有待提升。
- 多轮交互动作空间有限:目前实验主要集中在一次到两次文本/以图搜图的短程闭环,尚未扩展到网页深度交互浏览(如滚动、点击、表单填写)等更为复杂的具身网络环境中。
相关工作与启发¶
- vs MMSearch-R1: MMSearch-R1 开创了用 GRPO 微调多模态搜索智能体的路线,但其采用均匀搜索惩罚且完全依赖稀疏的终局准确率奖励,导致高达 45% 的检索结果为无关噪声且无法处理中间决策;SVRL 引入搜索感知校准与内生自验证机制,不仅准确率全面领先 8-9 个百分点,搜索调用比例还下降了近 20%。
- vs RAG 工作流: 传统多模态 RAG 采用无差别的每题必搜策略(SR=100%),对内生知识丰富的样本造成大量无效计算与外部干扰;SVRL 实现了自适应按需搜索,以大幅削减的检索次数取得了超越 RAG 工作流的优异表现。
- vs 外部测试时重排器 (Test-Time Verifiers): 现有网络智能体通常外挂额外的重排器或大模型裁判进行证据去噪,带来了极高的推理延迟与算力成本;SVRL 证明了通过合适的强化学习目标,参数量仅 7B 的轻量多模态模型完全有能力在单次输出中内化证据的自检自查。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ 首次将内生自验证机制与弱能力先验校准结合引入多模态搜索智能体的强化学习微调中。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 5 个基准测试、精细的组件消融、工具调用细粒度统计及测试时计算扩展分析。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密,图文对照极度清晰,对失败案例与奖励黑客现象的分析十分深入透彻。
- 价值: ⭐⭐⭐⭐⭐ 为轻量多模态智能体摆脱昂贵外部验证器、实现高效可靠的工具增强推理提供了切实可行的范本。