跳转至

MMAgent-R2: Learning to Rerank and Reject for Agentic mRAG

会议: ECCV 2026
论文: ECCV 官方海报
领域: 信息检索/RAG
关键词: 多模态RAG、知识库VQA、视觉智能体、强化学习、视觉重排序

一句话总结

MMAgent-R2 将视觉重排序(Visual Reranking)与主动拒绝(Active Rejection)统一为智能体的内部校验机制,配合步级验证奖励的 GRPO 强化学习,解决了现有多模态 RAG 受困于全局特征检索失真及静态候选池的实体混淆难题。

研究背景与动机

基于知识库的视觉问答(KB-VQA)要求模型在给定图片和问题后,从海量百科知识库中精确定位视觉实体并检索相关知识以推导答案。现有主流的多模态检索增强生成(mRAG)普遍采用“先检索后后处理”(Retrieve-then-Postprocess)的范式:先依靠图像全局特征从百万级图像知识库中初筛出 Top-K 个候选实体,再由后处理模块从该候选池中过滤噪声并生成回答。

然而,这一范式面临着难以克服的识别瓶颈。一方面,基于全局特征向量(如 CLIP 粗粒度特征)的初检索极易被大量外观相似但事实无关的混淆实体(distractors)误导,例如将结构相似但细节迥异的木制教堂混淆;而现有的后处理大多仅在文本段落层面进行重排或打分,文本描述根本无法精准传递细微的视觉特征差异。另一方面更为致命的是,推理完全受限于首轮召回的固定候选池。一旦目标实体未能进入初始候选池,后续模块便只能“矮子里面挑将军”,被迫在错误实体间进行幻觉推理,检索错误必然一路向下游传播放大。此外,传统流程高度依赖外挂模块与串行设计,难以适应多图输入与复杂多跳推理场景。

面对这一两难困境,研究团队打破了单向静态流水线,将“视觉重排序”与“主动拒绝”提升为智能体自主内部校验的核心动作。核心 idea:将多模态检索推理建模为多轮智能体决策回路,使模型不仅能直接比对图像细节精确定位目标实体(Rerank),更能在当前候选均不匹配时主动拒绝(Reject)并动态扩充候选池,通过带步级验证奖励的 GRPO 联合优化检索、校验与回答全流程。

方法详解

整体框架

MMAgent-R2 将 KB-VQA 过程形式化为多轮智能体序贯决策。模型作为策略代理 \(\pi_\theta\),在一个覆盖“外部检索”、“内部校验”和“回答生成”三大类动作的动作空间内自主探索。在每一轮交互中,智能体结合历史轨迹生成思维推理(Reasoning),并决策是调用图像/文本检索工具获取外部线索,还是触发视觉重排序或主动拒绝以严格审验候选,直至收集到确凿证据后输出最终答案。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入:多图查询 {I_q} 与问题 Q"] --> B["自主多轮思考 Reasoning"]
    B --> C["外部检索 External Retrieval<br/>多模态知识获取"]
    C -->|返回非重叠候选批次| D["内部校验 Internal Verification"]
    D --> E["动态候选扩展与主动拒绝 Reject<br/>未达置信阈值则抛弃并拉取新批次"]
    D --> F["视觉细粒度重排序 Rerank<br/>比对图像细节锁定目标实体"]
    E -->|未超最大拒绝次数 Rej_max| B
    F --> G["文本事实检索 SearchText<br/>聚合实体属性文本"]
    G --> B
    B --> H["回答生成 Answer<br/>综合多模态证据终止任务"]

关键设计

1. 统一的多模态智能体动作空间:解耦获取、审验与生成 传统 mRAG 往往采用硬编码的多阶段脚本或多个独立模型堆叠,而 MMAgent-R2 将所有操作统摄于单一策略模型 \(\pi_\theta\) 的动作空间 \(\mathcal{A}\) 中。外部检索包含图像检索 SearchImage(j) 与文本检索 SearchText({qi}):前者支持动态候选扩展,对同一查询图像的连续调用会自动返回不重叠的下一批 Top-K 视觉候选;后者支持单步并行提交多条文本查询,高效聚合多维事实。内部校验由视觉重排序 Rerank(ek) 与主动拒绝 Reject() 构成,前者直接输出目标实体名作为后续确定性事实,后者输出拒绝信号指示无匹配并驱动环境提供新批次。最终以 Answer(y) 终止闭环。这消除了对外部 Critic 模型的依赖,赋予模型自主决定“查什么、看哪批、何时停”的自适应能力。

2. 视觉层级的细粒度校验机制:重排序与主动拒绝双重防线 以往后处理仅在文本段落上做重排序,对视觉细微结构无能为力。MMAgent-R2 将校验提升至真正的像素/视觉特征层级。当环境返回候选图像批次 \(\mathcal{B}_t^{(j)} = \{(I_k, e_k)\}_{k=1}^K\) 时,模型直接比对查询原图与各候选图像的轮廓、部件拓扑等细节。如果某一实体 \(e_k\) 具有明确视觉一致性,则执行 Rerank(ek);若批次内均为形似神不似的混淆项,模型坚决执行 Reject()。为了防止模型无休止地拒绝造成长上下文退化与计算浪费,系统引入了最大拒绝次数硬边界 \(Rej_{\max}\)(默认设为 2),环境在达到上限时注入边界提示,使模型在搜索广度与推理效率间取得最优平衡。

3. 复合奖励引导的强化学习:步级验证奖励突破稀疏反馈 若仅以最终答案正确与否作为结果奖励(Outcome Reward),在多轮交互且长路径的任务中会遭遇极度严重的奖励稀疏问题,导致策略难以学会在何时应该坚定拒绝、何时应该准确选中。为此,MMAgent-R2 设计了复合奖励函数 \(R = R_{\text{outcome}} + R_{\text{format}} + R_{\text{ver}}\)。其中 \(R_{\text{format}}\) 规范输出语法的严格性,而核心的步级验证奖励 \(R_{\text{ver}}\) 为每个图像的每一次校验操作提供即时反馈。对于候选批次 \(\mathcal{B}\) 与真实实体 \(e^*\),步级单步奖励 \(\rho\) 定义为:

\[ \rho(a, \mathcal{B}, e^*) = \begin{cases} \delta, & \text{if } a = \texttt{Reject} \text{ and } e^* \notin \mathcal{B} \\ 1, & \text{if } a = \texttt{Rerank}(e^*) \\ 0, & \text{otherwise} \end{cases} \]

其中 \(\delta=0.2\) 为正确拒绝的激励权重。该奖励显著抑制了模型在候选存疑时“靠蒙”的劣性,正向引导模型勇于推翻不可靠检索结果。训练采用 GRPO 算法,对每个样本采样 \(G=8\) 条完整轨迹进行群体相对优势估计;并在损失反向传播时对环境返回的环境响应 Token(检索得到的图片与文本)进行严格 Mask,使梯度更新完全聚焦在模型自身的思考与动作生成上。

一个完整示例

以 MMhops 的跨图比较问题为例:“第二张图中的飞机相比第一张图中的飞机多发生过多少次机体全毁(hull-loss)事故?” 1. 智能体发起 SearchImage(1) 检索图 1,初始 Top-5 返回洛克希德 L-1011、波音 767 等,智能体比对尾翼引擎结构,精准执行 Rerank(McDonnell Douglas DC-10) 锁定麦道 DC-10。 2. 智能体发起 SearchImage(2) 检索图 2,初始 Top-5 返回波音 707、DC-8、波音 747 等,模型细致比对发动机吊舱与机翼细节,执行 Rerank(Douglas DC-8) 锁定道格拉斯 DC-8。 3. 智能体并行发起 SearchText(["DC-10 hull loss accidents count", "Douglas DC-8 hull loss accidents count"]),环境返回对应百科维基段落:DC-10 包含 32 次机体全毁事故,DC-8 包含 84 次机体全毁事故。 4. 智能体计算 \(84 - 32 = 52\),执行 Answer(52) 准确作答,避免了无重排序基线因误识图 1 为 L-1011(10 次)和误识图 2 为波音 707(174 次)而算出的荒谬偏差(164 次)。

实验关键数据

主实验

在单跳至多跳的三个代表性权威基准(E-VQA 拥有最大 200 万规模维基知识库、InfoSeek 评测未见问题与实体、MMhops 评测复杂多图多跳链条)上,MMAgent-R2 相比各类对比模型展现出压倒性优势。

数据集 指标 / 子任务 MMAgent-R2-8B MMAgent-R2-7B 之前最优 SOTA (基线) 相比 SOTA 提升
E-VQA (2M 知识库) Single-Hop Acc (%) 55.9 55.4 53.7 (QKVQA-7B) +2.2%
E-VQA (2M 知识库) All Acc (%) 54.2 53.6 47.0 (ReAG-7B) +7.2%
InfoSeek (100K 知识库) All Acc (%) 49.1 50.2 47.2 (ReAG-7B) +3.0%
InfoSeek (100K 知识库) Unseen-Question (%) 49.0 50.7 48.3 (ReAG-7B) +2.4%
InfoSeek (100K 知识库) Unseen-Entity (%) 49.2 49.7 46.2 (ReAG-7B) +3.5%
MMhops (多图多跳) Bridging Acc (%) 67.2 65.9 54.0 (Gemini-2.5-pro) +13.2%
MMhops (多图多跳) Comparison Acc (%) 39.8 34.9 29.4 (Gemini-2.5-pro) +10.4%

消融实验

在 InfoSeek 子集上对核心校验模块、批大小 \(K\)、最大拒绝次数 \(Rej_{\max}\) 以及拒绝奖励权重 \(\delta\) 进行消融验证(以 MMAgent-R2-8B 为例):

消融配置 实体识别率 (Ident.%) VQA Acc (All%) 核心结论与机制说明
完整模型 (Rerank + Reject) 58.6 45.5 双重校验协同:重排序提升精度,拒绝拓展召回边界
w/o Reject (仅保留 Rerank) 57.5 44.3 无法跳出初始批次,首轮漏检直接导致识别率下降 1.1%
w/o Rerank, w/o Reject (直接用 Top-1) 53.7 40.2 退化为传统 mRAG,大幅受限于初筛噪点,准确率骤降 5.3%
候选批大小 \(K=3\) 58.0 44.7 单批覆盖不足,导致频繁拒绝(平均拒绝 0.63 次)
候选批大小 \(K=7\) 58.7 45.7 精度微增但上下文膨胀严重,带来额外 Token 成本
最大拒绝上限 \(Rej_{\max}=0\) 57.5 44.3 等同于无拒绝机制
最大拒绝上限 \(Rej_{\max}=3\) 58.1 44.8 过度检索使上下文充斥冗余候选,推理质量不升反降
拒绝奖励权重 \(\delta=0.1\) 57.9 44.9 激励过弱,模型倾向于在模糊候选间盲猜
拒绝奖励权重 \(\delta=0.3\) 58.4 45.2 激励过高,诱发过度拒绝与上下文拉长

关键发现

  • 最难检索的场景收益最为显著:在 E-VQA 200 万规模的百科库中,基础检索器的 Recall@1 仅有 15.4%,而 MMAgent-R2-8B 将实体识别准确率跃升至 29.5%(绝对提升 +14.1%),最终 VQA 准确率暴涨 7.2 个点。这证明视觉内部校验机制能够直接盘活低召回率检索系统。
  • 纯 RL 驱动胜过复杂的 SFT 多阶段流水线:以往 SOTA 模型 ReAG 依赖繁复的 SFT 冷启动、外挂 Critic 判别模型再叠加强化学习;而 MMAgent-R2 完全基于单一模型,凭借 GRPO 和步级验证奖励直接端到端学会审验与拒绝,在 InfoSeek 上反超 ReAG 3.0 个点。
  • 自适应控制拒绝频率:在 \(Rej_{\max}=2\) 时,模型的平均实际拒绝次数仅为 0.59 次,远低于上限。这表明模型习得了按需拒绝(reject on demand),并未出现盲目扩充池子的失控行为。

亮点与洞察

  • 将视觉校验内化为 Agent 决策原子动作:以往工作将文本过滤与视觉检索割裂开,MMAgent-R2 首次让 VLM 在交互回路中直接看原图比对候选图,完成了从“文本语义过滤”到“像素级细粒度视觉比对”的跨越。
  • 动态候选扩展解除了固定候选集的紧箍咒:允许对同一查询进行多次无重叠候选召回,配合主动拒绝,使系统能够自适应决定搜索深度,从根本上消除了检索错误级联传播的隐患。
  • 步级中间反馈解决长链路信用分配:在多轮复杂交互中,密集且针对性的验证奖励(选对得 1 分、在无解时成功拒绝得 0.2 分)为策略探索提供了极佳的路标,成功引导模型戒除“幻觉盲猜”的顽疾。

局限与展望

  • 受限于检索器召回上限:实验中 Table 4 显示候选池覆盖率上限(R@15)在 E-VQA 达到 37.8%、InfoSeek 达到 80.2%,模型仍有可观的实体未被初始多批次覆盖。未来可探索将视觉检索编码器与智能体进行联合端到端反向传播微调。
  • 图像 Token 开销与长上下文负担:每一批传入 5 张候选图像会占据大量视觉 Token,多轮交互后显存占用与计算时延增大。如何对候选图像进行高效视觉摘要或特征级紧凑表征值得探索。

相关工作与启发

  • vs. 经典检索后处理 mRAG (如 EchoSight, mR2AG):传统工作仅能在初检的固定候选集合内,依靠多模态模型对关联的维基文本段落进行重排或打分。MMAgent-R2 实现了跨图视觉细节比对,且通过主动拒绝跳出了固定候选池的桎梏。
  • vs. 多阶段外挂判别管线 (如 ReAG, VLM-PRF):ReAG 等方案需要额外训练独立 Critic 判别器,并依靠多阶段分步预热。MMAgent-R2 依托单一基座策略模型,统一了工具调用与审验推理,架构更为轻量通畅。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ [将视觉细粒度重排序与主动拒绝统一为智能体内部校验动作,并用步级奖励做 GRPO 联合训练,思路清晰优雅]
  • 实验充分度: ⭐⭐⭐⭐⭐ [覆盖 E-VQA、InfoSeek、MMhops 三大经典与前沿基准,涵盖主结果、实体识别率跃迁与详尽参数消融]
  • 写作质量: ⭐⭐⭐⭐⭐ [行文严谨流畅,问题定义与理论公式完备,定性案例具有说服力]
  • 价值: ⭐⭐⭐⭐⭐ [为多模态 RAG 与视觉智能体在开放域海量知识库下的抗幻觉与防噪检索提供了极具启发性的通用范式]