跳转至

RegRet: Enhancing Region-Level Retrieval in Large Multimodal Models

会议: ECCV 2026
论文: ECCV 原文
PDF: ECCV PDF
领域: 多模态 VLM
关键词: 区域级多模态检索, 大多模态模型, 区域感知编码器, 对比学习, REGMB 基准

一句话总结

针对大多模态模型在区域级检索中难以权衡局部细节与全局背景上下文的瓶颈,本文提出 RegRet 架构,通过逐层交叉注意力的区域感知编码器与独立投影解耦全局和区域表征,并配合三阶段训练流水线及 225k 对多任务评测基准 REGMB,在显著提升区域检索精度的同时保持甚至增强全局检索性能。

研究背景与动机

多模态信息检索在电商搜同款、医疗影像配准以及多模态检索增强生成(RAG)中具有不可替代的产业价值。在实际工业界场景中,用户查询往往高度依赖感兴趣区域(ROI),例如用户上传一张包含卧室的实景照片并框选出地毯,期望检索具有类似精细材质或编织纹理的目标商品。如果检索系统缺乏对 ROI 的精准建模,仅依赖全局图像特征,系统就会被房间的整体布局、家具排列等宏观主导视觉信息所误导,错误召回宏观相似但地毯截然不同的负例样本。然而,现有大多模态模型(LMM)大多围绕全图粒度建模,缺乏在显式提供区域标注时最大化检索潜力的系统设计。

将现有基于 LMM 的多模态检索模型直接应用于区域级任务面临两大核心矛盾。首先是局部区域表征与全局背景上下文的动态平衡困境。现存的视觉提示策略各有固有缺陷:直接在图上画视觉框(Visual Mark)受制于模型的视觉定位能力,背景噪声依然喧宾夺主;直接裁剪(Crop 或 ROIAlign)会剔除必要的环境线索,使模型失去理解前景尺度的上下文(例如失去商店背景时易将遮阳伞误判为白布);将区域作为附加图像(Auxiliary Image)拼接入上下文则常引入原图背景干扰,让模型将过多注意力投射到无关区域。更严重的是,若粗暴采用编码器-解码器架构直接微调单一视觉编码器,区域级任务的训练梯度会导致全局检索特征严重退化。其次是高质量训练资源与多元评测基准的严重匮乏。现有区域级基准多局限于单一的图像到图像任务,且缺乏覆盖跨模态交叉检索与上下文依赖检索的统一训练和测试数据。

本文的核心思路是:不再依赖外挂的提示工程或单一共享表征,而是构建专用的区域感知分支与解耦表征空间,将上下文与前景细节的权衡转化为可学习的注意力机制。本文的核心 idea 是设计包含逐层交叉注意力的区域感知编码器(RAE)与解耦投影层,协同上下文编码器(CE)实现多层级语义吸收与全局表征解耦,配合“细粒度区域描述预训练-纯文本对比学习-区域多任务对比微调”三阶段流水线,在 225k 规模的 REGMB 基准上全面释放区域检索能力。

方法详解

整体框架

RegRet 的整体架构建立在大多模态模型骨干之上,整体输入可包含查询图像及其对应的 ROI 边界框 \(r_q\),以及文本指令。模型通过上下文编码器(CE)提取全图的全局视觉 token,同时将截取的 ROI 输入至区域感知编码器(RAE)。RAE 逐层与 CE 进行交叉注意力交互,有选择地汲取不同语义层次的背景线索并保留区域细节。最终,全局特征与区域特征分别通过独立的投影层(Projector)映射至 LLM 文本嵌入空间,由 LLM 聚合多模态 token,并提取末尾特殊标记 [EMB] 处的隐层状态作为最终检索向量。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入:图像 + ROI边界框 + 检索指令"] --> B["阶段1:区域感知编码器预训练<br/>逐层吸收上下文并拟合细粒度描述"]
    B --> C["阶段2:纯文本对比学习<br/>InfoNCE转换LLM文本嵌入能力"]
    C --> D["阶段3:区域对比微调<br/>混合视觉提示与跨模态难负例对齐"]
    D --> E["双路解耦检索输出<br/>[EMB] 向量支持区域与全局检索"]

关键设计

1. 逐层协调的区域感知编码器(RAE):多层级语义上下文的主动吸收 传统方法仅在 ViT 最后一层进行特征交互,容易丢失浅层特有的材质、纹理和精细边缘信息。RAE 采用与上下文编码器(CE)逐层对应的架构:在每一层中,ROI 特征首先经过自注意力提炼局部模式,随后通过交叉注意力模块向对应 CE 层查询全局背景,查询(Q)来自 RAE 自身隐层,键(K)和值(V)来自 CE 同层特征。自注意力层在 CE 和 RAE 之间共享权重以节省参数并利用预训练视觉先验,而交叉注意力输出通过可学习标量 \(\alpha\) 加权注入: $\(h_{\mathrm{RAE}}^{i+1} = h_{\mathrm{RAE}}^{i} + \alpha \cdot \operatorname{xattn}\left(h_{\mathrm{RAE}}^{i},\, h_{\mathrm{CE}}^{i},\, h_{\mathrm{CE}}^{i}\right)\)$ 标量 \(\alpha\) 初始化为 0,使网络平滑过渡到利用背景上下文的状态。深浅层协同运作机制让 RAE 既能从浅层获取物体局部物理属性,又能从深层吸收高层语义场景制约。

2. 独立投影层解耦架构:防止全局表征退化 当 RAE 与 CE 共用同一个线性投影层直接接入 LLM 时,区域级检索梯度会强行拉扯视觉空间,导致全局图像检索性能断崖式下跌。RegRet 明确区分两者的语义目标:全局全图特征服务于整体语义,区域特征服务于实例级细粒度辨识。因此,模型冻结原有的预训练 CE 编码器及其中文/英文全局投影层,为 RAE 单独设立专用的线性投影层。这种解耦机制确保了全局检索能力不被破坏,同时让 RAE 可以全力优化特定区域表征,实现全局任务与局部任务在同一模型内的和谐共存。

3. 三阶段渐进式训练管线:从感知描述到判别性嵌入 为了分步解耦优化难度,RegRet 划分了三阶段训练任务。阶段一为 RAE 预训练,采用 DAM 和 PAM 数据集上的细粒度局部描述生成任务,冻结语言基座,仅训练 RAE 交叉注意力和独立投影层,以自回归语言建模损失驱动 RAE 捕捉与上下文交融的区域细节。阶段二为纯文本对比学习,借助大规模文本对和 InfoNCE 损失,低成本地将 LLM 的生成模式转换为紧凑的向量嵌入能力。阶段三为区域对比微调,引入混合视觉提示策略:对侧重纯局部的任务仅将 RAE token 输入 LLM,对依赖上下文的交互任务则拼接 CE 和 RAE token,同时构建全局样本与区域样本之间的互为负例对,全面打磨细粒度判别力。

损失函数 / 训练策略

在阶段一,模型在长序列 token 上执行局部细粒度描述自回归生成,训练损失为交叉熵: $\(\mathcal{L}_{\mathrm{rae}} = -\frac{1}{T}\sum_{t=1}^{T} \log P(x_t \mid x_{<t}; \theta)\)$ 在阶段二与阶段三,模型采用 InfoNCE 对比损失对检索向量进行优化: $\(\mathcal{L}_{\mathrm{rcl}} = -\frac{1}{N} \sum_{i=1}^N \log \frac{\exp\left(\langle q_i \otimes r_{q_i},\, c_i^+ \otimes r_{c_i^+} \rangle / \tau\right)}{\sum_{j=1}^N \exp\left(\langle q_i \otimes r_{q_i},\, c_j \otimes r_{c_j} \rangle / \tau\right)}\)$ 其中 \(\tau\) 为温度超参数,\(N\) 为批大小。在 Stage-III 阶段,为在保持大 batch size 的同时节约显存,LLM 采用 LoRA 微调(阶段二 rank=64,阶段三 rank=128),在 24 张 NVIDIA H20 GPU 上仅需 20 小时即可完成全流程训练。

实验关键数据

主实验

REGMB 评测集全面涵盖四类任务:Task 1(文本到图像 T2I)、Task 2(图像到文本 I2T)、Task 3(图像到图像 I2I)、Task 4(图文到图像 IT2I)。主要评测指标在多数任务报告 Recall@5(R@5),在 vismin 和 imgdiff 报告 Recall@1(R@1)。

模型类别 模型 规模 Task 1 (SAM) Task 2 (SAM) Task 3 (XGoods) Task 4 (VisMin) REGMB 均分
CLIP类 FG-CLIP 0.2B 48.5 48.9 60.7 53.6 58.5
CLIP类 SigLIP2 0.4B 46.3 55.9 79.0 30.5 62.9
LMM类 MM-EMBED 8B 42.5 35.2 80.5 82.9 61.3
LMM类 LamRA 8B 41.3 46.7 83.3 82.6 65.7
LMM类 mmE5 11B 50.4 42.2 82.0 80.9 67.5
本文方法 RegRet-3B† 3B 58.1 70.6 91.7 83.1 79.9
本文方法 RegRet-8B-zs (Zero-Shot) 8B 59.5 72.4 86.3 81.1 78.8
本文方法 RegRet-8B† 8B 69.1 86.5 93.6 83.4 86.2

在公开泛化基准(ROxford-Hard、DeepFashion2、ILIAS)上,RegRet-8B 同样取得显著优势:

模型 ROxford-Hard (mAP) DeepFashion2 (R@1) ILIAS-I2I (mAP@50) ILIAS-T2I (mAP@50) 泛化平均分
LamRA 42.0 13.2 71.1 62.6 47.2
mmE5 36.9 11.1 50.1 39.0 34.2
RegRet-8B-zs 42.8 15.8 75.7 59.1 48.3
RegRet-8B 45.0 20.2 86.4 72.6 56.1

消融实验

表 4 系统验证了 RAE 核心架构设计的必要性,对比了交叉注意力(xattn)、独立投影层(separate proj.)和逐层协调机制(layer-wise):

架构变体 xattn 独立投影 逐层协调 Task 1 Task 2 Task 3 Task 4 REGMB 均分 M-BEIR 均分
Auxiliary Image (基准) ✗ ✗ ✗ 69.8 82.7 92.6 86.7 83.4 57.1
RAE-sharep (共享投影) ✓ ✗ ✗ 77.2 83.5 51.7 52.2 66.0 27.2
RAE-encdec (单层交叉+独立投影) ✓ ✓ ✗ 76.6 83.8 89.4 81.3 82.6 57.1
完整 RAE ✓ ✓ ✓ 79.0 86.9 92.9 86.0 86.2 57.3

关键发现

  • 独立投影层是杜绝局部与全局能力冲突的决定性设计:共享投影层(RAE-sharep)由于表征空间纠缠,导致全图 M-BEIR 检索均分从 57.1 暴跌至 27.2,而采用独立投影层后全局能力立刻恢复至 57.1,完整模型更微涨至 57.3。
  • 逐层协调机制通过融合 ViT 浅层纹理与深层语义,使 Task 1 和 Task 2 相对单层编解码器架构分别提升 2.4% 与 3.1%,证明了细粒度材质信息跨层传递的价值。
  • 提示策略对比中,RegRet-8B-zs 零样本表现(78.8)显著碾压使用 Auxiliary Image 的 LamRA(63.1)和 Crop(55.9),且在推理速度上比 Auxiliary Image 策略快 22%(单 batch 耗时从 9.1s 降至 7.1s)。

亮点与洞察

  • 逐层注意力平衡与权重共享:RAE 巧妙复用 CE 骨干的自注意力参数,仅训练交叉注意力与独立映射层,以极轻量参数增量实现了自适应上下文感知。
  • 解耦表征消除“跷跷板效应”:通过隔离 RAE 与 CE 的语义映射空间,攻克了在注入区域级表征微调时通用全图检索能力断崖式下降的经典顽疾。
  • 多元评测基准 REGMB:填补了领域内高质量区域对比训练集与跨模态基准的空白,引入具备光照、姿态扰动的人工校验真实社交商品数据,构建了极具区分度的评测体系。

局限与展望

  • 作者指出的局限:模型在依赖极其宏观上下文的图文编辑检索(如 Task 4 部分子项)上面临局部聚焦与全局理解的权衡,个别指标相较纯全局模型略有妥协。
  • 潜在改进空间:目前 ROI 输入主要依托边界框(Bounding Box),对于形状不规则、非凸多边形或半透明遮挡的前景目标,边界框内不可避免仍混入非目标像素,未来引入点提示或任意形状 mask 提示有望进一步提升边界纯度。
  • 拓展方向:可将 RAE 机制直接拓展至文档图像理解与精细化多模态文档检索(如提取复杂报表局部单元格并做跨文档对齐)。

相关工作与启发

  • vs FG-CLIP / FineCLIP: 传统区域对比方法依赖 CLIP 架构和 ROIAlign 特征裁剪,缺乏大语言模型的复杂指令解析能力且容易剥离必要背景;RegRet 基于 LMM 架构,借助 RAE 的交叉注意力动态调节背景融入量。
  • vs LamRA / mmE5: 通用 LMM 检索器在处理局部区域时依赖粗糙的视觉标记或副图拼接提示,导致背景噪声严重干扰;RegRet 提出专用 RAE 分支并实现独立投影解耦,在区域检索实现 20%+ 跨越式提升的同时稳固了全局多模态检索性能。

评分

  • 新颖性: ⭐⭐⭐⭐ [逐层协调的 RAE 与投影层解耦架构设计巧妙,逻辑自洽]
  • 实验充分度: ⭐⭐⭐⭐⭐ [自建 225k REGMB 基准,涵盖四大检索任务与多个经典泛化基准,消融与案例翔实]
  • 写作质量: ⭐⭐⭐⭐⭐ [问题定义明确,图表清晰,实验论证环环相扣]
  • 价值: ⭐⭐⭐⭐⭐ [切实解决工业界电商检索与细粒度 RAG 的痛点,兼顾了局部精度与全局通用性]