Reasoning-Guided Part-Level Visual Grounding via Reinforcement Learning¶
会议: ECCV 2026
论文: ECCV 2026 Poster
代码: https://github.com/sajeedmehrab/op-hrg
领域: 多模态VLM
关键词: 部件级视觉定位 / 多模态大语言模型 / 分层推理 / 强化学习 / GRPO
一句话总结¶
针对多模态大语言模型(MLLM)在部件定位中常退化为整物检测的痛点,提出对象-部件分层反思定位范式(OP-HRG)与部件感知 GRPO 强化学习框架,以 4B 参数量在跨数据集零样本与域内部件定位基准上全面超越 7B 模型与 SAM3。
研究背景与动机¶
在真实物理交互、具身抓取及精细化医学影像分析等场景中,细粒度定位物体的局部部件(如杯子的手柄、汽车的车轮)是一项基础能力。人类在寻找物体部件时,本能地遵循自粗到细的认知逻辑——首先定位包含该部件的完整物体,随后在物体边界内寻找局部部件。然而,现有的多模态大语言模型(如 Qwen-VL 系列)虽然在基于自由自然语言查询的整物级视觉定位(Visual Grounding)上表现卓越,但在面对部件级查询时往往严重失效:当提示模型定位“杯柄”时,模型输出的边界框经常直接罩住“整只杯子”。
这一现象背后存在两大核心矛盾与诱因。一方面是视觉语言预训练数据的严重偏差,现有大规模图文预训练主要由整物级描述主导,高质量且覆盖密集的部件级标注极其稀缺且昂贵,使模型形成了粗粒度实体的先验偏见;另一方面是模型定位机制的结构性缺失,当前定位 MLLM(包括引入强化学习对齐的模型如 Seg-Zero、VisionReasoner)对所有自然语言查询均采用一视同仁的单阶段单步回归,缺少显式建模“父级物体-局部部件”从属与空间拓扑层级的机制。虽然 MLLM 具备潜在的空间层级推理能力,但没有结构化的推理范式与精准奖惩信号去激活这一能力。
本文的切入角度是:将部件定位解耦为结构化的自粗到细分层推理,并配合细粒度的分阶段强化学习奖励。核心 idea:提出对象-部件分层反思定位(OP-HRG)框架,显式引导模型先辨识类型、定位父物体再提取部件,通过重编码局部裁剪图实现主动视觉反思校验,并在部件感知 GRPO 框架下引入包含防作弊基线的阶段化可验证奖励。
方法详解¶
整体框架¶
本文采用“解耦推理与分割”(Decoupled Reasoning and Segmentation)架构。输入图像 \(I \in \mathbb{R}^{H \times W \times 3}\) 和自然语言文本查询 \(q\),首先由多模态大模型(以 Qwen3-VL-Instruct 为基座)进行显式思维链推理,生成一组几何定位图元 \(\mathcal{O} = \{(b_i, p_i)\}_{i=1}^K\)(紧致 2D 边界框 \(b_i\) 与框内代表性关键点 \(p_i\))。随后,将这些几何图元作为空间提示(spatial prompt)送入完全冻结的高质量通用掩码分割解码器(SAM2 或 SAM3),最终生成稠密的二进制分割掩码 \(S \in \{0, 1\}^{H \times W}\)。
整个 MLLM 推理过程遵循 OP-HRG 结构化范式,包含三个核心阶段:首先根据查询判定目标属性并执行分层定位(先找父级整物框作为空间锚点,再推断局部部件框);接着利用预测框进行图像裁剪并由视觉编码器重编码,驱动模型开展主动视觉感知自反思(检查初始框是否过于宽松或遗漏,给出修正建议);最后利用包含紧致性、包含关系与防作弊基线提升的多阶段部件感知 GRPO 目标对模型策略进行直接对齐优化。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入:图像与自然语言查询 (I, q)"] --> B["对象-部件分层解耦与结构化提示<br/>查询类别判断 + 父物体锚点定位 + 初始部件预测"]
B --> C["主动视觉感知与自反思校验<br/>局部裁剪图重编码 + 空间证据自审视 + 终版图元提精"]
C --> D["部件感知可验证强化学习奖励<br/>紧致性惩罚 + 部件包含约束 + 防作弊基线提升奖惩"]
D --> E["冻结掩码解码器 (SAM2 / SAM3)<br/>输出高精度稠密部件分割掩码"]
关键设计¶
1. 对象-部件分层解耦与结构化提示:确立自粗到细的空间锚定路径
针对传统定位模型单一视角直接预测导致的整物偏见,OP-HRG 在 Prompt 层面设计了一套严格的结构化标签序列输出协议。模型在生成时必须逐步输出 <locate>(任务目标推理思考)、<target>(二分类判定当前查询是“object”还是“part”)、<object_hint>(父级实体边界框)、<first_answer>(初始部件边界框与代表点)、<criticism>(自反思评价与调整标志)以及 <answer>(最终精炼坐标)。当模型判定查询为部件时,强制其首先定位父级完整物体作为上下文锚点,再在该空间区域内定位目标部件,且要求初始部件框必须严格落在父物体框内部。这种分层约束将困难的直接高分辨率局部搜索转化为空间拓扑收敛问题,有效消除了将整物误报为部件的结构性缺陷。
2. 主动视觉感知与自反思校验:将高分辨率视觉证据重新注入思考流
现有的自反思(Self-Reflection)语言模型往往仅在文本坐标层面进行纯符号层面的反思,模型无法直观“看到”它所圈出的候选区域内部到底长什么样。本文提出了主动视觉感知(Active Visual Perception, AP)机制:在模型生成完初始预测 <first_answer> 后,生成过程主动暂停(pause),系统自动根据预测的边界框对输入图像 \(I\) 进行物理裁剪(crop)。各裁剪子图通过模型自身的预训练视觉编码器重新提取特征,并转化为交错的视觉 token 注入后续上下文中。模型在接收到自己圈定的局部高清视觉证据后,在 <criticism> 阶段对初始预测是否紧致、是否误包含了相邻肢体或整个躯干进行严密自查,并明确标记 ADJUSTMENT: YES 或 NO,最终在 <answer> 标签内输出修正后的紧致边界框。
3. 部件感知可验证强化学习奖励:杜绝作弊与退化的多阶段几何监督
在 GRPO 优化过程中,若仅使用单一终版 IoU 奖励,模型极易学会退化策略(例如先故意输出极差的初始框来骗取“改进奖励”,或者将部件框直接复制为父物体框来骗取包含率)。本文构建了一套细粒度、多阶段可验证的复合奖励函数:
- 紧致性奖励(Compactness Reward):由重叠精度项 \(\rho_{ij} = |\hat{b}_i \cap b^*_j| / |\hat{b}_i|\) 与过预测惩罚项 \(\omega_{ij} = -\min\left(1, \max(0, |\hat{b}_i| / |b^*_j| - 1)\right)\) 构成,当预测框面积达到真实框 2 倍时惩罚饱和达到 \(-1\),强制抑制大框扩张。
- 部件包含奖励(Part Containment Reward):对部件预测严格验证三项拓扑条件——空间上被父物体框包含、与父物体框不完全重合、面积严格小于父物体框(\(|\hat{b}_{\text{part}}| < |\hat{b}_{\text{obj}}|\)),杜绝直接复制父物体框的平凡解。
- 抗利用提升奖励(Improvement Reward):为了防止模型刻意拉低初始预测质量以刷取差值,定义如下提升机制:
$\(R^{\text{IoU}}_{\text{improv}} = \max\left(0, R^{\text{IoU}}_{\text{final}} - \max\left(R^{\text{IoU}}_{\text{initial}}, \lambda_{\text{IoU}} \cdot \text{IoU}_{\text{baseline}}\right)\right)\)$
其中 \(\text{IoU}_{\text{baseline}}\) 为预先离线计算的强外部基线(SAM3)得分。只有当终版预测同时战胜模型自身的初版表现以及外部基线表现时,模型才能获得奖励;若终版反思导致指标劣化,则追加惩罚 \(R^{\text{IoU}}_{\text{final}} - R^{\text{IoU}}_{\text{initial}}\)。
- 反思一致性惩罚(Adjustment Consistency Penalty):严密监测模型自省意图与动作的一致性。当模型声明 ADJUSTMENT: YES 但前后坐标保持不变,或声明 ADJUSTMENT: NO 却擅自改动坐标时,直接施加 \(-1\) 的硬性惩罚。
损失函数 / 训练策略¶
模型采用无 SFT 冷启动的纯 RL 对齐策略。直接使用预训练的 Qwen3-VL-Instruct 权重,利用 GRPO(Group Relative Policy Optimization)采样输出轨迹组 \(G = \{y_j\}_{j=1}^{|G|}\),计算轨迹在组内的优势值 \(A_j\)。总优化目标为带重要性采样裁剪和 KL 散度正则的替代损失: $\(\mathcal{L}_{\text{GRPO}} = -\frac{1}{|G|}\sum_{j=1}^{|G|} \left[\min\left(\rho_j A_j, \text{clip}(\rho_j, 1-\epsilon, 1+\epsilon) A_j\right)\right] + \beta \mathbb{D}_{\text{KL}}(\pi_\theta \,\|\, \pi_{\theta_0})\)$ 其中 \(\rho_j = \pi_\theta(y_j|I, q) / \pi_{\theta_0}(y_j|I, q)\),\(\pi_{\theta_0}\) 为冻结的参考策略。训练集仅采用 7k 通用多目标定位数据结合 InstructPart 训练集(仅 1200 张图像),通过连通域分析和欧式距离变换自监督提取掩码的最大内接点作为代表点,无需额外人工标注。
实验关键数据¶
主实验¶
在部件级视觉定位基准上,评估指标采用 gIoU(所有测试查询的平均交并比)。其中 InstructPart 为域内测试(600 图/查询),PascalPart-116(10k 部件查询)和 PartImageNet(14k 部件查询)均为完全跨数据集的零样本评估(训练时完全未见其图像与类别)。
| 模型类别 | 模型架构 | 参数量 | InstructPart (部件) | PascalPart (部件) | PartImageNet (部件) | Pascal-Obj (整物) |
|---|---|---|---|---|---|---|
| 显式标记定位 MLLM | LISA-7B | 7B | 43.26 | 13.82 | 29.91 | 83.50 |
| 显式标记定位 MLLM | Sa2VA-4B | 4B | 50.15 | 14.67 | 38.13 | 77.02 |
| 显式标记定位 MLLM | PixelLM-7B | 7B | 44.41 | 16.57 | 35.25 | 81.71 |
| 显式标记定位 MLLM | UniPixel-3B | 3B | 59.68 | 30.64 | 46.18 | 85.54 |
| 解耦式 MLLM+SAM | Molmo + SAM3 (point) | 7B+ | 51.02 | 8.87 | 17.30 | 57.57 |
| 解耦式 MLLM+SAM | Grounding DINO + SAM3 (box) | - | 33.74 | 13.13 | 31.38 | 79.25 |
| 解耦式 MLLM+SAM | VisionReasoner-7B | 7B | 59.38 | 27.44 | 45.59 | 86.68 |
| 文本提示分割模型 | SAM3 (text direct) | - | 71.06 | 33.05 | 53.89 | 85.32 |
| 解耦式 MLLM+SAM | Qwen3-VL-4B + SAM2 (零样本 Prompt) | 4B | 31.45 | 12.83 | 21.95 | 36.91 |
| 解耦式 MLLM+SAM | OP-HRG (Qwen3-VL-4B + SAM2, 本文) | 4B | 75.56 | 38.59 | 56.87 | 87.50 |
| - | 相比最佳基线提升 (\(\Delta\)) | - | +4.50 | +5.54 | +2.98 | +0.82 |
消融实验¶
消融实验在 InstructPart 测试集上系统检验了训练数据、分层架构与反思机制的独立贡献:
| 实验组别 | 实验配置 / 变体 | gIoU (%) | 说明与影响 |
|---|---|---|---|
| 数据与基线对比 | VisionReasoner-7B (原版) | 59.38 | 采用标准定位奖励的 7B 基线 |
| VisionReasoner-7B + InstructPart 上微调 | 62.33 | 仅增加部件数据不足以弥补结构性缺陷 (+2.95) | |
| 模块独立消融 | 本文全模型 w/o 分层与反思机制 | 70.32 | 仅保留基础几何奖励,退化幅度达 -5.24 |
| 本文全模型 w/o 分层定位机制 (去掉父物锚点/包含奖励) | 73.77 | 缺少父级锚定指导,性能下降 -1.79 | |
| 本文全模型 w/o 反思提精机制 (去掉批评提精/提升奖励) | 73.98 | 缺少自反思回路,性能下降 -1.58 | |
| 完整模型 | OP-HRG 全模型 (4B) | 75.56 | 分层与反思机制呈现高度互补 |
关键发现¶
- 轻量模型反超大模型与专用感知模型:仅用 4B 参数量的 Qwen3-VL-Instruct 在部件定位上大幅甩开 7B 参数的 VisionReasoner(InstructPart 领先 +16.18,PascalPart 领先 +11.15),并以绝对优势超越专用的 SAM3 文本直接提示分割(+4.50 与 +5.54 gIoU),证明结构化分层推理在细粒度定位上的必要性。
- 反思机制在训练期充当强正则化器,最终被参数充分内化:作者监测训练过程发现,训练早期反思步骤修改极其频繁且能带来显著的净 IoU 正向提升;但随着训练推进,初始预测质量大幅提升,两阶段输出逐渐收敛,反思步骤演化为低频的“双重核查”。即使在测试推理阶段剥离反思步骤直接采用单轮提示,模型依然能保有 75.40 gIoU 的高分(仅微跌 0.16),说明自审视能力已被有效内化在权重中。
- 整物与通用泛化能力不受损:在通用整物指称理解基准 RefCOCO/RefCOCO+/RefCOCOg 上,本文 4B 模型取得了 86.5% 的 [email protected],与未微调的基座(89.7%)和 7B 基线(88.7%)相比衰减极小;在复杂多步推理分割 ReasonSeg 上更是达到 69.6 gIoU,超越了 GenSeg-R1-4B(68.4)与 VisionReasoner-7B(63.6)。
亮点与洞察¶
- 将部件定位转化为层级化图元规划问题:巧妙避开了高昂的像素级部件标注微调,仅使用几何边界框和内接点图元作为语义与像素之间的中介,使轻量 MLLM 能充分调用冻结 SAM 的像素分割潜力。
- 引入外部 baseline 锚点的防刷分强化学习机制:在提升奖励公式中设计了与 SAM3 预计算分数的对齐约束,完美化解了强化学习在“自反思/自修正”任务中必然面临的“故意输出劣质初版以博取高额改进分”的博弈漏洞。
- 视觉主动裁剪回灌让反思落到实处:打破了过去仅在语言空间进行反思的局限,让模型对自身生成的候选框进行图像裁剪重编码,实现了端到端“看-想-截-再审”的闭环。
局限与展望¶
- 反思机制在训练后期的退化问题:由于初版生成质量随着训练越来越高,模型在训练后期绝大多数样本均判定
ADJUSTMENT: NO,反思网络退化为被动的检验者,未能持续挖掘更极限的亚像素边界修正能力。 - 同类多目标场景下的部件归属歧义:当前的部件包含奖励只要部件落在“任意”一个有效父物体边界框内即视为合法。当画面中密集出现多个同类别实体(如成群的奶牛)时,若模型将 A 牛的头部误分配在 B 牛的身体框内,奖励仍可能错误发放。
- 推理延时与计算开销:两阶段推理外加裁剪编码带来了平均 1 秒左右的时间开销,未来可探索将反思回路仅作为推理时按需激活(test-time adaptive compute)的动态机制。
相关工作与启发¶
- vs Seg-Zero / VisionReasoner: 同属于“MLLM 生成提示 + 冻结 SAM 解码”的解耦路线,但先驱工作将所有查询当成平面实体单步处理,缺乏部件与物体的层级约束;本文引入父子物体两阶段收敛与部件专有奖励,精准填补了部件分割空白。
- vs LISA / Sa2VA / PixelLM: 这类显式特殊标记(special-token)模型需要在 LLM 内部微调掩码生成头,显存占用大且易发生泛化漂移;本文完全解耦,使 MLLM 专注于高层拓扑推理,可无缝插拔升级更强大的下游分割器。
- vs SAM3 (Text Prompt): SAM3 依赖单向文本-图像密集对齐,在面对“某某的某某部件”等带层级依赖的长尾复杂短语时缺乏深层视觉语义推理;本文通过多模态 CoT 为 SAM 提供聚焦的物理级空间引导,形成了明显的互补优势。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ 提出首个面向部件级定位的对象-部件分层反思架构,主动视觉回灌与防作弊奖励设计极具巧思。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖域内与跨数据集零样本评估,系统覆盖了消融分析、解耦替换测试及泛化迁移测试。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑线索极为清晰,问题动机剖析深入,公式与架构图规范详实。
- 价值: ⭐⭐⭐⭐⭐ 为具身智能精细操作与 MLLM 可验证强化学习对齐提供了极具实用价值的范式参考。