Learning Active Perception for Pixel-Space Reasoning via Visual-Intent Stratified GRPO¶
会议: ECCV 2026
论文: ECCV 原文
领域: VLM推理 / 多模态VLM
关键词: 像素空间推理 (Pixel-Space Reasoning)、主动感知 (Active Perception)、强化学习 (RL)、视觉意图分层 (Visual-Intent Stratification)、视觉懒惰 (Visual Laziness)
一句话总结¶
针对视觉语言模型在像素空间推理中采用 GRPO 训练导致奖励归一化失衡、诱发“视觉懒惰”并抑制多步缩放的问题,本文提出视觉意图分层 GRPO(VIS-GRPO),通过沿缩放深度与基于空间重叠度的视觉意图(探索 vs 验证)对采样轨迹联合分层,将优势计算严格限定在同质策略层内,显著释放了多步主动感知能力,在 HR-Bench 8K 与 MME-RealWorld 上分别获得 8.7% 与 7.6% 的大幅提升。
研究背景与动机¶
视觉语言模型(VLM)通过基于强化学习(RL)的后训练在复杂视觉问答与图文推理任务中取得了长足进步。然而,主流框架几乎都将多模态推理建模为以固定输入图像为前置条件的纯文本自回归生成,视觉表征在推理初始即被冻结。这种“一眼定乾坤(single-look)”的被动感知范式在面对高分辨率、信息密集的复杂图像时暴露出根本性瓶颈:受限于输入分辨率与编码压缩,微小文字、局部关键符号或细粒度物体的关键视觉证据容易被模糊甚至抹除,导致模型仅凭低分辨率全局信息产生严重的事实幻觉。
为了突破这一局限,像素空间推理(Pixel-Space Reasoning)成为当前视觉推理领域备受瞩目的新方向。该范式允许 VLM 在生成文本思维链的同时,自主发起针对原始图像局部区域的显式放大(zoom-in)动作,将截取的高分辨率局部观测动态追加进上下文,形成“观察-放大-再推理”的主动感知闭环。然而,当业界普遍采用组相对策略优化(GRPO)训练像素空间推理模型时,普遍出现了意想不到的“视觉懒惰(Visual Laziness)”退化:模型在训练过程中调用放大动作的频率单调下滑,逐渐收敛为拒绝放大的被动回答状态;即便采样出多步放大的轨迹,其最终准确率也显著低于无放大或单次放大的简单轨迹。
这一退化的深层根源在于 GRPO 的组相对优势归一化与像素空间推理高度异质的策略空间之间存在结构性冲突。在同一输入提示下采样的多条轨迹,在「缩放深度」(高分辨率证据收集预算)与「视觉意图」(广域广角探索 explore 还是局部细节复核 verify)上具有本质差异。基座模型在预训练阶段已经熟练掌握了无缩放或单次缩放的文字推导,因而初始成功率与即时奖励相对较高;相反,多步放大作为后训练阶段新探索出的复杂行为,要求模型连续精准定位目标区域并长程整合局部证据,训练初期极易因单步选框偏倚而失败。标准 GRPO 将这些异质策略混在同一个采样组中计算均值和方差,直接给探索性的多步放大轨迹分配系统性的负优势,使其在尚未充分学习前就被概率衰减机制掐灭,形成拒绝放大的恶性死循环。核心 idea:提出视觉意图分层 GRPO(VIS-GRPO),沿「缩放深度」与基于空间相干性的「视觉意图」对轨迹进行联合同质分层,仅在策略可比的层级内部计算优势归一化,从算法机制上杜绝视觉懒惰,公平释放多步主动感知能力的学习潜力。
方法详解¶
整体框架¶
在像素空间推理中,输入为多模态图文对 \(\mathbf{x} = [V, L]\)。VLM 策略 \(\pi_\theta\) 生成的轨迹 \(\tau\) 交替包含文本推理 token 与归一化裁剪框动作 \(b_t \in [0, 1]^4\)。每当模型发出放大指令,图像裁剪算子 \(f\) 提取局部高分辨率图像 \(o_t = f(V, b_t)\) 并追加至上下文,供后续步骤继续感知推理。
VIS-GRPO 作为一个即插即用的策略优化算法,其输入是针对提示 \(\mathbf{x}\) 采样的 \(k\) 条候选轨迹及其最终奖励 \(\{R_i\}_{i=1}^k\)。算法首先依据每条轨迹的放大总次数进行深度分组,然后对多次放大的轨迹根据放缩框的重叠度判定其视觉意图是探索还是验证;最后在划分出的同质策略层级内独立计算均值与方差并归一化优势,用于更新策略网络。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["图文输入 x = [V, L]<br/>采样 k 条推理轨迹"] --> B["缩放深度分层<br/>按放大次数 c(τ) 隔离证据预算"]
B -->|c = 0| C1["零缩放同质层 (c=0)"]
B -->|c = 1| C2["单缩放同质层 (c=1)"]
B -->|c ≥ 2| D["视觉意图划分<br/>计算平均两两 IoU"]
D -->|平均 IoU < β| E1["广域探索层 (explore)<br/>分散多区域线索搜寻"]
D -->|平均 IoU ≥ β| E2["局部验证层 (verify)<br/>高重叠区域细节核对"]
C1 --> F["层内优势归一化<br/>独立计算层内均值与方差"]
C2 --> F
E1 --> F
E2 --> F
F --> G["策略参数更新<br/>PPO 裁剪目标优化"]
关键设计¶
1. 缩放深度分层:隔离证据预算引发的基准偏倚 标准 GRPO 混合归一化的首要缺陷在于忽略了轨迹证据预算的物理差异。执行 \(0\) 次、 \(1\) 次与 \(\ge 2\) 次放大的轨迹消耗的视觉计算与可利用的外部高清像素信息截然不同。在训练初期,模型对于基座模型已具备的零缩放或一次缩放具有极高的熟练度,容易依赖文本先验在简单样本上取得偶然正确;而多步缩放需要连续多次准确预测坐标框,初始成功率天然低于简单策略。如果将它们直接混同求取全局均值 \(\bar{R}\),多步缩放轨迹的收益必定经常低于该均值而获得负优势。为了纠正这一偏差,VIS-GRPO 第一步根据轨迹内的放大操作次数 \(c(\tau_i)\) 对采样组进行划分,确保无缩放、单次缩放与多次缩放轨迹互不干扰,阻止低缩放策略的早熟红利抑制多步探索。
2. 视觉意图空间相干性划分:解耦广域探索与局部验证 仅控制缩放深度依然不足以保证策略同质性。在多步缩放(\(c(\tau) \ge 2\))的情形下,模型的感知行为存在两种截然不同的功能意图:一种是广域探索(explore),模型在全图多个互不相交的候选区域连续扫描,以排查可能的目标线索;另一种是局部验证(verify),模型在已经定位的可疑区域或其邻域反复调焦放大,以辨识微小文字或模糊特征。这两种行为的难易程度和失败模式完全不同:verify 依赖极其精准的高重叠局部空间聚焦,在早期比大范围粗粒度探索更易失误。若在同深度内混同归一化,verify 策略容易被探索策略的相对高分淘汰,导致模型失去局部细致校验能力。VIS-GRPO 引入轻量级空间相干性统计量,计算缩放候选框序列 \(\{b_1, \dots, b_{c(\tau)}\}\) 的平均两两交并比(mean pairwise IoU):
以预设阈值 \(\beta\) 为决策边界,当 \(\overline{\mathrm{IoU}}(\tau) \ge \beta\) 时打上 verify 标签,反之标记为 explore。每条轨迹由此映射至唯一的策略层元组 \(s(\tau) = (c(\tau), m(\tau))\)。
3. 层内优势归一化与策略优化:构建公平的学习信号 在明确策略层划分后,对于输入 \(\mathbf{x}\) 与特定层 \(s\),定义属于该层的采样轨迹索引集为 \(\mathcal{I}_{\mathbf{x}, s} = \{i \mid s(\tau_i) = s\}\)。VIS-GRPO 将原本基于全组 \(k\) 条轨迹的标量均值和方差替换为层内统计量:
进而求得层内归一化优势值:
该机制的核心价值在于重塑了学习动力学:多步探索轨迹只与同一批次中同样采取多步探索的同伴比拼选框精准度,哪怕整体胜率在初期偏低,表现出色的多步探索行为也能稳稳拿到正向优势,被梯度更新所鼓励和放大。
损失函数 / 训练策略¶
训练采用带 KL 散度惩罚的 PPO 剪切代理目标。基座模型选用 Qwen3-VL-8B。训练数据集汇聚了来自 Pixel Reasoner SFT 数据、InfographicVQA、LLaVA-CoT 以及 STARQA 的共计 15,000 个图文推理样本。奖励函数采用严格的精准匹配(Exact Match, EM)二值奖励,无需人为设计复杂的放大惩罚或启发式步数奖励,完全依赖层内优势分配算法自发学习出最优的主动感知策略。
实验关键数据¶
主实验¶
评估在四大高分辨率、复杂细粒度视觉推理评测集上展开:V* Bench(多目标细粒度视觉搜索)、HR-Bench 4K 与 HR-Bench 8K(极高分辨率细节问答)、以及 MME-RealWorld。评测指标统一为百分比准确率(Accuracy, %)。下表展示了全系列多模态基线与像素空间推理方法的横向对比(数据源自原论文 Table 1)。
| 模型类别 | 模型 | 参数量 | V* Bench | HR-Bench 4K | HR-Bench 8K | MME-RealWorld | 平均准确率 |
|---|---|---|---|---|---|---|---|
| 通用 VLM | GPT-4o | — | 62.8 | 59.0 | 55.5 | 46.4 | 55.9 |
| 通用 VLM | LLaVA-OneVision | 7B | 75.4 | 63.0 | 59.8 | 48.5 | 61.7 |
| 通用 VLM | Qwen2.5-VL-7B | 7B | 73.3 | 67.3 | 64.1 | 44.6 | 62.3 |
| 通用 VLM | Qwen2.5-VL-72B | 72B | 69.1 | 67.6 | 68.0 | — | — |
| 通用 VLM | Qwen3-VL-8B (基座) | 8B | 86.4 | 77.8 | 72.9 | 48.7 | 71.5 |
| 像素空间推理 | Pixel Reasoner | 7B | 84.3 | 72.6 | 66.1 | — | — |
| 像素空间推理 | DeepEyes | 7B | 82.7 | 74.3 | 68.8 | 51.9 | 69.4 |
| 本文方法 | VIS-GRPO (Ours) | 8B | 88.5 | 81.9 | 81.6 | 56.3 | 77.1 |
消融实验¶
为剥离算法本身的贡献并排除基座模型差异,原论文在保持 Qwen3-VL-8B 基座和 15,000 训练样本严格一致的前提下,对比了不同强化学习算法的性能表现(数据源自原论文 Table 2)。
| 训练算法配置 | V* Bench | HR-Bench 4K | HR-Bench 8K | MME-RealWorld | 平均得分 | 说明 |
|---|---|---|---|---|---|---|
| Qwen3-VL-8B (未微调基座) | 86.4 | 77.8 | 72.9 | 48.7 | 71.5 | 原始多模态基座 |
| + 标准 GRPO | 87.4 | 79.0 | 77.6 | 52.7 | 74.2 | 遭遇视觉懒惰,多步缩放受抑 |
| + Pixel Reasoner (启发奖励) | 83.8 | 80.6 | 79.0 | 54.2 | 74.4 | 人为加放大奖励,策略易生硬 |
| + Depth-Stratified GRPO | 84.8 | 79.1 | 79.4 | 55.7 | 74.8 | 仅单轴分层(仅按缩放次数) |
| + VIS-GRPO (完整模型) | 88.5 | 81.9 | 81.6 | 56.3 | 77.1 | 深度 + 意图双轴联合分层 |
关键发现¶
- 双轴分层的必要性验证:仅按缩放深度单轴分层(Depth-Stratified GRPO)平均分达 74.8,相较于标准 GRPO(74.2)有一定提升,但明显不及 VIS-GRPO 的 77.1。在 MME-RealWorld 上的意图诊断显示,Depth-Stratified GRPO 中 explore 与 verify 的比例严重失衡至约 9:1,verify 准确率仅为 28.0%;而引入空间相干性意图分层后,两者的比例改善为更合理的 7:3,且两类意图的推理准确率同步提升。
- 高分辨率极致提点:图像分辨率越高、细节越微弱,VIS-GRPO 的主动感知优势越明显。在 8K 超高分辨率的 HR-Bench 8K 上,VIS-GRPO 比基座模型提升了 8.7 个百分点(81.6% vs 72.9%),比标准 GRPO 高出 4.0 个百分点;在真实世界复杂场景评测 MME-RealWorld 上提升了 7.6 个百分点(56.3% vs 48.7%)。
- 训练动力学健康反转:在缩放调用次数的变化曲线上,标准 GRPO 的单条轨迹平均缩放次数随训练步数快速下滑;Pixel Reasoner 依靠人为设计的奖励强行维持在约 1 次;而 VIS-GRPO 的放大操作数随训练持续稳步攀升并稳定在高位,证明模型真正掌握了主动探索与验证的自主意愿。
亮点与洞察¶
- 找准问题病根而非堆叠启发式技巧:以往工作发现模型不爱放大,往往通过硬性添加“放大奖励项”来强迫模型放大,极易导致策略为了吃奖励而胡乱选框;本文深刻指出这本质上是 GRPO 组内归一化的结构性缺陷,通过纯算法层面的同质分层解决问题,设计极为优雅。
- 以无监督几何统计量表达高层视觉意图:仅用候选缩放框之间的平均两两 IoU(mean pairwise IoU),就能极其敏锐地切分出“广域拉网式线索搜索”与“局部聚焦细粒度复验”两种高级认知动作,无需依赖任何额外分类器或昂贵的 LLM 意图标注。
- 可复用到多轮交互智能体的泛化范式:任何包含异质探索深度和不同动作模式的多轮智能体强化学习任务(如网页浏览、代码多轮测试搜索、多工具调用),只要不同 rollout 的计算开销与动作性质存在异质性,都可以借鉴此类“意图与步长分层优势归一化”机制。
局限与展望¶
- 单批次内分层样本稀疏性挑战:当采样组大小 \(k\) 较小,或某些极端层级(如放大次数过多、极度稀有的 verify 行为)采样出现极少甚至唯一样本时,层内方差估计可能出现偏差,需要更健壮的小样本平滑或跨组累积策略。
- 二值化意图划分的粗糙度:当前利用两两 IoU 与单一固定阈值 \(\beta\) 将连续的注意力空间硬性切分为 explore 和 verify 两种状态,对于探索与验证交织的复杂多轮动作序列(如先大范围找 2 处,再针对其中 1 处反复深潜)尚缺乏更细粒度的动态切片建模。
- 未来方向:探索与层次化强化学习(Hierarchical RL)的结合,由上层元策略显式决策当前的认知意图(搜索、验证、反思),底层则在分层策略空间内完成具体像素选框的高保真优化。
相关工作与启发¶
- vs 标准 GRPO (DeepSeekMath): 标准 GRPO 假设组内所有 sampled rollouts 具有战略可比性,在纯文本数学推导中尚能成立;但在像素空间多轮探索中,不同深度与意图的混同会系统性扼杀高难度新动作。VIS-GRPO 保留了 GRPO 免去 Critic 网络的简洁性,同时填补了对异质动作策略的适应能力。
- vs Pixel Reasoner: Pixel Reasoner 依靠好奇心驱动的稠密奖励或人工制定的 zoom 奖励来强行拉动放大操作,但难以保障多步缩放的决策质量;VIS-GRPO 保持稀疏的环境胜负反馈(EM),仅靠更合理的优势归一化结构,让模型自主自发学会何时、何处进行多步探索与验证。
- vs Search Agent 中的步长分层方法: 文本搜索智能体工作曾提出依据搜索 query 次数进行分层;VIS-GRPO 证明在视觉空间中不仅需要划分操作深度(步长),必须进一步解耦几何空间层面的认知意图(探索 vs 验证),为具身多模态智能体提供了重要方法借鉴。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ [敏锐发现并理论剖析了 GRPO 在像素推理中的视觉懒惰现象,提出了两轴同质分层新思路]
- 实验充分度: ⭐⭐⭐⭐⭐ [四大基准全面评测,控制变量消融扎实,提供了意图分布和缩放动力学的多维度深入分析]
- 写作质量: ⭐⭐⭐⭐⭐ [动机叙述逻辑缜密,数学形式清晰,实验图表信息密实且富有说服力]
- 价值: ⭐⭐⭐⭐⭐ [为多模态模型向主动感知、测试时计算(TTC)与像素空间推理的演进提供了极具实践意义的即插即用算法工具]