Bridging Visual Representation and Reinforcement Learning from Verifiable Rewards in Large Vision-Language Models¶
会议: ECCV 2026
论文: ECCV 官方
代码: https://github.com/kawhiiiileo/KAWHI
领域: 多模态VLM
关键词: 多模态大模型、强化学习(RLVR)、视觉表征对齐、信用分配、图表与几何推理
一句话总结¶
针对大视觉语言模型在可验证奖励强化学习中因稠密视觉编码与稀疏几何图表信息失配导致的视觉感知瓶颈,本文提出即插即用的奖励重加权机制 KAWHI,通过结构引导并查集提取几何关键区、筛选视觉关键注意力头进行非对称 Q-K 空间对齐并在段落级重分配信用,在显著提升多模态数理与图表推理表现的同时仅引入 3.6% 的轻微训练开销。
研究背景与动机¶
以可验证奖励强化学习(RLVR)为代表的在线策略优化范式(如 GRPO、GSPO),在单模态大语言模型的逻辑推导与抽象数学任务中取得了引人注目的突破。这一成功促使学术界迅速将其推广至多模态认知领域,试图通过自博弈强化学习激发大视觉语言模型(LVLM)在复杂图表解读、几何定理推导等任务中的长链思维(CoT)推理潜力。然而,现有方法往往直接沿用纯文本策略优化的统一奖励机制,将整条推理链条平铺直叙地赋予相同的序列级奖励;同时,视觉编码器默认采用均匀稠密的网格切片(dense tokenization),假设均质的视觉 token 能天然提供完备的环境信息。这种设计完全忽视了真实数理几何与专业图表场景的内在结构特性——视觉信息往往高度稀疏且存在极端的前背景失衡,关键的语义线索几乎全部浓缩在极其纤细的线段、符号标记、坐标轴和曲线拐点中,大面积的空白背景并不承载有效信息。
这种稠密视觉编码与稀疏空间信息之间的结构性失配,导致强化学习策略更新在反向传播时将宝贵的多模态注意力与梯度信号过度耗散在无关背景区域,难以准确定位并锚定决定推导走向的关键视觉证据。作者在 Qwen2.5-VL-7B-Instruct 上的实证归因诊断明确证实了这一痛点:在 MathVerse 基准上的错误案例中,视觉感知错误(Visual Perception Error, VP)占比高达 48.9%,是导致后续规则运用(RAE, 11.0%)与数值计算(CE, 17.3%)产生雪崩式链式崩溃的首要根源。现有尝试通过细粒度奖励建模缓解此问题的工作,要么如 VPPO 般依赖间接的统计散度掩码、缺乏对空间几何语义的显式具象表征,要么如 AT-RL 般强行提取跨模态注意力权重矩阵,从而与 FlashAttention 等现代高效算子发生底层显存架构冲突,无法支持大规模分布式工业训练。
本文的切入视角在于:既然数理图表的信息集中于局部几何结构,且模型内部深层注意力头对视觉特征的敏感度存在显著分化,那么完全可以通过无缝外挂的几何分析与解耦的前向隐状态恢复,构建出一条轻量而高保真的视觉引导通道。核心 idea:提出名为 KAWHI 的非侵入式奖励重加权机制,利用结构引导并查集(SGUF)自适应聚合几何关键区域,基于 MME 消融筛选出的视觉关键注意力头计算生成 Query 与视觉 Key 的非对称空间对齐得分,并以语义连贯的双换行段落为粒度进行自适应信用重分配,在完全兼容 FlashAttention 的前提下实现视觉空间证据与关键推理步骤的紧密耦合。
方法详解¶
整体框架¶
KAWHI(Key-Region Aligned Weighted Harmonic Incentive)是一个即插即用的视觉感知奖励重加权模块,能无缝嵌入到基于均匀奖励的策略优化算法(如 GRPO、GSPO、DAPO)中。整个流程包含三个核心阶段:首先在图像输入侧利用结构引导并查集(SGUF)自适应识别具有显著几何特征的局部笔画与符号关键区域,抑制冗余背景;随后在模型推理解码后,通过最后一层隐状态提取响应 token 的 Query 向量与视觉关键区域的 Key 向量,利用预先筛选的视觉关键注意力头计算非对称空间对齐得分;最后以段落为单位进行空间显著性均值池化与温度平滑归一化,得到段落级调节权重,直接调制优势函数(Advantage),从而强化驱动关键推理步骤的梯度更新。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入多模态数据<br/>图表/几何图像与推理指令"] --> B["结构引导并查集自适应区域筛选 SGUF<br/>CIELab 结构张量分解与双阈值聚类"]
B --> C["视觉关键头筛选与 Q-K 空间对齐<br/>全局消融定位关键头 + 探测 Query 与语义 Key 匹配"]
C --> D["语义保持的段落级信用分配与优势调制<br/>双换行分割 + 温度平滑加权 + 优势函数缩放"]
D --> E["策略优化梯度更新<br/>适配 GRPO / GSPO / DAPO 目标"]
关键设计¶
1. 结构引导并查集自适应区域筛选 SGUF:基于几何结构张量与并查集的空间先验解耦
数理几何与专业图表等结构化视觉输入具有极强的空间稀疏性与前景/背景失衡特征,密集的网格划分让大量无信息的空白背景 token 稀释了优化信号。SGUF 旨在提供显式的几何空间先验,自适应剔除冗余背景并保留高信息密度的线条与符号。具体而言,算法首先将输入图像 \(I\) 转换至 CIELab 感知均匀色彩空间并提取亮度通道 \(L \in [0, 100]\),经高斯平滑后利用 Sobel 算子计算梯度场 \(\nabla L = (\partial_x L, \partial_y L)^\top\)。对于每个图像 patch \(\mathcal{P}_{i,j}\),构建其二阶归一化结构张量:
对其进行特征值分解 \(\mathbf{S}_{i,j} = R^\top \Lambda R\) 得到 \(\lambda_{\max} \ge \lambda_{\min} \ge 0\)。当 \(\lambda_{\max} \gg \lambda_{\min}\) 时表征具有强各向异性的笔画边缘,而 \(\lambda_{\max} \approx \lambda_{\min} \approx 0\) 则对应平坦背景,且特征值天然具有旋转与光照不变性。随后,算法将 patch 网格建模为四连通图,采用双阈值并查集规则进行几何区域连通分量合并:当两节点满足结构归一化距离小于阈值 \(\delta_s\) 且亮度绝对差小于 \(\delta_l\) 时,即合并至连通分量 \(\mathcal{C}_k\)。通过计算连通分量内结构张量的平均迹 \(E(\mathcal{C}_k) = \frac{1}{|\mathcal{C}_k|} \sum_{\mathcal{P} \in \mathcal{C}_k} (\lambda_{\max} + \lambda_{\min})\) 衡量结构显著性,并以中位数自适应设定切分阈值 \(\tau = \beta \cdot \text{median}(\{E(\mathcal{C}_k)\})\),最终在保留所有关键区域 token 的同时对背景 token 进行比例为 \(1 - r_{\text{skip}}\) 的稀疏采样,极大压缩了背景冗余。
2. 视觉关键头筛选与 Q-K 空间对齐:任务引导的非对称跨模态语义锚定
模型内部的注意力头在跨模态推理中表现出极强的异质性,许多注意力头主要专注于纯文本句法或上下文维持,若在所有头上无差别计算视觉相似度会引入严重的高频语言噪声。此外,若直接提取完整的交叉注意力权重图,会导致与 FlashAttention 算子的底层并行冲突。为此,KAWHI 将自注意力中的 Query(Q)重新定义为信息探测器(反映文本生成对视觉信息的需求),将 Key(K)定义为语义标识符(表征视觉 token 的语义实体),并在 MME 基准上执行跨层全局注意力头消融:在所有解码层中屏蔽相同索引的头,若导致 MME 总分下降超过 100 分,则将该头纳入视觉关键头子集 \(\mathcal{H}_{\text{critical}}\)。
在强化学习采样完成后,无需修改底层的注意力内核,仅需基于最后一层解码器的隐状态进行单次前向传递恢复对应的 Query 和 Key 状态。针对分组查询注意力(GQA),将 Key 头复制 \(g\) 次与 Query 头维度对齐。对于生成响应中的每个 token \(t \in \mathcal{R}\) 与 SGUF 选出的关键视觉 token \(v \in \mathcal{S}\),计算它们在 \(\ell_2\) 归一化后的余弦相似度:
通过在关键视觉 token 集合 \(\mathcal{S}\) 与关键头子集 \(\mathcal{H}_{\text{critical}}\) 上取双重平均,得到 token \(t\) 的空间注意力得分:
该得分 \(\alpha_t \in [-1, 1]\) 精确刻画了当前词元生成在视觉关键区域上的语义聚焦程度。
3. 语义保持的段落级信用分配与优势调制:维持 CoT 推理结构完整性的奖励重加权
若将空间关注度直接施加在 token 级或句子级,由于单字或短句容易割裂思维链的完整逻辑步骤,会导致奖励分配在孤立词汇碎片上频繁震荡,从而破坏长程推导的连贯性。KAWHI 创新地采用以双换行符(\n\n)为天然边界的段落级粗粒度分割,将响应划分为 \(M\) 个段落 \(\{P_j\}_{j=1}^M\)。每个段落保持自成一体的完整推理推导步骤。首先在段落内部对 token 空间得分进行均值池化 \(\bar{\alpha}_j = \frac{1}{|S_j|} \sum_{t \in S_j} \alpha_t\);随后引入带温度参数 \(\tau\) 的 softmax 归一化与均匀平滑系数 \(\lambda\),将段落分数映射为稳定权重 \(w_j \in [w_{\min}, w_{\max}]\):
最后,利用该段落权重去乘性调制基于组间标准化的优势函数值。对于组内第 \(g\) 条轨迹中的 token \(t \in P_j\),调制后的最终优势值为:
该机制使包含关键视觉证据提取与核心几何定理套用的段落获得显著放大的优势权重,而公式模板或套话性过渡段落则被适度抑制,在维持长文本推导连贯性的同时实现了精准的视觉信用分配。
一个完整示例:Geo3K 几何证明中的动态权重分配¶
在 Geo3K 几何证明任务中,求解圆中弦 \(\overline{BE} \cong \overline{ED}\) 且已知圆弧度数 \(m\widehat{ED} = 120^\circ\) 时的圆弧 \(m\widehat{BE}\),模型的 CoT 解题链条经双换行分割为 6 个段落: - para1(引入段落):“To solve for \(m\widehat{BE}\), we need to understand the relationship between the arcs...” 属于泛化起手式,与图表具体区域关联微弱,KAWHI 赋予其较低的基准权重。 - para2(条件注入):“Given: \(\overline{BE} \cong \overline{ED}\), \(m\widehat{ED} = 120^\circ\)” 明确提取了图中的特定弦与角度数值,Query 向量与几何图关键区高频共振,得分显著攀升。 - para3(关键规则应用):“Since \(\overline{BE} \cong \overline{ED}\), the arcs are congruent. This means \(m\widehat{BE} = m\widehat{ED}\)” 进行了决定性的几何定理套用,直接建立视觉弦与弧的对应关系,KAWHI 为其分配最高阶权重。 - para4(冗余发散):“We know that the total measure of the circle is \(360^\circ\)...” 虽陈述事实但属于解题旁支,与该题直接求解无直接视觉依据关联,被自适应降权。 - para5 & para6(公式结论与输出框):“\(m\widehat{BE} = 120^\circ\)” 与 “\(\boxed{120}\)”,属于标准答案包装,获得平滑后的中等基准权重。
该案例直观表明,KAWHI 并非无差别提升整个成功轨迹的权重,而是精准挑选出承载关键视觉证据注入与定理判定的决定性核心步骤施加梯度放大。
损失函数 / 训练策略¶
KAWHI 适配基于组相对采样的策略优化框架(以 GRPO 为例)。对于输入提示词 \(x = (I, q)\),旧策略 \(\pi_{\theta_{\text{old}}}\) 采样 \(G\) 个候选回答 \(\{y_g\}_{g=1}^G\),可验证判定器给出序列级奖励 \(R_g \in \{0, 1\}\)。经组内均值 \(\mu\) 与标准差 \(\sigma\) 归一化得到基础标量优势 \(A_g\)。结合 KAWHI 提供的段落调制系数 \(w_j\),调制后的优势函数 \(\hat{A}_{g,t} = A_{g,t} \cdot w_j\) 代入截断代理损失函数中:
其中重要性采样比率为 \(r_{g,t}(\theta) = \frac{\pi_\theta(y_{g,t} \mid x, y_{g,<t})}{\pi_{\theta_{\text{old}}}(y_{g,t} \mid x, y_{g,<t})}\)。全流程无需任何中间有监督微调(SFT),在 8 块 NVIDIA H200 GPU 上采用 VERL 框架完成分布式强化学习训练。数学推理训练集采用 Geo3K,图表理解采用从 ChartQA 中抽取的 20K 样本。单步训练时间仅从基线的 521.0s 微增至 540.6s,仅带来 3.6% 的时间开销。
实验关键数据¶
主实验¶
在 Qwen2.5-VL-7B-Instruct 与 Qwen3-VL-4B-Instruct 上,将 KAWHI 挂载至 GRPO、DAPO 和 GSPO 三种主流均匀奖励优化算法上,并在四个主流多模态数学推理基准上全面评测。主实验对比结果如下表所示:
| 模型与方法 | MathVista | MathVerse | MathVision | WeMath | 平均分 (Avg) | 相对基线提升 |
|---|---|---|---|---|---|---|
| Qwen2.5-VL-7B-Instruct | ||||||
| Base | 67.47 | 45.56 | 23.36 | 54.32 | 47.68 | - |
| 细粒度奖励基线 | ||||||
| Step-GRPO | 66.87 | 44.32 | 24.76 | 55.32 | 47.82 | +0.14 |
| FT-RL | 67.68 | 46.88 | 26.12 | 56.78 | 49.37 | +1.69 |
| VPPO | 68.42 | 47.21 | 28.42 | 57.12 | 50.29 | +2.61 |
| 均匀奖励基线与本文方法 | ||||||
| GRPO | 68.37 | 45.94 | 28.29 | 58.10 | 50.18 | +2.50 |
| GRPO + KAWHI (Ours) | 69.30 | 47.56 | 29.28 | 57.84 | 51.00 | +3.32 (+0.82 vs GRPO) |
| DAPO | 69.20 | 47.75 | 28.21 | 57.98 | 50.79 | +3.11 |
| DAPO + KAWHI (Ours) | 69.08 | 48.20 | 31.91 | 58.21 | 51.85 | +4.17 (+1.06 vs DAPO) |
| GSPO | 69.42 | 49.87 | 27.30 | 59.02 | 51.40 | +3.72 |
| GSPO + KAWHI (Ours) | 69.37 | 50.10 | 32.57 | 59.71 | 52.94 | +5.26 (+1.54 vs GSPO) |
| Qwen3-VL-4B-Instruct | ||||||
| Base | 70.43 | 40.86 | 21.38 | 69.43 | 50.53 | - |
| GRPO | 71.07 | 41.12 | 22.16 | 70.31 | 51.17 | +0.64 |
| GRPO + KAWHI (Ours) | 71.80 | 42.10 | 23.03 | 70.98 | 51.98 | +1.45 (+0.81 vs GRPO) |
| DAPO | 69.40 | 40.48 | 27.63 | 69.67 | 51.80 | +1.27 |
| DAPO + KAWHI (Ours) | 71.21 | 41.36 | 28.43 | 71.23 | 53.06 | +2.53 (+1.26 vs DAPO) |
| GSPO | 70.50 | 41.62 | 32.89 | 71.55 | 54.14 | +3.61 |
| GSPO + KAWHI (Ours) | 72.10 | 46.82 | 31.09 | 72.15 | 55.54 | +5.01 (+1.40 vs GSPO) |
在图表理解任务上(以 Qwen2.5-VL-7B-Instruct 为底座,在 20K ChartQA 数据集上强化学习),KAWHI 在 5 个主流图表基准上均取得稳定增益:ChartXivDesc 提升 2.1%、ChartXivRea 提升 2.1%、ChartQA 提升 0.8%、ChartQA-Pro 提升 1.6%、ChartMimic 提升 2.3%。
消融实验¶
在 Qwen2.5-VL-7B-Instruct 模型上以 GRPO 为基线,针对五个核心设计模块在 MathVerse 和 MathVision 上进行详细消融研究:
| 消融维度 | 具体配置 | MathVerse (%) | MathVision (%) | 平均准确率 (%) | 相比本文完整版变化 |
|---|---|---|---|---|---|
| 基线与完整版 | GRPO 基线 | 45.94 | 28.29 | 37.11 | -1.31 |
| - | GRPO + KAWHI (完整版) | 47.56 | 29.28 | 38.42 | - |
| ① 区域选择策略 | 保留全部视觉 Token (All vision) | 46.58 | 28.45 | 37.52 | -0.90 |
| 随机采样 Token (Random) | 46.34 | 28.98 | 37.66 | -0.76 | |
| 反向区域选择 (Inverse selection) | 45.74 | 27.82 | 36.78 | -1.64 | |
| ② 奖励相似度形式 | Key–Key 对称匹配 | 47.08 | 28.95 | 38.02 | -0.40 |
| ③ 响应切分粒度 | 句子级切分 (Sentence-level) | 47.11 | 26.64 | 36.88 | -1.54 |
| Token 级切分 (Token-level) | 46.21 | 26.64 | 36.42 | -2.00 | |
| ④ 视觉关键头选择 | 去除关键头筛选 (全头平均) | 46.57 | 28.32 | 37.45 | -0.97 |
| ⑤ 位置编码机制 | 在 RoPE 位置编码前计算相似度 | 47.08 | 28.62 | 37.85 | -0.57 |
关键发现¶
- 结构化区域选择是关键:反向选择(Inverse selection)甚至跑输了原生 GRPO(平均分 36.78% vs 37.11%),证明关注无关背景确实会给策略更新注入有害噪声;保留全部 token 虽然保留了完整信息,但冗余稀释了关键梯度,平均分下降 0.90%。
- 粗粒度语义完整性决定强化学习稳定性:响应切分粒度实验显示,Token 级细粒度切分在 MathVision 上大幅暴跌 2.64%,证明细粒度分割会严重割裂思维链的上下文语义逻辑;段落级粗粒度汇聚不仅更鲁棒,而且贴合 CoT 的逐步推演本质。
- 任务引导的非对称对齐优于对称匹配:Key-Key 对称匹配比 Query-Key 非对称匹配平均低 0.40%,证明文本生成作为 Query 主动探测视觉语义更符合因果推导规律。
- 跨模块兼容与极高性价比:将 SGUF 替换为纯注意力驱动的 VisionZip 算法(保留 50% token),在三项数学基准上的平均降幅仅在 0.13%~0.30% 之间,证实 KAWHI 的重加权机制具有优异的模块泛化性。此外,训练全流程完全兼容 FlashAttention,训练耗时增幅仅 3.6%。
亮点与洞察¶
- 将经典几何张量分析引入强化学习奖励建模:巧妙地利用 CIELab 空间的梯度外积结构张量与并查集聚类,不依赖任何神经网络预先提取出无光照与旋转偏置的高精度几何骨架,为强化学习提供了鲁棒且零计算参数的空间先验。
- 解耦 FlashAttention 与跨模态对齐的工程智慧:放弃在训练 forward/backward 期间强行拦截跨模态注意力权重的重侵入做法,而是利用解码隐状态进行解耦的轻量单次前向恢复 Q 和 K,兼顾了算法理论完备性与工业级硬件加速算子的兼容性。
- 可复用的段落级奖励重分配范式:不仅限于视觉多模态,段落级(以
\n\n为界)结合温度平滑归一化的信用分配范式,对其他复杂逻辑推导、长文本多轮交互等长链 CoT 任务的步骤级强化学习均有极高的借鉴价值。
局限与展望¶
- 作者承认的局限:视觉关键注意力头的判定依赖于在 MME 基准上的先验全局离线消融,这一筛选过程是静态固定的,尚无法根据不同下游任务输入在推理时动态自适应调整活跃头子集。
- 潜在的研究局限:SGUF 算法在结构化图表、线框图和几何问题上展现出极佳的几何拓扑提取能力,但对于自然图像(如高纹理背景、富色彩的通用目标)的显著性分割先验可能不如专用视觉分割模型精细。
- 后续改进方向:探索动态在线注意力头稀疏门控机制,使视觉关键头的选择与当前样本动态绑定;将 SGUF 与现代端到端可微的可变形视觉采样器相结合,实现几何先验提取与视觉编码器的联合端到端微调。
相关工作与启发¶
- vs VPPO: VPPO 依赖于基于散度的 token 丢弃与间接统计掩码来估计视觉感知收益,缺乏显式的空间几何结构先验;KAWHI 显式利用结构张量建模几何拓扑,并在空间对齐上更具物理几何可解释性。
- vs AT-RL: AT-RL 必须显式提取完整的文本到图像跨模态注意力矩阵,这与训练阶段广泛使用的 FlashAttention 底层显存优化算子产生严重冲突;KAWHI 仅需在解码隐状态上单次解耦前向计算 Q-K 余弦相似度,完美兼容 FlashAttention 且训练额外时间开销仅 3.6%。
- vs Step-GRPO / FT-RL: 此类方法主要在纯文本维度或高熵少数 token 上进行细粒度信用微调,未显式耦合多模态空间证据;KAWHI 弥补了 RLVR 在大视觉语言模型中的模态失配,真正实现了视觉感知证据与语言逻辑推导的协同增强。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ 首次系统诊断出 LVLM 在 RLVR 下的视觉感知主要瓶颈,创造性地融合经典几何结构张量与多模态 Q-K 段落级重加权。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 Qwen2.5/Qwen3 两代多尺度模型、3 种主流 RLVR 优化算法、4 项数学与 5 项图表基准,消融实验严谨完备。
- 写作质量: ⭐⭐⭐⭐⭐ 诊断分析深刻有力,理论推导脉络清晰,图表可视化直观详实。
- 价值: ⭐⭐⭐⭐⭐ 即插即用、完全兼容 FlashAttention、增益显著且开销极低(3.6%),对推动多模态强化学习落地极具实用价值。