Learning Consistency in Reward Modeling for Multi-Modal Reasoning¶
会议: ECCV 2026
论文: ECCV 原文
领域: 多模态 VLM / LLM 推理
关键词: 一致性奖励模型、多模态推理、强化学习、GRPO、软奖励
一句话总结¶
提出一致性奖励模型(CRM),将多模态推理的奖励判别解耦为基于思维链的候选回答与真实答案语义及数学等价性比对,生成抗奖励欺骗的连续软奖励并结合符号一致性拒绝采样,在大幅扩充 4 倍强化学习可用数据的同时显著超越基于规则的基线。
研究背景与动机¶
在大语言模型与多模态大模型迈向复杂多步推理的过程中,基于强化学习(RL)的后训练已成为激发模型推理能力的核心驱动力。然而,强化学习的优化上限与训练稳定性高度依附于奖励系统的保真度。传统基于人类偏好的奖励模型(Preference-based RM)通常依赖 Bradley-Terry 框架学习候选回答之间的二元偏好,但在高难度多模态推理中,该类判别式标量头不仅剥夺了模型进行逐步推理的能力,更难以仅凭隐空间表征精准判定冗长复杂答案的绝对正确性,极易诱发严重的奖励欺骗(Reward Hacking)。
为规避偏好模型的幻觉,学术界转向利用符号计算(如 SymPy、MathRuler)及沙箱环境的基于规则奖励系统(Rule-based RM)。尽管规则系统具备确定性的符号精确度,却难以处理自然语言与数学表达中的语义等价性(例如“one week”与“7 days”、不同形式的 LaTeX 表达式、小数近似与带单位数值),且对输出格式存在近乎严苛的限制。这种机械刚性导致大量合理推理输出被误判为负样本,不仅损伤策略学习,更迫使数据管线丢弃海量格式不规范的原始数据,极大限制了多模态强化学习的训练规模。
面对判别式偏好模型的“能力不足”与符号规则系统的“形式僵化”,本文的切入视角是重新定义奖励模型的任务边界:奖励模型无需具备独立解出难题的全部能力,而只需专注于裁决模型候选输出与标准答案之间的语义与数学等价性。核心 idea:构建基于生成式思维链的一致性奖励模型(CRM),在纯文本空间内比对候选答案与参考真值并推导连续软奖励,结合优势符号一致性拒绝采样消除 GRPO 优化振荡,实现多模态强化学习数据的 4 倍无损扩增与稳健尺度扩展。
方法详解¶
整体框架¶
CRM 的核心机制在于将绝对正确性判定转化为双向一致性比对:给定多模态问题 \(q\)、待测候选回答 \(s\) 以及参考答案 \(g^*\),奖励模型拟合映射函数 \(R(q, s, g^*) = f(q, s, g^*; \theta)\)。整个流水线包含数据构建、纯文本表示解耦、生成式思维链裁决以及强化学习中的连续软奖励与样本过滤。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["多模态与数学原始语料池<br/>Numina-Math 与 MathV360K 题目提取"] --> B["严格三裁判共识的 860K 一致性数据管线<br/>13款模型生成候选,GPT-4o与双路豆包共识标注"]
B -->|监督微调 3 Epochs| C["一致性奖励模型 CRM-7B"]
D["多模态任务输入<br/>题目 q、候选回答 s、参考真值 g*"] --> E["纯文本空间判决架构<br/>剥离图像特征,保留文本上下文与答案表达"]
E --> C
C --> F["生成式 CoT 一致性推理机制<br/>分析语义数学等价性并反思,输出一致性标记"]
F --> G["软硬双模态奖励与符号一致性拒绝采样<br/>计算概率差连续奖励,剔除优势与硬标签符号相悖样本"]
G --> H["下游多模态强化学习策略优化<br/>驱动 7B 至 72B VLM 稳健迭代"]
关键设计¶
1. 严格三裁判共识的 860K 一致性数据管线:消除大规模无偏监督缺失
现有裁判数据集往往缺乏针对复杂多步推理与跨模态问答格式多样性的细粒度监督。为了支撑一致性奖励模型的高可靠性学习,研究团队构建了涵盖 860K 精确校验样本的统一数据管线。在问题收集阶段,整合了纯文本数学数据集 Numina-Math(剔除合成数学与元数学子集)以及来自 MathV360K 的 340k 多模态题目;在候选回答生成阶段,聚合了涵盖 Qwen 全系列、Mistral-Large、GPT-4o、DeepSeek-V3、DeepSeek-R1-Distill 系列及 QvQ-70B-preview 共 13 款主流闭源与开源模型,覆盖从浅层推演到长思维链的多元错误分布;在标注阶段,首先由 GPT-4o 进行直接一致性研判,随后引入两路独立的 Doubao-1.5-vision-pro 模型施加详细 CoT 推理,最终仅保留三位裁判完全一致(All Agree)的样本,构建出正负样本严格 1:1 均衡的 860K 高质量训练语料。
2. 纯文本空间判决架构:解耦多模态复杂性并消除视觉特征干扰
针对多模态题目通常绑定高分辨率图像的特性,直觉上多模态奖励模型应同时接收图像与文本作为输入。然而实验证据表明,基于 Qwen-2.5-VL-7B 的多模态裁判在一致性验证集上的准确率(96.7%)显著逊于纯文本语言模型裁判(98.0%)。其根本原因在于:一致性裁决的本质是核验候选陈述是否在逻辑与数值层面契合参考答案,这一过程主要依赖深层符号简化、多语言对齐与上下文逻辑推演,而非直接的低阶像素特征匹配;直接引入视觉输入不仅容易引入视觉编码器的注意力幻觉,还会分散骨干语言模型对关键数学符号的处理带宽。因此,CRM 确立了纯文本解耦架构:剔除图像视觉 Token,仅将题干文本描述、上下文约束、待测输出与参考标准共同组织为文本输入,在降低计算延迟的同时最大化激活预训练语言模型的符号推演潜能。
3. 生成式 CoT 一致性推理机制:免除解题负担,聚焦等价性分析与反思
传统判别式奖励模型通过线性层直接映射标量,割裂了多步符号化简的思考路径。CRM 采用全生成式框架,将判决过程规范为由轻量级思维链引导的三步推导结构:
- 分析(Analysis):在题干语境下全面展开候选回答与参考真值的语义比对,利用代数定理、形式化约简及单位转换比对等价性;
- 反思(Reflection):逐项复核判定逻辑,验证是否遗漏多子问(Sub-questions)解答,检查过长输出是否发生语义漂移,确保推导结论不依赖“自身盲目重解原题”;
- 结论(Conclusion):在生成末端严格发射代表“一致”的 <|+|> 或代表“不一致”的 <|-|> 特殊判断标记。
通过将求解任务转化为对比任务,模型能够利用比原策略更轻量的参数量准确裁决极高难度的推理步骤,且生成的思维链使奖励输出具备天然的可解释性。
4. 软硬双模态奖励与符号一致性拒绝采样:平滑优化信号并纠正 GRPO 优势反转
依据生成端特殊标记的预测概率(通过词表 Logits 计算),CRM 同时支持离散硬奖励与连续软奖励计算: $\(r_{\text{hard}} = \begin{cases} 1, & P(\texttt{<|+|>}) > P(\texttt{<|-|>}) \\ 0, & \text{otherwise} \end{cases}\)$ $\(r_{\text{soft}} = P(\texttt{<|+|>}) - P(\texttt{<|-|>})\)$ 连续软奖励 \(r_{\text{soft}} \in [-1, 1]\) 能够细致衡量语义贴近程度与模型的置信度分布,避免二元判定抹杀中间推理质量的梯度差异。但在将连续奖励部署于组相对策略优化(GRPO)时,组内奖励标准化会引发潜在的优势符号反转矛盾:当某一组采样的所有候选回答均为正确(或全错误)时,受轻微置信度差异影响,组内归一化后部分正确答案的优势值 \(A(q,s)\) 会被迫变为负数,导致策略梯度反向惩罚正确推理。为此,设计了符号一致性拒绝采样准则: $\(\mathcal{D}_{\text{train}} = \left\{ (q, s) \;\middle|\; \operatorname{sign}(A(q, s)) = \operatorname{sign}(r_{\text{hard}}(q, s)) \right\}\)$ 在训练更新中果断丢弃优势符号与硬判决标签相背离的样本,确保策略更新的方向始终与一致性裁判的本意严格对齐。
损失函数 / 训练策略¶
奖励模型基于 Qwen2.5-Instruct 架构初始化(涵盖 1.5B 与 7B 版本),最大序列长度设定为 4096,使用最大全学习率 2e-5 的余弦退火学习率调度器进行 3 个 Epoch 的监督微调,推理服务采用 vLLM 与 PyTorch FSDP 框架加速。在下游 GRPO 强化学习中,策略模型采用 Qwen-2.5-VL 系列,单采样组规模设为 10(Rollout Batch Size 为 512),训练批次大小为 1280,恒定学习率设为 1e-6。通过将 CRM 推理与策略前向及参考对数几率计算深度重叠(Overlap),相比纯规则计算系统仅引入约 6% 的微小时间开销。
实验关键数据¶
主实验¶
在涵盖 MathVista、MathVerse、MathVision 以及 WeMath 四大多模态数学推理基准上,将搭载 CRM 的强化学习模型与各类闭源前沿模型、开源基座及同等条件下的基线奖励系统进行综合对比。
| 模型 | 参数量 | MathVista | MathVerse | MathVision | WeMath | 平均 (Avg.) |
|---|---|---|---|---|---|---|
| 闭源前沿模型 | ||||||
| GPT-5 | - | 81.9% | 81.2% | 72.0% | 71.1% | 76.6% |
| Gemini 2.5 Pro | - | 80.9% | 76.9% | 69.1% | 78.0% | 76.2% |
| GPT-4o | - | 63.8% | 50.2% | 30.4% | 68.8% | 53.3% |
| 开源 7B/8B 基准模型 | ||||||
| Qwen-3-VL-8B | 8B | 77.2% | 62.1% | 53.9% | 64.2% | 64.4% |
| Qwen-2.5-VL-7B | 7B | 68.2% | 47.9% | 25.4% | 62.1% | 50.9% |
| MM-Eureka-7B | 7B | 73.0% | 50.3% | 26.9% | 66.1% | 54.1% |
| 同条件 RL 策略对比 (Qwen-2.5-VL-7B) | ||||||
| Rule-RL-7B-Baseline (MathRuler) | 7B | 72.4% | 52.3% | 28.6% | 67.5% | 55.2% |
| xVerify-RL-7B | 7B | 74.2% | 53.5% | 29.3% | 67.8% | 56.2% |
| CompassVerifier-RL-7B | 7B | 74.4% | 54.8% | 29.2% | 68.6% | 56.8% |
| CRM-RL-7B (本文,硬奖励) | 7B | 74.3% | 56.0% | 29.8% | 69.6% | 57.4% |
| CRM-RL-7B (本文,软奖励) | 7B | 75.2% | 57.1% | 30.6% | 70.5% | 58.4% |
| 大尺度策略扩展 (Qwen-2.5-VL-72B) | ||||||
| Qwen-2.5-VL-72B (基座无 RL) | 72B | 74.8% | 57.6% | 38.1% | 72.4% | 60.7% |
| CRM-RL-72B (本文,软奖励) | 72B | 76.5% | 61.0% | 41.7% | 74.3% | 63.4% |
在公开裁判基准 VerifyBench-Hard 上的评估同样验证了 CRM 的判定精度优势:
| 模型 / 裁判系统 | 数值题 (Num) | 表达式 (Exp) | 选择题 (MC) | 字符串 (Str) | 平均准确率 (AVG) |
|---|---|---|---|---|---|
| Qwen3-8B | 68.65% | 78.41% | 73.02% | 66.52% | 70.90% |
| xVerify-8B-I | 69.05% | 76.14% | 93.49% | 81.74% | 83.10% |
| CompassVerifier-7B | 78.97% | 85.23% | 95.35% | 76.09% | 85.90% |
| CRM-7B (本文) | 79.37% | 84.09% | 96.74% | 84.35% | 88.40% |
消融实验与稳定性分析¶
消融实验系统探究了思维链推演(CoT)对硬/软奖励建模的赋能机制,以及不同奖励系统在多步长时间强化学习中的抗崩溃表现。
| 配置方案 | MathVista | MathVision | 平均表现 | 机制说明 |
|---|---|---|---|---|
| Rule-RL-7B-Baseline | 72.4% | 28.6% | 50.5% | 规则系统(MathRuler)硬性匹配 |
| CRM-RL-7B (硬奖励,带 CoT) | 74.3% | 29.8% | 52.1% | 离散符号判断,逻辑完备 |
| CRM-RL-7B (硬奖励,无 CoT) | 73.4% (-0.9%) | 28.9% (-0.9%) | 51.2% | 缺失逐步推导,边界误判增加 |
| CRM-RL-7B (软奖励,带 CoT) | 75.2% | 30.6% | 52.9% | 最佳方案,连续梯度提供丰富信号 |
| CRM-RL-7B (软奖励,无 CoT) | 73.1% (-2.1%) | 28.8% (-1.8%) | 51.0% | 极易出现置信度过度极化,损害训练 |
进一步在 MathVerse 评测多步训练的抗崩溃稳定性,对比各方法在迭代中的表现延续度:
| 奖励方法 | Step-200 | Step-600 | Step-900 | Step-1000 | Step-1200 | 训练结果评估 |
|---|---|---|---|---|---|---|
| Rule (MathRuler) | 52.1% | - | - | - | - | 200 步迅速崩溃中断 |
| xVerify | 52.3% | 53.0% | 53.3% | - | - | 900 步后无法维持提升 |
| CompassVerifier-7B | 52.1% | 53.6% | 54.1% | 54.5% | - | 1000 步后停滞或崩溃 |
| CRM (本文) | 52.3% | 53.7% | 54.8% | 55.4% | 55.7% | 持续稳健增益至 1200 步 |
关键发现¶
- CoT 是软奖励模型发挥威力的核心先决条件:在硬奖励设置下去掉 CoT 仅掉点约 0.9%,而在软奖励设置下去掉 CoT 则发生高达 2.1% 的大幅回退(75.2% 降至 73.1%)。误差分布分析表明,无 CoT 的模型在假阳性(FP)和假阴性(FN)样本上倾向于给出极端分数(FP 软奖励高达 0.75,FN 达 -0.63),而带 CoT 的模型能有效收敛误判区间的方差(FP 降至 0.24,FN 收敛至 -0.39),极大削弱了错误梯度对策略模型的误导。
- 破解规则系统的 4 倍数据瓶颈与崩溃陷阱:规则方法在训练早期看似能提供部分正确梯度,但由于无法消化 Llava-OneVision 中表达多样的 220K 原始多模态数学样本,在 200 步即发生训练崩溃;而 CRM 能够无损吸纳各类格式不规范的非标数据,且在针对 VLMEvalKit 的判定对决中斩获 77.8% 的高胜率,成功抵御了长时间 RL 过程中的奖励欺骗。
- 纯文本输入优于图像条件输入:无论在验证集准确度(98.0% vs 96.7%)还是符号泛化性上,解耦图像特征不仅未损失视觉推理评判力,反而让语言核心专注于代数化简与语义对齐,反向证实多模态推理的奖励判别具有显著的“降维比对”特征。
亮点与洞察¶
- 将“解题”降维为“比对”的任务重构:规避了直接训练昂贵 Outcome-RM 需要模型自身超越被测策略的认知悖论,巧妙借力参考标准,让轻量 7B 裁判即可严谨监督更庞大的多模态模型。
- 符号一致性拒绝采样策略:敏锐捕捉到了 GRPO 组归一化在密集软奖励下诱发的“优势正负与硬事实脱节”机理,以极小的代码代价保证了策略优化方向的保真度。
- 零样本泛化打通开放式任务与 OCR 边界:展现出卓越的迁移潜能,无需领域微调直接在 OCRBench 取得 86.9% 的评测表现,并通过清单提取召回率范式将非结构化创意写作与图表问答转化为可验证强化学习(CharXivDQ +3.4%,InfoVQA +2.6%)。
局限与展望¶
- 强依赖真实标注真值的存在:CRM 框架假定每道输入题目均具备绝对可信的标准答案(Ground Truth),对于完全无标注的无监督探索(Self-play / Pure Exploration)环境尚无法直接生效。
- 长文本截断机制可能损失末端证据:为控制推理吞吐对超长回答采取尾部截断(Tail Focus),若复杂证明的最终结论或关键反转位于极长文本的末端,可能引发边界误判。
- 未来方向:探索弱参考答案或多步过程监督(Process Consistency)下的中间步等价性推导,以及拓展至多视角三维具身控制指令的一致性验证中。
相关工作与启发¶
- vs 符号规则系统(MathRuler / SymPy):规则系统严格限制于预先定义的语法解析树,面对自然语言包装的等价表达与多子问极度脆弱且数据利用率低;CRM 兼具符号化简与深层语义泛化,可直接吞吐扩充 4 倍的原始数据并保持长步训练不崩溃。
- vs 偏好奖励模型(Bradley-Terry 标量模型):偏好模型采用回归标量头,剥夺了逐步推导与形式化验证机制;CRM 采用完全生成式架构与特殊标记 Logits 推导连续值,兼顾透明思维链与平滑梯度。
- vs 独立终局奖励模型(Outcome RM / xVerify):独立 ORM 必须从零理解图像并独立解出题目,对 7B 级小模型极易发生推理过载与幻觉;CRM 将问题转化为候选与真值的双向语义映射,以极高效率实现对 72B 策略模型的稳定监督。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 巧妙重塑了多模态强化学习奖励判别的范式边界,提出连续软奖励与符号一致性拒绝采样。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 860K 标注基准构建、验证集裁决、多步训练崩溃曲线、消融分析及跨任务零样本泛化。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑链条严丝合缝,对规则崩溃与软奖励方差机理的剖析极其透彻。
- 价值: ⭐⭐⭐⭐⭐ 彻底打破多模态数学 RL 对规则解析的严苛束缚,为构建下一代可靠多模态推理策略奠定工业级基础设施。