Vero: Open Reinforcement Learning Recipes for Visual Reasoning¶
会议: ECCV 2026
论文: ECCV 原文
领域: 多模态VLM / LLM推理 / 强化学习
关键词: 视觉推理, 强化学习, 视觉语言模型, GSPO, 任务路由奖励
一句话总结¶
针对顶尖视觉语言模型强化学习数据与奖励机制闭源的痛点,Vero 提出了首个覆盖六大视觉推理维度的全开源单阶段 RL 方案,构建了含 60 万样本的 Vero-600K 数据集与任务路由奖励,无需多阶段蒸馏即可在 30 项评测基准上全面超越现有开源模型。
研究背景与动机¶
大语言模型和视觉语言模型(VLM)在图表分析、科学推理、空间感知与具身规划等复杂任务中展现出巨大潜力。以 GPT-5、Qwen3-VL 和 Kimi K2.5 为代表的前沿多模态系统表明,强化学习(RL,如 PPO 与 GRPO)是激发多模态思维链(CoT)推理、大幅提升模型能力的核心驱动力。然而,当前性能领先的视觉推理模型大多出自专有封闭的 RL 管线,其训练数据、过滤机制与奖励函数细节均未公开,技术报告亦鲜有详实消融,导致学界难以复现、系统性分析或在此基础上进一步拓展。
与闭源模型形成鲜明对比的是,现有开源视觉 RL 尝试(如 OpenMMReasoner、VL-Rethinker)普遍将关注点局限在视觉数学与几何等单一狭窄领域。多任务强化学习在视觉语言模型上面临严重的负迁移与优化失衡挑战:不同任务的答题格式异构、解题路径差异极大,在单一领域上通过 RL 获得的增益往往无法泛化至其他视觉能力,甚至会导致开放式对话或定位能力的急剧退化(例如在数学推理上强化后,指令遵循与图像描述得分骤降 15 到 35 分)。这引发了一个根本性问题:构建通用的视觉推理智能体,究竟需要怎样的全开源 RL 配方?
本文的研究表明,无需复杂的多阶段预热或特定教师模型的蒸馏微调,一套覆盖全面、采样均衡的高质量数据集配合细粒度任务路由奖励函数,便足以在单阶段强化学习下训练出泛化能力极强的视觉推理模型。核心 idea:构建跨越六大核心维度的 600K 视觉多任务训练集 Vero-600K,采用类别均匀混合策略消除跨任务负迁移,并配合 10 种任务路由精度奖励与 GSPO 算法,实现全开源单阶段多模态强化学习。
方法详解¶
整体框架¶
Vero 的目标是通过单阶段在线强化学习,使视觉语言策略模型 \(\pi_\theta\) 在多样化的视觉输入 \(v\) 和自然语言问题 \(q\) 下生成带有显式思维链的结构化响应 \(y = (z, a)\)(其中 \(z\) 为思考过程,a 为最终答案),并根据异构真实标签 \(y^*\) 最大化预期奖励。整体管线主要包含四大阶段:候选数据源初筛与人工质检、大模型辅助的多维度问答过滤、六大类别均匀加权的数据混合,以及基于 GSPO 和任务路由奖励的端到端强化学习优化。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["250+ 候选多模态数据集<br/>图表/科学/空间/知识/定位/描述"] --> B["多阶段数据筛选与过滤<br/>启发式初筛 + 质量清洗"]
B --> C["Vero-600K 均衡任务混合<br/>六大任务类别各 100K 样本"]
C --> D["任务路由奖励验证系统<br/>二元匹配 + 阶梯分值 + 规则 + 裁判"]
D --> E["GSPO 策略优化训练<br/>序列级概率比率 + 格式约束 + 长度惩罚"]
关键设计¶
1. 多阶段数据筛选与过滤:消除跨任务噪声与歧义
针对从 250 多个公开候选数据集中收集的杂乱样本,Vero 实施了两层过滤流水线。首先是数据集级别的启发式与人工筛选:剔除规模小于 1K 样本、平均分辨率低于 20 万像素(保留 5 个低分辨率高质量子集),以及二选一的二值是非题,防止模型通过随机猜测欺骗奖励机制;随后对每个候选集抽样 50 条做人工质检,严格要求图像-问题-答案三元组标注错误率低于 5%、问题指向明确且答案形式便于程序化验证,最终从约 100 个初筛数据集中选定 59 个高质量数据集。在此基础上,引入两步样本级过滤:使用 Qwen3-VL-235B 按照相关性、非歧义性、英文表达、可视内容可验证性以及数值精度 5 项严苛标准剔除有瑕疵的问题;再通过 Qwen3-235B 对真实答案做格式规范化,从而彻底消除了导致强化学习策略退化或不稳定的脏数据。
2. Vero-600K 均衡任务混合:打破领域壁垒与负迁移
针对单一领域 RL 训练会导致非目标任务灾难性遗忘的严重痛点,Vero 建立了包含六大能力维度的系统性分类体系:图表与 OCR(9 个数据集)、STEM 科学数学(13 个数据集)、空间与动作(8 个数据集)、常识知识与识别(12 个数据集)、定位计数与检索(11 个数据集),以及图像描述与指令遵循(6 个数据集)。实验表明,若依照任务准确率逆序、推理长度或图像分辨率来调整数据采样比例,往往顾此失彼;而对六大领域采取严格均等的采样比例(每个类别各配比 100K 样本,总计 600K 样本),能够在全任务基准上取得最高且最稳健的平均收益(相较基线平均提升 +5.8 分),彻底解决了由于单一视觉模式主导策略更新而产生的跨任务负迁移问题。
3. 任务路由奖励验证系统:精准评定异构输出质量
由于六大类别的答案形态极其多样,单一的数学符号校验库(如 math-verify)无法兼容图表文本、目标坐标或开放式指令。Vero 设计了包含 10 种验证器的任务路由机制,将总奖励表示为准确率奖励、格式奖励与超长惩罚的加权组合:
$\(R(y, y^*) = (1 - \alpha) R_{\text{acc}}(y, y^*) + \alpha R_{\text{fmt}}(y) + R_{\text{overlong}}(y)\)$
其中 \(\alpha = 0.2\)。准确率奖励 \(R_{\text{acc}}\) 根据问题类型自动路由:对简答文本、多项选择、数学数值和列表做二元判定;对图块重排采用置换顺序计分;对 Web 动作匹配 JSON 字段重合率;对目标定位采用匈牙利算法匹配预测框与真值框,并在 IoU 阈值 0.5 下计算 F1 连续得分;对点击类任务检测点是否落入真值框;对指令遵循依据规则库统计约束满足率;对开放式描述则采用基于 OLMo3 提示词的 LLM-as-judge 打分并惩罚自言自语的元评论。格式奖励 \(R_{\text{fmt}}\) 强制模型输出 <think>...</think><answer>...</answer> 结构并在符号题中使用单个 \boxed{...}。
4. GSPO 策略优化训练:抑制熵坍塌并平滑更新
在强化学习算法选择上,GRPO 中基于独立 Token 概率比率的重要性采样在长文本 CoT 推理中容易产生方差累积,甚至引发策略熵骤降与局部最优坍塌。Vero 引入群体序列策略优化(GSPO),利用序列维度的平均对数概率差异 \(\bar{\Delta}_i = \frac{1}{|y_i|} \sum_{t=1}^{|y_i|} (\log \pi_\theta(y_{i,t}) - \log \pi_{\theta_{\text{old}}}(y_{i,t}))\) 构造 Token 级的重要性比率 \(s_{i,t}(\theta) = \exp(\text{sg}(\bar{\Delta}_i) + \log \pi_\theta(y_{i,t}) - \text{sg}(\log \pi_\theta(y_{i,t})))\)。通过非对称截断(\(\epsilon_{\text{high}} > \epsilon_{\text{low}}\))并彻底移除显式 KL 惩罚,配合在上下文边界附近平滑生效的线性超长衰减惩罚 \(R_{\text{overlong}}(y)\),模型在整个训练周期内保持了健康的策略熵(\(0.58 \pm 0.11\)),大幅提升了长程视觉推理探索的稳定性。
损失函数 / 训练策略¶
GSPO 的目标优化函数定义为对一个批次中 \(G\) 个候选回答的加权截断重要性采样期望: $\(J(\theta) = \frac{1}{G} \sum_{i=1}^G \frac{1}{|y_i|} \sum_{t=1}^{|y_i|} \min \left( s_{i,t}(\theta) A_i, \, \text{clip}(s_{i,t}(\theta), 1-\epsilon_{\text{low}}, 1+\epsilon_{\text{high}}) A_i \right)\)$ 其中 \(A_i = (r_i - \mu_g) / (\sigma_g + \epsilon)\) 是整个回答序列共享的组内标准化优势值。当回答长度进入接近最大长度 \(L_{\max}\) 的缓冲带 \([L_{\max} - B, L_{\max}]\) 时(\(B=2048, \lambda=1.0\)),软截断惩罚项 \(R_{\text{overlong}}(y) = \min(-\frac{|y| - (L_{\max} - B)}{B}\lambda, 0)\) 开始线性抑制冗长输出,保证训练高效推进。
实验关键数据¶
主实验¶
评估在包含 30 个基准数据集的 VeroEval 上进行,涵盖图表、科学、空间、常识、定位搜索和指令遵循六大维度。各初始模型在接入 Vero 训练方案后的 Avg@5 表现对比如下:
| 模型 | 类型 | Chart & OCR | STEM | Spatial & Action | Knowl. & Recog. | Ground. & Search | Cap. & IF | 总评 (30基准) |
|---|---|---|---|---|---|---|---|---|
| Qwen2.5-VL-7B-Instruct | 开源基线 | 57.6 | 41.0 | 55.1 | 49.5 | 51.1 | 64.8 | 52.9 |
| OpenMMReasoner-7B | 开源 RL (874k蒸馏) | 61.1 | 52.0 | 56.3 | 49.4 | 46.0 | 47.8 | 52.2 |
| Vero-Qwen25-7B | 本文 (无蒸馏) | 61.2 | 46.4 | 59.5 | 52.8 | 57.1 | 72.1 | 57.8 (+4.9) |
| Qwen3-VL-8B-Instruct | 开源基线 | 61.2 | 57.3 | 62.6 | 52.3 | 58.5 | 78.2 | 60.7 |
| Qwen3-VL-8B-Thinking | 开源思维基线 | 67.3 | 64.5 | 63.7 | 54.3 | 53.3 | 81.4 | 62.3 |
| OneThinker-8B | 开源 RL (340k蒸馏) | 61.5 | 57.0 | 60.3 | 50.1 | 47.3 | 65.1 | 55.7 |
| Vero-Qwen3I-8B | 本文 (无蒸馏) | 69.5 | 64.0 | 67.2 | 53.8 | 63.4 | 83.5 | 66.1 (+5.4) |
| Vero-Qwen3T-8B | 本文 (无蒸馏) | 71.5 | 65.3 | 67.3 | 54.9 | 60.7 | 80.7 | 65.8 (+3.5) |
| Qwen3.5-9B | 开源基线 | 78.1 | 73.3 | 71.0 | 58.2 | 68.2 | 83.3 | 71.5 |
| Vero-Qwen35-9B | 本文 (无蒸馏) | 80.5 | 76.7 | 75.0 | 60.7 | 70.5 | 87.4 | 74.4 (+2.9) |
| Vero-Qwen35-9B-Base | 本文 (Base纯RL) | 79.2 | 73.6 | 72.4 | 60.7 | 69.1 | 87.8 | 73.0 (+12.9) |
消融实验¶
在 Qwen2.5-VL-7B-Instruct 架构上,针对训练范式、奖励函数设计与强化学习优化算法进行了系统消融(各项数值为全基准平均分):
| 消融维度 | 具体配置 | 总均分 | 策略熵 | 关键结论与说明 |
|---|---|---|---|---|
| 训练范式 | Base 基线 | 52.4 | - | 原始指令微调模型基准性能 |
| 训练范式 | FineVision SFT | 46.2 | - | 大规模 SFT 数据微调出现过拟合,性能显著下跌 |
| 训练范式 | Vero SFT | 52.8 | - | 使用本文数据做有监督微调仅获微弱提升 (+0.4) |
| 训练范式 | Vero RL (GSPO) | 57.2 | 0.58 | 在线强化学习带来全面性能飞跃 (+4.8) |
| 奖励设计 | 单一 Math-Verify | 51.8 | - | 无法适配非数学格式,开放式描述与指令遵循骤降至 34.3 |
| 奖励设计 | 本文任务路由奖励 | 57.2 | - | 10 种细分奖励路由保证多任务格式全覆盖 |
| 优化算法 | DAPO | 54.3 | 0.22 | 探索熵急剧下降,易陷入局部模式塌缩 |
| 优化算法 | GRPO | 54.3 | 0.50 | Token 级别重要性比率方差较大,收敛次优 |
| 优化算法 | GSPO | 54.7 | 0.58 | 序列级均值重要性权重带来更平滑的梯度与最高策略熵 |
关键发现¶
- 数据多样性彻底消除负迁移:单任务 RL 极易破坏其他能力(如仅用 STEM 训练会导致指令遵循指标下跌 21.2 分;非定位任务训练会导致 Grounding 指标普遍下跌 3 到 4 分)。而采用六大类别等比混合训练后,所有任务类别无一例外取得正向增益。
- 纯 Base 模型直升前列:直接在未经任何对齐或思维链微调的 Qwen3.5-9B-Base 上应用 Vero RL,模型均分从 60.1 暴涨 12.9 分达到 73.0,性能仅次于基于 Instruct 初始化的 Vero-Qwen35-9B(74.4),证明高质量多任务 RL 具备直接激发推理能力的完整潜力。
- 不同任务激活差异化认知模式:分析推理链行为发现,空间任务生成的推理长度最长(均值 1983 词),强调“感知先于推理”的时序构建;STEM 任务显著增加了回溯思考(Backtracking,从 0.27 升至 0.48);而定位与检索任务则主动抑制无意义的自省反思(自我意识从 0.73 降至 0.49),转向直接的视觉线索搜寻。
亮点与洞察¶
- 多任务均匀混合胜过复杂重加权:直觉上按任务难度或推理长度动态加权看似合理,但实验证明简单直观的六领域等比例(各 100K)采样综合泛化性能最优,为多模态 RL 数据工程提供了极其干净的实践基准。
- 开源 RL 全面击败大参数教师蒸馏:Vero-Qwen25-7B 在完全摒弃教师模型蒸馏的前提下,以 57.8 分完胜使用了 87.4 万教师思维链样本进行预热的 OpenMMReasoner-7B(52.2),打破了多模态推理必须依赖封闭强模型蒸馏冷启动的刻板印象。
- 任务路由奖励解决了异构验证瓶颈:构建视觉通用模型的最大瓶颈在于奖励信号的形式差异。将二元判别、IoU 连续重叠率与大模型裁判结合的分流路由器,是支撑大规模多任务 RL 稳定收敛的基础构件。
局限与展望¶
- 计算成本与开放式评估开销:在图像描述和指令遵循等开放式任务中引入 LLM-as-judge,在数万轮 Rollout 的大规模强化学习训练中会带来较高的推理延迟与显存开销。
- 极小目标与极精细定位仍存局限:在遥感航空视觉定位(如 AerialVG)等超高分辨率、小目标密集场景下,模型得分仍有较大上升空间,需探索高分辨率多级补丁编码与自适应缩放机制。
- 未来方向:探索结合轻量化判别器奖励替代大模型裁判,并将 Vero 方案拓展至长视频连续因果时序推理与具身交互决策控制。
相关工作与启发¶
- vs OpenMMReasoner / VL-Rethinker: 后者聚焦于视觉数学或窄域感知,且高度依赖额外教师模型的 CoT 蒸馏冷启动;Vero 证明多领域广泛混合与任务路由奖励即可直接通过在线 RL 取得显著更优的泛化能力。
- vs Qwen3-VL-8B-Thinking / MiMo-VL-7B-RL: 工业界前沿模型依赖闭源训练集与未公开配方;Vero 在相同基座下取得了持平甚至超越的评测结果,并全量开源数据、代码与检查点。
评分¶
- 新颖性: ⭐⭐⭐⭐ [构建了首个涵盖六大能力维度的视觉推理全开源多任务 RL 配方]
- 实验充分度: ⭐⭐⭐⭐⭐ [覆盖 6 种基座模型、30 项 VeroEval 基准及多维度消融]
- 写作质量: ⭐⭐⭐⭐⭐ [逻辑严谨、叙述清晰,认知行为学分析极具启发性]
- 价值: ⭐⭐⭐⭐⭐ [为开源多模态社区提供了极其宝贵且可复现的完整强化学习技术方案]