跳转至

Wan-R1: Verifiable-Reinforcement Learning for Generalizable Video Reasoning

会议: ECCV 2026
论文: ECCV 原文
PDF: EventHosts
领域: 多模态VLM
关键词: 视频推理 / 强化学习 / Flow-GRPO / 可验证奖励 / 具身导航

一句话总结

Wan-R1 将 Flow-GRPO 引入流匹配(Flow Matching)视频生成架构,通过提出基于客观真值轨迹的多组件可验证奖励与嵌入级参考锚定奖励,彻底规避了多模态奖励模型的作弊问题,在复杂 3D 迷宫与具身路径规划中大幅提升了分布外视频推理的泛化性能。

研究背景与动机

近年来以 Sora、Veo 以及 Wan 为代表的先进视频生成模型展现出极高保真度的动态视觉建模能力,这推动了一种全新的「以视觉生成进行推理」(Reasoning via Visual Generation)范式。不同于大语言模型通过文本离散 Token 展开思维链(CoT),视频生成模型能够以时序连续的视频帧天然表征三维空间几何、物体物理动态交互与因果演化,在视觉路径规划、迷宫求解与机器人无地图导航等长程时空推理任务中展现出巨大潜力。

然而,现有视频推理模型主要依赖在专家演示视频上进行监督微调(SFT)。这种模式存在严重的分布外(OOD)泛化脆弱性:模型极易死记硬背训练集中的特定几何纹理与网格坐标捷径,而非真正掌握可迁移的空间拓扑与路径搜索算法。当测试场景从简单规则网格扩展至未见过的复杂 3D 迷宫、不规则曲线通道或视觉材质突变时,SFT 模型的精确匹配率发生断崖式下跌。强化学习(RL)理论上可通过策略空间的主动试错探索打破这种表面模式记忆,但在视频生成中实施 RL 面临严峻的奖励设计瓶颈:传统的视觉语言模型(VLM)作为奖励评估器时极易发生奖励作弊(Reward Hacking)——生成器只要生成具有流畅视觉运镜或看似朝目标移动的虚假画面即可骗取 VLM 的高分,而底层逻辑根本未到达终点;而单纯依赖任务是否最终完成的稀疏二元奖励在超高维连续的视频潜空间中又因梯度匮乏而无法收敛。

面对这一两难困境,本文的核心切入点在于:必须放弃不透明的黑盒评估器,将强化学习信号直接锚定在可严格客观量化的几何真值与物理约束之上。核心 idea:将 Flow-GRPO 适配至流匹配图像到视频模型,构建解耦「精确匹配、连续前缀精度与迷宫结构保真度」的多组件可验证轨迹奖励,并针对无离散真值的具身导航设计嵌入级参考锚定奖励,实现稳定高效且防作弊的视频空间长程推理。

方法详解

整体框架

Wan-R1 针对视觉轨迹推理(Visual Trace Reasoning, VTR)与具身导航任务展开设计。给定任务文本提示词 \(c\) 与初始观测图像 \(I_0\),模型需要自回归或全序列生成包含智能体向目标移动的连贯视频序列 \(V = \{f_1, f_2, \dots, f_N\}\)。整个流水线将扩散流匹配的随机化求解器与群组相对优势估计相结合,在生成端通过降噪步数精简加速采样,在奖励端通过目标追踪器抽取出具身运动坐标,与真值几何路径比对计算显式奖励,最终驱动策略梯度反向传播。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    In["输入条件<br/>首帧观测 I0 + 任务提示 c"] --> SDE["Flow-SDE 随机采样与降噪步数精简<br/>ODE 转 SDE 注入噪声 | Strain=30 快速生成 G 个视频候选"]
    SDE --> Rollouts["候选视频集合 {V1, V2, ..., VG}"]
    Rollouts --> EvalBranch{任务类型分支}
    EvalBranch -->|网格/3D/规则迷宫| RewGame["多组件可验证轨迹奖励<br/>追踪提取连续轨迹 | 计算 REM + RPR + RMF"]
    EvalBranch -->|真实机器人具身导航| RewRobot["嵌入级参考锚定奖励<br/>冻结视觉编码器 | 计算 Rcos + Rtemp + Rend"]
    RewGame --> Adv["分组相对策略优化与 KL 约束<br/>群组奖励均值标准差归一化计算优势 | KL 散度锚定参考策略"]
    RewRobot --> Adv
    Adv --> Update["LoRA 策略梯度更新<br/>裁剪代理目标优化流匹配速度场网络"]

关键设计

1. Flow-SDE 随机采样与降噪步数精简:解决确定性生成无法探索与计算开销过大的双重瓶颈 流匹配(Flow Matching)模型在标准推理时依赖确定性常微分方程(ODE)求解: $\(d x_t = v_\theta(x_t, t) dt\)$ 该过程在初始噪声确定后轨迹唯一,无法提供强化学习所必需的多样化随机试错探索空间。为此,Wan-R1 借鉴 Flow-GRPO 将 ODE 转换为等价的随机微分方程(SDE): $\(d x_t = \left( v_\theta(x_t, t) - \frac{\sigma_t^2}{2} \nabla \log p_t(x_t) \right) dt + \sigma_t d w\)$ 在离散化更新中引入带有评分修正的速度项 \(\tilde{v}_\theta\) 与高斯噪声增量 \(\sigma_t \sqrt{\Delta t} \epsilon\),使得模型面对同一初始帧与文本提示可并发采样生成由 \(G\) 个各异解构成的视频候选组 \(\{V^i\}_{i=1}^G\)。针对视频多步去噪极其昂贵的计算瓶颈,本文引入训练时降噪步数精简机制:在在线 RL 探索阶段使用精简的 \(S_{\text{train}} = 30\) 步去噪收集 rollout,而在最终评估时保持完备的 \(S_{\text{infer}} = 50\) 步。实验证明适度步数削减不仅将训练吞吐提升数倍,其带来的轻微随机扰动还起到温和正则化效果,不仅未损伤生成质量,甚至微幅增强了探索多样性。

2. 结构化游戏多组件可验证轨迹奖励:兼顾探索密度、全路径闭环与防作弊结构保真 在结构化迷宫与解谜游戏(VR-Bench)中,使用端到端视觉语言模型打分必然招致严重的奖励作弊。Wan-R1 采用确定性目标追踪器在生成的视频中跟踪智能体边界框中心位置,提取出离散运动轨迹 \(\tau_{\text{pred}} = \{p_1, p_2, \dots, p_N\}\),进而对照广度优先搜索(BFS)确定的最优真实路径 \(\{v_{ij}\}_{j=1}^{n_i}\) 计算三项显式解耦的客观奖励: - 精确匹配奖励(Exact Match Reward, \(R_{\text{EM}}\)):判定生成轨迹是否一步不差地完整匹配最优路径,要求全序列每一步均为布尔真值,是衡量最终任务完全成功的强约束硬指标: $\(R_{\text{EM}} = \prod_{j=1}^{n_i} \mathbb{I}(\hat{v}_{ij} = v_{ij})\)$ - 连续前缀精度奖励(Precision Reward, \(R_{\text{PR}}\)):量化沿着最优路径连续保持正确步数的比例。纯二元 \(R_{\text{EM}}\) 极其稀疏,导致策略梯度在冷启动时几乎无法更新;\(R_{\text{PR}}\) 赋予沿着正确方向部分前进的轨迹平滑正向反馈,为长程探索构筑了平滑的连续奖励曲面。 - 迷宫结构保真度奖励(Maze Fidelity Reward, \(R_{\text{MF}}\)):防范视频模型在遭遇死胡同或障碍物时通过局部幻觉修改迷宫背景(例如直接让隔墙消失或融化)实施视觉作弊。该奖励在背景区域度量首帧 \(I_0\) 与后续采样帧 \(I_m\) 的重合像素静态稳定性,惩罚任何违背物理刚体结构的场景突变。

最终游戏总奖励采用加权组合: $\(R = \alpha R_{\text{EM}} + \beta R_{\text{PR}} + \gamma R_{\text{MF}}\)$ 实验默认设置 \(\alpha = 0.3, \beta = 0.5, \gamma = 0.2\),重在以高权重密集奖励 \(R_{\text{PR}}\) 指引探索梯度,辅以全局成功奖励与结构保真防作弊惩罚。

3. 机器人具身导航的嵌入级参考锚定奖励:跨越连续动作无离散序列真值的弱监督难题 在真实机器人具身导航(如 Target-Bench)中,监督信号通常来自遥操作录制的专家参考视频 \(V^* = \{f_1^*, \dots, f_{T^*}^*\}\),不存在离散网格坐标与唯一最优离散序列。Wan-R1 设计了一种免模型评判的嵌入级参考锚定奖励,通过冻结的高表征力视觉编码器 \(\phi\)(如 DINOv2 或 CLIP)将生成视频帧与参考帧映射到单位超球面上:\(e_t = \text{norm}(\phi(f_t))\)。针对生成视频与参考序列时长不一致的问题,先通过线性插值对齐至共同长度 \(T_c\),随后协同计算三个维度的几何量化指标: - 均值帧余弦相似度(\(R_{\text{cos}}\)):度量全程视野观察与参考路径的环境表征匹配程度: $\(R_{\text{cos}} = \frac{1}{T_c} \sum_{t=1}^{T_c} \langle e_t, e_t^* \rangle\)$ - 时序位移一致性(\(R_{\text{temp}}\)):基于嵌入空间累积位移向量的归一化比值,约束生成视频必须遵循单向逼近目标的正确时序流动,防止静止不动或反复徘徊骗取静态相似度。 - 终点到达保真度(\(R_{\text{end}}\)):针对起始帧与最终目标帧专门施加对称保真奖励,确保规划视频真正终结在语义目标邻近区域。

嵌入总奖励为加权和: $\(R_{\text{emb}} = \alpha_{\text{emb}} R_{\text{cos}} + \beta_{\text{emb}} R_{\text{temp}} + \gamma_{\text{emb}} R_{\text{end}}\)$ 取 \((\alpha_{\text{emb}}, \beta_{\text{emb}}, \gamma_{\text{emb}}) = (0.5, 0.2, 0.3)\),为无离散真值动作的物理世界规划提供稳健无偏的强化学习驱动。

4. 分组相对策略优化与 KL 约束:消除值函数网络并抑制退化探索 为了避免在庞大的扩散变换器网络之外额外训练复杂的价值评估网络(Critic),Wan-R1 采用群组相对优势估计。在每个训练步骤中,针对当前条件采样 \(G\) 个候选视频并计算对应奖励值 \(\{R(V^i, c)\}_{i=1}^G\),在群组内部进行零均值单位方差标准化: $\(\hat{A}^i = \frac{R(V^i, c) - \text{mean}\left(\{R(V^j, c)\}_{j=1}^G\right)}{\text{std}\left(\{R(V^j, c)\}_{j=1}^G\right)}\)$ 这种相对比较机制能天然滤除因测试用例难度差异引入的全局方差(某轨迹优秀仅因其优于同题候选,而非该迷宫天然简单)。同时在目标函数中施加针对参考策略 \(\pi_{\text{ref}}\) 的 KL 散度约束项 \(\beta_{\text{KL}}\)。消融实验证实,适度的 KL 约束(\(\beta_{\text{KL}} = 0.1\))能强力抑制生成策略在远离基础分布的退化路径上发散,大幅降低轨迹步骤冗余度。

实验关键数据

主实验

在 VR-Bench 基准上涵盖五类迷宫任务:基础规则网格迷宫(Base)、连续曲线不规则迷宫(Irreg)、带陷阱区域避障(Trap)、双眼深度感知 3D 迷宫(3D)以及推箱子解谜(Soko),全面对比闭源顶尖模型、开源视频基座与 SFT 微调模型。

方法分类 评测模型 规则迷宫 EM (↑) 不规则迷宫 EM (↑) 陷阱迷宫 EM (↑) 3D迷宫 EM (↑) 推箱子 EM (↑) 规则迷宫 SD (↓) 3D迷宫 SD (↓)
闭源前沿 Veo-3.1-pro 0.0 4.2 1.4 0.0 0.0 140.7 40.1
闭源前沿 Sora-2 1.4 5.6 0.0 0.0 4.2 302.9 92.4
闭源前沿 Kling-v1 0.0 0.0 0.0 0.0 0.0 162.3 84.4
闭源前沿 MiniMax-Hailuo-2.3 0.0 1.4 2.8 0.0 0.0 464.0 50.1
开源基座 Wan2.2-TI2V-5B 0.0 0.0 0.0 0.0 0.0 388.7 5.4
监督微调 Wan-SFT 33.3 56.9 38.9 65.3 4.2 10.3 3.9
本文方法 Wan-R1 (Ours) 61.1 47.9 90.3 94.4 30.6 5.2 1.9
相对增益 相比 Wan-SFT 绝对提升 +27.8 -9.0 +51.4 +29.1 +26.4 -5.1 -2.0

在真实机器人路径规划基准 Target-Bench 上,Wan-R1 在平均位移误差(ADE)、终点位移误差(FDE)与未到达率(MR)上相比原始基座减少了近一半,综合加权得分显著超越基线。

消融实验

在规则迷宫与 3D 迷宫任务上,系统考察策略散度约束强度 \(\beta_{\text{KL}}\) 与训练去噪步数 \(S_{\text{train}}\) 对路径生成质量与效率的定量影响:

实验组别 超参数设置 精确匹配 EM (%) 到达成功率 SR (%) 连续精度 PR (%) 步数冗余度 SD (↓) 说明
KL 约束消融 \(\beta_{\text{KL}} = 0\) 62.5 75.0 79.0 6.7 无约束时生成轨迹容易出现冗余迂回绕路
KL 约束消融 \(\beta_{\text{KL}} = 0.04\) 61.1 75.0 78.6 5.2 步长控制恢复至合理区间
KL 约束消融 \(\beta_{\text{KL}} = 0.1\) 66.7 75.0 81.5 3.7 强正则促使轨迹紧贴最优分布,冗余度降至最优
去噪步数精简 \(S_{\text{train}} = 5\) 59.7 70.8 77.5 4.0 采样步数过低削弱 rollout 图像与运动质量
去噪步数精简 \(S_{\text{train}} = 30\) 61.1 75.0 78.6 5.2 速度提升且保留与完备步数相当的学习效率
去噪步数精简 \(S_{\text{train}} = 50\) 62.5 73.6 79.7 2.9 全步数开销极大,综合性价比不及 30 步设置

关键发现

  • 复杂几何与规避类任务增益最为显著:在需要立体深度推理的 3D 迷宫中,Wan-R1 将精确匹配率从 65.3% 拔高至 94.4%;在含有高危禁区的陷阱迷宫(TrapField)中,SFT 容易产生鲁莽穿行,而 RL 探索使 EM 激增 51.4%(达到 90.3%),PR 达到近乎完美的 97.7%。
  • 不可替代的冷启动(Cold-Start)门槛:若脱离 SFT 阶段直接在原始未微调的 Wan2.2 基础模型上执行 Flow-GRPO,由于可验证奖励的逻辑严苛性,全零的随机探索无法捕获任何有效梯度,模型完全崩溃。SFT 作为引导策略进入可学奖励流形的梯子是绝对必需的。
  • VLM 奖励作弊现象确证:使用 Qwen2.5-VL 等通用多模态大模型作为打分器时,策略迅速学会生成「动作姿态自信、镜头平滑推移但撞击死胡同」的欺骗性样本,反证了可验证客观指标在视频推理训练中的根基地位。

亮点与洞察

  • 客观物理真值阻断奖励作弊:采用目标追踪抓取运动坐标对撞真值路径,直接破解了生成式视觉大模型被主观审美和伪装运动欺骗的顽疾,为视觉生成 RL 设立了可靠的评估范式。
  • Flow-SDE 随机化与离线步数压缩的工程闭环:巧妙平衡了连续时间流匹配的确定性 ODE 机制与强化学习必需的群组随机探索需求,同时通过 \(S_{\text{train}}=30\) 离线精简将高昂的视频生成训练时间缩短至可承受范畴。
  • 从离散棋盘到真实世界具身物理规划的泛化迁移:将可验证理念平滑外推为基于 DINOv2 嵌入的参考锚定指标,在无需显式离散动作建模的前提下,使生成式视频模型成功接管真实机器人的长程路径规划。

局限与展望

  • 严苛可验证真值的依赖边界:当前可验证机制高度依赖精准的目标追踪器或已对齐的单条专家参考视频,难以直接拓展到缺乏客观判定规则或开放式无参考任务中。
  • 单参考路径引发的假阴性惩罚:在 VR-Bench 迷宫中,真实解往往存在多条等长最短路径,当前仅比对单条 BFS 标定路径,导致模型探索出其它同样完美的替代解时可能被误判丢分。
  • 不规则连续曲线场景下的增益衰减:在无网格对齐的不规则迷宫中,过于刚性的离散轨迹匹配对平滑连续弧度敏感度不足,导致其在 Hard 级别表现略逊于全量拟合的 SFT 模型。

相关工作与启发

  • vs. Flow-GRPO (Liu et al., 2025):Flow-GRPO 率先探索了流匹配模型在文生图与风格对齐上的强化学习,但仅聚焦于基于美学质量和偏好打分的生成表现;Wan-R1 将其关键思想拓展至更高维的时空视频多步推理逻辑,并建立起严格的客观真值验证闭环。
  • vs. VR-Bench / SFT 范式 (Yang et al., 2025):VR-Bench 首创了基于迷宫的视频推理评测,但停留在常规 SFT 模仿学习层面,极易在材质突变与难度跨越时过拟合;Wan-R1 证明了在线强化学习是破除表面模式记忆、掌握真实拓扑决策能力的必由之路。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次在视频生成模型上建立起系统完整的可验证强化学习训练与防作弊奖励评估体系。
  • 实验充分度: ⭐⭐⭐⭐⭐ 覆盖五种迷宫类型、多级难度跨越、未见纹理迁移以及真实机器人 Target-Bench 实机基准。
  • 写作质量: ⭐⭐⭐⭐⭐ 概念清晰、动机严密,对 VLM 评判失效机理与步数压缩权衡的剖析鞭辟入里。
  • 价值: ⭐⭐⭐⭐⭐ 为推动视频生成大模型从「视觉幻象制造器」演变为「世界物理模拟与空间推理智能体」奠定了坚实技术基石。