跳转至

PhysRVG: Physics-Aware Unified Reinforcement Learning for Video Generative Models

会议: ECCV2026
论文: ECCV 原文
项目: https://lucaria-academy.github.io/PhysRVG/
领域: 视频生成
关键词: 视频续写、刚体运动、物理可验证奖励、碰撞检测、强化学习

一句话总结

PhysRVG 用碰撞加权的真实轨迹偏差评价视频续写,并在强化学习探索失败时追加 Flow Matching 监督,使 PhysRVGBench 的 IoU 达到 0.64、轨迹偏移降至 15.03,但这些结果主要证明受限刚体场景中的轨迹拟合能力。

研究背景与动机

视频生成模型已经能合成清晰、平滑的画面,却经常在物体相撞、反弹或摆动时产生错误轨迹。视觉上连续不等于动力学正确:一个球沿直线穿过另一个球,可能仍然具有很高的时序平滑度。增加物理视频训练数据可以改善外观与运动统计,使用模拟器提供完整轨迹也能约束输出,但前者缺少针对运动错误的精确信号,后者依赖额外的运动规划和控制输入。

强化学习提供了另一条路线,不过奖励必须能区分“看起来像”与“确实沿正确轨迹运动”。VLM 或人类整体评分难以定位细小的碰撞时刻;直接使用轨迹偏差,又可能让模型偏好容易生成的直线运动。与此同时,困难场景中一组候选可能全都很差,组内相对排序无法自动提供接近正确运动的方向,单纯 GRPO 因而不稳定。

本文先把问题限定为有多帧初始观测的刚体视频续写,再从真实视频中提取参考轨迹,将评价信号落实到物体位置与碰撞事件。核心 idea:用可观测的轨迹误差指导探索,并根据一组候选的绝对质量决定是否追加真实视频监督,让模型先具备生成合理候选的能力,再通过奖励改善运动。

方法详解

整体框架

输入是文本提示与前 5 帧视频,输出是后续帧;这不是仅凭一张图任意生成未来的设置。训练首先执行多帧条件适配,随后对同一条件生成一组候选,使用碰撞加权轨迹奖励评分,最后由 MDcycle 联合优化更新模型。

真实视频提供监督目标与参考轨迹。它不作为待生成的未来输入;参考轨迹主要在训练奖励和评测环节使用。模型推理时仍然根据文本和初始视频续写,不需要先由模拟器规划完整未来。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
        A["文本与前 5 帧"] --> B["多帧条件适配"]
        B --> C["同条件候选视频组"]
        C --> D["碰撞加权轨迹奖励"]
        G["真实视频与初帧标注"] --> D
        D --> E["MDcycle 联合优化"]
        G --> E
        E --> F["更新模型并继续采样"]
        F --> C

关键设计

1. 多帧条件适配

单张图通常无法确定物体初速度,同一初始位置可以对应多条合理未来。若用唯一真实轨迹评分,模型可能仅仅因为选择了另一种初速度而被惩罚。作者因此使用多帧观测约束初始状态,将图像到视频任务改为视频到视频任务;具体把预训练扩散 Transformer 的图像条件替换为前 5 帧,并用 Flow Matching 做全参数微调。

这一阶段提供的是基本的条件续写能力,而非已经完成物理学习。模型仍可能生成外观连贯但轨迹随机的未来。其价值在于让后续奖励比较更有意义:候选具有相同的初始运动信息,误差不再主要来自单帧条件下无法确定的初速度。需要注意,多帧二维观测并不自动揭示质量、摩擦、深度与外力;作者的确定性论证依赖其受限场景,而不是普适物理定理。

2. 碰撞加权轨迹奖励

作者在数据准备阶段标注首帧物体中心,碰撞场景标注主动体与被动体,其他场景标注一个物体。SAM2 分别跟踪真实视频和候选视频,得到物体掩码;每帧掩码内像素坐标的平均值就是该物体的二维中心。这样,奖励比较的是随时间变化的位置序列,不需要让另一个大模型主观判断整段视频是否“符合物理”。

基本指标 Trajectory Offset(TO)对对应物体、对应帧的中心欧氏距离做聚合。只最小化整体偏差可能忽略短暂但关键的接触事件:大部分帧走得不错,碰撞时刻却穿透或不反弹,平均分仍可能较好。作者将这种偏好简单运动、回避复杂碰撞的现象称为奖励作弊,因此加入事件加权。

碰撞检测先对位置序列作差分得到速度,再差分得到加速度,以加速度突变定位碰撞帧。碰撞帧使用权重 \(w^{col}\),相邻帧使用 \(w^{adj}\),其余帧使用 \(w\);强调邻帧也能覆盖接触前后的运动变化。以下按原文式 (9) 整理奖励关系,保留其时间下标与归一化写法:

\[ O_c=\frac{1}{NT}\sum_{s=1}^{N}\sum_{t=T_{\mathrm{obs}}}^{T}w_t\left\|p^{\mathrm{gt}}_{t,s}-p^{\mathrm{sample}}_{t,s}\right\|_2,\qquad R=-O_c. \]

其中 \(N\) 是标注物体数,\(T\) 是序列长度,\(p_{t,s}\) 是二维中心;去掉时间权重便得到原文的未加权偏移形式。误差越小,奖励越大。该目标并不显式计算动量守恒或求解牛顿方程,而是把真实视频中的运动作为参考,因此“可验证”指轨迹差异可测量,不意味着验证了所有物理规律。

缓存中的公式排版存在字符错位,上式根据邻近文字整理;碰撞检测阈值、三类权重的具体值以及权重时间表的完整生成规则被指向未附的 Appendix,不能从当前材料补出。本文也不把训练时的加权 \(O_c\) 与结果表中的未加权 TO 混为同一个指标。

3. MDcycle 联合优化

对于一个条件下的候选组,GRPO 用奖励减去组内均值、再除以组内标准差构造优势,鼓励相对更好的样本。但如果候选全部失败,“组内最好”也可能仍然远离正确运动。这解释了为何单纯 RL 会在简单场景上进步,却在分布外或复杂场景中恶化:相对优势不包含“整组都不合格”的绝对质量信息。

MDcycle 额外计算组平均加权偏移 \(\bar O_c\)。若它超过阈值,就在 RL 损失上追加针对真实视频的 Flow Matching 损失,提供更细粒度的监督;若没有超过阈值,就仅保留 RL 目标,让模型继续利用奖励探索。尽管论文将其称为 Mimicry 与 Discovery 两个阶段,式 (10) 实际不是互斥地关闭一条损失,而是困难组保留 RL 并增加监督:

\[ \mathcal L=\mathcal L_D+\alpha\mathcal L_M,\qquad \alpha=\begin{cases}1,&\bar O_c>\mathrm{Threshold},\\0,&\text{otherwise}.\end{cases} \]

这里 \(\mathcal L_D\) 是负的 GRPO 目标,\(\mathcal L_M\) 是 Flow Matching 损失。随着候选质量改善,触发额外监督的组逐渐减少,模型自然从依赖模仿转向更多自主探索。“分布外”并不是通过一个单独的分布分类器识别,而是作者对高误差困难案例的解释;真正控制门控的是可计算的平均偏移。

一个完整示例

以文中碰撞场景中的两球运动为例,前 5 帧显示一个球正在接近另一个球。模型据此生成多个未来视频;首帧两球中心分别提示 SAM2,得到真实轨迹和各候选轨迹。若某候选中的球继续直行并穿过目标球,它不仅有接触后的位移误差,还会在碰撞附近承受更高权重。

随后比较整组的平均加权偏移和阈值 8。超过 8 时,保留 GRPO 并追加真实视频的 Flow Matching 监督;不超过 8 时只使用 GRPO。这里的 5 帧和阈值 8 来自原文,候选行为是用于解释流程的示意,并非新报告的一次实验。

损失函数 / 训练策略

训练顺序是 I2V → V2V → RL:先全参数微调适配条件,再使用 LoRA 执行 MDcycle 后训练。GRPO 保留裁剪的重要性比目标与 KL 正则,不额外训练独立价值模型;Flow Matching 则学习从噪声到真实视频的速度场。

为降低探索成本,作者采用混合 ODE-SDE 采样,仅在选定窗口内的两个连续步骤使用随机 SDE,其余步骤使用 ODE。表 3 的最佳窗口是时间范围 75%–100%,论文将其解释为高噪声区域;这是流匹配时间坐标,不应误读为生成接近结束时的最后阶段。对应配置的 NFE 为 2,而全范围 SDE 对照为 16。

表 3 还报告最佳噪声强度 \(\sigma_t=1.0\)、阈值 8。当前缓存没有 Appendix 中的完整伪代码、学习率、LoRA 秩及硬件细节,因此这些设置不足以构成完整复现配方。

实验关键数据

主实验

原文使用约 10M 个训练视频,另从真实录制、游戏等来源人工整理约 700 个高质量刚体视频,其中约 50 个作为排除在训练之外的测试集。不能把 700 当成独立测试视频数,也不能把本方法描述成仅用 700 个视频训练。

下表摘录原文表 1。VBench 总分评价视觉质量;VideoPhy-2 的 SA、PC 分别表示语义遵循与物理常识指标;PhysRVGBench 的 IoU 衡量运动掩码空间重叠,TO 衡量二维中心轨迹偏差。IoU 的完整聚合细节被指向 Appendix,当前缓存未提供。

模型 VBench 总分 ↑ SA ↑ PC ↑ IoU ↑ TO ↓
Wan2.2 14B 76.83 0.64 0.34 0.12 162.40
Kling2.5 78.77 0.70 0.41 0.23 103.22
HunyuanVideo 76.97 0.60 0.32 0.10 181.62
Magi-1 77.16 0.67 0.38 0.27 113.42
VideoMAR 74.31 0.62 0.32 0.31 109.43
CosmosPredict2 76.91 0.70 0.39 0.33 79.67
PhysRVG 78.89 0.76 0.44 0.64 15.03

消融实验

下表摘录原文表 2,配置按作者的逐步添加方式排列。MDcycle 是在 RL 框架中增加门控监督,不表示另外串联一个独立生成模型。

配置 VBench 总分 ↑ SA ↑ PC ↑ IoU ↑ TO ↓
Baseline 74.86 0.57 0.21 0.15 162.78
+Fine-tuning (FT) 77.45 0.63 0.34 0.41 48.60
+GRPO 77.91 0.69 0.38 0.52 26.38
+MDcycle 78.53 0.74 0.43 0.62 19.47
+Collision Detect 78.89 0.76 0.44 0.64 15.03

关键发现

  • MDcycle 将 TO 从 26.38 降至 19.47,加入碰撞检测进一步降至 15.03;两者分别针对探索不稳定和事件被平均误差掩盖的问题。
  • 视觉总分相对 Kling2.5 只高 0.12,但 TO 相对 CosmosPredict2 从 79.67 降至 15.03。物理轨迹指标比整体视觉评分更能显示本文的目标收益。
  • 原文表 3 在同数据与 GPU-hours 预算下比较采样设置:高噪声窗口配置为 IoU 0.64、TO 15.03,全范围 SDE 为 0.55、27.24;这是预算受控的配置比较,不是推理加速倍数。

亮点与洞察

  • 奖励从整段视频的主观印象转向可定位的时空误差。碰撞附近的加权说明,短暂事件可能决定物理正确性,不能仅由占多数的平稳帧决定优化方向。
  • MDcycle 同时使用相对优势和绝对质量。前者决定组内偏好,后者决定何时需要外部监督,这个组合可迁移到有可测量误差的生成任务。
  • 任务条件本身也是奖励设计的一部分。先给出多帧初始运动信息,才让对单条真实轨迹的比较比单帧设置更合理。

局限与展望

  • 以下是基于正文的阅读判断;作者将正式局限、未来工作与伦理讨论放在未附的 Appendix,不能声称已核验那些内容。
  • 约 50 个测试视频、四类刚体运动和单随机种子的主对比,不能充分支撑任意场景的物理泛化;表中没有报告置信区间。
  • SAM2 失败、遮挡、相机运动和二维投影都可能污染轨迹奖励。中心轨迹也无法充分衡量刚体旋转、形状保持、真实接触或能量守恒。
  • I2V 与 V2V 基线可获得的初始运动信息不同;作者虽统一生成设置并设计提示,但不能据此认为条件信息量完全一致。模拟器方法的比较也被作者明确标为难以严格公平。
  • 私有训练视频、缺失的碰撞参数与基础模型细节限制独立复现。可优先增加受控模拟数据、跟踪置信度及跨物体和跨动力学参数的测试,区分参考轨迹拟合与真正的规律泛化。

相关工作与启发

  • vs PhysGen / GPT4Motion:这些方法用模拟器产生运动先验,PhysRVG 将真实轨迹作为后训练反馈;它减少推理时的完整轨迹规划依赖,但需要可用的训练参考视频。
  • vs PhysMaster / PhyT2V:这些方法依赖偏好或 MLLM 评价,PhysRVG 使用二维轨迹偏差;信号更具体,但适用范围也受到可追踪刚体与参考轨迹的限制。
  • vs Flow-GRPO / MixGRPO:PhysRVG 沿用流模型的随机采样与组相对优化基础,新增物理奖励和困难组监督门控。可迁移的启发是先诊断奖励和探索分别在哪里失效,再分别修改它们。

评分

  • 新颖性: 4/5。将可测轨迹奖励、碰撞事件与质量门控监督组合起来,问题针对性清楚。
  • 实验充分度: 3/5。有主对比和逐步消融,但测试规模、单种子与复现材料限制结论强度。
  • 写作质量: 4/5。动机到消融的逻辑完整,但“内化物理规律”的措辞强于当前证据。
  • 价值: 4/5。为刚体视频后训练提供了可操作的奖励设计与困难样本优化思路。