PhysRVG: Physics-Aware Unified Reinforcement Learning for Video Generative Models¶
会议: ECCV2026
论文: ECCV 原文
项目: https://lucaria-academy.github.io/PhysRVG/
领域: 视频生成
关键词: 视频续写、刚体运动、物理可验证奖励、碰撞检测、强化学习
一句话总结¶
PhysRVG 用碰撞加权的真实轨迹偏差评价视频续写,并在强化学习探索失败时追加 Flow Matching 监督,使 PhysRVGBench 的 IoU 达到 0.64、轨迹偏移降至 15.03,但这些结果主要证明受限刚体场景中的轨迹拟合能力。
研究背景与动机¶
视频生成模型已经能合成清晰、平滑的画面,却经常在物体相撞、反弹或摆动时产生错误轨迹。视觉上连续不等于动力学正确:一个球沿直线穿过另一个球,可能仍然具有很高的时序平滑度。增加物理视频训练数据可以改善外观与运动统计,使用模拟器提供完整轨迹也能约束输出,但前者缺少针对运动错误的精确信号,后者依赖额外的运动规划和控制输入。
强化学习提供了另一条路线,不过奖励必须能区分“看起来像”与“确实沿正确轨迹运动”。VLM 或人类整体评分难以定位细小的碰撞时刻;直接使用轨迹偏差,又可能让模型偏好容易生成的直线运动。与此同时,困难场景中一组候选可能全都很差,组内相对排序无法自动提供接近正确运动的方向,单纯 GRPO 因而不稳定。
本文先把问题限定为有多帧初始观测的刚体视频续写,再从真实视频中提取参考轨迹,将评价信号落实到物体位置与碰撞事件。核心 idea:用可观测的轨迹误差指导探索,并根据一组候选的绝对质量决定是否追加真实视频监督,让模型先具备生成合理候选的能力,再通过奖励改善运动。
方法详解¶
整体框架¶
输入是文本提示与前 5 帧视频,输出是后续帧;这不是仅凭一张图任意生成未来的设置。训练首先执行多帧条件适配,随后对同一条件生成一组候选,使用碰撞加权轨迹奖励评分,最后由 MDcycle 联合优化更新模型。
真实视频提供监督目标与参考轨迹。它不作为待生成的未来输入;参考轨迹主要在训练奖励和评测环节使用。模型推理时仍然根据文本和初始视频续写,不需要先由模拟器规划完整未来。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["文本与前 5 帧"] --> B["多帧条件适配"]
B --> C["同条件候选视频组"]
C --> D["碰撞加权轨迹奖励"]
G["真实视频与初帧标注"] --> D
D --> E["MDcycle 联合优化"]
G --> E
E --> F["更新模型并继续采样"]
F --> C
关键设计¶
1. 多帧条件适配
单张图通常无法确定物体初速度,同一初始位置可以对应多条合理未来。若用唯一真实轨迹评分,模型可能仅仅因为选择了另一种初速度而被惩罚。作者因此使用多帧观测约束初始状态,将图像到视频任务改为视频到视频任务;具体把预训练扩散 Transformer 的图像条件替换为前 5 帧,并用 Flow Matching 做全参数微调。
这一阶段提供的是基本的条件续写能力,而非已经完成物理学习。模型仍可能生成外观连贯但轨迹随机的未来。其价值在于让后续奖励比较更有意义:候选具有相同的初始运动信息,误差不再主要来自单帧条件下无法确定的初速度。需要注意,多帧二维观测并不自动揭示质量、摩擦、深度与外力;作者的确定性论证依赖其受限场景,而不是普适物理定理。
2. 碰撞加权轨迹奖励
作者在数据准备阶段标注首帧物体中心,碰撞场景标注主动体与被动体,其他场景标注一个物体。SAM2 分别跟踪真实视频和候选视频,得到物体掩码;每帧掩码内像素坐标的平均值就是该物体的二维中心。这样,奖励比较的是随时间变化的位置序列,不需要让另一个大模型主观判断整段视频是否“符合物理”。
基本指标 Trajectory Offset(TO)对对应物体、对应帧的中心欧氏距离做聚合。只最小化整体偏差可能忽略短暂但关键的接触事件:大部分帧走得不错,碰撞时刻却穿透或不反弹,平均分仍可能较好。作者将这种偏好简单运动、回避复杂碰撞的现象称为奖励作弊,因此加入事件加权。
碰撞检测先对位置序列作差分得到速度,再差分得到加速度,以加速度突变定位碰撞帧。碰撞帧使用权重 \(w^{col}\),相邻帧使用 \(w^{adj}\),其余帧使用 \(w\);强调邻帧也能覆盖接触前后的运动变化。以下按原文式 (9) 整理奖励关系,保留其时间下标与归一化写法:
其中 \(N\) 是标注物体数,\(T\) 是序列长度,\(p_{t,s}\) 是二维中心;去掉时间权重便得到原文的未加权偏移形式。误差越小,奖励越大。该目标并不显式计算动量守恒或求解牛顿方程,而是把真实视频中的运动作为参考,因此“可验证”指轨迹差异可测量,不意味着验证了所有物理规律。
缓存中的公式排版存在字符错位,上式根据邻近文字整理;碰撞检测阈值、三类权重的具体值以及权重时间表的完整生成规则被指向未附的 Appendix,不能从当前材料补出。本文也不把训练时的加权 \(O_c\) 与结果表中的未加权 TO 混为同一个指标。
3. MDcycle 联合优化
对于一个条件下的候选组,GRPO 用奖励减去组内均值、再除以组内标准差构造优势,鼓励相对更好的样本。但如果候选全部失败,“组内最好”也可能仍然远离正确运动。这解释了为何单纯 RL 会在简单场景上进步,却在分布外或复杂场景中恶化:相对优势不包含“整组都不合格”的绝对质量信息。
MDcycle 额外计算组平均加权偏移 \(\bar O_c\)。若它超过阈值,就在 RL 损失上追加针对真实视频的 Flow Matching 损失,提供更细粒度的监督;若没有超过阈值,就仅保留 RL 目标,让模型继续利用奖励探索。尽管论文将其称为 Mimicry 与 Discovery 两个阶段,式 (10) 实际不是互斥地关闭一条损失,而是困难组保留 RL 并增加监督:
这里 \(\mathcal L_D\) 是负的 GRPO 目标,\(\mathcal L_M\) 是 Flow Matching 损失。随着候选质量改善,触发额外监督的组逐渐减少,模型自然从依赖模仿转向更多自主探索。“分布外”并不是通过一个单独的分布分类器识别,而是作者对高误差困难案例的解释;真正控制门控的是可计算的平均偏移。
一个完整示例¶
以文中碰撞场景中的两球运动为例,前 5 帧显示一个球正在接近另一个球。模型据此生成多个未来视频;首帧两球中心分别提示 SAM2,得到真实轨迹和各候选轨迹。若某候选中的球继续直行并穿过目标球,它不仅有接触后的位移误差,还会在碰撞附近承受更高权重。
随后比较整组的平均加权偏移和阈值 8。超过 8 时,保留 GRPO 并追加真实视频的 Flow Matching 监督;不超过 8 时只使用 GRPO。这里的 5 帧和阈值 8 来自原文,候选行为是用于解释流程的示意,并非新报告的一次实验。
损失函数 / 训练策略¶
训练顺序是 I2V → V2V → RL:先全参数微调适配条件,再使用 LoRA 执行 MDcycle 后训练。GRPO 保留裁剪的重要性比目标与 KL 正则,不额外训练独立价值模型;Flow Matching 则学习从噪声到真实视频的速度场。
为降低探索成本,作者采用混合 ODE-SDE 采样,仅在选定窗口内的两个连续步骤使用随机 SDE,其余步骤使用 ODE。表 3 的最佳窗口是时间范围 75%–100%,论文将其解释为高噪声区域;这是流匹配时间坐标,不应误读为生成接近结束时的最后阶段。对应配置的 NFE 为 2,而全范围 SDE 对照为 16。
表 3 还报告最佳噪声强度 \(\sigma_t=1.0\)、阈值 8。当前缓存没有 Appendix 中的完整伪代码、学习率、LoRA 秩及硬件细节,因此这些设置不足以构成完整复现配方。
实验关键数据¶
主实验¶
原文使用约 10M 个训练视频,另从真实录制、游戏等来源人工整理约 700 个高质量刚体视频,其中约 50 个作为排除在训练之外的测试集。不能把 700 当成独立测试视频数,也不能把本方法描述成仅用 700 个视频训练。
下表摘录原文表 1。VBench 总分评价视觉质量;VideoPhy-2 的 SA、PC 分别表示语义遵循与物理常识指标;PhysRVGBench 的 IoU 衡量运动掩码空间重叠,TO 衡量二维中心轨迹偏差。IoU 的完整聚合细节被指向 Appendix,当前缓存未提供。
| 模型 | VBench 总分 ↑ | SA ↑ | PC ↑ | IoU ↑ | TO ↓ |
|---|---|---|---|---|---|
| Wan2.2 14B | 76.83 | 0.64 | 0.34 | 0.12 | 162.40 |
| Kling2.5 | 78.77 | 0.70 | 0.41 | 0.23 | 103.22 |
| HunyuanVideo | 76.97 | 0.60 | 0.32 | 0.10 | 181.62 |
| Magi-1 | 77.16 | 0.67 | 0.38 | 0.27 | 113.42 |
| VideoMAR | 74.31 | 0.62 | 0.32 | 0.31 | 109.43 |
| CosmosPredict2 | 76.91 | 0.70 | 0.39 | 0.33 | 79.67 |
| PhysRVG | 78.89 | 0.76 | 0.44 | 0.64 | 15.03 |
消融实验¶
下表摘录原文表 2,配置按作者的逐步添加方式排列。MDcycle 是在 RL 框架中增加门控监督,不表示另外串联一个独立生成模型。
| 配置 | VBench 总分 ↑ | SA ↑ | PC ↑ | IoU ↑ | TO ↓ |
|---|---|---|---|---|---|
| Baseline | 74.86 | 0.57 | 0.21 | 0.15 | 162.78 |
| +Fine-tuning (FT) | 77.45 | 0.63 | 0.34 | 0.41 | 48.60 |
| +GRPO | 77.91 | 0.69 | 0.38 | 0.52 | 26.38 |
| +MDcycle | 78.53 | 0.74 | 0.43 | 0.62 | 19.47 |
| +Collision Detect | 78.89 | 0.76 | 0.44 | 0.64 | 15.03 |
关键发现¶
- MDcycle 将 TO 从 26.38 降至 19.47,加入碰撞检测进一步降至 15.03;两者分别针对探索不稳定和事件被平均误差掩盖的问题。
- 视觉总分相对 Kling2.5 只高 0.12,但 TO 相对 CosmosPredict2 从 79.67 降至 15.03。物理轨迹指标比整体视觉评分更能显示本文的目标收益。
- 原文表 3 在同数据与 GPU-hours 预算下比较采样设置:高噪声窗口配置为 IoU 0.64、TO 15.03,全范围 SDE 为 0.55、27.24;这是预算受控的配置比较,不是推理加速倍数。
亮点与洞察¶
- 奖励从整段视频的主观印象转向可定位的时空误差。碰撞附近的加权说明,短暂事件可能决定物理正确性,不能仅由占多数的平稳帧决定优化方向。
- MDcycle 同时使用相对优势和绝对质量。前者决定组内偏好,后者决定何时需要外部监督,这个组合可迁移到有可测量误差的生成任务。
- 任务条件本身也是奖励设计的一部分。先给出多帧初始运动信息,才让对单条真实轨迹的比较比单帧设置更合理。
局限与展望¶
- 以下是基于正文的阅读判断;作者将正式局限、未来工作与伦理讨论放在未附的 Appendix,不能声称已核验那些内容。
- 约 50 个测试视频、四类刚体运动和单随机种子的主对比,不能充分支撑任意场景的物理泛化;表中没有报告置信区间。
- SAM2 失败、遮挡、相机运动和二维投影都可能污染轨迹奖励。中心轨迹也无法充分衡量刚体旋转、形状保持、真实接触或能量守恒。
- I2V 与 V2V 基线可获得的初始运动信息不同;作者虽统一生成设置并设计提示,但不能据此认为条件信息量完全一致。模拟器方法的比较也被作者明确标为难以严格公平。
- 私有训练视频、缺失的碰撞参数与基础模型细节限制独立复现。可优先增加受控模拟数据、跟踪置信度及跨物体和跨动力学参数的测试,区分参考轨迹拟合与真正的规律泛化。
相关工作与启发¶
- vs PhysGen / GPT4Motion:这些方法用模拟器产生运动先验,PhysRVG 将真实轨迹作为后训练反馈;它减少推理时的完整轨迹规划依赖,但需要可用的训练参考视频。
- vs PhysMaster / PhyT2V:这些方法依赖偏好或 MLLM 评价,PhysRVG 使用二维轨迹偏差;信号更具体,但适用范围也受到可追踪刚体与参考轨迹的限制。
- vs Flow-GRPO / MixGRPO:PhysRVG 沿用流模型的随机采样与组相对优化基础,新增物理奖励和困难组监督门控。可迁移的启发是先诊断奖励和探索分别在哪里失效,再分别修改它们。
评分¶
- 新颖性: 4/5。将可测轨迹奖励、碰撞事件与质量门控监督组合起来,问题针对性清楚。
- 实验充分度: 3/5。有主对比和逐步消融,但测试规模、单种子与复现材料限制结论强度。
- 写作质量: 4/5。动机到消融的逻辑完整,但“内化物理规律”的措辞强于当前证据。
- 价值: 4/5。为刚体视频后训练提供了可操作的奖励设计与困难样本优化思路。