跳转至

Predictive Structure Improves Video Diffusion Dynamics

会议: ECCV 2026
论文: ECCV 原文
代码: 待确认
领域: 视频生成
关键词: 视频生成, 扩散模型, 世界模型, 物理常识, 信息瓶颈

一句话总结

针对视频扩散模型生成的动态违背重力、支撑与物体恒常性等物理规律的问题,本文提出潜在动力学优化(LDO),将冻结的 V-JEPA 2 预测性世界模型作为动力学先验,通过特征层 Gram 矩阵关系蒸馏与生成级 GRPO 强化学习,显著提升视频物理合理性。

研究背景与动机

视频扩散模型在视觉逼真度和单帧清晰度上取得了巨大突破,能够合成极具真实感的复杂场景与动作。然而,当镜头和时间跨度展开时,最前沿的视频生成模型仍频繁违背基础物理常识,诸如物体在无外力作用下突兀悬浮、穿模、短暂遮挡后永久消失、滑动脱离支撑面或液体流动缺乏连贯因果。即使每一帧在像素层面都锐利真实,时序演化上的物理失真使得这些模型难以胜任具身仿真、物理交互和高可靠性视频编辑等下游任务。

从信息瓶颈理论(Information Bottleneck, IB)审视这一缺陷,问题的根源并非单纯受限于数据规模,而是源于生成模型底层的去噪似然目标。现有的潜在扩散与流匹配模型以 VAE 隐空间重构分布匹配为优化核心,而高熵的外观干扰因素(如光影变化、纹理抖动、背景噪声)极度膨胀了隐变量的条件熵,迫使生成网络将大量表征容量分配给不可预测的高频外观随机性,而非低维因果物理状态。相比之下,以 V-JEPA 2 为代表的自监督隐式预测世界模型通过对遮挡目标执行特征域预测,天然构成了隐式信息瓶颈,主动抑制不可跨时序预测的高频纹理,提炼出平滑演化的物理状态流形。

受此启发,本文认为无需改变扩散模型的采样架构,而应在后训练阶段为扩散模型注入因果预测结构。核心 idea:提出潜在动力学优化(LDO),以冻结的隐式世界模型 V-JEPA 2 为动力学导师与物理评判器,在特征层面利用 Gram 矩阵几何匹配实现因果预测动力学蒸馏(PDA),在轨迹层面利用基于时序自回归预测能力的 GRPO 策略优化,端到端提升生成视频的物理合理性与时序连贯性。

方法详解

整体框架

潜在动力学优化(LDO)是一种针对预训练视频扩散模型的两阶段协同后训练框架。给定条件提示词与输入视频,模型在特征表征层和生成轨迹层同步接受预测性世界模型的结构化指导。在特征层,预训练扩散 Transformer(DiT)的中间特征通过投影映射,与 V-JEPA 2 在离散时序分桶上的因果未来预测特征对齐其相对几何流形;在轨迹层,扩散模型作为随机策略生成多路视频候选,冻结的 V-JEPA 2 充当物理评判器,根据未来时序预测误差打分并通过 GRPO 强化对齐时序因果。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    In["输入视频 / 提示词 C"] --> DiTBranch["扩散主干生成通路<br/>VAE 编码 + DiT 中间特征"]
    In --> JEPA上演["冻结 V-JEPA 2 通路<br/>分桶时序嵌入 + 自回归预测器 P"]
    DiTBranch & JEPA上演 --> PDA["预测性动力学对齐 (PDA)<br/>Gram 矩阵几何拓扑蒸馏"]
    DiTBranch --> Rollout["随机策略多路采样<br/>stochastic DDIM 轨迹生成"]
    Rollout --> Critic["V-JEPA 2 物理评判器<br/>滑动窗口因果未来预测打分"]
    Critic --> GRPO["时序结构感知 GRPO 优化<br/>组相对优势更新扩散策略"]

关键设计

1. 预测性动力学对齐(PDA):消除外观干扰的流形几何蒸馏

针对像素级扩散特征与自监督表征维度不对齐、坐标空间不一致的问题,直接强行让 DiT 特征逼近世界模型隐状态容易破坏预训练模型的精细外观生成能力。PDA 选择约束特征间的关系拓扑而非绝对坐标。具体而言,将视频在时间轴上划分为 \(K\) 个等长时序分桶(temporal bins),每个分桶跨度为 \(\Delta_t\)。对于目标分桶 \(k\),冻结的 V-JEPA 2 预测器 \(\mathcal{P}\) 接收前序分桶 \([0, k-1]\) 的上下文,自回归预测出当前分桶的目标特征 \(\hat{\mathbf{h}}^{(k)}\)。随后,将 DiT 第 \(l\) 层的特征 \(\tilde{\mathbf{z}}\) 与预测特征 \(\tilde{\hat{\mathbf{h}}}\) 进行 L2 归一化,并计算空间 token 间的 Gram 矩阵(余弦相似度关系矩阵): $$ \mathbf{G}^{\text{diff}}t = \tilde{\mathbf{z}}_t \cdot \tilde{\mathbf{Z}}^\top, \quad \mathbf{G}^{\text{pred}}_t = \tilde{\hat{\mathbf{h}}}_t \cdot \tilde{\hat{\mathbf{H}}}^\top $$ 损失函数通过带边界裕量 \(m\) 的松弛惩罚,对齐 DiT 内部状态与世界模型因果预测特征的时空相关性结构: $$ \mathcal{L}_t\right| - m\right)\right) $$ 这种关系蒸馏保留了扩散模型的坐标自由度,仅将世界模型的因果时序流形几何迁移进扩散主干,有效排除了非因果高熵纹理的干扰。}} = \frac{1}{|T_{\text{valid}}|} \sum_{t \in T_{\text{valid}}} \text{mean}\left(\text{ReLU}\left(\left|\mathbf{G}^{\text{diff}}_t - \mathbf{G}^{\text{pred}

2. 结构感知奖励 GRPO:端到端动力学校验与组相对策略优化

针对表征对齐无法直接约束长程自回归轨迹质量、且微小隐空间误差容易在几十步去噪中累积放大的痛点,LDO 构建了直接作用于采样分布的强化学习反馈环。将预训练扩散模型视作参数化策略 \(\pi_\theta\),给定条件提示词生成一组 \(G\) 条候选视频。冻结的 V-JEPA 2 作为物理评判器(Physics Critic),采用滑动窗口机制切出重叠片段序列 \(\mathcal{W}\),以窗口前 \(C\) 帧为因果上下文预测后续帧特征,以预测特征与真实编码特征的平均余弦相似度计算轨迹物理奖励: $$ r(Y) = \frac{1}{|\mathcal{W}|} \sum_{w \in \mathcal{W}} \frac{1}{|w_{\text{future}}|} \sum_{i} \cos\left((\mathbf{h}^w_{\text{pred}})i, (\mathbf{h}^w)_i\right) $$ 依据该物理合理性奖励,计算组内相对优势 }\(A_i = (r_i - \mu_G) / (\sigma_G + \epsilon)\),并在带有截断的随机 DDIM 去噪步骤上执行策略梯度更新,仅在抽样的部分时间步计算梯度,以端到端方式惩罚发生违背常识的物理畸变轨迹。

3. 交替调度统一训练目标:突破显存瓶颈的联合优化

同时反传密集图蒸馏梯度和运行完整去噪生成展开(Rollout)会导致显存溢出。为此,LDO 设计了时间步交替更新机制,将总体目标定义为分步激活的动态损失函数: $$ \mathcal{L}{\text{total}}^{(n)} = \mathcal{L}}} + \lambda \mathcal{L{\text{PDA}} + \gamma(n) \mathcal{L} $$ 在标准优化步(}\(\gamma(n) = 0\)),模型仅在预训练视频数据上协同反向传播扩散去噪损失与 PDA 特征对齐损失;每隔固定的 \(m\) 步,激活 \(\gamma(n) > 0\),执行多路视频轨迹采样并进行 GRPO 策略梯度反传,辅以梯度检查点与去噪时间步随机子采样(仅反传 \(\rho=0.6\) 的时间步),在单机 GH200 上高效完成了双层物理约束优化。

损失函数 / 训练策略

  • 主干与基础配置:文本生成视频评测基于 CogVideoX-5B(并在 Wan2.2-T2V-A14B 上验证通用性),图生视频物理评测基于 Open-Sora。PDA 模块作用于 DiT 第 18 层,配置 LoRA rank 128;世界模型采用 V-JEPA 2-ViT-G。
  • 超参数设定:PDA 时序分桶数 \(K=4\);GRPO 组大小 \(G=16\),滑动窗口大小 16 帧(8 帧因果上下文,跨度 8);DDIM 随机扰动系数 \(\eta > 0\),无分类器引导尺度 \(w=6.0\);训练采用 8 卡 NVIDIA GH200(120GB)集群,仅训练 1 个 epoch。

实验关键数据

主实验

在物理常识基准 VideoPhy(评估固体-固体、固体-流体、流体-流体交互)和引力刚体物理基准 PisaBench 上,LDO 与前沿通用视频生成模型及物理专用基线进行了全面对比。

基准 / 评估维度 指标 CogVideoX-5B VideoREPA-5B LDO-5B (本文) 提升幅度 (相对 Base)
VideoPhy 总体物理常识 PC (%) ↑ 32.0 37.8 45.6 +13.6%
VideoPhy 总体语义遵循 SA (%) ↑ 69.2 70.3 71.8 +2.6%
VideoPhy 固体–固体交互 PC (%) ↑ 19.6 26.6 34.3 +14.7%
VideoPhy 固体–流体交互 PC (%) ↑ 33.6 37.7 43.8 +10.2%
VideoPhy 流体–流体交互 PC (%) ↑ 60.0 67.3 80.0 +20.0%

在 PisaBench 下降物体模拟测试中,对比 PISA 专用微调基线,LDO 在真实与模拟场景下均刷新了运动轨迹与几何形变指标:

评估子集 方法 轨迹误差 L2 ↓ 形状误差 CD ↓ 物体恒常性 IoU ↑
真实视频 (Real) Sora (OpenAI) 0.174 0.488 0.065
真实视频 (Real) PISA-psft (强基线) 0.079 0.194 0.138
真实视频 (Real) LDO (本文) 0.070 (-11.39%) 0.170 (-12.37%) 0.145 (+5.07%)
模拟视频 (Sim) Open-Sora (Base) 0.135 0.389 0.035
模拟视频 (Sim) PISA-psft (强基线) 0.035 0.076 0.155
模拟视频 (Sim) LDO (本文) 0.030 (-14.29%) 0.064 (-15.79%) 0.154 (-0.65%)

消融实验

在 VideoPhy 评测集上,作者系统消融了 PDA 特征对齐与 GRPO 轨迹强化学习各组件的独立贡献:

配置 语义遵循 SA ↑ 物理常识 PC ↑ 说明
Vanilla diffusion (CogVideoX-5B) 69.2 32.0 原始去噪模型,基线状态
仅保留 PDA (仅特征层对齐) 72.4 39.2 语义遵循最高 (+3.2),物理大幅提升 (+7.2)
仅保留 GRPO (仅生成轨迹奖励) 70.6 40.4 物理先验增强略优于 PDA (+8.4),但语义略弱
完整模型 (PDA + GRPO) 71.8 45.6 双通路协同达到最高物理准确率 (+13.6)

关键发现

  • 两路机制互补增效:单靠内部特征对齐(PDA)能极大保全甚至增强语义忠实度并提升物理常识,而 GRPO 提供了更强的长程物理轨迹约束;两者结合取得了高达 45.6% 的物理常识评分,且几乎不牺牲提示词语义对齐。
  • 显著修复重力与接触缺陷:可视化分析表明,原生模型经常生成悬空滑动、中途熔化或凭空消失的异常物体,LDO 严格保持了接触面摩擦受力轨迹与掉落出桌面边缘后的自由落体加速度。
  • 流体交互提升最显著:流体混合和扩散动态往往由于像素级高熵随机性而最难被标准扩散模型建模,LDO 在 Fluid-Fluid 类别上获得了高达 +20.0% 的绝对跃升,证明了时序预测性隐空间对非刚体连续变形的建模优越性。

亮点与洞察

  • 信息瓶颈视角解释物理缺失:深刻指出了标准扩散似然目标在处理高熵外观噪声时对模型容量的无效挤占,从理论上阐明了为什么纯粹 scaling 像素级模型无法自动涌现稳健物理规律。
  • 无须改动采样器的非侵入式后训练:通过将自监督世界模型作为教师与打分评判器,完全不改变扩散推理阶段的采样步数或计算开销,具备极强的工业落地友好性。
  • 几何关系对齐保护生成灵活性:不强行对齐特征绝对数值,而是采用 Gram 矩阵对齐时空相关性结构,成功规避了特征强制模仿导致的图像模糊或生成多样性坍缩。

局限与展望

  • 物理与提示词遵从的保守性权衡:当文本提示词缺乏明确因果主体时(例如“桌上的瓶子倒下了”),LDO 因强行遵循物体在平整表面无外力作用不应倾倒的物理定律,容易生成静止不动的保守视频,从而偏离用户的意图。
  • 依赖世界模型上限:所注入物理常识的广度与精度完全受限于 V-JEPA 2 自身的表征能力。若底层世界模型未能涵盖罕见物理动态,蒸馏指导亦将遇到瓶颈。
  • 未来方向:探索引入语言显式因果推理(如推断隐含外力),在保持物理正确性的同时增强对非完整描述性 Prompt 的指令遵循与动态激活。

相关工作与启发

  • vs VideoREPA: VideoREPA 同样采用表征对齐,但侧重通用自监督视频编码器(DINOv2 等)的静态几何特征匹配;LDO 引入自回归时序预测世界模型,以时间分桶因果预测为先验,物理常识评分高出 7.8 个百分点。
  • vs PISA: PISA 依赖显式目标检测与分割掩码构建特定重力轨迹奖赏,泛化成本高;LDO 无需显式目标提取标注,完全由潜空间预测一致性自发驱动物理动力学学习。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次从信息瓶颈角度剖析视频扩散物理失真,并创新性地将 V-JEPA 2 作为动力学蒸馏先验与 RL 评判器。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 VideoPhy 和 PisaBench 两大物理评测集,横跨文生视频与图生视频,消融与失败案例分析深入。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑论证极其清晰,理论动机与方法构思高度闭环,实验表述严谨客观。
  • 价值: ⭐⭐⭐⭐⭐ 为解决通用视频生成中的“幻觉动力学”与违背物理法则问题提供了极其优雅实用的后训练范式。