跳转至

PhysPO: Physics-Aware Local Preference Optimization for Physically Consistent Video Diffusion

会议: ECCV 2026
论文: ECCV 原文
项目主页: https://shanpoyang654.github.io/PhysPO/page.html
代码: https://shanpoyang654.github.io/PhysPO/page.html
领域: 视频生成 (video_generation)
关键词: 视频生成、物理一致性、局部偏好优化、反事实数据、扩散模型

一句话总结

针对视频生成模型违背物理规律且传统DPO面临高昂采样成本与全局语义噪声的问题,PhysPO构建了保持全局背景一致但注入局部物理违例的反事实偏好管线CounterPhyPipe,并通过时空高频分解提取物理掩码,实施聚焦物理变化区域的局部DPO与背景中立性正则化,大幅提升视频的物理真实感与文本对齐度。

研究背景与动机

基于扩散机制的文本到视频(T2V)生成模型在分辨率、生成时长与视觉保真度上已取得爆发式进展,然而合成视频的物理常识(Physical Commonsense)与现实物理规律遵从度依然面临严峻瓶颈。无论是 Wan2.1、CogVideoX 还是 HunyuanVideo 等代表性大模型,在处理动力学(如单摆反重力摆动)、热力学(如蜡烛火苗突兀上窜)以及光学(如折射下筷子或吸管断点错位)场景时,频繁产生违反现实直觉的畸变。为了赋予视频模型物理规律建模能力,早期方法尝试引入显式物理仿真引擎或利用多模态大语言模型(MLLM)进行多轮 Prompt 物理细化,但前者难以拓展到开放世界复杂场景,后者则严重拖慢推理速度且未真正提升生成骨干模型的内在动力学表征能力。

即便通过监督微调(SFT)引入高质量物理交互视频,模型也容易拟合表面视觉相关性或捷径特征(shortcuts),因为缺乏显式的负例对比信号来惩罚违反物理规律的生成模式。直接偏好优化(DPO)虽在强化对齐上展现出潜力,但在视频物理对齐领域暴露出三大难以调和的矛盾:一是成对数据构建成本极高,传统方案对每个提示词生成多个候选视频再由人工或奖励模型打分,单卡耗时极为庞大;二是基于独立噪声采样生成的视频对缺乏“控制变量”的可比性,正负样本在场景构图、相机运动与视觉风格上完全不同,导致偏好梯度被全局外观差异淹没;三是现有视频 DPO 将整段视频视为均质实体进行全局优化,而物理违规在时空上具有高度局部性,均摊到全画面的梯度不仅稀释了物理缺陷的纠正力度,更会破坏无关背景区域的语义稳定性。

本文的切入视角在于:与其让模型在全局差异巨大的两段视频中做粗粒度取舍,不如构建“背景与场景布局完全相同、仅局部物理因果产生违例”的高质量反事实对比对,并将偏好梯度的监督与背景中立性约束显式隔离。核心 idea:通过多模态编辑与首尾帧视频生成构建全局同质、局部违背物理规律的反事实偏好数据集 CounterPhy,并利用时空高频滤波定位物理演变掩码,在掩码区域执行动态自适应局部偏好优化,在掩码外部强制施加背景中立性约束。

方法详解

整体框架

PhysPO 围绕“反事实数据构建”与“局部偏好优化”两大部分展开。整个流程首先从真实物理视频出发,利用多模态大模型提出局部物理违背假设,结合首尾帧生成技术合成场景一致的反事实劣质样本;随后,在后训练阶段通过对视频进行空间与时间维度的傅里叶变换及高频滤波,精准剥离出物理状态转移与实体形变发生的局部掩码;最终在掩码内监督物理违例惩罚,在掩码外冻结背景差异,实现稳定且聚焦的物理规律对齐。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入真实视频与文本"] --> B["反事实数据构建管线<br/>CounterPhyPipe 构造正负样本对"]
    B --> C["时空高频物理掩码提取<br/>2D与1D高通滤波提取实体与运动转移"]
    C --> D["局部物理偏好优化 LPA-DPO<br/>自适应物理惩罚权重 1-PC"]
    C --> E["领带区域中立性正则 Tie-DPO<br/>语义遵从度驱动背景梯度归零"]
    D --> F["混合目标联合微调<br/>输出物理一致视频生成模型"]
    E --> F

关键设计

1. 反事实偏好数据构建管线:以最小修改生成局部物理违背的硬负例

针对从独立随机噪声生成对比视频导致场景与运动缠结的痛点,CounterPhyPipe 直接以高画质真实物理视频为正样本 \(x^w\)。首先通过共享图文特征模型提取与提示词对齐度最高的关键帧作为起始帧 \(i_{start}\);随后调用多模态大模型 Qwen3-VL 针对该帧提出一个违反物理定律但局部可行的反事实假设 \(c^l\)(例如“茶水违背重力溢出容器并向上飘散”);接着使用图像编辑模型 Qwen-Image-Edit 修改起始帧生成对应的反事实终止帧 \(i_{end}\);最后利用首尾帧条件生成模型 Wan2.1-FLF2V 以 \((i_{start}, i_{end}, c^l)\) 为条件合成负样本视频 \(x^l\)。为了避免首尾帧插值过程中的语义漂移,管线引入物理多模态模型 VideoCon-Physics 进行奖励过滤:仅保留语义遵从度 \(SA\) 较高且物理常识得分 \(PC\) 极低的样本。由于首尾帧模型具备强约束力,过滤淘汰率仅约 8%,最终以极低的计算成本构建出超过 3 万对全局布局完全一致、仅局部物理动力学颠倒的 CounterPhy 数据集。

2. 时空高频物理掩码提取:精细捕捉动力学转移与实体形变区域

物理规律的破坏(如刚体异常扭曲、加速度骤变或界面断裂)本质上表现为物体几何边缘或时间动态序列上的非自然剧变,这些异常主要集中在频域的高频分量中。为了避免人工标注局部区域的高昂代价,PhysPO 在视频隐空间设计了完全无监督的时空频域掩码。空间维度上,对每帧进行 2D 傅里叶变换并施加径向高通滤波:

\[ H_s(u, v) = \mathbb{I}\left(\sqrt{u^2 + v^2} > \tau_s\right), \quad \tau_s = \beta_s f_{s}^{\max} \]

经逆变换后,通过逐帧自适应阈值 \(\delta_s = \mu_s + \alpha_s \sigma_s\) 得到空间结构掩码 \(M_{sp}\),以此锚定承载物理交互的有形实体。时间维度上,沿时序轴对每个空间位置执行 1D 傅里叶变换并施加时序高通滤波 \(H_t(f) = \mathbb{I}(|f| > \tau_t)\),结合全局时序阈值 \(\delta_t = \mu_t + \alpha_t \sigma_t\) 得到时间运动掩码 \(M_{tp}\),精准锁定速度突变与运动不连续区域。该解耦过程在正样本 \(x^w\) 与负样本 \(x^l\) 上对称执行,四者取并集形成统一的时空物理掩码:

\[ M = M_{sp}^w \cup M_{tp}^w \cup M_{sp}^l \cup M_{tp}^l \]

从而精确圈定可能发生物理状态演化的候选区域。

3. 局部物理偏好与背景中立性正则化:抗捷径学习的双向梯度解耦

传统全局 DPO 会将优化梯度均匀分散到全画面的每个像素,导致模型倾向于修改静态背景以满足偏好差值。PhysPO 将优化空间显式拆分为掩码物理区域 \(M\) 与背景领带区域(tie region)\(1 - M\)。在物理区域 \(M\) 内,定义掩码隐式奖励差值,并提出局部物理偏好损失 \(\mathcal{L}_{\text{PA-DPO}}\)

\[ \mathcal{L}_{\text{PA-DPO}} = -\mathbb{E}_{d \sim \hat{\mathcal{D}}}\left[\log \sigma\left(\beta \cdot (1 - PC) \cdot \mathbb{E}_t \left[ s'(x^w, t, \theta, M) - s'(x^l, t, \theta, M) \right]\right)\right] \]

其中 \(1 - PC\) 充当物理违背严重程度的自适应调制因子,对严重违背物理规律的样本施加更强惩罚;而在非物理背景区域 \(1 - M\),由于正负样本在语义上应当完全等价,PhysPO 引入领带区域中立性正则项 \(\mathcal{L}_{\text{Tie-DPO}}\),以语义一致性指标 \(SA\) 为自适应加权因子,强制要求背景区域的正负样本偏好差异趋近于 0:

\[ \mathcal{L}_{\text{Tie-DPO}} = \mathbb{E}_{d \sim \hat{\mathcal{D}}}\left[ SA \cdot \left| \mathbb{E}_t \left[ s'(x^w, t, \theta, 1 - M) - s'(x^l, t, \theta, 1 - M) \right] \right| \right] \]

配合全域全局扩散 DPO 损失 \(\mathcal{L}_{\text{DPO}}\),最终的混合训练目标 \(\mathcal{L}_{\text{total}} = \lambda_{\text{PA-DPO}}\mathcal{L}_{\text{PA-DPO}} + \lambda_{\text{Tie-DPO}}\mathcal{L}_{\text{Tie-DPO}} + \lambda_{\text{DPO}}\mathcal{L}_{\text{DPO}}\) 既保证了全局结构生成的稳定性,又切断了利用背景噪声抄近道的捷径优化通道。

实验关键数据

主实验

在代表性的物理常识与视频生成基准 VideoPhy 以及 PhyGenBench 上,PhysPO 分别基于 Wan2.1-T2V-1.3B 和 CogVideoX-5B 进行了全面评估。指标包含衡量图文对齐的语义遵从度(SA)和衡量物理规律遵从度的物理常识分(PC)。

Table 1: VideoPhy 基准测试对比结果

方法 (Methods) 刚体-刚体 SA/PC 刚体-流体 SA/PC 流体-流体 SA/PC 综合 SA↑ 综合 PC↑ 推理耗时 (s)
VideoCrafter2 50.4 / 32.2 50.7 / 27.4 48.1 / 29.1 50.3 29.7 -
DreamMachine 55.1 / 21.7 59.6 / 23.3 58.2 / 18.2 57.5 21.8 -
LaVie 40.8 / 18.3 48.6 / 37.0 69.1 / 50.9 48.7 31.5 -
HunyuanVideo 55.2 / 16.1 67.1 / 30.1 54.5 / 54.5 60.2 28.2 1080
Cosmos-Diffusion-7B - / - - / - - / - 57.0 18.0 600
PhyT2V - / - - / - - / - 61.0 37.0 1800
WISA - / - - / - - / - 67.0 38.0 220
PhysMaster - / - - / - - / - 67.0 40.0 26
Wan2.1-T2V-1.3B 基线 34.9 / 10.0 64.3 / 25.4 43.5 / 48.1 49.0 24.0 180
PhysPO-Wan (本文) 55.4 / 26.0 80.1 / 44.7 62.0 / 81.5 67.0 (+36.7%) 42.6 (+77.5%) 180
CogVideoX-5B 基线 53.1 / 18.2 75.3 / 32.9 56.4 / 61.8 63.1 31.4 170
VideoREPA-CogVideoX 58.0 / 28.0 82.9 / 39.0 80.0 / 74.5 72.1 (+14.3%) 40.1 (+27.7%) 170
PhysPO-CogVideoX (本文) 62.3 / 31.8 82.5 / 52.2 87.0 / 88.9 74.7 (+18.4%) 49.4 (+57.3%) 170

Table 2: PhyGenBench 基准测试对比结果

方法 (Methods) 语义遵从度 SA↑ 物理常识 PC↑
VideoCrafter 27.0 20.0
OpenSora 23.0 21.0
Cosmos 43.0 14.0
PhyT2V 38.0 42.0
WISA 40.0 43.0
Wan2.1-T2V-1.3B 基线 30.0 22.0
PhysPO-Wan (本文) 43.0 (+43.4%) 46.0 (+109.1%)
CogVideoX-5B 基线 39.0 41.0
PhysPO-CogVideoX (本文) 52.0 (+33.3%) 64.0 (+56.1%)

消融实验

在 Wan2.1-T2V-1.3B 骨干网络上针对反事实数据集构建、局部物理掩码偏好损失以及背景中立性正则化进行系统消融。

Table 3: PhyGenBench 上的模块消融研究

配置 (Settings) 语义遵从度 SA↑ 物理常识 PC↑ 说明
PhysPO (完整模型) 43.0 46.0 完整模型配置
w/o CounterPhy 35.0 (-18.6%) 38.4 (-16.5%) 替换为随机生成的非反事实负例
w/o PA-DPO + Tie-DPO (VanillaDPO) 33.2 (-22.8%) 26.0 (-43.5%) 仅使用标准全图视频扩散 DPO
- w/o PA-DPO 39.1 (-9.1%) 29.4 (-36.1%) 去除局部物理掩码与自适应加权
- w/o Tie-DPO 34.6 (-19.5%) 40.2 (-12.6%) 去除背景领带区域中立性正则项

关键发现

  • 局部掩码对物理常识提升最具决定性:消融实验显示,一旦去掉局部物理偏好损失 PA-DPO,PC 分数暴跌 36.1%(从 46.0 跌至 29.4),甚至当完全退化为传统 VanillaDPO 时,PC 相对降幅达到 43.5%。这表明如果缺乏局部掩码,全局梯度会严重稀释物理运动细节的优化信号。
  • 背景中立性正则有效防御语义破坏与捷径坍缩:去掉 Tie-DPO 后,语义对齐度 SA 发生最大跌幅(下降 19.5%)。定性分析指出,缺乏背景中立性约束时,模型在学习倒水动作时会将水倒向杯外,或者修改背景来投机取巧,验证了中立性约束保护无违例区域语义等价的关键作用。
  • 反事实负样本构建质量直接决定对齐上限:不采用 CounterPhyPipe 构建的反事实样本,而使用常规独立噪声负样本时,SA 下降 18.6%、PC 下降 16.5%。定性展示中模型出现了“水杯倾倒却无水溢出”的违反常理现象,证明严格控制背景不变的硬负例对于物理因果学习不可或缺。

亮点与洞察

  • 反事实硬负例的高效生成范式:以往构建 DPO 偏好对需要对单 prompt 重复采样多条候选视频再打分挑选,不仅开销惊人且背景各异。CounterPhyPipe 借助 MLLM 提出反事实假设配合首尾帧条件生成,将背景完全对齐并仅对局部物理状态做“外科手术式”修改,过滤淘汰率仅 8%,为视频偏好对构建提供了高效可复制的工程标准。
  • 频域时空高频解耦物理敏感区:敏锐捕捉到物理破坏必伴随空间轮廓撕裂或时序速度阶跃的本质特性,创新性地采用 2D/1D 傅里叶高通滤波自适应圈定掩码,无需昂贵的人工标注或不可靠的检测分割大模型,以极简优雅的数学工具完成了局部掩码提取。
  • 物理自适应加权与背景梯度归零协同:提出用 \((1 - PC)\) 加权物理区域惩罚、用 \(SA\) 加权背景中立性正则的对偶设计,既保证了严重物理违例受到强约束,又确保背景区域零梯度干扰,彻底解决了生成式偏好优化中的捷径对齐顽疾。

局限与展望

  • 依赖预训练首尾帧生成与图像编辑模型的上限:CounterPhy 数据集的生成高度依赖 Wan2.1-FLF2V 和 Qwen-Image-Edit 的表现。在极端复杂的非刚体碰撞或剧烈流体紊流中,图像编辑模型本身可能无法准确呈现反事实终帧,从而引入数据噪声。
  • 高频掩码在复杂背景运动下的特异性受限:当视频伴随剧烈的相机快速推进、旋转或自然界高频纹理扰动(如茂密树叶摇曳、复杂水波反光)时,高通滤波器可能将背景运动误判为物理实体变动,导致掩码扩大并削弱局部聚焦效果。
  • 未来改进方向:可考虑将单目深度估计或 3D 点云运动流与频域分析相结合,构建兼顾几何深度与高频动态的三维物理掩码;此外,该局部偏好优化思路可进一步拓展至交互式物理仿真与具身智能世界模型(World Models)中。

相关工作与启发

  • vs Vanilla Video DPO (如 VideoDPO, Diffusion-DPO): 传统扩散 DPO 在全视频隐空间施加均质梯度,正负样本通常来自独立初始噪声,导致优化信号被全局色调、背景和运动风格差异主导,模型容易投机取巧;PhysPO 构建背景像素级一致的反事实对比对,并引入时空高频掩码与中立性正则,将物理对齐收敛在局部发生区域。
  • vs PhyGDPO / PhysMaster: PhyGDPO 采用真实视频与随机生成视频组合并依赖组内排序,依然无法避免全局背景不匹配问题;PhysMaster 依赖特定物理先验与复杂多步骤采样;PhysPO 无需多候选反复采样(每 prompt 一次生成),在 VideoPhy2 的 Hard 赛道上超越 PhyGDPO 达 19.8%(0.0532 vs 0.0444)。
  • vs WISA / VideoREPA: WISA 和 VideoREPA 依赖有监督微调(SFT)和多专家路由,但由于缺少对比负信号,极易对表面相关性过拟合;PhysPO 通过显式惩罚局部反事实违例,在相同基座 CogVideoX-5B 上全面超越 VideoREPA(VideoPhy PC 49.4 vs 40.1)。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 巧妙提出基于时空高频滤波的物理掩码与反事实首尾帧数据构建,局部 DPO 与背景中立性正则机制创新性极强。
  • 实验充分度: ⭐⭐⭐⭐⭐ 覆盖 VideoPhy、PhyGenBench 和 VideoPhy2 三大标杆基准,涵盖主实验、消融实验及细致的定性动力学比对。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密,图文对照清晰,公式推导与物理动机自洽。
  • 价值: ⭐⭐⭐⭐⭐ 为解决视频生成违背物理常识的核心瓶颈提供了计算友好且效果拔群的后训练对齐方案。