PhyProbe: Rethinking Physical Consistency Evaluation in Generated Videos¶
会议: NeurIPS2026
arXiv: 2609.38377
领域: 视频生成
关键词: 物理一致性、视频评估、时空表示、成对排序、分数校准
一句话总结¶
PhyProbe 在冻结的视频编码器上训练轻量评分头,用异构数据提供的排序、严重程度回归与端点锚定共同学习单视频物理违规分数,在四个物理基准中的三个取得最高成对准确率,但其分数仍是感知合理性的代理而非物理定律检验。
研究背景与动机¶
生成视频已经能保持清晰纹理和连贯运动,却仍可能出现物体穿透、液体运动异常或实体突然变形。画面好看不代表动力学合理,而一个二元的“合理/不合理”判断也不足以比较轻微偏离和严重失常。用于评估视频生成的指标需要同时回答谁的问题更严重,以及不同数据集上的一个分值是否具有相近含义。
现有视觉语言模型(VLM)通常通过提示词和语言描述判断物理合理性,容易忽略细微运动变化;在人类标注上微调也可能学到特定数据集的语义线索。直接拟合人的绝对评分同样有问题:标注者倾向于发现显著异常,评分尺度随生成质量变化,而且物理违规经常与模糊、闪烁等视觉缺陷共现。相对排序可能可靠,却无法独自确定绝对尺度;绝对标签提供量级,却不是精确测量。
本文没有试图让评估器解释每条物理定律,而是把任务改写为视频表示上的连续测量:预训练编码器负责提供运动与视觉结构信息,评分头从不同来源分别学习顺序、量级和尺度端点。核心 idea:用冻结表示上的轻量探针整合成对排序、噪声回归和锚定监督,使单视频违规分数既能比较大小,又尽量保持统一尺度。
方法详解¶
整体框架¶
输入是真实或生成视频,输出是物理违规分数,越低越合理。推理不需要配对参考视频、共享提示词或文字解释:视频经过固定长度采样和冻结编码器,利用统计池化形成描述符,三层 MLP 输出原始分值,再裁剪到 \([0,1]\)。
训练与推理的关键区别是,训练要借助视频对和多来源标签约束这个单视频评分函数。整体由“冻结统计探针”“异构监督构建”和“联合尺度校准”组成;视频对只用于训练比较和测试指标计算,不是推理接口的必需输入。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["视频/训练视频对"] --> B["冻结统计探针"]
T["七类训练数据"] --> C["异构监督构建"]
B -->|训练原始分值| D["联合尺度校准"]
C -->|排序/量级/锚点| D
D -.->|仅更新评分头| B
B -->|推理时裁剪| O["单视频违规分数"]
关键设计¶
1. 冻结统计探针:把表示学习与尺度学习分开
默认骨干是约 2B 参数的 PE-Core-G14-448,训练时完全冻结。视频按 16 fps 采样为 48 帧,缩放时保留长宽比,用像素值 0.5 的灰色边条补成正方形,再按骨干要求归一化。这样评分头面对的是统一采样格式,而不是由不同尺寸和裁剪策略引出的额外差异。
每帧的 patch token 先做空间平均,得到帧级特征;再沿时间计算均值、标准差和最大值,并拼接成三倍特征维度的描述符。均值保留视频整体内容,标准差反映帧间变化,最大值保留某些显著激活。这里的最大值是特征维度上的统计量,不是对每帧物理错误概率取最大。
描述符进入使用 GELU 的三层 MLP,最终统计评分头有 1.02M 可训练参数。作者把捕捉时空信息的负担交给预训练骨干,而不是重新训练大型 VLM 或在评分头中堆注意力。这种设计便于比较不同表示,也使异构监督主要改变“怎样读出违规严重程度”,而不是同时重塑整个视觉空间。
不过,统计池化本身不显式保留帧序。它可以利用编码器特征中已有的动态信息,却不能凭均值、标准差和最大值重建完整因果过程;“长度不敏感的聚合”也不等于已验证任意时长的视频评估。短暂事件被稀释和长程因果编码不足,是这种轻量化选择的重要边界。
2. 异构监督构建:让内容对应关系不再成为唯一捷径
训练集约有 371K 视频对,来自 PAI-Bench、VideoPhy2、VideoFeedback2、BrokenVideos、ImpossibleVideos、TRAVL 和 Kinetics-700。它既包含共享图像/文本的真实—生成对,也包含无语义对应的生成—生成对,以及同动作类别的真实—真实对。若训练只比较同一提示词的两个视频,模型可能依赖局部内容差异;跨提示词比较则要求分数在不同场景间仍能表达违规程度。
各来源提供的监督不是一律当作精确真值。PAI-Bench 以真实参考视频优于对应生成视频构造排序,并用真实视频做低违规锚点。VideoPhy2 在动作类别内按物理正确性评分配对,VideoFeedback2 跨提示词配对且只保留至少相差 1 级的评分。Kinetics-700 的两个真实视频被视为排序平局,同时锚定低违规端点;平局标签不是删掉样本,而是鼓励二者分数接近。
ImpossibleVideos 提供真实/反事实失败视频的跨内容比较。TRAVL 则对每个视频的物理问答标签做多数投票,删除票数相同的样本,再配对合理与不合理视频。两者提供排序和合理/违规端点,但这些仍是数据集给出的操作性标签,不意味着所有生成视频都应被普遍判成严重违规。
对 1–5 的物理正确性标签,作者不是简单线性反转,而使用违规下限映射(violation-flooring):5、4、3、2、1 分分别变成 0、0.5、0.667、0.833、1。其用意是给人类尚未明确感知的低违规区域留出空间,而把可见违规压到较高区间。这是经验设计,不是物理单位换算;尤其 \([0,0.5)\) 没有直接严重程度标注,其细分含义尚未被独立验证。
BrokenVideos 没有直接的成对偏好标签,作者用掩码面积、中心接近度和掩码存在帧比例构造启发式异常分数,权重依次为 0.6、0.3、0.1。掩码存在帧比例衡量异常在时间上的持续程度,中心接近度提高画面中心缺陷的影响;仅保留原始启发式分差至少 0.4 的对,再将回归量级映射至 \([0.5,0.9]\)。这些标签也覆盖视觉伪影,因此不是纯粹动力学错误的测量。
数据量大并不自动意味着监督更可靠。训练按数据集权重采样,避免 140K 的 Kinetics-700 对压倒较小的人类评分来源;配对池每 2.5K 步重采样。附录对 BrokenVideos 的 85 对样本进行了四人验证,启发式与非平局人类多数意见的一致率为 80.6%(58/72),支持其作为辅助标签,但不能消除标签噪声。
3. 联合尺度校准:分别约束顺序、量级与端点
成对排序采用 Bradley–Terry 模型:以两个原始分值之差经过 sigmoid,表示第一个视频更严重违规的概率。标签为 1、0 或 0.5,分别表示第一个更严重、第二个更严重和真实—真实平局;二元交叉熵使评分头学会相对顺序。排序只看差值,无法单独确定评分的平移和绝对量级,因此高排序准确率不保证分数尺度可用。
量级分支用 Huber 损失拟合归一化的噪声严重程度标签,阈值为 \(\delta=0.5\),大误差进入线性惩罚,减少少量噪声标签的影响。锚定分支对高置信度合理样本拟合 0,对明确失败样本拟合 1,使用均方误差。前者提供中间量级信息,后者把尺度两端固定在可解释参照附近;它们承担的角色不同,不能用一个回归标签概括。
用 \(\tilde{s}\) 表示未裁剪的评分头输出,训练目标可写为:
这里 \(y_v\) 是严重程度回归目标,\(I(v)\) 为 0 或 1 的锚点标签,排序项是上述分差概率的交叉熵。公式保留原文的三种监督结构,并显式区分原始输出;原文主文在部分训练公式中统一使用 \(s\),附录说明训练评分头实际上不受区间约束。
推理时才得到报告分数:
因此“有界分数”来自报告阶段的裁剪,不是网络末端 sigmoid,也不是损失保证所有输出严格落在区间内。裁剪还可能把极端原始分值变成同分,所以表 4 的原始输出范围和最终报告区间应分开理解。论文亦明确指出,Spearman 与 Pearson 相关性分别衡量顺序和线性关联,本身都不能证明绝对校准。
损失函数 / 训练策略¶
只训练评分头,使用 AdamW,学习率 \(3\times10^{-4}\)、权重衰减 0.01;先预热 500 步,再余弦衰减至零,总计 10K 步,批大小为 8。作者报告使用 4 张 NVIDIA H100 可在 24 小时内训练,并以衰减 0.9999 的 EMA 权重进行所有评估;这不是整个系统无需大型骨干计算的承诺。
排序标签还做与同数据集、当前批次评分差有关的平滑:最大分差对使用 0.05,接近平局的对最多平滑到 0.095,无标量标签的对使用 0.05。更含糊的比较因此不会获得与明显差异同样尖锐的目标。各来源采样概率依次为 PAI-Bench 0.059、VideoPhy2 0.176、VideoFeedback2 0.294、BrokenVideos 0.118、ImpossibleVideos 0.059、TRAVL 0.176、Kinetics-700 0.118。
实验关键数据¶
主实验¶
下表选自原文表 2。准确率单位为 %,相关性列为 Spearman \(\rho\);R 表示真实视频、G 表示生成视频。ImplBp 有 150 对,VP2p 有 1280 对且共享文本提示词,PhyDExp 和 VF2p 各有 2000 对且无语义对应。平均准确率按各基准对数加权,不是四列的简单平均。
| 方法 | ImplBp(R–G) | VP2p(G–G) | PhyDExp(R–G) | VF2p(G–G) | 加权平均 | VP2 \(\rho\) | VF2 \(\rho\) |
|---|---|---|---|---|---|---|---|
| VP2-AutoEval | 28.0 | 28.5 | 30.5 | 36.3 | 32.1 | 0.359 | 0.235 |
| V-JEPA Surprise | 33.3 | 46.3 | 49.0 | 45.5 | 46.6 | 0.065 | 0.121 |
| VideoScore2 | 68.7 | 49.7 | 60.6 | 65.0 | 59.9 | 0.197 | 0.462 |
| Gemini-3.1-Flash-Lite | 91.3 | 61.8 | 89.0 | 74.5 | 77.3 | 0.302 | 0.419 |
| Gemini-3.1-Pro | 95.2 | 70.5 | 86.2 | 73.7 | 78.1 | 0.277 | 0.402 |
| PhyProbe | 98.0 | 66.1 | 98.9 | 75.2 | 82.4 | 0.293 | 0.596 |
PhyProbe 的 VF2 Pearson \(r\) 为 0.604,VP2 为 0.302。比较人类合理性与违规分数时必须对齐方向,例如使用 \(1-s(v)\);不能把“高违规”直接解读为“高合理性”。PhyProbe 并非所有指标最佳:Gemini-3.1-Pro 在 VP2p 上为 70.5%,高于 66.1%;VP2-AutoEval 的 VP2 相关性也更高。
一般偏好结果来自表 3:MonetBench 含平局时 PhyProbe 为 72.7%,VisionReward 为 68.2%,VideoReward 为 56.1%;去掉该平局协议后分别为 71.0%、72.2%、58.2%。PhyProbe 在 Rapidata-I2V 为 62.7%,在 RewardBench Overall 无平局协议为 65.3%,低于 VideoReward 的 73.6%。这些结果支持迁移,但不是一般偏好全面领先。
消融实验¶
下表选自表 4,使用同一 PE-Core 骨干。输出范围是裁剪前的有效范围;负零按原文保留。
| 配置 | PhyDExp | VF2p | VP2p | ImplBp | VF2 \(\rho\) | 原始输出范围 |
|---|---|---|---|---|---|---|
| 去掉排序损失 | 94.7 | 75.6 | 61.9 | 99.2 | 0.614 | \([-0.07,0.88]\) |
| 去掉量级损失 | 98.7 | 75.3 | 62.3 | 94.1 | 0.584 | \([-1.89,3.45]\) |
| 去掉锚定损失 | 68.7 | 79.3 | 64.4 | 84.9 | 0.664 | \([-0.40,4.13]\) |
| 完整模型 | 98.9 | 75.2 | 66.1 | 98.0 | 0.596 | \([-0.00,1.15]\) |
下表选自表 6,比较同一骨干上的聚合评分头;参数数目只统计可训练部分。
| 评分头 | 可训练参数 | VP2p 准确率(%) | VP2 \(\rho\) | VF2p 准确率(%) | VF2 \(\rho\) |
|---|---|---|---|---|---|
| 均值池化 MLP | 0.36M | 61.0 | 0.277 | 73.2 | 0.578 |
| 注意力池化 | 6.92M | 63.7 | 0.292 | 75.0 | 0.612 |
| 统计池化(均值+标准差+最大值) | 1.02M | 66.1 | 0.293 | 75.2 | 0.596 |
关键发现¶
- 锚定是跨真实—生成场景的重要约束:移除后 PhyDExp 从 98.9% 降到 68.7%,但 VF2p 反而升至 79.3%。这说明更高的局部排序或相关性不能代替稳定尺度及跨域表现。
- 统计池化用远少于注意力池化的参数取得更高成对准确率,但 VF2 相关性为 0.596,低于注意力的 0.612;它是效果与复杂度的选择,不是逐指标支配。
- 表 7 使用同一 V-JEPA2 ViT-H/16 骨干时,PhyProbe 相对 Surprise 在四个基准提高 48.1、13.9、21.7、30.8 个百分点,说明提升不只来自换更大骨干。
- 表 9 去掉 VideoFeedback2 后,VF2p 从 75.2% 降至 58.0%;去掉 VideoPhy2 后,VP2p 从 66.1% 降至 58.3%。异构监督有部分迁移,也有明显数据集依赖。
- 表 10 的线性归一化在四个基准为 96.7%、60.0%、96.5%、71.0%,均低于违规下限映射。表 11 的辅助人类研究只有 30 对、四名非专家,Fleiss \(\kappa=0.148\),不宜据此宣称尺度已获强验证。
亮点与洞察¶
- 将排序、量级和端点分工是一种可迁移的评估器设计。面对来源不同且质量不一的标注,不必要求每个来源同时给出可靠顺序和精确绝对值。
- 冻结骨干上的探针使“表示是否有用”和“读出目标是否合适”能够分别检查。同骨干对比是重要证据,而不是只拿 2B 的评估器与预测误差基线比较。
- 无提示词、单视频推理降低了应用门槛。但跨内容可比较来自训练监督和校准假设,不能只因接口没有提示词就推断评估器已经消除了语义捷径。
局限与展望¶
- 长程因果违规、瞬时状态变化,以及少见但物理上合理的真实运动都可能误判;固定片段与统计聚合不能保证覆盖这些事件。可以进一步研究多时间尺度采样和保持事件顺序的表示。
- 监督混合了物理感知与视觉质量,BrokenVideos 尤其包含非物理伪影。要证明物理一致性被单独测量,应控制场景、提示词、生成器和视觉质量,只改变物理因素;本文没有这样的受控基准。
- 附录 C 明确 VF2 测试集与训练集共享全部提示词和生成器,虽无监督实例重合,却不是提示词/生成器分布迁移。VP2 不共享提示词但部分共享生成器,二者泛化含义不能混写。
- \([0,0.5)\) 缺少直接严重程度标签,锚点也是近似端点;原始完整模型仍到 1.15。因此稳定参考尺度是有实验证据的设计目标,不应被描述为具有物理单位的绝对测量。
- 原文表 2 的 VideoScore2 VP2p 为 49.7%,表 8 在最小评分差至少 1 时为 49.8%,且后者表头写作 VideoScore。保留这一口径/数值差异,不自行统一;附录 B.1.1 亦有“raw scores”措辞,归一化机制应以 B.1 的显式映射和 B.2 为准。
- 物理合理性不证明视频真实发生过。该评估器不能作为真实性或事实正确性的判定工具。
相关工作与启发¶
- vs VideoPhy2-AutoEval:后者用微调 VLM 输出离散物理常识评分,PhyProbe 学连续读出。附录表 19 显示前者 VP2p 平局率为 58.8%,全体准确率 28.5%,仅在模型非平局对上为 69.1%;直接比较全体准确率时应解释离散评分导致的平局,而非笼统称其完全不懂物理。
- vs VideoScore2:后者通过语言推理评估多个质量维度,PhyProbe 不生成解释并整合跨来源物理监督。前者提供的 VideoFeedback2 同时是本文训练来源,因此对应测试成绩必须结合分布重合与留一数据集实验看。
- vs V-JEPA Surprise:预测误差不天然等于物理违规严重程度。相同表示上的监督评分头显著改善结果,启发是将预训练世界表示视为可读出的基础,而不是直接把其预测误差当最终指标。
评分¶
- 新颖性: 4/5 — 冻结探针本身简单,异构监督下的测量分工更有价值。
- 实验充分度: 4/5 — 有跨配对类型、损失、骨干、聚合与留一来源实验,但缺少隔离物理因素的受控验证。
- 写作质量: 4/5 — 方法与校准边界解释清楚,少量表格数值和标签措辞存在差异。
- 价值: 4/5 — 适合视频生成的轻量连续评估研究,不应代替物理验证或真实性鉴定。