Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://xthomasbu.github.io/video-gen-evals/
领域: 图像生成
关键词: 视频生成评估、人体动作一致性、时序连贯性、SMPL骨骼几何、TAG-Bench-v0
一句话总结¶
针对现有纯视觉与多模态大模型评测中外观偏置强、缺乏时序解剖结构感知的问题,本文构建了融合 3D/2D 人体几何与时序动态的一阶导数动作流形,提出了无需基准视频的动作一致性与时序连贯性两项量化指标,在全新构建的 TAG-Bench-v0 评测集上与人类感知的相关性相比最佳大模型提升超 68%。
研究背景与动机¶
视频生成模型(如 Wan2.1/2.2、Runway Gen-4、HunyuanVideo 等)在逼真度与视觉生成质量上取得了突破性进展,甚至被视为潜在的物理世界模拟器。然而,在涉及精细人体动作生成的场景中,合成视频依然频繁出现解剖学失真、肢体突变、关节异位以及动作时序停滞等严重违背物理常识的瑕疵。令人困扰的是,现有的视频质量评估指标(如基于单帧的 PSNR、SSIM、LPIPS、CLIP-sim,或粗粒度分布距离 FVD)仅关注静态外观与单帧画质,完全丧失了对精细时序运动学与解剖学合理性的捕捉能力。
即便是当前依赖通用多模态大模型(MLLM)作为裁判的方法(如 VideoScore、VideoPhy),也暴露出明显的局限性。这些多模态大模型大多严重偏向静态画面纹理,仅评估宏观物理现象(如重力漂浮或物体碰撞),无法感知人体复杂的生物力学约束。此外,现有视频生成基准测试(如 EvalCrafter、VBench-2.0)同样缺乏针对人体全身动作连续性与时序一致性的专门评测集。这种评测工具的缺失导致生成模型在人体动作维度的退化无法被精确定量与诊断。
针对上述瓶颈,本文认为评估生成人体动作真实性的关键,在于显式刻画真实人类动作在解剖几何与时序平滑性上的紧凑流形分布。核心 idea:联合 3D SMPL 骨骼参数、2D 关键点与外观特征及其一阶时序导数构建以人体为中心的特征空间,利用对比学习与硬负样本约束学习真实世界人体动作流形,并通过投射距离与轨迹平滑度分别定量评估生成视频的动作一致性与时序连贯性。
方法详解¶
整体框架¶
本文框架旨在量化生成视频与真实人类动作物理分布之间的偏离程度。系统由人体为中心的特征提取、静态与动态双分支时序卷积编码、帧内自适应注意力融合、滑动窗口 Transformer 时序聚合,以及流形距离度量模块构成。输入视频按固定长度 \(T=32\) 帧切分为带有重叠的局部时序窗口,经过编码器映射后,通过两项定量指标对动作质量进行诊断。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入视频切片<br/>固定时序窗口 T=32 帧"] --> B["多源特征提取与一阶差分<br/>3D SMPL + 2D关键点 + ViT外观 + 导数"]
B --> C["双通路时序卷积编码<br/>静态特征与动态残差残差相加融合"]
C --> D["自适应注意力单帧融合<br/>按通道动态加权汇聚"]
D --> E["时序Transformer聚合与双目标训练<br/>监督对比损失 + 时序扰动硬负样本损失"]
E --> F["量化指标计算<br/>动作一致性 S_cons + 时序连贯性 S_temp"]
关键设计¶
1. 兼顾几何约束与异常敏感的多源静态与一阶导数特征提取
针对单一视觉或几何特征在表征人体动作时的固有盲区,本文设计了多模态静态特征集 \(S = \{\theta, \beta, go, kp2D, f_{vis}\}\)。其中利用 TokenHMR 提取 SMPL 模型的 3D 关节姿态角度 \(\theta\)、体型特征 \(\beta\) 以及骨盆全局朝向 \(go\) 作为外观不变量,为模型引入强解剖学约束;引入 DWPose 提取的 2D 关节点 \(kp2D\) 补充不受 SMPL 强先验限制的肢体拉长、关节错位等畸变;同时抽取 ViT-H/16 外观特征 \(f_{vis}\) 补充衣物与人机交互线索。更为关键的是,针对生成视频中肢体形态突变和非自然形变的痛点,本文提取各特征在相邻帧之间的一阶时序导数作为运动特征集合 \(U = \{m_\theta, m_\beta, m_{go}, m_{kp2D}, m_{fvis}\}\)(旋转量计算相对旋转角,标量与欧氏向量计算 \(\ell_2\) 范数),从而极度敏感地捕获时序突变信号。
2. 双通路扩张卷积与可学习注意力加权融合机制
针对多源特征时序演化速率与重要性不一致的问题,模型为静态特征 \(s_{k,t} \in S\) 与动态特征 \(u_{k,t} \in U\) 分别部署 1D 扩张时序卷积块 \(\phi_{static}^k\) 与 \(\phi_{motion}^k\)(核大小 5,扩张率分别为 1, 2, 4)。动态通路通过残差相加形式补强静态通路: $\(\mathbf{e}_{k,t} = \phi^k_{\text{static}}(s_{k,t}) + \phi^k_{\text{motion}}(u_{k,t})\)$ 随后,为消除各特征在不同动作场景下的冗余,模型通过可学习查询向量 \(\mathbf{q} \in \mathbb{R}^d\) 与线性投影矩阵 \(W_a\) 计算 scaled dot-product 注意力权重 \(\alpha_{k,t}\),实现帧内多特征的加权和: $\(\mathbf{f}_t = \sum_k \alpha_{k,t} \mathbf{e}_{k,t}, \quad \alpha_{k,t} = \text{softmax}_k\left(\frac{\mathbf{q}^\top W_a \mathbf{e}_{k,t}}{\sqrt{d}}\right)\)$ 使模型能自适应侧重于对当前动作最具鉴别力的几何或外观通道。
3. 动作语义与时序硬负样本联合优化的流形学习
在获取各帧嵌入后,在序列前拼接可学习的 \([CLS]\) 标记并通过 4 层 Transformer 编码器捕获长程动作依赖,输出窗口级向量 \(\mathbf{z}_{CLS}\) 与逐帧表征 \(\{\mathbf{z}_t\}_{t=1}^T\)。为了使潜空间同时具备动作分类辨别力与时序合理性感知力,设计了联合优化目标: $\(\mathcal{L} = \mathcal{L}_{\text{supcon}} + \lambda \mathcal{L}_{\text{hard-negative}}\)$ 其中 \(\mathcal{L}_{\text{supcon}}\) 基于真实视频动作标签拉近同类动作、推远异类;\(\mathcal{L}_{\text{hard-negative}}\) 则专门针对真实样本构造时序畸变变体作为硬负样本——包括乱序打乱(破坏运动连续性)、首帧复制重复(模拟动作卡顿冻结)、倒序播放(破坏因果物理时序)。这种硬负样本对抗训练强迫编码器学习真实运动动力学流形。
4. 动作一致性与时序连贯性的双维度量化评测体系
基于学得的真实动作流形,提出了两项互补且完全免参考视频(Reference-free)的量化指标: - 动作一致性(Action Consistency, \(S_{cons}\)):计算测试生成视频所有窗口 \(\mathbf{z}_{CLS}\) 的均值 \(\mathbf{z}_{genvideo}\) 与真实数据集中该动作类别的聚类中心 \(\mathbf{c}_k\) 之间的欧氏距离: $\(S_{cons} = \|\mathbf{z}_{genvideo} - \mathbf{c}_k\|_2\)$ 数值越小代表越贴近真实世界该动作的标准语义与动力学分布。 - 时序连贯性(Temporal Coherence, \(S_{temp}\)):通过统计窗口内相邻帧表征之间的跃迁幅度来评估运动是否平滑连续: $\(S_{temp} = \frac{1}{T-1} \sum_{t=1}^{T-1} \|\mathbf{z}_{t+1} - \mathbf{z}_t\|_2\)$ 数值越小表示帧间演变平缓且符合物理规律,避免了突兀的闪烁或变形。
实验关键数据¶
主实验¶
评估在专门构建的 TAG-Bench-v0(包含 Wan2.1、Wan2.2、Hunyuan、OpenSora、Runway Gen-4 生成的 300 个样本及 246 名受试者标注)上展开,汇报与人类评分的 Spearman 秩相关系数(\(\rho\))。
Table 1: TAG-Bench-v0 上各评估方法与人类主观打分的 Spearman 相关性 (\(\rho\))
| 方法类型 | 评估模型 / 指标 | 动作一致性 \(\rho \uparrow\) | 时序连贯性 \(\rho \uparrow\) |
|---|---|---|---|
| 基线对照 | Random | -0.07 | -0.11 |
| 自动特征指标 (Top-3) | VideoMAE(UCF101)-cls | 0.18 | 0.17 |
| DINO-sim | 0.08 | 0.21 | |
| CLIP-sim | 0.03 | 0.16 | |
| 微调MLLM指标 (Top-3) | VideoPhy-2 (Physical Commonsense) | 0.28 | 0.37 |
| VideoPhy-2 (Semantic Adherence) | 0.19 | 0.16 | |
| VideoScore2 (Physical Consistency) | 0.18 | 0.17 | |
| 闭源MLLM Prompting (Top-3) | GPT-4o | 0.34 | 0.31 |
| Gemini-2.5-Pro (4x10 grid) | 0.31 | 0.26 | |
| GPT-5 | 0.45 | 0.38 | |
| 本文方法 (Ours) | \(S_{cons}\) (动作一致性指标) | 0.61 | 0.45 |
| \(S_{temp}\) (时序连贯性指标) | 0.53 | 0.64 | |
| 相对最佳基线提升 | \(\Delta\) over best baseline | +0.16 (+35.6%) | +0.26 (+68.4%) |
| 人类标注上限 | Human vs Human (Inter-rater) | 0.72 | 0.71 |
消融实验¶
消融实验验证了损失函数组合(Table 2)与输入特征模块(Table 3)对指标准确性的贡献。
Table 2 & 3: 损失函数与输入特征模块消融分析 (Spearman \(\rho\))
| 实验配置 | 包含特征 / 损失组件 | 动作一致性 \(\rho\) | 时序连贯性 \(\rho\) | 说明 |
|---|---|---|---|---|
| 完整模型 (Full) | \(\mathcal{L}_{supcon} + \mathcal{L}_{hard-neg}\) (全特征) | 0.61 | 0.64 | 完整模型表现最优 |
| 损失消融 | 无 \(\mathcal{L}_{supcon}\)(仅保留硬负样本) | 0.26 | 0.38 | 缺乏语义聚类导致判别力剧降 |
| 损失消融 | 无 \(\mathcal{L}_{hard-neg}\)(仅保留对比损失) | 0.54 | 0.57 | 缺乏时序扰动先验,连贯性下降 |
| 特征消融 | 遮蔽 3D 姿态角 (\(\theta\)) | 0.56 | 0.57 | 缺少关节旋转物理约束 |
| 特征消融 | 遮蔽 2D 关键点 (\(kp2D\)) | 0.56 | 0.59 | 缺少对解剖畸变无偏先验捕获 |
| 特征消融 | 遮蔽所有动态时序导数 (\(U\)) | 0.46 | 0.50 | 移除一阶导数导致动态感知断崖式下跌 |
| 纯视觉表征对比 | 仅使用 CLIP / DINOv2 特征 | 0.12 ~ 0.14 | 0.19 ~ 0.26 | 证实纯外观表征无法评估人体动力学 |
关键发现¶
- 动态导数是时序异常的核心探测器:在输入特征消融中,去除一阶差分动态特征(\(U\))引起最大幅度的性能衰减(动作一致性从 0.61 跌至 0.46,时序连贯性从 0.64 跌至 0.50),表明运动速度与突变敏感度直接决定了评估上限。
- 生成模型能力剖析:Wan2.2 在整体胜率(Win Ratio)上名列榜首(动作一致性胜率 0.77,时序连贯性胜率 0.72),全面超越商业闭源模型 Runway Gen-4(0.65 与 0.61)。
- 旋转类动作呈现全行业普遍缺陷:包含剧烈全身旋转的复杂动作(如铅球掷 Shotput、铁饼掷 ThrowDiscus)在全部 5 个生成模型中均录得极高的异常距离得分;而相对受限的往复动作(如俯卧撑 PushUps、引体向上 PullUps)表现显著更佳,说明当前视频世界模型在人体旋转运动学与视角自遮挡推断上存在普遍物理缺陷。
亮点与洞察¶
- 解耦几何结构先验与无约束 2D 畸变感知:巧妙地将强先验的 SMPL 3D 网格恢复(确保生物力学合规)与无参数约束的 2D 关键点(用于直接捕捉生成模型特有的肢体拉长和多肢畸变)互补融合,构建了完备的解剖学防线。
- 一阶时序导数作为生成伪影的天然放大镜:通过计算帧间特征变化率,将静态模型极易忽略的轻微局部畸变和跳帧卡顿转化为强烈的动态跳变,极低成本地实现了对时序违和感的敏感检测。
- 自监督硬负样本注入时序因果意识:利用乱序、冻结、反向播放等视频时序变换作为对比硬负样本,在免除昂贵人工负样本标注的同时,迫使网络内化时间的单向流动与物理连续性。
局限与展望¶
- 受制于人体三维姿态估计的前置精度:方法严重依赖于 TokenHMR 与 DWPose 的检测质量;在多人交互、极端遮挡或生成画面严重模糊导致人体检测器失效的极端场景下,特征提取可能退化。
- 受限于预设动作类别的聚类中心:动作一致性指标 \(S_{cons}\) 需要特定动作类别的真实样本聚类中心作为参照,对于完全开放域、罕见或未定义动作类型的即兴生成视频评测受到约束(虽然时序连贯性指标 \(S_{temp}\) 能够很好地零样本泛化)。
- 未来方向:作者团队展望将物理动力学流形与现代多模态大语言模型(MLLM)相结合,利用大模型的通用语言推理能力克服类别预设限制,并将动作范围拓展至多人复杂交互与长时视频序列中。
相关工作与启发¶
- vs VideoPhy-2 / VideoScore2: 后者基于微调 MLLM 或纯视觉网络评判泛化物理规律(浮力、重力),但对人体解剖学几何和骨骼连接失真完全缺乏敏感度;本文通过直接引入显式人体几何参数,在人体动作评估维度大幅领先最佳 MLLM 达 35.6% ~ 68.4%。
- vs VBench-2.0: VBench-2.0 关注人体单帧结构存在性与外观静态身份,时序评估较弱;本文的 \(S_{temp}\) 在 VBench-2.0 人体解剖学子集上实现了与人类胜率排序 100% 一致的模型排位(Spearman 胜率对齐曲线高度重合)。
评分¶
- 新颖性: ⭐⭐⭐⭐ [针对生成视频人体动作缺乏物理时序评估的痛点,构建了融合几何与一阶导数的动作流形]
- 实验充分度: ⭐⭐⭐⭐⭐ [自建 TAG-Bench-v0 涵盖多款 SOTA 扩散模型与 246 名受试者,实验分析、消融与外部评测非常详实]
- 写作质量: ⭐⭐⭐⭐⭐ [逻辑严谨,问题陈述明确,框架图与数学公式精炼得当]
- 价值: ⭐⭐⭐⭐ [为视频生成社区提供了一套针对人体动作真实性与物理合规性的可靠自动化度量与评测基准]