跳转至

Inference-time Motion Calibration for Video Generation

会议: ECCV 2026
论文: ECCV 官方页面
领域: 视频生成
关键词: 推理时校准, 动态隐空间控制, 动态RoPE控制, 平摊轨迹整流, 视觉基础模型

一句话总结

针对预训练视频生成模型中运动失真、语义漂移与高频抖动问题,本文提出一种无需重新训练的推理时运动校准框架,利用视觉基础模型构建可微校准梯度(DLC)与自适应时间RoPE核(DRC),并通过平摊轨迹整流(ATR)将推理额外开销控制在基线的1.3倍以内。

研究背景与动机

近年来基于扩散模型与流匹配(Flow Matching)的前沿视频生成架构(如CogVideoX、HunyuanVideo与Wan 2.1等DiT模型)在单帧图像合成质量上取得了瞩目进展,但在长时间序列生成中,仍普遍面临运动真实性差、高频抖动、物体形变失真以及累积性语义漂移等缺陷。产生这些缺陷的根本症结在于:现有的生成模型训练目标基本围绕逐帧重构误差展开,连贯自然的运动动态往往只是时间注意力层间接学习到的伴生属性,模型自身缺乏显式的物理运动与时间一致性监督;而对于前沿超大参数量的视频生成底模,重新微调全参数的成本极其昂贵。

现有研究尝试通过推理时缩放(Inference-time Scaling)来改善视频质量,但主流方案主要依赖基于外部验证器(Verifier)的启发式搜索,如进化搜索(EvoSearch)或噪声轨迹搜索。这类方案维持一组候选样本群体并由验证器打分筛选,本质上将生成底模视为黑盒排序预言机,既无法产生指向高保真运动分布的可微梯度指导,又导致计算复杂度随着候选样本规模呈线性暴涨;同时,模型底层固定的时间感受野与位置编码在面对高速剧烈或缓慢长程运动时,极易产生时间尺度失配。

本文的切入视角在于将外部视觉基础模型(VFM)从离散的“重排序评分器”转变为连续的“可微能量场引导”,通过在单条ODE采样轨迹上局部回传运动与语义梯度来实现轨迹级动态修正,并同时在线自适应重塑注意力时间核。核心 idea:将推理时运动校准建模为无需训练的采样轨迹能量重塑问题,通过动态隐空间控制(DLC)注入VFM可微运动校准梯度、动态RoPE控制(DRC)根据运动强弱在线调整时间感受野,并提出平摊轨迹整流(ATR)缓存整流速度场,仅需极少次VFM反向传播即实现低延迟的高保真运动生成。

方法详解

整体框架

本文针对Flow-ODE形式的生成轨迹 \(\frac{\mathrm{d}z_t}{\mathrm{d}t} = v_\theta(t, z_t \mid c)\)(或对应扩散逆过程ODE更新)开展推理时干预。整个校准流程在采样过程中实时发生:在选定的稀疏校准步,算法通过欧拉外推直接估计终点干净隐变量 \(\hat{z}_0(t)\),送入轻量解码器解出低分辨率代理帧序列;接着调用光流模型(如RAFT)、DINOv2与CLIP等视觉基础模型分别计算运动连贯性、几何结构与语义文本对齐的综合能量损失 \(\mathcal{L}\),并反向传播得到隐空间校准梯度;该梯度在外部校正生成底模的速度场 \(v_\theta\)(DLC),同时依据代理帧的运动剧烈程度和时间不对称性自适应调制内部注意力模块的Rotary Position Embeddings(DRC);最后,利用整流场在局部轨迹上的平滑性,通过ATR缓存该整流差值并在后续轻量步直接复用,从而大幅削减反向传播开销。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入噪声状态 z_t 与条件 c"] --> B["欧拉外推估计干净隐变量 z_0(t)"]
    B --> C["解码低分辨率代理帧序列 x_proxy"]
    C --> D["VFM 综合能量计算<br/>光流 + DINOv2结构 + CLIP语义"]
    D --> E["动态隐空间控制 (DLC)<br/>反传生成速度场校准梯度"]
    D --> F["动态RoPE控制 (DRC)<br/>在线调制时间注意力感受野与相位"]
    E --> G["平摊轨迹整流 (ATR)<br/>缓存整流场并在快速步平摊复用"]
    F --> H["校准后的速度场 v' 与 DiT 注意力更新"]
    G --> H
    H --> I["输出下一时刻隐变量 z_{t-Δt}"]

关键设计

1. 动态隐空间控制 (DLC):通过VFM反馈构建可微校准场 针对以往黑盒验证器只能粗粒度过滤样本而无法主动纠错的问题,DLC构建了一个目标玻尔兹曼重加权分布 \(p^\star(z_0 \mid c) \propto p_\theta(z_0 \mid c) \exp(-\lambda_{\mathrm{E}} \mathcal{L}(z_0))\)。为了在中间采样步 \(t \in [0, 1]\)(以 \(t=1\) 为纯噪声、\(t=0\) 为干净数据)就能计算该能量梯度,DLC采用单步一阶欧拉外推近似干净隐变量 \(\hat{z}_0(t) \approx z_t - s_\tau \tau_t v_\theta(t, z_t \mid c)\),其中 \(\tau_t \approx t\) 为剩余时间尺度,\(s_\tau \in [1.0, 1.25]\) 为外推缩放系数。将 \(\hat{z}_0(t)\) 经解码器 \(\mathcal{D}\) 还原为低分辨率代理帧 \(x^{\mathrm{proxy}} = \mathcal{D}(\hat{z}_0(t))\),并计算三元综合损失: $\(\mathcal{L} = w_1 \mathcal{L}_{\mathrm{flow}} + w_2 \mathcal{L}_{\mathrm{struct}} + w_3 \mathcal{L}_{\mathrm{sem}}\)$ 其中 \(\mathcal{L}_{\mathrm{flow}}\) 利用光流模型衡量前后帧运动矢量跳变,\(\mathcal{L}_{\mathrm{struct}}\) 采用 DINOv2 保持物体轮廓与部位几何连续性,\(\mathcal{L}_{\mathrm{sem}}\) 借助 CLIP 约束文本语义一致性,各项均沿批次归一化至均值为0、方差为1以平衡梯度量纲。通过链式法则回传梯度并映射至速度空间,得到修正后的连续速度场: $\(v^{\mathrm{DLC}}(z_t, t \mid c) = v_\theta(t, z_t \mid c) + \beta_t b_t J_{\mathcal{D}}(\hat{z}_0(t))^\top \nabla_x \mathcal{L}(x^{\mathrm{proxy}})\)$ 式中加上校准梯度的正号巧妙对应于终点隐空间能量梯度的梯度下降(因为终点估计为 \(z_0 = z_t - \tau_t v_t\),速度增加正梯度相当于使终点向负梯度方向位移)。为规避噪声初期代理帧结构混乱的伪梯度干扰,DLC严格设定在 \(t_{\mathrm{start}} = 0.5\) 之后介入,并引入动量机制与梯度模长截断(\(\gamma = 2.0\)),确保底模先验平稳主导、校准信号精准纠偏。

2. 动态RoPE控制 (DRC):自适应调制时间注意力感受野 尽管轨迹层面的速度修正纠正了宏观漂移,但固定权重的DiT在网络内部依然受到恒定时间感受野的结构性约束:剧烈快速运动下过于宽泛的时间连接会导致帧间混叠与闪烁,而平缓慢速运动若缺乏长距离交互则会丢失长期一致性。DRC直接对时间维度的 Rotary Position Embeddings(RoPE)进行在线自适应调节,定义时间间隔 \(\Delta = r - s\) 下的相对旋转相位为: $\(\Delta \phi_i = \left(\frac{r - s}{\rho_t} + 2\phi_t\right)\omega\)$ 其中时间膨胀因子 \(\rho_t\) 控制时间感受野的有效跨度,相位偏置 \(\phi_t\) 引入前后时序的不对称偏好。DRC利用DLC阶段算得的代理帧光流速度统计量 \(\hat{u}_i\)、加速度离散导数 \(\hat{j}_i\) 与帧间相似度不对称度 \(\Delta s_t\),动态更新参数: $\(\rho_t = \rho_0 \exp(-\kappa_u \hat{u}_i - \kappa_j \hat{j}_i), \quad \phi_t = \beta \Delta s_t\)$ 当检测到高频抖动或剧烈加速时,\(\rho_t\) 自适应收缩,将注意力聚焦于邻近紧密帧以抹平高频闪烁;在平稳运动场景下,\(\rho_t\) 扩张以加强远距离关联,从而与外层DLC的轨迹修正实现内外协同。

3. 平摊轨迹整流 (ATR):缓存整流场以极低开销实现平摊校准 若在求解器每个离散步骤都执行完整的DLC前向后向计算与代理帧解码,推理时间将激增10倍以上。ATR基于视觉基础模型引导场沿ODE平滑轨迹具有李普希茨连续性(Lipschitz continuity)的关键洞察,将整个生成序列解耦为稀疏校准步与快速平摊步。在每隔 \(S_{\mathrm{ATR}}\) 步的慢速校准步 \(k_s\),计算精确的整流场残差并将其缓存: $\(R(z_{k_s}, t_{k_s}) = v'_{k_s} - v_\theta(z_{k_s}, t_{k_s})\)$ 在后续的连续快速基步 \(k_f \in (k_s, k_s + S_{\mathrm{ATR}})\) 中,无需再次调用VFM,而是直接将缓存的整流残差附加到当前基模预测的速度场中: $\(v'_{\mathrm{approx}}(z_{k_f}, t_{k_f}) = v_\theta(z_{k_f}, t_{k_f}) + R(z_{k_s}, t_{k_s})\)$ 文中在理论上证明了逼近误差满足李普希茨上界 \(\|\mathcal{E}_{\mathrm{approx}}\|_2 \le L \|z_{k_s} - z_{k_f}\|_2 + K |t_{k_s} - t_{k_f}|\)。只要合理控制校准间隔 \(S_{\mathrm{ATR}}\),状态和时间的漂移量皆处于微小量级,不仅消除累积误差,还将VFM调用次数从通常的50次骤降至8次以下,实现了极低计算代价下的近乎无损校准。

实验关键数据

主实验

在文生视频(T2V)基准 VBench 1.0 与 VBench 2.0 上,对比闭源前沿系统、开源底模及推理时搜索基准,本文方法在运动合理性、动作次序以及人体结构等高阶物理运动指标上展现出显著优势。

表1:VBench 1.0 与 VBench 2.0 文生视频主结果对比(摘自原文 Table 1)

方法 时间平滑度 (Smooth.) ↑ 时间闪烁 (Flicker) ↓ 动态幅度 (Dynamic) ↑ 运动合理性 (Rationality) ↑ 动作次序 (Order) ↑ 人体解剖 (Anatomy) ↑ 物理规律 (Mechanics) ↑
Sora 34.48% 15.15% 86.45% 62.22%
Kling 1.6 38.51% 29.29% 86.99% 65.55%
CogVideoX-1.5 (基线) 96.92% 98.66% 70.97% 33.91% 26.60% 59.72% 80.80%
CogVideoX-1.5 + EvoSearch 96.80% 98.72% 71.40% 34.00% 26.70% 59.80% 81.00%
CogVideoX-1.5 + Noise Traj. 97.05% 98.78% 71.80% 34.10% 26.80% 59.90% 81.10%
CogVideoX-1.5 + 本文 (N=8) 97.40% 99.10% 72.80% 36.00% 29.00% 61.20% 82.00%
CogVideoX-1.5 + 本文 (N=16) 97.20% 98.90% 73.20% 35.20% 28.50% 61.40% 82.30%
HunyuanVideo (基线) 98.70% 99.10% 57.00% 34.48% 26.94% 88.58% 76.09%
HunyuanVideo + EvoSearch 98.55% 99.00% 57.50% 34.60% 27.10% 88.70% 76.40%
HunyuanVideo + Noise Traj. 98.50% 98.95% 57.70% 34.70% 27.20% 88.65% 76.50%
HunyuanVideo + 本文 (N=8) 96.90% 98.80% 68.60% 37.20% 29.50% 90.30% 78.80%
HunyuanVideo + 本文 (N=16) 96.70% 98.70% 68.20% 36.80% 29.70% 90.10% 79.10%

在图生视频(I2V)评测中,针对主体一致性与摄像机运动控制进行评估,方法同样泛化到不同架构模型中:

表2:VBench-I2V 图生视频实验对比(摘自原文 Table 2)

方法 主体对齐 (Subject) ↑ 背景对齐 (Background) ↑ 相机运动 (Camera) ↑ 动态幅度 (Dynamic) ↑ 运动平滑度 (Smooth.) ↑ 美学质量 (Aesthetic) ↑
FramePack 基线 93.50% 93.00% 21.50% 20.05% 96.50% 63.94%
FramePack + EvoSearch 93.60% 93.10% 21.60% 20.20% 96.60% 63.98%
FramePack + 本文 (N=8) 94.40% 93.80% 22.80% 21.10% 97.30% 64.32%
Wan 2.1 基线 96.30% 95.60% 33.50% 46.02% 97.20% 63.12%
Wan 2.1 + EvoSearch 96.40% 95.70% 33.60% 46.20% 97.35% 63.20%
Wan 2.1 + 本文 (N=8) 98.10% 97.40% 36.80% 47.70% 98.50% 63.72%
Hunyuan I2V 基线 94.50% 94.00% 23.00% 17.74% 96.00% 62.04%
Hunyuan I2V + 本文 (N=8) 96.50% 95.90% 26.50% 18.55% 97.50% 62.42%

消融实验

表3:核心组件拆解与平摊效率分析(综合原文 Table 3 与 Table 5)

配置 FVD ↓ 运动得分 (Motion) ↑ 时间闪烁指标 ↑ 端到端延迟 (s) ↓ 说明
HunyuanVideo 基线 430.2 0.58 98.70% 5.2s 未校准的生成底模
+ Universal Guidance (密集反传) 385.4 0.63 48.6s 逐离散步求雅可比梯度,耗时高达9.3倍
+ 仅启用 DLC (无 ATR, 每步求导) 358.6 0.68 99.05% ~50s 外部轨迹控制带来大幅度质量跃升
+ 仅启用 DRC (无 DLC) 401.3 0.62 99.20% 5.4s 仅内部自适应注意力调制,缺乏宏观轨迹矫正
+ DLC + DRC (完整模型, 无 ATR) 318.9 0.72 99.10% 55.7s 质量上限,但计算代价昂贵(10.7倍耗时)
+ 完整模型 + ATR 平摊 (N=8) 328.5 0.70 98.80% 6.8s 仅1.3倍基线延迟,保全97%以上质量增益

表4:视觉基础模型(VFM)强度可扩展性(摘自原文 Table 4 核心数据)

VFM 组合配置 (\(\mathcal{L}_{\mathrm{sem}} + \mathcal{L}_{\mathrm{mot}}\)) 调度策略 FVD ↓ CLIP 得分 ↑ 运动得分 ↑ 延迟 (s) ↓
CLIP ViT-B/32 + 帧间差分 全量 DLC 405.7 0.279 0.61 28.5s
CLIP ViT-B/32 + 帧间差分 ATR 平摊 406.1 0.279 0.60 5.9s
DINOv2 ViT-B/14 + RAFT 光流 全量 DLC 329.7 0.287 0.70 48.8s
DINOv2 ViT-B/14 + RAFT 光流 ATR 平摊 330.5 0.286 0.70 6.4s
CLIP ViT-L/14 + RAFT 光流 全量 DLC 318.9 0.293 0.72 55.7s
CLIP ViT-L/14 + RAFT 光流 ATR 平摊 319.2 0.292 0.72 6.8s

关键发现

  • 内外协同效应显著:DLC独立生效可将FVD从430.2降低至358.6,DRC独立生效则降低至401.3;而两者结合后FVD进一步大幅压降至318.9,证明宏观速度场偏转与微观时间感受野重塑具备高度互补性。
  • 平摊整流场极其平滑:ATR在仅保留8次VFM求导的情况下,FVD仅从318.9轻微波动至328.5(性能保留超97%),而推理延迟由55.7秒缩短至6.8秒(加速超8倍),有力验证了ODE整流场沿时序轨迹的局部Lipschitz连续假设。
  • 搜索范式存在天花板:对比实验显示,基于群体抽样的EvoSearch和噪声轨迹搜索由于缺乏针对运动导数的显式梯度引导,在各项物理合理性指标上增益均未超过0.3%,且计算成本随样本数线性增加;本文提出的单轨迹梯度校准在效率与收益上均形成压制。

亮点与洞察

  • 将离散黑盒打分升级为连续能量引导:打破了过去将基础大模型仅作为检验过滤器的思路,创造性地通过欧拉外推直接在中间潜变量求导,为生成模型提供了无须训练即可利用更强VFM红利的开放接口。
  • 动态调制RoPE的低维高效调控:识别出时间RoPE的旋转相位是调节注意力时间跨度的无参数关键旋钮,用光流高阶统计量在线调节衰减率 \(\rho_t\) 与偏移 \(\phi_t\),既消除高频抖动又保全长程记忆。
  • 整流场缓存机制(ATR)的可复用性:在扩散和流匹配的采样控制领域,该方法证明了外部引导梯度在时间局部高度相关,未来可推广至图像修复、精准空间控制等多类引导采样加速场景。

局限与展望

  • 时序平滑度的轻微折损:在极少数模型(如HunyuanVideo)上,更强更复杂的动态运动提升伴随着表面时间平滑度(Motion Smoothness)的微小妥协(从98.70%略降至96.90%),反映出大动态与高平滑之间天然存在的权衡。
  • 中间代理帧对解码器与噪声水平的敏感性:DLC依赖 \(t \ge 0.5\) 之后解码代理帧的信噪比,若解码器重构失真严重或步长外推过激,梯度截断虽能托底,但也会阶段性削弱校准强度。
  • 未来方向:探索高维潜变量空间内的无解码原生运动能量评估,彻底消除 VAE 解码/编码代理帧的显存与计算开销。

相关工作与启发

  • vs Universal Guidance (UG):UG在所有反向去噪步均对全模型与引导网络做密集求导,显存占用大且带来9倍以上延迟(48.6s);本文提出欧拉外推代理帧与ATR平摊整流,将开销缩减至1.3倍(6.8s)且生成质量更高(FVD 328.5 vs 385.4)。
  • vs EvoSearch / Noise Trajectory Search:传统搜索方法在多条候选轨迹中按奖励排序筛选,生成时间随候选集大小线性膨胀,且对深层次物理运动瑕疵缺乏纠正能力;本文在单条轨迹内闭环注入运动可微梯度,以更低开销实现更精细的运动校准。
  • vs 运动条件微调方法 (如 FlowVid / DynamicCrafter):条件微调方法依赖繁重的成对训练与模型权重改动;本文属于完全的训练无关(training-free)即插即用框架,能无缝适配多种前沿DiT与3D U-Net架构。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次提出连续空间内的视频运动推理时校准,兼顾外部轨迹引导与内部RoPE自适应调节。
  • 实验充分度: ⭐⭐⭐⭐⭐ 覆盖CogVideoX、HunyuanVideo、Wan 2.1等主流顶尖视频模型,全面涵盖T2V与I2V并附带严格消融与理论界分析。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑结构严谨,数学形式化推导与工程平摊设计结合紧密。
  • 价值: ⭐⭐⭐⭐⭐ 无需微调即可使预训练开源底模直接获得物理合理运动增强,极具工业落地与后续扩展潜力。