跳转至

QWERTY: Training-Free Motion Control via Query-Warped Video Diffusion Transformers

会议: ECCV 2026
论文: ECCV 原文
代码: 待开源
领域: 视频生成
关键词: 视频扩散Transformer、无需训练、运动控制、查询扭曲、注意力重塑

一句话总结

针对视频 Diffusion Transformer (DiT) 难以显式受控运动的问题,QWERTY 提出一种无需训练的运动控制框架,通过语义-时序通道分解(STCD)与仅扭曲查询(Query Warping)机制精确重塑 3D 全注意力,并在早期去噪步利用扭曲噪声实现自引导潜空间优化,高质量完成物体与相机轨迹控制。

研究背景与动机

视频扩散 Transformer (DiT) 凭借 3D 全注意力架构在生成画质、时序连贯性和动态表现上取得了显著突破。然而,现有预训练模型主要依赖文本提示词(如“让松鼠摇尾巴”)间接激发运动,文本在描述“物体向何处运动、移动多远、速度几何”等细粒度空间运动时存在根本性的表达瓶颈。为了实现显式运动控制,近期主流方案通常依赖掩码、边界框或点轨迹等空间提示,通过引入 ControlNet 式附加分支、扭曲输入噪声或微调附加 Token 来注入控制先验。但微调不仅计算开销巨大、需要大量标注数据,更会破坏预训练主干本身的泛化与高保真生成能力。

在此背景下,无需训练(Training-free)的运动控制在 U-Net 架构上曾被广泛探索(如噪声扭曲、注意力掩码与基于特征相似度的潜变量优化)。然而,这些在 U-Net 上行之有效的设计直接迁移至 DiT 时几乎全部失效——噪声扭曲会导致生成画面彻底崩溃,而局部特征优化则由于 DiT 缺乏卷积局部归纳偏置而陷入大面积静止或异常拉伸。此外,现有基于 DiT 的无需训练工作多局限于“从参考视频迁移运动”,无法满足用户交互式指定空间轨迹或光流场的直接控制需求。

本文的切入视角源于一个核心观察:在图生视频 DiT 的去噪初始阶段,首帧 Query 特征已经具有极其清晰稳定的空间语义布局;同时在注意力计算中,Softmax 归一化是对 Key 维度独立进行的。核心 idea:仅对 DiT 的 Query 向量在分离出的语义子空间中执行运动扭曲与粘贴,使得目标帧区域直接关注首帧对应源区域的语义 Key,从而在无参数更新的前提下重塑 3D 全注意力分布,并以该扭曲预测噪声作为自引导信号优化潜变量。

方法详解

整体框架

QWERTY 的整体流程涵盖三大协同模块:首先,通过基于 PCA 的语义-时序通道分解(STCD)将包含 RoPE 时序异质性的 Query 特征解耦为帧一致的语义子空间与帧变化的时序子空间;其次,仅针对语义子空间在空间 RoPE 后、时序 RoPE 前执行查询扭曲(Query Warping)与孔洞修补;最后,利用查询扭曲 DiT 生成的预测速度场,在扩散去噪前 5 步实施自引导潜空间优化与偏置采样。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入首帧图像与控制先验<br/>(物体掩码轨迹 / 相机光流场)"] --> B["语义-时序通道分解 (STCD)<br/>PCA计算空间与时序锚点显著度"]
    B --> C["语义子空间查询扭曲 (Query Warping)<br/>空间RoPE旋转后扭曲粘贴 + 孔洞处理"]
    C --> D["时序RoPE注入与3D全注意力前向"]
    D --> E["双路速度场预测<br/>标准场 u_t 与扭曲场 u_t^warp"]
    E --> F["自引导潜空间优化<br/>幅值对齐与傅里叶相位一致性损失"]
    F --> G["流匹配去噪更新 x_{t-Δt}<br/>生成时空连贯受控视频"]

关键设计

1. 仅扭曲查询(Query-Only Warping):利用注意力非对称性建立精确对应 运动控制的核心诉求是迫使第 \(n\) 帧目标区域的 Token \(i\) 强力关注第 1 帧源区域的 Token \(s\),从而吸收首帧对应区域的 Value 向量。形式上,目标到源的注意力权重为: $$ \alpha_{i,s} = \frac{\exp(q_i^\top k_s / \sqrt{d})}{\sum_j \exp(q_i^\top k_j / \sqrt{d})} $$ 传统思路倾向于同时扭曲特征(即 Query 与 Key 一同扭曲),或者仅扭曲 Key。然而由于 Softmax 归一化是针对 Key 维度求和,若仅替换目标帧的 Key(\(k_i \leftarrow k_s\)),式中的分子项 \(q_i^\top k_s\) 保持不变,权重 \(\alpha_{i,s}\) 并不会提升,且会导致第一帧源查询的注意力全面离散;若同时替换 Query 与 Key(\(q_i \leftarrow q_s, k_i \leftarrow k_s\)),虽然分子因自对应性极大增加(\(q_s^\top k_s\)),但分母中同时引入了多个得分接近自对应的竞争项,稀释了对首帧基准 Key 的实际注意力集中度。QWERTY 证明仅设置 \(q_i \leftarrow q_s\) 时,不仅最大化了分子互相关得分,且分母未引入额外伪对应项,能最直接、最纯粹地把目标帧注意力拉向首帧对应位置。

2. 语义-时序通道分解(STCD):消除时序 RoPE 带来的跨帧失真 直接将首帧的 Query 强制粘贴到后续帧会引入明显的伪影,其根源在于 DiT 的 Query 向量通道高度混合了时序位置编码与帧序动态信息,呈现显著的“帧间不一致性”。STCD 利用主成分分析(PCA)构建特征判别子空间。具体而言,以首帧特征矩阵 \(X^{(1)} \in \mathbb{R}^{P \times D}\) 作为语义锚点矩阵 \(A^{\text{sem}}\)(保留帧内空间变化),对其中心化并做奇异值分解 \(A = U \Sigma V^\top\),取前 \(k_{\text{sem}}\) 个主成分计算各通道的语义显著度得分: $$ s_d(\mathbf{A}, k) = \max_{1 \le i \le k} \sigma_i |V_{d,i}| $$ 同时,将各帧在空间维度全局平均池化得到 \(A^{\text{tmp}} \in \mathbb{R}^{F \times D}\) 作为时序锚点矩阵,消除局部空间结构以捕捉跨帧变化趋势,计算时序显著度得分 \(s^{\text{tmp}}\)。通过逐通道对比,生成二值语义通道掩码: $$ m_{\text{sem}, d} = \mathbb{I}[s_d^{\text{sem}} \ge s_d^{\text{tmp}}] $$ Query Warping 仅在 \(m_{\text{sem}}\) 选中的通道上执行粘贴,非语义通道则保持第 \(n\) 帧原有分布,从而在引导运动的同时最大程度保护模型的固有生成分布。

3. 空间与时序 RoPE 解耦扭曲及针对性孔洞修补 3D 旋转位置编码(3D RoPE)将通道切分为空间与时序独立处理。若扭曲前应用完整 3D RoPE,第 \(n\) 帧目标区域会被打上第 1 帧的时序时间戳,严重破坏全视频时序一致性;若扭曲后才加 RoPE,则目标区域 Query 与首帧 Key 无法共享空间相对位移对齐。因此,QWERTY 将扭曲精确卡在空间 RoPE 之后、时序 RoPE 之前:先施加空间 RoPE 并完成空间扭曲(使目标 Query 与首帧 Key 具有相同的空间几何相对位置关联),随后在整体序列上施加时序 RoPE。此外,针对物体控制,源位置被挖空后用最近邻背景 Token 填补首帧空洞并一同粘贴,杜绝在原位生成“克隆体重影”;针对相机光流控制,前向光流映射在目标网格留下的遮挡/视场外出露孔洞则保持未扭曲的原 Query 不动,交由 DiT 的注意力自愈机制自然补全。

4. 自引导潜空间优化:结合频域相位一致性的运动锁定 在去噪初始阶段(\(t=999\) 等前 5 个步长),由 Query Warping 驱动的 DiT 预测速度场 \(\hat{u}_t^{\text{warp}}\) 已经显现出清晰的全局运动雏形。为了进一步稳定物理轨迹并强化高频几何结构,QWERTY 将该扭曲预测场作为自引导监督信号。固定 DiT 模型权重,反向传播更新当前步输入潜变量 \(x_t\),促使无扭曲的标准前向场 \(\hat{u}_t\) 逼近 \(\hat{u}_t^{\text{warp}}\)。优化目标综合均方误差与傅里叶相位约束: $$ \mathcal{L}_{\text{guide}} = |\hat{\mathbf{u}}_t - \hat{\mathbf{u}}_t^{\text{warp}}|_2^2 + \lambda |\angle \mathcal{F}(\hat{\mathbf{u}}_t) - \angle \mathcal{F}(\hat{\mathbf{u}}_t^{\text{warp}})|_2^2 $$ 其中 \(\mathcal{F}(\cdot)\) 为傅里叶变换,\(\angle\) 提取频域相位角(编码空间运动几何与边缘),\(\lambda=0.1\)。该自引导策略使潜变量本身顺应运动意图演进,大幅提升了大幅度相机运镜与复杂形变物体的运动精度。

实验关键数据

主实验

评估涵盖两大主流基准:针对物体局部运动控制的 VIPSeg 验证集(100 个具有主导物体运动的视频,标注多边形掩码扭曲);针对全局相机运镜控制的 DL3DV 数据集(100 个真实场景视频,提取光流控制)。主干采用 Wan 2.2 TI2V-5B,统一在 480×832 分辨率下评测生成质量指标(FID、FVD)与运动控制对齐指标(FTD,越低越好)以及 VBench 时空一致性。

数据集 / 任务 方法 训练范式 主干网络 FID \(\downarrow\) FVD \(\downarrow\) FTD \(\downarrow\) VBench-SC \(\uparrow\) VBench-BC \(\uparrow\)
VIPSeg
(物体运动控制)
FreeTraj 无需训练 VideoCrafter 126.8 0.924 0.528 0.886 0.901
MOFT 无需训练 SVD 76.04 0.861 0.527 0.955 0.944
SG-I2V 无需训练 SVD 60.83 0.798 0.579 0.952 0.961
Vanilla Wan 原始模型 Wan 2.2 46.17 0.677 0.534 0.977 0.973
Noise Warping 无需训练 Wan 2.2 270.38 3.392 0.569 0.725 0.753
SG-I2V (DiT) 无需训练 Wan 2.2 107.98 0.704 0.600 0.976 0.960
GWTF 微调训练 专用DiT 40.19 0.645 0.528 0.958 0.975
QWERTY (本文) 无需训练 Wan 2.2 45.95 0.667 0.512 0.978 0.981
DL3DV
(相机运镜控制)
MotionClone* 无需训练 AnimateDiff 96.63 1.624 0.683 0.897 0.934
MOFT 无需训练 SVD 51.84 1.327 0.424 0.955 0.967
SG-I2V 无需训练 SVD 45.18 1.265 0.578 0.966 0.973
Vanilla Wan 原始模型 Wan 2.2 32.21 1.362 0.367 0.977 0.974
Noise Warping 无需训练 Wan 2.2 282.93 5.663 0.455 0.719 0.747
SG-I2V (DiT) 无需训练 Wan 2.2 42.46 1.524 0.438 0.976 0.970
GWTF 微调训练 专用DiT 30.32 1.576 0.513 0.962 0.978
QWERTY (本文) 无需训练 Wan 2.2 35.56 1.007 0.237 0.946 0.956

(注:MotionClone 使用真实参考视频作为条件输入;VBench-SC 为主体一致性,BC 为背景一致性;FVD 数值以 \(\times 10^3\) 计)*

消融实验

在 Wan 2.2(DL3DV 相机控制)与 CogVideoX-I2V-5B(VIPSeg 物体控制)上验证各关键技术组件的有效性:

模型配置 变体说明 DL3DV (Wan) FVD \(\downarrow\) DL3DV (Wan) FTD \(\downarrow\) VIPSeg (Cog) FVD \(\downarrow\) VIPSeg (Cog) FTD \(\downarrow\)
QWERTY (Full) 完整模型 1.007 0.237 0.668 0.473
(a) No STCD 移除语义-时序通道分解,全局扭曲通道 1.348 0.297 0.697 0.542
(b) w/o spat. RoPE 扭曲时不含空间 RoPE 1.419 0.299 1.578 0.531
(c) w/ temp. RoPE 扭曲时同时包含时序 RoPE 1.348 0.285 0.831 0.511
(d) K 仅扭曲 Key 向量 1.482 0.293 0.759 0.544
(e) Q, K 同时扭曲 Query 与 Key 1.427 0.290 0.727 0.531
(f) Attn. output 扭曲注意力层最终输出特征 1.590 0.288 0.745 0.544
(g) No opt. 仅执行 Query 扭曲采样,无潜空间优化 1.301 0.274 0.669 0.501
(h) Opt. only 仅执行潜变量优化,无 Query 扭曲前向 1.423 0.355 0.688 0.536
(i) w/o phase loss 潜空间优化移除傅里叶相位损失项 1.440 0.285 0.704 0.514

关键发现

  • U-Net 传统策略在 DiT 上严重失效:基于噪声扭曲(Noise Warping)的方法在 Wan 上 FVD 飙升至 3.392(物体)和 5.663(相机),画面完全崩溃破碎;基于特征优化的 SG-I2V 在 DiT 上倾向于退化为完全静止的死板画面,无法响应连续运动提示。
  • Query 扭曲的决定性优势:消融实验显示,仅扭曲 Key(FTD 0.293)或同时扭曲 Q+K(FTD 0.290)的表现均显著劣于仅扭曲 Query(FTD 0.237)。这印证了理论推导:注意力机制中对 Query 的单边引导能够产生最纯粹、未被分母额外膨胀稀释的跨帧自相关引导。
  • 时空 RoPE 的精巧配比:若在扭曲时并入时序 RoPE,FTD 由 0.237 劣变至 0.285(Wan);若漏掉空间 RoPE,CogVideoX 上的 FVD 剧烈恶化至 1.578,说明空间位置的相对平移必须与视觉特征强绑定,而时序戳必须保持全局物理演变。
  • 实际单图运镜落地性验证:在仅有单张输入图像时,通过 VGGT 或 Depth Anything 3 (DAM 3) 预测单目深度并与用户相机位姿生成几何光流,QWERTY 取得的 FTD 为 0.243-0.251,光流误差仅 0.707-0.710,与使用 Ground-truth RAFT 光流(FTD 0.237)非常接近,具备很高的实际产品落地价值。

亮点与洞察

  • 抓住注意力 Softmax 的非对称数学本质:巧妙揭示了 3D 全注意力中 Softmax 归一化在 Key 维度的数学特性,在无参数微调的前提下通过单向重塑 Query 矩阵,以零训练代价引导跨时间步特征绑定。
  • 极简而高效的 PCA 空间锚点解耦(STCD):利用首帧内空间全量分布与时序跨帧均值池化的内在方差差异,用纯数学矩阵分解快速区分语义通道与时序通道,为长程时序 Transformer 的中间表征干预提供了通用的特征筛选范式。
  • 自引导与频域相位约束的协同闭环:不仅在去噪主干中注入扭曲计算,还将扭曲预测场作为自身先验指导潜变量梯度回传,引入傅里叶相位保持高频边缘与运动结构,兼顾了生成柔和度与物理刚性。

局限与展望

  • 极端大角度遮挡与重构瑕疵:当相机运动幅度极大或物体经历剧烈 3D 旋转导致大面积自遮挡时,未见区域主要依赖 DiT 自身的生成想象,偶尔会出现纹理突变或内容拉伸。
  • 自引导潜空间优化的计算延迟:潜变量优化需要在前 5 个步长内进行双路前向计算与梯度回传,相比完全无引导的单路推理增加了约 30%-40% 的首段推理耗时。
  • 未来方向:探索与单目 3D 高斯泼溅(3D-GS)先验相结合,通过显式 3D 几何变形指导 Query 扭曲,从而支持全方位 6-DoF 自由视点视频合成。

相关工作与启发

  • vs Go-With-The-Flow (GWTF):GWTF 通过全量微调 DiT 适配光流与掩码输入,在域内拟合极强但在 DL3DV 等开域复杂场景下泛化退化明显(FVD 达 1.576,劣于本文的 1.007);QWERTY 无需任何额外训练,完全保留了原始 Wan 2.2 的广义先验与画面保真度。
  • vs SG-I2V & FreeTraj:早期基于 U-Net 的工作依赖局部卷积先验与框重合度损失,难以直接适配全局注意力;QWERTY 专为 3D 全注意力 DiT 量身打造,直接操纵注意力图与 RoPE 嵌入,解决了 DiT 缺乏局部归纳偏置导致的控制脱靶问题。

评分

  • 新颖性: ⭐⭐⭐⭐⭐(首次深入揭示 DiT 3D 全注意力的 Query Warping 机制并提出 STCD 语义解耦,理论自洽且非常巧妙)
  • 实验充分度: ⭐⭐⭐⭐⭐(跨 Wan 2.2 与 CogVideoX 双架构,详尽对比 U-Net 迁移基线与微调 SOTA,包含充分的注意力组件消融与真实深度光流验证)
  • 写作质量: ⭐⭐⭐⭐⭐(动机阐述清晰紧凑,理论公式推导严谨,图表表达信息密度高)
  • 价值: ⭐⭐⭐⭐⭐(为文生/图生视频大模型提供了一套即插即用、开箱即用的无需训练运动控制标杆方案)