QWERTY: Training-Free Motion Control via Query-Warped Video Diffusion Transformers¶
会议: ECCV 2026
论文: ECCV 原文
代码: 待开源
领域: 视频生成
关键词: 视频扩散Transformer、无需训练、运动控制、查询扭曲、注意力重塑
一句话总结¶
针对视频 Diffusion Transformer (DiT) 难以显式受控运动的问题,QWERTY 提出一种无需训练的运动控制框架,通过语义-时序通道分解(STCD)与仅扭曲查询(Query Warping)机制精确重塑 3D 全注意力,并在早期去噪步利用扭曲噪声实现自引导潜空间优化,高质量完成物体与相机轨迹控制。
研究背景与动机¶
视频扩散 Transformer (DiT) 凭借 3D 全注意力架构在生成画质、时序连贯性和动态表现上取得了显著突破。然而,现有预训练模型主要依赖文本提示词(如“让松鼠摇尾巴”)间接激发运动,文本在描述“物体向何处运动、移动多远、速度几何”等细粒度空间运动时存在根本性的表达瓶颈。为了实现显式运动控制,近期主流方案通常依赖掩码、边界框或点轨迹等空间提示,通过引入 ControlNet 式附加分支、扭曲输入噪声或微调附加 Token 来注入控制先验。但微调不仅计算开销巨大、需要大量标注数据,更会破坏预训练主干本身的泛化与高保真生成能力。
在此背景下,无需训练(Training-free)的运动控制在 U-Net 架构上曾被广泛探索(如噪声扭曲、注意力掩码与基于特征相似度的潜变量优化)。然而,这些在 U-Net 上行之有效的设计直接迁移至 DiT 时几乎全部失效——噪声扭曲会导致生成画面彻底崩溃,而局部特征优化则由于 DiT 缺乏卷积局部归纳偏置而陷入大面积静止或异常拉伸。此外,现有基于 DiT 的无需训练工作多局限于“从参考视频迁移运动”,无法满足用户交互式指定空间轨迹或光流场的直接控制需求。
本文的切入视角源于一个核心观察:在图生视频 DiT 的去噪初始阶段,首帧 Query 特征已经具有极其清晰稳定的空间语义布局;同时在注意力计算中,Softmax 归一化是对 Key 维度独立进行的。核心 idea:仅对 DiT 的 Query 向量在分离出的语义子空间中执行运动扭曲与粘贴,使得目标帧区域直接关注首帧对应源区域的语义 Key,从而在无参数更新的前提下重塑 3D 全注意力分布,并以该扭曲预测噪声作为自引导信号优化潜变量。
方法详解¶
整体框架¶
QWERTY 的整体流程涵盖三大协同模块:首先,通过基于 PCA 的语义-时序通道分解(STCD)将包含 RoPE 时序异质性的 Query 特征解耦为帧一致的语义子空间与帧变化的时序子空间;其次,仅针对语义子空间在空间 RoPE 后、时序 RoPE 前执行查询扭曲(Query Warping)与孔洞修补;最后,利用查询扭曲 DiT 生成的预测速度场,在扩散去噪前 5 步实施自引导潜空间优化与偏置采样。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入首帧图像与控制先验<br/>(物体掩码轨迹 / 相机光流场)"] --> B["语义-时序通道分解 (STCD)<br/>PCA计算空间与时序锚点显著度"]
B --> C["语义子空间查询扭曲 (Query Warping)<br/>空间RoPE旋转后扭曲粘贴 + 孔洞处理"]
C --> D["时序RoPE注入与3D全注意力前向"]
D --> E["双路速度场预测<br/>标准场 u_t 与扭曲场 u_t^warp"]
E --> F["自引导潜空间优化<br/>幅值对齐与傅里叶相位一致性损失"]
F --> G["流匹配去噪更新 x_{t-Δt}<br/>生成时空连贯受控视频"]
关键设计¶
1. 仅扭曲查询(Query-Only Warping):利用注意力非对称性建立精确对应 运动控制的核心诉求是迫使第 \(n\) 帧目标区域的 Token \(i\) 强力关注第 1 帧源区域的 Token \(s\),从而吸收首帧对应区域的 Value 向量。形式上,目标到源的注意力权重为: $$ \alpha_{i,s} = \frac{\exp(q_i^\top k_s / \sqrt{d})}{\sum_j \exp(q_i^\top k_j / \sqrt{d})} $$ 传统思路倾向于同时扭曲特征(即 Query 与 Key 一同扭曲),或者仅扭曲 Key。然而由于 Softmax 归一化是针对 Key 维度求和,若仅替换目标帧的 Key(\(k_i \leftarrow k_s\)),式中的分子项 \(q_i^\top k_s\) 保持不变,权重 \(\alpha_{i,s}\) 并不会提升,且会导致第一帧源查询的注意力全面离散;若同时替换 Query 与 Key(\(q_i \leftarrow q_s, k_i \leftarrow k_s\)),虽然分子因自对应性极大增加(\(q_s^\top k_s\)),但分母中同时引入了多个得分接近自对应的竞争项,稀释了对首帧基准 Key 的实际注意力集中度。QWERTY 证明仅设置 \(q_i \leftarrow q_s\) 时,不仅最大化了分子互相关得分,且分母未引入额外伪对应项,能最直接、最纯粹地把目标帧注意力拉向首帧对应位置。
2. 语义-时序通道分解(STCD):消除时序 RoPE 带来的跨帧失真 直接将首帧的 Query 强制粘贴到后续帧会引入明显的伪影,其根源在于 DiT 的 Query 向量通道高度混合了时序位置编码与帧序动态信息,呈现显著的“帧间不一致性”。STCD 利用主成分分析(PCA)构建特征判别子空间。具体而言,以首帧特征矩阵 \(X^{(1)} \in \mathbb{R}^{P \times D}\) 作为语义锚点矩阵 \(A^{\text{sem}}\)(保留帧内空间变化),对其中心化并做奇异值分解 \(A = U \Sigma V^\top\),取前 \(k_{\text{sem}}\) 个主成分计算各通道的语义显著度得分: $$ s_d(\mathbf{A}, k) = \max_{1 \le i \le k} \sigma_i |V_{d,i}| $$ 同时,将各帧在空间维度全局平均池化得到 \(A^{\text{tmp}} \in \mathbb{R}^{F \times D}\) 作为时序锚点矩阵,消除局部空间结构以捕捉跨帧变化趋势,计算时序显著度得分 \(s^{\text{tmp}}\)。通过逐通道对比,生成二值语义通道掩码: $$ m_{\text{sem}, d} = \mathbb{I}[s_d^{\text{sem}} \ge s_d^{\text{tmp}}] $$ Query Warping 仅在 \(m_{\text{sem}}\) 选中的通道上执行粘贴,非语义通道则保持第 \(n\) 帧原有分布,从而在引导运动的同时最大程度保护模型的固有生成分布。
3. 空间与时序 RoPE 解耦扭曲及针对性孔洞修补 3D 旋转位置编码(3D RoPE)将通道切分为空间与时序独立处理。若扭曲前应用完整 3D RoPE,第 \(n\) 帧目标区域会被打上第 1 帧的时序时间戳,严重破坏全视频时序一致性;若扭曲后才加 RoPE,则目标区域 Query 与首帧 Key 无法共享空间相对位移对齐。因此,QWERTY 将扭曲精确卡在空间 RoPE 之后、时序 RoPE 之前:先施加空间 RoPE 并完成空间扭曲(使目标 Query 与首帧 Key 具有相同的空间几何相对位置关联),随后在整体序列上施加时序 RoPE。此外,针对物体控制,源位置被挖空后用最近邻背景 Token 填补首帧空洞并一同粘贴,杜绝在原位生成“克隆体重影”;针对相机光流控制,前向光流映射在目标网格留下的遮挡/视场外出露孔洞则保持未扭曲的原 Query 不动,交由 DiT 的注意力自愈机制自然补全。
4. 自引导潜空间优化:结合频域相位一致性的运动锁定 在去噪初始阶段(\(t=999\) 等前 5 个步长),由 Query Warping 驱动的 DiT 预测速度场 \(\hat{u}_t^{\text{warp}}\) 已经显现出清晰的全局运动雏形。为了进一步稳定物理轨迹并强化高频几何结构,QWERTY 将该扭曲预测场作为自引导监督信号。固定 DiT 模型权重,反向传播更新当前步输入潜变量 \(x_t\),促使无扭曲的标准前向场 \(\hat{u}_t\) 逼近 \(\hat{u}_t^{\text{warp}}\)。优化目标综合均方误差与傅里叶相位约束: $$ \mathcal{L}_{\text{guide}} = |\hat{\mathbf{u}}_t - \hat{\mathbf{u}}_t^{\text{warp}}|_2^2 + \lambda |\angle \mathcal{F}(\hat{\mathbf{u}}_t) - \angle \mathcal{F}(\hat{\mathbf{u}}_t^{\text{warp}})|_2^2 $$ 其中 \(\mathcal{F}(\cdot)\) 为傅里叶变换,\(\angle\) 提取频域相位角(编码空间运动几何与边缘),\(\lambda=0.1\)。该自引导策略使潜变量本身顺应运动意图演进,大幅提升了大幅度相机运镜与复杂形变物体的运动精度。
实验关键数据¶
主实验¶
评估涵盖两大主流基准:针对物体局部运动控制的 VIPSeg 验证集(100 个具有主导物体运动的视频,标注多边形掩码扭曲);针对全局相机运镜控制的 DL3DV 数据集(100 个真实场景视频,提取光流控制)。主干采用 Wan 2.2 TI2V-5B,统一在 480×832 分辨率下评测生成质量指标(FID、FVD)与运动控制对齐指标(FTD,越低越好)以及 VBench 时空一致性。
| 数据集 / 任务 | 方法 | 训练范式 | 主干网络 | FID \(\downarrow\) | FVD \(\downarrow\) | FTD \(\downarrow\) | VBench-SC \(\uparrow\) | VBench-BC \(\uparrow\) |
|---|---|---|---|---|---|---|---|---|
| VIPSeg (物体运动控制) |
FreeTraj | 无需训练 | VideoCrafter | 126.8 | 0.924 | 0.528 | 0.886 | 0.901 |
| MOFT | 无需训练 | SVD | 76.04 | 0.861 | 0.527 | 0.955 | 0.944 | |
| SG-I2V | 无需训练 | SVD | 60.83 | 0.798 | 0.579 | 0.952 | 0.961 | |
| Vanilla Wan | 原始模型 | Wan 2.2 | 46.17 | 0.677 | 0.534 | 0.977 | 0.973 | |
| Noise Warping | 无需训练 | Wan 2.2 | 270.38 | 3.392 | 0.569 | 0.725 | 0.753 | |
| SG-I2V (DiT) | 无需训练 | Wan 2.2 | 107.98 | 0.704 | 0.600 | 0.976 | 0.960 | |
| GWTF | 微调训练 | 专用DiT | 40.19 | 0.645 | 0.528 | 0.958 | 0.975 | |
| QWERTY (本文) | 无需训练 | Wan 2.2 | 45.95 | 0.667 | 0.512 | 0.978 | 0.981 | |
| DL3DV (相机运镜控制) |
MotionClone* | 无需训练 | AnimateDiff | 96.63 | 1.624 | 0.683 | 0.897 | 0.934 |
| MOFT | 无需训练 | SVD | 51.84 | 1.327 | 0.424 | 0.955 | 0.967 | |
| SG-I2V | 无需训练 | SVD | 45.18 | 1.265 | 0.578 | 0.966 | 0.973 | |
| Vanilla Wan | 原始模型 | Wan 2.2 | 32.21 | 1.362 | 0.367 | 0.977 | 0.974 | |
| Noise Warping | 无需训练 | Wan 2.2 | 282.93 | 5.663 | 0.455 | 0.719 | 0.747 | |
| SG-I2V (DiT) | 无需训练 | Wan 2.2 | 42.46 | 1.524 | 0.438 | 0.976 | 0.970 | |
| GWTF | 微调训练 | 专用DiT | 30.32 | 1.576 | 0.513 | 0.962 | 0.978 | |
| QWERTY (本文) | 无需训练 | Wan 2.2 | 35.56 | 1.007 | 0.237 | 0.946 | 0.956 |
(注:MotionClone 使用真实参考视频作为条件输入;VBench-SC 为主体一致性,BC 为背景一致性;FVD 数值以 \(\times 10^3\) 计)*
消融实验¶
在 Wan 2.2(DL3DV 相机控制)与 CogVideoX-I2V-5B(VIPSeg 物体控制)上验证各关键技术组件的有效性:
| 模型配置 | 变体说明 | DL3DV (Wan) FVD \(\downarrow\) | DL3DV (Wan) FTD \(\downarrow\) | VIPSeg (Cog) FVD \(\downarrow\) | VIPSeg (Cog) FTD \(\downarrow\) |
|---|---|---|---|---|---|
| QWERTY (Full) | 完整模型 | 1.007 | 0.237 | 0.668 | 0.473 |
| (a) No STCD | 移除语义-时序通道分解,全局扭曲通道 | 1.348 | 0.297 | 0.697 | 0.542 |
| (b) w/o spat. RoPE | 扭曲时不含空间 RoPE | 1.419 | 0.299 | 1.578 | 0.531 |
| (c) w/ temp. RoPE | 扭曲时同时包含时序 RoPE | 1.348 | 0.285 | 0.831 | 0.511 |
| (d) K | 仅扭曲 Key 向量 | 1.482 | 0.293 | 0.759 | 0.544 |
| (e) Q, K | 同时扭曲 Query 与 Key | 1.427 | 0.290 | 0.727 | 0.531 |
| (f) Attn. output | 扭曲注意力层最终输出特征 | 1.590 | 0.288 | 0.745 | 0.544 |
| (g) No opt. | 仅执行 Query 扭曲采样,无潜空间优化 | 1.301 | 0.274 | 0.669 | 0.501 |
| (h) Opt. only | 仅执行潜变量优化,无 Query 扭曲前向 | 1.423 | 0.355 | 0.688 | 0.536 |
| (i) w/o phase loss | 潜空间优化移除傅里叶相位损失项 | 1.440 | 0.285 | 0.704 | 0.514 |
关键发现¶
- U-Net 传统策略在 DiT 上严重失效:基于噪声扭曲(Noise Warping)的方法在 Wan 上 FVD 飙升至 3.392(物体)和 5.663(相机),画面完全崩溃破碎;基于特征优化的 SG-I2V 在 DiT 上倾向于退化为完全静止的死板画面,无法响应连续运动提示。
- Query 扭曲的决定性优势:消融实验显示,仅扭曲 Key(FTD 0.293)或同时扭曲 Q+K(FTD 0.290)的表现均显著劣于仅扭曲 Query(FTD 0.237)。这印证了理论推导:注意力机制中对 Query 的单边引导能够产生最纯粹、未被分母额外膨胀稀释的跨帧自相关引导。
- 时空 RoPE 的精巧配比:若在扭曲时并入时序 RoPE,FTD 由 0.237 劣变至 0.285(Wan);若漏掉空间 RoPE,CogVideoX 上的 FVD 剧烈恶化至 1.578,说明空间位置的相对平移必须与视觉特征强绑定,而时序戳必须保持全局物理演变。
- 实际单图运镜落地性验证:在仅有单张输入图像时,通过 VGGT 或 Depth Anything 3 (DAM 3) 预测单目深度并与用户相机位姿生成几何光流,QWERTY 取得的 FTD 为 0.243-0.251,光流误差仅 0.707-0.710,与使用 Ground-truth RAFT 光流(FTD 0.237)非常接近,具备很高的实际产品落地价值。
亮点与洞察¶
- 抓住注意力 Softmax 的非对称数学本质:巧妙揭示了 3D 全注意力中 Softmax 归一化在 Key 维度的数学特性,在无参数微调的前提下通过单向重塑 Query 矩阵,以零训练代价引导跨时间步特征绑定。
- 极简而高效的 PCA 空间锚点解耦(STCD):利用首帧内空间全量分布与时序跨帧均值池化的内在方差差异,用纯数学矩阵分解快速区分语义通道与时序通道,为长程时序 Transformer 的中间表征干预提供了通用的特征筛选范式。
- 自引导与频域相位约束的协同闭环:不仅在去噪主干中注入扭曲计算,还将扭曲预测场作为自身先验指导潜变量梯度回传,引入傅里叶相位保持高频边缘与运动结构,兼顾了生成柔和度与物理刚性。
局限与展望¶
- 极端大角度遮挡与重构瑕疵:当相机运动幅度极大或物体经历剧烈 3D 旋转导致大面积自遮挡时,未见区域主要依赖 DiT 自身的生成想象,偶尔会出现纹理突变或内容拉伸。
- 自引导潜空间优化的计算延迟:潜变量优化需要在前 5 个步长内进行双路前向计算与梯度回传,相比完全无引导的单路推理增加了约 30%-40% 的首段推理耗时。
- 未来方向:探索与单目 3D 高斯泼溅(3D-GS)先验相结合,通过显式 3D 几何变形指导 Query 扭曲,从而支持全方位 6-DoF 自由视点视频合成。
相关工作与启发¶
- vs Go-With-The-Flow (GWTF):GWTF 通过全量微调 DiT 适配光流与掩码输入,在域内拟合极强但在 DL3DV 等开域复杂场景下泛化退化明显(FVD 达 1.576,劣于本文的 1.007);QWERTY 无需任何额外训练,完全保留了原始 Wan 2.2 的广义先验与画面保真度。
- vs SG-I2V & FreeTraj:早期基于 U-Net 的工作依赖局部卷积先验与框重合度损失,难以直接适配全局注意力;QWERTY 专为 3D 全注意力 DiT 量身打造,直接操纵注意力图与 RoPE 嵌入,解决了 DiT 缺乏局部归纳偏置导致的控制脱靶问题。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐(首次深入揭示 DiT 3D 全注意力的 Query Warping 机制并提出 STCD 语义解耦,理论自洽且非常巧妙)
- 实验充分度: ⭐⭐⭐⭐⭐(跨 Wan 2.2 与 CogVideoX 双架构,详尽对比 U-Net 迁移基线与微调 SOTA,包含充分的注意力组件消融与真实深度光流验证)
- 写作质量: ⭐⭐⭐⭐⭐(动机阐述清晰紧凑,理论公式推导严谨,图表表达信息密度高)
- 价值: ⭐⭐⭐⭐⭐(为文生/图生视频大模型提供了一套即插即用、开箱即用的无需训练运动控制标杆方案)