Controlling Motion Transfer in Diffusion Transformers via Attention Heads¶
会议: ECCV 2026
Paper: https://eccv.ecva.net/virtual/2026/poster/3621
PDF: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/2249.pdf
项目: HALO
领域: 视频生成 / 运动迁移
关键词: 扩散 Transformer、运动注意力头、语义对应、结构注入、免训练控制
一句话总结¶
HALO 在视频 DiT 中分别识别运动头和结构头,用语义校正后的位移监督潜变量、用低熵头的参考值特征保留布局,在不更新模型参数的前提下将主基准运动保真度 MF 从 DiTFlow 的 59.6 提升至 66.2,同时保持目标文本一致性。
研究背景与动机¶
运动迁移不是把参考视频换一种颜色,而是要求生成视频既遵循新的主体和场景描述,又保留参考中的运动轨迹与空间组织。例如,参考车辆正在转弯,目标文本换了车型和环境,结果仍应转弯,而不能只生成一段视觉流畅的直行视频。这里至少有三项可能冲突的要求:动作要对、主体语义要对、物体相对位置也要对。只优化其中一项,容易得到“看起来会动,但并没有复现参考”的结果。
视频 DiT 的统一注意力把空间和时间关系混在同一结构中,不像一些 U-Net 视频模型那样显式分出时间模块。GWTF 通过扭曲噪声控制运动,RoPECraft 操作旋转位置编码,DiTFlow 从跨帧注意力提取位移;这些方法提供了控制入口,却没有充分回答同一个 DiT 内究竟哪些注意力头承担运动、哪些更适合保存结构。直接聚合全部头会混入无关空间关联;即使位移方向合理,也可能把背景运动错配给前景,或者让对象位置与数量发生变化。
作者于是把问题缩小到头级别:先用跨帧对应验证运动头,再用注意力熵分析结构头,而不是假设整个注意力层都承担相同功能。核心 idea:将“运动跟随谁”和“结构保留什么”分开控制,让运动头提供位移、扩散特征提供语义对应、低熵结构头提供布局约束,再在同一次生成中协同使用。
方法详解¶
整体框架¶
输入是参考视频和目标文本,输出是符合目标描述、同时跟随参考运动与布局的视频。HALO 以预训练视频 DiT 为生成器:参考分支提取跨帧位移及结构值特征,目标分支利用位移损失优化潜变量,并在生成时接收选定头的参考特征。这里的“免训练”指不更新模型参数,不代表只需一次前向传播,也不代表不计算梯度。
整个流程有三个关键控制点。运动头筛选负责从统一注意力中选出合适的运动信号;语义校正与潜变量优化负责解决“相似纹理不等于同一对象”的匹配错误;低熵结构注入补足位移本身无法约束的空间布局。前两者主要控制跨帧关系,后者为生成过程提供帧内结构支撑。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
inputs["参考视频与目标文本"] --> motion["运动头筛选"]
motion --> semantic["语义校正与<br/>潜变量优化"]
inputs --> features["参考注意力与值特征"]
semantic --> structure["低熵结构注入"]
features --> structure
structure --> output["运动与布局对齐的<br/>目标视频"]
图中是控制信息的依赖关系,不是论文补充材料中逐时间步算法的替代品。运动优化和结构注入共同服务于生成;当前正文没有给出足以复原全部执行调度的细节。
关键设计¶
1. 运动头筛选:从统一注意力中挑出可靠的跨帧对应
作者先依据注意力图与模式掩码的相似性区分头:时间模式表现为跨帧对角关联,空间模式更偏向帧内局部关联。随后才检验这种分类是否真的对应运动能力,而不是仅凭注意力可视化给头命名。具体来说,对某个头,用一帧的查询与另一帧的键计算跨帧注意力;对每个源 patch 找出最强的目标 patch,再把两者的二维坐标相减,就得到该头的位移图。位移图保留了“这个位置指向下一帧哪里”,比单看注意力亮暗更接近运动本身。
论文将这些位移与 RAFT 光流参考进行比较,用方向余弦相似度形成 Directional Alignment,用 Pearson 相关系数形成 Correlation,分别评估运动方向和整体模式一致性。时间头在两项上表现更好,因而 HALO 只聚合选出的运动头来构造后续运动信号。RAFT 在这里用于分析验证,不能据此把 HALO 的核心控制信号说成直接来自外部光流。正文图没有可可靠转录的 DA、Corr 数值,因此本笔记不补造它们。
这个筛选并非“头越少越好”,而是避免空间头稀释动态相关性。后面的头配置实验提供了直接检验:全部头的 MF 为 63.1,运动头为 66.2,空间头则只有 53.6。它支持所选头更适合这一任务,但还不能证明运动和结构在所有模型、所有时刻都完全解耦。
2. 语义校正与潜变量优化:先确定运动对应对象,再把位移变成可微约束
跨帧注意力的最大值可能来自外观相近却语义不相干的区域,因此仅将最大注意力位置当成位移终点并不可靠。HALO 用扩散特征的跨帧余弦相似度建立语义对应。参考侧的语义对应细化 SCR 不直接采用语义匹配结果,而是先保留注意力最高的 top-k 候选,再从中选出二维位置距离语义最佳匹配最近的候选。注意力限定运动上可信的候选,语义信息则帮助在这些候选间消歧,最终形成参考位移图。
可以把这一步理解为“先列候选,再按语义位置重排”,而不是对两张相似度图做简单平均。下面将正文的索引描述整理为明确的逐 patch 写法;这是依据文字澄清记号,不是补充一种新算法:
其中,\(i\) 是源 patch,\(j\) 是目标 patch,\(g\) 将展平索引还原为二维坐标,\(I^{\mathrm{cor}}\) 是扩散特征余弦相似度最高的对应位置。top-k 的具体数值被正文放到补充材料,当前缓存没有该值,因此不能自行指定。
目标侧不能再靠硬 argmax 构造全部控制路径,否则无法通过匹配选择顺畅地优化潜变量。HALO 使用语义重加权 SRW:在语义最佳匹配处给注意力 logits 添加偏置,再经 softmax 得到概率,并计算坐标差的期望。注意这个偏置加在 softmax 之前,不是直接修改归一化后的概率,也不是把所有非语义匹配位置清零。
\(E\) 表示跨帧注意力 logits,\(\beta\) 为偏置强度。缓存中原式的求和索引排版受损,这里按正文“patch 级位移图”和坐标期望的定义,固定源 patch、对目标 patch 求和,避免把整张图误写成一个全局位移。目标侧得到连续的软位移后,便可通过与参考位移的 L2 距离反向优化潜变量;生成模型权重保持冻结。SCR 改善监督目标,SRW 改善目标分支的位移估计,两者不是同一操作的不同名称。
3. 低熵结构注入:让参考布局进入生成,但减少无选择的外观搬运
即使每个 patch 的位移方向都接近参考,也不意味着目标视频一定从正确的位置、形状或对象数量出发。论文消融中,缺少结构注入会出现结构扭曲和对象重复。这说明运动约束无法独自决定整幅图的空间组织,因此 HALO 还要从参考视频提取能够保存布局的特征。
作者按视觉 token 注意力分布的熵选择结构头。对于一个归一化分布,熵的基本定义是 \(H=-\sum_k a_k\log a_k\);较低的熵意味着注意力更集中。论文观察到,具有清晰对角模式的低熵头,其 PCA 特征也具有较低空间熵,参考结构保留得更清楚。例如图 4 中 L20 H8 的注意力熵 / 特征熵为 3.34 / 0.44,L20 H6 则为 7.89 / 0.77。需要强调,起作用的是本文模型中经过验证的模式与熵的关联,不是“任何低熵分布都必然表示结构”的普遍定理。
在生成过程中,HALO 只把这些低熵头的参考值特征注入目标的对应头,而不是复制全部头。论文采用熵低于 7 的头,阈值来自分析中观察到的中位数。选择性注入旨在保留布局,同时减少无选择注入带来的噪声和参考身份泄漏;它并没有提供泄漏彻底消失的保证。头级熵如何汇总、哪些层和时间步执行注入,仍须补充材料或实现才能精确复现。
损失函数 / 训练策略¶
本文新增的核心优化目标是语义运动损失,即参考位移图与目标位移图的 L2 距离。它更新生成潜变量,而不是训练一个运动适配器或微调 DiT。参考侧的候选选择提供固定运动目标,目标侧的软位移使该目标能用于梯度优化。
正文给出的主设置是 CogVideoX、50 个去噪步、12 个优化步 \(T_{\mathrm{opt}}\)、guidance scale 7,以及 SRW 偏置 \(\beta=0.1\);结构头选择条件为注意力熵低于 7。不能把“12 个优化步”自动解读成每个去噪步都做 12 次优化,正文将具体优化算法指向补充材料 C.2。
当前缓存没有补充材料,因此不填写优化器、学习率、top-k、精确注入调度或显存耗时。正文还指向 Wan 上的附加实验,但没有提供这些实验的具体结果,不能据此声称跨骨干收益与 CogVideoX 相同。
实验关键数据¶
主实验¶
下表来自原文表 1。CLIP 衡量文本与视频一致性,TC 衡量时间一致性,MF 衡量参考运动保真度,三者越高越好;FTD 是论文采用的另一项参考运动对齐指标,越低越好。正文未展开 FTD 的具体计算及 TC 的完整实现,本笔记保留其原名,不自行补写定义细节。
| 方法 | CLIP ↑ | TC ↑ | MF ↑ | FTD ↓ |
|---|---|---|---|---|
| MoFT | 30.9 | 85.8 | 34.8 | 23.0 |
| ConMO | 29.8 | 85.3 | 52.0 | 17.4 |
| MotionClone | 30.4 | 78.6 | 55.6 | 19.8 |
| DiTFlow | 31.0 | 89.5 | 59.6 | 23.0 |
| RoPECraft | 30.3 | 85.9 | 58.2 | 19.6 |
| GWTF | 31.6 | 88.2 | 62.5 | 21.6 |
| HALO | 31.7 | 87.5 | 66.2 | 19.4 |
HALO 相比 GWTF 的 MF 增加 3.7 个点,CLIP 增加 0.1,FTD 降低 2.2,但 TC 下降 0.7。它在该表的 CLIP 和 MF 上最高,FTD 则并非全表最优:ConMO 的 17.4 低于 HALO 的 19.4。对比跨越 U-Net 与 DiT 方法,应理解为完整系统比较,而非完全一致骨干下的单模块增益。
电影场景数据集的原文表 2 中,HALO 的 CLIP / TC / MF 为 30.5 / 88.9 / 52.6;GWTF 为 30.2 / 87.6 / 46.6,DiTFlow 为 29.7 / 90.4 / 48.4。HALO 的 MF 相对二者分别增加 6.0 和 4.2 个点,但 TC 仍低于 DiTFlow。该表排除了需要视频掩码的方法,不能把它描述成对全部主实验基线的电影场景比较。
消融实验¶
下表对应原文表 3,以位移优化为基线。“语义引导”包括语义对应细化与语义重加权,“结构注入”是所选结构头的特征注入。
| 配置 | 语义引导 | 结构注入 | CLIP ↑ | TC ↑ | MF ↑ | FTD ↓ |
|---|---|---|---|---|---|---|
| Exp. 1:位移优化基线 | 否 | 否 | 31.0 | 89.5 | 59.6 | 23.0 |
| Exp. 2:仅结构注入 | 否 | 是 | 30.6 | 88.3 | 61.8 | 20.5 |
| Exp. 3:仅语义引导 | 是 | 否 | 30.9 | 88.5 | 61.3 | 20.9 |
| Exp. 4:HALO | 是 | 是 | 31.7 | 87.5 | 66.2 | 19.4 |
两部分单独加入时,MF 分别增加 2.2 和 1.7;联合使用则增加 6.6,且恢复并提高了 CLIP。相对完整方法,去掉结构注入使 MF 从 66.2 降至 61.3,去掉语义引导则降至 61.8。这支持二者互补,但表 3 将 SCR 与 SRW 合并为一个因素,无法据此单独量化两者的贡献。
原文表 6 进一步检验“究竟选哪些头”,以下保留其可清楚辨认的数值。前一组改变运动位移的头配置,后一组改变结构注入的熵范围,不能把两组当成同一个变量的连续扫描。
| 分析因素 | 配置 | MF ↑ | FTD ↓ |
|---|---|---|---|
| 运动头配置 | 全部头 | 63.1 | 21.6 |
| 运动头配置 | 空间头 | 53.6 | 22.7 |
| 运动头配置 | 运动头 | 66.2 | 19.4 |
| 结构注入熵范围 | 高于 7 | 54.1 | 23.5 |
| 结构注入熵范围 | 低于 7 | 66.2 | 19.4 |
关键发现¶
- 运动头选择带来的 MF 优势并不只是可视化印象:相对全部头增加 3.1 个点,相对空间头增加 12.6 个点。低熵结构头相对高熵头的 MF 优势为 12.1 个点,FTD 也从 23.5 降至 19.4。
- TC 不能孤立地当作运动迁移成功标准。作者指出它倾向奖励更静态的输出;HALO 的 MF 更高而 TC 略低,与这一解释相容,但正文没有给出足够数据将全部 TC 差异归因于静态偏好。
- 用户研究共有 20 名参与者,使用 5 点量表后归一化到 0–100。HALO 的编辑准确性 / 时间一致性 / 运动准确性为 86.5 / 87.8 / 93.3,DiTFlow 为 84.1 / 83.1 / 69.0;这些是归一化评分,不是胜率或回答正确率。
亮点与洞察¶
- 分析结果直接决定干预位置。 运动头的位移验证和结构头的熵分析最终都进入控制算法,再由头配置消融检验,不只是附带的注意力可视化。
- 语义不是运动的替代,而是匹配的约束。 SCR 在运动候选中选择接近语义对应的位置,避免让语义特征单独决定轨迹;SRW 则将这种偏好保留在可微的软位移中。
- 布局与运动需要不同控制量。 位移监督决定跨帧如何变化,结构注入帮助维持变化发生的空间组织。消融中联合使用的收益提示,改善轨迹前常常也需要改善轨迹附着的对象结构。
局限与展望¶
- 作者提出的后续方向: 将头级控制扩展到运动方向与强度的显式编辑。当前主任务仍是跟随参考,并不等于已经提供可任意设定方向、速度的用户控制器。
- 复现信息边界: 当前缓存仅有正文,缺少补充材料中的 top-k、优化调度、运行时间、峰值显存和电影数据集细节。不能把作者所称“边际开销较小”改写成未经核验的秒数或效率倍数。
- 头的专门化仍是经验性结论。 低熵与结构保存相关,运动头优于空间头,但没有证明两类功能完全独立或熵阈值 7 可跨骨干直接复用。可进一步比较跨层、跨时间步及跨模型的稳定性。
- 语义匹配也可能成为误差来源。 从机制推断,遮挡、重复纹理或错误的扩散特征对应会影响 SCR 与 SRW;正文展示复杂运动成功案例,但没有系统的语义对应失败率,不能认定这些情况已经解决。
- 评测仍有不确定性。 主表没有置信区间,用户研究正文没有完整抽样和方差信息,电影场景还过滤了部分基线。CLIP 的 0.1 点优势不宜被解释为已证明具有统计显著性,结构保持也主要通过可视化与相关指标支撑。
相关工作与启发¶
- vs DiTFlow: 两者都从跨帧注意力构造位移并优化潜变量。HALO 的增量在于筛选运动头、用 SCR / SRW 修正语义对应,并另行注入结构特征;它不是另起一套从零训练的视频生成器。
- vs GWTF / RoPECraft: 前者用噪声扭曲,后者用轨迹引导的位置编码控制。HALO 选择模型内部头级表征作为控制入口,带来可解释的组件分析,但仍需承担潜变量优化成本。
- vs Sparse VideoGen 与扩散特征对应研究: 前者启发了时间 / 空间头的模式区分,后者说明扩散特征可提供语义对应。HALO 将这些认识组合到运动迁移,而不是把注意力稀疏化本身当作目标。
论文入口见页首官方页面、PDF 和项目页;当前材料没有确认独立代码仓库链接,因此不把项目页冒充为代码地址。
评分¶
- 新颖性:4/5。把头级功能分析落实为运动与结构两种控制入口,贡献清晰,但仍建立在已有位移优化与特征注入之上。
- 实验充分度:4/5。主基准、电影场景、组件消融、头配置和用户研究相互补充;统计信息及关键复现细节在当前正文中不完整。
- 写作质量:4/5。问题与组件的对应关系明确,但部分指标和实现细节需查补充材料,缓存公式排版也影响复核。
- 价值:4/5。为免参数更新的视频运动控制提供了可解释、可复用的干预思路,实际部署价值仍需结合完整效率与跨骨干结果判断。