跳转至

Controlling Motion Transfer in Diffusion Transformers via Attention Heads

会议: ECCV 2026
Paper: https://eccv.ecva.net/virtual/2026/poster/3621
PDF: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/2249.pdf
项目: HALO
领域: 视频生成 / 运动迁移
关键词: 扩散 Transformer、运动注意力头、语义对应、结构注入、免训练控制

一句话总结

HALO 在视频 DiT 中分别识别运动头和结构头,用语义校正后的位移监督潜变量、用低熵头的参考值特征保留布局,在不更新模型参数的前提下将主基准运动保真度 MF 从 DiTFlow 的 59.6 提升至 66.2,同时保持目标文本一致性。

研究背景与动机

运动迁移不是把参考视频换一种颜色,而是要求生成视频既遵循新的主体和场景描述,又保留参考中的运动轨迹与空间组织。例如,参考车辆正在转弯,目标文本换了车型和环境,结果仍应转弯,而不能只生成一段视觉流畅的直行视频。这里至少有三项可能冲突的要求:动作要对、主体语义要对、物体相对位置也要对。只优化其中一项,容易得到“看起来会动,但并没有复现参考”的结果。

视频 DiT 的统一注意力把空间和时间关系混在同一结构中,不像一些 U-Net 视频模型那样显式分出时间模块。GWTF 通过扭曲噪声控制运动,RoPECraft 操作旋转位置编码,DiTFlow 从跨帧注意力提取位移;这些方法提供了控制入口,却没有充分回答同一个 DiT 内究竟哪些注意力头承担运动、哪些更适合保存结构。直接聚合全部头会混入无关空间关联;即使位移方向合理,也可能把背景运动错配给前景,或者让对象位置与数量发生变化。

作者于是把问题缩小到头级别:先用跨帧对应验证运动头,再用注意力熵分析结构头,而不是假设整个注意力层都承担相同功能。核心 idea:将“运动跟随谁”和“结构保留什么”分开控制,让运动头提供位移、扩散特征提供语义对应、低熵结构头提供布局约束,再在同一次生成中协同使用。

方法详解

整体框架

输入是参考视频和目标文本,输出是符合目标描述、同时跟随参考运动与布局的视频。HALO 以预训练视频 DiT 为生成器:参考分支提取跨帧位移及结构值特征,目标分支利用位移损失优化潜变量,并在生成时接收选定头的参考特征。这里的“免训练”指不更新模型参数,不代表只需一次前向传播,也不代表不计算梯度。

整个流程有三个关键控制点。运动头筛选负责从统一注意力中选出合适的运动信号;语义校正与潜变量优化负责解决“相似纹理不等于同一对象”的匹配错误;低熵结构注入补足位移本身无法约束的空间布局。前两者主要控制跨帧关系,后者为生成过程提供帧内结构支撑。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    inputs["参考视频与目标文本"] --> motion["运动头筛选"]
    motion --> semantic["语义校正与<br/>潜变量优化"]
    inputs --> features["参考注意力与值特征"]
    semantic --> structure["低熵结构注入"]
    features --> structure
    structure --> output["运动与布局对齐的<br/>目标视频"]

图中是控制信息的依赖关系,不是论文补充材料中逐时间步算法的替代品。运动优化和结构注入共同服务于生成;当前正文没有给出足以复原全部执行调度的细节。

关键设计

1. 运动头筛选:从统一注意力中挑出可靠的跨帧对应

作者先依据注意力图与模式掩码的相似性区分头:时间模式表现为跨帧对角关联,空间模式更偏向帧内局部关联。随后才检验这种分类是否真的对应运动能力,而不是仅凭注意力可视化给头命名。具体来说,对某个头,用一帧的查询与另一帧的键计算跨帧注意力;对每个源 patch 找出最强的目标 patch,再把两者的二维坐标相减,就得到该头的位移图。位移图保留了“这个位置指向下一帧哪里”,比单看注意力亮暗更接近运动本身。

论文将这些位移与 RAFT 光流参考进行比较,用方向余弦相似度形成 Directional Alignment,用 Pearson 相关系数形成 Correlation,分别评估运动方向和整体模式一致性。时间头在两项上表现更好,因而 HALO 只聚合选出的运动头来构造后续运动信号。RAFT 在这里用于分析验证,不能据此把 HALO 的核心控制信号说成直接来自外部光流。正文图没有可可靠转录的 DA、Corr 数值,因此本笔记不补造它们。

这个筛选并非“头越少越好”,而是避免空间头稀释动态相关性。后面的头配置实验提供了直接检验:全部头的 MF 为 63.1,运动头为 66.2,空间头则只有 53.6。它支持所选头更适合这一任务,但还不能证明运动和结构在所有模型、所有时刻都完全解耦。

2. 语义校正与潜变量优化:先确定运动对应对象,再把位移变成可微约束

跨帧注意力的最大值可能来自外观相近却语义不相干的区域,因此仅将最大注意力位置当成位移终点并不可靠。HALO 用扩散特征的跨帧余弦相似度建立语义对应。参考侧的语义对应细化 SCR 不直接采用语义匹配结果,而是先保留注意力最高的 top-k 候选,再从中选出二维位置距离语义最佳匹配最近的候选。注意力限定运动上可信的候选,语义信息则帮助在这些候选间消歧,最终形成参考位移图。

可以把这一步理解为“先列候选,再按语义位置重排”,而不是对两张相似度图做简单平均。下面将正文的索引描述整理为明确的逐 patch 写法;这是依据文字澄清记号,不是补充一种新算法:

\[ I^{\mathrm{ref}}_{f,f'}(i) =\underset{j\in\operatorname{TopK}(M_{f,f'}(i,:))}{\arg\min} \left\|g(j)-g\!\left(I^{\mathrm{cor}}_{f,f'}(i)\right)\right\|_2, \qquad D^{\mathrm{ref}}_{f,f'}(i)=g\!\left(I^{\mathrm{ref}}_{f,f'}(i)\right)-g(i). \]

其中,\(i\) 是源 patch,\(j\) 是目标 patch,\(g\) 将展平索引还原为二维坐标,\(I^{\mathrm{cor}}\) 是扩散特征余弦相似度最高的对应位置。top-k 的具体数值被正文放到补充材料,当前缓存没有该值,因此不能自行指定。

目标侧不能再靠硬 argmax 构造全部控制路径,否则无法通过匹配选择顺畅地优化潜变量。HALO 使用语义重加权 SRW:在语义最佳匹配处给注意力 logits 添加偏置,再经 softmax 得到概率,并计算坐标差的期望。注意这个偏置加在 softmax 之前,不是直接修改归一化后的概率,也不是把所有非语义匹配位置清零。

\[ \widetilde M_{f,f'}(i,:) =\operatorname{softmax}\!\left(E_{f,f'}(i,:) +\beta\,\mathbf{1}[\,\cdot=I^{\mathrm{cor}}_{f,f'}(i)]\right), \qquad D^{\mathrm{tgt}}_{f,f'}(i) =\sum_j\widetilde M_{f,f'}(i,j)\,[g(j)-g(i)]. \]

\(E\) 表示跨帧注意力 logits,\(\beta\) 为偏置强度。缓存中原式的求和索引排版受损,这里按正文“patch 级位移图”和坐标期望的定义,固定源 patch、对目标 patch 求和,避免把整张图误写成一个全局位移。目标侧得到连续的软位移后,便可通过与参考位移的 L2 距离反向优化潜变量;生成模型权重保持冻结。SCR 改善监督目标,SRW 改善目标分支的位移估计,两者不是同一操作的不同名称。

3. 低熵结构注入:让参考布局进入生成,但减少无选择的外观搬运

即使每个 patch 的位移方向都接近参考,也不意味着目标视频一定从正确的位置、形状或对象数量出发。论文消融中,缺少结构注入会出现结构扭曲和对象重复。这说明运动约束无法独自决定整幅图的空间组织,因此 HALO 还要从参考视频提取能够保存布局的特征。

作者按视觉 token 注意力分布的熵选择结构头。对于一个归一化分布,熵的基本定义是 \(H=-\sum_k a_k\log a_k\);较低的熵意味着注意力更集中。论文观察到,具有清晰对角模式的低熵头,其 PCA 特征也具有较低空间熵,参考结构保留得更清楚。例如图 4 中 L20 H8 的注意力熵 / 特征熵为 3.34 / 0.44,L20 H6 则为 7.89 / 0.77。需要强调,起作用的是本文模型中经过验证的模式与熵的关联,不是“任何低熵分布都必然表示结构”的普遍定理。

在生成过程中,HALO 只把这些低熵头的参考值特征注入目标的对应头,而不是复制全部头。论文采用熵低于 7 的头,阈值来自分析中观察到的中位数。选择性注入旨在保留布局,同时减少无选择注入带来的噪声和参考身份泄漏;它并没有提供泄漏彻底消失的保证。头级熵如何汇总、哪些层和时间步执行注入,仍须补充材料或实现才能精确复现。

损失函数 / 训练策略

本文新增的核心优化目标是语义运动损失,即参考位移图与目标位移图的 L2 距离。它更新生成潜变量,而不是训练一个运动适配器或微调 DiT。参考侧的候选选择提供固定运动目标,目标侧的软位移使该目标能用于梯度优化。

正文给出的主设置是 CogVideoX、50 个去噪步、12 个优化步 \(T_{\mathrm{opt}}\)、guidance scale 7,以及 SRW 偏置 \(\beta=0.1\);结构头选择条件为注意力熵低于 7。不能把“12 个优化步”自动解读成每个去噪步都做 12 次优化,正文将具体优化算法指向补充材料 C.2。

当前缓存没有补充材料,因此不填写优化器、学习率、top-k、精确注入调度或显存耗时。正文还指向 Wan 上的附加实验,但没有提供这些实验的具体结果,不能据此声称跨骨干收益与 CogVideoX 相同。

实验关键数据

主实验

下表来自原文表 1。CLIP 衡量文本与视频一致性,TC 衡量时间一致性,MF 衡量参考运动保真度,三者越高越好;FTD 是论文采用的另一项参考运动对齐指标,越低越好。正文未展开 FTD 的具体计算及 TC 的完整实现,本笔记保留其原名,不自行补写定义细节。

方法 CLIP ↑ TC ↑ MF ↑ FTD ↓
MoFT 30.9 85.8 34.8 23.0
ConMO 29.8 85.3 52.0 17.4
MotionClone 30.4 78.6 55.6 19.8
DiTFlow 31.0 89.5 59.6 23.0
RoPECraft 30.3 85.9 58.2 19.6
GWTF 31.6 88.2 62.5 21.6
HALO 31.7 87.5 66.2 19.4

HALO 相比 GWTF 的 MF 增加 3.7 个点,CLIP 增加 0.1,FTD 降低 2.2,但 TC 下降 0.7。它在该表的 CLIP 和 MF 上最高,FTD 则并非全表最优:ConMO 的 17.4 低于 HALO 的 19.4。对比跨越 U-Net 与 DiT 方法,应理解为完整系统比较,而非完全一致骨干下的单模块增益。

电影场景数据集的原文表 2 中,HALO 的 CLIP / TC / MF 为 30.5 / 88.9 / 52.6;GWTF 为 30.2 / 87.6 / 46.6,DiTFlow 为 29.7 / 90.4 / 48.4。HALO 的 MF 相对二者分别增加 6.0 和 4.2 个点,但 TC 仍低于 DiTFlow。该表排除了需要视频掩码的方法,不能把它描述成对全部主实验基线的电影场景比较。

消融实验

下表对应原文表 3,以位移优化为基线。“语义引导”包括语义对应细化与语义重加权,“结构注入”是所选结构头的特征注入。

配置 语义引导 结构注入 CLIP ↑ TC ↑ MF ↑ FTD ↓
Exp. 1:位移优化基线 31.0 89.5 59.6 23.0
Exp. 2:仅结构注入 30.6 88.3 61.8 20.5
Exp. 3:仅语义引导 30.9 88.5 61.3 20.9
Exp. 4:HALO 31.7 87.5 66.2 19.4

两部分单独加入时,MF 分别增加 2.2 和 1.7;联合使用则增加 6.6,且恢复并提高了 CLIP。相对完整方法,去掉结构注入使 MF 从 66.2 降至 61.3,去掉语义引导则降至 61.8。这支持二者互补,但表 3 将 SCR 与 SRW 合并为一个因素,无法据此单独量化两者的贡献。

原文表 6 进一步检验“究竟选哪些头”,以下保留其可清楚辨认的数值。前一组改变运动位移的头配置,后一组改变结构注入的熵范围,不能把两组当成同一个变量的连续扫描。

分析因素 配置 MF ↑ FTD ↓
运动头配置 全部头 63.1 21.6
运动头配置 空间头 53.6 22.7
运动头配置 运动头 66.2 19.4
结构注入熵范围 高于 7 54.1 23.5
结构注入熵范围 低于 7 66.2 19.4

关键发现

  • 运动头选择带来的 MF 优势并不只是可视化印象:相对全部头增加 3.1 个点,相对空间头增加 12.6 个点。低熵结构头相对高熵头的 MF 优势为 12.1 个点,FTD 也从 23.5 降至 19.4。
  • TC 不能孤立地当作运动迁移成功标准。作者指出它倾向奖励更静态的输出;HALO 的 MF 更高而 TC 略低,与这一解释相容,但正文没有给出足够数据将全部 TC 差异归因于静态偏好。
  • 用户研究共有 20 名参与者,使用 5 点量表后归一化到 0–100。HALO 的编辑准确性 / 时间一致性 / 运动准确性为 86.5 / 87.8 / 93.3,DiTFlow 为 84.1 / 83.1 / 69.0;这些是归一化评分,不是胜率或回答正确率。

亮点与洞察

  • 分析结果直接决定干预位置。 运动头的位移验证和结构头的熵分析最终都进入控制算法,再由头配置消融检验,不只是附带的注意力可视化。
  • 语义不是运动的替代,而是匹配的约束。 SCR 在运动候选中选择接近语义对应的位置,避免让语义特征单独决定轨迹;SRW 则将这种偏好保留在可微的软位移中。
  • 布局与运动需要不同控制量。 位移监督决定跨帧如何变化,结构注入帮助维持变化发生的空间组织。消融中联合使用的收益提示,改善轨迹前常常也需要改善轨迹附着的对象结构。

局限与展望

  • 作者提出的后续方向: 将头级控制扩展到运动方向与强度的显式编辑。当前主任务仍是跟随参考,并不等于已经提供可任意设定方向、速度的用户控制器。
  • 复现信息边界: 当前缓存仅有正文,缺少补充材料中的 top-k、优化调度、运行时间、峰值显存和电影数据集细节。不能把作者所称“边际开销较小”改写成未经核验的秒数或效率倍数。
  • 头的专门化仍是经验性结论。 低熵与结构保存相关,运动头优于空间头,但没有证明两类功能完全独立或熵阈值 7 可跨骨干直接复用。可进一步比较跨层、跨时间步及跨模型的稳定性。
  • 语义匹配也可能成为误差来源。 从机制推断,遮挡、重复纹理或错误的扩散特征对应会影响 SCR 与 SRW;正文展示复杂运动成功案例,但没有系统的语义对应失败率,不能认定这些情况已经解决。
  • 评测仍有不确定性。 主表没有置信区间,用户研究正文没有完整抽样和方差信息,电影场景还过滤了部分基线。CLIP 的 0.1 点优势不宜被解释为已证明具有统计显著性,结构保持也主要通过可视化与相关指标支撑。

相关工作与启发

  • vs DiTFlow: 两者都从跨帧注意力构造位移并优化潜变量。HALO 的增量在于筛选运动头、用 SCR / SRW 修正语义对应,并另行注入结构特征;它不是另起一套从零训练的视频生成器。
  • vs GWTF / RoPECraft: 前者用噪声扭曲,后者用轨迹引导的位置编码控制。HALO 选择模型内部头级表征作为控制入口,带来可解释的组件分析,但仍需承担潜变量优化成本。
  • vs Sparse VideoGen 与扩散特征对应研究: 前者启发了时间 / 空间头的模式区分,后者说明扩散特征可提供语义对应。HALO 将这些认识组合到运动迁移,而不是把注意力稀疏化本身当作目标。

论文入口见页首官方页面、PDF 和项目页;当前材料没有确认独立代码仓库链接,因此不把项目页冒充为代码地址。

评分

  • 新颖性:4/5。把头级功能分析落实为运动与结构两种控制入口,贡献清晰,但仍建立在已有位移优化与特征注入之上。
  • 实验充分度:4/5。主基准、电影场景、组件消融、头配置和用户研究相互补充;统计信息及关键复现细节在当前正文中不完整。
  • 写作质量:4/5。问题与组件的对应关系明确,但部分指标和实现细节需查补充材料,缓存公式排版也影响复核。
  • 价值:4/5。为免参数更新的视频运动控制提供了可解释、可复用的干预思路,实际部署价值仍需结合完整效率与跨骨干结果判断。