跳转至

Rebalancing Reference Frame Dominance to Improve Motion in Image-to-Video Models

会议: NeurIPS2026
arXiv: 2605.19398
领域: 视频生成
关键词: 图像到视频、参考帧主导、注意力调制、运动控制、免训练推理

一句话总结

DyMoS 在图像到视频模型的早期去噪中,仅对文本条件分支的“非参考帧查询→参考帧键”自注意力 logits 减去可调偏置,使 Wan 2.2 的 VBench Dynamic Degree 从 51.7 提升至 64.8,但更强动态性并不自动意味着更真实的运动或更高的参考保真度。

研究背景与动机

图像到视频(I2V)模型通常在文本到视频(T2V)骨干上加入图像条件,让输入图像成为生成视频的第一帧。参考图像提供主体、背景和颜色等外观约束,但这种约束也可能过强:即使提示词明确要求跳跃或车辆行驶,后续帧仍很像第一帧,视频成了微动的静态画面。既有方法把问题归因于条件图像泄漏,向图像条件注入噪声、改变潜变量注入方式,或像 ALG 一样在早期去噪阶段低通滤波输入图像;这些办法可能需要重新训练,或以外观信息损失换取运动。

本文关注的不是输入图像“太清楚”,而是模型内部如何反复使用它。作者用 CogVideoX-5B 构造 50 组配对生成:先用 T2V 生成视频,再把第一帧交给 I2V,保持提示词、随机种子和采样配置一致。把 token 自注意力聚合到帧间后,I2V 的非参考帧对参考帧键分配了更多注意力,尤其发生在最初 10% 的去噪步骤。这种参考帧主导会使外观信息沿时间轴过度传播,挤占后续帧之间的信息交互;不过,配对骨干仍有参数差异,不能把这一观察理解为所有静态生成问题的唯一解释。

作者进一步对这条注意力路径做正负方向干预:加强它会使视频更静态,削弱它则提高动态性,并使帧间注意力更接近配对的 T2V。核心 idea:保留输入图像和模型权重,只在决定全局运动的早期采样阶段降低后续帧对参考帧的过度依赖,让已有视频先验参与运动生成,而不是先破坏图像条件再补救外观。

方法详解

整体框架

DyMoS(Dynamic Motion Slider)是采样时的注意力修改,不是新增训练网络。输入仍是参考图像、文本提示词和随机视频潜变量;参考图像照常编码,沿用各骨干原有的图像条件注入方式。每一步仍计算空文本预测和文本条件预测,再按原有无分类器引导(CFG)组合并更新视频潜变量。

新增操作位于文本条件预测内部:在采样早期,对所有相关自注意力层中“非参考帧查询→参考帧键”的 logits 减去偏置,再做 softmax。参考帧自身的查询行、其他视频键以及 MM-DiT 中的文本 token 不属于这条目标路径。经过设定的早期窗口后,恢复原始注意力,最后由原有 VAE 解码视频。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["参考图像、文本<br/>当前视频潜变量"] --> B["早期窗口门控"]
    B -->|早期:修改文本条件分支| C["定向 logit 减偏置"]
    B -->|窗口结束:原始注意力| D["条件分支 CFG"]
    C --> D
    A -->|原始空文本预测,仍含图像条件| D
    D --> E["原有采样器更新<br/>循环后 VAE 解码"]

这里的“空文本”不等于“没有图像条件”:两条 CFG 分支都继续接收同一参考图像。框架图全部是推理数据流,没有训练监督、额外运动教师或奖励优化阶段。

关键设计

1. 早期窗口门控:先改变运动布局,再恢复细节精修

初期去噪决定粗粒度运动和场景演化,后期则更偏向外观与时序细节。如果整个采样过程都压制参考信息,模型可能不仅摆脱静止,也失去主体外观锚点。DyMoS 用采样步骤比例 \(\lambda\) 限定干预窗口,仅在最初一部分步骤使用修改后的注意力,之后完全回到原始计算。机制分析采用最初 10% 的步骤统计;这不是主实验统一使用的干预比例,Wan 2.2 的主实验取 \(\lambda=0.2\)。

这个门控作用于采样过程,而非生成视频的前几个输出帧。另一个独立维度是查询所在的潜在帧位置,它由后面的帧调度控制。附录算法用 \(t=i/N\) 和 \(t<\lambda\) 表示窗口,正文背景则以流匹配时间从噪声端到干净端解释去噪;两种时间约定不宜混为一谈。实际移植应依据采样步骤进度开启早期窗口,并核实边界,而不是直接把算法中的 \(t\) 当成骨干的原生噪声时间。

2. 定向 logit 减偏置:削弱读取参考帧的概率,不删除参考信息

普通自注意力把查询与各键的相似度变成 logits,再用 softmax 分配读取权重。DyMoS 不修改图像、查询、键或值,而是在 softmax 之前,只调整后续视频帧查询读取参考视频帧键的那一块矩阵。设 \(\mathcal{I}_{f_0}\) 为参考潜在帧的 token 索引,\(f(i)\) 为查询 token 的潜在帧位置,其核心机制为原文式(6):

\[ \tilde{\mathcal{L}}[i,j]=\mathcal{L}[i,j]-\gamma\,\phi(f(i))\,\mathbf{1}[j\in\mathcal{I}_{f_0}]\,\mathbf{1}[i\notin\mathcal{I}_{f_0}]. \]

其中 \(\gamma\) 是运动滑杆,\(\phi\) 是帧位置调度。\(\gamma>0\) 降低目标 logits,\(\gamma=0\) 恢复基线,\(\gamma<0\) 加强参考帧主导。两个指示函数确保不是对整张注意力矩阵均匀减常数:后者会被 softmax 抵消。因为只压低参考键这一组,softmax 会相对增加其他键的份额;目标参考键的未归一化权重乘以 \(e^{-\gamma\phi(f(i))}\),组内相对比例不变,这是该公式的数学解释,并非新的作者公式。

修改不直接清零参考注意力,也不扰动参考帧查询行,因此参考信息仍可进入后续帧。主实验在所有骨干上都用均匀调度 \(\phi=1\);附录比较的线性与对数调度分别为 \(f(i)/(F-1)\) 和 \(\log(1+f(i))/\log F\),使靠近参考帧的查询受到较弱干预,较后帧受到较强干预。不过实验显示均匀调度更有效,不能把帧距离递增调度误写成默认方法。

3. 条件分支 CFG:只改变有文本预测,保留原有图像锚点

如果空文本分支和文本条件分支都被同样改动,引导方向也会改变。作者选择仅在文本条件分支使用上述 logits,使提示词描述的运动更容易影响生成;空文本分支保持原始注意力,并继续接收原参考图像。原文式(7)给出的组合为:

\[ \tilde{\bm v}_\theta=\bm v_\theta(\bm z_t,t,\varnothing,\bm z_{\mathrm{ref}})+\omega\left[\bm v_\theta^{\tilde{\mathcal L}}(\bm z_t,t,\bm c,\bm z_{\mathrm{ref}})-\bm v_\theta(\bm z_t,t,\varnothing,\bm z_{\mathrm{ref}})\right]. \]

\(\omega\) 仍是骨干原有 CFG 强度,而非新的运动参数。方法保留原采样循环与前向次数,并通过 PyTorch FlexAttention 把分数修改融合进注意力内核。因此,“免训练”并不等于完全零成本或无需修改推理实现,也不意味着可以在任意封闭 API 上直接插入滑杆。

一个完整示例

以 Wan 2.2-14B 生成一段提示词要求车辆行驶的视频为例,配置为 40 步采样、\(\gamma=0.6\)、\(\lambda=0.2\)、\(\phi=1\)。参考图像和随机潜变量按原流程进入模型;在最初约五分之一的采样区间,文本条件分支每个后续帧查询读取参考帧键时,对应 logit 都比原值少 0.6。其他键不作该减法,空文本分支也不作该减法。

这不是指定车速,也不是显式生成轨迹,而是让后续帧不必持续复制最初车身位置,从已有视频先验和提示词中形成运动。离开早期窗口后,两分支都恢复原始注意力,保留原有精修过程。40 步乘 0.2 对应名义 8 步窗口,但附录从 \(i=1\) 开始并使用严格小于号,不能据此保证其伪代码实际恰好修改 8 步;具体边界需要实现核实。

损失函数 / 训练策略

DyMoS 没有新增损失、训练数据或权重更新。论文的流匹配和 CFG 背景描述的是现有骨干,不是本文重新训练的模块。方法虽以单个 \(\gamma\) 为用户运动滑杆,但复现实验还需要骨干特定的 \(\lambda\)、采样器、CFG 强度和分辨率。

骨干 视频尺寸(帧×宽×高)/ FPS 步数 / CFG 采样器 \(\gamma\) \(\lambda\)
Wan 2.2-14B 81×832×480 / 16 40 / 3.5 UniPC 0.6 0.20
Wan 2.1-14B 81×832×480 / 16 40 / 5.0 UniPC 1.0 0.25
HunyuanVideo-1.5 81×832×480 / 16 50 / 6.0 FlowMatch-Euler 1.0 0.20
CogVideoX-5B 49×720×480 / 8 50 / 6.0 DDIM 0.8 0.24

这张配置表来自附录表 3,各骨干均为 \(\phi=1\)。因此跨骨干有效说明干预路径可迁移,不说明同一组超参数可无调节泛化。

实验关键数据

主实验

主评测使用 VBench-I2V 的 246 个图像—文本对,排除了背景质量和相机运动指令子集;扩展实验使用 PVD 的 200 个视频首帧—描述对,以及 VidProM 的 500 条提示词配 Flux.1-dev 合成参考图像。同一骨干内固定配对随机种子和 GPU 类型,比较原始基线、官方 ALG 与 DyMoS。

VBench Dynamic Degree 基于 RAFT 光流,利用最高 5% 光流判断视频是否有足够大运动;VideoScore Dynamic Degree 是基于人类反馈训练的视频评估模型预测值。两者衡量动态性,不提供完整物理真实性保证。ViCLIP 衡量视频—文本语义相似度,VisionReward 是学习得到的人类偏好代理。

下表保留原文表 1 数值,DD 表示 Dynamic Degree,VQ 表示作者的 Video Quality。各列量纲不同,不应直接互相比大小。

骨干 方法 DD(VBench) DD(VideoScore) VQ ViCLIP VisionReward
Wan 2.2-14B Baseline 51.7 2.83 58.0 0.2614 0.143
Wan 2.2-14B ALG 55.3 2.83 57.7 0.2616 0.140
Wan 2.2-14B DyMoS 64.8 2.84 57.7 0.2621 0.143
Wan 2.1-14B Baseline 48.7 3.21 57.7 0.2601 0.132
Wan 2.1-14B ALG 52.5 3.18 57.2 0.2615 0.127
Wan 2.1-14B DyMoS 54.5 3.25 57.4 0.2618 0.126
HunyuanVideo-1.5 Baseline 48.0 2.87 58.2 0.2624 0.140
HunyuanVideo-1.5 ALG 46.3 2.87 58.2 0.2629 0.141
HunyuanVideo-1.5 DyMoS 55.3 2.88 58.1 0.2653 0.141
CogVideoX-5B Baseline 30.9 2.90 57.8 0.2612 0.140
CogVideoX-5B ALG 52.0 2.98 57.1 0.2647 0.127
CogVideoX-5B DyMoS 52.9 2.92 57.1 0.2652 0.131

Wan 2.2 的 VBench DD 增加 13.1 个百分点,约为 25.3% 相对提升;VQ 则由 58.0 变为 57.7,而不是完全不降。CogVideoX 上 DyMoS 的 VBench DD 超过 ALG,但 VideoScore DD 为 2.92,低于 ALG 的 2.98。Wan 2.1 的 VisionReward 为 0.126,低于基线 0.132 和 ALG 0.127,不能据正文概括声称所有偏好指标都稳定或提升。

作者定义的质量聚合为:

\[ \mathrm{VideoQuality}=0.1\,\mathrm{TF}+0.25\,\mathrm{MS}+0.1\,\mathrm{AQ}+0.25\,\mathrm{IQ}. \]

TF、MS、AQ、IQ 分别是时序闪烁、运动平滑度、美学质量和成像质量。原文权重总和为 0.70,并排除动态性、主体一致性和背景一致性;这里不自行归一化或修改其权重。因此该质量分数并不能直接支持“参考主体与背景保真度不变”。

消融实验

附录表 6 在 Wan 2.2 上固定主实验的 \(\gamma\) 和 \(\lambda\),只改变帧调度。

帧调度 DD(VBench) DD(VideoScore) VQ ViCLIP VisionReward
Uniform 64.8 2.84 57.7 0.2621 0.143
Linear 56.1 2.82 57.9 0.2598 0.143
Log 60.2 2.80 57.7 0.2597 0.141

均匀调度相较线性调度的 VBench DD 高 8.7 个百分点,相较对数调度高 4.6 个百分点。线性调度 VQ 略高,但运动不足,说明“离参考帧越远压制越强”不是自动更好的设计。

正文还测试 \(\gamma\in\{0.4,0.6,0.8,1.0\}\),报告从 0.4 到 0.6 的 DD 相对提升为 11.7%;图中绝对值未在缓存文字中提供,不补造数值。\(\lambda\) 从 0.24 增至 0.30 反而降低 DD,早期窗口并非越长越好。

关键发现

  • 机制距离 \(D(\gamma)\) 定义为各非参考查询帧的 I2V/T2V 帧间注意力行分布之间的 Jensen–Shannon 散度平均值;在配对分析中约 \(\gamma=0.6\) 最小,并对应接近 T2V 的动态性。这是注意力结构接近的证据,不是质量最优的普适参数证明。
  • Wan 2.2 在 PVD 的 VBench DD 从 79.0 提升至 85.0,在 VidProM 从 54.2 提升至 67.0;但 PVD ViCLIP 从 0.2147 变为 0.2143,跨数据集也不是所有指标都单调改善。
  • MTurk 用户研究采用 25 个 VBench-I2V 图像—提示词对,每个问题收集 30 个回答,比较运动、参考保真度、文本对齐和总体偏好。正文报告 DyMoS 四项均最常被选中;缓存没有图 5(c) 的精确比例,不能写具体胜率。
  • A100 80GB 单卡测时中,DyMoS 相对基线的额外开销依次为 Wan 2.2 1.2%、Wan 2.1 1.9%、HunyuanVideo-1.5 3.5%、CogVideoX 4.3%;其对应总时长为 841、749、503、242 秒,不能把 1.2% 推广到全部骨干。

亮点与洞察

  • 干预对象不是图像内容,而是信息被重复读取的路径。保持条件不变仍能释放运动,说明强条件引起的问题可能存在于内部路由,而不只在输入信号强弱上。
  • 正负偏置同时提供机制验证和用户控制:增强主导产生更静态输出,削弱主导产生更动态输出。这比只展示单向提升更能支撑目标路径与运动的关联,但并未消除骨干参数差异等混杂因素。
  • 早期窗口与条件分支选择让修改保持局部。已有骨干的采样器、空文本图像条件和后期精修仍在工作,因此无需重训练就能改变运动倾向。

局限与展望

  • 作者明确承认过大的 \(\gamma\) 会损害外观一致性和时间稳定性;提高光流或动态分数不是“运动更真实”的充分条件,也不应把滑杆理解为可靠速度控制器。
  • 各骨干单独调参,且目前为固定参数,没有根据提示词、主体或运动类型自适应选择强度。可探索按参考注意力占比触发的控制,但这属于后续研究设想,不是本文已实现模块。
  • 参考保真度主要由定性展示和小规模用户研究支持,聚合 VQ 还主动排除主体/背景一致性。后续需要补充这些维度、物理合理性、失败频率和多随机种子不确定性。
  • 原文存在表述不一致:附录 C.1 写“add a bias \(\gamma\)”,与式(6)的减去正偏置及正文符号约定不一致,本笔记按公式解释并保留此疑点;附录算法的时间符号与严格窗口边界也需要实现核验。

相关工作与启发

  • vs ALG:ALG 在早期对输入图像高频做低通引导,并在活跃窗口增加前向计算;DyMoS 在内部注意力 logits 上操作,保留输入图像且不增加模型前向次数。动态性优势取决于指标,CogVideoX 的 VideoScore DD 并不优于 ALG。
  • vs 条件图像泄漏缓解:Zhao 等使用随时间变化的噪声扰动条件图像,FlashI2V 用傅里叶引导潜变量位移重新设计条件注入;本文则针对训练后已有模型的信息路由,适合需要保留原权重的推理修改。
  • 可迁移启发:其他强参考条件生成任务可以先分析哪些查询过度读取参考键,再测试定向干预,而不是一开始就弱化整份条件。目标 token 的识别、早期窗口和条件分支语义都必须重新验证,不能直接照搬 I2V 配置。

评分

  • 新颖性: 4/5 —— 以参考帧主导分析引出局部注意力干预,机制简单但切入点明确。
  • 实验充分度: 4/5 —— 四骨干、三数据集、帧调度消融和用户研究覆盖较广,真实性与保真度量化仍不足。
  • 写作质量: 3/5 —— 主线清晰,但指标概括、附录偏置符号和采样时间约定需要更严格区分。
  • 价值: 4/5 —— 无权重更新、开销较低,适合开放骨干的运动调节,但需逐骨干调参并检查质量退化。