Rebalancing Reference Frame Dominance to Improve Motion in Image-to-Video Models¶
会议: NeurIPS2026
arXiv: 2605.19398
领域: 视频生成
关键词: 图像到视频、参考帧主导、注意力调制、运动控制、免训练推理
一句话总结¶
DyMoS 在图像到视频模型的早期去噪中,仅对文本条件分支的“非参考帧查询→参考帧键”自注意力 logits 减去可调偏置,使 Wan 2.2 的 VBench Dynamic Degree 从 51.7 提升至 64.8,但更强动态性并不自动意味着更真实的运动或更高的参考保真度。
研究背景与动机¶
图像到视频(I2V)模型通常在文本到视频(T2V)骨干上加入图像条件,让输入图像成为生成视频的第一帧。参考图像提供主体、背景和颜色等外观约束,但这种约束也可能过强:即使提示词明确要求跳跃或车辆行驶,后续帧仍很像第一帧,视频成了微动的静态画面。既有方法把问题归因于条件图像泄漏,向图像条件注入噪声、改变潜变量注入方式,或像 ALG 一样在早期去噪阶段低通滤波输入图像;这些办法可能需要重新训练,或以外观信息损失换取运动。
本文关注的不是输入图像“太清楚”,而是模型内部如何反复使用它。作者用 CogVideoX-5B 构造 50 组配对生成:先用 T2V 生成视频,再把第一帧交给 I2V,保持提示词、随机种子和采样配置一致。把 token 自注意力聚合到帧间后,I2V 的非参考帧对参考帧键分配了更多注意力,尤其发生在最初 10% 的去噪步骤。这种参考帧主导会使外观信息沿时间轴过度传播,挤占后续帧之间的信息交互;不过,配对骨干仍有参数差异,不能把这一观察理解为所有静态生成问题的唯一解释。
作者进一步对这条注意力路径做正负方向干预:加强它会使视频更静态,削弱它则提高动态性,并使帧间注意力更接近配对的 T2V。核心 idea:保留输入图像和模型权重,只在决定全局运动的早期采样阶段降低后续帧对参考帧的过度依赖,让已有视频先验参与运动生成,而不是先破坏图像条件再补救外观。
方法详解¶
整体框架¶
DyMoS(Dynamic Motion Slider)是采样时的注意力修改,不是新增训练网络。输入仍是参考图像、文本提示词和随机视频潜变量;参考图像照常编码,沿用各骨干原有的图像条件注入方式。每一步仍计算空文本预测和文本条件预测,再按原有无分类器引导(CFG)组合并更新视频潜变量。
新增操作位于文本条件预测内部:在采样早期,对所有相关自注意力层中“非参考帧查询→参考帧键”的 logits 减去偏置,再做 softmax。参考帧自身的查询行、其他视频键以及 MM-DiT 中的文本 token 不属于这条目标路径。经过设定的早期窗口后,恢复原始注意力,最后由原有 VAE 解码视频。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["参考图像、文本<br/>当前视频潜变量"] --> B["早期窗口门控"]
B -->|早期:修改文本条件分支| C["定向 logit 减偏置"]
B -->|窗口结束:原始注意力| D["条件分支 CFG"]
C --> D
A -->|原始空文本预测,仍含图像条件| D
D --> E["原有采样器更新<br/>循环后 VAE 解码"]
这里的“空文本”不等于“没有图像条件”:两条 CFG 分支都继续接收同一参考图像。框架图全部是推理数据流,没有训练监督、额外运动教师或奖励优化阶段。
关键设计¶
1. 早期窗口门控:先改变运动布局,再恢复细节精修
初期去噪决定粗粒度运动和场景演化,后期则更偏向外观与时序细节。如果整个采样过程都压制参考信息,模型可能不仅摆脱静止,也失去主体外观锚点。DyMoS 用采样步骤比例 \(\lambda\) 限定干预窗口,仅在最初一部分步骤使用修改后的注意力,之后完全回到原始计算。机制分析采用最初 10% 的步骤统计;这不是主实验统一使用的干预比例,Wan 2.2 的主实验取 \(\lambda=0.2\)。
这个门控作用于采样过程,而非生成视频的前几个输出帧。另一个独立维度是查询所在的潜在帧位置,它由后面的帧调度控制。附录算法用 \(t=i/N\) 和 \(t<\lambda\) 表示窗口,正文背景则以流匹配时间从噪声端到干净端解释去噪;两种时间约定不宜混为一谈。实际移植应依据采样步骤进度开启早期窗口,并核实边界,而不是直接把算法中的 \(t\) 当成骨干的原生噪声时间。
2. 定向 logit 减偏置:削弱读取参考帧的概率,不删除参考信息
普通自注意力把查询与各键的相似度变成 logits,再用 softmax 分配读取权重。DyMoS 不修改图像、查询、键或值,而是在 softmax 之前,只调整后续视频帧查询读取参考视频帧键的那一块矩阵。设 \(\mathcal{I}_{f_0}\) 为参考潜在帧的 token 索引,\(f(i)\) 为查询 token 的潜在帧位置,其核心机制为原文式(6):
其中 \(\gamma\) 是运动滑杆,\(\phi\) 是帧位置调度。\(\gamma>0\) 降低目标 logits,\(\gamma=0\) 恢复基线,\(\gamma<0\) 加强参考帧主导。两个指示函数确保不是对整张注意力矩阵均匀减常数:后者会被 softmax 抵消。因为只压低参考键这一组,softmax 会相对增加其他键的份额;目标参考键的未归一化权重乘以 \(e^{-\gamma\phi(f(i))}\),组内相对比例不变,这是该公式的数学解释,并非新的作者公式。
修改不直接清零参考注意力,也不扰动参考帧查询行,因此参考信息仍可进入后续帧。主实验在所有骨干上都用均匀调度 \(\phi=1\);附录比较的线性与对数调度分别为 \(f(i)/(F-1)\) 和 \(\log(1+f(i))/\log F\),使靠近参考帧的查询受到较弱干预,较后帧受到较强干预。不过实验显示均匀调度更有效,不能把帧距离递增调度误写成默认方法。
3. 条件分支 CFG:只改变有文本预测,保留原有图像锚点
如果空文本分支和文本条件分支都被同样改动,引导方向也会改变。作者选择仅在文本条件分支使用上述 logits,使提示词描述的运动更容易影响生成;空文本分支保持原始注意力,并继续接收原参考图像。原文式(7)给出的组合为:
\(\omega\) 仍是骨干原有 CFG 强度,而非新的运动参数。方法保留原采样循环与前向次数,并通过 PyTorch FlexAttention 把分数修改融合进注意力内核。因此,“免训练”并不等于完全零成本或无需修改推理实现,也不意味着可以在任意封闭 API 上直接插入滑杆。
一个完整示例¶
以 Wan 2.2-14B 生成一段提示词要求车辆行驶的视频为例,配置为 40 步采样、\(\gamma=0.6\)、\(\lambda=0.2\)、\(\phi=1\)。参考图像和随机潜变量按原流程进入模型;在最初约五分之一的采样区间,文本条件分支每个后续帧查询读取参考帧键时,对应 logit 都比原值少 0.6。其他键不作该减法,空文本分支也不作该减法。
这不是指定车速,也不是显式生成轨迹,而是让后续帧不必持续复制最初车身位置,从已有视频先验和提示词中形成运动。离开早期窗口后,两分支都恢复原始注意力,保留原有精修过程。40 步乘 0.2 对应名义 8 步窗口,但附录从 \(i=1\) 开始并使用严格小于号,不能据此保证其伪代码实际恰好修改 8 步;具体边界需要实现核实。
损失函数 / 训练策略¶
DyMoS 没有新增损失、训练数据或权重更新。论文的流匹配和 CFG 背景描述的是现有骨干,不是本文重新训练的模块。方法虽以单个 \(\gamma\) 为用户运动滑杆,但复现实验还需要骨干特定的 \(\lambda\)、采样器、CFG 强度和分辨率。
| 骨干 | 视频尺寸(帧×宽×高)/ FPS | 步数 / CFG | 采样器 | \(\gamma\) | \(\lambda\) |
|---|---|---|---|---|---|
| Wan 2.2-14B | 81×832×480 / 16 | 40 / 3.5 | UniPC | 0.6 | 0.20 |
| Wan 2.1-14B | 81×832×480 / 16 | 40 / 5.0 | UniPC | 1.0 | 0.25 |
| HunyuanVideo-1.5 | 81×832×480 / 16 | 50 / 6.0 | FlowMatch-Euler | 1.0 | 0.20 |
| CogVideoX-5B | 49×720×480 / 8 | 50 / 6.0 | DDIM | 0.8 | 0.24 |
这张配置表来自附录表 3,各骨干均为 \(\phi=1\)。因此跨骨干有效说明干预路径可迁移,不说明同一组超参数可无调节泛化。
实验关键数据¶
主实验¶
主评测使用 VBench-I2V 的 246 个图像—文本对,排除了背景质量和相机运动指令子集;扩展实验使用 PVD 的 200 个视频首帧—描述对,以及 VidProM 的 500 条提示词配 Flux.1-dev 合成参考图像。同一骨干内固定配对随机种子和 GPU 类型,比较原始基线、官方 ALG 与 DyMoS。
VBench Dynamic Degree 基于 RAFT 光流,利用最高 5% 光流判断视频是否有足够大运动;VideoScore Dynamic Degree 是基于人类反馈训练的视频评估模型预测值。两者衡量动态性,不提供完整物理真实性保证。ViCLIP 衡量视频—文本语义相似度,VisionReward 是学习得到的人类偏好代理。
下表保留原文表 1 数值,DD 表示 Dynamic Degree,VQ 表示作者的 Video Quality。各列量纲不同,不应直接互相比大小。
| 骨干 | 方法 | DD(VBench) | DD(VideoScore) | VQ | ViCLIP | VisionReward |
|---|---|---|---|---|---|---|
| Wan 2.2-14B | Baseline | 51.7 | 2.83 | 58.0 | 0.2614 | 0.143 |
| Wan 2.2-14B | ALG | 55.3 | 2.83 | 57.7 | 0.2616 | 0.140 |
| Wan 2.2-14B | DyMoS | 64.8 | 2.84 | 57.7 | 0.2621 | 0.143 |
| Wan 2.1-14B | Baseline | 48.7 | 3.21 | 57.7 | 0.2601 | 0.132 |
| Wan 2.1-14B | ALG | 52.5 | 3.18 | 57.2 | 0.2615 | 0.127 |
| Wan 2.1-14B | DyMoS | 54.5 | 3.25 | 57.4 | 0.2618 | 0.126 |
| HunyuanVideo-1.5 | Baseline | 48.0 | 2.87 | 58.2 | 0.2624 | 0.140 |
| HunyuanVideo-1.5 | ALG | 46.3 | 2.87 | 58.2 | 0.2629 | 0.141 |
| HunyuanVideo-1.5 | DyMoS | 55.3 | 2.88 | 58.1 | 0.2653 | 0.141 |
| CogVideoX-5B | Baseline | 30.9 | 2.90 | 57.8 | 0.2612 | 0.140 |
| CogVideoX-5B | ALG | 52.0 | 2.98 | 57.1 | 0.2647 | 0.127 |
| CogVideoX-5B | DyMoS | 52.9 | 2.92 | 57.1 | 0.2652 | 0.131 |
Wan 2.2 的 VBench DD 增加 13.1 个百分点,约为 25.3% 相对提升;VQ 则由 58.0 变为 57.7,而不是完全不降。CogVideoX 上 DyMoS 的 VBench DD 超过 ALG,但 VideoScore DD 为 2.92,低于 ALG 的 2.98。Wan 2.1 的 VisionReward 为 0.126,低于基线 0.132 和 ALG 0.127,不能据正文概括声称所有偏好指标都稳定或提升。
作者定义的质量聚合为:
TF、MS、AQ、IQ 分别是时序闪烁、运动平滑度、美学质量和成像质量。原文权重总和为 0.70,并排除动态性、主体一致性和背景一致性;这里不自行归一化或修改其权重。因此该质量分数并不能直接支持“参考主体与背景保真度不变”。
消融实验¶
附录表 6 在 Wan 2.2 上固定主实验的 \(\gamma\) 和 \(\lambda\),只改变帧调度。
| 帧调度 | DD(VBench) | DD(VideoScore) | VQ | ViCLIP | VisionReward |
|---|---|---|---|---|---|
| Uniform | 64.8 | 2.84 | 57.7 | 0.2621 | 0.143 |
| Linear | 56.1 | 2.82 | 57.9 | 0.2598 | 0.143 |
| Log | 60.2 | 2.80 | 57.7 | 0.2597 | 0.141 |
均匀调度相较线性调度的 VBench DD 高 8.7 个百分点,相较对数调度高 4.6 个百分点。线性调度 VQ 略高,但运动不足,说明“离参考帧越远压制越强”不是自动更好的设计。
正文还测试 \(\gamma\in\{0.4,0.6,0.8,1.0\}\),报告从 0.4 到 0.6 的 DD 相对提升为 11.7%;图中绝对值未在缓存文字中提供,不补造数值。\(\lambda\) 从 0.24 增至 0.30 反而降低 DD,早期窗口并非越长越好。
关键发现¶
- 机制距离 \(D(\gamma)\) 定义为各非参考查询帧的 I2V/T2V 帧间注意力行分布之间的 Jensen–Shannon 散度平均值;在配对分析中约 \(\gamma=0.6\) 最小,并对应接近 T2V 的动态性。这是注意力结构接近的证据,不是质量最优的普适参数证明。
- Wan 2.2 在 PVD 的 VBench DD 从 79.0 提升至 85.0,在 VidProM 从 54.2 提升至 67.0;但 PVD ViCLIP 从 0.2147 变为 0.2143,跨数据集也不是所有指标都单调改善。
- MTurk 用户研究采用 25 个 VBench-I2V 图像—提示词对,每个问题收集 30 个回答,比较运动、参考保真度、文本对齐和总体偏好。正文报告 DyMoS 四项均最常被选中;缓存没有图 5(c) 的精确比例,不能写具体胜率。
- A100 80GB 单卡测时中,DyMoS 相对基线的额外开销依次为 Wan 2.2 1.2%、Wan 2.1 1.9%、HunyuanVideo-1.5 3.5%、CogVideoX 4.3%;其对应总时长为 841、749、503、242 秒,不能把 1.2% 推广到全部骨干。
亮点与洞察¶
- 干预对象不是图像内容,而是信息被重复读取的路径。保持条件不变仍能释放运动,说明强条件引起的问题可能存在于内部路由,而不只在输入信号强弱上。
- 正负偏置同时提供机制验证和用户控制:增强主导产生更静态输出,削弱主导产生更动态输出。这比只展示单向提升更能支撑目标路径与运动的关联,但并未消除骨干参数差异等混杂因素。
- 早期窗口与条件分支选择让修改保持局部。已有骨干的采样器、空文本图像条件和后期精修仍在工作,因此无需重训练就能改变运动倾向。
局限与展望¶
- 作者明确承认过大的 \(\gamma\) 会损害外观一致性和时间稳定性;提高光流或动态分数不是“运动更真实”的充分条件,也不应把滑杆理解为可靠速度控制器。
- 各骨干单独调参,且目前为固定参数,没有根据提示词、主体或运动类型自适应选择强度。可探索按参考注意力占比触发的控制,但这属于后续研究设想,不是本文已实现模块。
- 参考保真度主要由定性展示和小规模用户研究支持,聚合 VQ 还主动排除主体/背景一致性。后续需要补充这些维度、物理合理性、失败频率和多随机种子不确定性。
- 原文存在表述不一致:附录 C.1 写“add a bias \(\gamma\)”,与式(6)的减去正偏置及正文符号约定不一致,本笔记按公式解释并保留此疑点;附录算法的时间符号与严格窗口边界也需要实现核验。
相关工作与启发¶
- vs ALG:ALG 在早期对输入图像高频做低通引导,并在活跃窗口增加前向计算;DyMoS 在内部注意力 logits 上操作,保留输入图像且不增加模型前向次数。动态性优势取决于指标,CogVideoX 的 VideoScore DD 并不优于 ALG。
- vs 条件图像泄漏缓解:Zhao 等使用随时间变化的噪声扰动条件图像,FlashI2V 用傅里叶引导潜变量位移重新设计条件注入;本文则针对训练后已有模型的信息路由,适合需要保留原权重的推理修改。
- 可迁移启发:其他强参考条件生成任务可以先分析哪些查询过度读取参考键,再测试定向干预,而不是一开始就弱化整份条件。目标 token 的识别、早期窗口和条件分支语义都必须重新验证,不能直接照搬 I2V 配置。
评分¶
- 新颖性: 4/5 —— 以参考帧主导分析引出局部注意力干预,机制简单但切入点明确。
- 实验充分度: 4/5 —— 四骨干、三数据集、帧调度消融和用户研究覆盖较广,真实性与保真度量化仍不足。
- 写作质量: 3/5 —— 主线清晰,但指标概括、附录偏置符号和采样时间约定需要更严格区分。
- 价值: 4/5 —— 无权重更新、开销较低,适合开放骨干的运动调节,但需逐骨干调参并检查质量退化。