Reward Lightning: Fast Video Generation via Homologous Preference Distillation¶
会议: ECCV 2026
论文: ECCV 原文
项目页: https://reward-lightning.github.io
领域: 视频生成
关键词: 视频扩散模型, 人类偏好对齐, 蒸馏加速, 同源偏好蒸馏, 隐空间奖励模型
一句话总结¶
针对传统视频生成加速与偏好对齐中跨空间优化导致的梯度冲突难题,本文提出同源偏好蒸馏框架 Reward Lightning,通过共享隐空间特征骨干与时间调制注意力头,在 1 至 4 步采样下实现了高保真且高度对齐人类偏好的极速视频生成。
研究背景与动机¶
视频扩散与流匹配模型在视觉生成质量上取得了突破性进展,但庞大的参数量、长时序依赖以及数十甚至上百步的迭代去噪过程,带来了极其昂贵的推理计算延迟。为了压缩采样步数,现有方法广泛采用渐进蒸馏、一致性模型或对抗蒸馏等技术,但纯粹的蒸馏过程往往只关注数据分布拟合,不可避免地破坏了反映人类主观偏好的生成先验;反之,若在蒸馏模型上直接应用强化学习或偏好微调,又会遭遇新的优化瓶颈。
现有多目标加速与对齐方案的核心瓶颈在于结构与表示空间的异质性(Heterogeneity)。传统方法主要分为两类:一是分阶段的串联训练(Disjoint Training),先做偏好对齐再做蒸馏加速,第二阶段灾难性遗忘会导致早期对齐分布被彻底洗掉;二是跨空间的联合训练(Heterogeneous Training),将像素级奖励模型(Pixel RM)与隐空间蒸馏目标线性相加,由于像素解码计算与隐空间去噪流处于不同流形,两者产生的优化梯度在少步高噪声区间存在严重的几何冲突(夹角甚至大于 90 度),极易引发严重的分布漂移与生成崩溃。
为了从根本上消除这一表示失配,本文提出严格的“同源性(Homology)”原则——让偏好评估与对抗蒸馏在完全一致的隐空间特征基底上进行,避免向像素空间反解码。核心 idea:构建直接在流匹配隐空间运作的潜在奖励模型(LRM),并以此为同源骨干双路并行派生判别器头与奖励头(HPD),借助自适应偏好权重消除多目标梯度冲突,实现 1-4 步兼具极速推理与卓越人类对齐的视频生成。
方法详解¶
整体框架¶
Reward Lightning 的核心架构分为两个紧密耦合的阶段:首先训练一个能够直接评估中间流动状态加噪隐变量的潜在奖励模型(Latent Reward Model, LRM);随后以此 LRM 提取器作为冻结的特征骨干,构建同源偏好蒸馏(Homologous Preference Distillation, HPD),由同一组隐特征并行驱动判别器头与奖励头,对流匹配生成器进行联合优化。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["多裕度与少步扩增数据对"] --> B["潜在奖励模型 LRM<br/>时间调制注意力 + EMA边界截断"]
B --> C["共享特征骨干 F_phi<br/>统一隐空间流形评估"]
C --> D["双头同源蒸馏 HPD<br/>判别器头 D_psi + 冻结奖励头 R_phi"]
D --> E["自适应偏好加权 lambda<br/>基于判别器纳什均衡动态引入偏好梯度"]
E --> F["少步视频生成器 v_theta<br/>1-4 步高保真输出"]
关键设计¶
1. 多裕度数据集构建与少步退化增强:解决偏好评估的分布外漂移 构建泛化性良好的隐空间奖励模型面临两层挑战:既要对真实视频与生成视频的高层级伪影敏感,又要能分辨同一模型在细粒度动作与语义上的细微优劣;更重要的是,蒸馏阶段生成器在 1 到 4 步采样时产生的预测隐变量往往带有严重的结构模糊,属于常规多步评估的分布外(OOD)数据。针对此痛点,本文构建了包含 30,000 对模型自身随机种子样本(Intra-Model Pairs)、17,390 对跨模型对比样本(Inter-Model Pairs,源自 VisionRewardDB)和 12,000 对真实与合成对比样本(Real-Synthetic Pairs)的多裕度数据集。在此基础上,特别引入 5,000 对专门的“少步扩增样本”(Few-Step Augmentation),将 80 步的高质量完整轨迹输出作为胜者(\(x_w\)),将 1-4 步欠收敛的模糊输出作为败者(\(x_l\)),使得奖励模型在极度截断的去噪轨迹上依然能给出准确、线性的质量梯度指导。
2. 时间调制注意力头与 EMA 边界动态截断:防止表示坍缩与奖励黑客 不同于传统仅使用可学习静态 Query 并在去噪时间步变化时泛化脆弱的设计,LRM 引入了时间调制注意力机制(Time-Modulated Attention Head)。对于中间流动状态 \(z_t = (1-t)z_0 + t z_1\),模型利用时间步嵌入向量 \(e_t\) 通过投影矩阵 \(W_h\) 动态生成状态查询向量 \(s_{t,h}\),自适应地与共享扩散骨干提取的时空特征 \(F_t\) 进行交叉注意力聚合,高噪声步关注全局宏观轮廓,低噪声步聚焦微观纹理细节。此外,在训练目标上,多裕度数据容易让模型在差距极大的真伪样本对上寻找肤浅的背景伪影捷径,导致对模型内细微差距的表征坍缩。本文在带平局的 Bradley-Terry(BTT)损失基础上引入 EMA 边界动态截断机制,实时维护难样本子集 \(\mathcal{B}_{\text{narrow}}\) 的平均奖励差 EMA 标量 \(\mu\): $$ \mu \leftarrow \rho \mu + (1-\rho) \frac{1}{|\mathcal{B}{\text{narrow}}|} \sum \Delta r_i $$ 当易样本对(如真伪视频)的得分差 }_{\text{narrow}}\(\Delta r_j\) 超过动态阈值 \(\mu\) 时,将其强制截断,梯度贡献置零。该机制有效压制了奖励黑客行为,迫使模型深挖细粒度的动作与语义一致性表征。
3. 同源特征路由与双头对抗蒸馏:将梯度冲突转化为隐流形正向正则 多目标对抗蒸馏 \(L_{\text{ADV}}^G\) 侧重于将噪声直接拉向真实数据分布流形,而人类偏好目标 \(L_{\text{ReFL}}\) 引导生成器向高质量子流形聚焦。传统异质架构在不同网络层或解码后的像素空间分别求导,导致梯度夹角呈现负相关。HPD 提出了完全同源的模块设计:直接复用 LRM 预训练好的特征提取器 \(F_\phi\) 作为共享骨干,并利用其权重直接初始化判别器头 \(D_{\psi}^{\text{head}}\),使其与冻结的奖励头 \(R_{\phi}^{\text{head}}\) 并行接入同一隐空间特征 \(F_t = F_\phi(\hat{z}_t, t)\)。因为对抗分布匹配与偏好奖励共享完全一致的语义特征基底,梯度计算被严格锚定在同一几何流形上,充当了隐式的梯度正则化器,使两项任务的梯度余弦相似度从异质基线的负值直接跃升为显著正相关,从数学机制上杜绝了模式坍缩。
4. 基于判别器均衡态的自适应偏好权重:自洽的渐进课程学习 在蒸馏训练初期,生成器预测的样本结构严重偏离真实数据流形,此时若强行注入偏好奖励,奖励头给出的伪梯度会加剧生成崩溃。本文根据判别器损失 \(L_{\text{ADV}}^D\) 偏离理想纳什均衡点(0.5)的程度,设计了基于半高斯压制函数的动态自适应权重: $$ \hat{\lambda} = \exp\left( -\text{ReLU}(\text{sg}(L_{\text{ADV}}^D) - 0.5)^2 \right) $$ 配合动量为 \(\beta = 0.99\) 的 EMA 平滑 \(\lambda \leftarrow \beta \lambda + (1-\beta)\hat{\lambda}\)。在早期结构粗糙、判别损失高企时,\(\hat{\lambda} \to 0\) 自动抑制偏好梯度,促使模型专注于恢复基本物理分布;一旦判别损失平稳逼近 0.5,\(\hat{\lambda} \to 1\) 无缝平滑地激活偏好优化,形成了一个安全、自驱动的课程学习过程。
损失函数 / 训练策略¶
整个体系分为两阶段解耦优化: 1. LRM 训练:骨干网络基于 Wan2.2-14B 初始化,采用 AdamW(学习率 \(1\times 10^{-5}\)),输入 720P 分辨率的 5 秒视频隐特征,采用截断 BTT 损失函数 \(\mathcal{L}_{\text{LRM}}(\phi)\) 优化。通过 DeepSpeed Ulysses 序列并行(SP)、完全分片数据并行(FSDP)以及 VAE/文本编码器 CPU-GPU 动态 Offload 策略,在 8 张 H20 GPU 上实现显存与吞吐的高效平衡。 2. HPD 蒸馏优化:骨干 \(F_\phi\) 和奖励头 \(R_\phi^{\text{head}}\) 保持冻结,判别器头参数 \(\psi\) 以 Hinge 损失 \(\mathcal{L}_{\text{ADV}}^D\) 最小化训练;生成器参数 \(\theta\) 则最小化联合目标: $$ \mathcal{L}{\text{HPD}}(\theta) = \mathcal{L}}}^G + \lambda \cdot \mathcal{L{\text{ReFL}} = - D\psi^{\text{head}}(F_t^{\text{fake}}, t) - \lambda \cdot R_\phi^{\text{head}}(F_t^{\text{fake}}, t) $$ 采用 AdamW 优化器,恒定学习率 \(5\times 10^{-7}\),批大小 64,总共仅需训练 2,000 步即可快速收敛。
实验关键数据¶
主实验¶
论文在两项主流 OOD 视频偏好基准(表 1)以及生成质量综合评测基准 VBench(表 2)上进行了系统评估。全部生成模型均构建在 Wan2.2-14B 底座之上。
表 1: 奖励模型偏好准确率与在线反馈开销评估(摘自原论文 Table 1,8× H20 GPU)
| 方法类别 | 模型 | VideoGen-RewardBench 带平局 (%) | VideoGen-RewardBench 无平局 (%) | GenAI-Bench 带平局 (%) | 训练显存 (GB) | 训练延迟 (ms) |
|---|---|---|---|---|---|---|
| 像素级奖励 | LiFT | 39.08 | 57.26 | 37.06 | 87.81 | 213.2 |
| 像素级奖励 | VisionReward | 56.77 | 67.59 | 51.56 | 82.15 | 185.3 |
| 像素级奖励 | VideoAlign | 61.26 | 73.59 | 49.41 | 87.46 | 217.9 |
| 隐空间奖励 | PRFL | 57.59 | 69.20 | 53.40 | 77.32 | 156.8 |
| 隐空间奖励 (本文) | LRM (Ours) | 72.24 | 86.63 | 59.85 | 76.24 | 154.2 |
表 2: VBench 文本到视频 (T2V) 与图像到视频 (I2V) 性能对比(摘自原论文 Table 2)
| 采样步数 | 模型方法 | 训练类型 | T2V 文本对齐 (TA) | T2V 动作质量 (MQ) | T2V 视觉质量 (VQ) | T2V 综合得分 (↑) | I2V 综合得分 (↑) |
|---|---|---|---|---|---|---|---|
| 80 步 (基线) | Wan2.2 基础模型 | 预训练无蒸馏 | 97.34 | 79.59 | 69.48 | 84.23 | 92.91 |
| 80 步 (对齐) | PRFL | 隐空间 RL | 97.83 | 81.56 | 70.45 | 85.72 | 94.87 |
| 4 步 (加速) | TurboDiffusion | 纯蒸馏 (rCM) | 94.53 | 75.62 | 63.28 | 83.51 | 92.45 |
| 4 步 (加速) | DMDR | 像素 RL + 蒸馏 | 96.14 | 71.85 | 68.57 | 84.63 | 93.28 |
| 4 步 (加速) | FlashDMD | 像素 RL + 蒸馏 | 88.19 | 68.23 | 67.84 | 82.36 | 92.59 |
| 4 步 (本文) | HPD (Ours) | 同源对齐 + 蒸馏 | 97.26 | 77.48 | 68.71 | 85.83 | 95.34 |
| 1 步 (极速) | APT | 纯对抗蒸馏 | 85.37 | 65.42 | 64.19 | 78.53 | 84.87 |
| 1 步 (本文) | HPD (Ours) | 同源对齐 + 蒸馏 | 92.54 | 70.16 | 62.83 | 82.42 | 91.92 |
消融实验¶
论文围绕 LRM 的架构细节以及 HPD 的核心机制展开了全方位消融分析(原论文 Table 3 与 Table 4)。
表 3: 核心组件消融分析(摘自原论文 Table 3)
| 消融维度 | 具体配置 | 偏好准确率 (%) | 最终综合质量得分 (Score) | 核心表现说明 |
|---|---|---|---|---|
| 数据集构建 | 完整多裕度 + 少步扩增 | 72.24 | 95.34 | 全配置达到最优综合指标 |
| 数据集构建 | 去除少步样本扩增 | 68.47 | 93.81 | 缺乏少步伪影先验,分布外泛化显著衰退 |
| 数据集构建 | 去除真实-合成对比对 | 65.12 | 92.45 | 缺失高质量上限参考,生成质感下降明显 |
| 头部结构设计 | 自注意力机制 | 64.38 | 91.87 | 无法随流动时间步调整全局与局部的关注焦距 |
| 头部结构设计 | 纯可学习静态 Query | 69.85 | 94.12 | 无法动态自适应高斯噪声与结构相位的变换 |
| 头部结构设计 | 时间调制投影 (本文) | 72.24 | 95.34 | 准确感知时序流动阶段的语义分布 |
| HPD 判别器初始化 | 随机权重初始化 | - | 88.26 | 早期对抗训练极不稳定,易产生纹理伪影 |
| HPD 判别器初始化 | 预训练骨干初始化 | - | 93.48 | 具备基础特征,但缺乏偏好判别归纳偏置 |
| HPD 判别器初始化 | LRM 奖励头参数继承 | - | 95.34 | 继承高质量对齐先验,收敛加速且稳定性最佳 |
关键发现¶
- 梯度冲突实测逆转:原论文 Table 4-(a) 实验表明,在传统“像素奖励 + 蒸馏”以及“独立骨干隐空间奖励 + 蒸馏”中,对抗梯度与偏好梯度的余弦相似度分别为 -0.14 和 -0.06,说明两项任务在相互拉扯;而本文提出的同源共享骨干 HPD 成功将梯度余弦相似度推升至 +0.41,证实表示同源性对多目标优化起到了关键的内生正向正则作用。
- 极端单步生成下的保真度维持:在 1-NFE 的极限单步采样下,HPD 依然在 VBench 上取得了 82.42 的综合评分,显著超越了纯蒸馏 SOTA 方法 APT(78.53),在文本对齐上更是拉开了 7.17 分的巨大差距(92.54 vs 85.37),表明偏好监督在超少步模式下能够有效校正几何畸变。
- 算力与显存开销双赢:由于完全抛弃了 VAE 像素反解码与高分辨率高维卷积反向传播,LRM 的单步训练显存从传统像素奖励模型的 87.46 GB 压降至 76.24 GB,延迟从 217.9 ms 缩短至 154.2 ms(下降约 29%)。
亮点与洞察¶
- 同源性理念对多目标扩散优化的重塑:深刻指出了“表示空间失配是导致少步蒸馏中对齐遗忘与梯度冲突的根本症结”,用“共享骨干隐空间评估”这一简洁优雅的结构设计替代了昂贵的二阶多目标梯度搜索。
- 少步模糊数据的逆向利用:将蒸馏初期的劣质模糊输出变废为宝,构造成偏好模型中的负样本对,针对性补全了评估器在非均衡流形上的 OOD 盲区。
- 半高斯均衡态动态路由:用判别器与纳什均衡(0.5)的偏差量化生成状态的真实度,自适应调节偏好梯度注入时机,为对抗式强化学习提供了通用的课程训练模版。
局限与展望¶
- 生成分辨率与时序长度受限于骨干底座:虽然在 720P 5 秒视频上验证充分,但若要外推到 4K 级别长视频,隐空间特征序列过长依然对 Ulysses 序列并行策略的通信开销提出了极大挑战。
- 平局判断依赖启发式标定:BTT 损失虽然比纯 BT 损失更鲁棒,但少步生成样本质量极其接近时的微妙平局仍依赖人工预设阈值,未来可探索自监督的不确定性估计方法。
- 跨底座通用权重的适配成本:虽然 LRM 对不同蒸馏方法(rCM, DMD2)皆有促进作用,但特征提取器与判别器依然与 Wan2.2 紧密绑定,切换到不同结构的 DiT 时仍需重新提取或微调隐特征空间。
相关工作与启发¶
- vs DMDR / FlashDMD: DMDR 与 FlashDMD 均在像素空间调用奖励模型引导隐空间蒸馏,存在跨流形梯度冲突(余弦相似度为负);Reward Lightning 提出了同源隐空间评估与双头机制,将梯度相似度逆转为 +0.41,彻底解决了少步采样的分布漂移。
- vs PRFL: PRFL 同样强调了隐空间评估视频的重要性,但其仅用于多步(80步)常规 RLHF 调优;Reward Lightning 则将 LRM 升维为对抗蒸馏的基础骨干,进一步扩展了时间调制注意力机制以适配 1-4 步极其模糊的截断流动状态。
- vs APT / TurboDiffusion: 后两者专注于极限减少步数但忽略了主观偏好分布的对齐;本文在仅需 1-4 步的极速推理下,各项主观对齐指标甚至反超了未经对齐的 80 步完整教师模型。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ [首次在理论与实验上证明并解决了视频生成中加速与对齐的多目标表示失配问题,提出同源偏好蒸馏]
- 实验充分度: ⭐⭐⭐⭐⭐ [覆盖 OOD 偏好基准、VBench 多维评测、梯度夹角分析及完整消融实验,数据翔实可信]
- 写作质量: ⭐⭐⭐⭐⭐ [逻辑严密,对表示异质性与同源性正则机制的数学与几何论述十分透彻清晰]
- 价值: ⭐⭐⭐⭐⭐ [极大促进了超低延迟极速视频生成工业化部署的落地可能,方法对 DiT 多目标联合微调具有高度通用参考价值]