LatSearch: Latent Reward-Guided Search for Faster Inference-Time Scaling in Video Diffusion¶
会议: ECCV 2026
arXiv: 2603.14526
代码: https://zengqunzhao.github.io/LatSearch (项目页)
领域: 视频生成 / 扩散模型 / 推理时扩展
关键词: 视频扩散、推理时扩展、潜在奖励模型、奖励引导搜索、golden noise
一句话总结¶
LatSearch 训练了一个能对去噪轨迹中间态潜在向量(而非解码后视频)直接打分的潜在奖励模型,并用它驱动「奖励引导重采样 + 剪枝(RGRP)」在潜在空间做推理时搜索,从而在视频扩散上做到与 SOTA 相当甚至更好的质量,同时把运行时间最多减少 79%。
研究背景与动机¶
领域现状与两类方法的硬伤:LLM 上「推理时扩展(inference-time scaling)」的成功启发了视频扩散领域——除了单纯增加去噪步数,人们发现存在所谓「黄金噪声(golden noise)」,即某些初始噪声天然能生成更高质量的视频,于是大量工作把额外算力花在推理阶段去优化或搜索更好的初始噪声。但这些方法分两类、各有硬伤。一类是噪声优化(FreeInit、FreqPrior 等),靠对参考视频注入噪声、光流 warp 或频域融合来给初始化加先验,可一旦轨迹开始去噪,它们没有任何机制去监控和纠正中间状态,初期引入的误差会沿长去噪轨迹一路累积;另一类是噪声搜索(VideoReward、EvoSearch 等),生成多个候选、用 Best-of-N / beam search / 进化算法挑最好的,但它们只在完全解码出的视频上评估——反复全量解码算力极其昂贵、奖励信号来得又晚又稀疏,也正因太贵而根本用不起更强的搜索算法。
核心矛盾:更强的搜索算法恰恰是解锁可控性、样本效率和生成质量的关键,但它的前提是算力成本必须降下来;而当前范式因为「只能评估最终视频」,把成本和延迟都顶到了天花板。问题的根子在于扩散模型缺乏可靠评估中间潜在态的能力,因此无法支持早停等灵活策略——要让「更强但更便宜」的搜索成为可能,就必须先补上这个能力。
本文的核心 idea 由此而来:与其只在终点评估,不如在去噪轨迹的任意时间步上就地评估「半去噪」的潜在向量。为此作者提出一个潜在奖励模型,从视觉质量、运动质量、文本对齐三个维度给中间潜在态打分,把过程级监督(process-level supervision)直接注入去噪轨迹——既能尽早剪掉低质候选、减少无谓去噪步,又避开了反复解码整段视频的重成本。
方法详解¶
整体框架¶
LatSearch 要解决的是「如何在不解码视频的前提下,于去噪中途就判断哪条候选轨迹更有前途」。整套系统分两块:先离线训练一个潜在奖励模型 \(R_\psi\),它吃进中间潜在张量 \(\bm{z}_t\)、时间步 \(t\)、文本 prompt \(p\),吐出 VQ/MQ/TA 三个标量分数;再在推理时用这个奖励模型驱动 RGRP(Reward-Guided Resampling and Pruning) 搜索——维护 \(N\) 条候选轨迹并行去噪,在预定的几个「打分步」上给候选打分、按奖励归一化概率重采样(保留唯一种子以省算力),并在最后一个打分步按累积奖励只留一条最优轨迹,最后才解码成视频。
训练潜在奖励模型的一个核心难点是:奖励标签天然是「视频级」的(打在解码后的视频上),而模型要评的却是没有显式语义的中间潜在态。本文用相似度接地(similarity-grounded credit assignment)把视频级奖励按中间态与最终干净潜在的余弦相似度折算成潜在级标签,再用回归损失 + 偏好损失联合训练。
推理侧的 RGRP 借鉴了重要性采样 / 序贯蒙特卡洛(SMC)的思路:多条候选在潜在空间被提出、按奖励分数(作为代理重要性权重)加权、重采样以平衡探索与利用,最终剪枝挑出「一直高奖励」的那条。整体流程如下:
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["文本 prompt + 基噪声"] --> B["候选生成<br/>N 条扰动轨迹并行去噪"]
B --> C["相似度接地的潜在奖励<br/>中间态打 VQ/MQ/TA 分"]
C -->|到打分步 S| D["奖励引导重采样<br/>softmax 权重+唯一性去重"]
D -->|打分步之间独立去噪| C
C -->|到 max(S)| E["累积权重最终剪枝<br/>只留最高累积奖励种子"]
E --> F["解码为视频"]
关键设计¶
1. 相似度接地的潜在奖励模型:让「视频级奖励」能监督无语义的中间潜在态
痛点直白:奖励打分器几乎都作用在渲染出的视频上、返回视频级分数,可本文的奖励模型必须评估沿去噪轨迹抽出的中间潜在 \(\bm{z}_t\),而这些中间态没有直接的 ground-truth。本文的做法是「按贡献折算」:给定 prompt \(p\) 和最终干净潜在 \(\bm{z}_0\),先在解码视频上拿到视频级奖励向量 \(\bm{r}=(r^{\mathrm{VQ}},r^{\mathrm{MQ}},r^{\mathrm{TA}})^\top=\mathcal{R}(\mathcal{D}(\bm{z}_0),p)\),再用一个 rescale 到 \([0,1]\) 的余弦相似度衡量中间态离终点有多近:
然后把每一维视频级奖励按 \(s_t\) 比例折算成潜在级目标 \(\tilde{\bm{r}}_t=s_t\cdot\bm{r}\),构成潜在奖励数据集 \(\mathcal{D}_{\mathrm{latent}}=\{(\bm{z}_t,p,\tilde{\bm{r}}_t,t)\}\)。直觉是:越接近终点、对最终视频「贡献」越大的中间态,越该继承高奖励。模型结构上,潜在张量经轻量 3D 卷积 patchify 成视频 token,时间步 \(t\) 映射成可学习嵌入 \(\mathbf{e}_t\) 拼进序列,prompt 用指令模板 token 化,再追加三个特殊查询 token [VQ]/[MQ]/[TA];整串喂进 transformer 骨干(实现用 Qwen2-VL-3B),取三个查询 token 的隐藏态过线性层得到 \(\hat{\bm{r}}=\mathrm{Linear}(h^{[\mathrm{VQ}]},h^{[\mathrm{MQ}]},h^{[\mathrm{TA}]})\)。这样评估在潜在空间完成,比全量解码视频便宜一个量级(后文实测每个潜在打分仅 0.84s)。
2. 回归损失 + 偏好损失:既锚定绝对分数,又保住相对排序
只用回归会有个问题:它给出绝对监督,却不保证候选之间的相对次序正确——而搜索恰恰最吃「谁比谁好」。回归损失是标准 L2:\(\mathcal{L}^d_{\mathrm{reg}}=\|\hat{\bm{r}}^d-\tilde{\bm{r}}^d_t\|_2^2\)。在此之上,受 RLHF 启发引入偏好损失:对 minibatch 里每对 \((i,j)\),令 \(\Delta\hat{\bm{r}}^d_{ij}=\hat{\bm{r}}^d_i-\hat{\bm{r}}^d_j\)、真值偏好 \(\bm{y}^d_{ij}=\mathbb{I}[\bm{r}^d_i>\bm{r}^d_j]\),则
本质是对成对分数差做二元交叉熵。最终损失是三维度、两目标的加权和 \(\mathcal{L}=\sum_{d}(\lambda^d_{\mathrm{reg}}\mathcal{L}^d_{\mathrm{reg}}+\lambda^d_{\mathrm{pref}}\mathcal{L}^d_{\mathrm{pref}})\)(实现里两项权重都取 1.0)。回归把预测钉在绝对奖励量级上,偏好则塑造奖励地形以保住相对序——消融显示加偏好损失后奖励预测准确率在各去噪步稳定提升约 1–3%,越到后期越明显。
3. 奖励引导重采样 + 唯一性去重:既相信奖励又不迷信它
有了会打分的模型,怎么用它选候选?最朴素是每步贪心选最高分,但奖励模型本身不完美,贪心会过度依赖它。本文借重要性采样思路:在初始步 \(T\),先由基噪声 \(\bm{z}_T^{(0)}\) 加各向同性扰动生成 \(N\) 条候选 \(\bm{z}_T^{(i)}=\sqrt{1-\eta^2}\,\bm{z}_T^{(0)}+\eta\,\bm{\epsilon}_i\)(\(\eta\) 控制多样性);在打分步 \(t\in\mathcal{S}\) 拿到奖励 \(r_i^{(t)}\) 后转成 softmax 权重 \(\pi_i^{(t)}=\exp(\tau r_i^{(t)})/\sum_k\exp(\tau r_k^{(t)})\)(\(\tau\) 为温度),再按多项式分布有放回采样 \(\bm{n}^{(t)}\sim\mathrm{Multinomial}(N;\pi^{(t)})\)。关键的一步是唯一性算子 \(\mathrm{supp}(\cdot)\):只保留被采到的不同种子 \(\mathcal{I}^{(t)}=\{i\mid n_i^{(t)}>0\}\),去掉同种子的重复副本——因为重复轨迹会浪费算力去算完全相同的去噪。此时候选 \(i\) 经去重后的存活概率为 \(1-(1-\pi_i^{(t)})^N\),随其权重单调递增,天然实现「权重越高越可能活下来」的软选择。两个打分步之间,候选各自独立走若干去噪更新。
4. 累积权重最终剪枝:用「一路高分」而非「某一步高分」定胜负
单看某一步的分数容易被噪声波动误导。本文用可加累积准则跨打分步累积证据:\(c_i^{(t)}=c_i^{(t-1)}+\pi_i^{(t)}\)(\(c_i^{(0)}=0\))。在最后一个打分步 \(t'=\max(\mathcal{S})\),若还剩多条候选,就选累积权重最高的那个种子 \(i^\star=\arg\max_{i\in\mathcal{I}^{(t')}}c_i^{(t')}\),令 \(\bm{z}_0=\bm{z}_0^{(i^\star)}\),只把这一条走完剩余去噪并解码。这一步剪枝同时提升质量和效率:既挑出「始终可信」的轨迹(而非某步侥幸高分的),又把最耗时的后段去噪从 \(N\) 条压到 1 条,大幅省算力。消融显示,相比只靠累积奖励的 beam-search 式基线,这套概率化的 RGRP 平均再高 0.42%,说明概率选择比确定性奖励累积更能平衡探索与利用、避免对累积奖励过拟合。
损失函数 / 训练策略¶
潜在奖励模型用 Qwen2-VL-3B 初始化,学习率 1e-4、第 10 epoch 降到 1e-5、batch size 4、第 15 epoch 停;回归与偏好损失等权(系数均 1.0)。数据构造:采 1000 条与 VBench-2.0 不重叠的 prompt,用不同随机种子生成 5000 段视频,同时存下选定时间步的潜在及其与最终潜在的相似度,8:2 划分训练/测试。视频生成骨干为 Wan2.1-1.3B(推理 50 步、CFG=5.0、33 帧、832×480),打分调度默认在时间步 {10,15,20},实验在 A100 上跑。
实验关键数据¶
主实验¶
在 VBench-2.0(五个维度:创意 Creativity、常识 Commonsense、可控性 Controllability、人体保真 Human Fidelity、物理 Physics)上对比推理时扩展方法(† 表示用 DPM-Solver++)。⚠️ 原文表 1 的箭头图注疑似写反(把 ↑ 标为「性能下降」、↓ 标为「性能提升」),下表以数值本身为准,括号内为相对 baseline 平均分的增减。
| 方法 | 平均分 | 推理时间(s) | 说明 |
|---|---|---|---|
| Baseline (Wan2.1-1.3B) | 51.90 | 77.21 | 单轨迹基线 |
| FreeInit [ECCV'24] | 49.82 (−2.08) | 308.87 (×4.00) | 噪声优化,反而掉点且慢 4× |
| FreqPrior [ICLR'25] | 50.37 (−1.53) | 142.46 (×1.85) | 噪声优化,仍掉点 |
| VideoReward [NeurIPS'25] | 52.80 (+0.90) | 283.63 (×3.67) | Best-of-N 搜索 |
| EvoSearch† [arXiv'25] | 55.01 (+3.11) | 783.76 (×10.15) | 进化搜索,质量高但慢 10× |
| LatSearch (Ours) | 53.84 (+1.94) | 182.43 (×2.36) | 本文 |
| LatSearch† (Ours) | 55.25 (+3.35) | 164.41 (×2.13) | 本文最佳配置 |
关键结论:噪声优化类方法虽不显著增加算力,但缺乏有效验证器,简单把潜在的时间特征喂回初始噪声反而掉点(FreeInit −2.08、FreqPrior −1.53)。搜索类方法能提质但代价高昂(EvoSearch 慢 10×)。LatSearch† 以 ×2.13 算力拿到全场最高 55.25(+3.35);在同等算力下比 FreqPrior 高 2.44%;与 EvoSearch 相比质量仅差 0.24% 却快 4.77×。运行时间拆解(表 7)显示优势来源:LatSearch 解码耗时几乎与 baseline 持平(1.88 vs 1.85s),只多了轻量的潜在奖励评估(1.03s),而 EvoSearch 因反复全量解码,DiT 756.66s + 解码 31.99s,总计 790.57s。
消融实验¶
核心消融拆开验证「偏好损失(PL)」与「RGRP」各自的贡献(表 4):
| 配置 | PL | RGRP | 平均分 | 说明 |
|---|---|---|---|---|
| Baseline | ✗ | ✗ | 51.90 | 单轨迹 |
| + PL only | ✓ | ✗ | 52.35 (+0.45) | beam-search 式,仅加偏好损失奖励模型 |
| + RGRP only | ✗ | ✓ | 53.42 (+1.52) | 回归奖励模型 + RGRP 搜索 |
| Full | ✓ | ✓ | 53.84 (+1.94) | 完整模型 |
从 baseline 加 RGRP(回归奖励模型)就带来 +1.52,说明搜索机制本身贡献最大;再叠加偏好损失把奖励模型练强,进一步 +0.42 到 53.84,印证「奖励模型越强、本文搜索越受益」。RGRP vs beam-search 式(仅靠累积奖励确定性保留固定种子)平均高 0.42%,且算力仅微增。
另一组消融对比信用分配(credit assignment)策略(表 5,如何把视频级奖励折算到中间态):
| 策略 | 平均分 | 说明 |
|---|---|---|
| Baseline | 51.90 | — |
| Uniform | 52.31 (+0.41) | 各步等权,几乎无效 |
| Exponential | 52.11 (+0.21) | 指数加权,早期偏置 |
| L2 Error | 52.74 (+0.84) | L2 误差加权 |
| Cosine Similarity | 53.84 (+1.94) | 本文,最佳 |
关键发现¶
- 搜索机制是主力,奖励模型是增益:RGRP 单独就贡献 +1.52(占 full 的 +1.94 的大头),偏好损失再补 +0.42;两者正交叠加。
- 余弦相似度信用分配显著优于朴素方案:naïve 地把奖励均匀撒到各时间步(Uniform +0.41 / Exponential +0.21)几乎无效,余弦相似度(+1.94)远超,因为它更贴合语义一致性。附录进一步显示,把预测潜在奖励反推回视频级奖励,其近似误差沿去噪轨迹单调下降——越晚的潜在态越能预测最终质量,这也解释了为何打分调度避开极早期步。
- 搜索预算 N 有收益但饱和:N=4→6 提升明显(52.81→53.84),6→8 边际递减(53.84→54.13);由于评估在潜在空间、避免重复解码,增大 N 的算力增长温和。
- 打分调度是甜点:{10,15} 覆盖不足(+0.27),{10,15,20,25,30} 因相似度目标的不确定性累积反而退化(+0.44),中段良好间隔的 {10,15,20} 最佳(+1.94)。温度 \(\tau\in\{0.5,1.0,2.0\}\) 对结果影响很小,说明重采样对温度鲁棒。
- 跨骨干泛化:因只作用于潜在空间、不依赖架构特定组件,LatSearch 在 Wan2.1-14B(52.58→53.61)、CogVideoX-2B(45.13→48.14,+3.01)、CogVideoX-5B(48.13→50.21,+2.08)上均稳定提升。
- 人类偏好一致:40 对视频、30 人评测,LatSearch 在视觉质量/运动质量/文本对齐上被偏好 72.15%/75.29%/78.51%(平均 75.32%),与自动指标一致。
- 时长/分辨率外推:2s/3s/4s/5s 分别 +1.94/+1.21/+0.87/+1.37,480p +1.94、720p +0.80;越长越高清增益越小,属预期。
亮点与洞察¶
- 把「评估搬进潜在空间」是全篇的效率杠杆:过去搜索类方法的成本大头是反复全量解码视频(EvoSearch 解码就 31.99s),LatSearch 把评估移到潜在态、每次打分仅 0.84s,解码只做最后一次——这是「质量相当却快 4.77×」的根本原因,思路可迁移到任何「候选评估贵」的生成式搜索。
- 相似度接地是很聪明的「无标签造标签」:中间潜在态没有 ground-truth 奖励,用余弦相似度按「对终点的贡献」折算视频级奖励,把一个看似无解的监督问题变得可训练;且这个近似误差被实证证明沿去噪单调收敛,不是拍脑袋。
- 「不迷信奖励模型」的工程自觉:明知奖励模型不完美,就不用贪心而用 softmax 概率重采样 + 唯一性去重 + 累积权重剪枝,把「相信奖励」和「保留多样性探索」调和好——这套 SMC 味道的软选择比 beam-search 确定性保留更稳。
- 即插即用:只需奖励评估中间去噪态、不碰生成骨干,天然跨 Wan/CogVideoX 多族适用,落地门槛低。
局限与展望¶
- 无理论最优性保证:RGRP 借鉴 SMC,但因潜在奖励模型是学习出来的近似,难以建立收敛性保证,作者明确不宣称形式最优。
- 信用分配仍是近似:余弦相似度虽在消融里最好,但只是「真实语义贡献」的代理;作者建议未来用轻量的、对比/自监督的时间相似度估计器替代,直接攻克这个近似瓶颈。
- 增益随难度衰减:更长时长、更高分辨率下提升变小(720p 仅 +0.80),说明方法在更具挑战的设定下边际收益下降。
- 可控性维度提升有限:从各表看 Controllability 提升普遍很小(如 full 仅 +0.70),主要收益集中在创意/常识/物理。
- 可扩展方向:奖励模型中视觉质量与运动质量两维是模态无关的,作者提出把文本对齐目标换成任务特定对齐模块后,可推广到音视频生成、视频编辑、指令引导变换。
相关工作与启发¶
- vs FreeInit / FreqPrior(噪声优化):它们只在轨迹起点给初始噪声加频域/时序先验,一旦去噪开始便无从纠错;本文在轨迹中途持续评估并重采样,因此不掉点还提质(对比中两者反而 −2.08 / −1.53)。
- vs VideoReward(Best-of-N 搜索):它需把每条候选去噪到底再解码成视频、用视频级奖励挑最优,解码开销巨大(×3.67 算力);本文在潜在态就打分、只解码胜者一条,同预算下质量更高。
- vs EvoSearch(进化搜索):进化搜索质量最高但慢 10×;本文质量仅差 0.24% 却快 4.77×,把「强搜索」的算力门槛真正打下来。
- vs \(\text{DOLLAR}\) 等潜在奖励工作:前人也用过潜在奖励模型做 few-shot 视频生成,但只评估最终去噪潜在;本文评估跨时间步的中间态,实现更细粒度的过程级引导。⚠️ 该对比方法名以原文引用为准。
评分¶
- 新颖性: ⭐⭐⭐⭐ 「潜在空间中间态打分 + 概率化重采样剪枝」的组合在视频推理时扩展里是清晰且实用的新点,但相似度接地、SMC 式搜索均有前作影子。
- 实验充分度: ⭐⭐⭐⭐⭐ VBench-2.0 五维主对比、时间拆解、跨三族骨干、时长/分辨率外推、信用分配/温度/调度多组消融外加人评,覆盖非常全。
- 写作质量: ⭐⭐⭐⭐ 动机与方法讲得清楚、公式规范;扣分点是主结果表箭头图注写反、个别术语(RGRP/PGRP)前后不一致易致误读。
- 价值: ⭐⭐⭐⭐ 「同质量快近 5×」对视频扩散推理落地价值明确,即插即用、跨骨干可用,实用性强。