跳转至

NoisEasier: Test-Time Noise Optimization for Text-to-Video Generation

会议: ECCV 2026
论文: ECCV 原文
项目主页: https://yujiangpu20.github.io/noiseasier/
领域: 视频生成
关键词: 文本生成视频、测试期缩放、噪声优化、视频一致性模型、多目标奖励

一句话总结

NoisEasier 提出了一种基于视频一致性模型(VCM)的测试期噪声优化框架,通过联合优化初始隐变量与中间随机扰动,并结合多目标可微奖励与负样本校准,在不修改模型参数的前提下显著提升了文本到视频生成的细粒度组合语义对齐。

研究背景与动机

扩散模型在文本到视频(T2V)生成领域取得了显著进展,能够合成高分辨率且视觉逼真的动态场景。然而,现有系统在面对复杂的细粒度组合控制时仍显脆弱,尤其是跨多个概念协同时的属性绑定、空间拓扑关系以及物体交互动作,模型极易产生概念混淆或语义丢失。为了改善生成内容与文本的对齐程度,主流方案主要依赖基于强化学习(RLHF / DPO)或可微奖励离线微调视频生成器。

然而,离线奖励微调存在两大致命缺陷:其一是偏好监督被静态固化在网络权重中,一旦面对新分布的提示词或需要引入新的评估标准,重新微调的计算开销极大;其二是不可避免的奖励黑客(reward hacking)现象,即优化单一或不完美的奖励函数容易导致模型生成缺乏动态运动的静止画面或破坏视觉真实感。尽管图像领域常通过测试期初始隐变量优化(test-time noise optimization)来实现灵活可控的后验校准,但在视频扩散模型中直接对隐变量进行反向传播面临数十步去噪带来的显存爆炸与计算瓶颈,且脆弱的时空奖励信号极易导致轨迹崩溃。

为打破计算与稳定性的双重壁垒,本文巧妙借力近年快速发展的短步视频一致性模型(VCM),将漫长的多步采样大幅缩短至 4 步,使得反向传播在有限推理算力下变得可行。核心 idea:将测试期优化变量从单一初始隐变量扩展为包含所有中间随机扰动的全轨迹联合变量,并协同图文、视频-文本与去全局相机的时空流多目标奖励,辅以 LLM 构造的硬负样本校准损失,实现即插即用、高效稳定的细粒度视频组合生成控制。

方法详解

整体框架

NoisEasier 的核心推理流围绕预训练好的视频一致性模型(如 T2V-Turbo 或 AnimateLCM)构建。输入目标文本提示词 \(c\),首先通过 LLM 离线构造句法相似但语义错误的硬负提示词集合。在测试期优化循环中,生成器以初始高斯噪声 \(\mathbf{z}_T\) 与中间各去噪步注入的随机摄动 \(\boldsymbol{\varepsilon}_t\) 作为输入,经由少步 consistency 迭代生成去噪视频序列。随后,生成视频传入由图像级图文对齐模型(HPSv2 / ImageReward)、视频级图文对齐模型(ViCLIP)以及基于 RAFT 光流提取的局部动态运动奖励构成的可微评估网络中,在负样本对比校准下计算复合标量目标,并通过反向传播对所有随机变量进行梯度上升更新。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["目标文本提示词 c 与 LLM 硬负样本集"] --> B["全轨迹随机噪声变量<br/>z_T 与中间扰动 {ε_t}"]
    B --> C["4步视频一致性模型 VCM<br/>前向积分生成视频序列"]
    C --> D["多目标可微奖励评估<br/>图像对齐 + 视频对齐 + RAFT 局部运动"]
    D --> E["负样本感知奖励对比校准<br/>拉开正负提示词得分边界"]
    E -->|AdamW 梯度回传| B
    E -->|达到优化步数 25 步| F["最终高对齐保真视频输出"]

关键设计

1. 全随机轨迹联合优化:突破初始噪声单点更新瓶颈

针对传统噪声优化仅将初始状态 \(\mathbf{z}_T\) 作为可学习参数导致表达自由度受限且梯度收敛迟缓的问题,本文挖掘了视频一致性模型在推理步进中的随机扰动机制。VCM 在交替预测干净样本 \(\hat{\mathbf{z}}_0 = f(\mathbf{z}_t, t, c)\) 与注入高斯扰动 \(\boldsymbol{\varepsilon}_t \sim \mathcal{N}(0, \mathbf{I})\) 生成下一步潜变量 \(\mathbf{z}_{t-1} = \sqrt{\alpha_{t-1}}\,\hat{\mathbf{z}}_0 + \sqrt{1 - \alpha_{t-1}}\,\boldsymbol{\varepsilon}_t\) 时,将扰动项显式暴露为控制变量。NoisEasier 将优化变量拓展为全体随机集合 \(\boldsymbol{\epsilon} = \{\mathbf{z}_T, \boldsymbol{\varepsilon}_1, \dots, \boldsymbol{\varepsilon}_T\}\),利用单次反向传播即可同时计算关于所有变量梯度的特性,无需任何额外的模型前向或反向传递开销。实验证明,初始噪声主导宏观语义与全局构图布局,而中间步扰动则精确调控局部结构、纹理对比度及细微动态细节,全轨迹联合更新能够显著加快奖励收敛速度并拓宽优化 Pareto 前沿。

2. 互补多目标可微视频奖励:抗衡静止偏差与视觉退化

单一奖励优化极易引发奖励黑客现象。若单纯使用图像-文本对齐模型(如 HPSv2 或 ImageReward),生成器往往倾向于生成近乎定格的静止画面以取得高相似度分;而纯运动引导则会破坏语义保真度。为此,本文设计了互补的多目标奖励函数: - 逐帧图像-文本奖励:平均每帧与文本提示词的 ImageReward / HPSv2 相似度; - 视频-文本时空奖励:利用 ViCLIP 抽取生成视频在时间轴上错开的两个 8 帧片段,评估与文本的宏观时空一致性; - 局部化光流运动奖励:调用 RAFT 计算相邻帧之间的光流场 \(\mathbf{F}_t \in \mathbb{R}^{2 \times H \times W}\),通过减去空间均值光流向量 \(\bar{\mathbf{f}}_t\) 消除全局摄像机平移干扰,并结合一阶动态激励与二阶加速度平滑惩罚: $\(\mathcal{R}_{\text{motion}} = \tanh\left(\frac{1}{T-1}\sum_{t=1}^{T-1}\|\mathbf{F}_t - \bar{\mathbf{f}}_t\|\right) \cdot \left[1 - \tanh\left(\frac{1}{T-2}\sum_{t=1}^{T-2}\|\mathbf{F}_{t+1} - \mathbf{F}_t\|\right)\right]\)$ 该式有效平衡了主体显著动态与时间序列的平滑连贯性。

3. 负样本感知奖励校准:克服 VLM 词袋效应的细粒度判别

针对现成视觉语言模型(VLM)常常表现得如同“词袋模型”、对词序变异、属性归属及逻辑反转钝感的问题,本文提出了负样本感知奖励校准策略。系统首先提示 LLM 将正向文本 \(c^+\) 转换为结构高度相似但关键语义颠倒的 \(N\) 个硬负样本 \(\{c^-_j\}_{j=1}^N\)(例如将“戴帽子的男孩与穿红衣的女孩踢足球”改写为“戴帽子的女孩与穿红衣的男孩踢足球”)。对于给定的生成视频 \(x\) 和基础奖励模型 \(\mathcal{R}\),校准后的对比奖励定义为: $\(\tilde{\mathcal{R}}(x, c^+) = \mathcal{R}(x, c^+) - \tau \log \sum_{j=1}^N \exp\left(\frac{\mathcal{R}(x, c^-_j) - \mathcal{R}(x, c^+) + m}{\tau}\right)\)$ 其中 \(m\) 为保持正负提示词得分间距的安全边界间隔,\(\tau\) 为对比温度系数。该校准迫使生成模型在强化目标描述特征的同时全力压制相近负向概念的伪激活,对解决颜色绑定、空间多物体排列及离散计数等细粒度组合问题起到了决定性作用。

损失函数 / 训练策略

在测试阶段,模型无需更新任何网络层权重。优化器使用 AdamW,设置学习率 \(\eta = 0.01\) 与梯度截断以保证更新平稳,优化迭代次数默认设为 25 轮。在每次更新步骤中,依据校准后的综合多目标梯度执行梯度上升: $\(\boldsymbol{\epsilon}^{k+1} = \boldsymbol{\epsilon}^k + \eta \cdot \nabla_{\boldsymbol{\epsilon}} \left[ \sum_i \alpha_i \tilde{\mathcal{R}}_i(\mathcal{G}_\theta(\boldsymbol{\epsilon}^k, c^+), c^+) \right]\)$ 为了在 24GB/40GB 等常规显存预算下跑通多步计算图的微分运算,算法联合使用了梯度检查点(gradient checkpointing)与混合精度推理技术。

实验关键数据

主实验

在代表性视频生成基准 VBench(衡量综合语义与运动质量)以及 T2V-CompBench(严格评估细粒度组合能力)上对多种短步生成骨干进行了测试。下表展示了在 VBench 和 T2V-CompBench 上的核心量化表现(分别对应原论文 Table 1 与 Table 2)。

Table 1: VBench 定量评测结果(%)

模型骨干 整体一致性 (Overall Consist.) 多物体生成 (Multiple Objects) 颜色绑定 (Color) 空间关系 (Spatial Relation.) 运动平滑度 (Motion Smooth.) 动态幅度 (Dynamic Degree)
ModelScope (基线) 25.67 38.98 81.72 33.68 95.79 66.39
VideoCrafter2 (基线) 28.23 40.66 92.92 35.86 97.73 42.50
AnimateLCM* 25.74 30.78 81.84 39.94 98.19 29.17
+ NoisEasier (本文) 28.79 (↑3.05) 44.04 (↑13.26) 88.22 (↑6.38) 46.70 (↑6.76) 98.57 (↑0.38) 30.56 (↑1.39)
T2V-Turbo (MS)* 27.40 54.50 89.90 46.62 95.51 70.83
+ NoisEasier (本文) 32.05 (↑4.65) 76.62 (↑22.12) 94.38 (↑4.48) 48.93 (↑2.31) 95.29 (↓0.22) 71.39 (↑0.56)
T2V-Turbo (VC2)* 28.12 54.33 90.59 39.95 96.29 51.67
+ NoisEasier (本文) 31.95 (↑3.83) 79.18 (↑24.85) 93.63 (↑3.04) 52.61 (↑12.66) 96.10 (↓0.19) 59.17 (↑7.50)

Table 2: T2V-CompBench 细粒度组合对齐能力评测

模型配置 一致性属性绑定 (Consist. Attr.) 空间关系 (Spatial) 动作绑定 (Action) 物体交互 (Interaction) 计数能力 (Numeracy)
AnimateLCM* 0.6746 0.4651 0.3425 0.4504 0.2494
+ NoisEasier (本文) 0.7807 (↑0.1061) 0.5113 (↑0.0462) 0.4362 (↑0.0937) 0.5365 (↑0.0861) 0.2567 (↑0.0073)
T2V-Turbo (MS)* 0.7313 0.4620 0.4923 0.5822 0.3030
+ NoisEasier (本文) 0.8375 (↑0.1062) 0.5259 (↑0.0639) 0.6477 (↑0.1554) 0.6743 (↑0.0921) 0.3983 (↑0.0953)
T2V-Turbo (VC2)* 0.7852 0.5079 0.6241 0.7017 0.2900
+ NoisEasier (本文) 0.8737 (↑0.0885) 0.5660 (↑0.0581) 0.7524 (↑0.1283) 0.7915 (↑0.0898) 0.3753 (↑0.0853)

消融实验

原论文通过严密的消融实验验证了各模块的不可或缺性。下表分别汇总了奖励组件拆解(原 Table 3)与初值优化 vs 全轨迹优化的对比(原 Table 4)。

Table 3 & 4: 奖励组件与优化变量消融(基于 T2V-Turbo (MS) / VBench)

实验组别 / 变体配置 整体一致性 多物体生成 颜色绑定 空间关系 动态幅度 说明
Baseline (T2V-Turbo MS) 27.40 54.50 89.90 46.62 70.83 原始骨干无优化
+ 单一 HPSv2 27.85 64.66 90.20 46.21 54.72 动态幅度严重暴跌至 54.72,画面偏向静态
+ 单一 Motion 奖励 26.05 47.68 87.32 42.07 85.56 动态幅度飙升,但语义一致性与空间关系恶化
+ 完整奖励 w/o 负样本校准 31.74 75.82 93.29 47.95 73.33 语义显著恢复,但在细粒度空间和颜色上欠缺校准
+ 仅初始噪声优化 (+Init) 29.67 72.58 90.03 44.10 66.94 相比 Baseline 提升,但不及全轨迹优化
+ 全轨迹优化 (Full, NoisEasier) 32.05 76.62 94.38 48.93 71.39 全面达到最优,且相较 +Init 耗时仅增加不到 1%

关键发现

  • 全轨迹优化具备极高收益-成本比:如 Table 8 所示,在 RTX 6000 Ada GPU 上,T2V-Turbo (MS) 优化初始噪声耗时 44.63s(峰值显存 22.93 GB),而联合优化所有中间噪声仅需 45.28s(峰值显存 22.95 GB),计算耗时增加不足 1.5%,显存几乎无变化,但在多物体生成上从 72.58% 跃升至 76.62%,空间关系从 44.10% 提升至 48.93%。
  • 对离线对齐模型的互补性:如 Table 7 所示,若在经过 LoRA 离线奖励微调(RFT)的模型上再叠加 NoisEasier 测试期优化,多物体指标从 RFT 的 73.49% 进一步拔高至 84.56%,证明离线参数微调并未完全挖掘奖励潜能,测试期搜索能持续提供可观增益。
  • 与其它测试期策略对比:在同等时间预算下,NoisEasier 在整体一致性和颜色绑定上显著优于 Best-of-n 采样(BoS)与 LLM 提示词重写(Prompt Enhancement, PE)。

亮点与洞察

  • 将随机扰动视为免费的高维控制自由度:以往扩散模型隐变量优化大多拘泥于初始高斯分布 \(z_T\),而本文指出一致性模型中的多步随机扰动同属于连续计算图的一部分,联合优化它们无需额外的正反向传播即可直接提升生成轨迹的表达容量。
  • 负样本校准抵消 VLM 视觉错觉:巧妙引入 LLM 生成的硬负样本构造对比 Margin 目标,以极低的成本破解了 CLIP 类模型“重词汇匹配、轻逻辑绑定”的通病,为基于多模态奖励的生成优化提供了普适参考范式。
  • 测试期缩放(Test-Time Scaling)在视频生成的落地示范:证明了除了通过扩增模型参数量和训练数据规模之外,在推理端利用梯度引导精细搜寻潜在噪声空间是突破组合泛化瓶颈的另一条强效途径。

局限与展望

  • 受限于奖励模型的长程时序判别瓶颈:作者在失败案例中指出,当前方法在处理“冰块融化成水”这类复杂的物理时态连续演变(temporal state transition)时仍然失效,这主要是因为目前轻量级奖励模型主要基于帧级语义,对跨时间的因果物理变化缺乏敏锐监督。
  • 严苛计数的粒度上限:尽管在 T2V-CompBench 计数维度上有明显提升,但面对“树枝上挂着三颗苹果,附近停着三只鸟”等多主体复合计数约束时,依然存在漏数或多生成的情况,显示出当前 VLM 奖励对高阶离散计数的指导精度有限。
  • 推理延迟对交互式部署的挑战:虽然 4 步 VCM 配合 25 轮优化已将耗时压缩至 45~177 秒(远快于传统扩散模型的几十分钟),但相比单次前向秒级出片,测试期迭代优化仍不适合低延迟交互场景,未来需探索基于低秩代理梯度的加速技术。

相关工作与启发

  • vs DOODL / ReNO (测试期噪声优化): DOODL 针对数十步全流程扩散模型,反向传播需几十步计算图展开,推理耗时达数十分钟;ReNO 仅在单步图像模型上验证了局部噪声更新。本文将测试期可微噪声优化推广至视频领域,首次利用短步视频一致性模型解决了显存与时序计算瓶颈。
  • vs Video-RLHF / Direct Preference Optimization: 离线偏好微调将偏好固化于参数,且容易产生奖励黑客导致动态退化;NoisEasier 无需改变基础模型参数,且能与离线微调互为补充叠加生效。

评分

  • 新颖性: ⭐⭐⭐⭐ [首次将全轨迹联合噪声优化与短步视频一致性模型结合,开创视频测试期计算扩展新思路]
  • 实验充分度: ⭐⭐⭐⭐⭐ [评测涵盖两套权威 Benchmark、详尽的消融、效率分析、与 BoS/PE/RFT 的横向对比及真人盲测]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑紧凑清晰,数学表达规整,框架图与图表支撑十分有力]
  • 价值: ⭐⭐⭐⭐ [为攻克多模态视频生成细粒度组合对齐提供了无需重新训练的轻量化即插即用方案]