跳转至

OSVE: One Step Video Editing with One Step Diffusion Models

会议: ECCV 2026
论文: ECCV 官方
代码: https://github.com/KU-VGI/OSVE
领域: 视频生成
关键词: 视频编辑, 单步扩散模型, 逆映射编码器, 跨帧注意力, 时序一致性

一句话总结

首个将单步文生图扩散模型扩展至视频编辑的“单步逆映射-单步生成”(One-to-One)框架,通过结构感知编辑损失训练前向噪声编码器保持几何布局,并利用统一帧拼接机制实现跨帧注意力交互,速度较多步方案提升 155–171 倍并实现亚秒级视频编辑。

研究背景与动机

基于扩散模型的文本引导视频编辑在影视制作与互动内容创作中展现了巨大潜力,但现有技术普遍受困于极其昂贵的多步采样与反演过程。主流方案多采用“多步反演 + 多步去噪”管线(如 DDIM 反演配合跨帧注意力控制),每帧视频都需要迭代几十到上百个去噪步,导致处理耗时与帧数及去噪步数呈乘性激增。例如,即便是以高效著称的轻量化编辑方法 RAVE,在单张 RTX 6000 Ada GPU 上编辑一段 5 分钟、30 FPS 的视频也需要约 24 小时,这使现有方法根本无法应用于实时流式交互。

直接引入蒸馏得到的单步文生图模型(如 DMD2)虽然理论上能将生成收敛至单次前向推理,却面临三项根本性技术挑战。首先是反演与生成路径的严重失配:传统多步 DDIM 反演轨迹与单步模型的直接映射流形脱节,导致信息严重丢失、生成画面模糊溃散;其次是单步控制下的结构崩塌与“过度转向(over-steering)”:在多步迭代中,外部控制信号(如 Prompt-to-Prompt、ControlNet)被稀释到各步逐步吸收修正,而单步生成会把所有控制强度压缩至单次前向,缺乏反馈修正机制,导致控制信号压制生成流形使结构彻底崩溃;最后是单步模型缺乏跨帧时序机制,逐帧独立生成必然引发严重的时序闪烁与画面抖动。

针对这一根本矛盾,本文提出关键转折思路:在单步生成范式下,几何结构不能依赖生成过程中的外部干预,而必须在生成开始前就固化在初始噪声潜变量中。核心 idea:构建“单步反演-单步生成”(One-to-One)视频编辑框架,通过提示词微扰自建生成器流形对齐的数据集,配合结构感知编辑(SAE)损失训练轻量前向噪声编码器锁定空间布局,并在生成侧将多帧潜变量空间拼接为单一宽张量触发全局自注意力,以极简设计同时兼顾几何保真度与全局时序一致性。

方法详解

整体框架

OSVE 的完整架构分为两个主要阶段:单步结构感知反演与统一帧拼接生成(Unified-Frame Editing, UFE)。在输入端,长度为 \(K\) 的原始视频帧序列首先经过 VAE 编码提取潜变量,各帧独立送入预训练反演编码器预测各自的初始噪声潜变量;随后,所有帧的初始潜变量沿宽度维度在空间上拼接成一个单一宽图潜变量,送入冻结的单步扩散生成器中,通过自注意力层在单次前向过程中天然实现全序列特征对齐。对于长视频序列,方法引入 DINO 特征中心帧作为全局锚点帧(Anchor Frame),结合滑动窗口机制防止长时序漂移。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入视频帧序列<br/>V0 = [z0_0, ..., z0_K-1]"] --> B["结构感知单步反演<br/>前向编码器预测噪声潜变量 zT"]
    B --> C["统一帧潜变量拼接<br/>宽维度拼接形成超宽潜变量 Z_UFE"]
    C --> D["锚点引导滑动窗口<br/>DINO 中心锚点帧 + 窗口切片"]
    D --> E["单步扩散生成与注意力共享<br/>单步生成器 Gθ 单次前向对齐特征"]
    E --> F["输出编辑视频<br/>剔除锚点并无缝缝合切片"]

关键设计

1. 结构感知单步反演:将空间几何约束前置编码进初始噪声

针对传统多步反演在单步模型上失配以及注意力注入在单步下产生“过度转向”导致结构崩塌的问题,本文设计了一个参数化单步反演编码器 \(I_\phi\)。该编码器直接从单步生成器 U-Net 初始化以继承潜空间先验,输入源帧 VAE 潜变量 \(z_0\) 与原提示词嵌入 \(c\),通过单次前向直接回归出终止时刻噪声潜变量 \(\hat{z}_T = I_\phi(z_0, c)\)。为解决缺乏成对编辑训练数据的难题,作者提出了“提示词微扰(Prompt Perturbation)”数据构建策略:从 LAION 和 JourneyDB 采样文本提示词并向文本嵌入施加高斯微扰 \(c_{\text{edit}} = c + \mathcal{N}(0, \lambda_{\text{noise}}^2 I)\),再利用同一初始高斯噪声通过冻结生成器生成图像对 \((z_0, z_0^{\text{edit}})\)。这种方式确保了编辑目标完全落在冻结生成器的可达流形内,避免了梯度冲突。

在训练目标上,模型联合使用重建均方误差损失与结构感知编辑(Structure-Aware Editing, SAE)损失:

\[\mathcal{L}_{\text{total}} = \|G_\theta(\hat{z}_T, c) - z_0\|_2^2 + \lambda_{\text{sae}} \|G_\theta(\hat{z}_T, c_{\text{edit}}) - z_0^{\text{edit}}\|_2^2\]

其中 \(\lambda_{\text{sae}} = 1.0\)。第一项保证反演噪声具备忠实的无损重建能力;第二项则强制同一个反演噪声在面对扰动语义时,解码产物依然与共享初始噪声的参考图 \(z_0^{\text{edit}}\) 空间结构保持对齐。这使得输出噪声天生具备结构不变性,无需任何运行时中间层干扰即可天然抗衡语义突变。

2. 统一帧潜变量拼接:零额外参数复用空间自注意力实现跨帧对齐

针对单步生成器缺乏时序模块导致帧间闪烁的问题,本文摒弃了修改网络结构或添加额外时序注意力层的传统路线,提出了输入层级的潜变量统一方案(Unified-Frame Editing, UFE)。由于扩散模型的 U-Net 卷积与自注意力模块天然支持任意输入分辨率,OSVE 将序列中 \(K\) 个帧的反演噪声潜变量 \(\hat{z}_{T, k} \in \mathbb{R}^{C \times H \times W}\) 沿着图像宽度维度进行横向拼接,构造出统一超宽潜变量:

\[Z_T^{\text{UFE}} = \text{Concat}(\hat{z}_{T, 0}, \hat{z}_{T, 1}, \dots, \hat{z}_{T, K-1}, \text{axis}=W) \in \mathbb{R}^{C \times H \times (W \cdot K)}\]

将该统一潜变量直接输入冻结的单步生成器 \(G_\theta\),其内部原生的空间自注意力机制便能同时横跨所有帧的图像 patch 进行注意力运算。某帧中的特定前景语义区域(如动物头部)可以直接与相邻乃至远端帧的对应区域建立全局特征对应,在完全不引入时序参数的前提下,仅依靠单次前向扩散计算完成了跨帧外观与运动的自然对齐。

3. 锚点引导滑动窗口:兼顾局部平滑与长程语义锚定

统一拼接机制的显存开销和自注意力计算复杂度随帧数呈二次方增长,难以直接扩展至长视频。为此,OSVE 提出了带全局锚点帧的重叠滑动窗口推理策略。系统首先在整段视频的所有帧中提取 DINO 视觉特征,计算特征空间的中心点(Medoid),将最具有代表性的一帧选为全局锚点帧 \(\hat{z}_T^A\)。随后以窗口大小 \(w=7\)、步长 \(s=5\) 沿时序滑动窗口遍历视频,在每个局部窗口的最前端拼接该固定锚点帧:\([ \hat{z}_T^A, \hat{z}_{T, t}, \dots, \hat{z}_{T, t+w-1} ]\)。生成完成后直接剔除锚点帧对应的输出区域,并仅提取中间步长 \(s\) 帧拼接到最终视频中。局部滑动窗口保障了连续运动的近邻平滑过渡,而恒定参与注意力交互的锚点帧则为整段长视频提供了全局统一的色彩、光照与主体身份参考,彻底杜绝了长视频编辑中常见的时序漂移现象。

实验关键数据

主实验

评估涵盖 60 段真实视频(51 段 20 帧短视频与 9 段 90 帧长视频),每段设计 5 个编辑指令(涵盖物体替换、删除、风格化等),采用 VBench 标准评测体系。评价指标包括时序一致性(主客体一致性 SC、背景一致性 BC、时序闪烁度 TF、运动平滑度 MS)、单帧视觉质量(美学评分 AQ、成像质量 IQ)、综合平衡分数 BQS 以及单卡推理帧率 FPS。

框架类型 方法 SC ↑ BC ↑ TF ↑ MS ↑ AQ ↑ IQ ↑ BQS ↑ FPS ↑
Multi-to-Multi (SD1.5) FLATTEN 0.965 0.970 0.964 0.972 0.625 0.639 0.611 0.072
Multi-to-Multi (SD1.5) TokenFlow 0.983 0.976 0.985 0.991 0.668 0.680 0.663 0.075
Multi-to-Multi (SD1.5) FRESCO 0.978 0.974 0.973 0.991 0.649 0.729 0.674 0.078
Multi-to-Multi (SD1.5) RAVE 0.982 0.976 0.975 0.986 0.637 0.695 0.653 0.091
Multi-to-Multi (SD1.5) COVE 0.983 0.976 0.984 0.989 0.645 0.655 0.639 0.061
Multi-to-One (DMD2) Prompt-to-Prompt 0.915 0.945 0.965 0.978 0.587 0.566 0.548 0.898
Multi-to-One (DMD2) ControlNet (Depth) 0.968 0.961 0.970 0.984 0.658 0.673 0.646 0.578
Multi-to-One (DMD2) Plug-and-Play 0.953 0.971 0.995 0.995 0.486 0.220 0.345 0.398
One-to-One (DMD2) OSVE (本文) 0.983 0.977 0.978 0.991 0.678 0.703 0.678 15.625

在长视频(90 帧)设定下,OSVE 保持了 15.793 FPS 的高速推理,BQS 达到 0.677,全面领先 Multi-to-Multi 基线(FRESCO 0.655、RAVE 0.659)及 Multi-to-One 基线,同时速度达到了 RAVE 的 155 倍、TokenFlow 的 188 倍。

消融实验

针对反演编码器训练目标在 PIE-Bench 上的有效性分析(评估结构距离与文本对齐度):

配置 \(\mathcal{L}_{\text{mse}}\) \(\mathcal{L}_{\text{sae}}\) 结构距离 (Struct. Dist) ↓ 全图 CLIP 分数 ↑ 编辑区 CLIP 分数 ↑ 说明
仅重建损失 ✓ – 0.087 21.797 19.884 结构保持能力显著不足
仅 SAE 损失 – ✓ 0.074 22.349 19.863 具备一定结构保持但细节欠佳
完整目标 (Full model) ✓ ✓ 0.064 22.329 20.416 结构保持与编辑强度协同最佳

针对 90 帧长视频中 UFE 组件的消融分析:

滑动窗口 (Sliding Window) 锚点帧 (Anchor Frame) 主体一致性 (SC) ↑ 背景一致性 (BC) ↑ 时序闪烁度 (TF) ↑ 运动平滑度 (MS) ↑ 综合质量 (BQS) ↑
– – 0.931 0.948 0.972 0.980 0.671
✓ – 0.954 0.963 0.977 0.988 0.676
– ✓ 0.943 0.950 0.976 0.985 0.669
✓ ✓ 0.958 0.965 0.978 0.989 0.677

关键发现

  • 损失协同效应:单独使用 \(\mathcal{L}_{\text{mse}}\) 导致模型只学到了原图的像素级重合,编辑时结构完全无法对抗文本变化;仅使用 \(\mathcal{L}_{\text{sae}}\) 则缺少高保真重建的像素级约束。两者联合训练让结构距离降低至 0.064,并取得最高的局部编辑 CLIP 分数 20.416。
  • 窗口与锚点的互补性:滑动窗口主要提升局部相邻帧的平滑性(MS 从 0.980 升至 0.988),而全局 DINO 锚点则强力约束了长时序的背景与主体漂移(SC 从 0.931 升至 0.958)。两者结合将长视频时序一致性推至最高水平。
  • 速度革命:由于反演和生成全部为单步前向推理,OSVE 的帧率达到了惊人的 15.6+ FPS,彻底跨越了扩散模型视频编辑从“分钟/小时级”到“亚秒级”的实用化鸿沟。

亮点与洞察

  • 将控制前置化破解单步过度转向:在单步扩散模型中,运行时的注意力操作由于缺乏多步纠错机制会产生破坏性失真,本文指出控制必须在采样前由潜变量自身承载,通过反演编码器直接将几何先验“烧录”进初始高斯噪声中。
  • 提示词微扰构建同源生成流形对齐数据:通过给提示词加微扰并在同源冻结生成器上采集成对训练数据,完美规避了使用外部编辑模型带来的流形偏置与梯度冲突,极简且高度有效。
  • 空间横向拼接撬动全局跨帧交互:巧妙利用全卷积/注意力结构对可变分辨率的天然适应性,通过沿宽度拼接潜变量将跨帧时序交互等价转换为单张宽图的空间自注意力,无需修改生成器一行权重或结构。

局限与展望

  • 依赖单步图像骨干的容量与分辨率:OSVE 目前构建在 SD1.5 蒸馏出的 DMD2 单步文生图底座上,受限于底座本身的生成分辨率与复杂场景概念理解能力。
  • 剧烈视角变换下的长视频外推能力有限:当前全局锚点依赖单一 DINO 特征中心帧,若输入视频存在频繁的镜头剪辑、大角度剧烈旋转或完全不同的场景切换,单一锚点会提供误导性参考(未来需要扩展为多锚点或动态自适应关键帧策略)。
  • 随着单步文生视频(T2V)模型成熟的外推潜力:当前单步 T2V 模型仍处于早期,存在严重的模糊与伪影,未来一旦高质量单步视频骨干成熟,OSVE 的反演前置化与统一拼接理念可直接迁移到更高维的时空架构中。

相关工作与启发

  • vs 多步视频编辑方法 (TokenFlow / RAVE / FRESCO):经典方案严重依赖多步迭代去噪(50-100 步)和复杂的显式流引导或特征注入,速度极慢(0.06-0.09 FPS);OSVE 实现了首个纯单步前向的 One-to-One 架构,性能相当或更优,而处理速度提升两个数量级(15.6+ FPS)。
  • vs 单步图像反演与编辑 (Prompt-to-Prompt / ControlNet 在单步下的移植):已有控制机制在单步下会因“过度转向”引发严重伪影与结构崩塌;OSVE 证明了在单步范式下,用 SAE 损失训练的离线编码器优于一切运行时显式注意力干预。
  • vs 现有多步扩散反演 (DDIM Inversion / Null-text Inversion):传统反演要求严格匹配正向去噪步进序列,在单步模型上完全崩溃;OSVE 的参数化编码器通过单次前向直接预测终态噪声,为极端轻量化生成模型提供了全新的反演标杆。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ [首次突破单步扩散模型用于视频编辑的理论与实践瓶颈,提出前置结构反演与统一拼接]
  • 实验充分度: ⭐⭐⭐⭐⭐ [涵盖 60 组视频、主客观多维指标、完整的组件消融与 26 人真实用户评估]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑严密清晰,深入剖析了单步过度转向与失配的本质根源,方案针对性极强]
  • 价值: ⭐⭐⭐⭐⭐ [将扩散视频编辑推至 15+ FPS 实时/亚秒级可用区间,对行业级落地具有重要指导价值]