跳转至

OpenVE-3M: A Large-Scale High-Quality Dataset for Instruction-based Video Editing

会议: ECCV 2026
论文: ECCV 原文
代码: 待确认
领域: 视频生成
关键词: 指令驱动视频编辑、数据集构建、多模态大语言模型、混合专家架构、基准评测

一句话总结

提出了包含 300 万对样本的高质量多类指令视频编辑数据集 OpenVE-3M、对应评测基准 OpenVE-Bench,以及基于 MLLM 和 MoE-Connector 的 5B 端到端模型 OpenVE-Edit,在参数量减半的情况下全面超越现有 14B 开源模型。

研究背景与动机

随着多模态生成技术的演进,基于自然语言指令的图像编辑已经涌现出 FLUX-Kontext、Qwen-Image-Edit 等一系列高控制力、强泛化性的开源模型,其突破很大程度上得益于大规模高质量配对数据集的支撑。然而,指令驱动视频编辑(Instruction-guided Video Editing, IVE)领域的研究进展却明显滞后。将单图编辑迁移至动态时空视频,不仅要求编辑区域保持精准的空间对齐与外观变换,还必须克服时序闪烁、运动漂移以及前后背景长期一致性的严苛物理约束,这使得构建海量、高质量、动作连贯的真实感视频编辑样本极其困难。

现有开源 IVE 数据集面临规模狭小、任务类型匮乏、提示词过于简短以及噪声伪影泛滥四大瓶颈。例如,InsViE-1M 与 Señorita-2M 的规模仅在 100万 至 200 万对之间,指令平均长度仅有 3 至 4 个单词,难以提供精细化的时空编辑引导;VIVID-10M 虽标称千万级,但仅提供视频掩膜而无编辑后真实视频,无法支持端到端直接训练;此外,现有合成方案缺乏严密的多层级质量过滤,低质量负例(1分样本)占比较高,导致基于其训练的模型极易产生语义漂移与背景崩溃。而在评测端,学界亦长期欠缺一套与人类主观感知深度对齐的标准化基准。

本文的目标是打破这一数据与评测瓶颈,系统化打通从数据合成、模型架构到自动化评估的完整闭环。核心 idea:构建涵盖空间对齐与非空间对齐两类、8种细分类的 300 万高质量指令视频编辑数据集 OpenVE-3M,配合严格的时序与 VLM 多维过滤机制;在此基础上设计由 MLLM 语义注入与 MoE 任务解耦门控驱动的 5B 模型 OpenVE-Edit,并推出高人类对齐度的基准 OpenVE-Bench。

方法详解

整体框架

OpenVE-3M 数据构建及 OpenVE-Edit 模型架构整体流程由三部分联动组成:首先是三阶段工业级数据工程管线(多模态预处理 → 任务驱动配对生成 → 细粒度多维过滤),消耗超 10,000 GPU-days 产出 300 万样本;其次是轻量高效的 OpenVE-Edit 模型,通过 MLLM 联合建模输入视频与指令,利用稀疏激活的 MoE-Connector 解耦多任务特征,并与 umT5 编码特征拼接后注入 DiT 进行跨模态去噪生成;最后通过三维指标基准 OpenVE-Bench 开展闭环评测。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["原始视频库与预处理<br/>Open-Sora-Plan / OpenViD / UltraVideo"] --> B["阶段 1:分类生成策略<br/>空间对齐 6 类 + 非空间对齐 2 类"]
    B --> C["阶段 2:多维严苛过滤<br/>TF/CLIP-F 时序筛除 + InternVL3.5-38B 评分"]
    C --> D["OpenVE-3M 数据集 (3M)"]
    D --> E["阶段 3:多模态联合编码<br/>Qwen2.5-VL 提取视频与指令时空语义"]
    E --> F["阶段 4:MoE-Connector 任务解耦<br/>可学习 Query 稀疏激活专用专家网络"]
    F --> G["阶段 5:零初始化收敛加速<br/>末层全零线性映射与 umT5 拼接注入 DiT"]
    G --> H["OpenVE-Edit (5B) 视频编辑输出"]

关键设计

1. 分类生成策略:针对不同时空对齐需求定制化多模型协同流水线

传统方法用单一流水线处理全部编辑,在局部增删、镜头切换或全局风格化上极易顾此失彼。本文将编辑任务显式划分为两大类共 8 种子任务:空间对齐(SA)包含全局风格迁移、背景替换、局部变更、局部消除、局部添加、字幕编辑;非空间对齐(NSA)包含多镜头运镜切换与创意生成。在 SA 任务中,利用 FLUX-Kontext 进行首帧高质量编辑,并提取原视频 Canny 边缘序列作为几何时序控制信号,由 Wan2.1-Fun-14B-Control 生成受控视频;对于局部增删,创新设计“逆向构建”策略——用视频修复模型去除物体作为“添加”训练对,或合成带新物体的视频并抠图回贴作为“消除”训练对。在 NSA 任务中,借助 Seedance 的原生多镜头能力与 GPT-4o 创意指令,生成同一主体在跨景别或全新动作下的连贯视频对,彻底解决视频编辑长久以来受限在局部刚性变换的技术瓶颈。

2. 多维严苛过滤:双时序指标与 VLM 逻辑上限约束的多重淘汰机制

合成数据中普遍存在首帧外推导致的分布漂移和局部频闪,若直接入库将严重污染模型训练。本文构建了两级过滤过滤网:第一级采用时序频闪指标 TF(帧间均值绝对差)与 CLIP-F(帧间 CLIP 特征余弦相似度)剔除运动畸变与严重抖动的候选;第二级设计了基于大视觉语言模型(VLM)的细粒度三维自动化评估,覆盖指令遵循度(Instruction Compliance)、一致性与细节保真度(Consistency & Detail Fidelity)、视觉质量与稳定性(Visual Quality & Stability)。关键创新在于确立了“指令遵循度为硬性上限”的打分逻辑——若指令未被正确执行,哪怕画面画质极高也直接判定为不及格。团队实测对比多种 VLM 与人类标注的一致性后,采用高鲁棒性的 InternVL3.5-38B 对全体 300 万样本进行打分清洗,仅保留综合评分 \(\ge 3\) 的优质配对。

3. 多模态联合编码:MLLM 隐层提取高阶指令与时空关联表示

现有视频编辑架构大多直接复用文本编码器(如 umT5 或 CLIP),仅能提供字面浅层 token 表示,无法捕捉指令与视频空间区域、动作时态之间的深层对应关系。OpenVE-Edit 将原始视频关键帧与编辑文本指令同时输入轻量多模态大模型 Qwen2.5-VL-3B 中,使网络在 LLM 自注意力机制内部实现跨模态交互,深刻理解“要改哪里、怎么改、保持谁不变”。同时,为了剔除系统 Prompt 和模板前缀引入的冗余注意力干扰,设计了前缀 Token 过滤机制,仅提取直接对应编辑核心语义的文本隐状态向量,确保下游生成网络聚焦于有效编辑信号。

4. MoE-Connector 任务解耦:可学习 Query 驱动的稀疏专家专用表征路由

面对风格迁移、局部修改、主体增删等高度异质化的编辑目标,若采用共享单层线性投影层,不同任务梯度的互相干扰会导致参数容量瓶颈与负迁移。为此,模型在 MLLM 与 DiT 之间引入了 MoE-Connector。针对可变帧数和分辨率带来的动态 token 长度,首先设计长度为 512 的可学习解码查询向量(learnable decoder queries)\(Q_l \in \mathbb{R}^{b \times L_q \times D_h}\),通过交叉注意力对齐抽取核心特征。在 MoE-FFN 内部配置 6 个独立专家网络,利用门控网络为不同编辑样本动态路由并激活 Top-2 专家:

\[S = \text{topk}(\text{softmax}(W_g x), k), \quad \mathbf{y} = \sum_{i \in S} w_i \cdot \left( W_{i,2} \cdot \text{GELU}(W_{i,1} x + b_{i,1}) + b_{i,2} \right)\]

这种稀疏专化解耦保证了风格任务与时空物体形变任务各用其道,参数利用效率大幅提升。

5. 零初始化收敛加速:无损保留预训练先验的渐进式残差融合

从零随机初始化的 MoE 连接层在训练初期会向扩散主干注入完全随机的噪声表征,极易冲垮预训练 DiT 已经建构的稳定几何与时空分布,导致收敛缓慢甚至模式崩溃。受 ControlNet 机制启发,团队对 MoE-Connector 最终线性输出层 \(W_o\) 进行全零参数初始化(Zero-Initialization)。在初始训练步,连接层的输出严格为零,与原始冻结的 umT5 指令特征拼接后无缝进入 DiT 的交叉注意力层,使基础视频生成能力不受任何冲击。随着梯度反向传播,\(W_o\) 逐步平滑脱离零点,将 MLLM 提炼的高阶空间任务语义平稳注入 DiT,极大提升了训练稳定性并显著缩短了收敛周期。

损失函数 / 训练策略

基础骨干采用 Wan2.2-TI2V-5B 扩散 Transformer。训练分为两阶段进阶策略:第一阶段在 480P 分辨率下进行预训练,全局 Batch Size 为 512,学习率设为 \(1 \times 10^{-5}\),训练 1 个 epoch;第二阶段切换至 720P 高清分辨率进行微调,学习率降至 \(1 \times 10^{-6}\),训练 1 个 epoch。在数据生成侧,针对 Wan2.1-Fun-14B-Control 推理耗时过长问题(单卡 81 帧 720P 需 50 分钟),引入 SageAttention-2 并将去噪步数从 50 步压缩至 10 步,同时采用 4 步蒸馏的 Wan2.2-I2V-A14B-NFE4-V1,实现数据构建过程 8 倍极速推进(单视频仅需 6 分钟)。

实验关键数据

主实验

在涵盖 8 类任务共 431 对视频的统一基准 OpenVE-Bench 上,以高人类对齐度的 Seed1.6-VL 作为综合裁判进行评分(满分 5.0,涵盖指令遵循、一致性与画质稳定性),并辅助汇报 Gemini 2.5 Pro 总体评分以及时序频闪 TF、时序相似度 CLIP-F:

模型 参数量 分辨率 总体评分 (Seed1.6) 全局风格 (GS) 背景替换 (BC) 局部修改 (LC) 局部消除 (LR) 局部添加 (LA) 字幕编辑 (SE) 创意编辑 (CE) 运镜切换 (CME) Gemini 总体 TF CLIP-F
Runway Aleph (闭源) - 1280×720 3.50 3.47 2.84 3.88 3.88 2.79 3.50 3.23 4.48 3.65 0.9851 0.9659
VACE 14B 1280×720 1.17 1.41 1.16 1.43 1.00 1.05 1.02 1.13 1.16 1.57 0.9852 0.9685
OmniVideo 1.3B 640×352 1.02 1.02 1.00 1.00 1.00 1.00 1.16 1.00 1.00 1.31 0.9916 0.9785
InsViE 2B 720×480 1.40 2.25 1.23 1.60 1.00 1.23 1.22 1.68 1.02 1.53 0.9768 0.9739
AnyV2V* 3.7B 512×512 1.41 1.84 1.31 1.94 1.09 1.27 1.02 1.57 1.11 1.51 0.9614 0.9589
Señorita* 5B 800×448 1.90 2.29 1.47 2.69 1.93 1.64 2.49 1.91 1.02 1.93 0.9802 0.9658
Lucy-Edit 5B 1280×704 1.95 2.17 2.20 3.30 1.03 2.37 1.06 2.35 1.14 2.15 0.9836 0.9692
ICVE 13B 384×240 2.25 2.35 1.86 2.91 2.68 2.27 2.04 1.94 1.38 2.07 0.9877 0.9661
DITTO 14B 832×480 2.06 3.70 2.23 2.28 1.00 2.08 1.01 2.61 1.51 1.98 0.9848 0.9635
VideoCoF 14B 1280×704 2.24 1.07 1.33 3.52 3.26 2.67 2.57 1.64 1.05 2.24 0.9768 0.9651
OpenVE-Edit (本文) 5B 1280×704 2.41 3.11 2.72 3.19 1.42 2.41 2.56 2.01 1.24 2.49 0.9889 0.9698

消融实验

表 3 验证了核心模型组件设计(MLLM 与 MoE-Connector)以及训练数据来源对 OpenVE-Bench 总体性能的增益与决定性作用:

索引 MLLM 语义注入 MoE-Connector 训练数据集: Señorita-2M 训练数据集: OpenVE-3M 总体评分 (Overall) 说明
1 2.12 仅使用 umT5 文本特征的基础 DiT
2 2.31 引入 MLLM 特征(普通共享 MLP 映射,+0.19)
3 1.54 完整架构但迁移至 Señorita-2M 数据(骤降 -0.87)
4 2.41 完整模型:MLLM + MoE + OpenVE-3M(最优组合)

此外,表 4 验证了多种 VLM 评测器与人类专家评分(3人独立标注、组内相关系数 ICC=0.948)的对齐度:

评测裁判 (Judge) PLCC (皮尔逊相关系数) SROCC (斯皮尔曼等级相关) 说明
Seed1.6-VL 0.833 0.842 与人类评判对齐度最高,选为主评测模型
Gemini 2.5 Pro 0.731 0.756 商业模型中高度对齐,选为第二主裁判
InternVL3.5-38B 0.670 0.643 开源模型中性价比最优,用于 3M 数据的大规模过滤
Qwen3-VL-30B-A3B 0.583 0.555 相关性偏弱,仅供粗筛参考

关键发现

  • 数据质量是决定视频编辑上限的胜负手:消融实验显示,在相同 5B 完整模型配置下,使用低分噪声较多的 Señorita-2M 训练仅获得 1.54 分,而使用 OpenVE-3M 训练大幅跃升至 2.41 分(+56.5% 的相对提升)。这直接印证了数据过滤与长描述指令的决定性价值。
  • MLLM 与 MoE 双轮驱动消除语义断层:单一依赖 T5 编码器会导致指令理解偏差,引入 MLLM 带来了 0.19 分的显著飞跃;随后引入稀疏激活的 MoE-Connector 进一步将分数推高 0.10 分,定性实验证明 MoE 成功遏制了不同编辑模式下的特征冲突。
  • 控制信号与生成加速选型:在数据生成阶段,Canny 边缘在动态画面下的保真度显著优于 Depth 深度图(避免了深度静止导致的背景死板),结合 SageAttention-2 与 10 步去噪将单样本生成提速 8 倍,使得 10,000 GPU-days 的算力预算得以落地。

亮点与洞察

  • 任务分类解耦与逆向合成工程:针对难以直接合成的视频“添加”与“消除”任务,通过“视频物体擦除反作添加源”与“贴图合成反作消除源”的构思逆向破题,极大扩充了细粒度编辑的真实数据空间。
  • 指令遵循度单向封顶评测原则:在评测中强制规定“指令遵循得分为画质和保真度的数值上限”,有效防范了以往评测中“模型什么都没改、单纯复制原视频却因画质极佳而获高分”的评测虚标漏洞。
  • 可迁移的轻量级零初始化适配层:将 ControlNet 的 Zero-Conv 逻辑外推至多模态 MoE 序列连接层,为大模型注入新感知模态提供了平滑收敛、无损预训练权重的通用范式。

局限与展望

  • 作者承认的局限:数据集中尚未涵盖基于参考图像的特定风格/主体迁移(Reference-based Editing);受制于计算资源,仅验证了 5B 规模的模型架构,更大参数量级的 Scaling Law 尚待挖掘。
  • 自行发现的局限:在局部消除(LR)与镜头运镜切换(CME)等高难度时空重构任务上,当前模型的绝对得分仍处于较低区间(1.42 与 1.24 分),反映出时空非对齐编辑依然是生成式视频领域的开放难题。
  • 改进思路:探索在 Token 维度沿隐空间直接进行动态噪声拼接的统一表征方案,并探索将视频理解、自回归时序规划与扩散生成深度统一的“万能”视频大模型。

相关工作与启发

  • vs InsViE-1M / Señorita-2M: 后者不仅规模受限在 1-2M,且指令平均仅 3-4 词,存在大量指令不遵循与闪烁样本;OpenVE-3M 拥有 300 万高质配对,平均指令长达 40.6 词,覆盖 8 种细化类别并建立强过滤机制。
  • vs DITTO / ICVE: DITTO 重度倾斜于风格迁移,泛化能力偏弱;ICVE 依赖 13B 庞大参数且在长视频时常面临显存溢出;OpenVE-Edit 仅以 5B 参数便在 8 类全能编辑上斩获开源最高分,展现出极高的架构与数据效率。

评分

  • 新颖性: ⭐⭐⭐⭐☆ 提出了首个涵盖空间与非空间对齐的 300 万高质量指令视频编辑数据集与 MoE 解耦适配架构。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 10 多种主流 baseline 对比、端到端消融、人类一致性相关性验证与多模态定性分析。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑结构严谨清晰,系统架构与数据构建管线阐述透彻。
  • 价值: ⭐⭐⭐⭐⭐ 补齐了视频指令编辑在高质量开源数据与人类对齐评测基准上的长期空白,实用与参考价值极高。