跳转至

Breaking the Uniformity Trap: Scaling Video Diffusion Model via SplitMoE

会议: NeurIPS 2026 Spotlight
arXiv: 2609.38140
论文: 项目页
领域: 视频生成
关键词: 视频扩散模型、混合专家、语义路由、原型引导、稀疏扩展

一句话总结

SplitMoE 将视频扩散 Transformer 的稀疏专家分成语义与通用两组,用干净 VAE 特征引导语义路由,在总参数 27B、激活参数 14B 的预算下改善同源基线的视频质量,而非让所有专家强行承担等量 token。

研究背景与动机

视频生成需要同时维持对象形状、跨帧运动和局部纹理,单纯扩大 DiT 的前馈网络会增加每一步去噪的计算成本。混合专家(Mixture-of-Experts,MoE)用少量激活专家调用更大的总容量,但常见做法沿用语言模型的逐 token 路由,并通过负载均衡让专家接收近似等量的 token。视频中的 token 分布却高度不均匀:天空、墙面等背景可以占据大量空间,相邻人体或物体 patch 又具有强相关性。专家使用率看起来均匀,不代表模型学到了不同的视觉职责。

本文关注的“均匀性陷阱”是这种统计目标与视频结构的冲突。同一物体可能为了满足容量或均衡约束而被拆给不同专家,相似区域在相邻帧里还可能切换专家,形成空间条带、语义碎裂和时间抖动。作者用分割掩码分析区域内部的专家一致性及不同类别的专家区分度,并结合路由图展示这一问题。不过,这些分析支持的是标准路由存在结构失配,不等于证明所有视频 MoE 都必须放弃负载控制。

直接取消所有均衡也不稳妥,因为冗余背景仍可能吸引大部分容量。本文把问题改成:哪些专家应该随自然语义分布形成非均匀专长,哪些专家仍应负责分散通用重建工作?核心 idea:让语义专家在 VAE 原型的引导下保持区域一致性,让通用专家承接视觉残差并保留负载控制,避免在一个同质专家池里同时要求语义聚类和均匀分流。

方法详解

整体框架

模型接收文本条件、当前带噪视频潜变量及扩散时间步,输出供流匹配去噪使用的预测。SplitMoE 从 Wan 2.2 的低噪声 checkpoint 扩展而来,只替换第 15–35 层之间的偶数层 FFN,其他组件保持不变;每个稀疏层保留一个始终激活的共享专家,并配置 100 个路由专家。

推理时,同一个 DiT token 分别选取语义专家和通用专家,两组的加权输出共同参与生成。训练时另有一条教师路径:干净视频的 VAE 特征与可学习原型形成软分配,监督带噪 DiT token 的语义路由;原型再通过当前与历史 VAE 特征的吸引、原型之间的排斥得到优化。干净 VAE 特征不是推理时需要额外提供的真实视频输入。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["文本、时间步<br/>带噪视频 token"] --> B["双角色专家划分"]
    B --> C["原型引导语义路由"]
    T["干净 VAE 特征<br/>仅训练教师"] -.->|软目标监督| C
    T -.-> D["原型吸引与排斥"]
    D -.->|更新教师原型| C
    C --> E["分组负载控制"]
    E --> F["专家输出聚合<br/>流预测与迭代去噪"]

实线表示生成路径,虚线表示仅训练时的监督或参数更新。原型吸引与排斥不构成每次推理必须经过的额外网络阶段,共享专家也不属于下面的 Top-8 路由名额。

关键设计

1. 双角色专家划分:固定激活名额,但不强迫两类视觉信息共用一个池

100 个路由专家分为 20 个语义专家和 80 个通用专家,每个 token 固定激活 2 个语义专家与 6 个通用专家。语义组负责对象、布局等高层结构,通用组保留处理局部外观和视觉残差的容量。这些是由路由监督鼓励形成的功能角色,不是先把视频严格分解成低频和高频信号,也不是把前景 token 只送语义组、背景 token 只送通用组:每个 token 都会进入两组。

路由器先用线性投影和 GELU 处理 token,再用归一化特征与专家向量的余弦相似度产生 logit,经独立 sigmoid 得到亲和分数。独立 sigmoid 避免一个全局 softmax 让两组专家互相争抢概率质量,因此同一 token 可以同时适合结构专家与纹理专家。随后在两组内部各自选 Top-K,并用未加偏置的原始分数分别归一化输出权重,再将两组贡献相加。组内归一化不同于在全部 8 个入选专家上做一次统一归一化。

固定 \(K_s=2\)、\(K_g=6\) 和 \(K=K_s+K_g=8\) 约束的是激活专家数量。实际专家宽度还被调整为与密集基线相同的激活中间维度,因此 27B 总参数中每次前向激活 14B。它扩大的是可调用容量,而不是宣称拥有 27B 密集模型的逐 token 计算量;共享专家继续保留通用的预训练能力。

2. 原型引导语义路由:把重建空间的视觉相似性变成带噪 token 的路由监督

仅划分专家组仍不能保证“语义专家”真的承担语义职责。作者为 20 个语义专家各配一个可学习原型,原型位于干净 VAE 特征空间中。训练时,把每个视频 token 对应的干净 VAE 特征与全部原型比较,经过温度缩放的余弦相似度得到教师软分配;DiT 路由器则从当前带噪 token 预测语义分布。两者通过 KL 散度对齐:

\[ \mathcal{L}_{\rm align}=\frac{1}{N}\sum_{i=1}^{N}\operatorname{KL}(\mathbf{q}_i\,\|\,\mathbf{r}_i). \]

其中 \(N\) 是 token 数,\(\mathbf{q}_i\) 是 VAE 特征与原型产生的教师分配,\(\mathbf{r}_i\) 是路由器的语义预测。教师目标停止梯度,避免路由器为了降低 KL 损失反过来挪动教师原型;原型由自己的目标优化。这使语义一致性来自相对稳定的干净视觉特征,而不是仅依赖不断变化的带噪 DiT 特征自行聚类。

VAE 本来就是潜空间视频生成的一部分,因此该教师不需要额外引入外部表示模型。但 VAE 特征是重建型表示,原型也不是人工语义类别:一个原型可能覆盖相近外观或结构模式,不能把“每个语义专家”解释成一个固定的、可命名的物体类别。推理时路由器直接根据 DiT token 工作,不查询干净目标视频。

3. 原型吸引与排斥:既避免背景扎堆,也避免多样性把原型推离数据

如果只让原型靠近数据,重复背景可能吸引很多原型形成冗余中心;如果只要求原型彼此远离,它们又可能落到没有真实 token 的位置,产生闲置专家。本文的 pull 同时利用当前 mini-batch 和循环 token bank 保存的近期历史 VAE 特征:前者推动原型覆盖当前样本,后者让每个原型靠近历史中存在的视觉模式,降低罕见模式在小 batch 中消失的影响。

push 则对余弦相似度超过间隔 \(\delta\) 的原型对施加排斥,防止多个中心重叠。二者组成 \(\mathcal{L}_{\rm proto}\),其目标不是把 token 数量调成均匀,而是在视觉特征流形上维持有数据支撑、又不完全重复的中心。原文的原型目标包含当前特征的平滑覆盖项、历史 bank 的最近相似特征项和带间隔的成对排斥项;这里保留机制解释,不把复杂目标简化成另一个未经验证的精确公式。

4. 分组负载控制:把使用率约束留给通用组,而不是破坏语义组的一致性

语义组不施加显式负载均衡,让常见与罕见视觉模式自然形成不同使用率;原型监督和吸引排斥负责缓解坍缩。通用组采用参考 DeepSeek-V3 的无辅助损失负载控制,以非梯度偏置影响离散专家选择。偏置只改变哪些专家入选,不进入最终混合权重;选中的专家仍按原始亲和分数加权,避免把负载修正误当成 token 对专家的真实匹配程度。

这种设计不是“完全不要均衡”,而是把均衡限制在承担通用重建容量的组内。固定 2+6 的激活名额也意味着粗到细生成并非动态把更多 Top-K 名额转给语义组。论文另外观察到语义路由权重随时间步变化,但它是路由行为分析,不是显式时间步门控规则;方法中的组内归一化公式本身不能直接当作两分支总输出能量比例。

一个完整示例

设生成片段包含一匹马从静止转为奔跑。对同一物体上相邻的两个 token,标准均衡路由可能为了分散负载选出不同专家,跨帧还可能改变选择。SplitMoE 的训练教师先利用这两个位置的干净 VAE 特征给出相近的原型软目标,让路由器学习在带噪状态下保持相近的语义分配,同时让通用组处理毛发、背景和局部外观差异。

每个 token 仍调用 20 个语义候选中的 2 个、80 个通用候选中的 6 个,另有始终激活的共享专家。测试时没有真实马视频作为教师,模型从当前潜变量预测路由并迭代去噪。这个示例解释模块协作,不代表所有马 token 必须命中同一个专家,也不额外赋予模型分割掩码输入。

损失函数 / 训练策略

总训练目标为:

\[ \mathcal{L}=\mathcal{L}_{\rm flow}+\lambda_{\rm align}\mathcal{L}_{\rm align}+\lambda_{\rm proto}\mathcal{L}_{\rm proto}. \]

\(\mathcal{L}_{\rm flow}\) 是流匹配损失,\(\lambda_{\rm align}\) 与 \(\lambda_{\rm proto}\) 控制两个训练辅助目标的强度。通用组负载控制不增加辅助优化损失,只更新非梯度选择偏置。路由专家从密集 FFN 初始化,保留原有生成先验;同源模型均训练 80k 步,共用低噪声起点、训练数据和推理设置。

缓存正文没有列出可复现的训练数据规模、两个损失权重数值和全部优化超参数,也没有独立附录段落,因而不能从当前材料补写这些配置。验证损失曲线支持的是训练步数上的更快收敛;作者报告约用 70% 的步数达到可比损失,不应把它改写为整个训练任务节省 30% 墙钟时间。

实验关键数据

主实验

VBench-2.0 分别评估创造力、常识、可控性、人体保真和物理性;T2V-CompBench 分别评估一致属性、交互和数量。下表保留原文百分数,全部指标越高越好;视频均为 81 帧,但独立模型沿用各自默认推理设置,部分基线分数来自既有论文或 benchmark。

模型 创造力 常识 可控性 人体保真 物理性 一致属性 交互 数量
官方 Wan2.2 58.35% 62.45% 48.73% 75.33% 69.07% 83.19% 73.29% 16.96%
LongCat-Video 54.73% 70.94% 44.79% 80.20% 59.92% 73.38% 61.76% 47.87%
LTX-2 50.39% 67.09% 38.09% 73.69% 76.71% 69.93% 47.98% 25.83%
Full SplitMoE 58.46% 64.89% 45.72% 84.47% 69.41% 84.63% 69.98% 44.01%

相对官方 Wan2.2,人体保真提高 9.14 个百分点,但可控性低 3.01 个百分点、交互低 3.31 个百分点。SplitMoE 也没有超过 LongCat-Video 的常识与数量、LTX-2 的物理性,不能把结果概括为所有维度的 SOTA。

官方 Wan2.2 使用高噪声与低噪声双模型 ensemble,而本文同源密集微调及 MoE 改造均从低噪声 checkpoint 出发。上表用于描述系统能力,不能把与官方模型的差异全部归因于 SplitMoE 路由;下面的同源消融才更接近架构贡献比较。

消融实验

下表选取同源实验中最能体现结构、外观与组合能力的四个维度;所有模型均采用相同 80k 步训练设置,MoE 模型激活参数为 14B。

配置 人体保真 物理性 一致属性 数量
Dense Wan2.2-FT 73.08% 54.66% 77.51% 36.71%
Wan2.2-MoE 73.49% 63.32% 78.82% 38.55%
SplitMoE w/o PG 74.04% 55.89% 78.46% 38.57%
SplitMoE w/o Push 73.60% 56.44% 77.29% 37.15%
SplitMoE w/o Pull 73.81% 56.83% 78.14% 38.32%
Full SplitMoE 84.47% 69.41% 84.63% 44.01%

w/o PG 保留 20/80 分组与双轨路由,但去掉 VAE 教师、原型及两个辅助目标,不能理解为只删除某一个 KL 项。相比标准 MoE,完整模型人体保真提高 10.98 个百分点、物理性提高 6.09 个百分点;相比仅分组的 w/o PG,物理性提高 13.52 个百分点,说明命名分工并不足以产生有效专长。

计算成本来自原文 Table 2,单位为秒/迭代,而不是一段视频的总生成时间:

配置 总参数 激活参数 训练秒/迭代 推理秒/迭代
Full SplitMoE 27B 14B 6.84 6.08
标准 MoE 27B 14B 6.69 6.12
密集模型 14B 14B 5.66 5.76

SplitMoE 的训练迭代比密集模型慢约 20.85%,比标准 MoE 慢约 2.24%;推理迭代比密集模型慢约 5.56%。因此“相同激活预算”不等于相同延迟,更不意味着稀疏模型训练迭代本身更快。

关键发现

  • 完整模型在同源 Table 1 的八个维度均超过密集微调、标准 MoE 与所列消融,但这一结论不应外推到独立模型的全部维度。
  • 吸引与排斥需要配套。去掉 push 后原型容易聚集在主导背景区域;去掉 pull 后原型可能远离真实特征流形。两种变体的物理性均低于标准 MoE 的 63.32%,辅助先验不完整时反而可能造成损害。
  • 作者在 50 步去噪轨迹上观察到语义权重于第 10–15 步附近达到峰值、之后下降,支持粗到细的职责变化。当前缓存没有给出该诊断权重的完整计算定义,不将其解释为固定 2+6 激活名额发生变化。

亮点与洞察

  • 将“需要均衡”从全局规则改为角色相关规则,是比简单放大专家池更重要的改动。语义组容许自然长尾,通用组仍控制使用率,避免把反均匀误读成反负载管理。
  • 教师就在生成模型已有的 VAE 空间中,不额外依赖大型外部视觉编码器。停止梯度和独立原型优化让“学习路由”与“建立教师中心”分离,降低相互追逐造成的不稳定。
  • Pull/push 针对的是两个相反失败模式,而不是重复正则。消融显示仅保留一个方向不能稳定受益,这比只展示完整模型更能说明语义先验需要数据支撑和防坍缩同时成立。

局限与展望

  • 作者承认依赖冻结视觉特征及稀疏路由开销。VAE 原型的视觉相似性并不保证覆盖动作因果、物理属性等高层语义,跨域数据上是否仍可靠尚需验证。
  • 当前设置固定 20/80 专家划分和 2+6 激活名额,没有给出比例扫描或跨模型规模的完整扩展规律。不能仅凭 27B 总参数这一点推断更大视频模型也会持续获得同等增益。
  • 现有结果主要是 81 帧文本到视频与基准评测,没有证明长视频、交互世界模型或其他生成任务上的有效性;也缺少多随机种子误差范围及端到端分布式吞吐证据。
  • 可研究按噪声阶段自适应分配激活名额,但需同时控制延迟、通用组负载和稀有语义专家覆盖,不能只依据权重曲线宣称动态分配一定更好。

相关工作与启发

  • vs Wan2.2:官方模型用高/低噪声模型进行粗粒度阶段分工;本文在低噪声来源模型内部做逐 token 的语义/通用分工。两种拆分发生在不同层次,不能直接混为同一 MoE 策略。
  • vs ProMoE:二者都使用原型,但本文把干净 VAE 表示与 DiT 路由预测连接起来,并针对视频语义与视觉残差拆分专家,而不只是条件类型分离或 DiT 空间中的直接原型匹配。
  • vs DeepSeek-V3:本文借用无辅助损失的负载控制,却只将它用于通用专家。可迁移的启发是区分“系统容量利用”与“任务结构一致性”,而不是原样照搬语言模型路由约束。

评分

  • 新颖性: 4/5,角色拆分与 VAE 原型监督形成针对视频结构的明确组合,核心部件本身已有先例。
  • 实验充分度: 4/5,同源消融、双基准与路由分析较完整,但缺少比例扫描、误差范围和更广任务验证。
  • 写作质量: 4/5,失败模式与模块设计对应清楚,时间步权重诊断和部分复现细节仍需更明确说明。
  • 价值: 4/5,为视频稀疏扩展提供具体可检验的路由方案,实际收益仍需连同显存、延迟与分布式成本评估。