跳转至

Direct Autoregressive Diffusion Distillation via Error-aware Causal Pretraining

会议: ECCV 2026
论文: ECCV 原文
领域: 视频生成
关键词: 自回归视频扩散, 扩散模型蒸馏, Error Forcing, 因果预训练, 暴露偏差

一句话总结

针对自回归视频扩散模型在蒸馏过程中因结构不对齐导致的训练崩溃与高昂轨迹拟合开销,本文提出了误差感知因果预训练(Error Forcing),通过向历史上下文注入模拟残差误差以消除暴露偏差并实现高效并行训练,使因果学生模型能够彻底绕过传统的 ODE 轨迹拟合阶段,直接进行高质量的少步分布匹配蒸馏。

研究背景与动机

世界模型模拟与高交互性实时内容创作对低延迟自回归(Autoregressive, AR)视频扩散模型提出了迫切需求。与常规的全序列双向视频扩散模型不同,自回归模型需要严格依赖历史帧信息逐帧预测未来,同时在推理时保持单步极低的计算延迟。为了兼顾生成质量与推理速度,当前主流方案通常将高质量的预训练双向基础模型(如 Wan2.1)蒸馏为仅需数步采样的因果学生模型。然而,直接将双向模型权重迁移至因果架构上往往会导致蒸馏严重失稳甚至崩溃,其根源在于自回归因果约束与双向注意力之间的内在结构鸿沟破坏了流映射的单射性。

为稳定蒸馏过程,已有方案(如 CausVid、Self Forcing、Causal Forcing 等)不得不引入一个繁琐的中间阶段——常微分方程(ODE)轨迹拟合,强制因果学生去逐点拟合多步教师的采样轨迹。然而,在大规模训练中模拟和缓存高保真 ODE 轨迹带来了难以承受的计算开销;更致命的是,跨架构的强制轨迹拟合极易破坏帧级单射条件,进而沿自回归链条引入严重的累积误差。另一方面,经典的自回归预训练范式(如 Teacher Forcing 依赖完美真值历史,Diffusion Forcing 依赖高斯噪声历史)与实际自回归推断时面临的“带有预测瑕疵但仍处在真实流形附近”的退化上下文存在显著的分布差距(暴露偏差),而通过串行展开来缓解偏差的 Self Forcing 又丧失了全帧并行训练的高吞吐特性。

本文的核心洞察在于:蒸馏崩溃的本质是因果架构对齐与少步快速采样适配两个优化目标的相互纠缠。如果能在蒸馏前为模型赋予稳健的因果先验与抗误差累积能力,即可将二者彻底解耦。核心 idea:提出 Error Forcing 因果预训练框架,通过在全并行预训练中向历史上下文注入经验预测残差来模拟真实推理时的累积误差分布,由此构建鲁棒的因果初始化模型,彻底跳过高开销的 ODE 轨迹拟合阶段,直接进行少步分布匹配蒸馏(DMD)。

方法详解

整体框架

本文方法的完整流水线分为两个阶段:阶段一为误差感知因果预训练(Error Forcing),阶段二为从因果初始化出发的直接少步蒸馏(Direct DMD)。在阶段一中,基础双向扩散模型被改造为因果注意力架构,训练过程中通过误差收集机制在 FIFO 队列中维护模型近期生成的真实残差分布,并将缩放后的结构化残差注入到历史上下文中;这使得因果模型在保持全序列并行训练高吞吐的同时,学会从带有累积误差的上下文中鲁棒地预测未来帧。在阶段二中,利用该因果预训练权重直接初始化自回归学生模型,无需经过任何 ODE 轨迹匹配阶段,直接利用多步教师和判别器展开自回归滚动(self-rollout)并执行分布匹配蒸馏(DMD)。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["双向视频基础模型权重<br/>Wan2.1-T2V-1.3B"] --> B["残差误差收集与经验分布构建<br/>前向输出转x0预测并提取残差δ"]
    B --> C["上下文误差注入与因果预训练<br/>向历史上下文注入经验残差扰动"]
    C --> D["稳健因果模型初始化<br/>对齐因果结构且具备抗漂移能力"]
    D --> E["因果初始化直接少步蒸馏<br/>完全绕过ODE轨迹拟合直接DMD"]
    E --> F["4步实时自回归视频生成模型"]

关键设计

1. 残差误差收集与经验分布构建:从实际预测中捕获结构化残差

传统自回归训练为了缓解暴露偏差,常尝试注入各向同性高斯噪声,但这与真实推断中的误差形态完全脱节——自回归滚动中产生的误差往往表现为局部运动模糊、边缘伪影或语义时序漂移等高度结构化的特征。为了构建贴近真实推理场景的历史分布,本文设计了一个在线残差收集机制。在因果预训练的前向计算中,模型根据当前流匹配速度预测直接推导对应的清晰帧估计 \(\hat{x}^i\)(即流映射所隐含的 \(x_0\) 预测)。随后计算预测估计与真实帧 \(x^i\) 之间的残差项: $$ \delta^i = \hat{x}^i - x^i $$ 将所有帧残差存入一个容量为 \(V\)(实验中设为 3,000)的先进先出(FIFO)队列 \(\mathcal{B}\) 中,构建经验误差分布 \(\mathcal{D}_{\text{err}} \approx \text{Uniform}(\mathcal{B})\)。使用 FIFO 队列确保了采样的残差能够动态跟踪模型在当前训练阶段的真实预测误差特性,避免了早期大误差对后期训练的持续污染。

2. 上下文误差注入与因果预训练:在保持并行训练吞吐下消除暴露偏差

在获得经验误差分布 \(\mathcal{D}_{\text{err}}\) 后,需要将其作为扰动引入训练以逼近推理时的历史分布,同时不能破坏 Transformer 因果自注意力的并行计算能力。本文在每个训练迭代中从 \(\mathcal{D}_{\text{err}}\) 采样残差 \(\delta^{1:N}\),并对真实视频上下文进行缩放扰动: $$ \tilde{x}^i = x^i + \gamma \delta^i $$ 其中 \(\gamma\) 为从集合 \(\{0, 0.1, 1\}\) 中随机采样的强度因子。因果流匹配模型在预测第 \(i\) 帧的速度场时,条件输入不再是完美的真值历史 \(x^{<i}\),而是被扰动后的带噪上下文 \(\tilde{x}^{<i}\)。这一设计巧妙地让模型学会从“轻微退化但保持语义连贯”的上下文中恢复目标帧,有效拟合条件分布 \(p(x_t^i \mid \tilde{x}^{<i}) \approx p(x_t^i \mid \hat{x}^{<i})\)。由于扰动仅通过在真值序列上叠加预先采样的张量实现,整个时序序列的所有帧仍可通过因果注意力掩码在一次前向反向中全并行计算,完全保留了类似 Teacher Forcing 的极高训练吞吐。为了防止训练初期模型粗糙预测导致的误差崩塌,前 \(T_{\text{warm}}\) 步(如 500 步)作为预热阶段,仅收集残差而不注入扰动。

3. 因果初始化直接少步蒸馏:解耦因果对齐与少步适配以绕过 ODE 轨迹拟合

在获得经过 Error Forcing 预训练的因果权重后,学生模型已经天然适应了因果自注意力机制与推断误差环境。此时,直接将因果权重作为学生模型的初始化,可以彻底跳过耗费数百 GPU 小时且容易累积单射违背误差的 ODE 轨迹拟合步骤。在少步(如 4 步)蒸馏阶段,学生模型在自展开(self-rollout)序列上通过 DMD 目标与真实/伪分值估计进行对齐。针对分值估计的条件上下文设计,本文探索了两种结构:一种是采用更庞大的外部双向教师(如 Wan2.1-14B)提供全局上下文打分;另一种是创新提出的“内部 DMD(Internal DMD)”,即让教师和判别器均复用与因果学生相同的架构与因果预训练权重,直接在学生自生成的历史 \(\hat{x}^{<i}\) 下计算分值梯度: $$ \nabla_\phi \mathcal{L}{\text{DMD}} \approx -\mathbb{E} \right] $$ 其中在 Internal DMD 下 }^i} \left[ \left( s_T(x_t^i \mid c_T^i, t) - s_F(x_t^i \mid c_S^i, t) \right) \frac{\partial x_t^i}{\partial \phi\(c_T^i = c_S^i = \hat{x}^{<i}\)。这保证了在蒸馏计算梯度时,学生、教师和判别器处于完全一致的历史上下文分布下,消除了雅可比矩阵漂移引入的梯度偏差。

损失函数 / 训练策略

在预训练阶段,模型遵循 Flow Matching 优化目标,通过最小化均方误差学习速度场向量 \(v = \epsilon^i - x^i\): $$ \mathcal{L}{\text{EF}} = \frac{1}{N} \sum}^N \mathbb{E{x, t, \epsilon, \delta} \left[ \left| (\epsilon^i - x^i) - v\theta(x_t^i, t \mid \tilde{x}^{<i}) \right|_2^2 \right] $$ 其中时间步 \(t \sim \text{LogitNormal}(0, 1)\),加噪插值为 \(x_t^i = (1-t) \tilde{x}^i + t \epsilon^i\)。在反向传播完成后,在无梯度模式下通过一步欧拉积分估计生成帧 \(\hat{x}^{1:N}\) 并将新残差存入 \(\mathcal{B}\)。在蒸馏阶段,学生模型以 4 步采样生成视频并应用 DMD 分布匹配损失进行端到端微调。

实验关键数据

主实验

主实验在 Wan2.1-T2V-1.3B 基础模型上进行微调与蒸馏,视频序列统一为 81 帧、分辨率 832×480。在标准 VBench 测试集以及更具挑战性的 TA-Hard 测试集上,与当前主流的双向模型、自回归模型及蒸馏自回归模型进行了全面量化评测。

模型 参数量 VBench 总分 ↑ VBench 质量 ↑ VBench 语义 ↑ VisionReward 总分 ↑ Detail 质量 ↑ Motion 真实度 ↑ Text 对齐度 ↑
Wan2.1 (双向基线) 1.3B 75.53 73.86 67.17 3.94 12.26 -40.49 39.18
SkyReels-V2 1.3B 78.48 81.37 66.93 7.71 29.32 -31.87 47.57
MAGI-1 4.5B 78.15 80.50 68.77 7.18 28.40 -40.43 49.47
CausVid 1.3B 79.12 81.91 68.00 10.33 40.10 -24.47 56.73
Self Forcing 1.3B 80.79 83.38 70.46 11.33 41.86 -10.20 64.76
Longlive 1.3B 80.25 82.94 69.48 11.35 42.71 -18.71 64.27
Causal Forcing 1.3B 80.52 83.11 70.15 10.74 41.01 -6.50 62.79
Ours (EF + DMD) 1.3B 81.35 83.92 71.03 12.00 45.74 -6.98 64.83

在极具语义复杂度的 TA-Hard 难例评测集上,本文模型展现出显著优势:

模型 VBench 总分 ↑ VBench 质量 ↑ VBench 语义 ↑ VisionReward 总分 ↑ Detail 质量 ↑ Motion 真实度 ↑ Text 对齐度 ↑
Wan2.1 64.45 75.62 19.78 -6.96 -1.85 -86.81 -31.48
CausVid 63.09 74.84 16.09 1.20 33.33 -79.17 12.96
Self Forcing 67.69 78.98 22.56 1.43 31.48 -79.86 21.30
Causal Forcing 69.42 81.03 22.99 0.77 27.78 -81.94 24.07
Ours (EF + DMD) 71.22 80.96 32.24 2.70 34.26 -69.44 21.30

消融实验

1. 预训练与蒸馏各阶段范式对比

对比 Teacher Forcing (TF)、Diffusion Forcing (DF) 与 Error Forcing (EF) 在 50 步多步生成与 4 步少步蒸馏下的表现:

训练范式 采样步数 VBench 质量分 ↑ VBench 语义分 ↑ VBench 总分 ↑ 说明
Diffusion Forcing (DF) 50 步 80.98 67.16 78.22 多噪声级训练,多步下产生过度平滑纹理
Teacher Forcing (TF) 50 步 81.34 68.19 79.15 完美真值上下文,推断时存在累积漂移
Error Forcing (EF) 50 步 81.89 68.95 79.64 注入真实残差,多步阶段质量最高
DF + DMD 4 步 83.13 68.39 80.19 基于 DF 因果初始化的 4 步蒸馏
TF + DMD 4 步 83.37 70.34 80.77 基于 TF 因果初始化的 4 步蒸馏
EF + DMD (本文) 4 步 83.92 71.03 81.35 完整模型:质量与语义均达最优

2. 误差注入机制与超参数消融

消融维度 具体配置 质量分 ↑ 语义分 ↑ 总分 ↑ 说明
存储粒度 Frame-wise 81.89 68.95 79.64 逐帧存储与采样残差,细粒度适配最优
Chunk-wise 81.31 68.92 79.08 按 3 帧 chunk 存储残差
Window-wise 80.19 66.15 77.38 按 21 帧窗口存储,误差分布过于粗糙
采样策略 Timestep-aware 81.48 69.05 79.32 记录对应时间步 \(t\) 进行同时间步匹配采样
Random 81.89 68.95 79.64 从缓冲队列中完全随机均匀采样,多样性更强
注入区域 Context only 79.91 67.15 77.36 仅在历史上下文注入残差
Context + Target (独立误差) 80.49 61.45 77.40 上下文与目标分别注入独立采样的残差
Context + Target (共享误差) 81.89 68.95 79.64 上下文与目标共享同一连续残差序列,保持时序自洽

3. 不同初始化对直接蒸馏稳定性的影响

初始化来源 蒸馏前少步表现 (总分) 蒸馏后 4 步表现 (总分) 训练稳定性与现象
双向预训练 (Bidirectional Init) 55.37 76.25 直接进行 DMD 极不稳定,容易训练崩溃
双向预训练 + ODE 轨迹蒸馏 61.36 80.79 需先耗费昂贵算力拟合 ODE 轨迹方能稳定
误差感知因果预训练 (EF Init) 54.14 81.35 无需 ODE 轨迹拟合,直接 DMD 即可完全稳定收敛
因果预训练 + Causal ODE 蒸馏 75.38 80.99 引入 ODE 拟合反而带来视觉伪影并限制天花板
因果预训练 + Internal DMD 78.70 81.49 纯因果自蒸馏,性能略有提升但需额外训练代价

关键发现

  • 直接蒸馏的可行性核心取决于因果权重的抗漂移鲁棒性:若使用原始双向模型直接进行 DMD 蒸馏,训练将面临严重失稳甚至崩溃(VBench 总分仅 76.25 且伪影严重)。而经 Error Forcing 预训练得到的因果权重,在无需任何 ODE 拟合的情况下直接运行 DMD,即可取得 81.35 的最高总分,超越了额外耗费巨资拟合 ODE 轨迹的方法。
  • 共享误差注入与逐帧粒度的重要性:消融表明,在历史上下文与当前目标帧同时注入来源于同一连续片段的“共享误差”(shared error),效果显著优于仅向上下文注入(总分 79.64 vs 77.36)。这表明保持帧间误差在时序物理上的连贯性,对消除流形漂移起到了关键约束作用。
  • 难例语义对齐能力大幅跃升:在 TA-Hard 数据集上,本文方法在 VBench 语义分数上达到了 32.24,较此前最强的 Causal Forcing(22.99)与 Self Forcing(22.56)提升超过 40%,充分证明了鲁棒因果上下文对抑制长时间长序列语义漂移的巨大价值。

亮点与洞察

  • 解耦结构对齐与少步压缩的优雅设计:跳出以往“双向模型 → ODE 轨迹拟合强行对齐 → DMD 微调”的惯性思维,明确指出 ODE 拟合是计算瓶颈且易破坏单射性;通过前置的 Error Forcing 预训练,以全并行吞吐获得了可以直接执行 DMD 的因果学生。
  • 真实残差替代高斯噪声的有效启发:利用模型自身早期推理产生的残差构建经验误差池,既保证了扰动位于数据流形附近,又精准刻画了运动不连贯和模糊等非高斯退化,这为扩散模型的暴露偏差治理提供了普适的即插即用方案。
  • Internal DMD 的纯因果自蒸馏潜力:探索了学生、教师和判别器共享同构因果权重的蒸馏体系,彻底排除了双向模型与因果模型在打分时的条件不对称,为未来全自回归基础模型的自迭代对齐铺平了道路。

局限与展望

  • 作者承认的局限:在极端复杂的长镜头长程自回归推演中,当累积误差严重超出预训练注入强度 \(\gamma\) 的覆盖包络时,视频画面仍可能逐渐失去细粒度几何一致性。
  • 潜在改进方向:当前误差池的采样与注入强度 \(\gamma \in \{0, 0.1, 1\}\) 为离散超参数,未来可探索自适应调度策略,根据自回归展开步数动态调整误差注入尺度;此外,可将 Error Forcing 拓展至端到端交互式世界模型中,结合动作条件进行闭环鲁棒预训练。

相关工作与启发

  • vs CausVid / Self Forcing: CausVid 依赖耗时的 ODE 轨迹拟合来跨越双向到因果的架构鸿沟;Self Forcing 则使用自推断展开(self-rollout)训练,丧失了并行训练吞吐。本文通过 Error Forcing 在真值上叠加残差,兼具并行训练高吞吐与端到端暴露偏差免疫,且完全剔除了 ODE 阶段。
  • vs Causal Forcing: Causal Forcing 提出了因果 ODE 蒸馏,但仍需要昂贵的 native AR 教师采样和轨迹存储。本文证明了在具备误差感知的因果初始化后,ODE 轨迹阶段是冗余的,直接进行分布匹配蒸馏能够获得更优画质与更低开销。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 巧妙提出用经验预测残差解决自回归扩散暴露偏差,并成功解耦因果预训练与少步蒸馏以跳过 ODE 轨迹拟合。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 50 步多步与 4 步少步、标准与 TA-Hard 双基准、粒度/区域/采样三维全面消融,对比详尽。
  • 写作质量: ⭐⭐⭐⭐⭐ 动机阐述清晰深刻,数学推导与实验分析紧密呼应,逻辑链条严密。
  • 价值: ⭐⭐⭐⭐⭐ 大幅降低了自回归实时视频扩散模型的训练成本并刷新了 SOTA,对实时视频生成和世界模型研发具有重要工业参考价值。