DC-Gen: Post-Training Diffusion Acceleration with Deeply Compressed Latent Space¶
会议: ECCV2026
Paper: https://eccv.ecva.net/virtual/2026/poster/4727
PDF: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/7216.pdf
代码: https://github.com/dc-ai-projects/DC-Gen
领域: 扩散模型 / 视觉生成效率
关键词: 深压缩潜空间、嵌入对齐、后训练、LoRA、视频生成
一句话总结¶
DC-Gen 先对齐输入与输出接口,再用 LoRA 将预训练扩散主干迁移到更少 token 的深压缩潜空间,在多类生成任务上接近原模型质量;论文报告 FLUX 4K 生成最高 53.8 倍加速,但计时仅覆盖 Transformer 主干。
研究背景与动机¶
潜扩散模型已经不在像素空间直接去噪,但常见的 8 倍空间压缩仍会留下大量视觉 token。FLUX.1-Krea 将一张 4K 图像表示为 65,536 个 token;Wan2.1 的 81 帧 720P 视频则需要 75,600 个 token。每一步扩散都要处理这些表示,因此即使减少采样步数,单步计算依然可能很重。DC-AE 已能在 32 倍或 64 倍空间压缩下维持较好的重建质量,问题变成如何让已有生成模型使用这些紧凑表示。
直接换编码器并不等于换一个兼容的文件格式。新潜变量的通道数、网格尺寸和统计分布改变后,原有 patch embedder 与输出层往往不能复用。随机初始化这两个接口,再把整个预训练网络一起微调,会把不熟悉的表示送入深层 Transformer:论文观察到特征偏差随层数放大,图像细节变糊,编辑模型复制输入,视频模型甚至训练崩溃。从头训练当然可以回避迁移问题,却失去了复用原模型能力与训练投入的意义。
DC-Gen 因而先处理接口兼容性,再恢复生成细节,而不是让主干在一开始同时适应输入、输出和潜空间变化。核心 idea:把深压缩潜空间迁移拆成输入嵌入对齐、输出层对齐、LoRA 精调,让旧主干先重新读懂和写出新潜变量,再进行轻量能力恢复。
方法详解¶
整体框架¶
训练时,同一图像或视频经过原编码器与深压缩编码器,形成可对照的两套表示。第一阶段只训练新 patch embedder,使其接近下采样后的原模型嵌入;第二阶段冻结 Transformer,联合训练新输入接口与输出层;第三阶段以 LoRA 调整生成主干,恢复细节与条件遵循。
推理时不再需要原编码器或对齐分支,而是在新潜空间中从噪声逐步生成,再用对应解码器还原图像或视频。视频的 DC-AE-V、图生视频条件编码和引导蒸馏模型的损失修正属于接入具体骨干所需的适配,不是额外的通用第四训练阶段。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
Input["训练图像或视频"] --> Old["原编码器与嵌入<br/>冻结并下采样"]
Input --> New["深压缩编码器<br/>冻结"]
Old --> Align["输入嵌入对齐"]
New --> Align
Align --> Output["输出层对齐"]
Output --> Tune["LoRA 精调"]
Tune --> Result["新潜空间生成<br/>对应解码器还原"]
关键设计¶
1. 输入嵌入对齐:先让新 token 进入主干熟悉的表示空间
空间压缩比 \(f\) 表示每条空间轴缩小的倍数,patch 大小 \(p\) 则进一步把潜变量网格切成 token;两者不可混为一谈。图像的 token 数为 \(N=HW/(fp)^2\)。从 \(f8p2\) 变成 \(f32p1\),空间压缩比虽然增大 4 倍,但 token 只减少到原来的四分之一,而不是十六分之一,因为 patch 大小也发生了变化。新潜变量通道数可以增大,但 Transformer 接收的隐藏维度仍需要匹配原主干。
对同一输入 \(x\),原编码器 \(E_o\) 与深压缩编码器 \(E_d\) 分别产生潜变量。原 patch embedder \(e_o\) 的嵌入网格更密,先将它空间下采样到新 token 网格,再让新接口 \(e_{d,\phi}\) 回归这个目标。下面按正文的 MSE 定义整理记号;缓存中的公式排版损坏,\(S\) 是本笔记对其下采样操作的简写,而非新增模块:
这一阶段固定两套编码器与原接口,只更新新 patch embedder。对齐目标在隐藏表示空间,而不是要求两个完全不同的编码器产生相同潜变量;这样既允许更短的序列,又为已有主干保留熟悉的输入语义。论文图 2 的逐层距离与生成示例支持接口失配的解释,但这些现象本身并不构成对所有潜空间迁移都有效的理论证明。
2. 输出层对齐:冻结主干,先打通新潜空间的生成出口
输入对齐后,随机初始化的输出层仍不知道如何将主干特征变成新潜空间的速度预测。论文因此继续冻结 Transformer,但同时更新新 patch embedder 与输出层,使用标准 flow matching,而非继续回归旧嵌入。这一步不仅是训练一个读出头,也允许输入接口在实际去噪任务下进一步调整。
令 \(z_0\) 为新空间的干净潜变量,\(\epsilon\sim\mathcal N(0,I)\),\(t\in[0,1]\),\(c\) 为文本条件;根据正文定义,带噪状态与目标速度分别为 \(z_t=(1-t)z_0+t\epsilon\) 和 \(\epsilon-z_0\)。将抽取损坏的公式按这些明确定义整理为:
完成这两个接口的对齐后,即使尚未微调主干,模型也能产生语义合理的图像。正文称输入对齐对恢复预训练能力关键,输出层对齐主要加快后续收敛;但拆开两者的独立实验在未提供的附录中,因此不能给出各自的精确贡献分数。
3. LoRA 精调:在已兼容的接口上恢复细节,并保留骨干的任务特性
最后进行端到端适配,以 LoRA 调整预训练 Transformer,而不是重新训练整个生成器。文生图实验对所有线性模块使用 rank 与 alpha 均为 256 的 LoRA;论文称 DC-Gen-FLUX 全部后训练为 40 H100 GPU-days,即 16 张卡训练 2.5 天。这里的“轻量”是相对工业级预训练而言,不意味着无需训练或单卡即可轻松复现。
骨干已有的条件机制也必须保留。FLUX.1-Krea 与 Z-Image-Turbo 使用引导蒸馏,把 CFG scale 编入条件;直接以普通 flow matching 训练会造成有偏的速度估计。作者给出结合正文本、负文本与 guidance scale 的修正目标,但本地缓存的式 3 运算符缺损,推导与消融又在附录中,故这里不猜测完整公式。复现这些模型时,不能将上面的标准目标不加修改地套用于全部阶段。
视频侧采用 DC-AE-V,空间压缩 \(f=32\)、时间压缩 \(t=4\)、通道数 \(c=32\)。其 chunk-causal 时间建模让块内信息双向流动、块间保持因果,以改善深压缩重建并支持更长视频。三阶段训练仍保持不变,只是张量扩展为时空网格。对 Wan2.1 图生视频,先把条件图像复制 4 次、再补空白帧到目标视频形状,经 DC-AE-V 编码后与生成潜变量拼接,处理原 VAE 与新编码器时间建模方式不同的问题。
一个完整示例¶
以 FLUX 的 \(1024\times1024\) 图像为例:原 \(f8c16\) 编码器生成 \(128\times128\) 潜网格,\(p=2\) 后是 \(64\times64=4096\) 个 token。换成 DC-AE-\(f32c32\) 与 \(p=1\) 后,网格变成 \(32\times32=1024\) 个 token。
训练时,把原 \(64\times64\) 嵌入下采样到 \(32\times32\),指导新 patch embedder;随后冻结主干,训练输入和输出接口预测新潜变量的速度;最后进行 LoRA 精调。推理只在这 1024 个 token 上反复运行主干,再用 DC-AE 解码为原分辨率图像,而不是先生成低分辨率图再做超分辨率。
论文在 2K 与 4K 场景进一步从 DC-AE-f32 迁移至 DC-AE-f64。按相同 \(p=1\) 计算,4K 的 token 数由原 \(f8p2\) 的 65,536 降为 4096;这是由配置推导的计数,不是将 16 倍 token 缩减直接等同于 16 倍或 53.8 倍实际加速。
损失函数 / 训练策略¶
文生图后训练数据混合 Pexels、Unsplash 的真实图像和原模型合成图像。视频使用 FusionX 生成的 257K 合成视频;图像编辑使用 Pico-Banana 中筛选的 201K 编辑对,并先在高质量数据上微调 Qwen-Image-Edit,再应用 DC-Gen。
为区分数据带来的收益与潜空间迁移收益,视频和编辑实验另设同数据微调的 Tuned 基线。主文没有完整学习率、batch size、各阶段步数及全部模型的适配超参,均指向附录;现有缓存止于参考文献,因此不补造这些参数,也不把文生图的 LoRA 配置推广为所有任务的配置。
实验关键数据¶
主实验¶
所有延迟均为单张 H100 上通过 TensorRT 测得的 Transformer 主干延迟,不含完整编码、解码与服务开销。下表摘自主文表 1、表 2;1K 使用 MJHQ-30K 与 GenEval,4K 使用文中所述 Aesthetic-4K / Diffusion-4K 评测。
| 分辨率 | 模型 | 步数 | 延迟(秒) | CLIP Score | GenEval / Aesthetic Score |
|---|---|---|---|---|---|
| 1K | FLUX.1-Krea-12B | 表 1 未列 | 4.06 | 27.93 | 0.69 / 不适用 |
| 1K | DC-Gen-FLUX | 表 1 未列 | 0.88 | 28.02 | 0.71 / 不适用 |
| 1K | Z-Image-Turbo | 表 1 未列 | 1.92 | 27.61 | 0.84 / 不适用 |
| 1K | DC-Gen-Z-Image | 表 1 未列 | 0.47 | 27.58 | 0.84 / 不适用 |
| 4K | FLUX.1-Krea-12B | 20 | 218.81 | 未报告 | 不适用 / 未报告 |
| 4K | Diffusion-4K(FLUX.1-WLF) | 20 | 23.76 | 32.79 | 不适用 / 5.94 |
| 4K | DC-Gen-FLUX | 20 | 4.04 | 35.07 | 不适用 / 6.31 |
| 4K | DC-Gen-Z-Image | 9 | 1.91 | 34.23 | 不适用 / 6.11 |
作者叙述中的 FLUX 4K 加速为 53.8 倍,而上述表值相除约为 54.2 倍,两者并非精确一致,故保留原表而不反向修改耗时。原始 FLUX 与 Z-Image 不原生支持 4K,表中也缺少其 4K 质量分数,因此不能由耗时对照宣称“在相同原生 4K 质量下加速”。
跨任务结果摘自主文表 4、表 5。视频列出 VBench 总分与语义分,编辑列出 GEdit 英文、中文总分,两组指标不可互相比大小。
| 任务 | 模型 | 主干延迟 | 质量指标 1 | 质量指标 2 |
|---|---|---|---|---|
| T2V,720×1280 | Wan2.1-T2V-14B Tuned | 27.52 分钟 | 总分 83.94 | 语义 74.97 |
| T2V,720×1280 | DC-Gen-Wan2.1-T2V-14B | 3.58 分钟 | 总分 83.97 | 语义 75.83 |
| 编辑,GEdit 1K | Qwen-Image-Edit Tuned | 57.63 秒 | 英文 O 7.23 | 中文 O 7.02 |
| 编辑,GEdit 1K | DC-Gen-Qwen-Image-Edit | 11.96 秒 | 英文 O 7.20 | 中文 O 7.32 |
消融实验¶
下表依据第 3.4 节及图 4、图 5 的定性描述,不从曲线猜测精确分数。对比的目标空间都是 DC-AE-f32;Direct Fine-Tuning 复用主干、随机初始化接口并直接联合微调,DC-Gen 则先做接口对齐。
| 骨干 | 无嵌入对齐的直接微调 | 完整 DC-Gen | 证据范围 |
|---|---|---|---|
| FLUX.1-Krea | 训练相对稳定,但细节更模糊 | 恢复接近预训练模型的视觉质量 | 主文定性比较;无精确消融表值 |
| Qwen-Image-Edit | 结构可辨,细节扭曲,倾向复制输入 | 能执行有效编辑并保留细节 | 主文定性比较;无精确消融表值 |
| Wan2.1-T2V-1.3B | 训练若干步后崩溃,输出接近噪声 | 后续微调稳定并保持生成能力 | 主文训练曲线与定性描述 |
关键发现¶
- 接口对齐的价值不只是小幅提分:在 Wan 视频模型上,它关联到能否稳定训练;仅观察图像模型的最终 CLIP 分数会低估这一作用。
- 1K FLUX 的 CLIP 从 27.93 到 28.02、GenEval 从 0.69 到 0.71,主要支持“质量保持”,不应包装成大幅质量突破。
- 图像编辑并非全面上涨:相较 Tuned,英文 O 从 7.23 到 7.20,中文 O 从 7.02 到 7.32;原表 PQ 英文从 7.36 到 7.12、中文从 7.32 到 7.15,说明更快并不保证所有质量维度不变。
- 文生图人工评测包含 75 个提示,每对图像由 20 位用户判断;整体视觉质量偏好为 DC-Gen 47.4%、原模型 44.1%、平局 8.5%,支持可比性,但未报告统计显著性。
亮点与洞察¶
- 将潜空间迁移理解成输入、输出接口的兼容问题,比把一切交给端到端优化更有针对性。冻结主干阶段还能检验旧模型的能力是否仍能被新表示调用。
- 在嵌入网格上对齐而非强迫潜变量逐点一致,使空间分辨率和通道配置可以改变。这是复用预训练主干的重要自由度。
- 缩短 token 序列与减少采样步数处理不同计算来源。原则上可探索组合,但本文的实验不能证明与任意量化、缓存或蒸馏方法都能无损叠加。
局限与展望¶
- 计时口径限制由作者明确给出:仅测 Transformer 主干。部署仍需报告包含自编码器、文本编码器和数据传输的端到端延迟,以及峰值显存。
- 4K 原模型不原生支持该分辨率且缺少质量分数,使最大加速比的质量对等性不如 1K 和同数据 Tuned 对比充分。这是实验解读限制,不是补出的失败案例。
- 附录未包含在本地缓存中,无法核验接口分项消融、引导修正推导、DC-AE-V 细节与完整超参;主文也没有提供可据以报告的消融精确分数。
- 方法仍依赖高质量压缩编码器、真实或合成训练数据及后训练预算。应进一步检查高频纹理、小字、长视频运动与域外编辑的质量损失,而不能把这些潜在风险写成已证实失败。
相关工作与启发¶
- 与 DC-AE / DC-AE 1.5 的关系:这些工作提供紧凑潜空间;DC-Gen 主要解决已有扩散主干如何稳定迁移过去,视频侧另扩展 DC-AE-V,二者不是同一个研究问题。
- 与 PixArt-Σ 的区别:其替换 SD-VAE-f8c4 为 SDXL-VAE-f8c4,接口形状相同可复用;DC-Gen 面对不同空间压缩与通道配置,不能直接继承输入输出层。
- 与 OpenSora-2.0 的区别:主文将其 f8 到 f32 适配归为直接微调,指出模糊与质量下降;DC-Gen 的核心新增步骤是迁移前对齐,而非声称首先使用高压缩视频潜空间。
- 后续启发:更换视觉 tokenizer 时,可先测试接口对齐后冻结主干的能力保留,再决定需要多少主干适配。这是从本文推导的实验策略,不是已验证的通用结论。
评分¶
- 新颖性: 4/5。三阶段接口对齐把深压缩迁移中的具体失配变成可操作的训练问题。
- 实验充分度: 4/5。多任务、多骨干与同数据 Tuned 对比有说服力,但完整附录与端到端计时缺口仍在。
- 写作质量: 4/5。主线清晰,失败行为具体;关键实现细节依赖附录,本地公式抽取损坏另限制核验。
- 价值: 5/5。为复用大规模生成模型、降低高分辨率推理成本提供实用路线,仍应按实际部署口径复测。