OneVAE: Joint Discrete and Continuous Optimization Helps Discrete Video VAE Train Better¶
会议: ECCV2026
论文: ECCV 原文
代码: https://github.com/HVision-NKU/OneVAE
领域: 视频生成
关键词: 视频VAE、有限标量量化、连续离散联合优化、多token量化、首帧增强
一句话总结¶
OneVAE 在共享视频 VAE 中交替训练连续与离散重建,并结合渐进初始化和结构改进,使统一训练消融的 PSNR 从 27.22 提升到 28.15,同时让同一压缩配置的模型支持两种潜表示。
研究背景与动机¶
视频生成首先需要把高维像素压缩成可建模的表示,tokenizer 的误差会成为后续生成器的重建上限。 扩散模型通常使用连续潜变量,而纯离散的下一 token 预测需要把视频编码成有限词表中的索引。 视频不仅有空间细节,还有跨帧运动,因此时间压缩会进一步放大量化带来的信息损失。 VQ 依靠最近邻码本匹配,可能出现码本坍塌;Cosmos 使用有限标量量化(FSQ)缓解这一问题,但离散视频 VAE 仍可能训练缓慢、重建较差。
作者关注的不是单独把词表做大,而是连续模型已经学到的潜空间能否帮助离散模型优化。 在预训练连续 VAE 中只训练中间量化模块时,表 1 的 FSQ 达到 26.46 PSNR,而 VQ 为 22.82。 这个局部实验表明,在该固定骨干设定下,FSQ 比最近邻码本更容易适应既有连续表示;它并不证明 FSQ 在所有架构上都优于 VQ。 由此产生的训练思路是保留连续重建通路,让共享编码器和解码器不必完全依赖离散量化后的近似梯度来调整。
即使训练变稳定,高压缩下的容量分配仍有问题:单个空间位置只分配一个 token,表达能力有限;因果模型的首帧又没有未来帧可用。 因此论文把优化策略与两类结构改进结合,而不是把所有收益都归因于一个新的量化算子。 核心 idea:用连续重建保住可学习的潜空间,再通过渐进训练、多 token 表示和首帧容量分配,改善离散视频 tokenizer 的训练与重建。
方法详解¶
整体框架¶
输入是视频片段,共享 3D 编码器先在空间和时间上压缩视频,得到每个潜位置的通道向量。 连续路径把连续表示送入解码器;离散路径对潜表示进行 FSQ,再把离散表示送回同一个解码器恢复视频。 训练时随机选择其中一条路径,并非每个步骤都同时计算两份重建损失。 模型开发顺序是从低压缩连续 VAE 出发,再派生高压缩和离散配置;针对因果首帧和离散容量,还可以加入首帧增强与多 token 量化。 下面实线表示重建数据流,虚线表示训练初始化或监督;连续路径绕过离散量化,并不把连续和离散结果拼接后再解码。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
Train["统一渐进训练"] -.-> Encoder["共享3D编码器"]
Video["输入视频"] --> Anchor["首帧增强"]
Anchor --> Encoder
Encoder -->|离散路径| Quant["多token量化"]
Encoder -->|连续路径| Decoder["共享3D解码器"]
Quant --> Decoder
Train -.-> Decoder
Decoder --> Output["重建视频"]
Output -.->|仅训练:重建监督| Train
图中展示带结构增强的重建路径;基本 OneVAE 不要求同时启用两个增强模块。 首帧增强涉及编码与解码的容量配置,图中放在编码入口表示其改变输入视频的压缩分配,而不是额外生成一张参考图。 推理时按用途选择连续或离散模式,不再随机抽取训练路径。 同一压缩比的两种模式可以共享模型,但不同压缩比对应渐进派生的模型配置,不能理解为任意压缩率自动切换。
关键设计¶
1. 统一渐进训练:让连续重建支撑离散优化
FSQ 先把连续特征映射到有界范围,再逐维取整,最后可把整数元组转换为离散索引。 它没有 VQ 那种为整条向量寻找最近码本项的过程,因而适合插入已有连续潜空间。 将第 3.1 节的机制整理为简式,可以写成:
这里的 \(z\) 是量化前特征,\(q\) 是逐维整数结果,不能把这个向量直接当作已经展平的词表索引。 缓存里的原始公式排版有损坏,因此不恢复未能核实的上下界、采样细节或分段条件;上式仅表达正文明确说明的操作。 表 1 固定连续 VAE、只训练量化模块的实验,是选择这条衔接路线的经验依据,而不是对潜空间相似性的严格证明。
每个训练步骤以 \(R_{dis}\) 控制离散路径所占比例,另一部分步骤走连续重建。 共享参数因此同时接收两类学习信号:离散步骤学习经过量化仍可恢复视频,连续步骤维持量化前特征到像素之间的重建联系。 作者认为连续路径可以减少仅靠离散近似梯度带来的优化困难;第 4.2 节明确将更准确梯度流的解释作为假设。 这不同于训练两个独立 VAE 再蒸馏,也不是部署时对两个输出求平均。
渐进训练先学习 \(8\times8\times4\) 连续 VAE,再向 \(16\times16\times4\) 等更高压缩配置扩展。 在相同压缩配置下,插入 FSQ 并继续联合训练即可派生离散版本,无需从零重学全部视频重建能力。 这里沿用表 3 的空间、空间、时间顺序;正文也出现时间、空间、空间顺序的 \(4\times16\times16\),两者指同一类下采样配置。 统一训练把连续初始化和双路径优化组合使用,所以表 2 的收益不能拆成两个单独机制各自贡献多少。 当目标主要是离散重建时,作者使用较高的 \(R_{dis}\),但可读正文没有给出该设置的精确数值。 当目标是一个同时支持连续与离散表示的统一模型时,作者明确采用 \(R_{dis}=0.5\)。
2. 首帧增强:给因果解码提供更可靠的起点
因果视频 VAE 不能依赖未来帧来恢复当前帧,首帧尤其缺少可利用的时间上下文。 在高压缩设置中,如果首帧的文字、边界或纹理已经丢失,后续帧也会失去一个可靠的起点。 作者对比因果与非因果模型后,将早期帧较差的重建表现与这种上下文不对称联系起来。 首帧增强因此只降低首帧的压缩强度,为其每个空间单元分配更多 token,让后续因果重建利用更清楚的结构和纹理。
这不是利用未来视频修补首帧,也不是用另一个教师模型生成首帧。 它改变的是时间序列中的容量分配,并仍保持因果使用信息的方式。 第 3.3 节声称总视频压缩比和 token 预算不变,但可读正文没有充分交代补偿分配与精确 token 计数。 因此可以确认增强位置和意图,不能据此自行构造一个已被验证的预算守恒实现。 图 3 展示首帧和后续帧的定性改善,表 3 则给出高压缩 OneVAE-FE 的整体重建结果。
3. 多token量化:用组合编码增加潜位置的表达能力
常规离散编码把一个潜位置的整个通道向量压成一个 token,局部内容再复杂也只能选一次离散表示。 OneVAE 将通道向量划分为多个子向量,实验使用两个等长部分,再分别量化为两个 token。 两个部分使用共享码本设计,联合描述原来的潜位置,而不是把整条向量塞进一个更大的独立码本。 直观地说,两个离散选择可以组合表达更多状态,但也意味着每个潜位置产生更多 token。
因此“相同 token 压缩率”不能只看每个潜位置的 token 数,还必须同时看潜网格大小。 表 3 的 OneVAE-MT 使用 \(8\times8\times8\) 配置,而普通 OneVAE 使用 \(8\times8\times4\)。 更强的时间下采样与每个位置两个 token 配合,解释了作者为什么能在声称相同 token 压缩率的条件下比较容量收益。 对有限长度的因果视频,精确序列长度还受首帧和边界处理影响;本笔记不从标称比例推断确切 token 总数。 这一设计与首帧增强作用不同:前者改变每个潜位置如何离散表达,后者改变时间位置间的容量分配。
一个完整示例¶
以训练中的一个 \(17\times256\times256\) 视频片段为例,先用连续 VAE 学习把它压缩和重建。 派生离散模型后,同一片段经过共享编码器,某一步若抽到离散路径,就通过 FSQ 产生离散表示再解码。 采用多 token 配置时,每个潜位置的通道会分为两个部分,各自产生 token,而不是输出两个独立视频。 另一个训练步骤若抽到连续路径,编码结果绕过离散量化,直接通过共享解码器学习重建。 若使用首帧增强,首帧会获得更低压缩的表示,但后续重建仍不访问未来帧。 完成训练后,重建评测输入为 \(33\times512\times512\);用于 AR 生成时则先由生成器预测离散 token,再用解码器生成视频。 这个例子串联正文给出的输入规格和机制,不代表额外实验,也不假定缓存未说明的精确潜网格边界规则。
损失函数 / 训练策略¶
训练数据为 WebVid-10M,优化器使用 AdamW,参数为 \(\beta_1=0.5\)、\(\beta_2=0.9\)。 使用 FP16 降低显存开销,模型参数的指数移动平均衰减率为 0.999。 重建目标包含像素损失和感知损失,其中 LPIPS 权重为 0.1。 训练先使用 17 帧、每帧 \(256\times256\) 的片段,收敛后再用 33 帧视频微调解码器。 Temporal PatchGAN 在 20K 步预热后开始对抗训练,避免一开始就叠加不稳定的对抗信号。 这些是实现配方,不应将所有重建提升归因于单一损失项;正文没有提供完整学习率、损失系数和算力预算供独立复现。 图 4 报告约 5 倍收敛加速,比较的是训练迭代上的收敛曲线,不等于已测量的端到端墙钟加速。
实验关键数据¶
主实验¶
表 3,第 12 页:Panda70M 测试集重建,输入为 \(33\times512\times512\),先将短边缩放到 512 再中心裁剪。 PSNR、SSIM 越高越好;LPIPS、FVD 越低越好。这里的 FVD 衡量重建视频分布质量,不是下面的生成 gFVD。 以下只列离散配置;压缩顺序沿用原表,MT 的潜网格下采样比例与普通版本不同。
| 离散模型 | 压缩配置 | PSNR | SSIM | LPIPS | FVD |
|---|---|---|---|---|---|
| Cosmos | \(8\times8\times4\) | 30.34 | 0.9159 | 0.0524 | 82.86 |
| OneVAE | \(8\times8\times4\) | 30.67 | 0.9228 | 0.0528 | 108.93 |
| OneVAE-MT | \(8\times8\times8\) | 31.80 | 0.9399 | 0.0450 | 78.35 |
| Cosmos | \(16\times16\times4\) | 26.80 | 0.8531 | 0.1260 | 350.87 |
| OneVAE | \(16\times16\times4\) | 27.40 | 0.8690 | 0.1063 | 336.48 |
| OneVAE-FE | \(16\times16\times4\) | 28.11 | 0.8772 | 0.0814 | 213.04 |
基本 OneVAE 在低压缩配置下并非所有指标都胜过 Cosmos:PSNR 更高,但 LPIPS 和 FVD 更差。 高压缩 OneVAE 加 FE 后,PSNR 从 27.40 到 28.11,FVD 从 336.48 降到 213.04,体现首帧分配策略的实际收益。 原文说明 Cosmos 的 \(16\times16\times4\) 比较配置由 \(16\times16\times8\) 适配而来,不能把它当作完全原生的相同训练配置。 连续模式也有收益:同表中 \(8\times8\times4\) OneVAE 的 PSNR 为 32.48,CV-VAE 为 31.12,但潜通道数分别为 6 和 4,不能忽略容量差异。
消融实验¶
表 2,第 11 页:统一训练及结构消融;第 4.1 节给出通用评估协议,但表 2 未单独明确其压缩配置。 原表的 Feature Enhancement 在正文中指首帧增强,以下统一写为 FE;UT 同时包含连续初始化与双路径训练。
| 配置 | PSNR | SSIM | LPIPS |
|---|---|---|---|
| 从零训练基线 | 27.22 | 0.8673 | 0.1029 |
| UT | 28.15 | 0.9039 | 0.0756 |
| UT + MT | 28.87 | 0.9207 | 0.0683 |
| UT + FE | 28.88 | 0.8973 | 0.0669 |
| UT + MT + FE | 29.35 | 0.9183 | 0.0611 |
UT 相比基线增加 0.93 PSNR;在 UT 上增加 MT 和 FE 后分别达到 28.87 和 28.88。 两项同时启用时 PSNR 和 LPIPS 最好,但 SSIM 的最佳值仍是仅加 MT 的 0.9207,而不是完整配置的 0.9183。 这些结果支持互补收益,却不支持“所有指标随模块叠加单调改善”的说法。
关键发现¶
下游生成也进行了验证,不能只用重建指标推断 token 一定容易建模。 表 4,第 13 页:UCF-101,评估格式为 \(16\times128\times128\);AR 架构与 LARP 相同,但生成器参数量不同。 星号 gFVD 以重建后的真实视频为参照,普通 gFVD 以原始真实视频为参照,两种口径不能混排比较。
| 方法 | Tokenizer 参数量 M | 生成器参数量 M | gFVD,重建参照 | gFVD,原始参照 |
|---|---|---|---|---|
| LARP-L | 173 | 632 | 43 | 57 |
| OneVAE | 135 | 775 | 37 | 62 |
OneVAE 在重建参照下为 37,优于 LARP-L 的 43;原始参照下为 62,反而差于 57。 更大的词表嵌入额外引入 143M 生成器参数,所以这项实验更适合说明 AR 兼容性,而非严格证明生成模型全面领先。 原始 OneVAE tokenizer 没有在 UCF-101 或 \(128\times128\) 分辨率上训练,这一点不等于下游 AR 生成器没有在该数据集训练。
亮点与洞察¶
- 连续路径可以是离散训练的辅助监督通路,而不只是最终部署时的另一种输出格式。这让已有连续 tokenizer 的训练投入可以被复用。
- 多 token 量化强调组合表示而非单纯扩大词表,但必须联合报告潜网格和序列长度,才能判断容量收益是否公平。
- 首帧增强针对因果上下文的不对称分配容量,比对所有帧统一增加成本更有针对性;具体预算仍需实现级核验。
局限与展望¶
- 证据边界:本次可读来源是主论文,MCL-JCV 结果被指向补充材料,本笔记不补写未读取的结果。
- 复现边界:公式抽取损坏,首帧预算补偿、精确词表规格及部分训练超参数未在可读正文中充分展开。
- 因果解释边界:表 2 没有分离连续初始化和双路径训练,潜特征可视化也不能独立证明梯度机制。
- 评估边界:重建提升并不保证原始参照 gFVD 更低;后续应控制词表、总 token 数与生成器参数量再比较。
相关工作与启发¶
- 与 VQ / FSQ 相比:OneVAE 主要重新组织 FSQ 周围的训练与表示容量,不是提出一个全新的最近邻替代准则。
- 与 Cosmos 相比:Cosmos 提供多种连续或离散 tokenizer,OneVAE 在同一压缩配置中共享两种表示的模型,但基本版本也存在指标不占优的情形。
- 与 CV-VAE 相比:连续视频潜空间不只是最终产品,也成为离散 tokenizer 的初始化与训练支撑;比较时仍需考虑潜通道容量。
- 与 LARP 相比:OneVAE 验证通用 tokenizer 可以支持下一 token 视频生成,但更大词表和不同 gFVD 参照限制了直接排名结论。
评分¶
- 新颖性: 4/5。把联合训练、渐进派生和容量分配组合为视频 tokenizer 配方,贡献以系统设计为主。
- 实验充分度: 4/5。覆盖重建、模块消融及 AR 生成,但关键训练因素与容量变量尚未完全解耦。
- 写作质量: 4/5。主线清晰,但压缩维度顺序和首帧预算说明仍可更明确。
- 价值: 4/5。适合复用连续 VAE 训练离散视频表示,实际采用时应补齐预算与下游生成验证。