跳转至

ProGVC: Progressive-based Generative Video Compression via Auto-Regressive Context Modeling

会议: ECCV 2026
论文: ECCV 官方页
领域: 模型压缩
关键词: 感知视频压缩、渐进式可伸缩编码、视觉自回归模型、熵编码、多尺度残差量化

一句话总结

ProGVC 把视觉自回归模型(Visual Auto-Regressive, VAR)的「下一尺度预测」搬到视频压缩:用多尺度残差量化把视频隐特征编成粗到细的分层 token 金字塔,传输时发全部帧内(intra)尺度与前 k 级帧间(inter)尺度、被截断的高频尺度由同一个自回归上下文模型现场生成,从而在 300–2000 kbps 低码率区间同时拿到可伸缩码流、码率自适应和具竞争力的感知质量。

研究背景与动机

视频压缩按用途分成「给人看」和「给机器分析」两类,这篇论文只关心前者。传统标准 H.264/AVC、H.265/HEVC、H.266/VVC 以及近年表现强劲的端到端神经视频编码(DCVC-FM、DCVC-B、SEVC 等),都是围绕 PSNR、SSIM 这类逐像素失真度量做设计。这类编码器确实能把信号保真度压得很高,但码率一低,重建画面就出现模糊、块效应和振铃——这些恼人的伪影恰恰说明人眼感知和失真度量已经分道扬镳。于是研究者转向生成式视频压缩:GAN 型方法(如 PLVC 的循环条件 GAN、Qi 等人的生成式隐编码)能生成锐利纹理,却受困于对抗训练不稳定与保真度不足;扩散模型普及之后,DiffVC 一类方法把 Stable Diffusion 或视频扩散 transformer 当作解码端的去噪器,用强先验合成缺失的纹理与运动,视觉效果明显更好。

问题出在三个结构性缺陷上。第一,扩散模型基本只在解码端做「像素/隐变量精修」,整个扩散过程与熵编码是解耦的——它再强的时空先验也不会转化成「少发几个比特」,而这些比特恰恰是码率的大头。第二,扩散解码依赖多步迭代去噪,延迟高,低延迟或实时流式场景根本用不了。第三,绝大多数感知编解码器不支持可伸缩码流与可变码率:带宽一波动就得换模型或重训,而 PLVC 这类方法连可变码率都不支持;保真度导向的神经编解码器虽然支持可变码率,却不支持一条码流里截断出多个质量层。本文要做的,就是把「渐进可伸缩」「高效熵编码」「细节生成」这三件在已有感知编解码器里彼此割裂的事,压进同一条自回归管线。

切入角度来自 VAR 的下一尺度预测机制:多尺度残差量化器把视觉数据编成分层 token 图(scale),再用 Transformer 自回归地按尺度预测。这个「粗到细」的结构天然就是可伸缩的——编码端只发前几个粗尺度,需要更高画质时再补发高频尺度;而且自回归模型为每个 token 给出的条件概率,本身就是一个可以直接拿去驱动算术编码的熵上下文模型;再加上 VAR 的采样步数远少于扩散的去噪迭代,解码延迟也能压下来。核心 idea:用多尺度残差量化把视频编成粗到细的离散 token 金字塔,再用一个多尺度自回归上下文模型同时充当熵编码的概率模型与被截断高频尺度的生成模型——帧内尺度全传,帧间只传前 k 级,剩下的由模型生成。

方法详解

整体框架

ProGVC 的输入是一段视频片段(1 个 intra 帧 + T 个 inter 帧),输出是重建视频。流程分四步走:因果视频 VAE 先把视频编码成连续时空隐特征;多尺度残差量化把它离散成 K 级、分辨率逐级升高、逐级携带更高频细节的 token 图;多尺度自回归上下文模型按尺度估计每个 token 的条件分布;编码端只把帧内全部尺度与帧间前 k 级低频谱尺度无损写进码流,其余 K−k 级高频 inter 尺度直接丢弃,解码端用同一个模型的分布做 argmax 生成补回,最后多尺度求和还原隐特征、由 VAE 解码器重建视频。全局唯一被复用的网络是那个自回归上下文模型:在编码端它是熵模型,在解码端它还是生成模型。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入视频片段<br/>因果 VAE 提连续时空特征"] --> B["分层多尺度残差量化<br/>BSQ 逐级逼近连续特征"]
    B --> C["多尺度自回归上下文模型<br/>按尺度自回归估计 token 分布"]
    C --> D["稀疏注意力掩码<br/>自身 + 前一级 + 最大 intra scale"]
    D --> E{"尺度是否传输"}
    E -->|"intra 全传 + 前 k 级 inter"| F["算术编解码<br/>无损传输"]
    E -->|"被截断的 K−k 级 inter"| G["丢弃尺度上的 token 生成<br/>取分布最大概率项"]
    F --> H["多尺度求和 + VAE 解码<br/>重建视频"]
    G --> H

关于可伸缩性与码率控制:之所以由粗到细传,是因为粗尺度先定下全局结构和画面布局,后续尺度只补充局部高频细节,所以任何「前缀子集」都是一个合法码流;比特流里包含的尺度越多,重建质量越高,砍掉尾部尺度就得到一条更低码率的合法码流。实际调码率时只截断 inter 尺度,因为 inter token 占了传输比特的绝大多数,而 intra 尺度关系到 inter 尺度分布建模时的时序对齐,全传更划算。被丢掉的高频 inter 尺度不是凭空猜的,而是在已经重建出来的尺度条件下生成。

关键设计

1. 分层多尺度残差量化:把连续隐特征压成可任意截断的粗到细码流

这条设计要解决的是「传一部分尺度必须等于一条合法低码率码流」——如果各尺度独立量化、彼此不可加,砍掉尾部尺度得到的就是残缺表示而不是低质量表示。做法是一条残差链:第 k 级拿当前残差特征 \(e_k\)(k=1 时就是连续隐特征本身),先下采样成 token 向量,再用二值球面量化(Binary Spherical Quantization, BSQ)把每个元素按其符号二值化并除以 \(\sqrt{L_k}\) 归一化,得到长度 \(L_k\) 的二进制码;随后把这一级的离散 token 上采样回隐特征分辨率、从残差里减掉,剩下的作为下一级的输入:\(e_{k+1}=e_k-U_k(r_k)\)。尺度 k 越大空间分辨率越高,逐级捕获越高频的细节,前 k 级的上采样求和也就逐步逼近原始连续特征。这一层「可加性」正是渐进码流的物理基础:任意前缀子集都能求和出一个合法隐特征,只是细节少一点。另一个不显眼但关键的选择是 BSQ——每个 token 直接就是二值码,模型输出的每一位概率可以不加转换地喂给算术编码器,省掉了 VQ 码本在熵编码前要做的一整套索引映射。

2. 多尺度自回归上下文模型:让同一套概率同时服务熵编码与细节生成

这是全文的核心组件,也是与扩散式感知压缩最本质的分野。它的自回归不是光栅扫描式的逐 token 预测,而是按尺度进行下一尺度预测:帧内尺度之间按链式法则分解,每个尺度条件在前序更粗的尺度上;帧间尺度除了条件在前序帧间尺度上,还额外条件在全部帧内尺度上。

\[p(r^{I}_{1},\dots,r^{I}_{K})=\prod_{k=1}^{K}p\!\left(r^{I}_{k}\mid\{r^{I}_{k'}\}_{k'<k}\right)\]
\[p(r^{P}_{1},\dots,r^{P}_{\kappa_P})=\prod_{k=1}^{\kappa_P}p\!\left(r^{P}_{k}\mid\{r^{P}_{k'}\}_{k'<k},\,R^{I}\right)\]

实现上,为了估计第 k 级的分布,模型先把前 k 级 token 上采样求和再下采样,拼成一个聚合多尺度表示当作当前尺度的输入,然后堆叠若干带掩码的注意力块把前缀尺度的信息注入进来,最后用 MLP 预测头输出离散 token 分布。这个分布的用途是双份的:传给算术编码器做无损编码,或者在解码端直接取概率最大的离散码字来生成被截断的尺度。为什么这样有效?扩散式编解码把生成先验放在解码端做精修,先验再强也压不掉一个比特;而这里的条件概率出现在编码端、决定了每个 token 实际花多少比特,生成能力因此直接兑现成了码率节省——消融里把上下文模型换成均匀分布,码率立刻翻倍以上。

3. 稀疏注意力掩码:用「自身 + 前一级 + 最大 intra scale」换码率与算力的折中

理论上条件信息越丰富条件熵越低(期望码率越低),但朴素地扩大条件上下文在视频上是灾难:上下文沿空间和时间两个维度同时膨胀,自回归建模的算力开销会爆炸;而且第 k 级的聚合输入本身已经概括了更粗尺度的信息,对全部历史 token 做全注意力有相当程度的冗余。已有的两种掩码都不合用:Infinity 的块状因果掩码让每个尺度看全部历史 token,长序列上太贵;InfinityStar 的掩码更严格,但感受野太窄、上下文利用不足,反而抬高码率。本文的折中是让每个尺度只注意自身和紧邻的前一级尺度,长程依赖靠堆叠多层注意力隐式传播,不需要显式看全历史;同时为了让 inter 尺度拿到帧间时序先验、保持重建的时序一致性,inter token 被允许注意最大的那一级 intra scale——它空间分辨率最高、细节最丰富,与 inter scale 的时序一致性也最强。掩码在编码与解码两侧完全一致,保证两端的概率估计严格对齐,否则算术编解码会失配。消融显示这套设计在码率-算力上取到了最好的折中:相比只注意自身的掩码,三档 BD-rate 全面改善;相比全因果注意力,压缩性能基本持平(略逊约 6.5% DISTS BD-rate)但每帧编解码耗时从 0.64/1.96 秒降到 0.56/1.53 秒。

4. 丢弃尺度上的 token 生成:用生成的高频尺度替代传输

被砍掉的 K−k 级高频 inter 尺度如果不补回来,重建就会缺高频细节、退回模糊。ProGVC 的补法非常轻:既然上下文模型已经给出了这些尺度的条件分布,解码端就直接贪心地取每个 token 里概率最大的离散码字,即 \(\hat r^{P}_{k}=\arg\max p\!\left(\hat r^{P}_{k}\mid\{\hat r^{P}_{k'}\}_{k'<k},\hat R^{I}\right)\),单步前向、不需要任何迭代去噪,也不额外消耗比特。生成出的尺度与已解码的尺度一起做多尺度求和,再送进 VAE 解码器。这是整个码率-质量权衡的执行端:k 调得越小,被生成的部分越多、码率越低;k 越大,传输的部分越多、质量越高。代价是它换来的是「像自然视频」而不是「像原视频」——模型捕捉的是自然视频分布,偏好结构连贯与自然纹理,对严格的像素或特征级对应并不敏感,所以局部纹理会与原图有轻微偏移,这也解释了后面 LPIPS 上不如 DISTS/NIQE 亮眼的现象。

损失函数 / 训练策略

训练分两段。因果 VAE 与多尺度残差量化模块的基础配置继承自 InfinityStar,在此之上联合微调 10K 迭代,训练片段为 256×256×81,batch size 2,学习率 \(5\times10^{-5}\);总损失是熵损失、commitment 损失、L2 重建损失、GAN 损失与 LPIPS 感知损失的加权和,权重分别为 0.1、0.25、1、0.01 和 4(感知与对抗项的权重远大于重建项,与「感知压缩」的目标定位一致)。多尺度自回归上下文模型单独训练 60K 迭代,用 AdamW,batch size 8,学习率 \(5\times10^{-5}\),动量系数 \((\beta_1,\beta_2)=(0.9,0.97)\);按 InfinityStar 的训练协议随机丢弃靠后的 inter 尺度来提升训练效率(这也让模型见过各种截断长度、与推理时的可变码率行为对齐)。训练语料是从 Pexels 构建的大规模高质量集合:先算每个视频的美学分与清晰度分,只保留美学分 > 4.5、清晰度 > 0.65 的样本,再剔除时长不足 10 秒的,只留接近 720p 标准宽高比的,最终约 48 万条视频。

实验关键数据

主实验

评测在 Xiph、HEVC Class B、MCL-JCV 三个基准上进行,每条序列取前 81 帧,统一在 RGB 域、300–2000 kbps 区间评测,HEVC-B 与 MCL-JCV 下采样到 720p 以匹配训练配置。对比方法覆盖三类:传统编解码器 VTM-17.0(VVC 参考实现,random access、GOP 32、单 intra 帧);保真度导向的神经编解码器 DCVC-FM、DCVC-B、SEVC;以及感知编解码器 PLVC(可复现的 GAN 强基线)。感知质量用 DISTS、LPIPS(全参考)与 NIQE(无参考),信号保真度用 PSNR,时序一致性用 t-LPIPS,码率以 kbps 计。BD-rate 为负表示同等质量下更省码率。

Xiph 上以 VTM-17.0 为锚点的 BD-rate↓(%) / BD-metric↑:

方法 DISTS LPIPS NIQE PSNR
VTM-17.0 0.0 / 0.0000 0.0 / 0.0000 0.0 / 0.0000 0.0 / 0.0000
DCVC-FM 92.0 / −0.0257 40.4 / −0.0228 71.3 / −0.2525 111.1 / −1.8623
SEVC 87.7 / −0.0179 19.4 / −0.0062 41.8 / −0.1331 51.5 / −0.9035
DCVC-B 63.2 / −0.0148 17.3 / −0.0065 94.7 / −0.2306 56.8 / −1.0048
PLVC −40.3 / 0.0109 −83.7 / 0.0565 169.9 / −0.0902 825.9 / −5.5261
ProGVC −61.5 / 0.0300 3.5 / −0.0025 −62.2 / 0.2670 891.2 / −5.8437

另外两个数据集上 ProGVC 的 DISTS BD-rate 为 HEVC-B 的 −47.7%(BD-metric +0.0217)与 MCL-JCV 的 −46.2%(+0.0238),均为所有方法中最好;NIQE 上分别为 −52.5% 与 −65.5%,同样领先。但 LPIPS 上它在 HEVC-B 是 30.3%,不及 PLVC 的 −30.5%,属于「可比」而非「领先」;PSNR 则全面落后,Xiph 上要多花约 8.9 倍码率才能追平 VTM-17.0,这是感知压缩用保真度换感知质量的直接代价。

时序一致性与复杂度:

方法 t-LPIPS BD-rate↓ (Xiph) 编码耗时 (s) ↓ 解码耗时 (s) ↓
DCVC-B 58.61 1.28 1.09
SEVC −15.89 1.04 0.88
DiffVC 0.82 4.54
PLVC 709.87
ProGVC −20.76 0.56 1.53

t-LPIPS 上 ProGVC 以 −20.76% 领先所有基线(次优 SEVC 为 −15.89%),论文归因于分层下一尺度自回归生成与时空注意力设计——每个 token 都能注意到当前及更早尺度上其他帧的 token,跨帧时序依赖被显式建模。复杂度方面,ProGVC 编码耗时最低(0.56 s/帧),解码 1.53 s/帧与 DCVC-B(1.09 s)、SEVC(0.88 s)同一量级,明显低于扩散式 DiffVC 的 4.54 s。需要说明的是 PLVC 因实现与统一评测平台不兼容未参与耗时对比,DiffVC 未开源、其架构是按原论文复现但未训练,这里的数字有 caveat。

消融实验

消融在 Xiph 上进行,报告 DISTS / LPIPS / PSNR 三档 BD-rate 与 BD-metric(以完整模型为相对基准,负值更优):

变体 DISTS BD-rate↓ LPIPS BD-rate↓ PSNR BD-rate↓ 说明
Base(完整模型) 0.0 0.0 0.0 相对基准
w/o 上下文模型(均匀概率) 122.4 119.6 119.4 熵上下文的贡献,码率翻倍以上
w/o token 生成 N/A 280.9 189.9 DISTS 无质量重叠无法算 BD-rate
注意力:self-only 6.8 12.8 10.9 感受野过窄,上下文利用不足
注意力:full causal −6.5 −3.8 0.5 比本文略优,但耗时 0.64 / 1.96 s
参考:无 intra scale 37.3 41.7 46.6 丢掉时序先验
参考:最小 intra scale 42.7 40.4 46.8 低频参考,预测性最差
参考:同分辨率 intra scale 11.7 12.2 14.4 次优,仍明显不及最大尺度

关键发现

  • 熵上下文模型是收益的最大来源:把它换成均匀分布后码率增加 122.4%(DISTS 口径),论文表述为「上下文建模把码率降低了一半以上」。这说明本文的收益主要不是来自生成能力,而是来自「自回归模型给的准确概率能直接进算术编码器」这条路径——正是扩散式方法缺的那一环。
  • token 生成负责感知质量:去掉丢弃尺度的生成后,LPIPS 与 PSNR 口径的码率开销分别涨到 280.9% 与 189.9%,DISTS 甚至因为质量区间不再重叠而无法计算 BD-rate(表中记为 N/A),说明生成环节对感知指标的影响是数量级的。
  • 稀疏掩码的取舍是划算的:相比 self-only 掩码三档 BD-rate 全面改善(6.8% → 0.0%);相比全因果注意力只差 6.5%(DISTS),但每帧编解码耗时低 12.5% / 22%。也就是说,用很小的压缩效率代价换到了明显的算力节省。
  • inter 尺度的参考对象要选「最大的 intra scale」:无参考、参考最小尺度、参考同分辨率尺度分别带来 37.3%、42.7%、11.7% 的 DISTS 码率开销,最优解是分辨率最高、高频细节最丰富的那一级;三种方案的计算开销几乎一致,说明这是纯赚的收益。
  • 感知与保真度的分裂非常明确:DISTS/NIQE 上 ProGVC 大幅领先(Xiph 上 NIQE BD-rate −62.2%),LPIPS 上只是可比,PSNR 上则要多花数倍码率。作者的解释是自回归上下文模型学的是自然视频分布,偏好结构连贯与自然纹理,轻微的局部偏差在 LPIPS 上会被重罚。
  • 定性结果与码率同时占优:在 Xiph 的 Kimono 序列上,ProGVC 拿到 355.6 kbps / DISTS 0.0621,而 VTM-17.0 是 444.15 kbps / 0.1174、SEVC 751.66 kbps / 0.1330、PLVC 745.69 kbps / 0.0717;MCL-JCV 的 videoSRC07 上同样是 300.2 kbps / 0.0590 对最优基线的 302.2 kbps / 0.1283。即码率更低、DISTS 也更好。

亮点与洞察

  • 把熵上下文模型和生成模型合成一个网络:这是与扩散式感知压缩最本质的差别。扩散方法把生成先验放在解码端做精修,先验再强也压不掉比特;而这里条件概率出现在编码端,直接决定每个 token 花多少比特,生成能力因此兑现成了码率。这个「一份概率两用」的思路可以迁移到任何「有离散 token 且需要传输」的场景(图像/音频/点云的可伸缩编码)。
  • 可伸缩性是从量化的结构里长出来的,而不是后加的一层:残差链保证任意前缀子集都能求和出一个合法表示,于是「截断 = 降码率」不需要额外训练,一个模型覆盖整个 300–2000 kbps 区间,这正好补上 PLVC 等感知编解码器「换码率要重训」的短板。
  • 掩码设计把「时间维参考」具体化了:不是笼统地说「利用时序先验」,而是落成一条可验证的规则——inter token 只注意最大的那一级 intra scale。消融给出了 11.7%–42.7% 的 BD-rate 差距,说明这个看似随意的选择其实很关键(细粒度细节比低频布局更适合做 inter 的预测参考)。
  • 最「啊哈」的一点是延迟:扩散式解码器要迭代去噪,而这里被丢弃的尺度用单步 argmax 生成就补回来了,解码 1.53 s/帧、只有 DiffVC 的三分之一,让感知压缩第一次有了进入低延迟流式场景的可能。

局限与展望

  • 分辨率与时长受自回归主干限制:作者承认支持的视频分辨率与长度被 AR 模型的训练配置锁死,扩展到 720p 以上很困难,主要瓶颈在训练算力与当前 AR 视频生成主干的成熟度;未来打算探索与分辨率、长度无关的通用架构。
  • 码率控制是粗粒度的:当前只能整级传输或整级丢弃,码率点是离散的,不能连续调。作者提出的下一步是 token 级丢弃,以获得更平滑的码率自适应。
  • 感知指标内部并不一致:DISTS/NIQE 上大幅领先,LPIPS 上仅可比(HEVC-B 还输给 PLVC),PSNR 上要多花约 8.9 倍码率。若目标场景对保真度有硬要求(如机器视觉下游、医学/取证类回放),这套方法不适用。
  • 实验覆盖的缺口(自身体会):消融只在 Xiph 一个数据集上做,跨数据集的结论稳健性未验证;DiffVC 基线未训练,复杂度对比的数字说服力有限;所有测试都只取前 81 帧,而「intra 尺度全传」的开销是随 GOP 长度摊薄的,长序列下的码率行为没有讨论;论文只报告了 300–2000 kbps 区间,更低码率端的表现未知。
  • 可改进方向:把码率点从「整级」细化到「token 级/bit 级」,并引入显式的率失真拉格朗日项替代当前的离散 k 网格;把 VAE、量化与上下文模型端到端联合训练,可能进一步降低重建与概率估计之间的失配。

相关工作与启发

  • vs VTM-17.0(VVC 参考实现):传统标准围绕 PSNR/SSIM 设计,低码率下重建出现模糊与块效应;ProGVC 在同等 DISTS 下省 61.5% 码率,但要付出 PSNR 上多花约 8.9 倍码率的代价。两者是保真度工具与感知工具的区别,不能互相替代。
  • vs DCVC-FM / DCVC-B / SEVC:保真度导向的端到端神经编解码器支持可变码率,但不支持可伸缩码流,且低码率视觉质量不佳;ProGVC 在 DISTS 与 NIQE 上全面领先它们,编码更快(0.56 s vs 1.04–1.28 s),解码耗时相当(1.53 s vs 0.88–1.09 s)。
  • vs PLVC(GAN 型感知编解码):PLVC 是强可复现生成基线,但既不支持可伸缩也不支持可变码率,换码率就要重训;在 Xiph 上 ProGVC 的 NIQE BD-rate 是 −62.2% 而 PLVC 是 +169.9%,且 ProGVC 天然覆盖整个码率区间。
  • vs DiffVC 等扩散式感知压缩:扩散模型做解码端去噪器,与熵编码解耦,先验不减少传输比特,且多步迭代去噪导致解码慢(4.54 s vs ProGVC 的 1.53 s);ProGVC 用自回归条件概率直接驱动算术编码,并用单步 argmax 生成被丢弃的尺度。
  • vs VAR / Infinity / InfinityStar:VAR 的下一尺度预测用于图像生成,Infinity 与 InfinityStar 把它扩展到文本到图像、文本到视频;本文第一次把它用于视频压缩,并把「按尺度自回归」从生成机制改造成熵上下文模型,注意力掩码也按压缩需求重新设计(比 InfinityStar 更宽以利用上下文、比 Infinity 更省算力)。
  • vs 图像自回归渐进编码(Zhang et al., ICLR 2026):同源的「自回归 + 渐进编码」思想在超低码率图像压缩上已有验证;本文的增量在于视频特有的帧内/帧间双金字塔、以及 inter 尺度对 intra 尺度的跨帧条件建模。

评分

  • 新颖性: ⭐⭐⭐⭐ 第一次把 VAR 式下一尺度预测用于视频压缩,并把熵上下文与细节生成统一到一个模型里;但渐进式自回归编码在图像上已有先例,属于范式迁移加任务特化,而非全新机制。
  • 实验充分度: ⭐⭐⭐⭐ 三个数据集、五个基线、四个指标外加时序一致性与复杂度对比,三组消融定位清楚;但消融只在 Xiph 上做,DiffVC 未训练,缺少连续码率点的分析。
  • 写作质量: ⭐⭐⭐⭐ 动机链清晰、公式节制、掩码三类设计的对比图直观;部分公式与隐特征维度在缓存文本中有损(⚠️ 以原文为准)。
  • 价值: ⭐⭐⭐⭐ 提出了一个可行且有实际吸引力的新范式——单模型、可伸缩、低延迟、低码率感知质量好;但 PSNR 的巨大差距与离散的码率点限制了短期落地范围。