TAQ: Static-Deployable Temporal-Aware Quantization for Real-World Video Super-Resolution¶
会议: ECCV 2026
论文: ECCV 2026 Official
代码: https://github.com/imaboybut/TAQ
领域: 模型压缩
关键词: 视频超分辨率, 后训练量化, 静态部署, 时序一致性, 边界集成
一句话总结¶
针对端侧视频超分辨率部署中动态量化开销过大以及静态量化忽略时序漂移的问题,TAQ 提出了仅在离线校准阶段感知时序的静态后训练量化框架,通过序列级直方图初始化、相邻帧间差分时序微调以及量化边界集成,生成单一静态量化参数,在 Jetson Orin Nano 上实现了 3.56 倍实际加速并显著抑制了时序闪烁。
研究背景与动机¶
真实场景下的视频超分辨率(VSR)在移动端画质增强、超高清流媒体传输和老旧视频修复等场景中至关重要。然而,先进的 VSR 模型(如结合变形注意力的循环架构与 Transformer 结构)通常具有极高的计算复杂度与内存占用,严重阻碍了在边缘硬件上的低延迟部署。后训练量化(PTQ)无需全量重训即可将浮点网络映射至低比特整数格式,是模型压缩与加速的理想方案。但在边缘计算设备上,静态执行管线(如 NVIDIA TensorRT 编译优化)对加速至关重要:一旦推理引擎编译完成,激活值与权重的量化参数(截断边界与缩放因子)必须严格固定,任何依赖运行期输入统计的动态重算都会大幅拖慢推理。实验表明,依赖运行期动态量化的 VSR 方案在 Jetson Orin Nano 上的吞吐仅为 0.266 fps(甚至落后于 FP32 原型的 0.325 fps,加速比仅 0.79×)。
然而,若直接退回到传统的静态 PTQ 方案,模型在视频领域会遭遇两大核心矛盾。其一是序列级多模态分布差异(Sequence-wise Multimodality):不同视频片段在场景内容、运动幅度和真实退化类型上差异巨大,如果直接将所有校准片段混合成全局单一分布统计量,算出的全局截断边界必然存在系统性偏差——对平缓片段过宽而引入严重舍入误差,对剧烈片段过窄而造成关键高频纹理截断。其二是时序误差漂移与闪烁(Temporal Error Drift):图像级 PTQ 仅优化单帧空间特征或像素重构,量化扰动在时间轴上逐步累积,在输出视频中表现为严重的频带闪烁与抖动。
面对既要满足硬件静态编译对单一固定参数的严苛约束,又要解决多序列异构分布与帧间时序漂移的矛盾,本文采取“离线专门化校准再聚合”的切入视角:将复杂的视频感知与时序对齐全部限制在离线校准阶段,在线推理则完全维持零计算开销的静态参数。核心 idea:在离线校准中针对各个独立视频序列估计专属激活边界,借助无权重重训的帧间差分对齐损失微调量化边界以抑制时序误差漂移,最后通过算术平均集成将异构序列边界凝聚为单一套可在端侧静态部署的高鲁棒量化参数。
方法详解¶
整体框架¶
TAQ 框架旨在为预训练 VSR 网络生成完全静态的仿射均匀量化参数。整个流程完全在离线校准阶段完成,共分为三个相辅相成的阶段:首先是序列级直方图初始化,为每个校准视频序列独立估计激活截断边界,保留多模态片段的异构特征;随后进入时序微调阶段,将浮点参考模型与量化模型并行输入相同序列,以量化边界为唯一可学习参数,最小化连续帧差分对齐损失,从根源消除时序误差漂移;最后通过边界集成,将各序列优化后的截断区间通过算术平均凝聚为全网唯一的静态量化参数组,直接烧录进静态推理引擎(如 TensorRT INT8)。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["校准视频集输入<br/>多序列片段分组"] --> B["序列级直方图初始化<br/>保留片段多模态分布"]
B --> C["时序微调<br/>连续帧差分对齐损失"]
C --> D["序列级量化边界集成<br/>算术平均聚合为单一静态参数"]
D --> E["静态引擎部署<br/>TensorRT INT8 零运行期开销推理"]
关键设计¶
1. 序列级直方图初始化:化解全局混合校准的分布失真
传统 PTQ 方法(如 MinMax、PTQ4SR、2DQuant)在校准时通常将来自不同视频的所有帧激活值混合,统计出单一全局直方图并求解最小均方误差(MSE)。但视频数据存在显著的片段多模态特性,全局统计会被极端片段拉偏。TAQ 改变这种混合模式,对校准集中的每个独立视频序列分别前向传播收集激活值。在构建直方图前,首先采用百分位截断(默认下限 0.1%、上限 99.9%)剔除罕见激活离群点;随后将截断后的激活值划分为 \(K\) 个直方图 bin(默认 \(K=1024\))。设第 \(k\) 个 bin 的中心值为 \(c_k\),样本频次为 \(w_k\),针对该序列独立求解加权量化重构损失:
其中 \(Q_b(\cdot; \ell, u)\) 为仿射均匀量化算子,步长 \(\Delta = (u - \ell)/(2^b - 1)\)。该设计使每个序列均获得最拟合自身统计特性的初始截断边界 \((\ell^{(s)}, u^{(s)})\),既避免了全局统计带来的截断与舍入偏差,又为后续的时序微调提供了稳定的起点。
2. 时序微调:通过帧间差分对齐抑制时序误差累积
图像级 PTQ 即使单帧重构误差很小,微小的量化扰动在连续帧间随机波动也会引发肉眼可辨的闪烁伪影;而若直接优化单帧绝对重构误差 \(\|F_t - Q_t\|_2\),模型往往陷入空间细节过度平滑。TAQ 引入差分一致性约束,在不改变预训练网络权重与网络结构的前提下,仅将各量化器的截断边界 \(\theta = \{(\ell_q, u_q)\}_{q \in \mathcal{Q}}\) 作为可学习参数(梯度通过直通估计器 STE 反向传播)。令浮点参考模型在时间 \(t\) 输出的高分辨率帧为 \(F_t\),量化模型输出为 \(Q_t\),定义相邻帧差分为 \(\Delta F_t = F_t - F_{t-1}\) 以及 \(\Delta Q_t = Q_t - Q_{t-1}\)。TAQ 构建时序一致性损失函数:
通过迫使量化模型的帧间变化速率对齐浮点模型,两帧之间固有的静态量化偏差在差分运算中相互抵消,优化目标精准聚焦于抑制帧间突变和抖动。时序微调在每个序列上轻量迭代数个 epoch,产出在各序列上兼顾高保真度与强时序连贯性的特化边界。
3. 序列级量化边界集成:兼顾异构统计与静态硬件部署
边缘硬件的静态部署要求推理期全局只能有一套不可变的量化参数 \((\ell_q^{\mathrm{ens}}, u_q^{\mathrm{ens}})\)。为将前述步骤在集合 \(\mathcal{S}\) 中获得的多个序列特化最优参数 \(\{\hat{\theta}_q^{(s)}\}_{s \in \mathcal{S}}\) 融合成鲁棒的静态值,TAQ 建立了一个静态边界凝聚目标:寻找一个常数参数 \(\theta_q\),使其与所有序列的最优参数保持最小加权 \(L_2\) 欧氏距离。在无偏先验假设下,每个序列权重相等(\(\alpha_s = 1/|\mathcal{S}|\)),其闭式全局最优解即为算术平均:
由于输入激活在直方图阶段已经历了 99.9% 百分位截断过滤,序列级极端异常值的影响已受到严格约束;集成操作进一步将单个校准序列带来的方差衰减为原本的 \(1/|\mathcal{S}|\)。该设计巧妙绕过了动态运行期统计,使模型以完全静态的仿射参数直接被编译入 TensorRT 引擎,彻底释放专用 INT8 计算单元的并行吞吐。
损失函数 / 训练策略¶
在时序微调阶段,预训练模型的全部权重、偏置及网络拓扑严格冻结,仅量化器截断上下界 \((\ell, u)\) 接收反向传播梯度。采用 Adam 优化器,学习率设为 \(5 \times 10^{-4}\)。校准集默认采用 9 个 REDS 视频序列,每个序列包含 20 帧输入差分对,微调轮数为 5 个 epoch。整个优化过程计算极轻量,在单张 NVIDIA RTX A6000 GPU 上总校准耗时仅 32 分钟,甚至低于图像级基线 2DQuant(36 分钟)。
实验关键数据¶
主实验¶
在代表性视频超分辨率骨干 RealViformer(\(\times 4\) 放大)上,评估 REDS、SPMCS、UDM10 测试集(含失真评估)与 VideoLQ(真实野生无参考视频)的综合表现。涵盖 2/3/4/8 比特位宽,重点评估图像感知质量指标 LPIPS 与时序一致性关键指标 TLPIPS、TOF(光流差分绝对均值)。
| 数据集 | 指标 | 2-bit (2DQuant / 本文) | 3-bit (2DQuant / 本文) | 4-bit (2DQuant / 本文) | 8-bit (2DQuant / 本文) |
|---|---|---|---|---|---|
| REDS | PSNR (dB)↑ | 24.0987 / 24.5386 | 22.0758 / 22.2444 | 23.1155 / 23.8949 | 25.7180 / 25.7768 |
| SSIM↑ | 0.5209 / 0.5944 | 0.4243 / 0.4252 | 0.5306 / 0.5480 | 0.6767 / 0.6772 | |
| LPIPS↓ | 0.7298 / 0.7142 | 0.5848 / 0.5757 | 0.4828 / 0.4724 | 0.2660 / 0.2517 | |
| TLPIPS↓ | 10.0091 / 5.7869 | 20.0603 / 15.3259 | 12.9041 / 10.0249 | 1.4566 / 1.2161 | |
| TOF↓ | 43.8434 / 31.7238 | 52.9386 / 45.2512 | 29.0666 / 23.6122 | 6.9301 / 5.9729 | |
| SPMCS | PSNR (dB)↑ | 24.6055 / 24.7626 | 22.4048 / 22.3462 | 24.0131 / 24.0377 | 25.9200 / 25.9252 |
| SSIM↑ | 0.6054 / 0.6126 | 0.4067 / 0.4462 | 0.5512 / 0.5709 | 0.6932 / 0.6941 | |
| LPIPS↓ | 0.6931 / 0.6730 | 0.5675 / 0.5710 | 0.4647 / 0.4582 | 0.2979 / 0.2754 | |
| TLPIPS↓ | 17.6929 / 14.0521 | 28.3180 / 26.1131 | 24.1784 / 19.6660 | 4.2171 / 3.8087 | |
| TOF↓ | 14.0130 / 5.8894 | 55.8117 / 30.7197 | 34.5345 / 12.5978 | 1.9064 / 1.5042 | |
| UDM10 | PSNR (dB)↑ | 28.2226 / 28.3204 | 24.7232 / 24.7274 | 27.1506 / 27.2359 | 30.3029 / 30.3708 |
| SSIM↑ | 0.7683 / 0.7744 | 0.5553 / 0.5462 | 0.6964 / 0.7244 | 0.8601 / 0.8664 | |
| LPIPS↓ | 0.6009 / 0.5971 | 0.5867 / 0.6063 | 0.4763 / 0.4604 | 0.2495 / 0.2161 | |
| TLPIPS↓ | 14.6868 / 11.3868 | 23.8387 / 21.6668 | 19.7242 / 15.5704 | 3.3868 / 2.0095 | |
| TOF↓ | 85.8837 / 62.4279 | 126.6288 / 83.1930 | 89.3016 / 71.7848 | 28.7950 / 25.0208 | |
| VideoLQ | ILNIQE↓ | 40.7119 / 39.1392 | 29.6925 / 29.3606 | 27.8252 / 27.4141 | 26.3192 / 26.2863 |
| NRQM↑ | 2.6489 / 4.7491 | 4.0320 / 6.6185 | 4.7833 / 6.0281 | 4.5939 / 4.9738 |
在 NVIDIA Jetson Orin Nano 嵌入式开发板上的实测部署性能(BasicVSR 骨干,输入 Vid4 32 帧): - FP32 原生基线:吞吐量 0.3245 fps,单帧延迟 2.987 s,加速比基准 \(1.00\times\) - QBasicVSR 动态 INT8:吞吐量 0.2661 fps,单帧延迟 3.738 s,加速比仅 \(0.79\times\)(慢于 FP32) - TAQ 静态 INT8(本文):吞吐量 1.1459 fps,单帧延迟 0.839 s,加速比高达 \(3.56\times\)
消融实验¶
核心模块贡献消融(4-bit RealViformer 在 REDS 数据集):
| 配置 | PSNR (dB)↑ | SSIM↑ | LPIPS↓ | TLPIPS↓ | TOF↓ | 说明 |
|---|---|---|---|---|---|---|
| 全局单一范围基准 (Global single range) | 23.1268 | 0.4689 | 0.5555 | 15.3454 | 55.4030 | 传统混合序列全局统计校准 |
| 仅序列级集成 (Seq-wise ensembling) | 23.8104 | 0.5479 | 0.4915 | 11.3696 | 27.5246 | 消除多模态偏置,PSNR+0.68dB,TOF降低50% |
| 完整模型 (Seq-wise + TempRef) | 23.8949 | 0.5480 | 0.4724 | 10.0249 | 23.6122 | 增加时序差分微调,时序漂移进一步显著压降 |
边界聚合策略消融(4-bit RealViformer 在 REDS 数据集):
| 聚合方式 | PSNR (dB)↑ | SSIM↑ | LPIPS↓ | TLPIPS↓ | TOF↓ | 说明 |
|---|---|---|---|---|---|---|
| 中位数 (Median) | 23.0800 | 0.5355 | 0.4821 | 10.1316 | 23.6815 | 抹平分布展宽,空间保真度严重损失 |
| 截尾均值 (Trimmed mean) | 23.8851 | 0.5451 | 0.4786 | 10.0418 | 24.2053 | 去除极值序列,但在百分位截断前提下优势微弱 |
| 算术均值 (Mean, 本文) | 23.8949 | 0.5480 | 0.4724 | 10.0249 | 23.6122 | 综合表现最佳,完美平衡空间细节与时序稳定性 |
关键发现¶
- 序列级校准是保真度的首要贡献者:从全局单范围到序列级初始化使得 PSNR 飙升 0.68 dB,TOF 骤降 27.88,证实消除多模态序列的分布偏差是低比特量化的核心;
- 时序微调专精压制闪烁:时序一致性损失专注于帧间增量变化,在几乎不增加校准成本的前提下将 TLPIPS 进一步降低 1.34,在 y-t 剖面图上消除了锯齿与条纹伪影;
- 动态量化在端侧存在负优化陷阱:动态 VSR 量化虽然在理论上自适应调节 bit,但由于中断了 TensorRT 深度融合算子并引入动态范围规约计算,实际硬件延迟反而比浮点模型更慢,静态部署是边缘落地的绝对必要条件。
亮点与洞察¶
- 将时序感知完全卸载至离线校准:传统时序感知量化倾向于在推理期做流引导或动态分支,TAQ 创造性地通过“特化微调-算术集成”将动态信息沉淀为静态超参数,兼得模型精度与硬件吞吐。
- 帧间差分对齐的偏差抵消技巧:直接拉齐单帧绝对像素容易导致高频模糊,但对齐帧间一阶差分(\(\Delta F_t \leftrightarrow \Delta Q_t\))能在数学上自动消除稳态量化偏置,是处理连续视频任务量化误差的通用范式。
- 高鲁棒的边界集成泛化性:仅用 9 个序列的平均集成参数,即可在分布完全未知的 SPMCS、UDM10 及野生无参考 VideoLQ 上稳定运行,且能无缝迁移到 RealBasicVSR 等 CNN 架构。
局限与展望¶
- 作者承认的局限:目前的时序微调仅依赖简单的一阶相邻帧差分,未显式结合光流或运动矢量;在剧烈全局相机运动或遮挡区域,差分信号可能退化为大范围非对齐误差。
- 潜在改进方向:当前在序列间采用简单的均等权重(\(1/|\mathcal{S}|\))算术平均,未来可探索基于序列运动幅度或退化特征的无损先验加权规则;此外,可进一步探索将静态时序对齐思想推广到生成式扩散视频超分辨率(Video Diffusion Models)的量化加速中。
相关工作与启发¶
- vs PTQ4SR / 2DQuant: 二者均为先进的图像级超分辨率 PTQ 方案,但在校准时把所有视频帧混合为单一分布,忽略了多模态差异与时序漂移;TAQ 保持了其高效性,并引入序列级分解与帧间差分约束,低比特下时序指标大幅领先。
- vs QBasicVSR: QBasicVSR 依赖推理期的光流估计进行动态位宽选择与激活重算,计算图动态化导致 TensorRT 加速受阻(Jetson 上仅 0.79×);TAQ 坚持全静态推理,在更低平均位宽(固定 6/7 vs 动态 6/7.14)下取得更高画质,硬件实测获得 3.56× 真正端侧加速。
评分¶
- 新颖性: ⭐⭐⭐⭐ [针对端侧硬件严苛的静态部署限制,提出“离线序列特化+差分对齐+参数集成”的全新范式]
- 实验充分度: ⭐⭐⭐⭐⭐ [覆盖 4 个基准数据集、2/3/4/8 全位宽对比、Jetson Orin Nano 真实上板测速及详尽消融]
- 写作质量: ⭐⭐⭐⭐⭐ [问题定义明确切中工业界落地痛点,逻辑自洽,数学论证与图表呈现清晰紧凑]
- 价值: ⭐⭐⭐⭐⭐ [为真实场景边缘端视频超分辨率的高效部署指明了静态量化的正确路径,开源代码实用性强]