Enhanced Neural Video Representation Compression with High Scalability¶
会议: ECCV 2026
论文: ECCV 原文
项目页: https://hmkx.github.io/nvrc-pp/
领域: 模型压缩
关键词: 隐式神经表示、视频压缩、高分辨率特征网格、参数内编码结构、多维熵模型
一句话总结¶
本文提出面向视频压缩的隐式神经表示框架 NVRC++,通过引入高分辨率特征网格、参数内分层B帧编码结构、退火特征网格掩码以及多先验多维网格熵模型,在保持固定解码计算复杂度的同时实现了宽码率范围跨越与最高 7.6 倍于 NVRC 的快速解码。
研究背景与动机¶
隐式神经表示(Implicit Neural Representations, INR)将视频实例映射为紧凑神经网络的权重或特征网格,无需依赖大规模泛化自编码器的通用训练,在解码延迟和率失真性能上展现出巨大潜力。然而,现有高性能 INR 视频编解码器(如 HiNeRV、NVRC)存在致命的扩展性缺陷:为了覆盖不同码率与重建质量,必须为每个质量点训练不同容量的模型配置,导致网络结构与解码计算复杂度随码率线性暴增。在超高清或高码率传输场景下,高昂的算力开销直接抵消了过拟合神经表示天然具备的轻量解码优势,使得统一硬件或软件解码流水线的落地极为困难。
与此相对,虽然已有轻量级过拟合方案尝试借助高分辨率网格降低解码器容量,但往往受制于算力与显存瓶颈:直接在整段长视频中对高维特征网格拟合自回归熵模型会导致显存爆炸,现有工作不得不退而求其次,将视频分割为独立空间块(patches)或极短片段(clips)分别编码,彻底破坏了长程时空连续性;同时,高分辨率网格在低码率下极易发生空间过拟合,削弱了相邻像素间共享隐式先验的红利,导致压缩效率严重退化。高性能与固定低复杂度之间始终存在难以逾越的鸿沟。
本文的切入角度是打破模型容量与重构质量的绑定关系,将视觉细节的高容量表征完全卸载到密集特征网格上,同时重塑网格内部的依赖建模与训练流程。核心 idea:构建以轻量化网络 HiNeRV++ 与多尺度高分辨率特征网格为核心的表示架构,在网格参数内部引入解耦量化的分层 B 帧编码时序切片与退火掩码机制,并配合融合时空尺度先验的快速熵模型,在极低且恒定的解码复杂度下实现覆盖宽码率的高性能视频压缩。
方法详解¶
整体框架¶
NVRC++ 整体由改进的轻量级隐式神经表示网络 HiNeRV++、参数内编码结构以及多先验网格熵模型构成。输入视频的长序列时空动态首先映射到多尺度高分辨率特征网格的各时序切片中,模型仅需经过极其紧凑的卷积层与末端 Pixel Shuffle 即可直接合成全分辨率视频帧。为了消除整段视频反向传播时的梯度缓存爆炸,框架重构了时序切片的依赖机制,并在优化阶段通过率失真解耦与随机采样高效拟合长序列。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["长视频序列输入"] --> B["多尺度高分辨率网格与HiNeRV++"]
B --> C["参数内分层B帧时序切片"]
C --> D["特征网格退火掩码正则化"]
D --> E["时空尺度融合的多维网格熵模型"]
E --> F["恒定复杂度全高清视频实时解码"]
关键设计¶
1. 多尺度高分辨率特征网格与HiNeRV++:解耦模型复杂度与重建质量 传统 NeRV 类架构为了提升画质必须拓宽网络通道或加深层数,造成高码率下解码 MACs 激增。HiNeRV++ 反其道而行之,将主要表征负担从密集网络层完全转移到高分辨率多尺度特征网格上。在网络前三个下采样阶段直接注入各尺度多分辨率网格提取的特征编码,并在输入端引入多参考上下文机制:除了当前时刻的三线性插值特征外,显式拼接入相邻未受插值模糊的原始网格切片,使网络直接获取保真度极高的高维时空线索。为了进一步压降最高分辨率阶段的计算开销,HiNeRV++ 彻底舍弃高分辨率下冗重的 ConvNeXt 模块与复杂 Head,改用单层 Pixel Shuffle 直接升采样至 RGB 像素空间,将网络层参数压缩至最低 1.23M 并保证不同码率下固定的超低解码负载。
2. 参数内分层B帧编码结构与无条件量化:打破长视频过拟合的显存瓶颈 高维网格直接进行整段过拟合会引发计算与显存灾难,而传统视频编码自回归依赖会导致深层激活值无法释放。NVRC++ 借鉴传统视频编码的分层 B 帧概念,将每个尺度的网格张量沿着时间轴切分为 \(T_{\text{grid}}\) 个时序切片 \(\{z_t\}\),构建 \(K\) 层分层依赖关系:高层级切片先行编码并作为低层级切片的条件参考,切片间可跨越多个视频帧进行时序内插共享。关键机制在于,NVRC++ 彻底移除了条件量化偏移量(Offset),采用全序列共享的无条件、对称量化步长 \(\delta_l\):
这种无条件量化完全斩断了切片之间的误差前向累积链,使得各切片的率估计(Rate Estimation)与失真计算(Distortion Computation)在数学上完全解耦。在反向传播时,无需保留整条时序激活链,支持对时序切片进行随机子采样优化并用期望值缩放全局码率,使得超过 1 亿参数的超大网格模型在 24GB 显存的消费级 GPU 上即可从容完成 600 帧 1080P 视频的端到端拟合。
3. 特征网格退火掩码:抑制低码率高频过拟合 引入高分辨率特征网格后,低码率压缩性能往往会出现反常断崖式下跌。这是由于低分辨率网格依赖像素间强共享机制建立时空冗余平滑表征,而高分辨率网格表达能力极强,在训练初期极易过拟合到微小区域甚至孤立像素噪声,破坏了全局时空相关性的挖掘。NVRC++ 提出了受 Dropout 启发的网格退火掩码机制:在优化初始阶段,以较高概率随机遮蔽高分辨率特征网格,强制梯度回传并激活低分辨率网格去拟合主体轮廓与长程运动;随着训练迭代步推进,掩码保留比例按预设退火调度逐步增加,在训练后期平滑降至零。这一机制对率失真两端计算完全一致,有效拉平了高分辨率网格在全码率范围内的率失真表现。
4. 结合时空与尺度先验的多维网格熵模型:兼顾压缩率与高吞吐并行 传统的全自回归 3D 卷积熵模型必须串行扫描三维网格,解码吞吐极低。NVRC++ 设计了三路先验融合的网格条件概率估计器。在尺度维度(Scale Prior)上,低分辨率网格先行编码,通过线性插值作为高分辨率网格的强条件 \(\hat{z}_t^{l-1}\);在时间维度(Temporal Prior)上,利用分层 B 结构的高层级参考切片 \(\hat{z}_{\tau^0_t}^l\) 提供运动上下文;在空间维度(Spatial Prior)上,单张切片内部采用 1-4 步棋盘掩码模式 \(m_s(\hat{z}_t^l)\),仅依赖前序已解码棋盘区域预测当前位置的高斯分布均值 \(\mu\) 与尺度 \(\sigma\):
将繁重计算转化为步数极少的并行矩阵前向推理,大幅提升了熵编解码的工程吞吐。
损失函数 / 训练策略¶
训练过程遵循经典的拉格朗日率失真优化目标:
其中失真项 \(D\) 包含重建帧与真实帧之间的综合失真,率估计项 \(R(\hat{\theta})\) 基于熵模型输出的连续概率分布积分计算。由于无条件量化与参数内分层结构彻底解耦了梯度链,NVRC++ 采用双重优化策略:失真计算步骤跳过复杂的熵模型前向,专注于 HiNeRV++ 参数与网格对像素值的残差拟合;码率估算步骤对时序切片进行随机采样并利用尺度先验执行梯度更新。全流程无需昂贵的前向特征缓存,大幅压低显存占用。
实验关键数据¶
主实验¶
在 UVG(7 序列,300-600 帧全高清 1080P)和 MCL-JCV(30 序列,120-150 帧全高清 1080P)上,以 x265 (veryslow) 为基准计算 BD-rate,解码速度在单张 NVIDIA RTX 4090 GPU(FP16 混合精度)上评测。NVRC++ 配置为 S1(超轻量)、S2(轻量)、S3(均衡)、S4(高容量)四种恒定复杂度规格。
| 方法 | 类型 | UVG PSNR BD-rate (%) | UVG MS-SSIM BD-rate (%) | MCL-JCV PSNR BD-rate (%) | 解码复杂度 (kMACs/px) | 解码速度 (FPS) |
|---|---|---|---|---|---|---|
| x265 (veryslow) | 传统 | 0.00 | 0.00 | 0.00 | - | - |
| HM-18.0 (RA) | 传统 | -44.54 | -43.85 | -39.91 | - | - |
| VTM-20.0 (RA) | 传统 | -62.81 | -61.74 | -58.86 | - | - |
| DCVC-FM | 深度自编码器 | -66.30 | -67.16 | -58.33 | 369.6(I)/865.5(P) | 3.7 |
| DCVC-RT | 深度自编码器 | -65.56 | -68.05 | -57.40 | 364.9(I)/166.8(P) | 57.8 (141.9*) |
| HiNeRV | INR | -45.84 | -63.04 | -28.75 | 87.3 - 346.3 | 13.3 - 49.9 |
| NVRC | INR (SOTA) | -73.74 | -80.65 | -51.61 | 173.4 - 930.6 | 14.0 - 33.2 |
| C3 | 轻量网格 INR | -21.91 | -14.06 | -19.42 | 4.4 | 434.0 |
| NVRC++ (S1) | 本文 (超轻量) | -40.06 | -67.59 | -22.07 | 7.3 (恒定) | 365.0 |
| NVRC++ (S2) | 本文 (轻量) | -61.41 | -76.78 | -47.61 | 25.1 (恒定) | 162.9 |
| NVRC++ (S3) | 本文 (均衡) | -71.20 | -81.25 | -55.90 | 92.5 (恒定) | 73.4 |
| NVRC++ (S4) | 本文 (高容量) | -74.82 | -81.88 | -51.84 | 357.7 (恒定) | 34.0 |
注:DCVC-RT 带星号速度为采用定制 CUDA 核心运行结果;NVRC++ 仅采用纯 PyTorch 实现即达到上述解码帧率。
消融实验与架构对比¶
消融实验以 NVRC++ (S2) 为基准,在 UVG 数据集上验证核心组件贡献;架构对比在 UVG 上评估 HiNeRV (S) 与 HiNeRV++ (S2) 的参数量与收敛性。
| 配置 / 变体 | PSNR BD-rate 变化 (%) | MS-SSIM BD-rate 变化 (%) | 说明 |
|---|---|---|---|
| NVRC++ (S2) 完整模型 | 0.00 (Anchor) | 0.00 (Anchor) | 恒定复杂度 25.1 kMACs/px,162.9 FPS |
| (v1) 替换为仅低分辨率网格 | +44.01 | +59.00 | 丧失高维细节拟合容量,性能严重崩塌 |
| (v2) 移除特征网格退火掩码 | +30.33 | +39.77 | 高分辨率网格在低码率下严重空间过拟合 |
| (v3) 移除熵模型空间先验 | +1.42 | +0.52 | 缺少棋盘切片局部上下文条件 |
| (v4) 移除熵模型时序先验 | +5.13 | +4.00 | 缺少分层 B 帧切片间的时序相关性 |
| (v5) 移除熵模型尺度先验 | +6.12 | +6.60 | 跨尺度特征间先验引导缺失 |
| (v6) 多参考改为 2D 卷积 Stem | +35.55 | +31.64 | 降级为传统浅层提取,时空线索严重丢失 |
| (v7) 多参考改为 3D 卷积 Stem | +7.76 | +8.44 | 纯 3D 卷积对时序切片融合劣于多参考切片 |
HiNeRV 与 HiNeRV++ 架构对比(UVG 数据集):
| 模型架构 | 网格参数 / 网络层参数 | 计算复杂度 (kMAC/px) | 解码帧率 (FPS) | 37 Epochs PSNR | 300 Epochs PSNR |
|---|---|---|---|---|---|
| HiNeRV (S) | 0.35M / 2.84M | 87.3 | 35.5 | 33.70 dB | 35.27 dB |
| HiNeRV++ (S2) | 100.06M / 1.23M | 24.8 | 162.9 | 37.36 dB | 39.46 dB |
关键发现¶
- 网格表征解耦带来颠覆性提速与收敛红利:HiNeRV++ 将网络层参数从 2.84M 压缩至 1.23M,而将细节完全存储在 100M 高维网格中,使得计算复杂度直降 71.6%(87.3 \(\to\) 24.8 kMACs/px),解码帧率从 35.5 FPS 飞跃至 162.9 FPS(4.6倍速);同时,仅训练 37 轮的 PSNR(37.36 dB)便已大幅超越原始 HiNeRV 训练 300 轮的最终收敛上限(35.27 dB),显示出高维网格直接拟合信号的卓越效率。
- 高分辨率网格与退火掩码是决定率失真上限的关键:消融实验中去掉高分辨率网格(v1)导致 BD-rate 暴增 +44.01%,移除退火掩码(v2)则带来 +30.33% 的巨大退化,证明高分辨率网格必须配合退火约束才能在全码率段实现稳健表现。
- 恒定复杂度下的超宽码率扩展性:在 S3 单一模型配置下,NVRC++ 跨越了极其宽广的码率区间,不仅全面击败 VTM 与 DCVC-RT,且相比前代 SOTA NVRC,在率失真曲线相当的前提下将解码速度最高提升了 7.6 倍。
亮点与洞察¶
- 复杂性与码率的完全解耦:彻底颠覆了 NeRV 系列“高质量必搭大网络”的固有范式,证明了轻量卷积骨干配合高维网格能够以固定的极小计算预算适配极端跨度的视频质量需求。
- 无条件量化与参数内分层 B 机制:将传统视频编码中的分层 B 帧设计巧妙嫁接到隐式神经表示的特征切片中,并通过剔除条件 Offset 切断了误差梯度链,一举攻克了长视频在消费级显卡上拟合超亿级网格的显存墙障碍。
- 多先验快速熵编码设计:利用有限步数的棋盘掩码空间上下文与跨尺度、跨时序切片条件,在维持极高熵解码并行吞吐的同时,充分压榨了模型参数中的时空统计冗余。
局限与展望¶
- 过拟合编码耗时依然高昂:尽管解码端实现了实时超快吞吐,但编码端仍需数百轮反向传播迭代优化(Encoding FPS 仅在 0.005 - 0.020 左右),暂不适用于强实时交互式视频通话场景。
- 显存与硬件带宽权衡:由于大量信息迁移至特征网格,虽然计算复杂度(MACs)显著下降,但网格读取对显存带宽的需求提升,低端嵌入式设备上的访存带宽利用率值得进一步探索。
- 未来方向:探索与前向生成模型(如视频扩散模型或自回归视频基础模型)的少步微调结合,大幅压缩编码过拟合时间,推进面向点播流媒体分发场景的规模化落地。
相关工作与启发¶
- vs HiNeRV / NVRC: HiNeRV 依赖深层网络逐级上采样,且 NVRC 在高码率下模型体积与解码计算开销急剧膨胀(高达 930 kMACs/px)。NVRC++ 采用 HiNeRV++,固定了解码复杂度(S1-S4 各档恒定),在相同性能下将解码速度提升最高 7.6 倍,并解决了显存爆炸问题。
- vs C3 / COOL-CHIC: C3 和 COOL-CHIC 虽然采用了极轻量解码器加特征网格,但因显存限制不得不切分成空间独立 patch 或极短片段分别编码,丢失了全序列长程相关性,压缩率远落后于传统 VTM。NVRC++ 借助分层切片与解耦采样,实现了全序列单模型端到端拟合,压缩效率显著反超。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 成功将分层 B 帧结构引入隐式网格参数内部,并提出无条件量化解耦与退火掩码机制,思路极具创新性。
- 实验充分度: ⭐⭐⭐⭐⭐ 覆盖 UVG、MCL-JCV 等权威长序列全高清测试集,与前沿传统标准及 SOTA 神经编解码器进行了全面的率失真与复杂度对比,消融扎实。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密,图表清晰,问题痛点与工程机制阐述深入透彻。
- 价值: ⭐⭐⭐⭐⭐ 攻克了隐式神经表示视频编解码向工程实用化迈进的核心瓶颈(固定低算力、宽码率覆盖、高速解码),具有极高行业参考价值。