跳转至

MixCompress: Mixture of Experts for Variable Rate Learned Image Compression

会议: ECCV 2026
论文: ECCV 2026
领域: 信号与通信
关键词: 学习型图像压缩 / 可变码率 / 混合专家模型 / 深度混合 / 梯度冲突消除

一句话总结

针对传统稠密调制可变码率图像压缩中高低码率梯度严重冲突的痛点,MixCompress 通过引入率条件门控的稀疏混合专家(MoE)与自适应深度扩展(MoD),结合条件辅助小波变换(CAT),在单一模型内实现了超越独立单码率模型的最优率失真性能。

研究背景与动机

神经学习型图像压缩(LIC)凭借端到端非线性变换编码与精细上下文概率建模,在率失真效率上已全面超越传统工程编解码器。然而主流 SOTA 模型均采用单码率独立优化策略,面对不同的率失真折中点(由拉格朗日乘子 \(\lambda\) 决定)必须分别训练并持久化整套网络权重。若要在实际业务中覆盖完整的压缩码率区间,系统需要维护数套庞大的独立模型检查点,不仅带来了成倍的训练算力与存储开销,也极大增加了端侧部署和动态码率切换的复杂度。

为了摆脱多模型维护负担,现有可变码率(VBR)方案通常采用共享骨干网络结合稠密参数调制机制,例如条件卷积、仿射变换或潜变量增益缩放。这类方法虽然实现了单一模型支持多码率点,但其实际率失真性能普遍显著劣于针对各个固定码率独立优化的单码率模型。这种性能鸿沟的本质在于多目标优化中的梯度干扰:低码率压缩目标强制抑制信息量、平滑图像以削减码率,其反向传播的平滑梯度会严重破坏高码率目标维护高频纹理细节所需的参数表征;稠密参数共享强行要求单一骨干去拟合差异巨大的非线性映射,导致模型在极端码率之间陷入严重的表征缠绕与负余弦梯度冲突。

既然稠密参数调制无法调和异质码率间的参数竞争,就必须在网络内部实现结构层面的条件特化。核心 idea:将稀疏门控混合专家(MoE)与动态深度扩展(MoD)引入分析、合成与超先验变换的关键瓶颈,配合率自适应频带能量调制的条件辅助小波变换(CAT),利用率条件路由将冲突梯度正交解耦至独立专家子空间,以单一紧凑模型达到乃至超越独立单码率模型的 Pareto 前沿。

方法详解

整体框架

MixCompress 旨在为任意分层端到端图像压缩骨干(如线性注意力架构 LALIC 或混合注意力架构 LIC-TCM)赋予高效的可变码率支持。系统输入为原始图像 \(x\) 与目标码率标量 \(\lambda\),通过对数映射或连续嵌入生成率向量 \(\lambda_e\)。整体架构包含分析变换(编码端)、合成变换(解码端)、超先验编解码器及空间-通道上下文熵模型。为了在不破坏主干特征流的前提下消除梯度干扰,MixCompress 将分析变换、合成变换和超先验网络的深层瓶颈模块替换为率条件门控的 MixCompress 块,并在编解码主干两侧对称引入条件辅助小波变换(CAT 与 iCAT)捷径。

在编码过程中,输入图像经分析变换分层下采样提取潜变量 \(y\),同时 CAT 捷径基于 Haar 小波提取多频带分量并根据 \(\lambda_e\) 进行动态能量缩放补偿;随后超编码器提取超先验潜变量 \(z\)。在解码端,超解码器与空间-通道上下文模型联合估算量化潜变量的均值与方差参数,最后通过含 iCAT 逆频带补偿的合成变换重构出图像 \(\hat{x}\)。在关键瓶颈处,MixCompress 块通过常驻共享专家与根据 \(\lambda_e\) 稀疏选出的 Top-\(K\) 特化专家协作计算,彻底避免了高低码率梯度的直接覆盖。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}, 'subGraphTitleMargin': {'top': 8, 'bottom': 16}}}%%
flowchart TD
    In["输入图像 x 与目标率乘子 λ"] --> Emb["率嵌入生成 λ_e"]
    In --> CAT["条件辅助小波变换 (CAT)<br/>Haar 频带分解 + FiLM 动态能量重权"]

    subgraph Analysis["分析变换 ga (编码主干)"]
        direction TB
        EncFeat["主干特征提取与下采样"] --> MoE_Enc["稀疏结构化 MoE / MoD 瓶颈<br/>共享专家 + Top-K 选通专家"]
    end

    CAT -.->|残差注入| Analysis
    Emb --> MoE_Enc
    Emb --> CAT

    Analysis --> Quant["潜变量量化与超先验熵编码<br/>上下文概率模型估计 μ, σ"]
    Quant --> Synthesis

    subgraph Synthesis["合成变换 gs (解码主干)"]
        direction TB
        DecFeat["主干特征上采样"] --> MoE_Dec["稀疏结构化 MoE / MoD 瓶颈<br/>共享专家 + Top-K 选通专家"]
    end

    Emb --> MoE_Dec
    Emb --> iCAT["逆条件辅助小波变换 (iCAT)<br/>倒数缩放 + IDWT 重建残差"]
    iCAT -.->|残差合并| Synthesis
    Synthesis --> Out["重构图像 x̂ (达到目标码率/失真点)"]

关键设计

1. 条件辅助小波变换 (CAT):率自适应的频带能量紧缩与补偿 传统辅助小波分支(AuxT)利用二维 Haar 离散小波变换(DWT)将特征解耦为低频(LL)与高频(LH, HL, HH)四个子带,以无参数解相关捷径分担主变换负担,但其静态子带缩放因子在跨码率场景下缺乏灵活性——低码率需要激进抑制高频能量以压缩体积,而高码率则急需保留高频分量以还原精细纹理。CAT 为此引入由率嵌入向量 \(\lambda_e\) 调控的 FiLM 调制网络,动态预测子带自适应缩放向量 \(\boldsymbol{\gamma}_\lambda\) 与偏置向量 \(\boldsymbol{\beta}_\lambda\): $$ [\boldsymbol{\gamma}\lambda, \boldsymbol{\beta}\lambda] = f_{\mathrm{film}}(\lambda_e), \quad s^{\mathrm{enc}}\lambda = \boldsymbol{\gamma}\lambda \odot s_{\mathrm{base}} + \boldsymbol{\beta}_\lambda $$ 变换后的小波词元经通道乘法 \(U \odot \exp(s^{\mathrm{enc}}_\lambda)\) 调制后线性映射并残差注入编码主干。解码端 iCAT 则采用对称结构与互补倒数尺度 \(\exp(-s^{\mathrm{dec}}_\lambda)\) 执行逆小波重建(IDWT)。这使得辅助频带能量随压缩目标动态倾斜,在不改变主干拓扑与熵模型的前提下显著提升了多码率适应性。

2. 稀疏结构化 MoE 路由:解耦异质码率的对抗性梯度冲突 针对稠密参数调制中多目标梯度余弦相似度出现长负尾(高低码率互斥破坏)的顽疾,MixCompress 在分析、合成与超先验变换的末端瓶颈配置 \(N\) 个并行专家子网络与 1 个全局共享专家 \(E_{\mathrm{global}}\)。全局专家承载所有码率通用的基底特征流,而路由门控网络根据 \(\lambda_e\) 输出 Top-\(K\) 稀疏权重(默认 \(N=4, K=2\))。当计算两个极值码率 \(\lambda_{\mathrm{low}}\)\(\lambda_{\mathrm{high}}\) 的梯度内积时,结构路由将冲突空间严格限定在两者选通专家的交集内: $$ \langle g_{\mathrm{routed}}(\lambda_{\mathrm{low}}), g_{\mathrm{routed}}(\lambda_{\mathrm{high}}) \rangle = \sum_{i \in \mathcal{T}{\mathrm{low}} \cap \mathcal{T}}}} \langle \nabla_\theta \mathcal{L{\mathrm{low}}, \nabla\theta \mathcal{L}_{\mathrm{high}} \rangle $$ 只要高低码率未选中重叠专家,其在路由子空间内的梯度内积严格为 0。实测显示,该设计将编码器中表现为负梯度余弦相似度的层比例从传统稠密调制的 78% 骤降至 31%,彻底遏制了低码率平滑梯度对高码率纹理细节参数的侵蚀。

3. 渐进深度混合扩展 (MoD):按需自适应拉伸模型表征容量 标准 MoE 各专家具有完全相同的拓扑结构与计算量,然而高码率极限保真度对网络容量的绝对需求天然高于低码率。为了消除固定计算图对高码率上限的压制,MoD 扩展将同质专家升级为不同深度的级联块:第 \(i\) 个专家由 \(i\) 个嵌套变换块(在 LALIC 骨干中采用堆叠的双向 RWKV 块,在 TCM 骨干中采用级联卷积块)串联而成,即 \(E_i(f) = (h_i \circ \dots \circ h_1)(f)\)。所有专家保持统一的输入输出张量尺寸,而门控机制倾向于为高码率分配更深层的专家组合,使得网络能够以非均匀算力按需扩展表征容量,将全网络负梯度冲突层比例进一步压缩至 22%。

4. 门控噪声退火与零开销离线参数固化 由于路由决策完全以率嵌入 \(\lambda_e\) 为输入而脱离具体图像输入 \(x\),常规门控极易在训练早期陷入专家坍缩,导致部分专家永远未被激活。MixCompress 在门控 logits 中引入高斯噪声 \(\epsilon \sim \mathcal{N}(0, \sigma(e)^2)\),其标准差随训练轮次线性衰减至 0(前 20 轮退火),强行激励模型在早期探索所有专家并逐步过渡到确定性专业化分工。更为重要的是,纯 \(\lambda_e\) 条件意味着在推理测试或实际部署时,选通专家的索引与 CAT 调制系数对固定的 \(\lambda\) 是完全确定不变的,可直接通过离线预计算生成静态查表(LUT),在实际前向推理中完全消除了运行期动态门控决策与调度开销。

损失函数 / 训练策略

MixCompress 采用联合可变码率率失真优化目标,训练时每个 mini-batch 均从预设六个码率点中均匀随机采样一个拉格朗日乘子 \(\lambda \sim p(\lambda)\): $$ \min_\theta \mathcal{L}{\mathrm{VBR}}(\theta) = \mathbb{E}; \theta) \right] $$ 其中失真度量 }}} \left[ \lambda D(x, \hat{x}; \theta) + R(\hat{y}; \theta) + R(\hat{z\(D\) 为均方误差(MSE),率权重 \(\lambda \in \{0.0018, 0.0035, 0.0067, 0.0130, 0.0250, 0.0483\}\)。训练遵循三阶段递进策略:第一阶段以学习率 \(1 \times 10^{-4}\) 在 OpenImages 裁剪的 \(256 \times 256\) 图像块上训练 40 个 epoch(前 20 轮包含噪声退火);第二阶段在相同分辨率下降采样学习率至 \(1 \times 10^{-5}\) 训练 4 个 epoch;第三阶段在 \(512 \times 512\) 大分辨率图像块上微调 4 个 epoch 以巩固高频细节表征。整套训练仅需单张 NVIDIA H100 GPU,总训练时长等同于训练单一码率基线模型,却能一次性取代 6 个独立单码率检查点。

实验关键数据

主实验

实验以最新视频编码参考软件 VTM-23.1 作为锚点(BD-Rate 设为 0.00%),在 Kodak、CLIC 验证集(CLIC-V)、CLIC 测试集(CLIC-T)和 Tecnick 四大权威数据集上全面评测了 BD-Rate(PSNR)性能,涵盖单码率 SOTA 独立模型与可变码率基线。

模型类型 方法 VBR 支持 Kodak (%) CLIC-V (%) CLIC-T (%) Tecnick (%)
传统编码基准 VTM-23.1 [18] 0.00 0.00 0.00 0.00
单码率独立检查点 Hyper-prior (Ballé 18) +27.09 +34.27 +35.38 +35.88
单码率独立检查点 Minnen18 [25] +6.89 +2.95 +0.98 +3.30
单码率独立检查点 Cheng20-Parallel [7] -1.77 -4.12 -5.45 -3.52
单码率独立检查点 ELIC [15] -8.95 -12.22 -14.35 -15.07
单码率独立检查点 TCM [24] -16.06 -18.63 -19.70 -20.41
单码率独立检查点 FAT [22] -17.12 -19.07 -20.04 -23.07
单码率独立检查点 LALIC (单码率锚点) [13] -18.81 -23.96 -26.43 -26.03
稠密可变码率基线 LALIC-QRAF [29] -9.32 -13.22 -15.24 -14.36
稠密可变码率基线 LALIC-CondConv [9] -15.12 -19.22 -22.05 -21.60
本文方法 MixCompress-LALIC-MoE -18.81 -24.16 -26.80 -27.05
本文方法 MixCompress-LALIC-MoD -20.12 -25.73 -28.71 -28.88

消融实验

在 LALIC 骨干上逐项拆解 MixCompress 各核心模块对 BD-Rate(PSNR)增益的贡献(均以 VTM-23.1 为锚点):

模型配置说明 Kodak (%) CLIC-V (%) CLIC-T (%) Tecnick (%)
稠密调制基线 (Cond-Conv) -15.15 -19.27 -22.09 -21.53
+ AuxT 静态小波辅助分支 -17.06 -20.76 -23.37 -23.50
+ CAT 率条件动态小波调制 -17.89 -21.92 -24.23 -24.41
+ MoE 同质专家稀疏路由 (\(N=4, K=2\)) -18.81 -24.16 -26.80 -27.05
+ MoD 渐进深度专家扩展 (\(N=4, K=2\)) -20.12 -25.73 -28.71 -28.88

计算复杂度与部署效率分析

对比单模型运行期资源消耗与完整支持 6 个码率点所需的存储占用:

评估模型 编码耗时 (s) 解码耗时 (s) 显存占用 (GB) 计算量 FLOPs (G) 激活/总参数量 (M)
LALIC (单码率单点) [13] 0.234 0.184 0.875 283.39 66.13 / 66.13 (全量 6 模需 ~397M)
MixCompress-MoE 0.252 0.187 1.037 311.99 77.86 / 88.56
MixCompress-MoD 0.257 0.190 1.262 392.02 120.22 / 156.55

关键发现

  1. 反超单码率上限:即使各码率在联合训练中仅分摊到 \(1/6\) 的迭代量,MixCompress-MoD 在 CLIC-T 和 Tecnick 上仍将 BD-Rate 从单码率基准的 -26.43% / -26.03% 大幅推升至 -28.71% / -28.88%,彻底粉碎了“可变码率性能必输于专用模型”的固有认知。
  2. 根除 QRAF 归一化失效陷阱:在注意力骨干中,单纯在量化前做尺度缩放的 QRAF 会遭遇 Bi-RWKV 中 LayerNorm 的逐词元方差压制,导致熵模型彻底失去码率辨识能力,性能严重劣化(Kodak 上落后专用模型 9.49% BD-Rate)。MixCompress 通过改变结构激活路径而不是仅仅拉伸特征幅值,完全避免了该失效问题。
  3. 极佳的部署经济性:传统方案覆盖 6 个码率点需存储约 397M 权重文件,而 MixCompress-MoD 仅需 156.55M 总参数(激活参数仅 120.22M),编码解码耗时仅增加不到 0.02 秒。

亮点与洞察

  • 多任务学习视角的全新突破:首次从多目标优化中“负余弦梯度冲突”的理论视角揭示了可变码率图像压缩中稠密参数共享的根本缺陷,为神经编码器的多模式适配提供了坚实的理论落脚点。
  • 空间解耦与容量解耦双重发力:MoE 在横向将不同码率分流至正交子空间,MoD 则在纵向按需扩展高码率所需的非线性层数,两者与频域的 CAT 协同,形成了完备的条件计算金字塔。
  • 零推理额外开销设计:路由机制纯粹以码率标量 \(\lambda_e\) 驱动,使复杂的动态门控和参数调制能在部署前离线固化为常量表,真正兼顾了学术创新与产业端侧工程落地的严苛限制。

局限与展望

  • 极端密集码率测试支持:虽然论文在补充材料中测试了未见 \(\lambda\) 的连续插值,但当部署环境需要数百个微调步长的超密连续码率时,稀疏专家的离散选通在插值过渡边界处的率失真平滑性仍需进一步评测。
  • 高阶跨模态与视频编码拓展:目前架构聚焦于静态图像的端到端变换瓶颈,未来将该条件路由机制拓展至神经视频编解码(如同时适应时域参考帧距离与运动剧烈程度的多条件门控)具有重要应用前景。

相关工作与启发

  • 从标量增益到结构化神经剪裁:早期工作如 Choi 等人(ICCV 2019)与 Cui 等人(CVPR 2021)主要依赖特征增益与全局条件仿射,缺乏针对网络容量的动态划分;MixCompress 证明了结构专精优于单纯的权重调制。
  • 频率分支与神经网络协同:Li 等人的 AuxT(ICLR 2025)验证了频域小波在解相关上的价值,而 CAT 将其进一步率条件化,启示我们在设计自适应多任务视觉模型时应充分利用经典信号变换的显式频带引导作用。

评分

  • 新颖性: 4.5 / 5.0(将 MoE/MoD 首次引入分层图像压缩瓶颈,并从梯度冲突角度提供深刻洞见)
  • 实验充分度: 4.5 / 5.0(四大数据集充分验证,对比单码率与多码率基准,辅以细致的层级梯度统计与消融)
  • 写作质量: 4.5 / 5.0(理论推导严谨,痛点分析透彻,图表呈现极其清晰)
  • 价值: 5.0 / 5.0(大幅降低工业级神经图像压缩部署与训练成本,奠定了新的工程与学术基准)