Controllable Generative Reference for Stereo Image Compression via Reliability-Aware Gating¶
会议: ECCV 2026
论文: ECCV 2026
领域: 3D 视觉
关键词: 双目图像压缩, 扩散先验, 可控参考生成, 可靠性感知门控, 熵模型
一句话总结¶
针对传统双目图像压缩在视场外(OOV)区域匹配失效与强量化伪影传递的瓶颈,提出利用预训练扩散模型并结合联合语义-空间控制合成高质量目标视点参考,再通过可靠性感知门控自适应调节熵模型信息流,实现了显著超越现有 SOTA 的率失真性能。
研究背景与动机¶
双目立体图像压缩作为双目视觉系统在 3D 沉浸式远程临场与自动驾驶等任务中的底层核心技术,其基础逻辑在于通过挖掘双视角间的互补冗余来大幅削减传输码率。主流方法经历了从传统编码标准(如 MV-HEVC)到基于学习的显式几何对齐(视差变换、光流偏移)以及隐式特征交互(双向交叉注意力、掩码图像建模)的演进。这些方法都建立在“依赖压缩后的参考视点建立显式对应关系”的前提之上。
然而,在低带宽与严苛压缩比约束下,这种依赖显式对应关系的范式面临两个根本性瓶颈:其一,参考视点(通常为左图)经由强量化后自身高频纹理严重丢失,跨视点交互不可避免地将量化噪声与模糊伪影传播至目标视点;其二,由于基线视差的存在,目标视点中必然存在物理遮挡与视场外(Out-of-View, OOV)区域,在这些完全不存在几何对应关系的死角,传统注意力与对齐模块发生上下文耗尽,导致预测完全崩溃。与此同时,直接引入无约束扩散生成模型虽能凭借强大的生成先验补全逼真纹理,但随机生成过程与双目几何的一致性冲突会导致像素级客观指标(如 PSNR / MS-SSIM)遭遇断崖式下跌。
本文切入的角度是:摆脱对退化参考视点显式像素对应关系的刚性依赖,将视点间预测重构为“条件可控的生成式补全任务”,同时在熵模型中建立动态门控防线隔离不可靠生成。核心 idea:利用预训练扩散模型并结合左图几何锚点与极低码率右图语义条件合成高质量目标视点参考,再通过可靠性感知门控动态剔除生成偏差,在保持严格像素保真度的同时最大化利用生成先验。
方法详解¶
整体框架¶
整体框架采用非对称三阶段压缩流水线。首先,输入双目对 \((x_L, x_R)\) 中的左图 \(x_L\) 作为锚点视点,通过标准端到端学习图像压缩(LIC)网络完成编码并重构出 \(\hat{x}_L\),既作为最终左图输出,又充当严谨的几何锚点;其次,在生成参考阶段,冻结的潜空间扩散模型(LDM)在联合语义-空间控制(Joint Semantic-Spatial Control)的引导下,仅需单步推理即可合成具备高保真纹理与补全 OOV 结构的高质量右图参考 \(x_{gen}\);最后,在目标视点压缩阶段,结合 \(\hat{x}_L\) 的几何特征与 \(x_{gen}\) 的生成特征构建混合上下文,利用可靠性感知门控(Reliability-Aware Gating)动态评估生成特征的置信度,自适应修正高斯熵模型的均值与尺度参数,完成右图潜在表示 \(\hat{y}_R\) 的高保真率失真优化重构 \(\hat{x}_R\)。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
subgraph S1["第一阶段:锚点视点压缩"]
direction TB
XL["左图输入 xL"] --> L_Enc["标准 LIC 编解码"]
L_Enc --> XL_Hat["重构左图锚点 x̂L"]
end
subgraph S2["第二阶段:联合语义-空间控制生成"]
direction TB
XR["右图输入 xR"] --> Sem_Enc["极轻量语义编解码<br/>(~0.00065 bpp)"]
Sem_Enc --> F_Sem["语义条件 f̂sem"]
XL_Hat --> CN_Spa["空间控制网络 CNimg"]
F_Sem --> CN_Lat["潜控制网络 CNlat"]
CN_Spa & CN_Lat --> Fuse["逐元素融合特征"]
Fuse --> LDM["冻结扩散模型 LDM U-Net<br/>(单步潜空间推理)"]
LDM --> VAE_Dec["VAE 解码器"]
VAE_Dec --> X_Gen["高质量目标参考 xgen"]
end
subgraph S3["第三阶段:可靠性感知门控目标视点压缩"]
direction TB
X_Gen & XL_Hat --> Feat_Ext["共享特征提取器 grefa"]
Feat_Ext --> Gating["可靠性感知门控模块<br/>(空间置信图 G 动态过滤)"]
Gating --> Entropy["条件高斯熵模型<br/>(精炼 μFinal 与 σFinal)"]
XR --> R_Enc["LIC 编码与量化 ŷR"]
R_Enc & Entropy --> R_Dec["熵解码与 LIC 解码"]
R_Dec --> XR_Hat["重构目标视点 x̂R"]
end
XL_Hat -.-> CN_Spa
XL_Hat -.-> Feat_Ext
X_Gen -.-> Feat_Ext
关键设计¶
1. 空间控制(几何锚点约束):锁定双目共视区域的基线几何 针对传统方法直接利用强量化特征进行特征变形导致的伪影传递,本文并不把左图特征直接作为预测底图,而是将其转化为扩散模型的几何导向场。将重构左图 \(\hat{x}_L\) 接入标准图像域控制网络 \(CN_{img}\),与扩散时间步 \(t\) 及加噪潜在变量 \(z_t\) 结合,提取多尺度空间控制特征: $\(F_{ctl}^{spa} = \text{CN}_{img}(\hat{x}_L, z_t, t)\)$ 该特征为扩散过程提供了双目共视区域坚固的空间边缘、轮廓和结构约束,确保单步扩散生成时不会发生宏观结构形变或基线偏移。
2. 语义控制(超紧凑语义条件):极低码率引导 OOV 补全与视差对齐 针对目标视点中存在的 OOV 视场外区域以及左图被遮挡部分的纹理缺失,纯粹依赖左图空间几何无法解决“凭空无依据”的问题。本文引入极轻量语义编解码器,将右图 \(x_R\) 经由冻结的 VAE 编码器映射至潜空间,压缩提取出码率开销仅约 \(0.00065\text{ bpp}\) 的超紧凑语义条件 \(\hat{f}_{sem}\)。通过轻量潜空间适配层(Latent Adapter)对齐维度后送入修改后的潜空间控制网络 \(CN_{lat}\),生成宏观布局与视差指引特征: $\(F_{ctl}^{sem} = \text{CN}_{lat}(\text{Adapter}(\hat{f}_{sem}), z_t, t)\)$ 将 \(F_{ctl}^{spa}\) 与 \(F_{ctl}^{sem}\) 逐元素相加后经由零卷积(Zero-Convolution)注入冻结扩散模型的 U-Net 解码块中。这样,极小代价的语义种子决定了目标视点的宏观布局和特有纹理倾向,引导扩散模型在 OOV 区域智能“脑补”出逼真结构与高频细节,最终解码输出逼真的目标参考图像 \(x_{gen}\)。
3. 可靠性感知门控:动态过滤生成不一致性以锚定率失真曲线 扩散先验虽然提供了逼真的感知纹理,但其固有随机性导致局部合成细节在像素级上可能与真实输入偏离,若直接无脑引入熵模型会导致客观失真惩罚激增。为此,本文在熵模型参数估计阶段设计了可靠性感知门控模块。通过共享特征提取器分别从几何锚点与合成参考中提取特征 \(F_{geo} = g^{ref}_a(\hat{x}_L)\) 和 \(F_{gen} = g^{ref}_a(x_{gen})\)。几何分支首先计算基准偏移量 \(\Delta\mu_{geo}\),而生成分支计算富含高频但存在风险的候选偏移量 \(\Delta\mu_{gen}\)。门控轻量网络动态预测出空间置信度图 \(G \in [0, 1]\): $\(G = \sigma(\mathcal{F}_{Gate}([\mu_{Base}, F_{gen}]))\)$ 最终精炼的均值参数通过门控动态加权合成: $\(\mu_{Final} = \mu_{Base} + \Delta\mu_{geo} + (G \odot \Delta\mu_{gen})\)$ 当生成特征存在结构错配或高不确定性时,门控响应趋于 0,系统自适应衰减生成指导并安全退回至几何可靠底座,从而在严格满足客观率失真最优的同时吸收高质量生成先验。
损失函数 / 训练策略¶
系统采用分阶段解耦训练策略以保证梯度稳定性并避免各目标互相干扰: - 第一阶段(锚点视点优化):固定采用标准率失真损失 \(\mathcal{L}_{\text{Stage I}} = \lambda D(x_L, \hat{x}_L) + R(\hat{y}_L) + R(\hat{z}_L)\) 训练左图 LIC 网络,其中 \(D\) 为均方误差(MSE)。 - 第二阶段(联合生成与语义优化):冻结预训练 LDM 和 VAE,仅联合优化双控制网络与超轻量语义编解码器。总损失由扩散噪声预测损失与语义特征率失真损失构成: $\(\mathcal{L}_{\text{Stage II}} = \mathcal{L}_{Diff} + \lambda_{codec} \mathcal{L}_{Codec}\)$ $\(\mathcal{L}_{Codec} = R(\hat{f}_{sem}) + \beta \|f_{sem} - \hat{f}_{sem}\|_2^2\)$ 来自 \(\mathcal{L}_{Diff}\) 的梯度直接反向传播穿过潜在控制网络进入语义编解码器,迫使仅 \(0.00065\text{ bpp}\) 的 \(\hat{f}_{sem}\) 精确捕获引导宏观布局的核心先验。 - 第三阶段(门控目标视点压缩):冻结前两阶段模块,针对右图进行端到端率失真优化。为使门控网络能真正辨别不可靠特征,引入了可靠性感知训练机制:在训练时以概率 \(p_{Drop}\) 丢弃 \(F_{gen}\) 或以 \(p_{Noise}\) 注入高斯噪声,迫使门控网络学会识别无效生成并主动关闭信息流。
实验关键数据¶
主实验¶
在标准双目数据集 InStereo2K 和 Cityscapes 上,本文方法与传统编解码器(BPG、HEVC、VVC、MV-HEVC)以及代表性深度学习双目压缩算法(LDMIC、ECSIC、BiSIC、CAMSIC)进行了全面对比。以 BPG 为锚点计算的 Bjøntegaard Delta Bitrate(BDBR,负值表示节省码率)如下表所示:
| 数据集 | 指标 | 本文 | 之前最好(SOTA) | 相对优势 / 提升 |
|---|---|---|---|---|
| InStereo2K | PSNR BDBR (↓) | -67.64% | -48.08% (BiSIC) | 额外节省 19.56% 码率 |
| InStereo2K | MS-SSIM BDBR (↓) | -65.22% | -61.13% (BiSIC) | 额外节省 4.09% 码率 |
| Cityscapes | PSNR BDBR (↓) | -65.90% | -59.74% (CAMSIC) | 额外节省 6.16% 码率 |
| Cityscapes | MS-SSIM BDBR (↓) | -74.53% | -69.67% (CAMSIC) | 额外节省 4.86% 码率 |
在推理效率方面,本文在 NVIDIA A100 GPU 上的双目图像对单对整体平均耗时为 1.60 秒(其中核心压缩网络仅占 0.78 秒,单步扩散生成参考耗时 0.82 秒),与 ECSIC(1.47s)、BiSIC(1.29s)、CAMSIC(1.34s)等基于复杂注意力交互的 SOTA 深度方法处于同一数量级,且比 CPU 执行的传统 VVC 标准(208.42s)快两个数量级以上。
消融实验¶
在 InStereo2K 和 Cityscapes 上分别剔除核心模块,以完整模型的 Bjøntegaard Delta PSNR(BD-PSNR,负值表示性能下降)进行量化消融评估:
| 配置 | InStereo2K BD-PSNR | Cityscapes BD-PSNR | 说明 |
|---|---|---|---|
| Full Model (Ours) | 0.00 dB | 0.00 dB | 完整模型 |
| w/o Generative Reference | -1.31 dB | -1.23 dB | 移除扩散生成参考,性能出现毁灭性暴跌 |
| w/o Reliability-Aware Gate | -1.07 dB | -0.91 dB | 移除动态门控盲目引入生成特征,因结构失真受到严厉客观惩罚 |
| w/o Semantic Control | -0.76 dB | -0.83 dB | 移除超紧凑语义条件,生成缺乏宏观视差与边界约束导致歧义 |
关键发现¶
- 生成先验是性能飞跃的核心根基:去掉生成式参考后,在 InStereo2K 和 Cityscapes 上分别产生了高达 -1.31 dB 和 -1.23 dB 的性能崩塌,证明生成先验摆脱对退化参考的刚性对应匹配是该框架效率质变的关键。
- 门控机制是客观指标的“安全阀”:无门控保护时直接融合扩散生成特征导致 BD-PSNR 下降达 -1.07 dB,直接验证了生成模型的不可靠特征若无动态隔离,会因像素级偏差抵消生成先验带来的感知增益。
- 极低码率下优势尤为显著:在 InStereo2K 极低码率(~0.07 bpp)下,本文 PSNR 达到 35.75 dB,超越 CAMSIC 和 BiSIC 达 1 dB 以上;在 Cityscapes 上面对常规方法极易失效的极低码率区(~0.03 bpp),本文 PSNR 仍领先 ECSIC 达 1.5 dB。
亮点与洞察¶
- 将“对应搜索”重塑为“可控生成”:打破了过去十年双目压缩死磕光流/视差变形与交叉注意力的思维定式,将右图预测重新定义为以几何与极简语义为条件的生成补全任务,彻底根治了 OOV 盲区和强量化伪影传递的死穴。
- ~0.00065 bpp 的四两拨千斤:通过端到端梯度直接穿透扩散网络回传至语义编解码器,仅用万分之六 bpp 的近乎可忽略码率,成功为随机扩散模型注入了宏观布局与视差定位能力。
- 可靠性感知门控实现感知-失真双赢:在熵模型参数调整上引入动态置信度标定与训练期主动破坏机制,优雅地化解了生成模型“脑补细节逼真但像素未对齐”与率失真客观优化之间的根本冲突。
局限与展望¶
- 计算复杂度与硬件要求高:虽然扩散过程经单步潜空间推理加速,单对耗时控制在 1.6 秒左右,但相比无扩散模型的纯 CNN/小轻量级 Transformer 架构,其对 GPU 显存(运行 SD 1.5 U-Net)及算力要求依然较高,在边缘端或低功耗嵌入式双目设备上的实时部署面临挑战。
- 高码率区间边际效益递减:在极高码率、带宽极度充裕的工况下,真实纹理信息足以通过常规量化残差高保真重建,生成先验带来的边际增益会逐渐收敛。
- 未来改进方向:可进一步探索结合轻量化蒸馏扩散架构(如结合 Consistency Models 或更小型的前向生成骨干),降低内存与算力开销;同时可探索将此双控门控范式推广至多视角立体视频编码中。
相关工作与启发¶
- vs BiSIC [Liu et al., ECCV 2024] / CAMSIC [Zhang et al., AAAI 2025]:BiSIC 与 CAMSIC 分别依赖 3D 卷积跨维度熵模型和掩码图像建模交互,依然依赖于在强量化的左图特征中搜寻有效对应点。当码率极低、左图被严重压缩时,伪影与模糊无法避免,且在 OOV 区域无能为力。本文彻底放弃依赖退化特征硬匹配,以扩散先验直接端到端合成高质量目标视点参考。
- vs 传统生成式图像压缩 [Mentzer et al., NeurIPS 2020 / Agustsson et al., CVPR 2023]:传统单图生成式压缩要么完全偏向感知质量而使 PSNR 严重受损,要么缺乏多视角的强几何约束。本文利用立体几何锚点协同极小语义约束,并辅以可靠性门控,成功将生成模型驯服在严格的率失真优化轨道上。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ [首次在双目图像压缩中引入扩散生成先验作为参考视点,提出几何+极简语义双控机制与可靠性门控,架构思路极具开创性]
- 实验充分度: ⭐⭐⭐⭐⭐ [双数据集完整评测,涵盖传统与深度学习共 9 类主流基线,率失真曲线、BDBR、消融实验与运行耗时俱备]
- 写作质量: ⭐⭐⭐⭐⭐ [逻辑架构异常清晰,问题定义精准,图表详实且推导严谨]
- 价值: ⭐⭐⭐⭐⭐ [为跨视角立体编码乃至多视角/视频生成式压缩开辟了全新的技术范式,在低码率场景实用价值极高]