Raw-JPEG Adapter: Efficient Raw Image Compression with JPEG¶
会议: ECCV 2026
论文: ECCV 原文
领域: 信号处理通信
关键词: Raw图像压缩, JPEG适配, 可逆预处理, 神经参数预测, 传感器信号保留
一句话总结¶
针对原始 Raw 图像体积庞大且无法直接适配标准 JPEG 编解码流水线的问题,本文提出了一种轻量、可逆且自监督学习的 Raw-JPEG 适配器,通过神经网络预测通道查找表、频域 DCT 缩放及像素级 Gamma 参数并嵌入 JPEG 注释段,实现了小于 64 KB 额外开销下极低解码延迟的高保真 Raw 图像压缩与重建。
研究背景与动机¶
现代数字相机的图像传感器通常以 12–14 位的线性精度记录入射光线。未加工的 Raw 传感器数据完整保留了传感器的原始动态范围与辐射度信息,为后期专业摄影调整、自动白平衡以及底层计算机视觉任务提供了不可替代的高保真输入。然而,主流 Raw 归档格式(如 Adobe DNG 或 16 位无损 PNG/TIFF)单张照片体积动辄高达 30–50 MB,高昂的存储与带宽成本严重阻碍了移动端拍摄留存、云端快速同步以及大规模视觉数据集的快速分发。
广泛部署的传统有损压缩标准 JPEG 拥有极其成熟的硬件解码生态与高压缩率,但其设计初衷是针对经 Gamma 校正、非线性映射的 8 位 sRGB 显示域图像。若将线性传感器空间的 Raw 数据直接送入 JPEG 编码管线,不仅会导致高位深向 8 位截断时产生灾难性的暗区色彩分层与伪影,JPEG 固定的 DCT 量化表与色度抽样更是与传感器的统计分布严重错配。现有折中方案主要存在两类缺陷:一类是依赖双向神经 ISP 或 sRGB 逆渲染技术,但 ISP 非线性映射损失严重且常需伴随 1–2 MB 的额外元数据,重建误差大;另一类是基于隐式神经表示(INF)等测试时优化方案,虽然元数据较小,但单图重建耗时长达数十秒,完全无法用于实际摄影工作流。
面对标准编解码器的普适性与 Raw 数据高保真存储之间的核心矛盾,本文跳过了复杂的 sRGB 显式渲染与不可逆的神经 ISP,直接将 Raw 数据作为压缩对象,转而在编码前引入轻量级可逆预处理,以调控信号分布使其顺应 JPEG 的量化特性。核心 idea:构建一套完全可逆且参数极度紧凑的前置适配管线,利用轻量卷积网络从 Raw 缩略图中预测通道 1D 查找表、块级 DCT 缩放矩阵与像素级 Gamma 映射,将参数(<64 KB)存入标准 JPEG 注释段,解码时无需运行神经网络即可通过解析求逆实现极速高保真 Raw 重建。
方法详解¶
整体框架¶
Raw-JPEG Adapter 的端到端流水线由前置编码适配、标准 JPEG 编解码及后置解码求逆三个核心阶段构成。在编码端,输入的去马赛克 RGB Raw 图像首先下采样得到轻量缩略图,送入参数预测网络生成一组可逆算子的连续参数,并在空间域与频域依次执行通道级 1D 查找表(LuT)重平衡、可选的 8×8 块级 DCT 频域特征缩放以及自适应像素级 Gamma 变换。变换后的伪 Raw 图像输入标准 JPEG 编码器压缩为标准 .jpg 文件,而预测的所有变换参数经 zlib 压缩与 Base64 编码后存储在 JPEG 规范允许的注释(COM)数据段中(小于 64 KB)。在解码端,任何标准 JPEG 解码器先将图像解码回空间域,随后从 COM 段解析出变换参数,严格按照逆向顺序执行解析求逆计算,从而高保真恢复出原始 12–14 位线性 Raw 信号。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入线性 Raw 图像<br/>(12-14 bit, H×W×3)"] --> B["轻量预测网络<br/>缩略图抽取 (~37K 参数)"]
B --> C["通道级 1D 查找表 (LuTs)<br/>重平衡全局色调分布"]
C --> D["块级 DCT 频域缩放 (S)<br/>对齐传感器特征与量化表"]
D --> E["像素级 Gamma 映射 (Γ)<br/>自适应非线性扩展暗区"]
E --> F["标准 JPEG 编码器<br/>质量因数 Q 控制体积"]
B -.->|"参数压缩存储 (<64 KB)"| G["JPEG COM 注释数据段"]
F --> H["标准 JPEG 存储文件<br/>(.jpg 容器格式)"]
G --> H
H --> I["标准 JPEG 解码器<br/>重建 8 位空间域图像"]
I --> J["逆 Gamma 变换<br/>恢复高动态线性范围"]
J --> K["逆 DCT 频域除法<br/>还原频域能量分布"]
K --> L["逆 1D 查找表插值<br/>恢复通道原始响应"]
L --> M["输出高保真重建 Raw<br/>(可直接输入下游 ISP / 编辑)"]
关键设计¶
1. 通道级单调 1D 查找表:重构强度分布与动态范围
直接将 Raw 线性信号压缩为 8 位整数时,大部分真实曝光场景的像素能量密集挤压在低强度区间,造成严重的位深下采样信息丢失与色偏。为此,预处理第一步采用三通道独立的 1D 查找表对输入 Raw 像素值进行全局再分配。为确保该操作数学上绝对可逆,每个通道的查找表被约束为严格单调递增映射。网络预测无约束的隐式输出增量向量,通过 Softplus 激活函数保证所有增量严格为正,随后通过累加(Cumulative Sum)构建严格递增序列,最后归一化至 \([0, 1]\): $$ \mathbf{L}c(i) = \frac{\sum, \quad c \in {R, G, B} $$ 每个通道查找表仅保留 128 个采样点,总计 }^i \text{softplus}(h_{\theta, c}(j))}{\sum_{j=1}^{128} \text{softplus}(h_{\theta, c}(j))\(128 \times 3\) 个浮点数。正向映射通过分段线性查找对强度值做拉伸与重平衡,使传感器低光信号合理展开;解码时只需通过单调序列的数值插值进行解析求逆,计算开销可忽略不计。
2. 块级 DCT 频域缩放:对齐传感器特征与固定量化表
标准 JPEG 压缩的核心瓶颈之一在于其内置的亮度和色度量化表是根据人类视觉系统(HVS)对自然 sRGB 图像的感知敏感度专门调优的,并不符合 Raw 传感器图像在频域上的噪声模型与高频分布。为消除这种统计特性错配,本文在 \(8 \times 8\) 图像块上引入了一个全局可学习的频域缩放矩阵 \(\mathbf{S} \in \mathbb{R}^{8 \times 8}\)。对每个 \(8 \times 8\) 块执行 DCT 变换后,频域系数与 \(\mathbf{S}\) 进行逐元素点乘: $$ \mathbf{I}^{\text{DCT}}_b = \text{IDCT}\left( \text{DCT}(\mathbf{I}^{\text{LuT}}_b) \odot \mathbf{S} \right) $$ 为防止数值过大或接近零引起数值不稳定,预测网络输出经双曲正切缩放限制在安全区间 \([0.5, 2.0]\):\(\mathbf{S} = \exp(\tanh(s_\theta))\)。解码时,仅需计算逆向除法 \(\mathbf{I}^{\text{LuT}}_b = \text{IDCT}\left( \text{DCT}(\mathbf{I}^{\text{DCT}}_b) \oslash \mathbf{S} \right)\)。该矩阵隐式刻画了特定传感器型号的频域噪声响应,显著减少了高频细节在 DCT 量化阶段的不可逆丢失。
3. 像素级 Gamma 映射:消除暗区伪影与位深量化条纹
即便经过全局查找表调整,大面积暗区由于局部对比度极端且信噪比低,在 JPEG 有损量化后极易出现严重的等高线台阶(Banding)与色彩溢出。为了提供空间局部自适应的补偿能力,本文引入了一个分辨率为 \(100 \times 100\) 的像素级空间 Gamma 映射图 \(\boldsymbol{\Gamma}\)。网络预测的 Gamma 参数通过非线性变换被严格约束在正数区间 \([0.14, 7.4]\): $$ \boldsymbol{\Gamma}{(x,y)} = \exp\left(2.0 \cdot \tanh(g)\right) $$ 在正向处理时,该矩阵通过双线性插值上采样至图像全分辨率,并逐像素计算幂律变换 \(\mathbf{I}^{\Gamma}_{(x,y)} = \left(\mathbf{I}^{\text{DCT}}_{(x,y)}\right)^{\boldsymbol{\Gamma}_{(x,y)}}\);后向重建阶段则直接采用指数倒数 \(\left(\mathbf{I}^{\Gamma}_{(x,y)}\right)^{1 / \boldsymbol{\Gamma}_{(x,y)}}\) 精确还原。该设计为阴影区域提供了局部的非线性放大,使暗部渐变在经过 8 位量化后仍能保留足够的量化阶梯,从根本上消除了重构后的色彩断层。
4. 紧凑预测网络与元数据轻量化封装:保证超低开销与绝对兼容
整个适配器参数预测器采用紧凑的卷积 Encoder-Decoder 结构,内嵌 GELU 激活函数、跳跃连接与高效通道注意力(ECA)模块,全网总参数量仅约 37K。网络仅输入一张双线性缩放的 Raw 缩略图,在端侧仅需约 0.1 秒即可完成参数推断。所有预测算子参数(384 个 LuT 系数、64 个 DCT 系数、10,000 个 Gamma 系数)在序列化后经过 zlib 压缩与 Base64 编码,最终数据体积通常仅为 40 KB 左右,严格限制在标准 JPEG 单个 COM 注释段 64 KB 的协议上限之内。由于所有逆算子均为解析闭式计算,解码端完全脱离深度神经网络,任何终端设备都能在 0.12 秒内完成高保真 Raw 恢复。
损失函数 / 训练策略¶
模型采用端到端自监督方式训练,利用未压缩的 Raw 图像自身作为真值。为了使整个网络能够跨越不可导的 JPEG 离散量化过程进行梯度反向传播,训练过程中引入了可微 JPEG 模拟器,在模拟压缩失真下协同优化前置算子。优化目标结合了空间域与频域的多尺度监督损失: $$ \mathcal{L} = \lambda_{\text{L1}} \mathcal{L}{\text{L1}}(\hat{\mathbf{I}}, \mathbf{I}) + \lambda}} \mathcal{L{\text{SSIM}}(\hat{\mathbf{I}}, \mathbf{I}) + \lambda) $$ 其中 }} \mathcal{L}_{\text{FFT}}(\hat{\mathbf{I}}, \mathbf{I\(\mathcal{L}_{\text{FFT}}\) 对真实与重建 Raw 图像 2D 快速傅里叶变换的实部与虚部分别计算 \(L_1\) 距离,以强化频域结构保真度;超参数设置为 \(\lambda_{\text{L1}} = 1.0, \lambda_{\text{SSIM}} = 0.1, \lambda_{\text{FFT}} = 0.1\)。训练阶段引入了随机亮度和跨通道扰动增强,并在绿色通道添加 \(+0.05\) 的固定偏置,以精准模拟数码相机 Bayer 阵列中感光元件对绿色波段的光谱敏感度特性。
实验关键数据¶
主实验¶
在 Samsung Galaxy S24 Ultra 数据集(400 张测试图)上,本文方法与标准 JPEG 以及代表性预处理/神经重建基线在不同质量参数下进行了对比。下表呈现了最佳质量(Quality = 100)与常规质量(Quality = 75)下的综合性能,压缩比(CR)以 16 位未压缩 Raw PNG 为基准。
| 方法 | 质量因数 (Q) | PSNR (dB) | SSIM (%) | MS-SSIM (%) | 码率 BPP | 压缩比 (CR) |
|---|---|---|---|---|---|---|
| 标准 JPEG (直接存储) | 100 | 46.00 | 98.47 | 99.72 | 4.36 | 6.51× |
| JPEG + OLM [Chung et al.] | 100 | 43.65 | 97.74 | 99.55 | 4.21 | 6.73× |
| JPEG + raw↔sRGB (CCM逆映射) | 100 | 47.65 | 99.25 | 99.86 | 6.09 | 4.70× |
| JPEG + 固定 Gamma (2.2) | 100 | 48.38 | 99.27 | 99.87 | 5.25 | 5.47× |
| Raw-JPEG Adapter (本文完整版) | 100 | 49.04 | 99.35 | 99.89 | 5.28 | 5.41× |
| 标准 JPEG (直接存储) | 75 | 40.75 | 95.40 | 98.62 | 0.56 | 56.42× |
| JPEG + OLM [Chung et al.] | 75 | 40.33 | 95.17 | 98.56 | 0.55 | 57.20× |
| JPEG + raw↔sRGB (CCM逆映射) | 75 | 42.63 | 97.37 | 99.39 | 0.85 | 37.15× |
| JPEG + 固定 Gamma (2.2) | 75 | 42.43 | 97.16 | 99.25 | 0.73 | 43.06× |
| Raw-JPEG Adapter (本文完整版) | 75 | 43.58 | 97.67 | 99.48 | 1.04 | 29.85× |
在与元数据重建(INF、R2LCM)及双向神经 ISP(Invertible ISP)等复杂方案的横向对决中,Raw-JPEG Adapter 展现出兼顾精度与极致运行速度的压倒性优势:
| 方法类型 | 具体方法 | PSNR (dB) | SSIM (%) | 存储 BPP (总/辅助) | 解码重建延迟 |
|---|---|---|---|---|---|
| 双向神经 ISP | CIE XYZ Net [Afifi et al.] | 20.47 | 81.61 | 2.340 / 0.000 | 0.301 s |
| 双向神经 ISP | Invertible ISP [Xing et al.] | 43.71 | 98.40 | 2.340 / 0.000 | 7.932 s |
| 隐式函数元数据 | INF [Li et al.] | 41.24 | 96.29 | 3.764 / 0.776 | 25.930 s |
| 紧凑隐空间元数据 | R2LCM (drop 0) [Wang et al.] | 46.01 | 98.49 | 3.929 / 1.701 | 2.815 s |
| 本文方案 (JPEG Q=75) | Raw-JPEG Adapter | 43.58 | 97.67 | 1.036 / 1.036 | 0.120 s |
| 本文方案 (JPEG Q=95) | Raw-JPEG Adapter | 46.22 | 98.60 | 2.345 / 2.345 | 0.120 s |
| 本文方案 (深度压缩 LIC-TCM) | LIC-TCM + Adapter (Tuned) | 46.03 | 98.75 | 1.260 / 1.260 | 0.120 s |
消融实验¶
在 S24 测试集上针对各算子配置及损失项进行的系统性消融(JPEG 质量设为 75),结果如下:
| 配置 | 核心改动说明 | PSNR (dB) | SSIM (×100) |
|---|---|---|---|
| 仅 Gamma 映射 | 仅使用 \(100 \times 100\) 像素级 Gamma 算子 | 42.32 | 96.11 |
| 仅 1D 查找表 | 仅使用 \(128 \times 3\) 通道级查找表 | 40.93 | 95.56 |
| Gamma + LuT | 组合两项空间域算子 | 42.50 | 97.12 |
| Gamma + LuT + DCT | 引入 \(8 \times 8\) 块级频域缩放 | 42.70 | 97.24 |
| 加入 ECA 通道注意力 | 增强特征交互能力 | 42.80 | 97.19 |
| 完整模型 (含可微模拟器) | 所有算子 + ECA + 模拟训练 | 43.58 | 97.67 |
| 降低 Gamma 分辨率 | Gamma 分辨率由 \(100 \times 100\) 降至 \(64 \times 64\) | 43.56 | 97.64 |
| 降低 LuT 采样点 | LuT 采样点由 128 降至 64 | 43.49 | 97.66 |
| 共享单通道 LuT | 三通道共享单一 \(128 \times 1\) 查找表 | 43.42 | 97.63 |
| 去除 FFT 频域损失 | 训练损失仅保留 \(L_1\) 与 SSIM | 43.06 | 97.35 |
| 去除 SSIM 结构损失 | 训练损失仅保留 \(L_1\) 与 FFT | 43.34 | 97.59 |
| 去除 \(L_1\) 保真损失 | 训练损失仅保留 SSIM 与 FFT | 41.72 | 97.62 |
关键发现¶
- 模块贡献与色调丰富度:像素级 Gamma 映射对抑制暗区台阶与噪声伪影贡献最为突出,配合通道 1D 查找表后,重建图像包含超过 1139 万个独立 RGB 颜色组合(对比无预处理 JPEG 仅能恢复出约 7195 个),彻底消除了色调割裂感。
- 频域缩放的相机专一性与跨设备泛化:\(8 \times 8\) 块级 DCT 缩放矩阵在训练相机(S24)上带来了约 0.2–0.3 dB 的稳步提升;但在跨相机泛化测试(如 MIT-Adobe 5K 和 NUS 单反数据集)中,由于固化了特定传感器的噪声分布,带 DCT 的版本表现略逊于纯空间域算子组合(w/o DCT)。在未知相机场景下,省略 DCT 模块具有更优异的通用鲁棒性(跨相机 PSNR 领先基准达 1.5–2.0 dB)。
- 码率节省优势:Bjontegaard Delta 评估显示,在相同重建 PSNR 质量下,Raw-JPEG Adapter 相比原始 JPEG 节省了 27.88% 的码率,相比 raw↔sRGB 颜色转换基线节省了 13.56% 的码率。
- 通用编解码器可扩展性:该适配器不仅在标准 JPEG 和 JPEG 2000 上显著增益,当直接替换为深度学习神经图像压缩模型 LIC-TCM 时,依然能够取得 46.03 dB 的高保真度,验证了“前置可逆统计适配”思想的普适性。
亮点与洞察¶
- 跳出逆向工程思维,直面正向适配:不同于过去耗费巨额计算量试图从不可逆 ISP 处理后的 sRGB 图像中“逆推”Raw 信息的做法,本文完全绕开 sRGB 渲染陷阱,将 Raw 数据本身作为传输主体,仅通过轻量变换让其“假装”成适合 JPEG 量化的分布,构思极其纯粹高效。
- 利用标准协议扩展槽实现零破坏部署:将几项变换的数学参数压缩在 40 KB 以内并注入标准 JPEG COM 段,产生的文件在任何旧软件中都能作为普通缩略图或合法文件被直接查看与管理,在专用端侧则能瞬间无损解压回 Raw,兼顾了生态兼容性与专业保真需求。
- 闭式求逆带来零显存极速解码:不同于神经 ISP 动辄占用数百兆显存且运行数秒,本文解码端仅为矩阵相乘与三次插值查表,在算力受限的嵌入式芯片或移动终端上即可瞬时完成运算。
局限与展望¶
- 极端低码率下的残余块效应:在极限压缩模式下(如 JPEG 质量 \(Q \le 25\)),JPEG 内部的粗糙量化不可避免地会引入微弱的高频边缘伪影与模糊,预处理算子虽然极大缓解了断层,但无法从物理上凭空创造被彻底丢弃的频域信息。
- 固定分辨率 Gamma 图的局部平滑假设:\(100 \times 100\) 的 Gamma 映射图通过双线性插值扩展至千万级像素,本质上假设了光照补偿参数在局部空间是低频平滑的,在应对极端高频的高反差背光细小边缘时,补偿精度存在细微局限。
- 未来改进方向:可进一步探索结合小波变换的轻量自适应边缘保护机制,或者将此思路扩展至手机多帧合并 Raw(Computational Raw / ProRAW)的超轻量无损级归档场景中。
相关工作与启发¶
- vs. Invertible ISP [Xing et al., CVPR 2021]: Invertible ISP 采用深度可逆双射网络(Invertible Neural Network)实现 sRGB 与 Raw 之间的双向可逆映射,但推理依赖沉重的深层网络,解码一张图片需耗时近 8 秒;本文采用轻量参数化算子,解码端无网络推理,速度提升近 70 倍且重建保真度显著更高。
- vs. R2LCM [Wang et al., CVPR 2023 / IJCV 2024]: R2LCM 需从渲染后的 sRGB 图像中借助 1–2 MB 的紧凑潜在特征辅助恢复 Raw,元数据开销巨大且高度绑定特定的 ISP 渲染曲线;本文仅需不到 64 KB 的预处理参数,存储开销下降数十倍。
- vs. Bayer CFA 硬件压缩 (JPEG XS / OLM): 传统广播级 CFA 压缩方案侧重于低延迟视频流传输,往往牺牲了压缩比;本文立足于大众消费级移动摄影与计算机视觉数据归档,将体积压缩了数十倍,与现有生态无缝衔接。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ 突破传统逆 ISP 与神经元数据重构路径,创造性地通过纯数学闭式可逆算子实现标准 JPEG 对线性高位深 Raw 的无缝兼容。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 S24 手机真实数据集、跨 35 款单反相机的 MIT-Adobe 5K 及 NUS 数据集,覆盖不同 JPEG 质量因数、深度学习编解码器及 Lightroom 实际显色下游任务。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密,图表详实,问题切入点与系统边界定义极其清晰。
- 价值: ⭐⭐⭐⭐⭐ 对移动计算摄影落地、云相册 Raw 备份归档以及大规模底层视觉数据集的高效分发具有极高的工程与学术应用价值。