RawGen: Learning Camera Raw Image Generation¶
会议: ECCV 2026
论文: ECCV 官方
项目主页: https://dy112.github.io/rawgen-page/
领域: 图像生成
关键词: 相机Raw图像生成, 扩散模型, 逆向ISP, CIE XYZ, 许多对一重构
一句话总结¶
RawGen 提出了首个支持从文本或 sRGB 图像生成物理线性相机 Raw 数据的扩散生成框架,通过构建“许多对一”逆向 ISP 训练范式解耦不可控的图像润色效果,结合针对 CIE XYZ 线性域微调的 DiT 去噪器与 VAE 解码器,实现了任意目标相机的传感器级线性 Raw 数据高保真合成。
研究背景与动机¶
现代数字相机传感器原生记录的是与场景辐射度呈线性关系的 Raw 数据,这类数据保留了未经非线性破坏的辐射度与色彩物理信息,是低级别计算机视觉、计算摄影和神经 ISP 算法研发的核心基石。然而,现实中高质量 Raw 图像的采集极其严苛且耗时费力,且高度受限于特定的相机传感器硬件与光学校准参数。一旦感光元件架构或机内处理管线变更,便必须重新耗资采集。这种数据稀缺性长期制约着跨设备低级别视觉泛化能力的推进。
生成式扩散模型虽然在合成高分辨率、语义丰富的 sRGB 图像上取得了革命性突破,但其生成空间本质上受限于面向显示的 8 位 sRGB 域。互联网上海量训练图像均经过了机内厂商私有且高度异构的图像信号处理器(ISP)处理,叠加了未知的白平衡、色调映射、非线性伽马校正与美学润色风格,彻底破坏了物理辐射度线性。若直接尝试采用传统逆向 ISP(Inverse-ISP)方法将扩散生成的 sRGB 反推回 Raw 空间,往往会全面失效;因为传统方法大多基于固定软件 ISP(如 RawPy、DCRAW)构建一对一配对映射,面对扩散模型输出中高度不可控且混杂的多样化机内润色风格时,根本无法稳定恢复出物理自洽的场景级线性表征。
要打破生成模型与物理传感器信号之间的壁垒,关键在于如何从混乱异构的机内后处理效应中剥离出客观的场景线性基准。核心 idea:将多相机共享的无偏线性 CIE XYZ 空间确立为规范化锚点,提出“许多对一”反向渲染监督,训练基于流匹配 DiT 的条件去噪器与专精 VAE 解码器,在潜空间抹除未知 ISP 润色扰动并重建规范化线性 XYZ 图像,最后利用目标相机标定元数据确定性渲染出任意机型的传感器线性 Raw。
方法详解¶
整体框架¶
RawGen 的核心设计思想是“在潜空间抹除机内后处理扰动,在物理线性空间锚定辐射度基准,在后端元数据层映射目标设备”。整个框架构建在预训练的修正流(Rectified-Flow)Diffusion Transformer(FLUX.1-Kontext)与 VAE 之上,分为两阶段离线微调与统一推理流程。
在训练阶段,针对 Raw 数据的处理首先通过相机标定参数去除传感器特异性,转换至场景级设备无关的线性 CIE XYZ 锚点图像 \(I_{\mathrm{XYZ}}\);接着,算法利用参数随机化的虚拟 ISP 对同一场景合成多个具有不同白平衡、色调曲线和对比度偏置的 sRGB 变体图像。由冻结的 VAE 编码器将这些变体与锚点分别投影至潜空间后,第一阶段通过条件 DiT 学习将任意 sRGB 变体潜变量去噪映射至同一个标准 XYZ 潜变量;第二阶段通过重构损失微调 VAE 解码器,使其具备将 XYZ 潜表征无损解码为物理线性图像的能力。在推理阶段,无论是来自输入 sRGB 图像还是文本提示词生成的潜变量,均统一输入该去噪流程并解码得到规范化 CIE XYZ 图像,最后结合目标相机的 DNG 标定元数据直接变换为目标设备的线性 Raw 图像。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
subgraph S1["数据构建与锚点设定"]
direction TB
A["多设备 Raw 图像<br/>与标定元数据"] --> B["多对一数据构建<br/>解耦ISP扰动并生成XYZ锚点"]
end
subgraph S2["模型微调阶段"]
direction TB
B --> C["条件流匹配 DiT 微调<br/>基于LoRA学习去噪速度场"]
B --> D["线性域 VAE 解码器微调<br/>重靶向解码物理线性图像"]
end
subgraph S3["统一推理与设备映射"]
direction TB
E["输入 sRGB 图像 (I2R)<br/>或文本提示词 (T2R)"] --> F["流匹配生成 CIE XYZ 潜变量"]
C -.-> F
F --> G["微调解码器重构线性 XYZ"]
D -.-> G
G --> H["解耦式相机 Raw 渲染<br/>插值前向矩阵并注入传感器噪声"]
end
H --> I["任意目标相机 Raw 输出"]
关键设计¶
1. 多对一数据构建:消除异构 ISP 伪影的规范化锚点
传统逆向 ISP 方法无法泛化至网络图像与扩散生成图的核心症结在于“一对一假设”的破裂——在现实中,同一个物理场景在不同曝光、白平衡增益及色调映射风格下会生成形态迥异的 sRGB 图像。为了迫使生成网络学会剥离这些与场景几何和光照物理无关的美学调色,RawGen 提出了“许多对一”(Many-to-One)映射任务。研究团队以 MIT-Adobe FiveK 和 RAISE 等大型 Raw 数据集为基础,首先利用各图像自带的 AsShotNeutral 和 ForwardMatrix 标定参数将原始 Raw 转换为无偏的场景参考线性 CIE XYZ 图像 \(I_{\mathrm{XYZ}}\),以此作为跨所有渲染变体的真值锚点。随后,通过可微分软件 ISP 随机扰动三组核心参数采样出 \(N\) 个 sRGB 变体 \(\{I_{\mathrm{sRGB}}^{(n)}\}_{n=1}^N\):一是白平衡增益随机偏移,二是非线性色调曲线曲率扰动,三是基于中性灰枢轴的对比度增益。预训练 VAE 编码器将输入映射为潜变量对:
$\(z_{\mathrm{sRGB}}^{(n)} = E_{\mathrm{VAE}}(I_{\mathrm{sRGB}}^{(n)}), \quad z_{\mathrm{XYZ}} = E_{\mathrm{VAE}}(I_{\mathrm{XYZ}})\)$
该设计让网络在潜空间内接触到同内容、多色调的样本分布,显式促使去噪器学习对未知非线性润色算子保持不变性。
2. 条件流匹配 DiT 微调:基于 LoRA 的潜空间物理对齐
在生成模型骨干网络选择上,RawGen 采用具备原生图像上下文控制能力的修正流 DiT(FLUX.1-Kontext)。训练去噪模型时,从该场景的 \(N\) 个变体潜变量中随机抽取一个 \(z_{\mathrm{sRGB}}^{(n)}\) 作为条件上下文。目标噪声插值定义在标准的欧氏线性直线上:\(z_t = (1-t)z_{\mathrm{XYZ}} + t\epsilon\),其中 \(\epsilon \sim \mathcal{N}(0, I), t \in [0, 1]\)。去噪器以速度场预测(v-prediction)为目标,损失函数定义为: $\(\mathcal{L}_{\mathrm{denoise}} = \mathbb{E}_{n, t, \epsilon} \left\| v_{\mathrm{gt}} - v_\theta\left(z_t, t; z_{\mathrm{sRGB}}^{(n)}\right) \right\|_2^2, \quad v_{\mathrm{gt}} = \epsilon - z_{\mathrm{XYZ}}\)$ 在网络结构层面,sRGB 条件潜变量和加噪目标潜变量分别被切分为 Patch Token,并在序列维度上直接拼接送入 Transformer 块进行联合全注意力交互,仅有目标序列位置计算损失。为了完整保留大模型沉淀的通用视觉先验并防止破坏生成知识库,backbone 主干权重完全冻结,仅在多头注意力的投影层插入秩为 64、缩放系数为 64 的 LoRA 适配层,使模型以极小开销习得从非线性风格向线性辐射度锚点的收敛映射。
3. 线性域 VAE 解码器微调:重靶向解码物理线性图像
标准多模态扩散模型配套的预训练 VAE 解码器是在 display-referred 8 位非线性 sRGB 数据上预训练的,其内部通道归一化与非线性激活层隐含了针对 sRGB 感知均匀性的偏置。如果直接将去噪模型生成的 CIE XYZ 潜表征送入冻结的解码器,解出的图像会出现严重的动态范围压缩、非线性失真与色彩斑块。为此,RawGen 设立了第二阶段微调,专门优化 VAE 解码器 \(D_{\mathrm{VAE}}\)。微调直接利用预先计算的无噪真值锚点潜变量 \(z_{\mathrm{XYZ}}\) 作为输入,以真值物理线性图像 \(I_{\mathrm{XYZ}}\) 监督空间重建: $\(\mathcal{L}_{\mathrm{recon}} = \left\| D_{\mathrm{VAE}}(z_{\mathrm{XYZ}}) - I_{\mathrm{XYZ}} \right\|_1\)$ 这一微调步骤将 VAE 的解码流形顺利从 sRGB 像素域重靶向至浮点级连续的线性 XYZ 域,同时完整保留了预训练编码器提炼的空间拓扑与高频纹理结构。
4. 解耦式相机 Raw 渲染:元数据驱动的确定性目标设备映射
得到规范化的场景级线性图像 \(\widehat{I}_{\mathrm{XYZ}}\) 后,RawGen 并没有通过复杂的神经网络去死记硬背各个相机品牌的特有响应,而是通过严格的色彩科学几何映射解耦硬件特异性。针对用户指定的任意目标相机(如 Canon EOS、Samsung NX、Fujifilm X-M1 等),系统直接读取该设备单张标准 DNG 文件的元数据。根据选定的相关色温(CCT),在 DNG 标定的两组前向色彩校正矩阵(如标准光源 A 与 D65)之间进行线性插值,将 \(\widehat{I}_{\mathrm{XYZ}}\) 投影至该相机白平衡后的 RGB 空间,再乘以对应光源的通道增益,还原至传感器原生感光电荷响应空间。若下游任务需要模拟真实相机的感光噪声分布,系统可通过异方差高斯-泊松噪声模型注入光子散粒噪声与读出噪声,并按照目标相机的拜耳 CFA 阵列(如 RGGB)进行重新马赛克化,全程解析且完全无需针对新设备重新训练网络。
损失函数 / 训练策略¶
模型在训练阶段完全解耦为去噪器与解码器两个子任务,分别采用 AdamW 优化器进行端到端微调。去噪阶段通过式 (3) 优化速度场 \(v_\theta\),梯度仅反向传播至 DiT 的 LoRA 适配器(\(r=64, \alpha=64\));解码器阶段通过式 (4) 优化 \(D_{\mathrm{VAE}}\) 权重的 \(\ell_1\) 重构误差。训练数据混合了 MIT-Adobe FiveK 与 RAISE 数据集,覆盖城市、自然风景、肖像与动植物等极广泛的多样化场景。
在推理生成时,若执行图像到 Raw 任务(I2R),输入任意 sRGB 图像经过冻结的 \(E_{\mathrm{VAE}}\) 提取上下文潜变量 \(z_{\mathrm{sRGB}}\),随后在 DiT 中通过欧拉积分求解反向常微分方程(ODE)迭代去噪 50 步;若执行文本到 Raw 任务(T2R),则复用 FLUX.1 的原生 Text-to-Latent 生成路径获得 sRGB 域潜变量中间态,随后以相同的条件流匹配路径将其转化为 XYZ 潜变量并解码输出。
实验关键数据¶
主实验¶
为了严格检验在真实复杂后期处理下的反求能力,主实验选取了经典的 MIT-Adobe FiveK 数据集测试集。该数据集中每张图像均由五位专业修图师(Expert A–E)按照个人审美独立调整色彩、色调曲线和对比度,代表了真实世界中极度异构且不可预测的修图风格。对比基线包括代表性的传统网络 CIE XYZ Net、可逆网络 InvISP、以及最新的扩散逆向模型 Raw-Diffusion,重构精度以针对真实物理参考线性 XYZ 图像计算的 PSNR(dB)和 SSIM 衡量。
| 方法 | Expert A (PSNR / SSIM) | Expert B (PSNR / SSIM) | Expert C (PSNR / SSIM) | Expert D (PSNR / SSIM) | Expert E (PSNR / SSIM) |
|---|---|---|---|---|---|
| CIE XYZ Net (PAMI 2021) | 19.60 / 0.7861 | 21.04 / 0.8431 | 19.49 / 0.7795 | 19.44 / 0.8058 | 18.64 / 0.7918 |
| InvISP (CVPR 2021) | 16.04 / 0.6854 | 16.04 / 0.6854 | 14.92 / 0.6323 | 14.24 / 0.6802 | 13.30 / 0.6473 |
| Raw-Diffusion (WACV 2025) | 19.30 / 0.7832 | 20.66 / 0.8397 | 18.79 / 0.7705 | 18.69 / 0.7966 | 17.49 / 0.7751 |
| RawGen (单对单基线) | 19.57 / 0.7782 | 21.21 / 0.8349 | 19.48 / 0.7741 | 18.74 / 0.7929 | 18.07 / 0.7839 |
| RawGen (仅微调去噪器) | 23.36 / 0.8407 | 24.35 / 0.8540 | 23.40 / 0.8390 | 23.50 / 0.8476 | 23.77 / 0.8448 |
| RawGen (完整模型) | 23.20 / 0.8432 | 24.35 / 0.8581 | 23.37 / 0.8387 | 23.51 / 0.8531 | 23.89 / 0.8500 |
消融实验¶
消融实验重点验证了“许多对一(Many-to-One, N-to-1)训练范式”本身的有效性,以及该机制能否直接赋能传统确定性逆向 ISP 网络。实验在 MIT-Adobe FiveK 专家 A–E 集合上测定平均重构指标,引入了感知色差指标 \(\Delta E_{00}\)(数值越低越优)。此外,为验证输出对调色扰动的鲁棒收敛性,论文测试了将同一场景扩展至 100 种文本提示调色变体后,反向重构潜变量在 PCA、t-SNE 和 UMAP 空间下的质心平均 \(L_2\) 紧致度距离(表 2B)。
表 2A:训练协议与模型架构消融(MIT-Adobe FiveK 专家 A–E 平均)
| 实验配置 / 方法 | PSNR (dB) ↑ | SSIM ↑ | \(\Delta E_{00}\) ↓ | 说明 |
|---|---|---|---|---|
| CIE XYZ Net (N-to-1 重训) | 21.69 | 0.8070 | 9.66 | 赋予许多对一数据后相比单对单提升超 2 dB |
| InvISP (N-to-1 重训) | 8.92 | 0.2713 | 44.10 | 可逆网络难以拟合多对一的非单射压缩流形,严重崩塌 |
| RawGen (单对单 1-to-1) | 19.41 | 0.7928 | 13.85 | 仅用单一默认 sRGB 训练,面对专家调色无法消除风格偏置 |
| RawGen (完整模型 N-to-1) | 23.66 | 0.8486 | 8.39 | 在所有指标上显著领先,色差较传统方法大幅收窄 |
表 2B:100 种颜色变体下潜空间向锚点聚集的紧致度(Mean \(L_2\) Distance to Centroid ↓)
| 潜变量转换方式 | PCA 投影距离 ↓ | t-SNE 投影距离 ↓ | UMAP 投影距离 ↓ | 表现与现象 |
|---|---|---|---|---|
| 原始输入 sRGB | 286.8 | 27.65 | 2.099 | 调色扰动导致潜空间样本极度离散 |
| InvISP | 265.4 | 24.33 | 1.913 | 聚类发散,无法消除色偏 |
| CIE XYZ Net | 256.1 | 25.52 | 2.014 | 色彩收敛程度有限 |
| RAW-Diffusion | 318.2 | 19.58 | 2.557 | 扩散逆向模型仍保留了大量风格方差 |
| RawGen (Ours) | 160.0 | 10.69 | 1.067 | 质心距离缩减超 50%,形成极度收敛致密的单一流形簇 |
表 3:下游低级别视觉任务使用合成 Raw 数据训练的实测表现
| 训练数据来源 | 光源估计 (NUS-8, 9相机) Mean 角度误差 ↓ / Worst 25% ↓ |
神经 ISP (PyNet) PSNR (dB) ↑ / \(\Delta E\) ↓ |
传感器去噪 (SIDD) ISO 1600 PSNR ↑ / ISO 3200 PSNR ↑ |
|---|---|---|---|
| EnlightenGAN | 7.01° / 11.07° | 35.58 / 3.137 | 48.82 / 47.25 |
| UPI (CVPR 2019) | 6.26° / 10.33° | 36.43 / 2.907 | 49.05 / 47.51 |
| Graphics2RAW (ICCV 2023) | 4.21° / 8.57° | 38.10 / 2.301 | 49.37 / 48.16 |
| RawGen (合成 3K 样本) | 3.14° / 7.37° | 38.42 / 2.183 | 50.63 / 48.57 |
| 真实数据上限 (Real) | 3.02° / 6.77° | 38.32 / 2.133 | 49.80 / 48.25 |
关键发现¶
- 许多对一监督是消解风格偏差的决定性前提:对比单对单基线与 RawGen 完整版可见,若仅用固定 ISP 输出训练,模型对未知后处理一筹莫展;引入许多对一数据后,即便让传统 CIE XYZ Net 重训也能显著涨点 2.05 dB。然而,对于 InvISP 这类强行依赖单射双射(bijective)的可逆流模型,许多对一的不可逆映射导致其数学条件严重破缺,重训直接崩塌至 8.92 dB,证明了 DiT 生成先验在多对一欠定反演问题上的不可替代性。
- 潜空间流形高度收敛:从表 2B 的降维度量可以看出,面对 100 种激进色温与调色变体(如青橙调、冷暖色偏),RawGen 的平均质心距离比输入降低了近一半,t-SNE 距离甚至达到 10.69(基线均在 19–27 之间),证明网络确实是在消除风格而非简单复制输入特征。
- 下游任务全面超越真实数据拟合效果:在去噪任务(表 3)中,使用 RawGen 合成数据训练的模型在 ISO 1600 下取得了 50.63 dB 的高分,甚至超越了用真实配对数据训练的 49.80 dB;其核心收益来自于扩散模型基于提示词生成的合成数据在场景类别、光照动态范围和语义多样性上远远碾压了现实中仅有几百张固定视角的物理标定数据集。
亮点与洞察¶
- 解耦生成内容与硬件传感器参数:传统方法试图一步到位直接端到端生成某种特定型号的 Bayer Raw,导致每新增一款手机或相机就需要重新训练模型。RawGen 巧妙地把“生成式先验”限定在场景级 CIE XYZ 空间内解决内容和光照一致性,把“硬件特异性”推迟到最后的 DNG 线性色彩矩阵与噪声模型中确定性求解,实现了极其优雅的相机无关生成。
- 改写解调机制的“许多对一”逆向训练构思:直接指出了扩散生成图应用于逆向 ISP 时的核心痛点——扩散先验继承了互联网海量图片的混乱后处理。用受控多参数扰动 ISP 制造伪影群,并强制锚定回真值 XYZ,巧妙利用生成模型的条件流匹配将未知后处理“擦除”。
- 非破坏性物理级可控图像编辑新范式:以往生成模型如 Generative Photography 调节光圈、白平衡或快门必须每一次都从头跑数十步扩散推理,且受限于训练见过的参数。RawGen 只需一次生成物理线性的 Raw 图像,后续用户便可在 Lightroom、RawPy 等任何专业图像软件中以零时延、零质量损耗进行无限次曝光补偿、白平衡滑块微调与色调映射,完美融合了 AI 创造力与专业摄影工作流。
局限与展望¶
- 复杂光学畸变与传感器硬件指纹建模缺失:当前从 CIE XYZ 映射到 Raw 仅使用了线性前向颜色矩阵与全局高斯-泊松噪声模型,尚未考虑真实镜头的光学渐晕(Lens Shading)、点扩散函数(PSF 像差与衍射模糊)、径向畸变以及传感器微透镜阵列引起的非均匀空间响应。
- 极端过曝与高动态范围截断:由于骨干模型仍从 8 位感知域图像或对应潜空间演化而来,对高光过曝截断(Sensor Saturation)区域的反演依旧依赖先验脑补,缺乏物理真实的多重曝光高动态合成机制。
- 改进方向:后续工作可进一步将可微光学物理模型(如可学习的波前传播与空间自适应噪声流)与 DiT 结合,探索输入特定传感器 ID 直接端到端预测完整谱响应函数(Spectral Sensitivity Functions)的高保真物理仿真系统。
相关工作与启发¶
- vs CIE XYZ Net / InvISP: 传统逆向 ISP 方法强依赖严格的一对一配对数据与固定管线逻辑,面对网络非受控调色与多变 ISP 时性能急剧滑坡甚至数学失稳;RawGen 提出许多对一训练范式并依托扩散模型先验,在未见过的复杂艺术润色下仍能稳定恢复出高质量的线性辐射度图像。
- vs Raw-Diffusion: Raw-Diffusion 虽然同样采用了扩散模型合成 Raw,但其依然遵循传统固定的 RGB-to-Raw 单一管线,且输出强行绑定在单款设备上;RawGen 将生成目标提升至设备无关的 CIE XYZ 规范化空间,打通了 Text-to-Raw 与 Image-to-Raw 的双向统一接口,并能够一键泛化至任意未知相机。
- vs Generative Photography: 后者是在 8 位 sRGB 空间内部通过引导扩散过程来模拟曝光与白平衡调节,每一次调整参数都需要重新进行繁重的迭代去噪循环;RawGen 则是真正将图像从感知空间“还原”至物理传感器域,利用标准软件 ISP 算子实现瞬时且完全物理真实的相机参数后期调整。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次打通了文本直接生成相机物理线性 Raw 的全流程,并提出了极富启发性的多对一解耦逆向 ISP 构想。
- 实验充分度: ⭐⭐⭐⭐⭐ 兼顾真实专家修图盲测、高维调色紧致度几何投影、三项下游低级别视觉实战评测及跨手机/单反真实 ISP 渲染验证。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密,物理色彩空间推导与机器学习系统架构结合紧密,实验图表极其详实。
- 价值: ⭐⭐⭐⭐⭐ 极大地缓解了计算摄影与低级别视觉研究长期面临的高质量多机型 Raw 数据匮乏瓶颈,为工业级合成数据扩增开辟了全新路径。