跳转至

CLDefocus: Physically Grounded Compound-Lens Defocus Blur Synthesis

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/lykelee/CLDefocus
领域: 图像恢复
关键词: 散焦去模糊 / 复眼镜头 / 德拜衍射 / 点扩散函数 / 真实感合成

一句话总结

针对现有散焦去模糊数据集真实感与光学多样性不足的问题,本文提出了结合德拜啁啾Z变换(Debye CZT)波光学传播、深度分层遮挡感知合成以及辐射线性空间与相机ISP模拟的物理驱动合成管线,构建了包含700种复眼镜头的大规模基准数据集CLDefocus,显著提升了去模糊模型的跨设备泛化能力。

研究背景与动机

散焦模糊(Defocus Blur)在大光圈光学系统中极其常见,当物点发出的光线未能在传感器平面精准汇聚时,便会在焦平面上形成弥散圆(Circle of Confusion, CoC)。在摄影中散焦常用于营造景深虚化效果,但在计算机视觉任务中,严重的散焦模糊会抹除边缘和高频纹理结构,直接破坏目标检测、人脸识别和语义分割等下游任务的可靠性。尽管基于深度学习的散焦去模糊算法(如 NRKNet、Restormer)取得了显著进展,但其泛化性能高度依赖于训练数据的规模、光学多样性与物理真实性。

然而,获取高质量散焦图像对面临极其严苛的现实瓶颈。真实场景采集通常需要在保持相机固定姿态的同时切换光圈(大光圈模糊图像与小光圈清晰参考图像),这不仅难以大规模扩展到各类相机和镜头系统,而且机械调整光圈往往会引入空间微位移、曝光和色彩漂移,甚至参考小光圈图像自身仍残留不可忽略的景深模糊。另一方面,传统合成数据集要么依赖简化的圆盘(Disk)或高斯核模型,丢失了光学像差和非对称光瞳特性;要么基于传统惠更斯-菲涅耳或瑞利-索末菲衍射积分进行波光学模拟,这些积分计算复杂度极高且缺乏明确的抗混叠采样准则,导致难以对多样化镜头进行深浅景深全覆盖。此外,以往合成常在非线性 sRGB 空间直接卷积,违背了光学成像在辐射线性空间叠加的物理规律。

面对真实采集数据的对齐缺陷与传统合成数据光学逼真度不足的核心矛盾,本文提出了一条兼顾物理精确性与大规模合成效率的复眼镜头散焦模拟管线。核心 idea:利用基于德拜啁啾Z变换(Debye CZT)的显式采样波光学衍射计算快速生成多样化复眼镜头PSF,并在辐射线性空间结合深度分层遮挡感知与相机ISP链路进行物理一致性散焦图像合成,构建兼具光学多样性与像素级零漂移对齐的基准数据集。

方法详解

整体框架

本文提出的散焦模糊合成管线以清晰RAW图像和复眼镜头光学设计为输入,端到端合成高保真散焦图像对。整个流水线包含三个主要处理阶段:首先,通过光线追踪与德拜啁啾Z变换快速计算不同物距、场角与光圈下的真实镜头点扩散函数(PSF);其次,对输入场景进行单目度量深度估计,基于有符号弥散圆(Signed CoC)对深度进行自适应离散分层,并进行前景遮挡修复;最后,在辐射线性空间执行由后至前的前景-背景层叠卷积合成,并贯穿逆向/正向相机ISP与传感器噪声注入,生成物理一致的清晰-模糊配对图像。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["清晰 RAW 图像输入"] --> B["阶段 1:Debye CZT 波光学 PSF 计算<br/>光线追踪出瞳采样 + Zernike 拟合 + CZT 传播"]
    B --> C["阶段 2:深度分层与遮挡感知合成<br/>单目度量深度估计 + 符号 CoC 量化分层 + 背景补全"]
    C --> D["阶段 3:线性空间模糊与 ISP 模拟<br/>辐射线性层叠卷积 + 逆/正向 ISP + 传感器噪声"]
    D --> E["高保真清晰-模糊图像对 (sRGB)"]

关键设计

1. 基于 Debye CZT 的高效波光学 PSF 计算:建立显式采样准则与任意传感器分辨率对齐

传统波光学模拟通常采用瑞利-索末菲(Rayleigh-Sommerfeld)衍射积分,计算复杂度高达 \(\mathcal{O}(N^2 M^2)\),且缺乏严格的网格采样界限,容易产生剧烈的相位混叠与核函数变形。本文引入聚焦光场传播的德拜(Debye)表述,将出瞳(Exit Pupil, XP)球面上的收敛光波谱积分改写为傅里叶变换形式:

\[\mathbf{E}(x, y, z) = \mathcal{F}\left\{ E_t \exp\left(j k_z z\right) \right\}\]

其中 \(E_t\) 为出瞳球面上的波前分布,\(k_z\) 为纵向波矢分量,\(z\) 表示传感器离焦轴向位移。针对离散网格中的高频相位波动,论文基于相位因子导出了显式无混叠采样下界:

\[N_{\text{inf}} = \frac{2 \cdot \text{NA} \cdot |z|}{\lambda \cdot n_t}\]

为彻底压制大像差透镜引起的波前高阶振荡,本文严格设定输入采样网格尺寸为 \(N = 2 N_{\text{inf}}\)。标准 FFT 的输出网格步长受限于输入傅里叶共轭网格,无法自由匹配相机的物理像素尺寸。为此,算法引入基于 Bluestein 算法的啁啾Z变换(Chirp Z-Transform, CZT),实现对任意传感器感光像元间距和感兴趣区域(ROI)的自由缩放评估,将计算复杂度大幅降低至 \(\mathcal{O}((N+M)^2 \log(N+M))\)。计算时先在 \(u=5\) 倍的高清超采样网格上求解复振幅 \(E_u\) 并取模平方 \(P_u = |E_u|^2\),最后下采样至传感器分辨率,完全消除了数值边缘伪影。

2. 深度分层与遮挡感知合成:利用符号弥散圆离散化与背景修复消除边界空洞

场景中的物体深度连续变化,若逐像素直接计算连续变化的空间非平稳 PSF 卷积,计算量将不可承受;而简单的整图均匀卷积又会破坏虚化边界。本文提出依据有符号弥散圆(Signed CoC)自适应将连续度量深度图量化为 \(K\) 个离散层级。符号 CoC 能够自然区分焦平面之前(前景模糊)与焦平面之后(背景模糊)的光线发散方向。量化规则要求同一层内所有像素对应的符号 CoC 极差小于 1 个传感器像素,有效避免了景深离散化引起的虚化断层。

对于分割出的第 \(i\) 层颜色图 \(C_i\) 与不透明度遮罩 \(A_i\),由于前景模糊在物理上会因光圈口径而“外扩”并透出被遮挡的背景细节,若直接叠加会出现黑边或双影瑕疵。本文对被前景遮挡的背景层区域实施图像补全修复(Inpainting),将修复后的层图像按深度从远至近(从后向前)依次执行 PSF 卷积与 Alpha 混合层叠:

\[C_i^{\text{blur}} = C_{i-1}^{\text{blur}} \cdot (1 - A_i * P_i) + (C_i \cdot A_i) * P_i\]

最终积累合成最前端图层,获得几何一致且遮挡过渡平滑的散焦光场。

3. 辐射线性空间模糊与 ISP 模拟:符合光子累积物理规律的端到端色彩建模

真实相机成像中,光子在感光传感器上的能量叠加严格发生在线性辐射度空间(Linear RGB),而常见图像经过了伽马校正、色调映射与压缩等高度非线性的相机信号处理器(ISP)变换。直接在 sRGB 空间进行模糊卷积会导致高光虚化光斑(Bokeh)暗淡、颜色畸变并违背光子统计规律。本文构建了完整的可逆 ISP 仿真回路:从真实 RAW 图像出发,通过部分 ISP(去马赛克、白平衡、色彩校正矩阵变换)得到线性清晰图像 \(I_{\text{lin}}^s\);深度感知模糊卷积完全在 \(I_{\text{lin}}^s\) 上执行,生成线性模糊图像 \(I_{\text{lin}}^b\)。随后,管线利用逆向 ISP 将线性结果映射回 Bayer 域,合成与传感器增益匹配的高斯-泊松混合散粒噪声(Shot Noise)与读出噪声(Read Noise),最后通过正向非线性 ISP 转换到 sRGB 空间,生成严格光度学对齐的清晰-模糊配对 \((I_{\text{sRGB}}^s, I_{\text{sRGB}}^b)\)

一个完整示例

以拍摄一张包含近景玩偶与远景书架的场景为例: 1. RAW 补丁与几何深度提取:从 DPDD 原始 RAW 库中截取 \(384 \times 384\) 的局部区域,通过部分 ISP 解析为线性 RGB;利用单目深度估计模型 Depth Pro 预测该区域每个像素的绝对公制深度(例如玩偶深度 0.8m,书架深度 2.5m)。 2. 光学参数匹配与 PSF 采样:从 700 种候选优质复眼镜头库中随机抽取一款等效焦距 50mm、光圈 F/1.8 的镜头,设定对焦距离为 0.8m。依据近轴近似剔除超出计算阈值的无效组合后,对出瞳进行稠密光线追踪,拟合 Zernike 多项式并由 Debye CZT 计算出 0.8m 处清晰锐利的 PSF,以及 2.5m 处带有真实球差与渐晕边缘截断的光斑核函数。 3. 分层卷积与遮挡融合:根据符号 CoC 将场景离散为 \(K=12\) 个深度图层;对书架被玩偶轮廓挡住的区域进行扩散填充,防止前景虚化外溢时暴露空洞;自后向前逐层执行核卷积与遮罩 Alpha 混合。 4. 传感器噪声与非线性显色:将合成出的线性模糊补丁逆映射回 RAW 传感器域注入噪声,并由正向 ISP 赋予 sRGB 伽马曲线;同时将未经模糊的线性原图送入相同 ISP 得到真值图。最终输出一套几何完美对齐、光斑纹理逼真、色调完全吻合的训练数据对。

实验关键数据

主实验

为了验证数据集的实用价值与跨设备泛化能力,作者在相同训练配置(统一以 NRKNet 为主干模型、相同的训练迭代步数 350,000 次)下,分别在实拍数据集 DPDD、传统简化合成数据集 SYNDOF 以及本文提出的 CLDefocus 上进行训练,并在四大基准测试集(CLDefocus 测试集、RTF、RealDOF、DPDD)上进行全参考指标(PSNR / SSIM / LPIPS)与无参考图像质量感知指标(NIQE / MUSIQ / TOPIQ)的系统评测。

表 1:全参考评价指标对比(PSNR ↑ / SSIM ↑ / LPIPS ↓)

测试集 训练集 PSNR (dB) ↑ SSIM ↑ LPIPS ↓
CLDefocus (本文) CLDefocus (本文) 32.16 0.865 0.201
SYNDOF 27.58 0.790 0.296
DPDD 28.27 0.825 0.263
RTF CLDefocus (本文) 26.62 0.845 0.242
SYNDOF 24.55 0.743 0.261
DPDD 25.95 0.833 0.207
RealDOF CLDefocus (本文) 24.74 0.764 0.303
SYNDOF 21.64 0.654 0.474
DPDD 25.03 0.771 0.335
DPDD CLDefocus (本文) 24.73 0.776 0.265
SYNDOF 23.77 0.743 0.315
DPDD 26.11 0.817 0.223

表 2:无参考质量评价指标对比(NIQE ↓ / MUSIQ ↑ / TOPIQ ↑)

测试集 训练集 NIQE ↓ MUSIQ ↑ TOPIQ ↑
CLDefocus (本文) CLDefocus (本文) 7.724 39.850 0.348
SYNDOF 12.048 36.904 0.316
DPDD 7.508 38.961 0.345
RTF CLDefocus (本文) 4.263 59.144 0.533
SYNDOF 3.855 57.279 0.539
DPDD 4.196 58.822 0.531
RealDOF CLDefocus (本文) 5.029 35.787 0.303
SYNDOF 6.285 23.905 0.241
DPDD 6.030 31.350 0.270
DPDD CLDefocus (本文) 4.657 56.696 0.487
SYNDOF 5.067 55.819 0.493
DPDD 4.746 59.473 0.507

消融实验

为定量剖析合成管线各核心模块的独立贡献,作者在 RealDOF 测试集上进行了消融对比(统一采用 NRKNet 作为去模糊网络)。

表 3:各合成组件在 RealDOF 测试集上的消融实验

实验配置 PSNR ↑ SSIM ↑ LPIPS ↓ NIQE ↓ MUSIQ ↑ TOPIQ ↑ 说明
w/o Lens (无真实镜头核) 22.34 0.667 0.521 7.733 25.162 0.238 替换为等效高斯模糊核,性能全面崩塌
w/o ISP (无 ISP 模拟) 23.49 0.746 0.349 5.191 32.045 0.285 直接在 sRGB 空间卷积且无 RAW 噪声模拟
w/o Depth (无深度分层) 24.54 0.762 0.317 5.292 34.999 0.300 忽略深度变化退化为单层均匀模糊卷积
Full Pipeline (完整方案) 24.74 0.764 0.303 5.029 35.787 0.303 完整结合物理光学、深度感知与成像ISP

关键发现

  1. 光学 PSF 的真实性决定去模糊泛化天花板:将真实镜头 PSF 替换为参数化高斯核(w/o Lens)会导致 PSNR 暴跌 2.40 dB、LPIPS 恶化 0.218。这说明基于简单对称核训练的深度网络根本无法复原包含非对称彗差、球差和光瞳渐晕等复杂几何畸变的真实光学模糊。
  2. 实拍基准存在“像素错位红利”系统性偏差:在实拍测试集 DPDD 和 RealDOF 上,在 DPDD 自身上训练的模型获得了更高的 PSNR,但在无参考感知指标(NIQE / MUSIQ / TOPIQ)与视觉主观锐度上,CLDefocus 训练的模型全面胜出。作者深入分析指出,实拍数据集因改变物理光圈引起的微小视角平移、微动以及残余模糊,导致“保守、欠去模糊”的恢复结果更容易在像素级残差指标上获利;而 CLDefocus 训练的模型复原出的锋利高频边缘反而会受到错位真值的严厉惩罚。
  3. Debye CZT 兼备极速与无混叠稳定性:在 PSF 衍射计算耗时对比中,传统瑞利-索末菲积分耗时高达 45.1 秒(\(N=256\) 网格),且由于缺乏明确采样下界,采样数不足时核函数严重扭曲;而 Debye CZT 依据显式理论准则(\(N=732\))仅需 0.018 秒(提速超 2500 倍),彻底扫清了大规模生成数万种镜头离焦 PSF 的算力障碍。

亮点与洞察

  • 波光学理论与 CZT 算法的极速融合:巧妙借助聚焦光场传播的德拜积分形式将衍射计算等价为傅里叶变换,并引入啁啾Z变换彻底解耦了输入波前网格与物理传感器感光像元尺寸的绑定。使得复眼镜头的衍射 PSF 仿真可以在毫秒级完成,兼备物理高保真与流水线量产可行性。
  • 揭示实拍全参考基准的评价偏差隐患:尖锐指出了计算机视觉界长期依赖的实拍双光圈去模糊数据集(如 DPDD)中固有的“光圈诱导光度/几何错位”。用充分的直方图漂移与视觉对比证明了像素级指标(PSNR/SSIM)对保守模糊结果的虚假青睐,为超分辨率与去模糊领域重新审视合成数据集的地位提供了坚实的论据。
  • 可解耦、可控的光学物理数据工厂:该管线参数全部显式可控(镜头设计图纸、光圈 F 值、物距、对焦平面、像元大小)。这种可编程性不仅适用于散焦去模糊,还能直接无缝迁移到逆向任务——如虚拟大光圈单反虚化渲染(Portrait Bokeh Rendering)、基于散焦的单目深度估计(Depth from Defocus, DFD)以及光场重构。

局限与展望

  • 极端大离轴场角模拟精度存在衰减:德拜近似在视场极大、强烈离轴(Off-axis)光线下精度有所降低,且镜头内部极复杂的机械光阑遮挡(如不规则多边形光圈与复杂内壁机械渐晕)难以完全由解析光线投影和 Zernike 多项式完美还原。
  • 单目深度估计与简易 ISP 的累积误差:管线依赖单目深度估计模型(Depth Pro)推断物距,一旦深度估计在细小物体边缘出现伪影,合成的虚化层边界也会发生局部瑕疵;同时所采用的通用参数化 ISP 仍无法覆盖部分高端相机专属的非线性降噪与锐化逻辑。
  • 未来改进路径:后续可探索将矢量衍射理论与可微光线追踪结合以支持超大视场超广角镜头;进一步引入自适应神经隐式光场表达,避免离散层级划分,并开放可调节离焦程度的课程学习(Curriculum Learning)训练策略。

相关工作与启发

  • vs SYNDOF (Lee et al., CVPR 2019):SYNDOF 采用基于薄透镜近似的高斯或圆盘核进行卷积合成,计算简单但完全忽略了复眼镜头的实际球面像差、色散与彗差;本文基于真实工业 Zemax 复眼镜头库结合波动光学衍射计算,光学逼真度与跨设备泛化性能全面大幅超越。
  • vs DPDD (Abuolaim & Brown, ECCV 2020):DPDD 依赖佳能单反相机实拍,场景与设备仅局限于单一机型(Canon DSLR),且多曝光切换光圈引入了像素级错位与光度不一致;本文通过全流程物理合成实现像素级严格对齐,支持 700 种镜头多样性,在无参考感知指标上显著占优。
  • vs RSBlur (Rim et al., ECCV 2022):RSBlur 重点研究了运动模糊与相机 ISP 间的辐射度关系;本文借鉴了其线性空间合成的原则,并将其创新性地推演拓展至复眼镜头波前衍射、离焦弥散圆深度分层与前景遮挡感知修复的完整光学管线中。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ [首次实现基于 Debye CZT 与显式采样准则的毫秒级复眼镜头波动光学 PSF 计算,彻底打通了物理精确散焦合成链路。]
  • 实验充分度: ⭐⭐⭐⭐⭐ [覆盖 700 种工业级镜头,构建 4.2 万图像对,在四大全参考与无参考基准及多个主干网络上进行了系统性横向与消融评测。]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑严密清晰,深入浅出地剖析了实拍数据集的对齐偏差,图表直观且理论推导完备。]
  • 价值: ⭐⭐⭐⭐⭐ [开源了完整的合成框架与大规模高质量数据集,不仅突破了散焦去模糊的数据瓶颈,也为计算成像领域提供了高价值的光学模拟基础设施。]