Synthetic Sub-Aperture Phase Augmentation for Demosaicing 2×2 Shared Microlens Sensors¶
会议: ECCV 2026
论文: ECCV 原文
领域: LLM 其他
关键词: 去马赛克、共享微透镜、相位建模、合成数据、相位对焦
一句话总结¶
针对 2×2 共享微透镜传感器在散焦下子孔径相位偏移引发网格状棋盘伪影的难题,提出无需传感器逐点标定的合成子孔径相位增强框架(SPA),配合轻量化网络在抑制伪影的同时保留了真实自然的散焦模糊。
研究背景与动机¶
现代移动端超高分辨率 CMOS 图像传感器(如突破两亿像素的传感器)普遍采用 Quad(2×2)和 Hexadeca(4×4)等聚合彩色滤波阵列(Clustered CFA)布局,以在微小像元尺寸下通过多像素合一提升暗光信噪比。与此同时,高端传感器为了实现全像素高密度相位对焦(PDAF),大规模引入了 2×2 共享微透镜架构(Q-cell lens / 2×2 On-Chip-Lens),即让同色的 2×2 相邻像素共用单个微透镜,从而在单次曝光中采集左上(TL)、右上(TR)、左下(BL)、右下(BR)四个方向的子孔径光线。然而,这一光学设计在带来全向相位检测能力的同时,为全分辨率图像重建引入了严重的欠探索物理伪影。
传统去马赛克算法(包括 DPN、KLAP、NAFNet 等基于深度学习的方案)均隐式基于同色像素簇内光度一致性的基本假设。然而在非合焦(散焦)状态下,共享微透镜下的四个子孔径会产生视角视差位移,导致同一 2×2 单元内的采样值出现明显的极性交替与强度失衡;加之镜头边缘主光线角(CRA)倾斜诱发的非对称遮挡,直接在 RAW 域构成了高频周期性偏置。传统网络将这种物理相位偏置误判为真实的高频边缘与色彩纹理,重建后在 RGB 域急剧放大为顽固的网格状棋盘伪影、拉链效应与伪色边缘。若要通过传统物理标定采集不同传感器、镜头模组、视场位置与对焦距离下的真实点扩散函数(PSF),工程复杂度与成本在移动端部署中几乎不可行。
本文切入角度在于:去马赛克模型对周期性网格伪影的敏感本质上源于训练数据分布的缺陷——现有的 RAW 图像合成管线只考虑了逆 ISP 变换与噪声分布,从未暴露过子孔径相位偏置。核心 idea:提出物理启发的合成子孔径相位增强框架(SPA),通过紧凑的方向衰减核与主光线角扰动合成四向子孔径视差,并以对称模糊为无偏重构目标,无需实测 PSF 或传感器专属标定即可引导网络学会解耦相位偏置与自然高频结构。
方法详解¶
整体框架¶
SPA 在数据生成阶段模拟共享微透镜传感器的四向相位采样过程,随后由轻量级去马赛克网络进行端到端重构。输入场景级未处理 sRGB 图像,首先经过逆 ISP 操作映射回场景参考的线性 RGB 空间;然后根据薄透镜模型与巴特沃斯函数生成基础弥散圆核,通过正交线性衰减与局部 CRA 倾斜扰动解耦出 TL、TR、BL、BR 四组各向异性子孔径核;接着对线性图像分别滤波并交错编织为 2×2 簇状 RAW 阵列,添加泊松-高斯噪声作为网络输入;最后,以对称弥散圆核滤波后的图像作为无偏真实标签,训练轻量网络 PhaseUNet 学习去除相位交织引起的周期伪影。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["场景参考线性 RGB 图像"] --> B["基于物理的各向异性子孔径相位核采样<br/>薄透镜弥散圆 + 方向线性衰减场"]
B --> C["主光线角偏置扰动模拟<br/>局部角度随机扰动引入能量失衡"]
C --> D["对称散焦目标约束与 RAW 交错合成<br/>四向子孔径交织 + 滤镜遮罩 + 噪声注入"]
D --> E["轻量级相位感知反马赛克网络<br/>PhaseUNet 重建全分辨率 RGB"]
关键设计¶
1. 基于物理的各向异性子孔径相位核采样:解耦四向子孔径弥散特性
为了在无需精确光学标定的前提下逼真模拟 Q-cell 结构在散焦时的能量偏置,算法基于薄透镜近似与巴特沃斯环状轮廓建立基准对称模糊核。对于物距 \(d\) 与对焦距离 \(s\),带有正负符号的弥散圆(CoC)半径 \(r\) 决定了前后景焦外极性与核尺寸,结合平滑巴特沃斯响应构造出中心微陷的软化光斑核 \(K_0\)。在此基础上,定义沿水平与垂直维度的线性衰减场 \(D_x(i, j) = \frac{j}{k-1}\) 与 \(D_y(i, j) = \frac{i}{k-1}\),通过正交方向调制与翻转运算快速导出基底子孔径核:
对水平与垂直基底核进行对角两两平均即可获得左上、右上、左下、右下四个子孔径核(如 \(K_{TL} = \frac{1}{2}(K_T + K_L)\))。前后焦翻转则通过反转衰减场 \((D_x, D_y) \to (1-D_x, 1-D_y)\) 实现,精确重现了焦前与焦后子孔径明暗交替的极性反转特性。
2. 主光线角偏置扰动模拟:覆盖传感器边缘入射光倾斜
在实际手机摄像模组中,边缘视场的主光线并非垂直入射,倾斜的入射角导致微透镜下的四个光电二极管接收光通量发生各向异性遮挡与偏移。为了让模型在未知像高位置坐标的情况下具备全局鲁棒性,算法引入了基于局部 patch 随机采样的 CRA 倾斜扰动因子 \(\delta \sim \text{Uniform}(-0.15, 0.15)\),对衰减场的缩放系数施加反相关的线性扰动:
经过 CRA 修正后的衰减场使得最终合成的四个对角子孔径核存在自然的能量不对称性。这种轻度各向异性能量倾斜有效避免了合成数据过于理想化对称的缺陷,迫使去马赛克网络学习对镜头阴影、微透镜装配误差引起的偏置具有强容忍度的滤波表征。
3. 对称散焦目标约束与 RAW 交错合成:构建无偏监督信号
将四个子孔径核分别作用于线性 RGB 图像得到四路视差图 \(I_{lin}^{(v)}\)(\(v \in \{TL, TR, BL, BR\}\)),随后根据像元坐标 \((i, j)\) 的奇偶性以 \(2\times 2\) 周期交错重采样拼装为单张 RAW 图像,经由 CFA(Hexadeca 4×4 或 Quad 2×2)掩码与泊松-高斯噪声注入形成训练输入。至关重要的是监督目标的设计:传统去模糊或超分若以清晰图为监督会强制网络在严重散焦区域强行幻觉高频边缘,破坏焦外光学柔美感;本文直接以对称基准核卷积的图像 \(I_{tgt} = K_0 * I_{lin}\) 作为真值目标。该目标保留了真实的散焦弥散程度,但完全剥离了子孔径视差引起的网格交织跳跃,使网络的目标聚焦于消除极性交替与棋盘偏置。
4. 轻量级相位感知反马赛克网络:微小算力验证数据驱动优势
为了严格证明性能提升源自物理启发式数据增强而非网络参数堆叠,本文设计了一个极紧凑的 U-Net 风格骨干 PhaseUNet,基础通道数仅为 \(C=32\),总参数量约为 0.90M。网络包含 3 级下采样编码器与 2 级上采样解码器,搭配跨层加性残差跳跃连接和最终的残差精细化重建头。训练阶段采用平滑的一范数损失 \(\mathcal{L}_1 = \|I_{pred} - I_{tgt}\|_1\) 端到端优化。超轻量化的架构不仅利于移动端芯片的部署验证,更清晰地证实了只要训练数据能够覆盖物理相位畸变,极小规模网络便足以完美抹除传统大模型无法应对的 Q-cell 周期性伪影。
实验关键数据¶
主实验¶
在合成 Q-cell RAW 评测基准(涵盖 Kodak、McM、Set5、Set14 和 Urban100 共 5 个经典数据集,按真实拍摄概率加权混合合焦与各级散焦)上,PhaseUNet 与代表性聚簇去马赛克 SOTA 方法的客观指标对比见下表:
| 模型 | 参数量 (M) | 计算量 (MACs, M) | Hexadeca PSNR (dB) ↑ | Hexadeca SSIM ↑ | Hexadeca LPIPS ↓ | Quad PSNR (dB) ↑ | Quad SSIM ↑ | Quad LPIPS ↓ |
|---|---|---|---|---|---|---|---|---|
| DPN | 5.58 | 10775 | 35.09 | 0.942 | 0.0747 | 35.42 | 0.945 | 0.0698 |
| NAFNet | 17.11 | 3985 | 35.31 | 0.946 | 0.0719 | 35.68 | 0.948 | 0.0673 |
| KLAP | 17.80 | 4016 | 33.64 | 0.922 | 0.0965 | 34.12 | 0.928 | 0.0892 |
| PyNet-Q×Q | 1.07 | 4408 | 28.35 | 0.836 | 0.2057 | — | — | — |
| PhaseUNet (本文) | 0.90 | 3010 | 36.60 | 0.954 | 0.0434 | 37.15 | 0.958 | 0.0401 |
消融实验¶
在 Hexadeca CFA 设定下,评估 SPA 相位感知训练策略在不同散焦程度下的增益表现(以相同 PhaseUNet-H 骨干做消融):
| 散焦等级 (弥散圆半径) | 训练配置 | PSNR (dB) ↑ | SSIM ↑ | LPIPS ↓ | 相对改善幅度 |
|---|---|---|---|---|---|
| 轻度散焦 (\(0 < \|r\| \le 2\)) | w/o SPA | 32.91 | 0.941 | 0.083 | 基准 |
| w/ SPA (完整) | 35.44 | 0.954 | 0.043 | PSNR +2.53 dB / LPIPS -48% | |
| 中度散焦 (\(2 < \|r\| \le 5\)) | w/o SPA | 34.76 | 0.932 | 0.192 | 基准 |
| w/ SPA (完整) | 41.62 | 0.985 | 0.028 | PSNR +6.86 dB / LPIPS -85% | |
| 重度散焦 (\(\|r\| > 5\)) | w/o SPA | 33.46 | 0.827 | 0.332 | 基准 |
| w/ SPA (完整) | 47.33 | 0.994 | 0.015 | PSNR +13.87 dB / LPIPS -95% |
同时,在真实采集的 Q-cell 传感器测试集(包含 116 张 Hexadeca 真实抓拍与 52 张 Quad 图表抓拍)上,采用无参考感知指标 CLIPIQA 以及本文提出的空间晶格不平衡度(SLI)和奈奎斯特能量比(NER)进行结构伪影量化:
| 传感器配置 | 评估指标 | DPN | NAFNet | KLAP | PyNet-Q×Q | PhaseUNet (本文) |
|---|---|---|---|---|---|---|
| 真实 Hexadeca | CLIPIQA ↑ | 0.376 | 0.368 | 0.356 | 0.257 | 0.390 |
| SLI (×10⁻³) ↓ | 4.61 | 3.97 | 5.94 | 10.25 | 2.97 | |
| NER (×10⁻²) ↓ | 5.067 | 7.274 | 3.957 | 1.204 | 0.012 (\(1.2\times 10^{-4}\)) | |
| 真实 Quad | CLIPIQA ↑ | 0.409 | 0.401 | 0.394 | — | 0.467 |
| SLI (×10⁻³) ↓ | 2.05 | 3.26 | 1.39 | — | 0.56 | |
| NER ↓ | 2.929 | 2.557 | 1.909 | — | 0.00007 (\(7.0\times 10^{-5}\)) |
关键发现¶
- 散焦越严重,相位失配对去马赛克的破坏越呈指数级恶化。在重度散焦区间,未加入 SPA 的模型因将错位的极性当成结构反转,PSNR 仅 33.46 dB,而加入 SPA 后飙升至 47.33 dB(+13.87 dB),LPIPS 骤降 95%,证明网格伪影正是大散焦下误差的核心根源。
- 频域与空域伪影被近乎彻底消除。在真实 Quad 传感器上,NER(衡量 2×2 周期奈奎斯特峰值能量占比)由传统基线的 1.9~2.9 暴降至 \(7\times 10^{-5}\),频域响应由刺锐的离散尖峰退化为符合自然图像统计特性的平滑衰减。
- 零样本跨阵列泛化性突出。无论是 4×4 的 Hexadeca 还是 2×2 的 Quad 布局,轻量化网络均以极低算力(3010M MACs,比 NAFNet 节省 24% 算力、参数仅为其 1/19)刷新了 SOTA,验证了物理相位先验的普遍有效性。
亮点与洞察¶
- 数据级物理先验破局传统算力依赖:在图像去马赛克中,棋盘伪影的症结不在于网络容量不足,而在于训练集缺少微透镜视差的物理机制。通过轻巧的各向异性衰减核重构数据管线,0.9M 的小模型便轻易击败了近 20M 的通用大模型。
- 对称模糊目标的无偏对齐构想:训练监督不盲目追求去模糊恢复锐利高频,而是以对称弥散圆核作为真值。既保护了焦外画面的自然虚化美感,又强制模型只剥离网格极性伪影,避免了不切实际的高频脑补。
- SLI 与 NER 指标填补无参考评估空白:传统 PSNR/LPIPS 对细微的高频周期性跳跃敏感度有限,SLI(空间子晶格均值差异)与 NER(2×2 奈奎斯特离散能量比)直接从空域周期和频域谱峰切入,为共享微透镜传感器的图像质量评价提供了标准量化工具。
局限与展望¶
- 局限性:目前的薄透镜与巴特沃斯核采样仍属轴对称与一阶各向异性近似,尚未显式引入高级光学像差(如彗差、散光与场曲);在极其极端的大像高边缘视场下,高阶非对称像差仍可能产生微弱的残存相位差。
- 适用范围:当前实验主要针对 2×2 共享微透镜(Q-cell)架构;对于 1×2 双光电二极管(2PD)或更复杂的非对称对焦点阵,核衰减场需要定制化重新映射。
- 未来改进:探索可微分的物镜级可形变光学模拟,以及根据光学镜头参数直接推导空间自适应的局部增强分布,进一步向全链路车载/航拍高动态场景推广。
相关工作与启发¶
- vs DPN / NAFNet / KLAP (聚簇 CFA 去马赛克):现有聚簇去马赛克方法仅聚焦于克服色彩子像素稀疏采样带来的插值模糊,全部默认同一同色单元内部采样一致。本文指出了共享微透镜诱发簇内极性跳变这一关键物理隐患,并通过 SPA 从数据源头彻底切断了伪影传递。
- vs 2PD 散焦去模糊 (Dual-Pixel Deblurring):双像素领域利用左右视差估计景深或复原锐利图像,属于图像域去模糊任务。本文则发现多向子孔径视差在 RAW 域与 Bayer 滤波阵列发生非线性空间混叠,首次从去马赛克底层重构视角解决了色彩域的结构伪影。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ [首次揭示 2×2 共享微透镜在聚簇 CFA 上的相位交错伪影机制,并提出优雅的免标定合成方案]
- 实验充分度: ⭐⭐⭐⭐⭐ [涵盖合成基准、实测原型芯片 RAW 数据,且自研空频域两项全新度量指标]
- 写作质量: ⭐⭐⭐⭐⭐ [物理建模直观透彻,动机严密,图文对照自洽]
- 价值: ⭐⭐⭐⭐⭐ [为两亿像素手机传感器 ISP 全分辨率去马赛克提供了开箱即用且算力友好的关键解决方案]