Diffusion-based dual-view reflection removal¶
会议: ECCV 2026
论文: ECCV 原文
领域: 图像恢复
关键词: 图像去反光、双视角扩散模型、跨帧空间注意力、相机位姿先验、物理视差解耦
一句话总结¶
针对单图去反光严重欠定以及多帧序列对齐易受反光干扰的难题,本文提出基于双视角扩散模型的去反光框架,通过有向跨帧空间注意力杜绝跨视角噪声泄漏,并以软条件形式注入手机 IMU 相对位姿以利用深度视差解耦透射层与反射层。
研究背景与动机¶
玻璃反光去除(Reflection Removal)是移动摄影与计算成像中的经典逆问题,其成像物理模型通常简化为观测混合图像由透射层与反射层线性叠加而成。长期以来,单图去反光(SIRR)因其极低的操作门槛成为最主流的研究方向,但将单幅图像分解为两个未知图层本质上是病态欠定的,存在无穷多组可行解。即使引入大规模生成扩散先验或多模态大模型,当遇到强光过曝、结构复杂的反光时,单图算法仍极易混淆透射和反射结构,甚至误将反光纹理增强,造成严重的视觉伪影。
为打破单图逆问题的病态约束,研究者曾探索过偏振滤镜、近红外、闪光灯对以及长序列多视角等方案。然而,专用硬件大幅增加了设备成本与采集复杂度;而多帧序列与连拍方案通常严重依赖显式光流估计或稠密 3D 重建。由于物理透射层与虚拟反射层处于不同的空间深度,两层之间表现出截然不同的视差运动;当反光层严重破坏图像梯度与对应性时,显式光流算法极易在反光区域发生误匹配并累积级联误差。与此同时,现代智能手机普遍标配双摄系统或支持瞬时抓拍(如 Live Photo),能以单次快门自然捕获具备基线视差的双视角图对,但双视角所含的视线冗余远低于多帧序列,如何在不依赖脆弱显式光流的前提下充分挖掘跨视角几何视差成为新的瓶颈。
面对这一挑战,本文转换思路:既不采用显式稠密匹配,也不施加硬性几何 3D 约束,而是将双摄采集的几何视差解耦过程完全内化到扩散模型中。核心 idea:构建双视角扩散去反光框架,设计仅允许加噪透射特征查询纯净混合图的有向跨帧空间注意力以杜绝噪声跨视角泄漏,同时将手机 IMU 估计的相对相机位姿作为软条件嵌入与去噪步数特征相融合,引导网络自适应解耦深度视差并稳定分离反光。
方法详解¶
整体框架¶
本文方法以 Stable Diffusion v2.1 架构为骨干,旨在从输入的成对混合图像 \(M_1, M_2\) 及对应相机位姿 \(p_1, p_2\) 中,联合恢复出纯净的双视角透射图像 \(T_1, T_2\)。系统先利用预训练冻结的 VAE 编码器将双视角混合图和透射图投影至隐空间;在扩散前向加噪中,仅对透射隐变量添加高斯噪声,而双视角的混合条件隐变量保持完全纯净。两者在通道维度拼接形成 16 通道的联合输入送入修改后的去噪 U-Net。在 U-Net 的深层上采样阶段,引入跨帧空间注意力实现跨视角交互;同时将相机位姿转化为归一化相对位姿嵌入,注入到扩散步数编码中共同调节网络特征。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["双视角输入<br/>图像对 (M1, M2) + 姿态 (p1, p2)"] --> B["相对位姿编码<br/>四元数与归一化平移注入时间步"]
A --> C["VAE 隐空间联合通道拼接<br/>加噪透射 (z1_t, z2_t) + 纯净混合 (c1_M, c2_M)"]
B --> D["去噪 U-Net 主干网络"]
C --> D
D --> E["跨帧空间注意力<br/>加噪透射 Q 仅查询纯净混合 K, V"]
E --> F["双阶段渐进式课程训练<br/>视差学习 → 极端反光鲁棒增强"]
F --> G["纯净透射图恢复<br/>双视角无反光输出 (T1, T2)"]
关键设计¶
1. 跨帧空间注意力:切断跨视角噪声污染的有向交叉注意力
在双视角设置下,利用基线视差是分离处于不同深度的透射与反射层的关键,但直接引入无约束的全局自注意力会导致双视角的加噪隐变量互相混合,造成噪声跨视角泄漏与放大;而使用 3D 卷积层又会改变特征维度,破坏预训练 2D 扩散模型的强大生成先验。为此,本文在 U-Net 处于 \(16 \times 16\) 与 \(32 \times 32\) 分辨率的上采样层中引入了有向跨帧空间注意力。将隐藏特征拆分为来自双视角加噪透射路径的查询分量 \(l_q \in \mathbb{R}^{B \times 2C' \times H \times W}\) 与来自纯净混合路径的条件分量 \(l_c \in \mathbb{R}^{B \times 2C' \times H \times W}\),展平后复用 SD 预训练投影矩阵分别映射出 \(Q_{\text{all}}, K_{\text{all}}, V_{\text{all}}\)。核心机制是强制构建单向注意力流:查询向量只截取自加噪透射位置,而键值对仅截取自纯净混合条件位置:
$\(\mathbf{Q} = \mathbf{Q}_{\text{all}}[:, :2HW, :], \quad \mathbf{K} = \mathbf{K}_{\text{all}}[:, 2HW:, :], \quad \mathbf{V} = \mathbf{V}_{\text{all}}[:, 2HW:, :]\)$
注意力运算 \(\text{Softmax}(\mathbf{Q}\mathbf{K}^\top / \sqrt{d_k})\mathbf{V}\) 的输出通过残差连接加回到透射查询特征上,纯净混合特征则原样保留。这种非对称有向设计确保每个加噪 patch 能全局检索两个视角中的全部纯净混合信息以获取互补视差,同时彻底阻断了未去噪特征之间的双向噪声传播。
2. 相对位姿编码:抑制惯导漂移的几何软条件注入
人眼在透过玻璃观察时,会通过轻微晃动头部并对比自身移动与场景视差来辨别反光;但在移动端,消费级手机的 IMU 与陀螺仪普遍存在尺度漂移和高频测量噪声,传统的显式多视几何投影极易崩溃。本文提取绝对姿态 \(p_1 = [\mathbf{t}_1, \mathbf{q}_1]^\top\) 与 \(p_2 = [\mathbf{t}_2, \mathbf{q}_2]^\top\) 后,舍弃绝对尺度,仅保留高度可靠的平移方向与相对旋转四元数,构建 7 维相对位姿表征:
$\(\mathbf{p}_{\text{rel}} = \left[ \frac{\mathbf{t}_2 - \mathbf{t}_1}{\|\mathbf{t}_2 - \mathbf{t}_1\|}, \, \mathbf{q}_2 \otimes \mathbf{q}_1^{-1} \right]\)$
该表征经由双层 MLP 映射为几何条件嵌入 \(e_p\),并以自适应缩放系数 \(\gamma = 0.15\) 注入到扩散时间步嵌入中:\(e_c = e_t + \gamma e_p\)。这种软条件调制形式将相对运动向量作为全局先验,告知网络相机位移方向与转角,有效指导空间注意力强化符合物理透射视差运动的特征、抑制违反该几何变换的虚拟反光,且对手机传感器的测量误差展现出强鲁棒性。
3. 双阶段渐进式课程训练:兼顾物理视差学习与极端反光鲁棒性
实验发现,若仅在简单反光场景下训练,模型在真实强过曝或复杂结构反光中会彻底失效;但若直接用极端破坏样本训练,模型又无法从杂乱信号中学会利用微妙的双目视差。为此本文制定了两阶段课程策略:第一阶段在 \(768 \times 768\) 分辨率和中等反光强度 \(\alpha_r \sim \mathcal{U}(0.3, 0.7)\) 下奠定视差解耦基础,并引入随机视角丢弃(分别以 15% 概率将其中一视角替换为另一视角,位姿置零)与 25% 的条件位姿丢弃,迫使网络兼备单视角泛化和纯视觉几何推断能力;第二阶段将反光强度提升至 \(\alpha_r \sim \mathcal{N}(0.8, 0.2)\)(截断在 \([0.4, 1.2]\)),并叠加运动模糊、色差畸变与重影伪影,使网络充分适应反光掩盖透射主体的严苛极端工况。
损失函数 / 训练策略¶
训练目标遵循带有视角掩码 \(m_v \in \{0, 1\}^2\) 和位姿掩码 \(m_p \in \{0, 1\}\) 的条件 DDPM 扩散均方误差: $\(\mathcal{L} = \mathbb{E}_{t, \mathbf{z}_0, \boldsymbol{\epsilon}, m_v, m_p} \left[ \left\| \boldsymbol{\epsilon} - \boldsymbol{\epsilon}_\theta(\mathbf{z}_T^t, t, m_v \odot \mathbf{c}_M, m_p \cdot \mathbf{e}_{\text{rel}}) \right\|^2 \right]\)$ 优化器采用 AdamW,批大小为 8,基于预训练 Stable Diffusion v2.1 权重微调。
实验关键数据¶
主实验¶
本文在真实轨迹采集数据集 DualRef-V、半合成数据集 DualRef-R 以及真实基准 Niklaus 数据集上与单图及多图 SOTA 算法进行对比(带 * 为在本文训练集上微调的版本):
| 数据集 | 指标 | 本文 (Ours) | 之前SOTA | 次优方法 | 提升幅度 |
|---|---|---|---|---|---|
| DualRef-V (真实世界) | PSNR↑ | 24.17 | 21.57 | DAI (21.57) / WSeat (21.44) | +2.60 dB (+12.0%) |
| DualRef-V (真实世界) | SSIM↑ | 0.7591 | 0.7481 | DSIT* (0.7481) / WSeat (0.7478) | +0.0110 |
| DualRef-V (真实世界) | LPIPS↓ | 0.1638 | 0.1692 | WSeat (0.1692) / DAI (0.1762) | -0.0054 |
| DualRef-V (真实世界) | CLIPIQA↑ | 0.4705 | 0.4691 | WSeat (0.4691) / RDNet (0.4569) | +0.0014 |
| DualRef-V (真实世界) | MUSIQ↑ | 64.81 | 64.22 | RDNet (64.22) / ZF24* (64.01) | +0.59 |
| DualRef-R (半合成) | PSNR↑ | 28.19 | 27.11 | WSeat (27.11) / DSIT* (26.71) | +1.08 dB |
| DualRef-R (半合成) | SSIM↑ | 0.8378 | 0.8389 | DSIT* (0.8389) / WSeat (0.8369) | -0.0011 |
| DualRef-R (半合成) | LPIPS↓ | 0.0983 | 0.0990 | DSIT* (0.0990) / RDNet (0.1017) | -0.0007 |
| Niklaus (真实世界) | PSNR↑ | 25.09 | 23.72 | WSeat (23.72) / DSIT* (23.40) | +1.37 dB |
| Niklaus (真实世界) | SSIM↑ | 0.7973 | 0.7999 | DSIT (0.7999) / DSIT* (0.7971) | -0.0026 |
| Niklaus (真实世界) | LPIPS↓ | 0.0865 | 0.0934 | RDNet (0.0934) / Niklaus* (0.1112) | -0.0069 |
消融实验¶
消融实验基于 DualRef-R 训练并在 DualRef-V 真实序列和 DualRef-R 半合成测试集上评估各关键模块的贡献:
| 配置 | DualRef-V PSNR↑ | DualRef-V SSIM↑ | DualRef-V LPIPS↓ | DualRef-R PSNR↑ | 说明 |
|---|---|---|---|---|---|
| Single-view | 21.59 | 0.7236 | 0.1720 | 26.07 | 单视角 InstructPix2Pix 微调基线 |
| Dual separate | 21.44 | 0.7245 | 0.1703 | 26.12 | 输入两幅相同图片 (无有效视差) |
| Dual w/o pose | 23.53 | 0.7468 | 0.1694 | 27.47 | 仅保留双视角与注意力,去掉位姿嵌入 |
| SD2.1 + RAFT | 21.60 | 0.7369 | 0.1744 | 26.33 | 显式 RAFT 光流前向扭曲对齐基线 |
| Cat3D-Style Attn | 22.09 | 0.7267 | 0.1717 | 26.52 | 朴素双向跨视角交叉注意力 (产生噪声泄漏) |
| SIR-Style Attn | 20.87 | 0.7036 | 0.2069 | 25.99 | 引入 3D 卷积结构 (破坏 2D 扩散先验) |
| Width-concat | 22.03 | 0.7354 | 0.1838 | 25.83 | 沿宽度拼接输入而非通道融合 |
| 完整模型 (Ours) | 24.17 | 0.7591 | 0.1638 | 28.19 | 完整双视角有向注意力 + 相对位姿编码 |
关键发现¶
- 位姿编码的核心贡献:从
Dual w/o pose到Ours,DualRef-V 上 PSNR 显著跃升 0.64 dB(23.53 到 24.17),视觉上能清晰剔除与透射视差运动明显相左的高亮虚拟反光;若完全退化至Single-view则掉点 2.58 dB。 - 隐式注意力完胜显式光流:
SD2.1 + RAFT在真实数据上 PSNR 仅为 21.60 dB,较完整模型暴跌 2.57 dB。这印证了反光区域的“透射+反射”双重物理运动使传统单像素光流假设失效,强制扭曲对齐反而引入了严重的运动撕裂与错切。 - 跨视角注意力结构的设计敏感性:
SIR-Style强行塞入 3D ResNet 破坏了 SD 原生先验,PSNR 仅 20.87 dB;而Cat3D-Style的双向自注意力导致加噪透射特征互相污染,PSNR 仅 22.09 dB。证明本文“单向查询纯净条件”设计的必要性。 - 视角数量的边际收益:从单视角扩展至双视角性能发生阶跃式提升,但进一步增加至 3 或 4 个视角时增益迅速趋近饱和,而采集与推理开销成倍增长,证明双摄配置在手机端达到了性价比的黄金平衡点。
亮点与洞察¶
- 切断跨视角噪声污染的有向注意力流:巧妙将查询项严格限制在加噪透射特征、将键值项严格锚定在纯净混合条件上,既零参数复用了预训练 2D 扩散注意力权重,又从数学结构上封死了跨图噪声干扰通道。
- 容忍传感器漂移的软几何约束:将容易产生累积漂移的 IMU 平移向量归一化为单位方向向量,与相对旋转四元数一起作为连续条件特征融入时间步嵌入,避开了传统 3D 几何重建的脆性与极高算力消耗。
- 高保真可复现真实基准 DualRef-V:设计配备步进轨道车、可拆卸玻璃板与同步高频 IMU 的物理采集系统,首次实现了在完全相同运动轨迹下成对采集带反光混合图与绝对透射真实标签(Ground Truth)。
局限与展望¶
- 零视差场景退化风险:模型对反光的判定高度依赖透射与反射之间的相对运动差。当双视角基线过小、相机运动极度微弱或场景位于无穷远处导致视差接近于零时,模型将失去几何判别力,性能会自然退化回单图扩散基线。
- 极端条件下的颜色漂移:作为基于潜空间扩散生成的恢复模型,在遭遇大面积重度高光完全饱和透射信号的极端情形下,偶发轻微的色调偏差。
- 未来方向:可进一步将双视角软位姿引导机制推广至 Live Photo 微动态序列的联合恢复,或结合高动态范围(HDR)传感器以解决强反光饱和过曝导致的纹理信息丢失问题。
相关工作与启发¶
- vs 单图扩散去反光 (DAI [27] / WindowSeat [87]):DAI 仅依赖单图强先验做单步去噪,面对大面积高光反光时常把反光结构当作前景透射保留甚至增强;本文借助双视角视差和位姿物理线索,从本质上解除了反光分解的数学欠定性。
- vs 显式多视/双视去反光 (Niklaus [46] / TF15 [81]):Niklaus 等依赖光流网络预测多层运动场,在复杂半透明混合区域极易发生光流估计崩溃;本文采用隐式空间交叉注意力在特征层自适应聚合互补证据,彻底免除了对光流精度的苛刻依赖。
- vs 连拍神经场优化 (Burst Reflection Removal [9]):Neural Spline Fields 需对每组场景耗费 3 分钟进行专门的测试期 3D 优化;本文端到端扩散网络前向推理单场景仅耗时 3 秒(速度提升 60 倍),大幅增强了移动端实用性。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次针对双摄移动设备构建端到端扩散去反光模型,提出有向跨帧注意力与软位姿几何嵌入。
- 实验充分度: ⭐⭐⭐⭐⭐ 建立了包含高精度轨迹对齐真实数据的 DualRef 数据集,对比了单图/多图各流派代表性方法及深入细致的消融实验。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密自洽,问题定义清晰,架构与物理动机阐述极为透彻。
- 价值: ⭐⭐⭐⭐⭐ 与主流智能手机双摄硬件天然契合,单次快门即可获取极佳去反光效果,具备很高的工业落地实用价值。