Frames2Residual: Spatiotemporal Decoupling for Self-Supervised Video Denoising¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/m1NGGi/F2R
领域: 图像恢复
关键词: 视频去噪, 自监督学习, 时空解耦, 残差学习, 盲点网络
一句话总结¶
针对自监督视频去噪中噪声独立性约束与空间纹理重建的固有冲突,本文提出两阶段时空解耦框架 F2R,先通过帧级盲时序估计器提取一致性时序锚点,再通过非盲空间精细化网络利用重加噪策略安全引入中心帧空间证据,实现了细粒度高频残差恢复与 SOTA 去噪性能。
研究背景与动机¶
深度学习在视频去噪任务中取得了显著进展,其核心优势在于引入时序维度,借助跨帧相关性识别真实场景结构并压制随机噪声涨落。然而,现有高性能视频去噪网络主要依赖于包含配对干净真实图像的监督训练,而在活细胞荧光显微镜成像、超快瞬态成像或极端暗光摄影等实际工业与科研场景中,获取无噪真值(Ground Truth)极为昂贵甚至物理不可行,这迫切需要能够直接在真实含噪视频上进行优化的自监督去噪方案。
现有的自监督视频去噪方法主要从单图像框架拓展而来,其中基于 Noise2Noise 的视频方案通常依赖光流运动补偿将相邻帧对齐作为监督目标,但光流插值与重采样不可避免地破坏了像素连续性并改变了局域噪声统计特性,严重违背了自监督学习所需的噪声独立性假设,在动态场景中极易产生严重的鬼影伪影与细节模糊。另一分支视频盲点网络(Video BSNs)虽然通过剔除中心像素严格保证了噪声独立性,但也切断了目标像素与其局部时空邻域之间的结构连续性,导致模型完全无法直接利用中心帧的空间证据来恢复精细纹理,造成严重的细节涂抹与高频信息丢失。
强制满足盲点约束以保证噪声统计独立性,与利用直接空间上下文以重建细粒度纹理,在现存单阶段自监督架构下构成了不可调和的底层冲突。本文的切入角度是打破时空特征的单阶段联合优化,将原本纠缠的时序一致性建模与空间纹理重建显式解耦为前后两个互补阶段,并借助图像去噪先验建立残差域优化。核心 idea:将自监督视频去噪显式解耦为「基于帧级盲掩蔽的时序一致性估计」与「基于重加噪锚点的非盲空间纹理精细化」两阶段,通过残差域先验卸载静态结构负担,在保持时序稳定性的同时安全引入中心帧空间证据重建高频残差。
方法详解¶
整体框架¶
F2R 的整体架构围绕「时空解耦」与「残差域优化」展开。整个框架在训练阶段划分为两个循序渐进的阶段:Stage 1 训练一个盲时序估计器(Blind Estimator, BE),Stage 2 训练一个非盲空间精细化器(Spatial Refiner, SR)。两阶段均以标准 4 层 U-Net 为骨干网络,输入输出均在残差域中进行,但两者的跳跃连接(Skip Connection)根据各自的任务目标分别设计为流导向注意力对齐模块(FAAM)与流导向可形变卷积对齐模块(FDAM)。在推理阶段,Stage 1 的盲估计器被直接丢弃,仅部署训练收敛后的非盲空间精细化器,因而推理过程不产生额外的时间延迟或多模型级联开销。
方法的整体工作流如下图所示:
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["含噪视频序列 Y<br/>{y1, ..., yT}"] --> B["预处理与残差分解<br/>单帧去噪先验 D(yi) 与残差 ri"]
B --> C["联合特征与光流金字塔<br/>zi = cat(D(yi), ri) 与 V"]
C --> D["Stage 1: 盲时序估计器 (BE)<br/>完全掩蔽中心帧 + FAAM 注意力对齐"]
D --> E["生成时序一致性锚点<br/>xs1 = D(yt) + BE 预测时序残差"]
E --> F["Stage 2: 重加噪中心帧合成<br/>y't = xs1 + n' 生成伪含噪序列 Y'"]
F --> G["Stage 2: 非盲空间精细化器 (SR)<br/>中心帧可见 + FDAM 可形变卷积对齐"]
G --> H["推理阶段最终输出<br/>x_final = SR(z, V) + D(yt)"]
关键设计¶
1. 残差域表征解耦:引入单帧去噪先验卸载静态结构建模
在自监督视频去噪中,直接让网络从含噪帧序列回归干净中心帧往往面临巨大的解空间,网络容易把容量消耗在恢复低频静态图像轮廓上,从而削弱了捕捉动态高频纹理的能力。为此,F2R 引入冻结权重的预训练单图像去噪网络(如 NAFNet)作为确定性结构基线。对输入的每一含噪帧 \(y_i\),首先通过图像去噪器得到低频几何结构 \(\hat{x}_i = \mathcal{D}(y_i)\),随后通过差分显式分离出高频残差分量 \(r_i = y_i - \hat{x}_i\)。对于每一个输入时间步,网络接收的联合输入构造为特征级拼接 \(z_i = \text{cat}(\hat{x}_i, r_i)\)。由于图像去噪器 \(\mathcal{D}\) 提供了无噪且结构稳定的基底,网络无需再耗费表征能力去重新学习场景的低频拓扑,而可以将全部优化潜能聚焦于建模跨帧时序残差与高频纹理细节。
2. 盲时序一致性估计:帧级盲掩蔽与注意力对齐
为了从根本上摆脱中心帧噪声对自监督训练的统计污染,Stage 1 提出了帧级盲策略(Frame-wise Blind Strategy)。与传统像素级随机打孔不同,该策略直接将整个中心帧 \(y_t\) 从输入集合中彻底剔除,使时序上下文严格限制在其余相邻帧 \(\Omega_{\text{temporal}} = \{y_i\}_{i \neq t}\)。在模型内部,各相邻帧首先通过 U-Net 编码器独立提取特征,随后在跳跃连接中通过流导向注意力对齐模块(FAAM)进行保真融合。FAAM 首先利用基于去噪特征估算出的光流场 \(\{V_{i \to t}\}_{i \neq t}\) 将邻帧特征显式扭曲至中心时刻,继而通过通道注意力动态筛选高可靠性帧以抑制遮挡运动,并通过空间注意力加权过滤扭曲边界伪影。盲时序估计器 \(f_\theta\) 以未参与输入的真实中心残差 \(r_t = y_t - \mathcal{D}(y_t)\) 作为回归目标:
优化完成后,网络输出的时序残差与结构基线相加,生成了一个具备高度时序一致性但由于中心帧缺失而略微欠缺高频局部细节的基准估计——时序锚点 \(\hat{x}_{s1} = \hat{x}_t + f_\theta(\{z_i\}_{i \neq t}, V)\)。
3. 非盲空间纹理精细化:重加噪锚点与可形变对齐
Stage 1 提取的时序锚点 \(\hat{x}_{s1}\) 成功压制了噪声并锁定了跨帧运动连续性,但因中心帧完全被遮蔽而丢失了特定高频空间纹理。Stage 2 的目标是在不破坏该时序稳定性的前提下,安全恢复被图像去噪器平滑掉的空间纹理。为此,F2R 构造了一个可控的重加噪(Recorruption)训练任务:将输入视频序列中的真实中心帧替换为注入高斯或真实标定噪声的时序锚点 \(y'_t = \hat{x}_{s1} + n'\),而相邻含噪帧保持不变。对重加噪中心帧重新运行冻结的去噪器 \(\mathcal{D}(y'_t)\),并将 Stage 2 的监督目标精确量化为单帧去噪器在锚点上损失的确定性高频残差 \(r'_t = \hat{x}_{s1} - \mathcal{D}(y'_t)\)。
在这一阶段,空间精细化网络 \(f_{\theta'}\) 是完全非盲的,可以直接观测中心帧输入 \(z'_t = \text{cat}(\mathcal{D}(y'_t), y'_t - \mathcal{D}(y'_t))\)。由于中心帧重新可见,网络无需再采用保守的注意力滤波,而是引入基于光流先验初始化的流导向可形变卷积模块(FDAM)。FDAM 将参考特征 \(F_t\)、邻帧特征、粗对齐特征及光流金字塔联合输入,回归亚像素级残差偏移量,自适应拟合非刚性复杂运动。Stage 2 训练的目标函数为:
由于图像去噪器 \(\mathcal{D}\) 具有确定的空间平滑特性,该训练任务迫使非盲网络学会在中心帧可见条件下,利用局域空间先验去补偿 \(\mathcal{D}\) 所抹除的高频边缘与微小纹理,完美弥补了 Stage 1 留下的细节空缺。
损失函数 / 训练策略¶
对于合成高斯噪声(AWGN, \(\sigma \in [10, 50]\)),网络在 DAVIS 2017 训练集上采用 \(L_1\) 损失函数训练;对于真实暗光 Raw 视频(CRVD 数据集),由于噪声分布具有较强的信号依赖性与异方差特性,训练采用 \(L_2\) 损失函数,且中心帧重加噪 \(n'\) 按照该序列对应 ISO 标定的噪声参数进行随机采样。优化器采用 Adam,基础学习率为 \(3 \times 10^{-4}\),并采用余弦退火(Cosine Annealing)学习率衰减策略,训练总迭代轮数为 200K 步。推理阶段完全不需要执行 Stage 1 计算,直接将真实测试输入喂入已收敛的 Spatial Refiner 得到最终去噪视频:\(\hat{x}_{\text{final}} = f_{\theta'}(\{z\}, V) + \mathcal{D}(y_t)\)。
实验关键数据¶
主实验¶
在合成高斯去噪(DAVIS 和 Set8)以及真实 raw 视频去噪(CRVD indoor)数据集上,F2R 与代表性传统算法、全监督 SOTA 模型以及无监督/自监督方法进行了全面量化对比。
下表给出了 DAVIS 和 Set8 数据集在不同高斯噪声水平下的平均去噪性能(PSNR / SSIM):
| 数据集 | 方法类型 | 方法 | 平均 PSNR (dB) | 平均 SSIM | \(\sigma=30\) PSNR (dB) |
|---|---|---|---|---|---|
| DAVIS | 传统算法 | VBM4D | 32.39 | - | 31.65 |
| DAVIS | 监督学习 | NAFNet (单帧) | 34.20 | 0.908 | 33.47 |
| DAVIS | 监督学习 | FastDVDNet | 34.64 | 0.919 | 34.04 |
| DAVIS | 监督学习 | FloRNN | 36.38 | 0.944 | 35.89 |
| DAVIS | 自监督/无监督 | UDVD | 34.76 | 0.920 | 34.09 |
| DAVIS | 自监督/无监督 | RDRF | 35.18 | 0.926 | 34.55 |
| DAVIS | 自监督/无监督 | TAP-T | 35.48 | 0.928 | 34.84 |
| DAVIS | 自监督 (本文) | F2R (Ours) | 36.14 | 0.941 | 35.56 |
| Set8 | 传统算法 | VBM4D | 30.81 | - | 30.00 |
| Set8 | 监督学习 | FastDVDNet | 32.31 | 0.892 | 31.68 |
| Set8 | 监督学习 | FloRNN | 33.55 | 0.915 | 32.97 |
| Set8 | 自监督/无监督 | UDVD | 32.46 | 0.890 | 31.88 |
| Set8 | 自监督/无监督 | RDRF | 32.92 | 0.900 | 32.39 |
| Set8 | 自监督/无监督 | TAP-T | 33.95 | 0.902 | 33.42 |
| Set8 | 自监督 (本文) | F2R (Ours) | 34.30 | 0.915 | 33.82 |
下表汇报了在真实暗光视频基准 CRVD 室内数据集上各 ISO 档位的去噪结果对比(PSNR / dB):
| 方法类型 | 方法 | ISO 1600 | ISO 3200 | ISO 6400 | ISO 12800 | ISO 25600 | 平均 PSNR (dB) |
|---|---|---|---|---|---|---|---|
| 监督学习 | NAFNet | 48.02 | 46.05 | 44.04 | 41.44 | 41.49 | 44.21 |
| 监督学习 | RViDeNet | 47.74 | 45.91 | 43.85 | 41.20 | 41.17 | 43.97 |
| 监督学习 | FloRNN | 48.81 | 47.05 | 45.09 | 42.63 | 42.19 | 45.15 |
| 自监督/无监督 | UDVD | 48.02 | 46.44 | 44.74 | 42.21 | 42.13 | 44.71 |
| 自监督/无监督 | RDRF | 48.38 | 46.86 | 45.24 | 42.72 | 42.25 | 45.09 |
| 自监督/无监督 | TAP | 48.85 | 47.03 | 45.11 | 42.44 | 42.33 | 45.15 |
| 自监督 (本文) | F2R (Ours) | 49.41 | 47.52 | 45.66 | 43.03 | 42.82 | 45.69 |
消融实验¶
1. 两阶段级联机制贡献消融(DAVIS, Set8 在 \(\sigma=30\), CRVD 在 ISO=25600)
| 配置方案 | 预去噪先验 D | Stage 1 (盲时序) | Stage 2 (非盲空间) | DAVIS PSNR / SSIM | Set8 PSNR / SSIM | CRVD PSNR (dB) | 说明 |
|---|---|---|---|---|---|---|---|
| 基线预去噪 | ✓ | ✗ | ✗ | 33.47 / 0.904 | 31.81 / 0.869 | 41.49 | 仅使用单帧 NAFNet 去噪输出 |
| 仅 Stage 1 | ✓ | ✓ | ✗ | 34.36 / 0.930 | 32.70 / 0.903 | 41.88 | 提取时序锚点,但缺失高频空间纹理 |
| 仅 Stage 2 | ✓ | ✗ | ✓ | 33.47 / 0.904 | 31.81 / 0.869 | 41.49 | 无时序锚点时退化为恒等映射 |
| 完整 F2R | ✓ | ✓ | ✓ | 35.56 / 0.940 | 33.82 / 0.913 | 42.82 | 两阶段时空解耦协同,性能大幅领先 |
2. 核心模块与表征设计消融(Stage 1 on DAVIS, \(\sigma=30\))
| 配置方案 | 光流注意力对齐 FAAM | 联合残差输入 \(z\) | PSNR (dB) | SSIM | 增益分析 |
|---|---|---|---|---|---|
| 朴素 U-Net 基线 | ✗ | ✗ | 25.06 | 0.731 | 序列直接通道堆叠,优化困难 |
| + FAAM 对齐 | ✓ | ✗ | 28.22 | 0.870 | 光流注意力有效缓解运动对齐伪影 (+3.16 dB) |
| + 联合残差输入 | ✗ | ✓ | 33.59 | 0.907 | 残差域表征极大简化解空间 (+8.53 dB) |
| FAAM + 联合输入 | ✓ | ✓ | 34.36 | 0.930 | 两者互补实现高质量时序锚点提取 |
3. 对齐模块与阶段任务适配性消融(DAVIS, \(\sigma=30\))
| Stage 1 模块 | Stage 2 模块 | PSNR (dB) | SSIM | 架构洞察 |
|---|---|---|---|---|
| FAAM | FAAM | 35.37 | 0.939 | 统一使用 FAAM 缺乏亚像素精细形变能力 |
| FDAM | FDAM | 35.53 | 0.940 | Stage 1 缺乏中心帧时 DCN 偏移量难以稳定回归 |
| FAAM (盲提取) | FDAM (非盲精细化) | 35.56 | 0.940 | 针对盲与非盲特性分别选用对齐策略,达到最优解 |
关键发现¶
- 阶段协同至关重要:单独运行 Stage 2 无法带来任何增益(与预去噪完全相同,33.47 dB),因为缺少 Stage 1 构建的稳健时序锚点作为基底,模型在重加噪监督下极易退化成预去噪结果的恒等复制;而两阶段级联相比单 Stage 1 在 DAVIS 上跃升了 1.20 dB,证明了非盲空间恢复对找回高频细节的不可替代性。
- 残差域优化的显著红利:在 Stage 1 内部,将原始图像像素输入替换为结合了单帧去噪先验的联合残差输入 \(z_i\),直接带来了惊人的 8.53 dB 提升,表明卸载低频结构建模能使网络集中所有参数精力于学习残差相关性。
- 超越部分监督基线:在 Set8 数据集平均指标上,自监督的 F2R(34.30 dB)超过了全监督模型 FloRNN(33.55 dB)达 0.75 dB;在 CRVD 真实数据集中,F2R 亦全面压制了包括 RViDeNet 与 FloRNN 在内的全监督模型,验证了时空解耦策略在复杂真实噪声下的强大泛化能力。
亮点与洞察¶
- 训练解耦与推理极简的优雅平衡:在训练阶段创造性地将时序一致性(盲网络)与空间细化(非盲网络)拆分为两个独立学习任务,而在推理阶段直接舍弃盲网络、仅调用非盲精细化器完成单步推理,兼顾了自监督无偏训练与极速推理部署。
- 重加噪监督策略的巧妙构造:利用冻结图像去噪器的确定性退化属性,通过向时序锚点注入已知分布噪声,将原本难以监督的空间残差恢复转化为可控的残差回归任务,安全破除了盲点网络无法使用中心帧证据的魔咒。
- 自适应分层对齐范式:在中心帧缺席的盲估计阶段采用保守的「显式光流扭曲 + 双重注意力筛选」(FAAM),在中心帧可用的非盲恢复阶段切换为激进的「光流引导可形变卷积」(FDAM),展现了算法机制与数据可见性的高度自洽。
局限与展望¶
- 对单帧去噪器性能存在先验依赖:F2R 依赖冻结权重的预训练图像去噪器提供结构基准,若图像去噪器在极端严重噪声或未知传感器缺陷下产生严重的结构幻觉或结构扭曲,其产生的偏差可能会传递至后续的残差学习流程中。
- 光流估计误差在快速大运动中的脆弱性:尽管 FDAM 具有亚像素级偏移拟合能力,但在存在剧烈大位移、运动模糊或严重遮挡的极端动态视频中,前置光流估计器(PWC-Net)的失真仍可能给跨帧特征聚合带来挑战。
- 端到端联合微调潜力:当前框架为严格串行训练,未来可探索设计自适应梯度路由机制,在保证时序锚点不被退化的情况下实现双阶段的联合微调与端到端协同。
相关工作与启发¶
- vs Video Noise2Noise (如 MF2F, RFR): 早期自监督视频方案依赖相邻帧跨时间显式扭曲进行互监督,但扭曲操作改变了噪声统计学独立性并伴随重采样伪影;F2R 在 Stage 1 采用完全不输入中心帧的盲策略,从数学根源上杜绝了伪影与噪声相关性。
- vs Video BSN (如 UDVD, RDRF): 传统视频盲点网络在推理时由于持续受到盲点约束而无法获取中心像素/中心帧的空间证据,导致严重的文字边缘模糊与纹理平滑;F2R 推理阶段仅使用完全非盲的 Spatial Refiner,彻底激活了中心帧的局部纹理恢复能力。
- vs TAP: TAP 虽然也尝试融合图像去噪与时序信息,但其未对时序一致性与空间特异性进行显式解耦,在处理高动态织物等高频纹理时仍存在模糊现象;F2R 通过明确的两阶段重加噪残差学习,显著增强了真实细节的还原度。
评分¶
- 新颖性: ★★★★★ 将自监督去噪显式解耦为时序一致性估计与空间纹理精细化两阶段,重加噪监督与残差域设计非常巧妙。
- 实验充分度: ★★★★★ 涵盖合成高斯与真实 raw 视频全场景,消融实验严谨剖析了阶段协同性、模块替换及时间窗口效应。
- 写作质量: ★★★★★ 逻辑严密,图文对照清晰,公式推导与动机剖析十分自然。
- 价值: ★★★★★ 显著缩小乃至超越了全监督视频去噪模型的表现,为无监督高画质视频重建提供了极佳的范式参考。