跳转至

Stabilizing Deep Reconstruction Operators with Contractive Anchoring

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/trishitmg/costa
领域: 图像恢复
关键词: 即插即用先验 (PnP), 正则化去噪 (RED), 收缩算子, 算子稳定性, 逆问题重建

一句话总结

针对即插即用 (PnP) 和 RED 图像重建中预训练深层去噪器迭代引发的“先达峰后坍塌”(peak-and-collapse)失稳现象,本文提出无需微调黑盒去噪器的自适应收缩锚定机制,通过局部稳定性指标动态闭式融合结构内生收缩的轻量算子,在保留 SOTA 峰值质量的同时彻底消除了迭代发散。

研究背景与动机

基于模型的图像逆问题(如图像去模糊、超分辨率、MRI 和 CT)通常表述为带有数据保真项与先验正则项的优化问题。近年来,即插即用(Plug-and-Play, PnP)与去噪正则化(Regularization-by-Denoising, RED)算法凭借强大的灵活性成为前沿范式,它们将标准近端优化算法(如 PGD、HQS、ADMM)中的近端投影步直接替换为预训练的判别式深度去噪网络(如 DnCNN、DRUNet、DiffUNet 等),免去了针对每个具体退化任务端到端重训大模型的沉重开销。

然而,现存深度去噪器几乎均基于单步加性高斯白噪声去除进行监督训练,其隐式先验并不满足传统优化理论所需的非扩张性(nonexpansiveness)或单调算子条件。一旦将这类深层非线性网络反复置于迭代闭环中,系统极易展现出病态的“先达峰后坍塌”(peak-and-collapse, PC)失稳现象:重建图像的 PSNR 在最初几十次迭代迅速爬升至令人惊艳的高峰,但随之急转直下发生伪影畸变甚至数值爆炸(如表 1 中 Vanilla-PnP 遭遇发散)。虽然早停法(early stopping)在理想状态下能截获峰值,但实际应用中由于缺乏无噪真实参考图,根本无法在盲测下精准判断何时见顶;而现有的可收敛 PnP 变体要么强行修改去噪器架构限制表达能力,要么将正则化器与特定求解器紧密绑定,剥夺了即插即用任意切换最新 SOTA 去噪器的核心优势。

面对黑盒去噪器结构不可见且不可微调的约束,本文另辟蹊径:既然无法全局约束复杂去噪器的李普希茨常数,能否在迭代过程中实时监控算子局部的“膨胀”趋势,并引入一个绝对稳定、具备严格压缩性质的辅助算子在失稳时刻进行精准锚定拉回?核心 idea:将任意黑盒图像重建算子与一个结构内生收缩的轻量级锚点算子通过序列平均自适应融合,依据局部稳定性指标是否超标闭式计算最小必要混合权重,既保证迭代序列全局有界,又最大程度维系黑盒算子的高性能重建能力。

方法详解

整体框架

本文提出的收缩锚定稳定框架(COSTA)将任意基于深度去噪器的图像重建算子 \(T\) 视作纯粹的黑盒映射(输入图像输出更新图像,如 PnP-PGD、PnP-HQS、PnP-ADMM 或 RED-GD)。系统首先预先确定一个收缩锚点算子 \(S\)(该算子具备严格的 \(\kappa\)-收缩性,\(\kappa < 1\))及其唯一不动点 \(p\)。在每次迭代步 \(k\) 中,算法通过当前迭代点 \(x_k\)、黑盒更新点 \(T(x_k)\) 与不动点 \(p\) 的几何比例计算局部稳定性指标 \(\eta_k\)。当检测到系统处于安全区域(\(\eta_k \le 1\))时,完全放权给黑盒算子推进;一旦检测到扩张失稳风险(\(\eta_k > 1\)),则自适应激活闭式混合权重 \(\theta_k\),执行凸组合更新 \(x_{k+1} = (1-\theta_k)T(x_k) + \theta_k S(x_k)\),将稳定度精准平抑至临界阈值。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入退化图像与初值 $x_k$"] --> B["黑盒算子预测与局部稳定性指标监控<br/>计算 $T(x_k)$ 与 $\eta_k = \|T(x_k)-p\| / \|x_k-p\|$"]
    B --> C{"稳定性判断<br/>$\eta_k > 1$ ?"}
    C -->|否:处于安全收缩域| D["零权重更新<br/>$\theta_k = 0 \implies x_{k+1} = T(x_k)$"]
    C -->|是:存在局部发散风险| E["自适应收缩锚定机制<br/>闭式求解二次方程确定最小混合权重 $\theta_k$"]
    E --> F["结构内生收缩去噪器与锚点算子<br/>融合锚点输出 $S(x_k) = D_\sigma(\mathrm{prox}_{\rho f}(x_k))$"]
    F --> G["凸组合稳定更新<br/>$x_{k+1} = (1-\theta_k)T(x_k) + \theta_k S(x_k)$"]
    D --> H["下一轮迭代 $x_{k+1}$"]
    G --> H

关键设计

1. 局部稳定性指标:量化黑盒算子的局部扩张与坍塌风险

由于主流深度去噪器是不可导或内部不可见的复杂黑盒,无法通过解析手段获取其雅可比矩阵范数。为此,本文提出一个仅依赖输入输出采样的标量度量——稳定性指标(Stability Index)\(\eta_p(x, T)\)

\[\eta_p(x, T) = \frac{\|T(x) - p\|}{\|x - p\|} \quad (x \neq p)\]

其中 \(p\) 为已知稳定收缩算子 \(S\) 的不动点。该指标的几何本质在于度量黑盒算子 \(T\) 在参考基准 \(p\) 周围的局部扩张率(expansive factor)。在正常优化初期,去噪器引导图像向自然图像流形聚集,\(\eta_p(x, T) \le 1\);当迭代逼近流形局部极值后,由于累积误差与网络泛化盲区,算子开始输出过冲校正,导致轨迹偏离基准甚至发散,此时 \(\eta_p(x, T) > 1\)。通过这一标量指标,算法无需侵入网络内部即可精确诊断失稳先兆。

2. 自适应收缩锚定机制:闭式解动态混合权重与有界性保证

为了在抑制坍塌的同时不损害黑盒算子本身的复原敏锐度,框架采用序列平均算子 \(T_\theta(x) = (1-\theta)T(x) + \theta S(x)\)。本文在理论上证明了:若锚点算子 \(S\)\(\kappa\)-收缩的(\(\kappa < 1\)),则对于任意满足 \(\eta_p(x, T) > \xi > \kappa\) 的状态,必存在唯一最小阈值 \(\tilde{\theta}(x, \xi) \in (0, 1)\),使得混合后的算子满足 \(\eta_p(x, T_{\tilde{\theta}}) = \xi\)

在实际实现中,目标控制级别设定为临界值 \(\xi = 1\)。当 \(\eta_p(x_k, T) > 1\) 时,求解使得 \(\eta_p(x_k, T_\theta)^2 = 1\) 成立的混合权重:

\[\|(1-\theta)(T(x_k) - p) + \theta(S(x_k) - p)\|^2 = \|x_k - p\|^2\]

该方程本质上是一个关于 \(\theta\) 的一元二次方程,可以直接求出 \([0, 1]\) 范围内的最小正实根,全程毫无内层迭代搜索开销。更关键的是,理论推导严格保证了只要在后续迭代中持续将稳定性指标控制在 1 以内,生成的迭代序列 \(\{x_k\}\) 必处处有界。而在实际实验中,求解出的 \(\theta_k\) 普遍保持在极小数值,意味着系统大部分驱动力仍源自顶尖黑盒去噪器,仅施加恰到好处的“阻尼拉力”。

3. 结构内生收缩去噪器:强凸势函数与样条激活的轻量级锚点

锚点算子 \(S\) 自身必须无条件保证 Euclidean 范数下的收缩性。基于命题 1,若保真项 \(f\) 凸且去噪器 \(D\) 为收缩算子,则近端分裂步 \(S = D \circ \mathrm{prox}_{\rho f}\) 严格收缩。传统构建李普希茨受限网络常采用分块拼贴或正交投影,计算极其沉重且复原质量粗糙。本文提出一种单层卷积结构的强凸势函数去噪网络 \(D_\sigma\)

\[D_\sigma(x) = (1-\gamma)x - \gamma W^\top \left( \nu(\sigma)^{-1} \psi\left( \frac{\nu(\sigma) W x}{\tau} \right) \right)\]

其中卷积算子通过正定对角归一化重参数化 \(W = \tilde{W} R^{-1/2}\)(其中 \(R = \mathrm{Diag}(\tilde{W}^\top \mathbf{1})\))内生满足算子范数 \(\|W\| \le 1\);激活函数 \(\psi\) 参数化为一阶导斜率严格限制在 \([0, 1]\) 的自适应线性样条(由 101 个均匀节点构成),从而保证其势函数为平滑强凸函数;\(\nu(\sigma)\) 为可学习的多噪声级别自适应缩放函数。当步长设定为 \(\gamma = 1/(1+2\tau)\)\(\tau \in [0.0102, 0.135]\) 时,数学上证明该去噪器严格为收缩因子 \(\kappa = (1+\tau)/(1+2\tau) \in [0.9, 0.99]\) 的收缩映射,兼顾了快速单步去噪性能与绝对理论安全性。

损失函数 / 训练策略

对于锚点去噪器 \(D_\sigma\),在 BSD400、DIV2K、Waterloo Exploration 和 Flickr2K 图像块上进行高斯去噪训练,噪声水平范围为 \(\sigma_n \sim \mathcal{U}[0, 25/255]\)。优化目标为均方误差(MSE),使用 Adam 优化器训练 100,000 个 epoch,batch size 为 16(patch 大小 \(128 \times 128\)),学习率采用余弦退火衰减至初始值的 \(5 \times 10^{-3}\)。针对不同参数组分配独立初始学习率:卷积权重与重参数化变量为 \(5 \times 10^{-3}\),样条激活节点为 \(5 \times 10^{-4}\),噪声缩放函数为 \(5 \times 10^{-3}\),势函数超参 \(\tau\)\(5 \times 10^{-2}\)。训练全程无需施加拉格朗日乘子或惩罚项,结构设计天然捍卫李普希茨界。

实验关键数据

主实验

在 CBSD10 数据集(噪声强度 \(\sigma_n = 0.02\))上,评估运动去模糊(Motion Deblurring)与高斯去模糊任务中各主流去噪器在 Vanilla-PnP、Equivariant PnP 与本文提出的稳定框架下的表现。表中对比了峰值 PSNR(迭代过程中的最高画质)与终局第 10,000 次迭代的最终 PSNR(反映长程稳定性),符号 \(\times\) 代表迭代数值发散崩溃。

求解框架与去噪骨干 方法 运动模糊 Peak (dB) 运动模糊 Final (dB) 高斯模糊 Peak (dB) 高斯模糊 Final (dB)
PnP-PGD + DnCNN 本文方法 27.96 ± 4.38 27.95 ± 4.38 28.78 ± 3.02 28.77 ± 3.02
PnP-PGD + DnCNN Vanilla PnP 27.78 ± 4.13 \(\times\) (发散) 27.53 ± 2.97 \(\times\) (发散)
PnP-PGD + DnCNN Equiv. PnP 27.97 ± 4.37 \(\times\) (发散) 27.58 ± 3.01 \(\times\) (发散)
PnP-HQS + DRUNet 本文方法 27.86 ± 4.42 27.86 ± 4.42 30.02 ± 4.03 30.02 ± 4.03
PnP-HQS + DRUNet Vanilla PnP 27.60 ± 4.28 26.90 ± 4.36 29.78 ± 3.89 \(\times\) (发散)
PnP-HQS + DRUNet Equiv. PnP 27.70 ± 4.42 \(\times\) (发散) 29.83 ± 3.94 \(\times\) (发散)
PnP-HQS + DiffUNet 本文方法 27.84 ± 3.98 27.82 ± 3.96 29.62 ± 3.49 29.61 ± 3.48
PnP-HQS + DiffUNet Vanilla PnP 27.21 ± 3.52 18.90 ± 0.92 29.20 ± 3.22 23.12 ± 3.17
PnP-HQS + GSDRUNet 本文方法 28.29 ± 4.39 28.28 ± 4.39 30.70 ± 4.12 30.70 ± 4.12
PnP-HQS + GSDRUNet Vanilla PnP 28.18 ± 4.26 23.86 ± 8.18 30.56 ± 4.13 25.72 ± 8.23
PnP-ADMM + CoCo-DRUNet 本文方法 27.85 ± 4.30 27.65 ± 4.39 29.26 ± 3.01 29.19 ± 3.05
RED-GD + DRUNet 本文方法 27.74 ± 4.19 27.74 ± 4.19 29.48 ± 3.18 29.48 ± 3.18
DPIR (专用调优管线) 基线参考 28.33 ± 4.65 28.33 ± 4.65 30.69 ± 0.52 30.69 ± 0.52
GSPnP (可收敛管线) 基线参考 28.21 ± 4.23 28.21 ± 4.23 30.58 ± 0.59 30.58 ± 0.59

在超分辨率(Super-Resolution, 比例 \(s \in \{2, 3, 4\}\))任务下,表 2 展示了 CBSD10 上的详细复原与防坍塌测试结果:

求解框架与去噪骨干 方法 \(s=2\) Peak (dB) \(s=2\) Final (dB) \(s=3\) Peak (dB) \(s=3\) Final (dB) \(s=4\) Peak (dB) \(s=4\) Final (dB)
PnP-HQS + DRUNet 本文方法 27.48 ± 4.25 27.48 ± 4.24 25.85 ± 4.40 25.83 ± 4.43 24.29 ± 4.46 23.96 ± 4.80
PnP-HQS + DRUNet Vanilla PnP 27.29 ± 4.25 \(\times\) (发散) 25.64 ± 4.35 \(\times\) (发散) 24.04 ± 4.32 \(\times\) (发散)
PnP-HQS + GSDRUNet 本文方法 27.99 ± 4.52 27.95 ± 4.47 26.30 ± 4.52 26.29 ± 4.53 24.74 ± 4.41 24.62 ± 4.37
PnP-HQS + GSDRUNet Vanilla PnP 27.89 ± 4.37 23.84 ± 7.91 26.24 ± 4.48 24.08 ± 5.78 24.65 ± 4.37 21.02 ± 6.71
PnP-IHQS + SPC-DRUNet 本文方法 27.26 ± 4.04 27.22 ± 4.07 25.61 ± 4.15 25.55 ± 4.22 24.03 ± 4.12 23.75 ± 4.29
RED-GD + GSDRUNet 本文方法 27.54 ± 4.18 27.53 ± 4.17 26.08 ± 4.39 26.07 ± 4.39 24.66 ± 4.34 24.66 ± 4.35
DPIR (专用调优管线) 基线参考 27.93 ± 1.16 27.93 ± 1.16 26.32 ± 0.35 26.32 ± 0.35 24.76 ± 0.36 24.76 ± 0.36

消融实验

研究锚点去噪器 \(D_\sigma\) 的训练质量与训练 Epoch 数(\(N\))对最终稳定化表现的影响,以及不同核心组件的作用分析:

实验配置 / 变体 运动去模糊 Final PSNR 轨迹形态与稳定性特征 结论分析
欠拟合锚点(\(N=100\) 10.21 dB 坍塌崩溃(曲线跌落至谷底) 锚点不动点 \(p\) 画质太低,无法建立有效参考基准
初步收敛锚点(\(N=200\) 18.45 dB 延迟坍塌(后期严重失稳) 局部几何引导不足,仍无法完全束缚发散倾向
合格锚点(\(N=300\) 28.15 dB 彻底稳定(Final 紧贴 Peak) 锚点达到基本还原能力即可可靠实现全局约束
充分训练锚点(\(N=1000\) 28.28 dB 完美稳定(高保真无抖动) 表现逼近极限,说明框架对锚点精度并不极度苛刻
移除自适应权重(固定 \(\theta=1\) 27.55 dB 彻底平庸化(退化为纯收缩解) 去噪细节严重抹平,丧失 SOTA 黑盒网络的先验优势
移除收缩锚点(仅设截断阈值) \(\times\) (发散) 振荡发散 缺乏具有明确吸引子的压缩算子,无法从数学上约束有界

关键发现

  • 峰值无损锁定:在所有测试配置下,本文稳定化算子达到的最终 PSNR 与迭代最高峰值 PSNR 之差几乎在 \(0.01 \sim 0.05 \text{ dB}\) 之内,彻底攻克了传统 PnP/RED 算法必须人工肉眼早停的工程难题。
  • 锚点要求低门槛:如图 4 所示,锚点去噪器仅需轻量训练(约 300 epoch 达到初级基准),其固有的不动点 \(p\) 即可提供足够的全局拓扑牵引力,无需将锚点自身训练至超越复杂大模型的水平。
  • 极小计算额外开销:自适应权重计算依托标量内积与二次闭式解,单次迭代增加的额外计算延迟仅约 20%,远低于等变采样或多次重打分的开销。

亮点与洞察

  • 黑盒非侵入式包裹机制:将即插即用算子的不稳定根源抽象为局部扩张率 \(\eta\),不仅规避了对神经网络权重的繁复约束与反向传播截断,而且无缝适配 CNN、Diffusion、Transformer 等任意新型先验骨干。
  • 数学紧凑性与闭式自适应解:通过严格的一阶与二次方程推导出最小介入权重 \(\tilde{\theta}\),系统绝大部分时间以 \(\theta_k \approx 0\) 运行,仅在“即将失稳的刀尖上”施加最小阻尼力,实现了“平时不干涉、危急瞬间拉回”的控制美感。
  • 可复用技术迁移:该“黑盒强算子 + 白盒收缩算子自适应序列平均”的设计哲学,可广泛迁移至扩散模型反演(Diffusion Inversion)、迭代文本引导图像编辑等其他长期多步迭代退化的逆问题系统。

局限与展望

  • 依赖凸保真项假设:当前定理中锚点算子 \(S\) 的严格收缩性建立在数据保真项 \(f\) 严格为凸的基础上,对于非线性前向退化算子(如盲去卷积或非线性相位恢复),保真步自身的收缩性难以从理论上严格延续。
  • 锚点去噪器训练域依赖:虽然锚点结构轻量,但仍需在通用自然图像上完成基于 MSE 的离线训练;面对极度特异化的领域(如低剂量工业 CT 或稀疏冷冻电镜),可能需要重新调整锚点的样条节点与滤波权重。
  • 未来方向:探索将局部收缩锚定机制直接作为辅助损失内嵌至去噪网络的前期自监督预训练中,使大模型网络天然内生具备反抗长程迭代坍塌的固有不动点流形。

相关工作与启发

  • vs Equivariant PnP (CVPR 2024):Equivariant PnP 尝试利用几何群变换的随机数据增强来平抑迭代震荡,但实验证明在长步数(如 10,000 步)下依然频繁发生发散 \(\times\);本文方法基于收缩不动点理论给出确定性的有界收敛保证,稳定性完胜启发式扰动。
  • vs GSPnP / DEAL (ICLR 2022 / ICML 2025):GSPnP 与 DEAL 强行将去噪器限制为梯度步(Gradient-Step)或弱凸/可逼近算子,模型设计严重受限且无法兼容现成的 Diffusion 预训练底座;本文将模型解耦为“任意黑盒先验 + 轻量收缩锚点”,通用性与工程兼容度显著提高。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次从局部扩张性指标与序列平均理论出发,为黑盒 PnP 逆问题提供了兼具数学闭式解与全局有界保证的非侵入式稳定器。
  • 实验充分度: ⭐⭐⭐⭐⭐ 跨越 5 类去噪底座、3 大近端框架、去模糊与超分任务,对比多达 10,000 步超长迭代,证据极具说服力。
  • 写作质量: ⭐⭐⭐⭐⭐ 问题切中痛点,数学推导清晰严密,理论命题与实验曲线环环相扣。
  • 价值: ⭐⭐⭐⭐⭐ 彻底扫清了高性能深度去噪器在即插即用迭代重建中的可靠性隐患,代码开源且易于作为标准模块落盘部署。