DAPS++: Rethinking Diffusion Inverse Problems with Decoupled Posterior Annealing¶
会议: ECCV2026
论文: ECCV 原文
领域: 图像生成
关键词: 扩散模型;逆问题;后验退火;朗之万采样;测量一致性
一句话总结¶
DAPS++ 用梯度比与梯度内积两项实证指出"扩散先验在逆问题求解中实际只是热启动器",据此把扩散初始化与似然驱动的朗之万精修彻底拆成两个互不调用对方的阶段,在 FFHQ / ImageNet 的超分、修复、去模糊与 HDR 任务上以约 1/10 ~ 1/20 的 NFE 达到与 DAPS-1K 相当或更好的重建质量。
研究背景与动机¶
从贝叶斯视角看,逆问题求解就是在后验 \(p(x_0\mid y)\propto p(y\mid x_0)p(x_0)\) 下做推断:似然刻画测量过程,先验编码信号的先验结构。经典做法用 Tikhonov、全变分或小波先验把解空间压住,近年的主流则换成表达能力更强的 score-based 扩散模型——以 DPS 为代表的方法在每一个扩散时间步注入一个近似的似然梯度 \(\nabla_{x_t}\log p(y\mid x_t)\),让反向 SDE 或对应的确定性 ODE 在生成的同时向观测靠拢。DCDP、DAPS 这类"解耦"改进把这件事在算法层面做得更细:扩散更新与测量更新交替执行,每次数据一致性更新把估计推向观测,随后的重加噪再把估计拉回对应的噪声水平,理论上让时间边缘分布 \(\pi(x_t\mid y)\) 逐级逼近真实后验。
但这条理论轨迹在实践中并不成立。作者先量了两件事:一是似然梯度与先验 score 的内积在高噪声处经验上接近 0,两者近似正交;二是两者的模长之比在整个扩散过程中都远大于 1,且随噪声-测量比 \(\sigma_t/\gamma\) 增长(附录用 Lipschitz 界给出形如 \(\kappa_t \gtrsim \sigma_t|r_t|/(\gamma^2 C + \sigma_{\min}(A))\) 的下界,⚠️ 该式由原文版式还原,符号含义以原文附录为准)。这意味着似然梯度支配了整个更新动力学:每个中间分布 \(\pi(x_t\mid y)\) 只是后验的一个孤立近似,\(x_T\to x_0\) 的路径是一串松散拼接的估计而非连贯的后验演化,严格贝叶斯解释不足以描述这些求解器的实际行为。更直接的一刀是:把时间边缘更新里的先验项整个删掉、只用数据一致性项,重建质量几乎没有变化——说明连续的先验引导可以被一次性的扩散初始化替代。
于是先验与似然的角色被重新划分:扩散阶段负责把估计放到数据流形附近、把可行解空间约束住,似然梯度负责在这个空间里把观测满足掉;两段之间是"先初始化、后校正"的关系,本就不需要互相纠缠。核心 idea:把扩散逆问题求解显式重写成"先验只做一次性初始化、似然独占精修"的两阶段结构——Stage 1 用一步 Tweedie(低噪声处换成单步 RK4)把纯噪声推到流形附近,Stage 2 在该图像空间估计上只跑似然梯度的 ULA 并在每个循环末重加噪,从而彻底摆脱 DAPS 依赖的时间边缘约束,在几乎不损失质量的前提下把 NFE 砍掉约 90%。
方法详解¶
整体框架¶
输入是观测 \(y\)、已知前向算子 \(\mathcal{A}\) 与噪声方差 \(\gamma^2\),输出干净估计 \(\hat{x}_0\),全程不训练任何网络,只挂在一个已有的像素空间预训练扩散模型上。整条推理是 \(K\) 个循环,每个循环里两段互不重叠:Stage 1 从当前含噪状态 \(x_{\mathrm{in}}\) 出发,只用 score 网络得到干净估计 \(\hat{x}_0\)(噪声高于阈值 \(\bar\sigma\) 时走一步 Tweedie,低于阈值时走一步 RK4);Stage 2 把 \(z^{(0)}=\hat{x}_0\) 交给 \(J\) 步只含似然梯度的 ULA 精修,得到 \(\tilde{x}_0\);循环末把 \(\tilde{x}_0\) 按当前噪声水平重加噪回 \(x_{\mathrm{in}}\leftarrow \tilde{x}_0+\sigma_k\epsilon_k\),进入下一轮,\(\sigma_k\) 随 \(k\) 幂律衰减。结构上最关键的一点是:score 网络只在 Stage 1 被碰一次,Stage 2 完全不接触先验;两段之间只通过"一张接近数据流形的干净图像"传信息,所以不需要像 DAPS 那样在每个退火层级上把时间边缘分布维持住。名称里的数字就是退火步数 \(K\):FFHQ 用 DAPS++-50,ImageNet 用 DAPS++-100。
关键设计¶
1. 先验降级为一次性热启动:把"后验采样"改写成"初始化"
这是全文的立论支点,也是与所有把扩散先验当作全程引导的方法分道扬镳的地方。作者不去争论算法名义上在采样什么,而是直接测两个量。第一个是似然梯度与先验 score 的内积 \(\langle \nabla_{x_t}\log p_t(y\mid x_t;\sigma_t),\,\nabla_{x_t}\log p_t(x_t;\sigma_t)\rangle\):在高噪声条件下它经验上接近 0,两个梯度近似正交,这正好解释了为什么 DPS 把两项直接相加不会互相破坏。第二个是两者的模长之比 \(\kappa_t\),是整个论证里唯一需要留下的自定义量:
在 FFHQ 的高斯去模糊上,\(\kappa_t\) 在整个噪声区间都远大于 1,并随 \(\sigma_t/\gamma\) 单调增长;附录的 Lipschitz 分析把这一现象形式化为随噪声-测量比增长的下界。把这两件事合起来读,结论很清楚:一旦初始化完成,先验梯度既太小(模长可比性差一个数量级以上)又与似然梯度近似正交,它既不能加速也不能改变测量驱动的校正方向——先验的实际功能是把初始估计放到数据流形附近。作者的验证方式也很直接:把时间边缘更新里的先验项删掉、只留数据一致性,重建质量几乎不变。于是"连续先验引导"被替换为"一次性扩散初始化",这是后面所有结构性简化的前提。
2. 阈值化 Tweedie / 单步 RK4 初始化:全局结构要便宜地拿到,细节不能丢
确定初始化的形式时,作者从 EDM 的概率流 ODE 出发:从 \(x_t\) 出发做一步 Euler 更新,恰好还原出 Tweedie 公式,也就是用 score 一步给出干净图像的均值估计
这是一个一阶均值估计,光滑、计算便宜,且已经恢复了信号的主要结构(大尺度几何、色调分布、语义内容);更关键的是,Stage 2 只要求出发点靠近数据流形,并不要求采样路径精确,所以更高阶的 ODE 求解器对 Stage 2 的收敛没有帮助(补充材料 S1 用不同初始化策略的对比验证了这一点)。但纯 Tweedie 的代价是画面偏平滑、细节不足,于是一个阈值 \(\bar\sigma\) 把初始化分成两段:\(\sigma_t>\bar\sigma\) 时用 Tweedie 快速去噪,\(\sigma_t\le\bar\sigma\) 时改用单步 RK4 以极小的额外开销保住细节,最终取 \(\bar\sigma=10\gamma\)——这个取值的依据是一阶截断误差开始超过测量残差的临界点。消融里可以看到这一步的实际影响:在 DAPS 的"先验+似然"精修框架里,把 2 步 Euler 初始化换成 Tweedie 初始化后 SSIM 从 0.716 升到 0.741,说明初始化质量本身就能换到指标。
3. 只有似然的 ULA 精修:把测量一致性从"逐步引导"变成图像空间上的朗之万采样
Stage 2 是整个方法与 DPS / DAPS 差距最大的地方。给定初始化 \(\hat{x}_0\),作者在图像空间上跑无调整朗之万算法(ULA),状态记作 \(z\):
也就是算法伪代码里"算残差 \(r=y-\mathcal{A}(z)\)、再乘一次前向算子的向量-雅可比积(VJP)"那一步。标准 MCMC 里 \(\nabla_{z}\log p(z)\) 充当正则项,但扩散初始化已经把 \(\hat{x}_0\) 放到 \(\|\nabla\log p(x_0)\|=O(\varepsilon)\) 的区域,这一项数值上可以忽略,因此被直接删掉,只剩似然。删掉先验带来的不只是省一次网络前向:在方差为 \(\gamma^2\) 的高斯测量模型下,似然梯度全局 Lipschitz、对数密度强凹,ULA 有现成的收敛保证,且收敛只由似然的几何决定,所需步数远少于维持时间边缘分布所需的步数。这一步同时解释了 DPS 的效率瓶颈——DPS 在每个扩散时间步都要把残差 \(\|y-\mathcal{A}(\hat{x}_0(x_t))\|_2^2\) 经 Tweedie 估计器反传穿过 score 网络,每个时间步一个穿过网络的 Jacobian-向量积,既贵又让方法无法兼容高阶 ODE 求解器;本文把似然优化彻底搬出扩散过程,每步只需要一次测量算子的 VJP,也不再有这条约束。
4. 重加噪 + 多项式退火:用生成随机性换正则化
只做似然精修会把估计推向测量一致的解,但同时压掉了被噪声污染或根本未被观测的分量(例如修复任务中的缺失区域)的随机性。作者在每个精修循环末尾重新注入噪声 \(x_{\mathrm{in}}\leftarrow\tilde{x}_0+\sigma_k\epsilon_k\),让下一轮从一个新鲜状态重新开始探索:这既恢复了被似然压平的变异性,又避免了对测量噪声的过拟合,也使它区别于收敛到单一模态的 MAP 估计——整个流程是在扩散模型定义的隐空间里做随机采样。注入的噪声日程需要小于测量噪声,否则会放大噪声:\(\sigma\) 从 \(\sigma_{\max}=100\) 幂律衰减到 \(\sigma_{\min}=0.1\),配合 \(\gamma=0.05\)。另一处退火是步长:\(\eta_j\) 随迭代多项式衰减、指数落在 \(-4\sim-7\) 区间(EDM 风格,⚠️ 原文只给出指数取值范围,未给出与 EDM 幂律参数 \(\rho\) 的精确对应),使迭代集中在细节修正最有效的低噪声段;噪声日程本身沿用 EDM 的 POLY(-7) 离散化。退火步数 \(K\) 在 FFHQ 上取 50、ImageNet 上取 100,每轮的 MCMC 精修步数 \(J\) 取 4~8,非线性去模糊因为在初始化附近曲率不均匀需要约 50 步。
一个完整示例¶
以 FFHQ 上的一次高斯去模糊(算子为 \(61\times61\)、\(\sigma=3.0\) 的核,\(\gamma=0.05\))为例:从纯噪声 \(x_T\) 起步,此时 \(\sigma_{\mathrm{in}}=100\gg\bar\sigma=10\gamma=0.5\),Stage 1 只做一次 Tweedie 就得出一张已经具备人脸大致轮廓与配色的估计;Stage 2 从这张估计出发跑 \(J=4\sim8\) 步 ULA,每步只算一次残差 \(y-\mathcal{A}(z)\) 并乘一次前向算子的 VJP,把估计往观测上拉;随后按当前 \(\sigma_k\) 重加噪,进入下一轮。随着 \(K=50\) 个循环推进,\(\sigma_k\) 从 100 幂律降到 0.1,重加噪注入的扰动越来越小,ULA 的修正越来越细;只有当 \(\sigma_k\) 降到阈值 0.5 以下之后的最后几个循环,Stage 1 才从 Tweedie 切换成单步 RK4 补细节(具体是哪几轮取决于 POLY(-7) 的离散化,⚠️ 原文未逐轮列出)。整条流程里 score 网络总共只被调用约 \(K\) 次量级,测量算子的 VJP 次数则由 \(K\times J\) 决定——这正是相对 DAPS-1K 约 90% NFE 削减的来源。
损失函数 / 训练策略¶
方法完全免训练:不微调、不蒸馏,只复用现成的像素空间预训练扩散模型,所有工作发生在推理阶段。Stage 2 优化的是隐式的测量残差目标 \(\|y-\mathcal{A}(z)\|_2^2/(2\gamma^2)\),其梯度按上式的 VJP 实现。需要人工设定的量只有几个:噪声日程范围 \(\sigma_{\max}=100,\sigma_{\min}=0.1\),阈值 \(\bar\sigma=10\gamma\),退火步数 \(K\)(FFHQ 50 / ImageNet 100),每轮精修步数 \(J\)(一般 4~8,非线性去模糊约 50),以及学习率 \(\eta\)——原文说明学习率按任务单独调;超参敏感性分析放在附录。
实验关键数据¶
主实验¶
评测在两个数据集的 \(256\times256\) 版本上做:FFHQ 与 ImageNet,各取 100 张验证图,全部图像归一化到 \([0,1]\) 以保证可比。任务覆盖线性(\(\times4\) 超分、box 随机/方形掩码修复、高斯去模糊、运动去模糊)与非线性(HDR、非线性去模糊);高斯核与运动核均为 \(61\times61\),标准差分别为 3.0 和 0.5,修复用标准的 \(128\times128\) box 掩码,所有观测都加 \(\gamma=0.05\) 的高斯白噪声。指标为 SSIM↑ / LPIPS↓ / FID↓。对比方法包括 DPS、DDRM、DDNM、DiffPIR(原文写作 "DiPIR")、DCDP、DAPS-100、DAPS-1K;其中 DDRM 与 DDNM 这类基于 SVD 投影的方法只适用于线性算子,故在非线性列留空。相位恢复只在补充材料 S2.2 讨论,主表未评测;\(\times8\) 超分以 ImageNet 预训练模型做定性展示(图 3f),主表的超分设定为 \(\times4\)。
表 1:FFHQ 上 100 张验证图的重建质量(SSIM↑ / LPIPS↓ / FID↓,\(\gamma=0.05\))。DAPS++ 只用了 50 个退火步,DAPS-1K 用了 1000 步。
| 逆问题 | DPS | DAPS-1K | DAPS++-50 |
|---|---|---|---|
| 超分 \(\times4\) | 0.591 / 0.357 / 81.1 | 0.782 / 0.192 / 55.5 | 0.781 / 0.176 / 46.0 |
| 修复 | 0.727 / 0.259 / 75.6 | 0.747 / 0.176 / 50.1 | 0.812 / 0.141 / 42.1 |
| 高斯去模糊 | 0.647 / 0.285 / 73.3 | 0.786 / 0.179 / 52.7 | 0.784 / 0.171 / 51.1 |
| 运动去模糊 | 0.588 / 0.327 / 76.8 | 0.836 / 0.137 / 38.4 | 0.829 / 0.136 / 37.9 |
| 非线性去模糊 | 0.648 / 0.281 / 74.3 | 0.762 / 0.191 / 57.8 | 0.745 / 0.194 / 54.9 |
| HDR | 0.693 / 0.284 / 77.6 | 0.839 / 0.163 / 41.1 | 0.834 / 0.169 / 42.3 |
其余基线在 FFHQ 上的最好成绩可作参照:DDNM 与 DDRM 在线性任务上最好分别为 0.820(超分 SSIM)、0.810(修复 SSIM),但它们的 FID 明显偏高(超分 76.1 与 152.9 量级);DiffPIR 最好为 0.553 / 0.257 / 52.6(运动去模糊);DCDP 在线性任务上 SSIM 多在 0.64~0.76,非线性去模糊为 0.803 / 0.160 / 44.8。
表 2:ImageNet 上 100 张验证图的重建质量(SSIM↑ / LPIPS↓ / FID↓)。DAPS++-100 为 100 个退火步。
| 逆问题 | DPS | DAPS-1K | DAPS++-100 |
|---|---|---|---|
| 超分 \(\times4\) | 0.454 / 0.474 / 208.4 | 0.638 / 0.295 / 109.1 | 0.661 / 0.276 / 114.2 |
| 修复 | 0.623 / 0.343 / 157.5 | 0.715 / 0.229 / 114.0 | 0.771 / 0.195 / 105.3 |
| 高斯去模糊 | 0.526 / 0.355 / 155.6 | 0.658 / 0.268 / 107.6 | 0.663 / 0.273 / 122.9 |
| 运动去模糊 | 0.542 / 0.365 / 161.4 | 0.769 / 0.175 / 47.1 | 0.763 / 0.179 / 56.1 |
| 非线性去模糊 | 0.520 / 0.365 / 151.5 | 0.720 / 0.212 / 75.9 | 0.718 / 0.211 / 75.7 |
| HDR | 0.349 / 0.552 / 213.8 | 0.824 / 0.171 / 44.7 | 0.807 / 0.191 / 48.5 |
消融实验¶
表 3:FFHQ 修复任务上的解耦消融,所有配置统一在 100 个扩散 NFE 的预算下比较,用于隔离"初始化形式"与"精修是否使用先验"两个因素。
| 配置 | 初始化 | 精修 | SSIM↑ / LPIPS↓ | 时间 (s) |
|---|---|---|---|---|
| DAPS-100 | 2 步 Euler | 先验 + 似然 | 0.716 / 0.194 | 7.4 |
| DAPS-100 去掉先验梯度 | 2 步 Euler | 仅似然 | 0.716 / 0.194 | 6.8 |
| DAPS + Tweedie 初始化 | Tweedie | 先验 + 似然 | 0.741 / 0.186 | 10.1 |
| DAPS + Tweedie/RK4 初始化 | Tweedie/RK4 | 先验 + 似然 | 0.712 / 0.192 | 5.9 |
| DAPS++ | Tweedie/RK4 | 仅似然 | 0.812 / 0.141 | 2.4 |
表 4:噪声鲁棒性(FFHQ 高斯去模糊,\(\sigma_{\min}\) 与 \(\gamma\) 对齐)。
| 配置 | \(\gamma=0.05\) | \(\gamma=0.1\) | \(\gamma=0.2\) | \(\gamma=0.4\) |
|---|---|---|---|---|
| DAPS-1K | 0.786 / 0.179 | 0.615 / 0.330 | 0.410 / 0.495 | 0.192 / 0.633 |
| DAPS++-50 | 0.784 / 0.171 | 0.728 / 0.191 | 0.674 / 0.229 | 0.579 / 0.303 |
关键发现¶
- "去掉先验梯度"这一刀最干净也最有说服力:表 3 第一、二行完全同分(0.716 / 0.194),只省了 0.6 秒;也就是说在精修阶段保留扩散先验几乎不产生任何质量收益,只是白白多算了一次 score 网络的梯度。这直接支撑了"先验=热启动器"的判断。
- 初始化形式的影响比精修是否带先验更大:同样在 DAPS 的"先验+似然"精修下,2 步 Euler 换成 Tweedie 初始化让 SSIM 从 0.716 涨到 0.741。值得注意的是表 3 中 Tweedie/RK4 初始化在该精修框架下只有 0.712 / 0.192,低于纯 Tweedie 的 0.741——这一行并未干净地隔离初始化形式,作者给出的理由是纯 Tweedie 偏平滑、细节不足;换成仅似然的精修后完整 DAPS++ 才拿到 0.812 / 0.141,同时把耗时压到 2.4 秒(比 DAPS-100 快约 3 倍)。
- 效率与质量的权衡全线倾向 DAPS++:在 20~200 个扩散 NFE 的预算扫描里(对比 DAPS 的 50~1K),DAPS++ 在同等耗时下的 LPIPS 更低,即使极端设置 DAPS++-20 也能在线性退化上给出有竞争力的结果;FFHQ 上 50 步的 DAPS++-50 已稳超 100 步的 DAPS-100。
- 噪声越大优势越明显:\(\gamma\) 从 0.05 涨到 0.4,DAPS-1K 的 SSIM 从 0.786 崩到 0.192(几乎不可用),DAPS++-50 只从 0.784 降到 0.579,且 \(\sigma_{\min}\) 与 \(\gamma\) 匹配时最稳——重加噪结构与更少的精修步数共同抑制了噪声过拟合。
- 精修步数取决于算子性质:条件数好、近似二次的算子收敛极快(超分只需 2 步,因为下采样保留大部分信号能量;HDR 这类逐像素单调映射约 5 步),高斯去模糊因特征值分布更宽需要更多步,非线性去模糊因核依赖信号、曲率不均匀需要约 50 步;相位恢复存在多个等价极小值,初始化一旦落错盆地,局部精修无法救回。
- 需要留意的边界:在 ImageNet 上,DAPS++-100 的 SSIM / LPIPS 大体持平或更优,但 FID 在多数任务上仍高于 DAPS-1K(超分 114.2 vs 109.1、高斯去模糊 122.9 vs 107.6、运动去模糊 56.1 vs 47.1),说明大幅减少步数后分布级指标还有差距;FFHQ 上也存在 SSIM 略低的单项(运动去模糊 0.829 vs 0.836、HDR 0.834 vs 0.839),但 LPIPS / FID 更低。
亮点与洞察¶
- 把"扩散先验到底在做什么"变成一个可测量的问题。梯度比 \(\kappa_t\) 与梯度内积这两个量都很便宜,却把"名义上的后验采样器"与"实际的初始化+精修"区分开了;这种"先证伪再重写"的论证方式比直接提一个新模块更有说服力,也顺手解释了 DPS 为什么能用相乘/相加的方式混合两项梯度而不互相破坏。
- 解耦的收益是复合的,不只是省算力。Stage 2 不再穿过 score 网络求导,于是摆脱了 DPS 的每步反传瓶颈、天然兼容高阶 ODE 求解器;同时因为放弃了时间边缘约束,可以用更大的步长和更少的迭代,反而不容易过拟合测量噪声——速度快与鲁棒性提升来自同一个结构改动,这是全文最"啊哈"的地方。
- 重加噪是一个可复用的正则化手段:用生成模型自带的随机性替代显式的先验正则或早停,把"不要过拟合噪声"翻译成"注入的噪声要小于测量噪声",实现简单且有一个可解释的调节旋钮(\(\sigma_{\min}\) 与 \(\gamma\) 的关系)。
- 可迁移的判断标准:任何"生成先验 + 数据一致性交替迭代"的 PnP 框架都可以先算一遍 \(\kappa_t\),若先验梯度在精修阶段确实量级偏小且近似正交,就可以把先验降级为一次性初始化、把余下的迭代交给显式似然优化;这一思路在 latent diffusion 或更高分辨率的逆问题上是否同样成立,是一个值得验证的开放问题。
局限与展望¶
- 实验范围偏窄:只在 FFHQ-256 与 ImageNet-256 两个 256 分辨率的合成/自然图像基准上验证,用的是像素空间预训练扩散模型;没有涉及 latent diffusion(如 Stable Diffusion 系列)、更高分辨率、真实退化数据或医学/天文等本文在引言里强调的科学成像场景。
- 非凸算子没有保证:作者自己承认相位恢复这类有多等价极小值的任务依赖初始化落在正确的盆地,而阈值化 Tweedie/RK4 初始化并不提供这种保证。
- 分布级指标仍有差距:ImageNet 上多数任务的 FID 高于 DAPS-1K,说明"少步数 + 强解耦"在样本分布层面还没完全追平,论文对这一点没有展开分析。
- 超参与调参成本:\(\bar\sigma=10\gamma\)、多项式指数、每任务单独调的学习率都需要人工设定;当噪声水平 \(\gamma\) 未知、或测量噪声不是高斯白噪声时,重加噪噪声必须小于测量噪声这条约束如何满足,论文没有讨论。
- "是否真在采样后验"缺少定量证据:论文批评 DPS/DAPS 更像 MAP 迭代,但本文 Stage 2 的 ULA 迭代次数很少(多数任务 4~8 步),实际行为也可能更接近带随机扰动的正则化优化;要坐实"在探索后验而非收敛到单模态",需要似然面覆盖或样本多样性层面的证据。
- 理论部分在附录:初始化残差量级(\(O(|\mathcal{A}|\sigma_t)+O(\gamma\sqrt{d_y})\))与收敛界都只给了结论,正文无法复核推导过程。
相关工作与启发¶
- vs DPS:DPS 在每个扩散时间步都做"Tweedie 初始化 + 单步似然校正",两项耦合在一起,似然梯度必须穿过 Tweedie 估计器反传回 score 网络,每个时间步一次 Jacobian-向量积,这既是它的主要计算瓶颈,也让它与高阶 ODE 求解器结构性不兼容。本文把似然修正整体搬出扩散过程、并删掉先验项,代价是失去了"逐步引导"的理论叙事,收益是每步只需一次测量算子的 VJP。
- vs DAPS:DAPS 已经在算法层面解耦(Tweedie 估计与朗之万动力学交替,且直接在图像空间更新、不反传穿过 score),但它每到一个退火层级都要重新调用 score 网络以维持时间边缘分布 \(p(x_t\mid y)\),因此每个层级都需要大量朗之万步才能近似从 \(p(x_0\mid x_t,y)\) 采样;一旦这些步没收敛,理论保证就失效。本文把这一约束整个取消,score 网络只进 Stage 1,这也是 90% NFE 削减的直接来源。
- vs DCDP:DCDP 同样走"扩散净化 + 数据一致性"的解耦路线,但数据一致性仍是被嵌进扩散循环的一步更新。本文的区别在于把整个似然优化阶段隔离出来、给它独立的迭代预算(\(J\) 步)和独立的退火步长,从而可以按算子条件数决定投入多少步。
- vs DDRM / DDNM:这两类方法用前向算子的 SVD 做严格的测量一致性投影,理论干净、只适用于线性算子,对噪声的处理也更"硬";本文用基于梯度的似然,天然覆盖非线性算子(HDR、非线性去模糊),代价是不再有投影式的严格一致性保证。
- vs DiffPIR:DiffPIR 在扩散采样过程中嵌入 PnP 去噪与近端数据一致性,每一步仍然要过一次扩散模型;本文只在 Stage 1 用扩散模型,后续全部交给似然,因此在同等质量下把 NFE 压到低一个量级。
评分¶
- 新颖性: ⭐⭐⭐⭐ 观点新颖——用两项可测的实证把扩散逆问题求解重新定性为"初始化 + 精修";但具体组件(Tweedie 初始化、ULA 精修、重加噪、多项式退火)都取自已有工作,创新主要在结构与解释。
- 实验充分度: ⭐⭐⭐⭐ 两个数据集、六类逆问题、100 张验证图、7 个基线的统一评测,消融能直接证伪先验在精修阶段的作用;不足是缺少 latent diffusion、真实数据与相位恢复的主表结果。
- 写作质量: ⭐⭐⭐⭐ 论证链条清楚(测量 → 解释 → 重新设计 → 与 DPS/DAPS 逐项对照),伪代码完整;部分公式在版式上受损、消融表对初始化形式的隔离不够干净。
- 价值: ⭐⭐⭐⭐ 免训练、即插即用,以约 1/10 的 NFE 达到与 DAPS-1K 相当或更好的质量,对资源受限或实时成像场景很有吸引力;对"先验梯度还值不值得算"这一问题的回答也具有方法论价值。