Solving Diffusion Inverse Problems with Restart Posterior Sampling¶
会议: ECCV 2026
论文: ECCV 2026 官方页 / 项目页 RePS
领域: 图像生成
关键词: 扩散逆问题, 后验采样, 重启采样, plug-and-play 先验, 图像恢复
一句话总结¶
RePS 把无条件扩散采样里的「重启采样」(分段积分 ODE + 周期性大加噪抹掉累计近似误差)推广到后验推断:每一轮用若干步测量条件 ODE 把样本推到干净区,每步只在 \(x_0\) 空间解一个 MAP 子问题(因此完全不反传 score 网络),再用前向扩散把样本加噪回一个退火下降的重启噪声级重开一轮,在 FFHQ/ImageNet 的 5 个线性与 3 个非线性逆问题上取得比 DAPS、DPS、DDRM、DDNM、DiffPIR 等更强的综合表现。
研究背景与动机¶
逆问题的目标是从间接、不完整或带噪的观测 \(y = h(x_0) + z\) 里恢复真实信号 \(x_0\),医学成像、计算摄影、神经科学里到处都是这类问题。近年的主流做法是不再手写解析先验(总变差、\(\ell_2\) 惩罚之类),而是用预训练扩散模型充当隐式的强先验。本文只关心其中「plug-and-play」的一支:训练好的无条件扩散模型不动,靠推理阶段的算法把它适配到任意逆问题上(同一数据集内)。这条路线上有两种基本思路,各有硬伤。第一种把优化和采样解耦——先无条件采样/去噪到像素空间,再在 \(x_0\) 空间施加测量约束(DCDP 用梯度下降求 MAP,DAPS 用 Langevin 动力学从后验采样),然后靠前向扩散把样本送回更低的噪声级。它确实避开了反传,但反向扩散过程本身对测量约束是「盲」的,等于把大部分算力花在生成一个可能根本不合约束的样本上,效率低下。第二种让似然和先验联合优化,但既然两者的空间要靠反向扩散网络连接,这类方法几乎都必须把梯度反传穿过 score 网络:DPS 把测量算子「提升」到噪声样本 \(x_t\) 上,需要算 score 的 Jacobian;Graikos 等的变分推断方案要做一次「反向扩散再前向扩散」的往返。计算代价高,而且常常被限制在线性测量算子上。
真正的障碍在于:迭代采样需要的量是噪声样本上的似然分数 \(\nabla_{x_t}\log p(y|x_t)\),而测量模型只给出干净样本上的 \(\nabla_{x_0}\log p(y|x_0)\),两者之间没有通用的闭式关系。但作者注意到,流行的 DDIM 采样器其实提供了一条绕开它的出口:从 \(x_t\) 到 \(x_{t-1}\) 的一步 ODE 更新,可以完全用后验众数 \(\mathbb{E}[X_0|x_t,y]\) 来表达;而要找到这个 \(x_0\)(比如用几步梯度下降),根本不需要穿过 score 网络。原因很直白——这个子问题问的是「什么样的干净图像 \(x_0\) 既像当前样本的去噪版本、又满足测量约束」,而不是「什么样的噪声样本 \(x_t\) 最符合这个去噪器」,梯度只落在 \(h\) 上。
不过近似终究会累积。作者借用了 Xu 等人在无条件扩散采样上的一组结论:NFE 预算小时,ODE 因为离散误差小而占优;预算大时,SDE 因为持续注入随机性、收缩累计近似误差更快而反超;而「分段数值积分 ODE + 周期性加一大笔噪声」的重启方案能同时拿到两者的好处。Xu 等人只给了这个想法,没给出简单的重启日程(他们在多个任意噪声级上反复重开)。核心 idea:把重启采样从无条件生成推广到后验推断——每一轮的条件 ODE 积分就是重启框架的「第一阶段」,重启就是把刚刚算出的 \(x_0\) 按 VE 前向过程加噪回一个逐步退火的噪声级 \(\sigma_r\)(第二阶段),从而在不反传 score 网络的前提下周期性地把近似误差一次性抹掉。
方法详解¶
整体框架¶
RePS 的输入是一个预训练的无条件扩散模型 \(s_\theta\)(按 Karras 等人的做法统一用 VE-SDE 形式、噪声日程 \(\sigma(t)=t\))、测量 \(y\) 与一个可微的测量算子 \(h\),以及一组采样超参(\(\sigma_{\max},\sigma_0,\sigma_{\min},\sigma_{\text{res}},N_{\text{res}},N_{\text{ode}},\rho_{\text{ode}},\rho_{\text{res}}\));输出是后验分布的一个样本 \(x_0\)。整个过程不训练任何东西,只是一条由两个阶段交替构成的采样轨迹:
- 阶段一 · 条件 ODE 积分:从当前噪声级 \(\sigma_r\) 出发,用 \(N_{\text{ode}}\) 步 Euler 积分一条「测量条件 ODE」降到 \(\sigma_0=0.01\)。每一步先用 Tweedie 关系得到无条件的去噪估计 \(\mathbb{E}[X_0|x_t]\),再在 \(x_0\) 空间解一个「既贴住测量、又贴近去噪估计」的 MAP 子问题得到 \(\hat x_{0|y}\),最后用它构造该步的 ODE 更新。
- 阶段二 · 重启:把这一轮走出来的 \(x_0\) 按前向扩散加噪到下一个(更低的)重启噪声级 \(\sigma_{r-1}\),也就是从 \(\mathcal{N}(x_0,\sigma_{r-1}^2 I)\) 重新采一个样本,然后回到阶段一。
重启噪声级本身也走一条从 \(\sigma_{\text{restart}}\) 退火到固定 \(\sigma_{\min}=0.1\) 的多项式日程,于是整条轨迹就是「一小段干净的条件 ODE + 一次大加噪」不断重复,且每重复一次,抖动幅度就更小一点。论文特别强调,这个两阶段视角并不是 RePS 独有的:把最近的一批后验采样方法都按「做多少步 ODE / 约束放在积分内还是积分后」拆开看,它们全都落在这个框架里,RePS 只是占据了此前没人走过的那一维。
关键设计¶
1. 测量条件的 ODE 步:把后验分数换成 \(x_0\) 空间的 MAP 子问题
在 VE-SDE 下,用后验分数驱动的反向 ODE 做一步 Euler 积分,可以改写成让当前样本朝条件后验均值收缩的形式:
也就是说,每一步「往哪走、走多远」完全由后验均值 \(\mathbb{E}[X_0|x_t,y]\) 决定(其等价形式是 \(\nabla_{x_t}\log p(x_t|y) = (\mathbb{E}[X_0|x_t,y]-x_t)/\sigma^2(t)\))。问题在于这个均值没有闭式。作者的替代方案是用后验众数(MAP)去近似它:由 \(p(x_0|x_t,y)\propto p(y|x_0)\,p(x_0|x_t)\),把无条件项 \(p(x_0|x_t)\) 近似成高斯 \(\mathcal{N}(\mathbb{E}[X_0|x_t],\sigma_t^2 I)\),MAP 子问题就变成一个两项互相拉扯的最小二乘:
第一项要求测量一致,第二项要求别偏离去噪器给出的可信估计太远;实践中把 \(\sigma_n^2/\sigma_t^2\) 合成一个不随时间变化的可调权重 \(\lambda\)。这里最关键的一步取舍是:Li 与 Wang 把该优化对线性问题写成闭式解,代价是采样器被绑死在线性(或极少数特殊非线性)算子上;RePS 放弃闭式解,每一步只用若干次梯度下降迭代去解它,于是任何可微的 \(h\)——线性的超分/修复/去模糊,非线性的相位恢复、HDR——都可以直接插进来。因为优化变量是 \(x_0\) 而不是 \(x_t\),梯度不穿过扩散网络,所以相比 DPS 那一类需要 score Jacobian 的方法,计算开销反而更低。
2. 只在干净区触发的简化重启日程
条件 ODE 一路积到底会累积误差:score 网络本身不完美,Euler 离散也有残差,越接近 \(\sigma_0\) 误差越容易被放大成可见的伪影。DAPS/DCDP 的对策是把轨迹切成很多小段,每段结束都做一次约束再前向加噪;Xu 等人的重启则是在多个任意噪声级上反复重开、每个级数还要重复若干次,超参多、实现复杂。RePS 把触发判据简化到极致:只有当样本被积到 \(\sigma_0\)(无噪声区)时才重启一次,把 \(x_0\) 按 VE 前向过程加噪回重启级,即 \(x_r \sim \mathcal{N}(x_0,\sigma_r^2 I)\);而重启级序列 \(\{\sigma_r\}\) 复用和 ODE 模拟器同一种多项式内插日程(\(\rho_{\text{res}}=15\)),从任务相关的 \(\sigma_{\text{restart}}\) 单调退火到固定的 \(\sigma_{\min}=0.1\)。作者发现把重启迭代集中在小噪声级上效果更好,因此只调 \(\sigma_{\text{restart}}\) 一个值、\(\sigma_{\min}\) 全任务固定。
这样做的收益在于「大噪声一次到位」:一次大加噪会把之前若干步里攒下的近似误差整体打散(论文的说法是 stochastic restart obliterates accumulated approximation error),而由于重启分布的均值就是刚刚算出的那张 \(x_0\),已经找到的合理模式不会被丢掉,这一点和「从头重新采样」有本质区别。相比之下 SDE 采样是每一步撒一点小噪声,虽然也在收缩误差,却把大量 NFE 花在了噪声注入上;RePS 的「多步干净 ODE + 偶尔大噪声」因此同时拿到了 ODE 的低离散误差和 SDE 的误差收缩能力。
3. 每次重启跑多步条件 ODE:占据设计空间里没被走过的那一维
作者把近期方法放到一个二维设计空间里重新定位:一个轴是每次重启内做多少步(无条件)ODE,另一个轴是约束是嵌在 ODE 积分内部,还是等积分结束后单独做。沿坐标原点看,Li 与 Wang、DiffPIR 只做一步条件 ODE 就结束(Tweedie 去噪 + 一步约束),两者落在两条轴的交点上,本质上等价于 DCDP 的「Tweedie 特例」——DiffPIR 与它们唯一的区别是重启前会把 MAP 估计朝噪声样本插值回去。沿「先自由积分再单独约束」这条轴走的是 DCDP 与 DAPS:它们先跑多步无条件 ODE,再回到 \(x_0\) 空间做一次约束(DCDP 用梯度下降求 MAP,DAPS 用 Langevin 动力学做真正的后验采样)。而「把约束放进积分内部、一次跑多步」这一维此前基本是空白,RePS 就站在这里:每次重启内跑 \(N_{\text{ode}}\) 步条件 ODE(主实验统一取 10 步)。
机制上这为什么更好,作者的解释是:约束被直接编进了 ODE 轨迹本身,每一步都在把轨迹朝想要的那个模式引导;而「先产生一个无约束样本、再事后纠正」的做法,一旦自由采样已经漂到坏模式上,后面的纠正就很难拉回来。因此 RePS 收敛更快、重建质量更好。论文的步数敏感性实验(固定总预算 1000 NFE 的超分任务)也支持这一点:增加重启之间的 ODE 步数初期是有效的,但收益有边界——LPIPS 在超过约 20 步后开始变差,PSNR 则在约 2 步附近就到峰,说明「重启抹除误差」与「单段 ODE 的引导精度」之间存在权衡。⚠️ 需要注意,主实验统一用 10 步/重启,与这条敏感性曲线的峰值位置并不完全一致,具体超参见原文补充材料。
一个完整示例¶
拿 FFHQ 上的 4× 超分走一遍。\(h\) 是 4 倍双三次下采样,\(\lambda\) 按任务调好。采样从 \(\sigma_{\max}=100\) 起步,先取 \(x_K\sim\mathcal{N}(0,100^2 I)\)。第一轮里,10 步条件 ODE 按 \(\rho_{\text{ode}}=7\) 的多项式日程从 \(\sigma=100\) 一路降到 \(\sigma_0=0.01\):每一步先让模型给出 \(\mathbb{E}[X_0|x_t]\),再对 \(x_0\) 做若干次梯度下降,把重建往「下采样后等于 \(y\)」的方向拉,得到 \(\hat x_{0|y}\);然后用上面那条收缩式把样本从 \(x_t\) 推到 \(x_{t-\Delta t}\)。走完 10 步,手里是一张大致干净的重建。接着进入重启:按 \(x_r\sim\mathcal{N}(x_0,\sigma_r^2 I)\) 把它加噪到 \(\sigma_{\text{restart}}\)(该值按任务单独调,论文放在补充材料里),再重新跑 10 步条件 ODE。如此反复,每一轮的重启级沿 \(\rho_{\text{res}}=15\) 的多项式日程退火下降,直到 \(\sigma_{\min}=0.1\);所有轮次跑完后返回最后一次得到的 \(x_0\)。整个过程的采样预算线性任务约 1000 NFE、非线性任务约 4000 NFE。可以看到「重启到底重启了什么」这一步:它并不是丢掉结果从头来,而是把当前这张已经不错的图重新打散到一个较高的噪声级上,让下一段 ODE 在一个误差更干净、但仍靠近解的起点上重跑。
损失函数 / 训练策略¶
RePS 完全训练-free,没有任何需要训练的模块或损失函数,只有推理期的采样超参。全局固定:\(\sigma_{\max}=100\)、\(\sigma_0=0.01\)、\(\sigma_{\min}=0.1\)、每次重启 10 步条件 ODE、\(\rho_{\text{ode}}=7\)、\(\rho_{\text{restart}}=15\)。按任务分别调的是四个量:重启起始噪声级 \(\sigma_{\text{restart}}\)、每步 MAP 子问题的梯度更新次数 \(N\)、学习率 \(\eta\) 与权重 \(\lambda\)(具体取值在补充材料)。两套预训练权重都是现成的公开模型:ImageNet 256×256 用 Dhariwal 与 Nichol 发布的模型,FFHQ 256×256 用 Chung 等人(DPS)提供的模型;两者虽然按 DDPM/VP-SDE 训练,但按 Karras 等人的做法统一用 VE-SDE 采样器驱动。
实验关键数据¶
主实验¶
评测在 ImageNet 256×256 与 FFHQ 256×256 上各取 100 张验证图。线性任务五个:4× 超分(双三次下采样)、box 修复(128×128 随机位置方块遮挡)、随机修复(随机遮 70% 像素)、高斯去模糊(61×61 核、标准差 3.0)、运动去模糊(61×61 核、标准差 0.5)。非线性任务三个:相位恢复(只给傅里叶幅度,2× 过采样,每个测量生成 4 个重建取最好)、非线性去模糊(用 Tran 等人公开的模糊核网络制造退化)、HDR 重建(像素强度压缩 2×)。所有任务的测量上都加了 \(\sigma_n=0.05\) 的高斯噪声。基线包括 Li & Wang、DAPS、DDRM、DDNM、DPS、DCDP、FPS-SMC、DiffPIR(线性)与 DAPS、DPS、RED-diff、DCDP(非线性),指标为 PSNR↑ / SSIM↑ / LPIPS↓。
表 1:FFHQ 线性逆问题(PSNR / SSIM / LPIPS)
| 方法 | 4× 超分 | Box 修复 | 随机修复 | 高斯去模糊 | 运动去模糊 |
|---|---|---|---|---|---|
| RePS(本文) | 29.95 / 0.845 / 0.155 | 24.32 / 0.844 / 0.122 | 32.49 / 0.899 / 0.090 | 29.92 / 0.841 / 0.146 | 32.27 / 0.875 / 0.115 |
| Li and Wang | 29.21 / 0.805 / 0.256 | 24.75 / 0.817 / 0.167 | 34.11 / 0.926 / 0.071 | 29.89 / 0.831 / 0.217 | 29.90 / 0.766 / 0.207 |
| DAPS(官方代码) | 29.55 / 0.793 / 0.186 | 24.88 / 0.755 / 0.174 | 30.94 / 0.807 / 0.155 | 29.75 / 0.794 / 0.177 | 31.80 / 0.843 / 0.135 |
| DPS | 25.86 / 0.753 / 0.269 | 22.51 / 0.792 / 0.209 | 25.46 / 0.823 / 0.203 | 25.87 / 0.764 / 0.219 | 24.52 / 0.801 / 0.246 |
| DDRM | 26.58 / 0.782 / 0.282 | 22.26 / 0.801 / 0.207 | — | 24.93 / 0.732 / 0.239 | — |
| DDNM | 28.03 / 0.795 / 0.197 | 24.47 / 0.837 / 0.235 | 29.91 / 0.817 / 0.121 | 28.20 / 0.804 / 0.216 | — |
| DCDP | 28.66 / 0.807 / 0.178 | 23.89 / 0.760 / 0.163 | 30.69 / 0.842 / 0.142 | 27.50 / 0.699 / 0.304 | 25.08 / 0.512 / 0.364 |
| FPS-SMC | 28.42 / 0.813 / 0.204 | 24.86 / 0.823 / 0.146 | 28.21 / 0.823 / 0.261 | 26.54 / 0.773 / 0.253 | 27.39 / 0.826 / 0.227 |
| DiffPIR | 26.64 / — / 0.260 | — | — | 27.36 / — / 0.236 | 26.57 / — / 0.255 |
表 2:ImageNet 线性逆问题(PSNR / SSIM / LPIPS)
| 方法 | 4× 超分 | Box 修复 | 随机修复 | 高斯去模糊 | 运动去模糊 |
|---|---|---|---|---|---|
| RePS(本文) | 26.12 / 0.708 / 0.259 | 20.71 / 0.787 / 0.186 | 28.97 / 0.829 / 0.115 | 26.21 / 0.703 / 0.255 | 28.95 / 0.801 / 0.169 |
| Li and Wang | 25.68 / 0.682 / 0.307 | 21.39 / 0.779 / 0.217 | 29.67 / 0.861 / 0.114 | 25.75 / 0.681 / 0.296 | 27.70 / 0.733 / 0.238 |
| DAPS(官方代码) | 25.70 / 0.654 / 0.285 | 21.40 / 0.721 / 0.228 | 27.72 / 0.742 / 0.177 | 26.00 / 0.668 / 0.260 | 28.87 / 0.781 / 0.171 |
| DPS | 21.13 / 0.489 / 0.361 | 18.94 / 0.722 / 0.257 | 23.52 / 0.745 / 0.297 | 20.31 / 0.598 / 0.397 | 18.96 / 0.629 / 0.423 |
| DDRM | 22.62 / 0.521 / 0.324 | 18.63 / 0.733 / 0.254 | — | 21.26 / 0.564 / 0.443 | — |
| DDNM | 23.96 / 0.604 / 0.475 | 21.64 / 0.748 / 0.319 | 31.16 / 0.841 / 0.191 | 28.06 / 0.703 / 0.278 | — |
| FPS-SMC | 24.82 / 0.703 / 0.313 | 22.16 / 0.726 / 0.208 | 24.52 / 0.701 / 0.316 | 23.91 / 0.601 / 0.387 | 24.52 / 0.647 / 0.326 |
| DiffPIR | 23.18 / — / 0.371 | — | — | 22.80 / — / 0.355 | 24.01 / — / 0.366 |
表 3:非线性逆问题(FFHQ / ImageNet,均值±标准差)
| 任务 | 方法 | FFHQ PSNR | FFHQ SSIM | FFHQ LPIPS | ImageNet PSNR | ImageNet SSIM | ImageNet LPIPS |
|---|---|---|---|---|---|---|---|
| 相位恢复 | RePS | 30.41±4.45 | 0.824±0.119 | 0.152±0.107 | 20.12±7.18 | 0.449±0.260 | 0.419±0.184 |
| 相位恢复 | DAPS | 30.72±3.15 | 0.809±0.081 | 0.157±0.073 | 22.32±6.51 | 0.514±0.219 | 0.343±0.155 |
| 相位恢复 | DPS | 17.64±2.97 | 0.441±0.129 | 0.410±0.090 | 16.81±3.61 | 0.427±0.143 | 0.447±0.099 |
| 相位恢复 | RED-diff | 15.60±4.48 | 0.398±0.195 | 0.596±0.092 | 14.98±3.75 | 0.386±0.057 | 0.536±0.129 |
| 相位恢复 | DCDP | 28.65±8.09 | 0.781±0.217 | 0.203±0.196 | — | — | — |
| 非线性去模糊 | RePS | 29.02±1.76 | 0.797±0.031 | 0.165±0.030 | 27.58±3.28 | 0.745±0.082 | 0.191±0.056 |
| 非线性去模糊 | DAPS | 28.79±1.54 | 0.781±0.033 | 0.177±0.030 | 27.47±3.21 | 0.737±0.084 | 0.198±0.052 |
| 非线性去模糊 | DPS | 23.39±2.01 | 0.623±0.082 | 0.278±0.060 | 22.49±3.20 | 0.591±0.101 | 0.306±0.081 |
| 非线性去模糊 | RED-diff | 30.86±0.51 | 0.795±0.028 | 0.160±0.034 | 30.07±1.41 | 0.754±0.023 | 0.211±0.083 |
| 非线性去模糊 | DCDP | 27.92±2.64 | 0.779±0.067 | 0.183±0.051 | — | — | — |
| HDR 重建 | RePS | 27.96±3.54 | 0.872±0.080 | 0.145±0.071 | 26.37±4.05 | 0.843±0.117 | 0.157±0.103 |
| HDR 重建 | DAPS | 27.52±3.58 | 0.840±0.084 | 0.157±0.064 | 26.50±4.70 | 0.812±0.140 | 0.170±0.113 |
| HDR 重建 | DPS | 22.73±6.07 | 0.591±0.141 | 0.264±0.156 | 19.23±2.52 | 0.582±0.082 | 0.503±0.106 |
| HDR 重建 | RED-diff | 22.16±3.41 | 0.512±0.083 | 0.258±0.089 | 22.03±5.90 | 0.601±0.094 | 0.274±0.198 |
消融实验¶
| 分析维度 | 配置 | 结果 | 说明 |
|---|---|---|---|
| 采样器类型(FFHQ 高斯去模糊) | 同一条件 ODE 但不重启 | 低 NFE 收敛最快、离散误差小,高 NFE 被反超 | 原始 ODE 采样器基线 |
| 采样器类型 | 用 Euler–Maruyama 离散出的 SDE(同样条件、连续注入噪声) | 高 NFE 时优于纯 ODE,靠随机噪声收缩累计误差 | 相当于每步撒小噪声 |
| 采样器类型 | RePS | 全 NFE 区间同时取得最快收敛与最佳 PSNR / LPIPS | 短 ODE 段 + 周期性大加噪兼得两者 |
| 重启间条件 ODE 步数(超分,固定 1000 NFE) | 1 步(≈ Li and Wang / DiffPIR) | 左端点即单步条件 ODE 的极限情形 | 落在设计空间原点 |
| 重启间条件 ODE 步数 | 约 2 步 | PSNR 到峰 | 引导精度与重启频率的权衡 |
| 重启间条件 ODE 步数 | 10 步(主实验默认) | 综合表现最好 | 与补充材料的超参表一致 |
| 重启间条件 ODE 步数 | 超过约 20 步 | LPIPS 开始变差 | 单段 ODE 过长、误差重新累积 |
| 像素 vs 潜空间(FFHQ,补充材料) | RePS (latent) | 略差于像素空间版本 | 方法可直接扩展到 latent diffusion |
| 后验校准(box 修复 / 相位恢复,补充材料) | ensemble skill / spread / spread-to-skill | 比值非平凡,未坍缩为点估计 | box 修复的空间 spread 图显示掩码内不确定性大于掩码外 |
| 采样时间(各任务最大 NFE,线性 1k / 非线性 4k) | RePS vs DAPS 逐图计时 | 线性任务略快、非线性任务略慢 | 总体可比,差异很小 |
(上表中采样器类型与 ODE 步数的敏感性,原文以 Fig. 3 的曲线给出,未附独立数值表;本表按其结论描述,具体坐标以原文为准。)
关键发现¶
- 综合最优但并非每格全胜。RePS 在任务覆盖面上最强,却被个别基线在个别格子上反超:FFHQ 随机修复上 Li and Wang 的 34.11 / 0.926 / 0.071 全面优于 RePS(32.49 / 0.899 / 0.090);ImageNet 高斯去模糊上 DDNM 的 PSNR 28.06 高于 RePS 26.21(但 LPIPS 0.278 更差);ImageNet box 修复上 FPS-SMC(22.16)与 DDNM(21.64)的 PSNR 也高于 RePS 的 20.71。作者据此的表述是「综合最优」,逐任务看则需要按指标取舍。
- DAPS 是最强基线,也是唯一被单独讨论的一个。FFHQ 上 RePS 在全部任务上胜过 DAPS;ImageNet 上 RePS 在四个任务上更好、三个任务上接近、一个任务(相位恢复,20.12 vs 22.32 PSNR)明显落后——这也是作者在正文中唯一承认的大幅劣势。
- 非线性去模糊上出现指标分歧。RED-diff 的 PSNR 更高(FFHQ 30.86 vs 29.02,ImageNet 30.07 vs 27.58),LPIPS 却更差(ImageNet 0.211 vs 0.191),说明该任务上「像素保真」和「感知质量」两种目标被不同方法各自占优。
- 重启确实把 ODE 和 SDE 的优点合起来了。低 NFE 区间纯 ODE 收敛更快,高 NFE 区间 SDE 更强,而 RePS 在整段 NFE 上同时占优,直接验证了「离散误差小 + 周期性收缩近似误差」的设计动机;与 DAPS 在运动去模糊上跨 NFE 的对比同样是 RePS 全程领先。
- 重启频率存在最优区间。固定 1000 NFE 时,重启之间的条件 ODE 步数太少(1 步)相当于退化为 Li and Wang / DiffPIR,太多(>20 步)又会让单段 ODE 内的误差重新累积、LPIPS 变差;PSNR 的峰值出现在约 2 步附近。⚠️ 主实验统一用 10 步,与这条曲线的峰值位置不完全吻合,实际部署时应以原文补充材料的超参表为准。
- 它给出的确实是后验样本而非点估计。在本质上多解的 box 修复与相位恢复上,集成 spread 与 spread-to-skill 比值非平凡;box 修复的空间 spread 图更直接地显示掩码内部的不确定性高于掩码外部。这对需要不确定性量化的科学应用是有意义的性质。
- 成本与 DAPS 相当。不反传 score 网络带来的收益主要体现在可扩展性(支持任意可微算子)而不是绝对速度:按每个任务的最大 NFE 计时,RePS 在线性任务上略快、非线性任务上略慢,差距不大。
亮点与洞察¶
- 统一视角本身就是贡献。把 DPS、DDRM、DDNM、DCDP、DAPS、DiffPIR、Li and Wang 这些看起来各成一派的方法,全部塞进「条件/去噪阶段 + 前向加噪重启阶段」这个两阶段框架,并画成「每次重启内 ODE 步数 × 约束是否嵌在积分内」的二维设计空间,直接暴露了 DiffPIR 与 Li and Wang 等价于 DCDP-Tweedie 这一事实,也指出了 RePS 占的那一维此前是空白。这种「用坐标轴重新定位已有工作」的写法可迁移到任何交替式采样/优化算法。
- 把约束搬进 ODE 内部,而不是事后纠正。先自由采样再施加约束,一旦轨迹漂到坏模式就救不回来;直接把测量约束写进每一步的更新里,等于给轨迹装了持续的方向盘。这个思路可以迁移到其他「采样 + 约束」场景(带物理约束的生成、可控图像编辑)。
- 把优化变量选在 \(x_0\) 空间,换来「不反传 score 网络却仍支持非线性算子」。这是一个很实用的工程取舍:闭式解只在线性算子上存在,放弃闭式解、改用几步梯度下降,适用面就从线性扩到任意可微 \(h\),而由于优化变量不是 \(x_t\),梯度不经过扩散网络,省掉了 score Jacobian 这一大块开销。
- 重启日程极简到只剩一个超参。Xu 等人的重启要在多个噪声级反复重开,RePS 只保留「走到 \(\sigma_0\) 才重启 + 重启级退火」这一条规则,\(\sigma_{\min}\) 全任务固定,只有 \(\sigma_{\text{restart}}\) 需要按任务调。这让它几乎可以零成本地替换掉 SDE 采样器。
- 把 \(x_0\) 加噪回高噪声级而不是从头重采,是「重启」这个词在此处最容易被误解的地方:均值保留了刚找到的解,方差负责抹掉误差,本质上是在解附近做一次受控的重新探索。
局限与展望¶
- ImageNet 相位恢复上明显落后于 DAPS(20.12 vs 22.32 PSNR,SSIM 0.449 vs 0.514),这是作者自己承认的唯一大幅劣势任务。值得注意的是 RePS 在该任务上的标准差也很大(FFHQ 上 30.41±4.45),说明其稳定性同样成问题;而「每个测量生成 4 个重建取最好」这个评测协议会系统性偏向方差大、偶尔命中的方法,两种效应叠在一起使得该任务的结论不易解读。
- 评测规模有限、基线数字来源不统一。只在 FFHQ 与 ImageNet 两个 256×256 数据集、各 100 张验证图上评测,绝大多数基线数字直接引自 DAPS 论文(仅 DAPS 用官方代码重跑),Li and Wang 没有公开代码、由本文作者自行实现(1000 NFE、梯度下降版而非闭式解)。跨论文、跨实现、跨 NFE 预算的数字不能直接当公平比较。⚠️ 以原文补充材料为准。
- 「任务无关」的重启日程仍需任务相关调参。\(\sigma_{\text{restart}}\)、每步梯度更新次数 \(N\)、学习率 \(\eta\)、权重 \(\lambda\) 四个量都要按任务调,虽然形式简单,但离真正免调参还有距离,论文也没在正文给出推荐值表。
- 缺「重启次数」本身的敏感性分析。只给了「重启之间 ODE 步数」的曲线,而「多久重启一次」才是重启类方法最核心的超参;同样的预算下 NFE 在「长 ODE 段」与「多重启」之间如何分配,论文没有系统回答。
- 可改进方向:把 \(\sigma_{\text{restart}}\) 或重启触发做成自适应的(例如监控测量残差 \(\lVert y-h(x_0)\rVert\) 的下降是否停滞再触发重启),有望在相位恢复这类高度病态的任务上减少对「多次重建取最好」的依赖;把 MAP 子问题的梯度更新次数与当前噪声级绑定(高噪声级少更新、低噪声级多更新)也可能进一步省下 NFE。
相关工作与启发¶
- vs DPS:DPS 用点估计把测量算子「提升」到噪声样本 \(x_t\) 上,需要 score 网络的 Jacobian 并反传;RePS 把优化搬到 \(x_0\) 空间解 MAP 子问题,梯度只经过测量算子,既不反传 score 网络,也天然支持非线性算子。表 1/2 里 DPS 是全场最弱的一档(FFHQ 运动去模糊仅 24.52 PSNR)。
- vs Li and Wang / DiffPIR:二者是 RePS 框架里「每次重启只用 1 步条件 ODE」的极限特例,落在二维设计空间的原点,本质上等价于 DCDP 的 Tweedie 变体;DiffPIR 与它们的差别仅在于重启前把 MAP 估计往噪声样本插值回去。Li and Wang 用闭式解因此只支持线性问题,RePS 用梯度下降换来通用性——代价是随机修复这类 Li and Wang 特别擅长的任务上会被反超。
- vs DAPS / DCDP:两者沿「先跑多步无条件 ODE、再单独做一次约束」这条轴(DCDP 用梯度下降求 MAP,DAPS 用 Langevin 动力学做真正的后验采样),与 RePS 共用「解耦 + 重启」的骨架,区别是约束放在积分之后还是之内。DAPS 是最强基线:FFHQ 全任务落败,ImageNet 上 4 胜 3 平 1 负。
- vs Xu et al. 的重启采样:那篇是无条件生成上的启发来源,只有想法没有简单日程(多噪声级、每级重复多次);RePS 的贡献是把重启推广到后验推断,并把它压缩成「只在 \(\sigma_0\) 触发 + 重启级退火」的单规则日程。
- vs DDNM / DDRM:基于零空间投影与奇异值分解的一类方法,严格依赖线性算子且通常需要已知噪声水平;它们在 ImageNet 的随机修复(DDNM 31.16)与高斯去模糊(DDNM 28.06)上仍然很强,说明「不重训、只投影」的经典路线在结构简单的线性任务上并未过时。
评分¶
- 新颖性: ⭐⭐⭐⭐ 把重启采样推广到后验推断、并统一重构已有方法的设计空间,是有价值的重新定位,但两个核心部件(条件 ODE 与 MAP 子问题)都来自既有工作
- 实验充分度: ⭐⭐⭐⭐ 5 个线性 + 3 个非线性任务 × 2 个数据集覆盖很全,还补了校准与计时分析;但多数基线数字直接引自 DAPS 论文,评测仅 100 张图
- 写作质量: ⭐⭐⭐⭐ 设计空间与算法 1 的对应清楚、动机链讲得透;部分公式在缓存排版中损坏(如多项式日程的定义式),需回原文核对
- 价值: ⭐⭐⭐⭐ 训练-free、不反传 score 网络、支持任意可微算子、重启日程几乎免调参,工程落地价值高