跳转至

SR-Edit: Region-Aware Image Editing via Self-Refinement

会议: ECCV 2026
论文: ECCV 2026 Official
领域: 图像生成
关键词: 图像编辑、扩散模型、Flow Matching、Doob's h-transform、自细化

一句话总结

针对免掩码图像编辑中非编辑区域易漂移且启发式特征干预易产生伪影的难题,SR-Edit 提出在像素空间通过自反馈提取精准变化区域,并基于 Doob's h-transform 推导对齐原生采样动力学的掩码残差漂移/速度修正,实现无需训练的高保真区域感知图像编辑。

研究背景与动机

近年来基于扩散模型与流匹配(Flow Matching)的指令驱动图像编辑取得了长足进展,但在真实编辑任务中,用户往往要求模型在精确修改目标物体的同时,必须严格保留背景、非目标物体、几何细节与身份特征。然而主流生成模型从全局高斯噪声或隐空间起点出发逐步去噪,这种全局采样动力学天然作用于全图,导致即便编辑区域修改成功,非编辑区域也常伴随不可控的内容漂移、纹理扭曲与细节模糊。

为了避免漂移,直观思路是将画面显式划分为编辑区与非编辑区,并在非编辑区施加一致性约束。但获取高质量人工标注掩码成本高昂,而现有免掩码方案往往存在两大致命缺陷:其一,基于交叉注意力图或隐空间特征差异的区域估计严重缺乏亚像素精度,不仅边界粗糙模糊,且在时间步之间剧烈抖动;其二,以 SpotEdit 或 Follow-Your-Shape 为代表的保护策略多依赖中间层 KV 特征替换、线性插值或特征强行拼接等启发式干预,打破了扩散或流模型的原生动力学轨迹,本意为了保真,却成了引入边缘跳跃、边界撕裂与模糊的新伪影源。

深入分析编辑模型的实际推理行为可以发现:训练良好的模型在编辑区会集中释放高能量且空间连贯的变化,而在非编辑区仅产生弥散、低幅值、碎片化的微弱扰动。核心 idea:将模型自身的预测作为像素空间的稳定自反馈信号,通过轻量形态学与连通域后处理精准分离编辑区域,并基于 Doob's h-transform 严谨推导出完全融入原生采样动力学的掩码残差修正项,在迭代自细化循环中实现高精边界与高保真保留的协同进化。

方法详解

整体框架

SR-Edit 在推理阶段将整个采样过程组织为一个简短的稳定阶段,后接多个自细化块(SR-Edit Blocks)。在每个细化块内部,首先通过数步前向探测生成临时预测图像 \(I_{\mathrm{ref}}\);随后在解码后的像素空间计算与输入原图 \(I_{\mathrm{in}}\) 的差分图,经过 Otsu 自适应二值化、形态学滤波与连通域面积筛选,得到精准的编辑区域掩码 \(M\);最后,基于将非编辑区保真约束建模为消失噪声观测的 Doob's h-transform 理论,在扩散模型中转化为漂移修正项,在流匹配模型中转化为速度修正项,平滑纠正采样轨迹中的非编辑区漂移。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入图像 I_in + 文本编辑指令"] --> B["初始稳定阶段与多步前向探测<br/>Few-step Inference 生成临时预测 I_ref"]
    B --> C["自反馈像素区域精准分离<br/>差分图计算 + Otsu 自适应阈值化"]
    C --> D["空间形态学与连通域滤波<br/>开闭运算消除噪点 + 滤除微小连通块"]
    D --> E["h-transform 动力学保持修正<br/>Doob 观测模型导出掩码残差修正项"]
    E -->|下一次自细化循环| B
    E -->|完成多轮自细化迭代| F["最终高保真编辑图像输出"]

关键设计

1. 自反馈像素区域精准分离:利用模型自身输出构建可靠差分表征

针对交叉注意力机制与隐空间表征空间分辨率受限、非线性解码后边界失真的问题,SR-Edit 直接利用模型自身的预测结果作为自反馈信号。在像素网格 \(\Omega\) 上逐通道计算原图与临时预测的绝对差异: $\(d(p) = \frac{1}{C}\sum_{c=1}^C \left|I_{\mathrm{in}}(p, c) - I_{\mathrm{ref}}(p, c)\right|\)$ 为了避免手工设定固定阈值导致不同编辑幅度的案例失效,算法采用 Otsu 类间方差最大化准则自适应求取最佳分割阈值 \(t^\star = \arg\max_t \omega_0(t)\omega_1(t)(\mu_0(t)-\mu_1(t))^2\),将差分图直方图自适应划分为高变动的编辑前景与微弱扰动的背景,得到初始二值掩码 \(M_0(p) = \mathbb{I}[d(p) \ge t^\star]\)。

2. 空间形态学与连通域滤波:消除离散伪影并强化空间连贯性

针对 Otsu 初始分割中残留的孤立散斑以及编辑主体内部的微小空洞与狭缝,SR-Edit 结合成熟的数字图像处理操作进行几何规整。首先采用小尺寸圆形核进行形态学开运算(核大小 \(s_{\mathrm{open}}\))剥离微小孤立噪点,紧接着执行形态学闭运算(核大小 \(s_{\mathrm{close}}\))填补主体内部凹陷并连接断裂边缘,生成平滑连贯的掩码 \(M_1\)。随后执行两遍连通域标记算法,计算每个连通块的像素面积,直接剔除面积小于阈值 \(A_{\mathrm{min}}\) 的碎片化成分,仅保留具备显著语义浓度的编辑主体区域 \(M\)。这种纯像素级后处理确保了边界像素对齐,杜绝了隐空间插值引入的抖动。

3. Doob's h-transform 动力学保持修正:基于严谨分布变换的无损保真引导

针对启发式 KV 缓存替换或特征拼接破坏生成流形、导致边缘跳跃断层的问题,SR-Edit 从随机动力学条件化理论出发。将非编辑区域(掩码补集 \(\bar{M}\))的保真约束形式化为极限意义下的消失噪声观测模型 \(Y = \bar{M}x_0 + \xi\)(其中 \(\xi \sim \mathcal{N}(0, \sigma_{\mathrm{obs}}^2 I), \sigma_{\mathrm{obs}} \to 0\))。根据 Doob's h-transform,条件分布的得分函数可精确分解为无条件/基线得分与先验似然项之和: $\(\nabla_{x_t} \log p_t(x_t \mid y, \mathcal{C}) = \nabla_{x_t} \log p_t(x_t \mid \mathcal{C}) + \nabla_{x_t} \log h(t, x_t)\)$ 利用模型对清晰图像的即时预测 \(\hat{x}_0(x_t)\) 进行 plug-in 近似,并吸收局部雅可比矩阵敏感度为时间依赖标量调度 \(\lambda(t)\),推导出紧凑实用的掩码残差修正项: $\(\nabla_{x_t} \log h(t, x_t) \approx -\lambda(t) \bar{M} (\hat{x}_0(x_t) - x_{\mathrm{src}})\)$ 在连续时间扩散 SDE 中,该项作为加性漂移向量注入,不改变扩散项噪声标度;而在流匹配 ODE \(\frac{dx_t}{dt} = u_\theta(x_t, t)\) 中,则定义保真二次能量 \(E_t(x_t) = \frac{1}{2\sigma_{\mathrm{obs}}^2} \|\bar{M}(\hat{x}_0(x_t) - x_{\mathrm{src}})\|_2^2\),以加性速度修正形式注入原生场: $\(\frac{dx_t}{dt} = u_\theta(x_t, t) - \gamma(t)\lambda(t) \bar{M}(\hat{x}_0(x_t) - x_{\mathrm{src}})\)$ 从而在完全维持 ODE/SDE 传输结构的前提下,对非编辑区域产生指向源图像的平滑恢复牵引力。

4. 探针式多轮自细化循环:渐进式收敛编辑区域与采样轨迹

单次确定掩码容易在去噪早期因语义未定型而圈定过大范围,从而过度约束模型的编辑自由度。SR-Edit 组织多轮(默认 2 轮)自细化迭代:在采样进程达到 30% 步数时启动,先以 stride=3 的小步长快速前向推演形成探针预测,提取当前阶段更加聚焦的掩码,随后施加 h-transform 修正引导主轨迹。下一轮细化在更干净的中间态上重新估计差分与掩码,使得掩码与图像内容同步渐进式锐化,实现编辑自由度与保真约束的最佳动态平衡。

实验关键数据

主实验

在涵盖 replace、adjust、background、remove、add、action 六类区域编辑任务的 ImgEdit-Bench(497 例)上,SR-Edit 在扩散类(InstructPix2Pix、AnyEdit)与流匹配类(Qwen-Image-Edit 2511、Step1X-Edit v1p2)共 4 个主流骨干上均取得显著保真度与综合评分提升。

骨干模型与方法 CLIP ↑ SSIM ↑ PSNR ↑ DISTS ↓ LPIPS ↓ Judge ↑
InstructPix2Pix 26.68 0.67 16.58 0.20 0.46 2.69
+ SR-Edit (本文) 25.07 0.68 16.94 0.18 0.43 2.75
AnyEdit 25.15 0.70 18.95 0.17 0.41 2.82
+ SR-Edit (本文) 25.21 0.85 19.19 0.13 0.35 2.99
Qwen-Image-Edit 2511 26.16 0.61 14.92 0.23 0.46 3.84
+ Follow-Your-Shape 26.03 0.61 14.96 0.23 0.47 3.59
+ SpotEdit 26.11 0.70 16.55 0.20 0.32 3.91
+ SR-Edit (本文) 26.80 0.67 17.40 0.18 0.31 3.94
Step1X-Edit v1p2 25.89 0.68 15.96 0.20 0.39 4.00
+ Follow-Your-Shape 25.84 0.67 15.93 0.20 0.39 4.03
+ SpotEdit 25.91 0.75 16.77 0.17 0.31 4.08
+ SR-Edit (本文) 26.09 0.77 16.48 0.14 0.27 4.01

消融实验

消融实验基于 Qwen-Image-Edit 2511 骨干,分别评估了区域估计策略、细化轮数以及后处理各组件对最终编辑质量和掩码精度的影响。

实验配置与变体 CLIP ↑ SSIM ↑ PSNR ↑ DISTS ↓ LPIPS ↓ Judge ↑
SR-Edit (完整模型, 2 轮迭代) 26.80 0.67 17.40 0.18 0.31 3.94
基于重构估计区域 (Reconstruction) 26.95 0.64 16.90 0.21 0.35 3.88
单轮固定细化 (Single Iter) 25.90 0.60 16.10 0.24 0.41 3.60

在区域识别后处理各模块的独立消融中,去除任一组件均导致掩码质量明显退化:

后处理模块消融配置 Precision (P) ↑ Recall (R) ↑ IoU ↑ F1 ↑
w/o Otsu 自适应分离 0.10 1.00 0.10 0.16
w/o Opening 开运算滤波 0.69 1.00 0.69 0.76
w/o Closing 闭运算填充 1.00 0.91 0.91 0.95
w/o Connected Component 连通域过滤 0.76 1.00 0.76 0.84

关键发现

  • 非编辑区漂移大幅抑制,结构保真度跃升:在 AnyEdit 上,SR-Edit 将 SSIM 从 0.70 大幅提升至 0.85,LPIPS 感知误差从 0.41 降至 0.35;在 Step1X-Edit 上 LPIPS 从 0.39 降至 0.27,证明数学推导的平滑残差修正比启发式特征注入更有效保护了背景高频纹理。
  • 多轮自细化解决早期掩码失真:单轮迭代(Single Iter)由于在早期固定了粗糙过大的掩码,过度压制了编辑区域的自由度,导致 Judge 分数暴跌至 3.60、CLIP 降至 25.90;而引入 2 轮渐进细化后,区域定位随生成内容同步收敛,兼顾了指令遵循与局部修改。
  • Few-step 探测相比单步重构具备更高的稳定性:单步重构由于噪声敏感性极高,在采样中程(如 step 32 附近)会出现 IoU 和 F1 的剧烈跳水;而几步小步长探测(stride=2 或 3)能平滑跟踪生成轨迹,提供坚实且高精度的自反馈。

亮点与洞察

  • 从动力学本质出发的约束注入:避免了在注意力层强行插值 KV 或拼接特征带来的生硬边界跳跃,而是利用 Doob's h-transform 将保真转化为 SDE 的漂移倾斜和 ODE 的平滑速度引导,属于免训练图像编辑在理论建模上的优雅突破。
  • 像素级自反馈优于隐空间与注意力图:充分认识到生成模型解码器的极强非线性映射会导致隐空间和注意力层难以捕捉真实亚像素边缘,果断在解码像素域做成熟形态学清洗,以极低开销换取极高边缘质量。
  • 可复用的采样轨迹即时校正范式:将“探针预测 → 误差残差计算 → 动力学外加项引导”的闭环思想,不仅适用于局部编辑,未来还可直接迁移至可控视频生成、音频局部修复与分子结构定向演化等连续动力学生成任务中。

局限与展望

  • 推理耗时增加:由于每个 SR-Edit 块包含额外的几步前向探测推演,相比直接单程生成增加了一定的推理计算开销(FLOPs 略增)。
  • 极端几何形变与复杂多目标挑战:当编辑指令涉及大幅度姿态扭曲或多个分散小物体同时交互时,差分图的 Otsu 分割与连通域面积阈值可能面临前景碎片化风险,导致弱相关区域漏检或误检。
  • 未来方向:探索端到端动态自适应步长调度策略,减少探测步数;并将该 h-transform 动力学校正机制推广到视频流匹配模型中的时空连贯局部编辑。

相关工作与启发

  • vs Follow-Your-Shape: Follow-Your-Shape 基于轨迹分歧图定位可编辑区并采用启发式 KV 注入维持背景;SR-Edit 则在像素空间通过形态学自细化消除抖动,并采用数学严谨的 Doob's h-transform 漂移修正,避免了背景残留模糊与边缘断层。
  • vs SpotEdit: SpotEdit 依赖单步重构和 KV 缓存插值;SR-Edit 指出单步重构在特定采样步极不稳定,改用多步前向探测,并在生成动力学层面对齐向量场,彻底解决了边界跳跃伪影。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次将 Doob's h-transform 理论严谨应用于扩散与流匹配的局部免掩码编辑保真约束。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 4 大主流骨干、ImgEdit-Bench 全面评测与极度详实的组件级消融。
  • 写作质量: ⭐⭐⭐⭐⭐ 理论推导清晰完备,从直觉观察到数学建模逻辑严密。
  • 价值: ⭐⭐⭐⭐⭐ 即插即用、无需训练,大幅提升开源编辑底座的实际落地保真度。