OSOR: One-Step Diffusion Inpainting for Effect-Aware Object Removal¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/Zhouqm-Git/osor
领域: 图像生成
关键词: 目标消除, 图像修复, 单步扩散模型, 阴影与倒影消除, 掩码鲁棒性
一句话总结¶
OSOR 提出了面向目标消除的单步扩散修复框架,通过占用引导判别器提供精确多尺度边界监督,结合轻量 Alpha 头预测真实影响区域以实现自适应潜空间混合,在实现阴影与倒影完全消除及掩码容错的同时,将推理速度较现有强多步基线提升 4 至 30 倍。
研究背景与动机¶
在真实场景的照片智能编辑中,目标消除(Object Removal)是一项核心需求,它不仅要求抹去用户指定的目标前景,还必须恢复被遮挡的原生背景,并彻底清理目标引发的环境耦合视觉效应(如地面投射阴影、光滑表面镜面反射以及环境光遮蔽)。早期的 GAN 方案虽然推理迅速,但受限于生成网络容量,修补区域常出现纹理模糊和结构畸变;近年来基于多步扩散模型(如 SDXL、FLUX Fill)的方案大幅提升了生成质量,但数十步迭代去噪的计算开销极大,单张图像动辄耗时数秒至数十秒,无法满足边缘设备交互式实时编辑的延迟要求。
更严重的瓶颈在于现有方法难以兼顾“关联效应感知”(Effect-awareness)与“掩码鲁棒性”(Mask-robustness)。现实中用户手工涂抹的掩码往往非常随意:要么仅粗略框选目标主体而遗漏外部阴影和倒影,导致修补后残存“鬼影”;要么涂抹过大覆盖无关背景。直接将现有基于对抗蒸馏的单步加速方案迁移至目标消除时,由于缺乏多步逐步纠错的机会,修补边缘极易出现缝隙、伪影与边界模糊;此外,公开编辑数据集中充斥着大量语义不匹配或全局漂移的脏样本,导致模型难以学到精准的几何与光照先验。
针对这些核心矛盾,本文跳出传统多步迭代框架,将目标消除重新建模为中间噪声潜变量的单步恢复任务,并从判别器监督粒度、掩码自适应软混合以及高质量效应感知数据挖掘三个维度系统攻克挑战。核心 idea:通过占用引导的多尺度判别器解决单步去噪的边界模糊缺陷,引入依附于扩散主干的轻量 Alpha 头推断真实受影响区域实现自适应潜空间融合,并基于语义锚定验证管线(SAVP)构建含 280K 高保真图对的 CORNE 数据集,在单步前向内实现效应感知且掩码鲁棒的极速目标消除。
方法详解¶
整体框架¶
OSOR 的整体框架建立在预训练扩散修复骨干网络(如 SDXL-Inpainting 与 FLUX Fill)及对应 VAE 的潜空间之上。给定输入图像 \(x\) 与用户提供的初始掩码 \(m\),模型先通过 VAE 编码器将图像投影至潜空间 \(\bar{z} = \mathcal{E}(x)\),并在中间选定噪声步长 \(t\)(实验优选 \(t=400\))施加微弱前向扰动生成 \(z_t\)。骨干网络以条件拼合元组 \(c = \langle \bar{z}, m, e \rangle\)(其中 \(e\) 为固定提示词“Remove the instance of object”的文本嵌入)为输入,进行单步去噪前向传播,直接输出一步还原的干净背景潜变量 \(\hat{z}_0\)。
为了实现端到端的鲁棒消除与边界平滑过渡,OSOR 采用两阶段渐进式训练方案: 1. 阶段一(Phase I:边界一致单步消除):在真实效应感知掩码 \(m_{\text{gt}}\) 监督下,采用潜空间硬混合(Hard Latent Blending)将未编辑区域锁定为输入图像,并引入占用引导的多尺度判别器(Occupancy-Guided Multi-Scale Discriminator)在 OpenCLIP ConvNeXt 提取的 4 个分辨率特征图上施加面积分数监督,解决拼接接缝问题; 2. 阶段二(Phase II:Alpha 感知自适应鲁棒消除):在骨干输出层挂载轻量 Alpha 预测头,输入保守或不完整的用户掩码 \(m_{\text{in}}\),利用扩散主干深层语义先验预测出覆盖完整阴影/倒影的软透明度图 \(\hat{\alpha}\),通过 Alpha 自适应潜空间混合输出最终结果,从而在推理时免除用户精细涂抹阴影的负担。
整个数据与训练流程如下图所示:
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入图像 x 与初始掩码 m"] --> B["SAVP 语义锚定验证管线<br/>挖掘效应标注并构建 CORNE 数据集"]
B --> C["单步潜空间恢复主干<br/>中间噪声步长加噪与一步还原"]
C --> D["占用引导判别器<br/>阶段一:多尺度面积池化分数目标"]
D --> E["轻量 Alpha 预测头<br/>阶段二:不完整掩码软扩展与自适应混合"]
E --> F["输出无残留高保真修复背景"]
关键设计¶
1. SAVP 语义锚定验证管线:低质指令编辑三元组的高纯度效应数据挖掘
针对真实场景缺乏大规模“目标+阴影/倒影”成对消除样本的问题,传统方法依赖合成阴影或噪声严重的指令编辑三元组(如 NHR-Edit)。SAVP 通过在对数亮度、色度及梯度幅值三个维度构建多特征差异热力图,并提取差异连通域候选框 \(b_{\text{diff}}\);同时使用 GroundingDINO 对指令文本进行开放集目标检测得到语义框 \(b_{\text{sem}}\)。管线首先依据连通域碎裂度与散落噪声比率剔除全局畸变样本,再通过面积降序遍历匹配最佳 IoU 与尺度比例约束,仅保留真正包含局部编辑且无全局坍塌的候选框 \(b_{\text{val}}\)。随后,利用 SAM2 结合 \(b_{\text{val}}\) 提示分割出精确目标核心掩码 \(m_{\text{obj}}\),并与差异掩码取并集得到效应感知目标掩码 \(m_{\text{fuse}} = m_{\text{obj}} \cup m_{\text{diff}}^{\text{val}}\)。通过量化效应残差 \(m_{\text{eff}} = m_{\text{fuse}} \setminus m_{\text{obj}}\) 及其占比 \(\|m_{\text{eff}}\|_1 / \|m_{\text{fuse}}\|_1\),筛选出效应密集的样本构建出包含 280K 样本的 CORNE 数据集,为后续训练提供了坚实数据基础。
2. 占用引导判别器:攻克单步去噪边界接缝与模糊的多尺度分数监督
单步对抗蒸馏在目标消除任务中极易产生边界拼接接缝,根本原因在于判别器降采样后的粗糙网格对边缘 Patch 的定性失真。最近邻下采样会产生非 0 即 1 的硬目标,迫使部分覆盖的边界 Patch 过度自信;高斯平滑软目标则受制于固定核带宽,无法精确反映真实几何占比。本文提出占用引导 Patch 目标(OG-Patch Targets),在判别器的 4 个特征尺度上直接对掩码执行区域面积平均池化(Area Pooling),计算出每个 Patch 区域内的真实覆盖比例分数值 \(\tilde{w}_k \in [0, 1]\)。判别器基于冻结的 OpenCLIP ConvNeXt 主干和轻量多尺度头部,其损失函数定义为: $$ \mathcal{L}D(w) = \sum_k \mathbb{E}\left[ -\log D\xi^k(x^{\text{bg}}) \right] + \sum_k \mathbb{E}\left[ -(1-\tilde{w}k) \odot D\xi^k(\hat{x}) - \tilde{w}k \odot \left(1 - D\xi^k(\hat{x})\right) \right] + \lambda_{\text{r1}}\mathcal{R}{\text{r1}} $$ 生成器对抗损失同样引入掩码面积归一化因子,确保不同尺寸物体的梯度更新幅度自适应平衡: $$ \mathcal{L}}}(w) = \sum_k \mathbb{E}\left[ \frac{\sum_p \tilde{wk(p) D\xi^k(\hat{x})_p}{\sum_p \tilde{w}_k(p) + \varepsilon} \right] $$ 这一设计使得跨越边界的 Patch 能够接收连续平滑的分数级惩罚,消除拼接错位。
3. 轻量 Alpha 预测头:面向粗糙掩码的自适应效应补全与潜空间融合
当用户仅涂抹目标主体而遗漏阴影时,传统的潜空间硬掩码混合(\(z_{\text{out}} = m_z \odot \hat{z}_0 + (1 - m_z) \odot \bar{z}\))会强制保留未被涂抹的阴影像素,使得任何模型都无法去除掩码外残余效应。为此,OSOR 在阶段二为骨干网络扩展了终极输出投影层,在输出去噪结果的同时额外输出通道生成透明度 Logit \(\ell_\theta\),通过 Sigmoid 激活得到软掩码 \(\hat{\alpha} = \sigma(\ell_\theta)\)。最终输出潜变量采用软 Alpha 融合合成: $$ z_{\text{out}} = \hat{\alpha} \odot \hat{z}_0 + (1 - \hat{\alpha}) \odot \bar{z} $$ 在训练时,输入条件掩码 \(m_{\text{in}}\) 从紧致目标核心掩码 \(m_{\text{obj}}\) 以及经过腐蚀、膨胀、随机丢孔和平移扰动的几何退化家族中采样,故意使其缺失外围效应;而监督目标始终强制绑定完整的效应感知真值 \(m_{\text{gt}}\)。通过复合监督损失 \(\mathcal{L}_{\alpha} = \lambda_{\text{bce}}\operatorname{BCE}(\ell_\theta, m_{\text{gt}}^z) + \lambda_{\text{dice}}\operatorname{Dice}(\hat{\alpha}, m_{\text{gt}}^z)\),强迫模型基于扩散先验“脑补”出视野外的阴影与倒影范围,实现对随意涂抹的高度容错。
损失函数 / 训练策略¶
OSOR 采用参数高效适配策略,在微调大型扩散骨干(SDXL 或 FLUX Fill)时,主体网络权重保持冻结,仅更新轻量 LoRA 模块以及终端输出投影层。训练分为两阶段: - 阶段一损失函数:设置引导掩码 \(w = m_{\text{gt}}\),联合优化掩码归一化重构损失、感知损失与占用对抗损失: $$ \mathcal{L}G(m)|}}) = \lambda_{\text{rec}} \frac{|m_{\text{gt}} \odot (\hat{x} - x^{\text{bg}1}{|m|}1 + \varepsilon} + \lambda}} \text{LPIPS}(\hat{x}, x^{\text{bg}}) + \lambda_{\text{adv}} \mathcal{L{\text{adv}}(m) $$ 生成器与判别器交替最小-最大优化。 - }阶段二损失函数:继承阶段一权重,输入不完整掩码 \(m_{\text{in}}\),重构与对抗项仍严格以真实效应区域 \(m_{\text{gt}}\) 作为权重评估(防止 \(\hat{\alpha}\) 通过自主收缩偷懒降 loss),总目标函数为: $$ \min_\theta \max_\xi \mathcal{L}G(m}}) + \mathcal{L\alpha - \mathcal{L}_D(m) $$}
实验关键数据¶
主实验¶
评估在具有真实成对背景的数据集 CORNE-Val、真实消除数据集 RORD-Val 以及专有基准 AnimeEraseBench、TextEraseBench、OmniPaint-Bench 和 RemovalBench 共 6 个评测集上全面展开。评价指标包含全参考指标 PSNR、SSIM、LPIPS,分布逼真度指标 FID、CMMD,以及衡量颜色与纹理不连续度的 CFD(Contextual Fracture Distance)。
下表为 CORNE-Val、RORD-Val 和 AnimeEraseBench 在仅目标掩码(Object Mask)与效应感知掩码(Object-Effect Mask)设置下的核心对比结果:
| 数据集 | 方法 | 延迟 (s)↓ | Object Mask FID↓ | Object Mask PSNR↑ | Object Mask SSIM↑ | Object Mask CFD↓ | Object-Effect PSNR↑ |
|---|---|---|---|---|---|---|---|
| CORNE-Val | OmniPaint | 26.12 | 18.6077 | 28.436 | 0.9166 | 0.1950 | 27.950 |
| ObjectClear | 6.44 | 22.0457 | 29.207 | 0.9191 | 0.2040 | 29.012 | |
| AttentiveEraser | 8.69 | 25.4818 | 25.650 | 0.8636 | 0.2244 | 25.602 | |
| FLUX-Fill (多步) | 25.27 | 59.5678 | 23.124 | 0.9130 | 0.2766 | 23.629 | |
| OSOR (SDXL) | 0.42 | 29.3846 | 27.262 | 0.8371 | 0.1608 | 27.422 | |
| OSOR (FLUX) | 0.80 | 12.3241 | 32.031 | 0.9373 | 0.1538 | 32.189 | |
| RORD-Val | OmniPaint | 16.51 | 27.5658 | 23.293 | 0.7899 | 0.3707 | 23.078 |
| ObjectClear | 8.69 | 25.4667 | 25.804 | 0.8500 | 0.3248 | 25.633 | |
| AttentiveEraser | 8.68 | 36.5740 | 22.798 | 0.7023 | 0.3608 | 23.080 | |
| OSOR (SDXL) | 0.42 | 35.5989 | 23.767 | 0.6827 | 0.2644 | 23.826 | |
| OSOR (FLUX) | 0.62 | 27.3621 | 25.599 | 0.8175 | 0.2465 | 25.613 | |
| AnimeErase | OmniPaint | 24.93 | 27.4034 | 25.542 | 0.8573 | 0.4369 | 25.351 |
| ObjectClear | 10.18 | 36.6865 | 25.429 | 0.8409 | 0.3872 | 25.530 | |
| OSOR (SDXL) | 0.48 | 55.7614 | 23.090 | 0.6857 | 0.2820 | 23.130 | |
| OSOR (FLUX) | 0.89 | 26.8352 | 27.780 | 0.8859 | 0.2703 | 27.871 |
在额外三个单掩码基准上的对比结果同样验证了其优异性能:在 TextEraseBench 上,OSOR(FLUX) 达到 31.997 dB PSNR 与 19.6169 FID(大幅优于次优方法 ObjectClear 的 29.689 dB 与 29.1359 FID),延迟仅需 0.83s(加速 12.2 倍);在 OmniPaint-Bench 上,OSOR(FLUX) 斩获 49.1927 FID 与 24.936 dB PSNR(OmniPaint 为 50.0921 FID 与 23.455 dB),单图推理从 34.13 秒急剧缩短至 1.06 秒(加速 32.2 倍)。
消融实验¶
针对判别器多尺度目标建模类型(在 RORD-Val 且输入效应掩码下)的消融对比证明了占用引导监督的关键作用:
| 目标类型 (Patch Target) | PSNR↑ | SSIM↑ | FID↓ | LPIPS↓ | CFD↓ | 说明 |
|---|---|---|---|---|---|---|
| 硬二值目标 (Hard Mask) | 22.463 | 0.6739 | 56.1508 | 0.2007 | 0.3399 | 最近邻降采样,粗网格边界过度自信 |
| 高斯平滑目标 (Gaussian Soft) | 21.992 | 0.6708 | 64.1290 | 0.2103 | 0.3430 | 固定方差高斯滤波,脱离实际几何物理占用 |
| 占用引导目标 (Occupancy, 本文) | 22.696 | 0.6741 | 50.0639 | 0.1855 | 0.3013 | 区域面积池化计算连续分数,消除边界断裂 |
在噪声步长 \(t\) 的选择上,测试 \(t \in \{200, 400, 600, 800\}\),结果显示 \(t=400\) 时取得最佳感知与保真权衡(FID 达到 50.0639,PSNR 为 22.696 dB,显著优于 \(t=200\) 的 60.1520 FID 与 \(t=800\) 的 51.8961 FID)。
针对 Alpha 预测头与阶段二训练机制的消融实验(在 RORD-Val 上基于 SDXL 架构)如下表:
| 条件掩码类型 | 训练阶段与融合方式 | PSNR↑ | SSIM↑ | FID↓ | LPIPS↓ | CFD↓ |
|---|---|---|---|---|---|---|
| 仅主体掩码 \(m_{\text{obj}}\) | 阶段一 (硬潜变量融合) | 21.965 | 0.6726 | 59.8017 | 0.2062 | 0.3133 |
| 仅主体掩码 \(m_{\text{obj}}\) | 阶段二 (Alpha 软自适应融合) | 23.767 | 0.6827 | 35.5989 | 0.1795 | 0.2644 |
| 效应感知掩码 \(m_{\text{gt}}\) | 阶段一 (硬潜变量融合) | 22.696 | 0.6741 | 50.0639 | 0.1855 | 0.3013 |
| 效应感知掩码 \(m_{\text{gt}}\) | 阶段二 (Alpha 软自适应融合) | 23.826 | 0.6823 | 35.6523 | 0.1797 | 0.2624 |
关键发现¶
- Alpha 预测头对粗糙掩码具有本质性提升:当用户仅提供紧致主体掩码时,阶段一模型受限于硬掩码,残余阴影无法抹除,FID 劣化至 59.8017;引入 Alpha 自适应合成后,FID 大幅跃升 24.2 点至 35.5989,PSNR 提升 1.80 dB,彻底释放了扩散先验的主动外扩补全能力。
- 占用引导是单步对抗训练稳定收敛的核心:面积池化分数目标使得 CFD(上下文断裂距离)从硬掩码的 0.3399 显著压降至 0.3013,有效消除了合成区域与原始未修改背景之间的缝合伪影。
- 极致的计算性价比:OSOR(FLUX) 在各项指标上反超需要 28 步去噪的原始 FLUX Fill,单图耗时从 25.27 秒暴降至 0.80 秒,证明适度利用扩散潜空间先验进行微扰单步恢复是完全可行的。
亮点与洞察¶
- 将多尺度面积池化融入对抗边界建模:传统图像生成任务的判别器往往全局打分,而单步修复模型最脆弱的是“硬拼接边界”。利用 Area Pooling 将掩码下采样为连续占用率,用简单的分数匹配化解了单步生成的边界高频振荡,这一思路可直接推广到任意单步局部编辑与外扩(Outpainting)任务中。
- 复用骨干潜表示的即插即用 Alpha 头设计:不额外构建庞大的分割子网络,仅扩展骨干网终极输出投影层的输出通道,几乎零额外开销地榨取了主干内蕴的物体边界感知先验,并通过自适应加权巧妙融合未修改潜变量与生成潜变量。
- 全自动高纯度弱监督过滤闭环(SAVP):通过“多特征物理差异 \(\to\) 开放集检测对齐 \(\to\) 分割大模型掩码融合 \(\to\) 效应残差筛选”的自监督逻辑链,从脏污的互联网编辑数据中自动化清洗出高质量配对数据,具有极佳的工程工程复用价值。
局限与展望¶
- 极端大面积复杂遮挡与全局重光照挑战:对于跨越极其复杂透视结构、或占据画面超过一半的强关联漫反射,模型有时在单步预测中依然难以重建完全符合全局物理光照传播的复杂几何纹理。
- 透明度预测在强镜面反射边缘的精度:当背景材质为高反射率粗糙水面或复杂镜面时,Alpha 预测头推断的反射边界偶尔会出现边界轻度虚化或过度外扩现象。
- 未来方向:探索将多模态大模型的物理光照常识注入 Alpha 头,或引入少步(如 2-4 步)确定性自洽校正机制,在保持极低延迟的同时进一步强化高难度场景的几何自洽性。
相关工作与启发¶
- vs OmniPaint / ObjectClear / OmniEraser: 这些前序 SOTA 方法虽然关注到了阴影消除与掩码不完整性,但全部建立在多步(20-50 步)扩散迭代生成或自注意力重定向机制之上,推理延迟高达 6 至 34 秒;OSOR 首次在单步去噪框架内实现了效应感知与掩码容错,不仅将速度推向 sub-second(<1s),指标上反超了大多数多步方案。
- vs ADD / DMD (对抗扩散蒸馏): 标准的图像生成对抗蒸馏主要针对整图全局分布对齐,在局部条件编辑中容易忽略未掩码区域与编辑区域的几何连续性;OSOR 提出的潜空间微弱加噪框架(Latent Restoration)与占用引导判别器成功补齐了单步蒸馏在局部修补中的边界缺陷。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 巧妙提出占用引导判别器与轻量 Alpha 头,实现了业界领先的首个兼具效应感知与粗掩码容错的单步扩散消除框架。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 6 个公开及专有基准、7 种对比前沿方案,指标细致全面,消融实验扎实验证了各核心组件的有效性。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑结构层次分明,数学形式化表述严谨,问题动机直击现有落地痛点。
- 价值: ⭐⭐⭐⭐⭐ 在工业级移动端交互编辑、边缘计算低延迟去水印与物体消除领域具备极高的落地部署价值。