CoIn: Comprehensive 2D-3D Inpainting with Gaussian Splatting Guidance¶
会议: ECCV 2026
论文: ECCV 官方海报
PDF: ECCV Open Access
领域: 3D 视觉
关键词: 3D 场景补全, 3D 高斯泼溅, 扩散模型引导, 多视角一致性, 物体增删
一句话总结¶
CoIn 提出了一种融合 2D 扩散生成与 3D 高斯泼溅(3DGS)的双向协同 3D 场景补全框架,通过参考自适应高斯(Ref-GS)构建几何粗结构、基于 GS 特征翘曲的一致性损失引导(CLG)约束 2D 扩散多视角一致去噪,再经局部纹理判别器(TE-D)对抗细化,实现了在任意形状掩码(包括包围盒)下对物体移除与插入任务的高质量多视角一致补全。
研究背景与动机¶
3D 场景补全(3D Scene Inpainting)旨在修复由于视点遮挡、传感器噪声或视野受限引起的场景缺失区域,在场景编辑、虚拟现实与具身感知中具有重要价值。早期神经辐射场(NeRF)补全方法受限于隐式体积表示,重构计算开销巨大、优化周期长且难以直接进行几何显式操纵。随着 3D 高斯泼溅(3DGS)的兴起,近期的主流方案(如 IMFine、3DGIC、AuraFusion 等)普遍采用「3D 优先(3D-first)」管线:先从原始图像构建多视角 3DGS 场景,借助 2D 分割模型(如 SAM2)获取各视角的掩码并在 3D 空间中对目标高斯进行剪枝(pruning),随后通过几何平滑或参考视角翘曲来填补几何与纹理空洞。然而,这一范式高度依赖多视角分割掩码的严苛空间一致性;在实际多视角采集下,2D 分割边界的轻微漂移会导致 3D 空间误剪枝与非目标区域过度剔除,且「先剪枝后填补」的机制天然局限于物体移除任务,无法支持新物体插入或粗粒度的包围盒(Bounding Box)掩码。
与之相对的「2D 优先(2D-first)」管线则试图先行利用 2D 生成模型(如 Stable Diffusion Inpainting)强大的语义生成能力对各视角分别进行修复,再借助光流或网格等 3D 先验进行后验一致性约束。然而,由于 2D 扩散去噪固有的随机采样特性,在未加额外强约束的情况下,各视角独立生成的结果往往存在严重的纹理漂移与几何冲突,直接用于 3DGS 重建会导致灾难性的几何伪影与重影模糊;而现有多视角 2D 扩散修正方法往往需要耗费大量资源在特定数据集上微调,泛化能力与掩码适应性受限。
本文的切入角度是打破 2D 生成与 3D 重建的单向割裂,构建 2D 扩散先验与 3D 显式表征紧密闭环的双向信息流。核心 idea:以 2D 初始补全为起点支持任意掩码与插入任务,通过参考自适应高斯(Ref-GS)构建粗粒度 3D 几何,利用 GS 驱动的参考特征翘曲构造跨视角一致性能量损失(CLG)以零微调引导 2D 扩散去噪,最终通过纹理增强判别器(TE-D)对抗学习消除引导平滑并恢复高频纹理细节。
方法详解¶
整体框架¶
CoIn 的输入为包含待编辑目标的多视角图像集 \(\{I_n\}_{n=1}^N\) 及其对应的任意形状掩码 \(\{M_n\}_{n=1}^N\)(支持精准分割掩码或松弛的包围盒掩码)。整个管线包含四个协同演进的阶段:首先,通过预训练 2D 扩散模型获得初始单张补全图,摆脱对精准 3D 掩码剪枝的依赖;接着,进入 2D \(\to\) 3D 粗阶段,利用参考自适应高斯泼溅构建粗粒度 3D 场景并提取几何点云;随后,进入 3D \(\to\) 2D 引导阶段,借助 3D 点云将参考特征翘曲至虚拟中间视角,以能量引导方式约束 2D 扩散去噪过程,生成多视角一致的补全图像;最后,进入 2D \(\to\) 3D 精修阶段,使用局部纹理增强判别器进行对抗优化,在锁定全局一致几何的前提下重现高保真表面纹理。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
In["输入多视角图像与掩码<br/>{I_n, M_n}"] --> Init["初始 2D 扩散补全<br/>生成初始修复图像 {Î_n}"]
Init --> RefGS["参考自适应高斯泼溅与特征注意力 (Ref-GS)<br/>自适应视角加权 W_n + 锚点单向特征注意力"]
RefGS --> Cloud["重建粗粒度 3D 场景与点云 P_k"]
Cloud --> CLG["一致性损失引导 (CLG)<br/>中间视角特征翘曲 + 3D 能量损失引导去噪"]
CLG --> Consist["多视角一致 2D 补全图像 {Ĩ_n}"]
Consist --> TED["纹理增强判别器 (TE-D)<br/>局部 Patch 对抗训练 + 光度渲染微调"]
TED --> Out["高质量多视角一致 3DGS 场景 𝒢"]
关键设计¶
1. 参考自适应高斯泼溅与特征注意力(Ref-GS):以基准视角为锚拉齐粗粒度 3D 几何 针对各视角初始 2D 补全结果 \(\{\hat{I}_n\}_{n=1}^N\) 存在内容与纹理冲突、直接优化 3DGS 会导致严重视点不一致伪影与模糊的问题,作者基于轻量化锚点架构 Scaffold-GS 构建粗场景。在初始化时,仅剪枝落入掩码内的初始 COLMAP 稀疏点以剔除残留目标,并选定一个视点居中且修复自然的视角作为参考视角 \(\hat{I}_k\)。为了避免多视角冲突梯度破坏几何,模型为每个视角赋予动态光度损失权重 \(W_n\):参考视角分配最高权重 \(\lambda_r\);对于其余视角 \(n \neq k\),依据其当前迭代与前一迭代光度损失 \(\mathcal{L}_R\) 的变化幅度计算衰减权重: $\(W_n = \begin{cases} \lambda_r, & \text{if } n = k \\ \exp\left(-\lambda \left(\mathcal{L}_R^{(n,t)} - \mathcal{L}_R^{(n,t-1)}\right)\right), & \text{if } n \neq k \end{cases}\)$ 该加权机制抑制了与参考视角相冲突的视角更新,使场景几何强力对齐参考视角。同时,在 3D 空间针对 Scaffold-GS 的锚点特征执行单向交叉注意力更新: $\(f_{in}^A \leftarrow \text{Attn}\left(Q = f_{in}^A, K = f_{side}^A, V = f_{side}^A\right)\)$ 将掩码外围完好区域的锚点特征 \(f_{side}^A\) 定向传递给掩码内部区域的锚点 \(f_{in}^A\),保证边界纹理与结构的平滑延伸。最后,结合单目深度估计网络提取的参考视角深度图 \(D_k\) 进行深度对齐约束,提取出稳定的 3D 场景点云 \(P_k\)。
2. 一致性损失引导(CLG):基于 GS 特征翘曲的多视角 2D 扩散能量引导 针对独立 2D 扩散模型去噪难以自发保持多视角几何一致性的问题,作者受 FreeDoM 能量引导机制启发,将粗粒度 3D 场景的显式几何反哺至 2D 扩散模型的采样过程。在冻结的 Latent Diffusion 模型的第 \(t\) 步去噪中,中间潜在变量经解码器得到当前视角图像 \(X_{(n,t)} = \text{Dec}(z_{(n,t)})\)。利用点云 \(P_k\) 和相机外参,将参考图像 \(\hat{I}_k\) 与当前生成图 \(X_{(n,t)}\) 共同投影至两相机位姿的半程插值虚拟视点 \(\phi\)(平移采用线性插值,旋转采用四元数球面插值 Slerp)。在虚拟视点 \(\phi\) 下,模型提取 FeatUp 增强的高频 DINO 特征并计算余弦相似度,同时计算 RGB 外观特征的 \(L_2\) 距离,形成 3D 一致性度量 \(\mathcal{L}_{3D}\): $\(\mathcal{L}_{3D} = -\cos\left(f_\phi^{hr}(\hat{I}_k), f_\phi^{hr}(X_{(n,t)})\right) + \|f_\phi^{rgb}(\hat{I}_k) - f_\phi^{rgb}(X_{(n,t)})\|_2^2\)$ 为妥善处理视角间的遮挡与视场不重叠区域,算法生成点云有效投影支撑掩码 \(m_n^P\);在点云有效区域应用 \(\mathcal{L}_{3D}\),在缺失区域则以当前 3DGS 渲染图 \(R_n\) 的 \(L_1\) 距离兜底,构成整体能量函数: $\(\mathcal{E}(X_{(n,t)}) = m_n^P \cdot \mathcal{L}_{3D} + (1 - m_n^P) \|X_{(n,t)} - R_n\|_1\)$ 通过在扩散逆过程中最小化 \(\mathcal{E}(X_{(n,t)})\),使扩散采样在无需任何微调或额外训练数据的情况下,自适应收敛至跨视角几何与外观高度一致的高清补全图像 \(\{\tilde{I}_n\}_{n=1}^N\)。
3. 纹理增强判别器(TE-D):对抗学习解耦几何平滑与高频纹理重构 虽然 CLG 阶段产出了几何对齐的多视角补全图像,但强几何先验引导往往会引入微小的过平滑,使最终 3DGS 渲染缺乏真实表面的高频微观纹理。为此,作者引入局部纹理增强判别器(TE-D),在 2D \(\to\) 3D 精修阶段与 3DGS 进行联合对抗训练。判别器采用 PatchGAN 结构,在待补全区域周围随机抽取 \(64 \times 64\) 的局部图像块:以初版 2D 补全图像 \(\hat{I}_n\)(具备丰富的生成式微观纹理但缺乏多视角一致性)的 patch 作为真实样本,以当前 3DGS 渲染图 \(R_n\) 的 patch 作为虚假样本。通过对抗损失 \(\mathcal{L}_{gen}(R_n, \hat{I}_n)\),3DGS 被驱动去学习真实图像块的高频统计分布。同时,3DGS 依旧以 CLG 生成的一致性图像 \(\tilde{I}_n\) 作为光度渲染监督与深度监督,总优化目标为: $\(\mathcal{L} = \mathcal{L}_R(R_n, \tilde{I}_n) + \lambda_D \mathcal{L}_D + \lambda_{gen}\mathcal{L}_{gen}(R_n, \hat{I}_n)\)$ 该设计实现了「全局几何由一致性补全图锚定,微观纹理从高频局部 patch 汲取」的解耦效果,在消除引导模糊的同时杜绝了几何变形。
损失函数 / 训练策略¶
系统的优化分为粗重建与精细对抗两个核心周期。在 Ref-GS 粗重建阶段,总损失由加权光度损失与深度损失构成,训练中剪枝初始掩码内的高斯点并执行单向特征注意力传播。在 CLG 阶段,扩散模型完全冻结,输入为 \(512 \times 512\) 图像,DINO (dino16) 与 FeatUp 特征在 \(256 \times 256\) 分辨率下提取以兼顾显存效率。在最终 TE-D 精修阶段,首先在一致性补全图像 \(\tilde{I}_n\) 上微调 3DGS 生成器 10k 次迭代,随后开启 TE-D 判别器联合对抗训练 10k 次迭代,采样概率聚焦于掩码区域附近的 \(64 \times 64\) patch。整套方案在单张 NVIDIA RTX 4090 GPU 上运行,单场景总耗时仅约 2.5 小时。
实验关键数据¶
主实验¶
评估在主流基准 SPIn-NeRF 数据集(10 个场景,每个场景含 60 张目标存在图与 40 张目标不存在图,在目标不存在视点评估新视角合成)与 IMFine 数据集(视角跨度覆盖 90°、120°、180° 的 10 个代表性场景)上展开。指标包括全图与掩码区域(前缀 m-)的 LPIPS、PSNR 与 FID。
表 1:SPIn-NeRF 数据集上的定量评估对比(原论文 Table 1)
| 方法类型 | 算法 | 掩码类型 | m-LPIPS (↓) | LPIPS (↓) | m-FID (↓) | FID (↓) |
|---|---|---|---|---|---|---|
| NeRF | SPIn-NeRF | 分割掩码 (Seg) | 0.053 | 0.31 | 153.4 | 49.6 |
| NeRF | MVIP-NeRF | 分割掩码 (Seg) | 0.050 | 0.31 | 173.4 | 50.5 |
| NeRF | MALD-NeRF | 分割掩码 (Seg) | 0.031 | 0.30 | 113.5 | 44.7 |
| 3DGS | Gaussian Grouping | 分割掩码 (Seg) | 0.037 | 0.26 | 132.5 | 44.9 |
| 3DGS | 3DGIC | 分割掩码 (Seg) | 0.028 | 0.26 | 96.3 | 36.4 |
| 3DGS | GScream | 分割掩码 (Seg) | 0.032 | 0.26 | 86.1 | 31.2 |
| 3DGS | Ours (CoIn) | 分割掩码 (Seg) | 0.032 | 0.23 | 80.4 | 28.9 |
| 3DGS | 3DGIC | 包围盒 (BB mask) | 0.047 | 0.38 | 168.0 | 104.1 |
| 3DGS | GScream | 包围盒 (BB mask) | 0.043 | 0.29 | 104.6 | 34.2 |
| 3DGS | Ours (CoIn) | 包围盒 (BB mask) | 0.033 | 0.24 | 95.1 | 26.6 |
表 2:IMFine 数据集上的定量评估对比(原论文 Table 2)
| 方法 | LPIPS (↓) | PSNR (↑) | FID (↓) |
|---|---|---|---|
| 3DGIC | 0.3386 | 20.29 | 200.99 |
| GScream | 0.2000 | 22.68 | 112.91 |
| IMFine | 0.1747 | 23.59 | 57.53 |
| Ours (CoIn) | 0.1685 | 23.88 | 53.37 |
表 3:物体插入任务的定量评估与用户偏好调查(原论文 Table 3)
| 方法 | CLIPdir (↑) | 视角一致性投票 (%) | 视觉质量投票 (%) | 文本对齐度投票 (%) | 无伪影比例投票 (%) |
|---|---|---|---|---|---|
| Gaussian Editor | 0.0222 | 20.825 | 23.625 | 13.900 | 17.000 |
| Infusion | 0.1589 | 31.950 | 31.950 | 26.975 | 30.550 |
| Ours (CoIn) | 0.1628 | 47.225 | 44.425 | 59.125 | 45.400 |
消融实验¶
在 SPIn-NeRF 数据集上系统性评估了 Ref-GS(包括独立去除自适应加权与特征注意力)、CLG 以及 TE-D 模块的贡献。
表 4:SPIn-NeRF 上的关键模块消融实验(原论文 Table 4)
| 配置 | m-LPIPS (↓) | LPIPS (↓) | m-FID (↓) | FID (↓) | 说明 |
|---|---|---|---|---|---|
| w/o Ref-GS | 0.0359 | 0.2534 | 87.05 | 30.47 | 去除参考自适应粗建图 |
| w/o Adaptive Weight | 0.0356 | 0.2571 | 82.07 | 30.76 | 去除视角自适应损失权重 |
| w/o Feature Attention | 0.0355 | 0.2559 | 88.15 | 31.78 | 去除锚点单向特征注意力 |
| w/o CLG | 0.0428 | 0.3057 | 97.04 | 36.47 | 去除一致性损失引导,2D 出现抖动伪影 |
| w/o TE-D | 0.0535 | 0.2902 | 132.55 | 39.31 | 去除判别器,纹理严重过度平滑 |
| Full model (Ours) | 0.0317 | 0.2349 | 80.44 | 28.92 | 完整模型各项指标最优 |
关键发现¶
- 掩码形状鲁棒性极高:在表 1 中,从精确分割掩码切换至粗糙包围盒(BB mask)时,3DGIC 的 FID 指标暴跌(从 36.4 恶化到 104.1),GScream 的 m-FID 也从 86.1 恶化至 104.6;而 CoIn 的 FID 保持在 26.6(全图)和 95.1(掩码区域),证明 2D 优先管线彻底摆脱了传统 3DGS 剪枝方案对跨视角像素级掩码的依赖。
- TE-D 是恢复真实感与抑制模糊的关键:消融实验(表 4)中,去除 TE-D 导致 m-FID 从 80.44 骤升至 132.55(恶化超 64%),说明虽然 CLG 建立了正确的几何对应,但缺乏局部高频对抗训练会导致严重的过平滑退化。
- CLG 决定多视角几何一致性:去除 CLG 引导后,LPIPS 出现最剧烈的劣化(从 0.2349 恶化至 0.3057),深度图对比也表明 unguided 扩散图优化出的 3DGS 几何深度结构高度不稳定,充斥浮动伪影。
亮点与洞察¶
- 半程插值虚拟视角特征翘曲:在 CLG 中,将参考视角与当前视角同时重投影至两相机位姿插值得到的半程虚拟视角 \(\phi\),极大地缓解了两大真实视角间大视差引起的局部拉伸形变,使高维 DINO 语义特征与 RGB 颜色特征的对齐更加平滑可靠。
- PatchGAN 局域判别器仅转移纹理统计:巧妙地将不一致但细节锐利的初始 2D 补全图作为判别器的 Real 样本,限定在 \(64 \times 64\) patch 尺度对抗,实现了高频纹理风格迁移与大尺度 3D 几何一致性的解耦。
- 真正统一物体移除与插入:打破了 3DGS Inpainting 领域依赖「3D 剪枝」导致无法插入物体的宿命,用户只需给出粗糙框与文本提示,即可端到端完成几何与纹理自洽的全新物体无缝合成。
局限与展望¶
- 依赖单基准参考视角选择:目前管线依赖人工或启发式选定单一高质量参考视角 \(\hat{I}_k\)。若全景视角范围跨越 360°,背向视角的遮挡区域与基准视角无重叠点云支撑,引导效果会发生衰减(需如补充材料中拓展至多基准参考)。
- 多阶段流程的计算时间开销:全流程涉及初始扩散生成、粗建图、扩散去噪能量引导及对抗精修,单场景耗时约 2.5 小时,虽然相较 NeRF 动辄数小时的优化有所改进,但距离交互式实时场景编辑仍有提速空间。
- 极端几何变形下的点云投影漂移:在复杂薄结构或剧烈凹凸表面,由单目深度辅助生成的粗点云 \(P_k\) 可能存在投影残差,影响虚拟视点特征翘曲的精确度。
相关工作与启发¶
- vs 3DGIC / IMFine: 3DGIC 与 IMFine 是典型的「3D-first」剪枝代表,先删去 3D 高斯再靠几何平滑补全,在掩码不一致或使用包围盒时易过度删除非目标背景,且无法处理物体插入;CoIn 采用「2D-first」与双向引导,对粗糙掩码天然免疫,同时完美支持物体增删。
- vs GScream: GScream 同样基于 3DGS 且仅做单视角参考引导,但在大视角变化下缺乏跨视角的显式几何约束与能量去噪对齐,在新视角下易出现内容错位;CoIn 引入插值视角的特征翘曲能量引导(CLG),多视角空间一致性显著增强。
- vs Infusion / Gaussian Editor: 后者主要通过扩散分数蒸馏或微调来处理 3D 编辑,常出现过度饱和、几何扭曲或伪影;CoIn 通过结合局部纹理对抗与显式一致性几何损失,在物体插入任务上取得了更优的真实感与文本对齐度。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ (打破 3D-first 剪枝局限,巧妙通过插值视角特征翘曲与局部 Patch 对抗打通 2D 扩散与 3DGS 的双向闭环)
- 实验充分度: ⭐⭐⭐⭐⭐ (覆盖 SPIn-NeRF 与 IMFine 基准、对比多种掩码形式、包含全量消融、深度图验证、物体插入与用户双盲调研)
- 写作质量: ⭐⭐⭐⭐⭐ (结构清晰严谨,公式与动机交融,问题定义精准)
- 价值: ⭐⭐⭐⭐☆ (为 3DGS 场景编辑提供了摆脱像素级精准 2D 掩码依赖的通用解决方案,极大扩展了 3D 补全的应用边界)