GaINeR: Geometry-Aware Implicit Neural Representation for Image Editing¶
会议: ECCV 2026
论文: ECCV 原文
领域: 图像生成
关键词: 隐式神经表示 / 图像编辑 / 高斯嵌入 / 物理仿真 / 单图3D提升
一句话总结¶
GaINeR 将可训练的高斯嵌入引入隐式神经表示(INR)框架,利用局部半径受限的 KNN 距离加权聚合高斯特征来驱动 MLP 解码器,在刷新 2D 图像超高保真重建 SOTA 的同时,实现了具备物理与几何一致性的图像变形、超分辨率与单图 3D 提升。
研究背景与动机¶
隐式神经表示(INR)将图像建模为由神经网络参数化的连续坐标映射函数,摆脱了离散像素网格的分辨率限制,具备分辨率无关、内存紧凑以及亚像素级连续插值的优势。以 SIREN、WIRE、FINER 等为代表的高频激活网络相继提升了 INR 对复杂高频纹理的拟合能力。然而,经典 INR 采用全局坐标映射,网络内部缺乏显式的局部几何拓扑结构,导致用户无法对图像进行直观的局部形变编辑,更难以与基于粒子的物理仿真引擎(如连续介质力学模拟)实现直接耦合。
与此同时,以 3D Gaussian Splatting(3DGS)及 2D GaussianImage、MiRaGe 为代表的显式高斯图元方法凭借离散高斯椭球的可操纵性,赋予了图像交互编辑与物理模拟的能力。但这类显式方法的致命短板在于渲染机制高度离散,基元直接绑定不透明度与颜色属性。当物理引擎对图像对象施加弯曲、拉伸或断裂等大幅度几何形变时,离散高斯基元之间会产生明显的孔洞、锯齿边界和伪影;若依靠密集微小高斯图元弥合,则会急剧增加调参难度与显存负担,且本质上无法提供真正的空间连续性。
本文的切入点在于打破“显式图元即渲染器”的固有思维,将显式可控的几何基元与连续隐式解码器深度协同:让高斯椭球专职充当几何先验与特征载体,而让坐标神经解码器专职合成连续逼真的像素颜色。核心 idea:提出几何感知隐式神经表示 GaINeR,通过在连续图像平面上部署一组可训练的高斯分布并抽取多分辨率哈希特征,以半径受限的 KNN 高斯距离加权聚合邻域嵌入驱动 MLP 解码器,使图像既拥有极高保真的连续表征,又能通过直接变换高斯中心实现平滑、抗伪影的几何编辑与单图 3D 提升。
方法详解¶
整体框架¶
GaINeR 的核心架构由可训练的高斯嵌入集合、半径受限局部邻域聚合模块以及坐标解码 MLP 构成。对于输入图像,模型在连续空间中优化一组包含均值中心、协方差矩阵和特征向量的高斯分布基元。给定任意连续查询坐标,模型首先检索局部邻域内最近邻的高斯基元,利用高斯概率密度计算加权几何嵌入,随后送入紧凑的 MLP 解码器预测对应位置的 RGB 颜色(或用于 3D 渲染的体密度)。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["连续查询坐标 x ∈ ℝ²"] --> B["高斯几何嵌入与多分辨率哈希编码<br/>可优化高斯基元分布 G = {N(μ_i, Σ_i, e_i)}"]
B --> C["局部几何感知聚合<br/>半径受限 KNN 搜索与高斯距离加权插值"]
C --> D["连续坐标解码与物理/空间编辑映射<br/>MLP 解码生成目标 RGB (或 3D 辐射场 c, σ)"]
D --> E["连续图像重建 / 任意倍率超分 / 物理形变 / 3D 新视角"]
关键设计¶
1. 高斯几何嵌入与多分辨率哈希编码:解耦几何可操纵性与色彩解码 传统 INR 直接将原始绝对空间坐标作为 MLP 的输入,缺乏显式的空间几何载体。GaINeR 引入了一组包含 \(N\) 个成分的可学习高斯分布集合 \(\mathcal{G} = \{ (\mathcal{N}_i(\boldsymbol{\mu}_i, \boldsymbol{\Sigma}_i), \mathbf{e}_i) \}_{i=1}^N\),其中 \(\boldsymbol{\mu}_i \in \mathbb{R}^2\) 为高斯中心位置,\(\boldsymbol{\Sigma}_i \in \mathbb{R}^{2\times 2}\) 为协方差矩阵,\(\mathbf{e}_i \in \mathbb{R}^d\) 为特征嵌入向量。为了赋予高斯嵌入捕捉多尺度空间细节的能力,训练阶段的高斯特征通过多分辨率哈希网格进行初始化与约束:\(\mathbf{e}_i = \mathcal{H}(\boldsymbol{\mu}_i)\)。在推理阶段,哈希编码器被完全卸载,仅保留优化好的高斯参数集合 \(\mathcal{G}\)。这种设计让高斯图元专职表达局部的几何位姿与拓扑联系,避免了显式高斯图元直接存储离散颜色所带来的色彩不连续性。
2. 局部几何感知聚合:半径受限 KNN 与高斯核加权插值 为了从离散的高斯基元中构建连续平滑的特征场,对于任意查询坐标 \(\mathbf{x} \in \mathbb{R}^2\),GaINeR 采用局部半径受限的 \(K\) 近邻(KNN)搜索定位邻域高斯,限制搜索半径 \(r\) 以确保计算效率与局部性。邻域内各个高斯基元所贡献的特征向量根据其对应的高斯概率密度函数进行加权归一化: $$ \mathbf{e}{\mathrm{KNN}}(\mathbf{x}, \mathcal{G}) = \frac{\sum}(\mathbf{x}, \mathcal{G})} \mathcal{Ni(\mathbf{x}; \boldsymbol{\mu}_i, \boldsymbol{\Sigma}_i) \, \mathbf{e}_i}{\sum $$ 该加权嵌入不仅精确编码了查询点与周边高斯中心的欧氏几何邻近度,还融合了各高斯椭球的各向异性展宽与密度分布。由此产生的特征场具备连续微积分性质,消除了离散图元在边界处常见的跳变。}(\mathbf{x}, \mathcal{G})} \mathcal{N}_i(\mathbf{x}; \boldsymbol{\mu}_i, \boldsymbol{\Sigma}_i)
3. 连续坐标解码与物理/空间编辑映射:空间等变性驱动无伪影形变 聚合得到的特征嵌入 \(\mathbf{e}_{\mathrm{KNN}}(\mathbf{x})\) 被送入多层感知机解码器 \(f_\theta\) 计算最终的颜色输出:\(\mathbf{c} = \mathrm{MLP}_\theta(\mathbf{e}_{\mathrm{KNN}}(\mathbf{x}))\)。至关重要的是,解码器仅以局部的相对聚合嵌入为输入,而不直接依赖全局绝对坐标。这一特性赋予了模型良好的空间等变性:当用户通过平移、旋转、拉伸或弯曲调整高斯中心 \(\boldsymbol{\mu}_i \mapsto \boldsymbol{\mu}_i'\) 时,局部的相对拓扑与插值特征平滑变化,解码器能自适应合成连贯自然的纹理过渡,完全避免了断裂或透明孔洞。在对接物理引擎(如 Taichi Elements 物质点法 MPM)时,每个高斯中心均可直接作为物理质点参与弹塑性力学或流体模拟。
4. 单图 2D-to-3D 几何提升与体渲染:维度无关的辐射场扩展 GaINeR 的表征机制本质上具备维度通用性。通过结合现成单目深度估计网络(Depth-Pro)和实例分割(SAM),模型将 2D 高斯中心沿视线投射到 3D 空间,将邻域搜索扩展为基于马氏距离(Mahalanobis distance)的 3D KNN 聚合,同时将 MLP 解码器的输出维度扩展为预测颜色 \(\mathbf{c}\) 与体密度 \(\sigma\):\(f_\theta(\mathbf{x}) = (\mathbf{c}, \sigma)\)。沿相机光线进行经典的体渲染积分: $$ \hat{\mathbf{C}}(\mathbf{r}) = \int_{t_n}^{t_f} T(t)\,\sigma(\mathbf{r}(t))\,\mathbf{c}(\mathbf{r}(t))\,dt, \quad T(t) = \exp\left(-\int_{t_n}^t \sigma(\mathbf{r}(s))\,ds\right) $$ 由于连续神经网络解码器天然具备几何插值平滑能力,即便单目点云重投影存在稀疏空洞,GaINeR 也能合成连续无瑕疵的新视角图像,并支持在 3D 空间内进行直接的深度感知几何修改。
损失函数 / 训练策略¶
模型联合优化高斯基元参数 \(\{(\boldsymbol{\Sigma}_i, \mathbf{e}_i)\}_{i=1}^N\)、多分辨率哈希编码器 \(\mathcal{H}\) 以及解码器参数 \(\theta\)。优化目标采用 Smooth L1 损失函数以兼顾误差平滑性与高频保真度: $$ \mathcal{L}{\mathrm{rec}} = \frac{1}{M}\sum_j\right) $$ 其中残差 }^M \mathrm{SmoothL1}\left(f_\theta(\mathbf{x}_j) - \mathbf{c\(\mathbf{r} = f_\theta(\mathbf{x}_j) - \mathbf{c}_j\),阈值参数 \(\beta\) 控制 \(\ell_1\) 与 \(\ell_2\) 范数的平滑过渡。对于包含 Alpha 透明通道的 RGBA 图像,GaINeR 引入基于 Alpha 掩码的空间采样策略,仅对非零可见区域像素进行反向传播采样;同时并行训练一个轻量级的掩码生成模型,在后续动画形变与编辑中保持前景遮罩的同步一致更新。
实验关键数据¶
主实验¶
在经典图像重建基准 Kodak(24 张自然图像)和 DIV2K 验证集(100 张高分辨率图像,2倍双三次下采样)上,GaINeR 与主流神经隐式表示模型(WIRE、SIREN、I-NGP、NeuRBF)以及显式高斯表示(3DGS、GaussianImage、MiRaGe)进行了全面定量对比。
| 方法 | 模型范式 | Kodak PSNR (dB) ↑ | Kodak MS-SSIM ↑ | DIV2K PSNR (dB) ↑ | DIV2K MS-SSIM ↑ |
|---|---|---|---|---|---|
| WIRE (CVPR 2023) | 连续 INR (小波) | 41.47 | 0.9939 | 35.64 | 0.9511 |
| SIREN (NeurIPS 2020) | 连续 INR (周期正弦) | 40.83 | 0.9960 | 36.02 | 0.9568 |
| I-NGP (SIGGRAPH 2022) | 混合 INR (哈希网格) | 43.88 | 0.9976 | 37.06 | 0.9894 |
| NeuRBF (2023) | 连续 INR (径向基) | 43.78 | 0.9984 | 37.06 | 0.9901 |
| 3DGS (SIGGRAPH 2023) | 显式高斯图元 | 44.09 | 0.9991 | 39.12 | 0.9980 |
| GaussianImage (ECCV 2024) | 显式 2D 高斯 | 38.93 | 0.9984 | 41.48 | 0.9981 |
| MiRaGe (ICML 2025) | 显式 2D 高斯可编辑 | 59.52 | 0.9999 | 54.54 | 0.9998 |
| GaINeR (本文) | 高斯引导隐式神经表示 | 77.09 | 0.9999 | 62.20 | 0.9999 |
消融实验¶
为在严格对齐的实验条件下考察高斯表征的本质效能,作者在统一的训练设置下进行了对比测试:所有高斯模型均固定初始化为 500k 个高斯基元,训练全程不执行分裂增密或剪枝,均优化 30k 迭代步。
| 配置 / 对比模型 | 高斯基元数 | Kodak PSNR (dB) ↑ | Kodak MS-SSIM ↑ | DIV2K PSNR (dB) ↑ | DIV2K MS-SSIM ↑ | 说明 |
|---|---|---|---|---|---|---|
| GaussianImage | 500k 固定 | 30.46 | 0.9635 | 28.58 | 0.9565 | 无神经解码器,直接渲染 |
| MiRaGe | 500k 固定 | 62.49 | 0.9999 | 58.45 | 0.9999 | 显式 2D 高斯直接混合 |
| GaINeR (完整模型) | 500k 固定 | 77.09 | 0.9999 | 62.20 | 0.9999 | 高斯几何特征 + MLP 连续解码 |
此外,在单图像 3D 新视角合成(NVS)基准测试中,使用真实深度与单目 Depth-Pro 深度时,GaINeR 显著超越显式点云重投影(EPC)基准: - Hotdog 场景(GT 深度下):EPC 为 8.57 dB,GaINeR 达到 20.58 dB(SSIM 0.874,LPIPS 0.186);Depth-Pro 深度下 GaINeR 达到 19.50 dB。 - Scan 114 场景(GT 深度下):EPC 为 13.51 dB,GaINeR 达到 18.09 dB(SSIM 0.724,LPIPS 0.237);Depth-Pro 深度下达到 17.74 dB。 - 在 DIV2K \(\times 8\) 超分辨率重建中,GaINeR 获得 23.22 dB PSNR,大幅领先 3DGS(17.33 dB)和 MiRaGe(16.61 dB)。
关键发现¶
- 几何与解码解耦带来质的飞跃:GaINeR 相比前序最强高斯图像模型 MiRaGe,在 Kodak 和 DIV2K 上分别暴涨 17.57 dB 和 7.66 dB。误差图分析表明,GaINeR 的像素级绝对重构误差接近于零,彻底消除了显式高斯叠加造成的局部微小色块偏差。
- 大形变物理仿真稳定性:在物质点法(MPM)弹塑性沙粒崩溃和流体动力学模拟中,MiRaGe 在大形变下拉扯出大量刺状尖角边界和非自然半透明孔洞,而 GaINeR 通过连续 MLP 解码器的隐式插值能力,维持了高频纹理的完整平滑性,MUSIQ 达到 62.62(优于 MiRaGe 的 61.03),CLIPIQA 达到 0.530。
- 超分辨率抗伪影能力:在 \(\times 8\)、\(\times 10\)、\(\times 12\) 极端上采样下,显式高斯方法会暴露出明显的椭圆色块,而 GaINeR 依赖连续隐式神经场表征,无需微调重新训练即可直接在任意亚像素网格上合成锐利细节。
亮点与洞察¶
- “显式几何做支架、隐式网络做着色”的双赢设计:显式图元擅长空间变换和物理模拟,隐式网络擅长高保真连续色彩插值。GaINeR 不用高斯做渲染,而是将高斯作为动态空间特征索引器,彻底解决了传统 INR 无法编辑与高斯模型形变伪影的两难困境。
- 零代价推断加速与哈希解耦:训练阶段采用多分辨率哈希网格为每个高斯赋能丰富的多尺度表征,而在推断编辑阶段完全移除哈希网格,直接操作固化的高斯特征,兼顾了快速收敛与轻量推断。
- 2D 与 3D 表达范式的自然统一:该方案的数学形式与维度解耦,只需将 2D 欧氏 KNN 替换为 3D 马氏距离,并将输出拓展为密度与颜色,即可平滑衔接到 NeRF 体渲染管线,为基于单图的 3D 生成与交互编辑提供了通用底层范式。
局限与展望¶
- 3D 提升严重依赖单目深度质量:论文明确承认,当使用 Depth-Pro 等单目深度模型时,由于遮挡区域和推断深度的固有误差,可能在复杂场景边缘产生几何扭曲与纹理拉伸。
- KNN 动态检索的计算开销:在图像极大或高斯图元规模上升至数百万时,推断阶段动态进行半径受限的最近邻搜索会显著拖慢连续光栅化/采样的吞吐速率,需要更优化的 GPU 空间索引数据结构。
- 单向形变缺乏语义自愈:当进行大幅度撕裂或强行拉伸时,若局部高斯被过度稀疏化,虽然连续网络能做平滑插值,但无法自主“凭空生成”被遮挡处从未见过的语义结构(如物体背面)。
相关工作与启发¶
- vs SIREN / WIRE / FINER 等经典 INR:经典方法完全依赖全局坐标多层感知机及特定激活函数,模型整体缺乏显式局部几何结构,无法进行局部物体的拖拽和物理形变;GaINeR 引入具象高斯分布作为局部中介,实现了精准可控的交互式形变。
- vs GaussianImage / MiRaGe 等 2D 高斯显式渲染:MiRaGe 直接将高斯用于 Alpha 混合光栅化,拉伸形变时离散图元间隙产生严重空洞与条纹伪影;GaINeR 将高斯降阶为特征载体,由连续 MLP 解码输出色彩,杜绝了离散拼接缺陷。
- vs 3DGS / NeRF:GaINeR 搭建了单张图像 2D 连续表征到 3D 辐射场的无缝过渡桥梁,避免了传统显式点云重投影造成的空洞飞点,为跨维度神经场建模提供了统一数学视角。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次成功融合可训练高斯显式空间结构与连续隐式神经解码器,兼具两派所长。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖超高精度图像重建、多样物理形变模拟、单图 3D 提升以及极高倍率超分辨,证据详实。
- 写作质量: ⭐⭐⭐⭐⭐ 动机清晰,数学表述严密优雅,对比图示直观有力。
- 价值: ⭐⭐⭐⭐⭐ 为图像编辑、可微神经渲染和物理模拟的交叉结合开辟了极具前景的实用新范式。