InstGS: Shared-Template Gaussian Instancing for Object-Redundancy-Free Rendering¶
会议: ECCV 2026
论文: CVF Open Access
代码: https://github.com/Strange-tech/InstGS
领域: 3D 视觉
关键词: 3D高斯泼溅, 实例化渲染, 共享模板, 显存压缩, 实时渲染
一句话总结¶
InstGS 首次将图形学实例化渲染机制引入 3D 高斯泼溅,通过梯度驱动的跨视点实例分割构建共享高斯几何模板,结合可学习的逐实例位置、颜色与不透明度轻量偏移及可微光栅化器,在几乎不损失保真度的前提下大幅消除重复物体的显存冗余并显著提升渲染帧率。
研究背景与动机¶
神经辐射场(NeRF)与 3D 高斯泼溅(3DGS)作为新视角合成的代表性技术,已经能够从多视角图像中重构出高质量的照片级真实感场景。其中 3DGS 凭借显式的三维高斯图元及基于 CUDA 的拼贴光栅化管线,摆脱了 NeRF 像素级神经网络采样的沉重计算负担,成功实现了实时交互渲染。然而,当 3DGS 应用于包含大量重复性结构的复杂或大规模场景(如城市街景中的成片建筑物、会议厅内密集的桌椅等)时,每个高斯图元均被视作完全独立的实体进行显式参数化与存储,图元总数急剧膨胀,带来极其沉重的显存开销与带宽吞吐压力。
现有加速与压缩工作大多聚焦于图元修剪、量化编码或层次化视锥 LOD 组织。这类方案虽然能在一定程度上缩减单物体的高斯数量,但依然停留在“将空间中每个重复图元逐一单独表达”的范畴,且往往需要在渲染前完整解压,无法根本性解决结构级冗余,运行时内存和显存瓶颈依然未解。另一方面,近年涌现的实例级或模块化 3DGS 方法(如 Splat-and-Replace、Proc-GS)尝试通过复制同一高斯簇来拼装场景,但它们主要依赖 CPU 端硬拷贝,不仅无法适配同类实例之间微小的光照、纹理及几何形态差异,更缺乏 GPU 底层的可微实例化光栅化管线支持。
面对这一核心矛盾,本文跳出孤立优化图元的旧框架,从经典计算机图形学的“实例化渲染”(Instancing)思想中汲取灵感:现实场景中的重复物体往往共享底层几何骨架,差异仅体现在微小的局部形变、涂装或透明度上。核心 idea:将多实例的高斯表示解耦为“全局共享的基础模板”与“逐实例可学习的轻量偏移量”,并设计端到端可微的 GPU 实例化光栅化算子,实现显存极度紧凑且支持实例间差异化渲染的高帧率重构。
方法详解¶
整体框架¶
InstGS 的输入为一个预训练的初始 3DGS 场景表示。整个流程划分为两个核心阶段:首先是模板初始化,利用开词表 2D 目标检测与跨帧一致分割,从多视角中提取相似实例并计算梯度反向追踪对应的 3D 高斯集合,随后通过粗精两级配准融合成统一的共享高斯模板;其次是可微实例化光栅化与联合优化,在 GPU 端为每个实例传入变换矩阵及位置、基色、不透明度的微小偏移,在 CUDA kernel 内部将模板即时映射并渲染为目标视角,同时基于反向传播链式法则联合更新共享模板与各个实例偏移。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入: 预训练 3DGS 场景"] --> B["梯度驱动实例分割<br/>2D 掩码反推 3D 贡献图元"]
B --> C["两级配准融合建模<br/>FPFH-ICP 对齐并重采样"]
C --> D["模板-轻量偏移解耦<br/>共享几何与外观变异分离"]
D --> E["GPU 实例化光栅化与联合优化<br/>CUDA Kernel 动态映射与梯度回传"]
E --> F["输出: 紧凑且高质量的渲染结果"]
关键设计¶
1. 梯度驱动的跨视点高斯实例分割:无额外训练开销的精准图元捕获 针对现有 3D 语义高斯分割方法依赖对比学习特征场导致显存激增、耗时过长,且容易受跨视点遮挡与光照变异干扰的问题,本文提出无需额外模型训练的梯度驱动分割策略。首先通过 Grounding DINO 结合文本提示检测目标实例边界框,由 SAM 生成精细分割掩码,并借助多视角一致性聚类滤除跨帧噪点,获得一致性掩码 \(M^k \in \{0, 1\}^{H \times W}\)。随后,利用 3DGS 像素透射率与不透明度乘积在掩码区域内的反向误差梯度特性,构建掩码 MSE 激活损失。为抑制大尺度背景高斯对边缘像素的误穿透,引入带加权背景剔除的梯度计算: $\(\mathbf{g} = \sum_{\mathbf{v}^k \in \mathcal{V}} \left( \nabla \mathcal{L}_{\text{GSeg}}(\mathbf{v}^k, M^k) - \alpha \nabla \mathcal{L}_{\text{GSeg}}(\mathbf{v}^k, 1 - M^k) \right)\)$ 其中加权系数 \(\alpha\) 设定为 \(0.8\),确保实例外部但当前视点未覆盖到的边缘高斯梯度仍然保持正向。最终梯度为正的图元归类为实例高斯,梯度为负的划入背景高斯,实现了快速且无伪影的 3D 实例解耦。
2. 两级点云配准融合:构建结构完备的归一化共享几何模板 在提取出同一类别的多个高斯实例点云后,需要将其对齐为统一规范空间的基准模板。本文固定第一项实例为基准坐标系,对其余实例采用两阶段配准算法:首先利用快速点特征直方图(FPFH)进行全局粗配准,快速搜索初始刚体变换;接着使用点对点迭代最近点(ICP)算法进行精细几何收敛,求解出各实例相对于模板的精确 \(4 \times 4\) 空间刚体变换矩阵 \(T_k = [R_k \mid t_k]\)。在将全部实例对齐至规范空间后,执行合并与重采样操作,重采样图元总数取所有实例图元规模的平均值。此时仅保留点位坐标和球谐系数的第 0 阶基色(Base Color),其余尺度、旋转与高阶不透明度参数重新初始化,避免个别实例的局部形变带偏共享模板。
3. 模板与轻量偏移解耦表达:兼顾极致紧凑与外观形变适应度 如果对高斯的全部参数(位置、协方差、高阶球谐)均维护逐实例偏移,其参数量将与独立存储毫无二致;而若完全不允许偏移,则无法表达同类物体的真实差异(如赛车表面完全不同的彩绘图层、微小结构间隙)。经过理论约束与消融论证,InstGS 将轻量偏移限定在三个关键属性上:位置偏移 \(\Delta p_i^k\)、基色偏移 \(\Delta c_i^k\)(对应球谐系数 \(c^{\{0,0\}}\))以及不透明度偏移 \(\Delta o_i^k\)。其中,\(\Delta p\) 负责拉合微小几何形变;\(\Delta c\) 吸收光照漫反射与涂装差异;\(\Delta o\) 则具备重要修剪功能——将模板中某实例不存在的局部结构设为全透明以消除重影。初始位置偏移直接设为实例与模板在初始阶段的差值,从而在有限训练步数内迅速消除模糊雾状噪点。
4. 硬件级异构实例化光栅化器与反向传播:端到端 GPU 联合训练 为了实现真正的运行时加速,本文定制了专门的 CUDA 可微实例化光栅化管线。数据在主机侧仅常驻一份模板和各实例的紧凑偏移表。在 GPU 渲染时,每个 CUDA 线程负责处理一个高斯点,依照下式完成即时空间投影与属性叠加: $\(g_i^k = T_k(g_i) + \Delta_i^k\)$ 变换 \(T_k\) 仅作用于中心点坐标与四元数旋转矩阵,偏移量 \(\Delta_i^k\) 采用元素级加法叠加。在反向传播过程中,根据渲染图像的 \(L_1\) 与 D-SSIM 复合损失,CUDA 线程根据链式法则回传梯度:实例偏移梯度由其所在线程直接累加,而共享模板的梯度则通过正交旋转矩阵雅可比项映射回模板空间并跨实例求和: $\(\frac{\partial \mathcal{L}}{\partial \mathbf{g}_i} = \sum_{k} J_k^\top \frac{\partial \mathcal{L}}{\partial \mathbf{g}_i^k}\)$ 从而保证了模板与实例个性化参数在全局几何和多视点监督下的联合平滑收敛。
实验关键数据¶
主实验¶
论文在涵盖 20+ 个场景的自建 ReScene 数据集(包含合成场景与低空无人机拍摄的真实场景)上进行了系统评测,并与包括 NeRF(InstantNGP)、显式 3DGS、层次化 3DGS(3DGS*)、模块化替换方案(Splat&Replace)、网格压缩(SOG)、紧凑树状结构(OctreeGS)以及紧凑 3DGS(CompactGS)在内的代表性方案进行了全面对比。
| 数据集 | 指标 | 3DGS(原始基线) | CompactGS(紧凑基线) | Ours(InstGS) | 性能增益 / 优势 |
|---|---|---|---|---|---|
| Synthetic | PSNR (dB) ↑ | 34.9 | 34.8 | 35.2 | 达到并微超原始 3DGS (+0.3 dB) |
| Synthetic | SSIM ↑ | 0.985 | 0.982 | 0.983 | 保持极高结构相似度 |
| Synthetic | LPIPS ↓ | 0.026 | 0.028 | 0.026 | 感知质量与 3DGS 持平 |
| Synthetic | CPU 显存/内存 ↓ | 198.4 MB | 23.9 MB | 20.4 MB | 内存降低 89.7% (近 10x 压缩) |
| Synthetic | 渲染 FPS ↑ | 117 | 196 | 204 | 帧率提升 74.4% |
| Real | PSNR (dB) ↑ | 27.4 | 26.9 | 27.8 | 超过所有对比基准 (+0.4 dB vs 3DGS) |
| Real | SSIM ↑ | 0.912 | 0.906 | 0.913 | 优于原版 3DGS |
| Real | LPIPS ↓ | 0.089 | 0.101 | 0.089 | 纹理保真度保持最优 |
| Real | CPU 显存/内存 ↓ | 312.7 MB | 42.3 MB | 37.9 MB | 内存降低 87.9% |
| Real | 渲染 FPS ↑ | 98 | 113 | 128 | 帧率提升 30.6% |
在 8 辆不同涂装方程式赛车的特写场景(Teaser,原论文 Table 2)中,InstGS 在渲染质量(PSNR 35.12 dB vs 3DGS 35.18 dB)几乎一致的情况下,内存仅占用 41.24 MB(3DGS 为 200.51 MB,Splat&Replace 为 216.89 MB),渲染速度达到 201 FPS(3DGS 为 115 FPS),且仅需在预训练基础上微调 3分11秒。
消融实验¶
论文针对模板构建方式、偏移量类型组合及位置偏移初始化在合成/真实场景中进行了细致的消融评测(原论文 Figure 5)。
| 模板初始化策略 | 偏移量配置组合 | PSNR (dB) | SSIM | 配置说明 |
|---|---|---|---|---|
| Max 实例直接取用 | \(\Delta c_{\{l,m\}}\) (全阶球谐) | 17.9 | 0.767 | 缺少几何与透明度调节,表现较差 |
| Max 实例直接取用 | \(\Delta c_{\{l,m\}} + \Delta o + \Delta p\) | 20.4 | 0.885 | 补齐偏移但模板几何代表性不足 |
| Merge 配准融合 (Ours) | \(\Delta c_{\{l,m\}}\) (全阶球谐) | 18.5 | 0.803 | 融合模板奠定良好基础 |
| Merge 配准融合 (Ours) | \(\Delta c_{\{l,m\}} + \Delta o\) | 21.5 | 0.909 | 引入透明度大幅压制重影伪影 |
| Merge 配准融合 (Ours) | \(\Delta c_{\{l,m\}} + \Delta o + \Delta p\) | 21.7 | 0.916 | 引入位置偏移修正几何对齐 |
| Merge 配准融合 (Ours) | \(\Delta c_{\{l,m\}} + \Delta o + \Delta p + \Delta \text{cov}\) | 22.0 | 0.922 | 增加协方差偏移,画质提升极微但数据量陡增 |
| Merge 配准融合 (Ours) | \(\Delta c_{\{0,0\}} + \Delta o + \Delta p\) (最终方案) | 21.6 | 0.913 | 仅保留基色偏移,数据量大幅压缩且画质几乎无损 |
关键发现¶
- 基色偏移搭配不透明度是消除冗余的关键:仅优化全阶球谐系数无法拟合几何变异;引入 \(\Delta p\) 和 \(\Delta o\) 可使 PSNR 跃升 3.1 dB 以上。而将高阶球谐偏移精简至仅含第 0 阶基色 \(\Delta c_{\{0,0\}}\) 时,PSNR 仅微跌 0.1 dB,但极大节省了内存开销。
- 协方差偏移得不偿失:若为每个高斯引入协方差偏移(\(\Delta \text{cov}\)),参数膨胀严重,且容易在实例间发生过拟合形变,违背实例化共享设计的初衷。
- 差值初始化消除漂浮伪影:将初始位置偏移 \(\Delta p\) 设为对齐后的实例点与模板点的真实空间差值,可在前 1000 次迭代内迅速收敛,彻底根除从零初始化带来的半透明雾状伪影。
亮点与洞察¶
- 将经典图形学 Instancing 算子无缝植入 3DGS 渲染内核:打破了过去神经辐射场或高斯渲染中“无论多重复都要逐一渲染、逐一存取”的惯性,利用 GPU 端线程动态重定向技术,真正实现了常驻数据极小化与光栅化高吞吐。
- 负梯度权重的背景分离设计简单有效:无需训练庞大的 3D 特征场或耗时的三维分割网络,利用现成的 2D 基础模型反推 3DGS 的渲染链式梯度,并通过设置负梯度权重优雅地剔除了穿透性强的大尺寸背景高斯。
- 架构具备强大的多品类与跨外观泛化能力:算法不仅支持单一物体的密集排布,还支持多类别复合模板管理(如同时管理桌、椅、花瓶模板),并能在几何相似但涂装迥异(如多款 F1 赛车)的苛刻条件下维持极高保真度。
局限与展望¶
- 高度依赖场景的重复性与类别先验:该方法专为包含显著重复性物体的场景设计,收益与场景内物体的重复频率和占比正相关;对于无重复结构的完全异构通用场景,框架无法发挥出实例化压缩优势。
- 无法兼容拓扑差异过大的极端几何:对于拓扑结构完全不一致的极端物体(如论文图 10 中将卡车和火车强行融合成单个模板),不透明度偏移无法完全使缺失区域隐形,会导致明显的重影与黑边伪影。
- 未来方向:作者指出可将该框架推广到大规模场景交互与三维内容创作(Editable 3D)中,用户只需编辑或驱动单个高斯模板,即可实时级联更新场景中的成百上千个物体实例。
相关工作与启发¶
- vs Splat-and-Replace: 后者同样探索了重复物体的替换,但其主要在 CPU 端做相同高斯簇的硬拷贝,无法处理多实例间外观、纹理与几何的细微变化,导致整体 PSNR 大幅掉落(在 Teaser 场景中跌至 23.28 dB);而 InstGS 基于 GPU 模板偏移优化,PSNR 达到 35.12 dB。
- vs OctreeGS / CompactGS: 紧凑型高斯工作主要通过向量量化或八叉树结构来压缩单个图元的参数冗余,但它们并未挖掘跨物体间的语义与几何共性;InstGS 在 ReScene 合成场景中显存进一步降低至 20.4 MB,同时帧率提升至 204 FPS。
- vs SAGA / LangSplat: 现有 3D 高斯分割方法通常需要构建高维特征场或训练蒸馏网络,开销极大;InstGS 基于 2D 开词表掩码的梯度驱动定位,零训练开销即完成精准的 3D 实例提取。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ (首次在 3DGS 渲染中构建了端到端可微的 GPU 实例化模板管线)
- 实验充分度: ⭐⭐⭐⭐⭐ (自建跨室内外的 ReScene 数据集,消融对比深入且包含极端失败案例分析)
- 写作质量: ⭐⭐⭐⭐⭐ (结构清晰,图表直观,公式推导严谨且实验逻辑闭环)
- 价值: ⭐⭐⭐⭐⭐ (为大规模具身仿真、数字孪生与智慧城市等包含海量重复物体的三维重建提供了极高实用价值的工业级落地范式)