跳转至

MLP Splatting: Object-Centric Neural Fields

会议: ECCV 2026
论文: ECCV 原文
领域: 3D 视觉
关键词: 物体中心表示、神经基元、高斯泼溅、体渲染、开放词汇分割

一句话总结

MLP-Splatting 把场景的每个基元从"一个高斯椭球"换成"一个参数不共享、只在自己各向异性高斯支撑内起作用的紧凑 MLP",用分块排序的稀疏体渲染合成图像;仅靠 RGB 监督,这些神经基元就自发特化到物体或物体部件上,因此不训练任何分割掩码就能做物体级编辑,并在 Replica/ScanNet 上以约 1/7 的内存和约 5 倍的速度达到与 Feature-3DGS 持平甚至更好的渲染质量。

研究背景与动机

过去几年 3D 场景表示基本走两条路:一条是 NeRF 系的全场景神经场,用一个(或一组)全局 MLP 把位置和方向映射成密度与颜色,靠可微体渲染拟合 posed 图像;另一条是 3D Gaussian Splatting 系的显式基元路线,把场景拆成一堆可独立优化的椭球,用可见性感知的光栅化换来实时渲染。两条路在照片级新视角合成上都做得很好,但它们的基元都是低层元素——椭球、体素密度、多分辨率哈希格子——物体在表示里并不存在,它只是事后从表示里"导出"出来的分组。于是想要编辑场景里的一个杯子,就得先把它分割出来:Gaussian Grouping 用 SAM 掩码监督学习逐高斯的分组特征,Panoptic NeRF 需要外部的位姿估计、跟踪和 2D 全景预测当伪标签。

语义信息也大多是被贴上去的而不是长出来的。LERF、LangSplat、Nerf-DFF、Feature-3DGS 都是把 CLIP/LSeg 的特征蒸馏进一个原本只为光度真实感设计的表示里。这种贴法的代价有两层:一是粒度错位——地面和茶杯在同一个全局辐射场里没有明确边界,只能靠额外的特征场去区分;二是效率——为了拟合物体边界上的锐利跳变,3DGS 必须沿边界堆积大量高斯,本文表 2 里 room0 场景光前 5 类物体就用了 22.9 万个高斯椭球,内存和 alpha 混合开销随之膨胀,Feature-3DGS 在 Replica 上要 629.7 MB,ScanNet 上要 1120 MB。

本文的观察是:真实场景的不连续性恰恰是集中的——物体内部的空间占据、颜色、密度高度一致,剧烈跳变只出现在物体边界附近。既然如此,可以让表示结构本身来承担这件事:如果每个基元是一个连续可微的局部函数、彼此不共享参数,那么"物体内部连续、物体之间断开"就自动成立,而不需要靠海量低层基元去一点点逼近。核心 idea:把 MLP 本身当作场景的功能单元——每个基元是一个紧凑 MLP,只在自己的高斯支撑区域内预测辐射与不透明度,一组这样的基元共同拼出场景级辐射场,物体级结构作为纯 RGB 监督下的涌现结果出现(可选的语义特征蒸馏只是在这个表示上再挂一层特征,而不是物体性的来源)。

方法详解

整体框架

输入是多视角 posed 图像和一份 COLMAP 稀疏点云,输出是一组神经基元(每个 = 一个显式的高斯支撑 + 一个隐式的小 MLP)以及渲染出的颜色图和(可选的)语义特征图。整条流程可以分成四步:用八叉树在点云上撒下初始基元;对每条相机光线找到与基元的"软接触点",把方向与基元坐标系下的局部偏移拼成 6D 输入喂给该基元的 MLP,得到颜色与密度;在 8×8 的屏幕 tile 内用一条穿过 tile 中心的虚拟光线排序,做前向 alpha 合成;如果开了特征蒸馏,再把同一套体渲染权重用来合成 512 维语义特征。渲染出来的每个基元都自带位置与朝向,所以删、移、缩放、改色都能直接在基元(甚至 MLP 参数)层面完成。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["多视角图像 + COLMAP 点云"] --> B["八叉树采样初始化基元"]
    B --> C["神经基元表示<br/>独立 MLP + 各向异性高斯支撑"]
    C --> D["软接触点交互<br/>光线→基元局部 6D 输入"]
    D --> E["分块排序的稀疏合成<br/>tile 内虚拟光线排序 → alpha 合成"]
    E -->|纯 RGB 监督| F["物体级结构涌现"]
    E -->|加特征蒸馏| G["四面体方向基的语义特征嵌入"]
    F --> H["基元级编辑:删除 / 缩放 / SE(3) / 改色"]
    G --> I["开放词汇分割 / SAM 实例分割"]

论文另外在 Discussion 里给这套设计做了一个函数空间的分析,提出所谓的等质内存律(Equal-Quality Memory Law):要达到同一个像素误差 \(\varepsilon\),高斯泼溅至少需要 \(\Omega(\varepsilon^{-2})\) 个参数,而 MLP-Splatting 存在一个只需 \(\Theta(\varepsilon^{-3/s})\) 参数的构造(\(s\) 是场景局部的光滑阶数)。直觉是解析高斯无法产生真正的跳变,只能沿不连续面堆 \(\Theta(h^{-2})\) 个分量去"逼近"一个断口;而本文在光滑区域内做局部函数逼近、靠 partition-of-unity 保留断口,能达到最优的 Sobolev 逼近速率。当 \(s \ge 2\)(场景分段二阶可微)时 \(\varepsilon^{-3/2} < \varepsilon^{-2}\),严格优于高斯。这解释了为什么本文能用少一个数量级的参数拟合同样的误差,也顺带解释了物体级结构为何会自然长出来。

关键设计

1. 神经基元表示:把 MLP 本身当作场景的功能单元

每个基元 \(i\) 由三样显式几何量定位:中心 \(\boldsymbol{\mu}_i\)、尺度向量 \(\mathbf{s}_i\) 和单位四元数 \(\mathbf{q}_i\),后两者定义一个各向异性的高斯支撑区域,充当该基元在 3D 中的"软边界"。挂在它上面的是一个独立的神经函数 \(f_i(\cdot;\theta_i)\),把一个 6D 输入映射成 RGB 辐射与不透明度密度,各基元之间完全不共享参数。这条设计与 3DGS 的区别不是"用了神经网络"这么简单:3DGS 的基元是"不透明度 + 球谐系数"的椭球,表达力被单个高斯的解析形式锁死,要拟合复杂外观只能加基元;本文的基元是一个被局部支撑约束住的神经场,单个基元就能拟合非解析、非凸的外观分布,同时它仍然是一个有明确位置和朝向的显式实体——可编辑性正是从后者来的。与场景级 NeRF 的区别则在于全局与分解:NeRF 是一个贯穿全场景的 MLP,物体在里面不可寻址;本文是 K 个互不通信的局部 MLP,物体边界天然就落在两个 MLP 支撑区域的交界处,所以"按物体分解表示"不需要任何分组或聚类步骤。

一个反直觉的地方是训练时故意不做密度控制。3DGS 那套基于位置梯度的致密化与剪枝在这里不成立:MLP 基元对位置的梯度往往又弱又噪,而且它没有可以直接读出的显式不透明度用于剪枝。作者的选择是放任基元互相竞争——外观一致的区域里,某些基元会迅速撑大尺度,把邻居压成事实上不活跃的冗余项;外观复杂的区域里,基元则通过参数震荡去抠细节。这套机制配合八叉树在 COLMAP 点云上的采样初始化,最终让"哪些基元活下来、各自负责场景的哪一块"完全由光度损失决定,这正是纯 RGB 监督下物体级结构涌现的来源。

2. 软接触点交互:用闭式解把光线–基元交互压成 6D 光场输入

一条光线穿过一个体积基元的支撑区域是有一段长度的,如果沿这段区间密集采样、再逐点查询 MLP,既慢又丢掉了"基元是一个整体"的结构。本文改为求一个软接触点:在基元的高斯支撑诱导出的度量 \(\Lambda_i = R(\mathbf{q}_i)\,\mathrm{diag}(s_{ix}^2,s_{iy}^2,s_{iz}^2)^{-1}R(\mathbf{q}_i)^\top\) 下(\(R(\cdot)\) 为四元数对应的旋转矩阵),最小化光线到基元中心的高斯加权距离,其最优解有闭式表达:

\[t_i^\star = \max\!\Big(0,\ \frac{\mathbf{d}^\top\Lambda_i(\boldsymbol{\mu}_i-\mathbf{o})}{\mathbf{d}^\top\Lambda_i\mathbf{d}}\Big),\qquad \mathbf{p}_i^\star = \mathbf{o}+t_i^\star\mathbf{d}\]

⚠️ 原文式 (2) 的截断形式在缓存 PDF 的文本抽取中已损坏(只能看出是把解限制到非负),此处按"投影到非负"理解,细节以原文为准。取接触点到中心的残差 \(\boldsymbol{\delta}_i = \boldsymbol{\mu}_i - \mathbf{p}_i^\star\),与光线方向拼成输入 \(\mathbf{x}_i = [\mathbf{d};\boldsymbol{\delta}_i]\)——方向刻画视角依赖,残差刻画接触位置在基元坐标系里的局部几何,两者合起来正是光场参数化(辐射同时依赖方向与空间位置)在基元坐标下的写法。这也是本文与 3DGS 在"每个基元能表达什么"上的分水岭:3DGS 的球谐只随方向变化,位置信息全靠基元自己的空间分布去编码,而本文把局部位置显式喂进了网络。

为了让小 MLP 还能拟合高频外观,6 个标量分量各自做多分辨率位置编码(\(\sin/\cos\) 多频,共升到 12 维,整体 72 维),编码后的特征才是真正的网络输入;网络输出经 sigmoid 得到颜色、经 softplus 得到非负密度,密度再乘上基元的高斯衰减,从数值上强制"这个 MLP 只在自己那一片区域里说话"。

3. 分块排序的稀疏合成:把体渲染做成 tile-based 光栅化

体渲染要求基元按深度从前到后合成,而逐像素地把所有与该像素光线相交的基元排一遍序非常昂贵。本文沿用 3DGS 的 tile 思路:把像平面划成 8×8 的小块,先用 AABB–tile frustum 相交测试筛出候选基元,再用一条穿过 tile 中心的虚拟光线求出的深度做块级基数排序——这条虚拟光线只用来决定 tile 内基元的先后顺序,与每个像素真正的渲染光线无关,因此是可控的近似,换来了整个 tile 共享一次排序。排序后,负责 tile 内像素的每个线程块协作把 MLP 权重载入并前向,得到颜色与密度,再做 alpha 合成:

\[\mathbf{C}=\sum_{i=1}^{N}T_i\alpha_i\mathbf{c}_i,\qquad \alpha_i=1-\exp(-\sigma_i\ell_i),\qquad T_i=\exp\!\Big(-\sum_{j<i}\sigma_j\Big)\]

其中 \(\ell_i\) 是第 \(i\) 次光线–基元交互的有效积分长度(⚠️ 原文式 (6) 的透射率写法把 \(\ell\) 折进了 \(\sigma\),细节以原文为准)。这个式子和 3DGS 的 alpha 混合长得很像,也确实是 NeRF 体渲染积分的离散近似,区别是它把"沿光线密集采样"换成了"每基元只做一次稀疏交互"——因为每个基元本身已经是连续函数了,不需要靠采样点去铺满它。这个稀疏性是整篇论文效率的来源:参数量少一个数量级意味着基元数少一个数量级,也就意味着每像素要混合的项数少一个数量级,Feature-3DGS 那种"海量语义高斯的 alpha 混合开销"被直接绕开了。至于遮挡,它没有被当作特例处理——所有基元的密度加在一起构成场景密度,前后关系由上述排序与透射率自然给出;两个物体在某段光线上重叠时,各自的基元按不透明度加权混合,所以把一组基元的不透明度屏蔽掉,物体就直接从场景里消失,不需要重训。

4. 四面体方向基的语义特征嵌入:让语义挂在基元而不是挂在每个高斯基元上

为了支持语言引导编辑和开放词汇分割,本文把语义特征挂到同一套光线–基元交互上,而不是另建一个特征场。关键的一步是构造一个尺度归一化的局部偏移\(\mathbf{u}_i = \mathrm{clip}_{[-1,1]^3}\big(R(\mathbf{q}_i)^\top\boldsymbol{\delta}_i \oslash \mathbf{s}_i\big)\)。用归一化偏移而不是原始残差,是为了把"外观相似但局部朝向不同"的区域在语义空间里分开——比如同一张桌子的桌面与桌腿,颜色可能很接近,但它们相对各自基元中心的归一化偏移方向截然不同。特征的混合方式是用一组方向向量给这个偏移打分再 softmax:

\[g_{ik}=\mathrm{softmax}\big(\mathbf{a}_k^\top\mathbf{u}_i\big),\qquad \mathbf{f}_i=\sum_k g_{ik}\mathbf{e}_{ik}\]

其中 \(\mathbf{e}_{ik}\) 是可学习的 slot embedding,\(\{\mathbf{a}_k\}_{k=1}^{4}\) 取自一个正则四面体框架——它是 3D 中最小的一组仿射无关方向,能给出一份各向同性的角度划分,用最少的 slot 覆盖所有方向而不偏向任何一个坐标轴。渲染时特征图用与颜色完全相同的体渲染权重合成(\(\mathbf{F}=\sum_i T_i\alpha_i\mathbf{f}_i\)),因此语义与几何天然共边界、天然多视角一致。这条设计是整篇论文"省内存"的另一半原因:一个基元只带 4 个 slot embedding,而不是让每个高斯基元各自背一份 512 维特征。

一个完整示例:从点云到删掉一支蜡烛

以论文 Fig. 3 的蜡烛场景走一遍。训练前,用八叉树在 COLMAP 点云上采样出初始基元(论文表 2 显示这类室内场景通常收敛到千级基元,例如 room0 是 2107 个 MLP 对 228941 个高斯)。训练 60k 迭代的过程中没有任何致密化/剪枝操作,全凭光度损失让基元彼此竞争:一部分膨胀并接管大片一致区域,另一部分尺度与不透明度趋零而失效。收敛后,那支蜡烛恰好由 11 个 MLP 基元共同表示,而且它们大多沿圆柱结构的边缘分布——这正是"光滑内部 + 边界处断开"这一归纳偏置的直接后果:曲面内部的辐射各处相似,一两个基元就够,真正需要额外基元的是轮廓转折处。想删掉蜡烛时,用户选中这 11 个基元,把它们的不透明度屏蔽掉,重新渲染,物体就从场景里消失,其余基元和它们的参数一个都没动。同一套机制还能做刚性变换(对选中基元的位姿整体施加 SE(3) 变换)和缩放(改基元的尺度参数);更细粒度的改色甚至可以只改 MLP 最后一层的 bias——论文 Fig. 3 中的颜色编辑就是这么做的。

损失函数 / 训练策略

光度监督沿用 3DGS 的 L1 + SSIM 组合:

\[\mathcal{L}_{rgb}=(1-\lambda)\,\|\mathbf{C}-\mathbf{C}^\ast\|_1+\lambda\big(1-\mathrm{SSIM}(\mathbf{C},\mathbf{C}^\ast)\big)\]

开启语义特征蒸馏时,再对齐渲染出的特征图与视觉基础模型的教师隐特征(\(|\mathbf{F}-\mathbf{F}_t|\)),总损失为两者之和。实现上,每个 MLP 的结构是 72–32–32–4(输入 72 维位置编码,输出 RGB 与原始密度),语义 embedding 维度 512,8×8 tile 的定制 CUDA 渲染器是效率关键。优化用 Adam,log-scale 学习率 \(10^{-2}\)、位置 \(10^{-4}\)、其余参数 \(10^{-3}\),训练 60,000 迭代,单张 RTX 6000 Ada 完成训练,评测在 RTX 4090 上按 Feature-3DGS 的设定进行。

实验关键数据

主实验

新视角合成在 Replica 与 ScanNet 上对比 Feature-3DGS(两者都只做光度指标,ScanNet 序列按 Feature-3DGS 的采样方式选取):

数据集 指标 本文 Feature-3DGS 趋势
Replica PSNR ↑ 36.25 36.18 略优
Replica SSIM ↑ 0.971 0.964 略优
Replica LPIPS ↓ 0.090 0.079 落后
ScanNet PSNR ↑ 25.35 23.32 +2.03
ScanNet SSIM ↑ 0.830 0.817 略优
ScanNet LPIPS ↓ 0.403 0.362 落后

语义与效率对比(Nerf-DFF 与 Feature-3DGS 为基线,后者的 FPS 在两个数据集上分别是 ~3 与 <1):

数据集 指标 Nerf-DFF Feature-3DGS 本文
Replica mIoU (%) ↑ 63.6 78.9 77.7
Replica Accuracy (%) ↑ 86.4 94.3 93.9
Replica 内存 (MB) ↓ 86.5 629.7 32.0
Replica FPS ↑ < 3 ~3 ~8
ScanNet mIoU (%) ↑ - 60.0 64.3
ScanNet Accuracy (%) ↑ - 87.0 89.4
ScanNet 内存 (MB) ↓ - 1120 206
ScanNet FPS ↑ - < 1 ~12

(Nerf-DFF 只在 Replica 上评测,表中以 - 表示。)摘要与引言另外给出了一组跨数据集平均:本文约 120 MB / ~10 FPS,Feature-3DGS 约 880 MB / ~2 FPS,对应约 1/7 内存、5 倍速度;这组平均与上表的单数据集数值并不一一对应(例如 Replica 上内存比值其实是 1/19.7,ScanNet 上约 1/5.4),⚠️ 引用时请以原文表格为准。

消融实验

论文没有常规意义上的逐模块消融(本文的核心改动是整体表示范式,不是一个可拆的模块),最接近"分析实验"的是对同一物体在两种表示下所需参数量的对照:作者按 softmax 阈值(\(\tau=0,15\))估计每个场景前 5 类物体(覆盖约 95% 的基元)的基元数,把 MLP 与高斯逐类并排比较。

场景 物体(MLP 基元数 / 3DGS 高斯数) 合计 (MLP / 3DGS) 说明
room0 地板 253/48490,地毯 485/21621,桌子 511/98197,椅子 782/43149,包 76/17484 2107 / 228941 约为高斯的 0.92%
room1 地板 91/21525,地毯 116/32751,桌子 1961/332611,包 44/10389,墙 428/140025 2640 / 537301 约为高斯的 0.49%
office3 地板 174/50671,桌子 198/24242,椅子 290/36867,包 49/9102,墙 351/62102 1062 / 182984 约为高斯的 0.58%
office4 地板 171/29803,桌子 178/35771,椅子 203/49684,包 38/9425,墙 296/51922 886 / 176605 约为高斯的 0.50%

参数量的对比更极端:论文指出单个 MLP 的参数比 10 个语义高斯椭球还少。不过要提醒的是,这张表统计的是"基元个数"而不是浮点参数量,两者的可编辑粒度不同(一个 MLP 承载的是连续区域,一个高斯承载的是一个各向异性核),直接按个数比会高估压缩率;论文的等质内存律给的是参数量的理论速率差,可作为补充参照。

关键发现

  • 表示结构决定了拟合行为,而不只是效率。论文 Fig. 4 的定性对比里,3DGS 用了海量高斯椭球去渲百叶窗,结果反而塌成一片模糊的粗块;MLP-Splatting 用一两个细长的 MLP 基元就复现出正确的条纹结构。作者据此认为"把物体当作独立功能单元"并不牺牲光度保真度,反而给出了一种与结构对齐的替代方案。
  • 语义基本持平,效率差一个数量级。mIoU 在 Replica 上是 77.7 对 78.9(略低),在 ScanNet 上是 64.3 对 60.0(反超),Accuracy 也基本持平,而内存小了约 20 倍(Replica)与 5.4 倍(ScanNet)。作者把速度提升归因于高压缩——基元少了,语义 embedding 的 alpha 混合项也随之变少。
  • LPIPS 是明确的短板。两个数据集上本文的 LPIPS 都落后(0.090 vs 0.079,0.403 vs 0.362),说明在感知层面的高频细节上,解析高斯密集覆盖仍然有优势,PSNR/SSIM 的领先不足以掩盖这一点。论文正文没有对此展开讨论。
  • 物体级结构确实不需要监督。不用任何分割掩码、语言先验或身份标签,基元就自发对齐到物体或部件;作者把原因归给归纳偏置——独立预测器 + 局部支撑,使得优化自然倾向于"每个 MLP 只负责场景中一小块连贯区域"。
  • 无密度控制是把双刃剑。省掉了 3DGS 的致密化/剪枝逻辑让方法更好分析,但作者观察到两类副作用:外观一致区域里基元会快速膨胀、把邻居压成无效项,外观复杂区域里基元参数会震荡去抠细节,两者都会损害效率或重建质量。

亮点与洞察

  • 可编辑性是表示结构自带的,不是加模块换来的。以往物体级编辑要先做分割再做编辑,本文把"每个基元是一个有位置、有朝向、有局部支撑的独立函数"作为表示的定义,于是 SE(3) 变换作用在位姿上、缩放作用在尺度上、改色作用在最后一层 bias 上——编辑路径短到几乎不需要额外系统。这是整篇论文最"啊哈"的地方:物体性不是被学习出来的属性,而是被设计进结构的先验。
  • 等质内存律把"为什么这样更省"讲成了定理\(\Omega(\varepsilon^{-2})\)\(\Theta(\varepsilon^{-3/s})\) 的对比给出了一个可检验的预测,也让"神经基元比高斯基元更省参数"从工程直觉变成了速率论证。这个分析框架本身可以迁移——任何"解析基元 vs 局部函数基元"的取舍都可以套用同样的函数空间语言(解析性、断口附近的几何管状论证、渲染算子的稳定性)去估算参数代价。
  • 无密度控制的竞争式特化是一套可复用的 trick。它把"要多少个基元"这件事从显式的致密化调度变成了隐含的优化结果:初始多撒一点,让光度损失自己淘汰冗余项。对任何用自适应数量基元的表示(点云神经形状、可编辑 SLAM 地图、甚至注意力槽位)都有借鉴价值,代价是收敛后的基元数不可控。
  • 用方向 slot 而不是逐基元特征向量来编码语义。4 个四面体方向 + softmax 混合,参数量是常数级的,同时用"尺度归一化的局部偏移"把朝向差异显式暴露给语义空间。这个思路可以直接搬到 3DGS 系方法上:把逐高斯的 512 维特征换成逐组的低维 slot,理论上能大幅降低语义场的存储。
  • tile 级虚拟光线排序。用一条共享的虚拟光线替 tile 内所有像素排序,把逐像素排序的开销摊薄,且这条光线只影响顺序不影响取值。这是一个很实用的近似,任何需要"按深度排序大量体积基元"的渲染器都能直接借用。

局限与展望

  • 作者承认:没有设计显式的密度控制策略;3DGS 那套基于位置梯度的致密化在这里迁移不过来(梯度弱且有噪),MLP 基元也没有可以直接用于剪枝的显式不透明度参数。他们观察到的一致区域膨胀和复杂区域震荡都说明一个合适的密度控制机制还有明显收益空间。
  • 评测面偏窄。全部实验都在 Replica 和 ScanNet 这两个室内数据集上,室外大场景、无界场景、动态场景都没有验证;等质内存律里的 \(s\) 是场景相关的光滑阶数,论文只给出了"实际场景分段光滑"的定性论证,没有实测 \(s\) 或者反过来用参数量曲线验证速率。
  • LPIPS 系统性落后没有解释。如果高频细节的损失来自"单个 MLP 拟合能力有限 + 基元数不足",那么把位置编码的频带数或 MLP 宽度做成逐基元可调,可能是直接的对策;如果是 alpha 合成的排序近似造成的,那就该对比逐像素排序与 tile 虚拟光线排序的误差上界。
  • 编辑能力依赖人工选基元。论文里的删除、缩放、SE(3) 变换都是"用户选中一组基元"之后进行的,没有给出自动选择或语言引导选择的方案;虽然可以用特征嵌入做文本查询,但这条链路论文只演示了分割,没有演示"用文本选中基元再编辑"。
  • 效率数字的引用需要小心。摘要/引言的 120 MB、~10 FPS 是跨数据集平均,与表 3 的单数据集数值不一致;训练用 RTX 6000 Ada、评测用 RTX 4090,跨方法的时间对比也应说明硬件差异。
  • 可能的改进方向:让基元数成为可学习的变量(例如引入可微的合并/分裂代价),把 tile 排序的近似误差纳入损失,或者把语义 embedding 与基元尺度绑定以进一步提升压缩率。

相关工作与启发

  • vs 3DGS / Feature-3DGS: 两者都以显式基元 + 光栅化管线为基础,但 3DGS 的基元是解析高斯、语义靠事后蒸馏贴上去的;本文的基元是局部神经函数,语义直接挂在基元上。本文在内存(约 1/20 ~ 1/5)、渲染速度(约 3~12 倍)和新视角合成指标上占优,但在 LPIPS 上落后,且缺少 3DGS 那套成熟的密度控制。
  • vs Nerf-DFF: Nerf-DFF 把 CLIP-LSeg 特征蒸馏进一个全局 NeRF 特征场,编辑需要在该特征场里定位区域;本文的每个基元自带位置与朝向,所以编辑可以在基元位姿层面直接做。本文在两个数据集的全部语义指标上都超过了 Nerf-DFF,同时内存只有它的约 1/3(Replica 上 32.0 vs 86.5 MB)。
  • vs Panoptic NeRF / vMAP: 这两类物体级表示依赖外部先验——Panoptic NeRF 要位姿估计、跟踪和 2D 全景伪标签,vMAP 用独立的紧凑神经场在线建模每个实例。本文不需要任何分割或跟踪监督,物体级结构从纯 RGB 监督中涌现,特征蒸馏是可选的增强而不是前提。
  • vs Gaussian Grouping / LangSplat: 它们把分组或语言特征附加到每一个高斯上,存储随高斯数量线性膨胀(Gaussian Grouping 还依赖 SAM 多视角掩码);本文把语义挂在基元上,一个基元只有 4 个方向 slot,存储随基元数增长,而基元数比高斯数少两个数量级。
  • vs 本文自身的理论分析: 等质内存律不只是解释本文为什么省,也给出了高斯泼溅在物体级分解上吃亏的原因——解析基元无法表达断口,只能靠沿边界堆分量去逼近,这条路本身就与"物体是边界清晰的功能单元"这一目标相冲突。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ "MLP 即基元"把神经场和显式基元两条路真正缝合到一起,物体中心性来自表示结构而非监督,这个视角是新的。
  • 实验充分度: ⭐⭐⭐⭐ 覆盖了两个数据集、光度/语义/效率三类指标,参数量对照很有说服力;但缺少标准消融、LPIPS 落后未解释、只在室内数据集验证。
  • 写作质量: ⭐⭐⭐⭐⭐ 动机逻辑链清晰,Discussion 的理论分析把工程直觉上升为速率论证,图表(尤其 Fig. 1 的三个维度对比)辅助理解到位。
  • 价值: ⭐⭐⭐⭐ 给物体中心 3D 表示提供了一条不依赖分割监督的路线,可编辑性与效率的收益是实打实的;但密度控制缺失、编辑仍需人工选基元,离即插即用还有距离。