PointSplat: Compact Gaussian Splatting via Human-Centric Prediction¶
会议: ECCV 2026
论文: ECCV 原文
领域: 3D 视觉
关键词: 3D 高斯泼溅, 前馈三维重建, 紧凑表示, 人体新视角合成, 光线投射
一句话总结¶
PointSplat 提出了一种以人体为中心的 3D 高斯前馈预测框架,利用空间雕刻与光线投射构建紧凑表面点代理并建立显式 2D-3D 对应,再经点-图像 Transformer 直接在 3D 空间回归高斯属性,以仅约 1/3 的高斯球数量超越了现有视点中心基线的新视角渲染质量。
研究背景与动机¶
从稀疏多视角图像即时生成高质量三维人体表示是沉浸式流媒体、全息通信和远程交互等系统的关键基础。在带宽受限与计算资源紧张的实际落地场景中,表示的紧凑性(Compactness)与渲染保真度同等关键。传统基于光场采集的方法高度依赖密集相机阵列与专用硬件,成本高昂且部署扩展性极差;而近期兴起的前馈神经重建方法(如 GS-LRM、DepthSplat、GPS-Gaussian)通过深度网络从稀疏视点直接预测 3D 高斯,显著降低了硬件门槛。
然而,现存主流前馈方法普遍采用“以视点为中心”(View-Centric)的范式,即对每个输入视点独立预测像素对齐的高斯图或特征图,再反投影到 3D 空间进行拼接。由于多个输入视角观测的是同一个目标人体,这种设计不可避免地造成严重的跨视角内容重复表达。随着输入视角数量的增加或图像分辨率的提升,高斯图层叠带来的冗余呈线性甚至超线性激增,导致显存占用暴涨、传输开销巨大,并且在视点融合处极易出现浮空伪影和离群噪点。后处理剪枝虽然能缓解膨胀,但在前馈流水线中往往引入不透明度阈值歧义,难以在速度与保真度之间取得平衡。
本文的切入点是打破像素对齐的视点中心限制,将预测空间直接迁移到原生三维空间中,让神经网络聚焦于前景兴趣区域的单一全局表示。核心 idea:通过空间雕刻与光线投射构建去除冗余内部点的紧凑几何代理并建立显式 2D-3D 对应,利用点-图像 Transformer 融合多视角外观与几何上下文,在 3D 空间单次前馈直接回归紧凑的高斯球基元。
方法详解¶
整体框架¶
PointSplat 接收多视角标定图像及其对应的前景人体掩膜作为输入,输出紧凑的 3D 高斯点云集合。整个流水线分为四个阶段:首先从 2D 图像中提取与相机射线联合编码的外观特征,并通过掩膜引导采样聚焦前景;其次利用多视角掩膜执行空间雕刻(Space Carving)提取粗糙视觉壳点云,经体素化和光线投射剔除不可见的内部冗余点,同时建立严谨的图像像素到 3D 空间点的双向对应;然后由点-图像 Transformer 通过交替注意力机制深层聚合外观与局部几何特征;最后通过轻量解码头预测各基元相对于初始点的空间偏移及尺度、旋转、球谐系数与不透明度,仅依赖 RGB 重建损失实现端到端训练。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["多视角图像与前景掩膜"] --> B["外观特征提取与掩膜 Token 采样"]
A --> C["空间雕刻与体素化光线投射"]
B --> D["点-图像 Transformer 特征融合"]
C --> D
D --> E["3D 高斯参数回归与位置偏移叠加"]
E --> F["端到端可微渲染与新视角合成"]
关键设计¶
1. 外观特征提取与掩膜引导 Token 采样:保留关键前景语义并控制序列长度 为了赋予 2D 特征明确的三维空间感知能力,方法将每个像素与其普吕克射线(Plücker Ray)几何嵌入 \(\mathbf{f}_{\mathrm{ray}} = [\mathbf{d}, \mathbf{o} \times \mathbf{d}]\) 拼接,结合 RGB 颜色构建联合输入特征 \(\mathbf{f}_{\mathrm{pixel}} = [\mathbf{c}, \mathbf{f}_{\mathrm{ray}}]\)。若直接对整幅高分辨率图像进行分块(Patchify)输入 Transformer,背景空白区域的大量无用 token 会带来二次方的注意力计算开销。针对人体前景集中的特性,方法通过累加每个图像 Patch 内的人体掩膜值计算显著性得分 \(s_i\),使用 Top-\(n\) 筛选机制提取高响应的外观 token 并通过线性层投影至特征维度 \(C\),在大幅压缩序列计算量的同时完全保留了人体核心外观纹理。
2. 体素化光线投射与几何编码:剔除内部冗余并构建显式 2D-3D 对应 直接使用传统空间雕刻得到的视觉壳(Visual Hull)几何外壳包含大量未暴露在表面的实体内部点,且由于分辨率限制缺乏高频细节,若盲目作为基元初始化会导致高斯数量膨胀。为此,方法构建包裹点云的体素网格(体素尺寸设为 0.005),并从各锚点视点发射穿透像素的视线。利用数字差分分析仪(DDA)遍历光线相交的体素,并在每个穿透体素内选取与光线垂直欧式距离最小的表面点: $\(d(\mathbf{p}_v, \mathbf{r}) = \frac{\|(\mathbf{p}_v - \mathbf{c}) \times \mathbf{d}\|}{\|\mathbf{d}\|},\quad \mathbf{p}_v^* = \arg\min_{\mathbf{p}_v \in \mathbf{v}} d(\mathbf{p}_v, \mathbf{r})\)$ 未被任何光线击中的体素及其内部点直接被剪枝剔除。随后,对保留的表面点集合 \(\mathbf{p}_s^*\) 施加 \(L\) 频正弦位置编码 \(\gamma(\mathbf{p}_s^*)\),并与对应视点发射的光线嵌入 \(\mathbf{f}_{\mathrm{ray}}\) 拼接,经线性层与层归一化后生成几何 token \(\mathbf{T}_{\mathrm{geometry}}\)。这一设计既完全排除了对渲染无贡献的内部冗余点,又建立了 2D 像素与 3D 点之间的几何锚定。
3. 点-图像 Transformer 与 3D 高斯参数直接回归:跨模态解耦与基元生成 在融合阶段,网络输入外观 token \(\mathbf{T}_{\mathrm{appearance}}\) 与几何 token \(\mathbf{T}_{\mathrm{geometry}}\),通过四层交替注意力(Alternating Attention)机制分层捕获不同层级上下文:首先通过全局自注意力使所有点与跨视角图像 token 自由交互建立全局关联;接着利用点级自注意力增强局部三维几何邻域的结构平滑与连续性;最后利用图像级注意力分别建模视角内细节(Frame-wise)与多视角间特征互补(Cross-view)。解码模块直接将融合后的每个高斯 token 解码为 \(K=16\) 个高斯基元的属性集合,并通过轻量线性层与专用激活函数预测位置偏移量 \(\mathbf{o}\)、颜色/球谐系数、尺度、旋转四元数及不透明度: $\(\mathbf{p}_{\mathrm{final}} = \mathbf{p}_s^* + \mathbf{o}\)$ 该机制无需依赖显式深度图先验或 SMPL 人体骨架模板,直接在 3D 空间以残差方式校准粗糙表面点,生成紧凑贴合人体表面的高斯基元分布。
损失函数 / 训练策略¶
整个模型采用端到端纯 RGB 监督训练,无需三维点云或稠密深度作为中间标签。损失函数结合了像素级光度一致性与感知相似度损失: $\(\mathcal{L} = \lambda_{\mathrm{L1}} \mathcal{L}_{\mathrm{L1}} + \lambda_{\mathrm{LPIPS}} \mathcal{L}_{\mathrm{LPIPS}}\)$ 实验中两项权重均设为 \(\lambda_{\mathrm{L1}} = 1.0, \lambda_{\mathrm{LPIPS}} = 1.0\)。网络使用 FlashAttention-2、梯度检查点(Gradient Checkpointing)与混合精度训练以优化显存开销,初始学习率为 \(2 \times 10^{-4}\),在前 10% 迭代期执行线性预热(Warmup),在 NVIDIA H20 GPU 集群上基于 batch size 32 训练 300k 次迭代。
实验关键数据¶
主实验¶
在真实人体动态数据集 DNA-Rendering(测试集 16 个序列)与 ActorsHQ(12 个动态序列)上,输入 8 个 \(512 \times 512\) 分辨率视点,纯 PyTorch 推理评测结果如下:
| 数据集 | 方法 | PSNR ↑ | SSIM ↑ | LPIPS ↓ | GS 数量 (k) | 单帧推理耗时 (s) |
|---|---|---|---|---|---|---|
| DNA-Rendering [5] | GS-LRM [51] | 18.25 | 0.582 | 0.364 | 204k | 0.32 |
| DNA-Rendering [5] | AnySplat [14] | 20.97 | 0.790 | 0.143 | 86k | 0.53 |
| DNA-Rendering [5] | GPS-Gaussian [55] | 22.35 | 0.797 | 0.172 | 51k × N | 0.07 × N |
| DNA-Rendering [5] | DepthSplat [43] | 23.98 | 0.821 | 0.131 | 212k | 0.45 |
| DNA-Rendering [5] | LVSM [15] | 23.24 | 0.802 | 0.135 | - | 1.0 × N |
| DNA-Rendering [5] | Ours (PointSplat) | 27.18 | 0.891 | 0.071 | 71k | 0.40 |
| ActorsHQ [13] | GS-LRM [51] | 16.96 | 0.675 | 0.299 | 204k | 0.32 |
| ActorsHQ [13] | AnySplat [14] | 19.11 | 0.699 | 0.238 | 86k | 0.53 |
| ActorsHQ [13] | GPS-Gaussian [55] | 23.81 | 0.887 | 0.084 | 51k × N | 0.07 × N |
| ActorsHQ [13] | DepthSplat [43] | 22.39 | 0.797 | 0.157 | 212k | 0.45 |
| ActorsHQ [13] | LVSM [15] | 24.00 | 0.804 | 0.128 | - | 1.0 × N |
| ActorsHQ [13] | Ours (PointSplat) | 27.62 | 0.887 | 0.084 | 71k | 0.40 |
在合成人体数据集 THuman2.0 与 RenderPeople 上的评估(表 2 协议)表明,在 8 视点输入下,PointSplat 在 THuman2.0 上取得 34.30 dB PSNR / 0.015 LPIPS(基线 DepthSplat 为 26.32 dB / 0.048,GPS-Gaussian 为 31.08 dB / 0.032),且高斯数量仅为 75k(DepthSplat 为 270k)。
在 1024 高分辨率测试下(表 3),PointSplat 在未经微调的零样本迁移设置中取得 26.54 dB PSNR / 0.123 LPIPS,全面超越 GPS-GS (20.63 dB) 与 DepthSplat (19.82 dB),且表现优于耗时漫长的优化类方法 GauHuman (17.60 dB) 与 LongVolCap (24.21 dB)。
消融实验¶
在 DNA-Rendering 数据集上对核心模块、几何代理类型与体素尺寸进行消融实验:
| 配置 | PSNR ↑ | SSIM ↑ | LPIPS ↓ | GS 数量 (k) | 推理耗时 (s) | 说明 (Table 5 & 6) |
|---|---|---|---|---|---|---|
| Full Model (AA + Ray Casting + Voxel Encode) | 27.18 | 0.891 | 0.071 | 71k | 0.4 | 完整模型 |
| w/o Voxel Encode | 26.60 | 0.876 | 0.091 | 160k | 0.7 | 缺乏体素位置编码,结构一致性下降 |
| w/o Ray Casting | 26.32 | 0.856 | 0.093 | 224k | 0.7 | 未剔除实体内部点,高斯数量膨胀 3.1 倍 |
| Full Attention (替代交替注意力 AA) | 27.09 | 0.887 | 0.076 | 71k | 1.1 | 显存与计算开销大幅增加,精度略降 |
几何代理形式对比(Table 7):使用视觉壳 Visual Hull (27.18 dB) 显著优于预训练深度图 VGGT Depth (25.95 dB)、视锥空间采样 Frustum Sample (22.92 dB) 以及边界框 Bounding Box (23.89 dB)。
关键发现¶
- 光线投射是紧凑性的首要支柱:消融光线投射机制直接导致高斯球基元从 71k 激增至 224k(增长超过 215%),推理延迟从 0.4s 上升到 0.7s,且 LPIPS 从 0.071 恶化至 0.093,证明内部未暴露点的存在不仅拖累效率,还会因不透明度混合产生视觉噪声。
- 跨视点数量具有极强鲁棒性:在仅 4 台相机的极端稀疏输入下(Table 4),GPS-GS 发生崩溃(PSNR 仅 13.71 dB),DepthSplat 降至 19.55 dB,而 PointSplat 依然维持在 23.16 dB / 0.112 LPIPS;当视角扩展至 16 台相机时,PointSplat 进一步达到 27.31 dB,体现出 3D 原生表示相比 2D 反投影方法对输入视点密度更具泛化韧性。
亮点与洞察¶
- 原生 3D 预测范式取代视点反投影:彻底摒弃了主流方法对各视角分别预测密集高斯图再做 3D 拼接的传统做法,以 3D 几何代理为空间骨架直接进行基元回归,从数学架构层面根除了跨视角的表达冗余。
- 轻量 DDA 光线求交实现高效 2D-3D 几何绑定:利用 DDA 穿透体素网格,直接在欧式空间筛选距视线最近的表面点,既完成了内部死点的剪枝,又以零网络参数为每个点赋予了确切的视线投影归属。
- 不依赖 SMPL 先验的泛化性扩展:传统以人体为中心的方法多高度绑定 SMPL/SMPL-X 参数化网格,难以拓展至衣物下摆松散、携带手持道具或多人交互场景;PointSplat 仅依靠多视角掩膜与视觉壳,在 PKU-DyMVHumans 多人场景中依然表现稳定。
局限与展望¶
- 依赖精准的多视角前景掩膜与相机标定:粗糙几何代理的构建高度依赖多视角掩膜的空间雕刻,若遮罩提取存在边缘缺失或相机外参存在漂移,视觉壳的几何残缺将直接影响后续光线投射与点采样。
- 无边界大场景与复杂环境扩展受限:目前体素化和视觉壳仅适用于前景主体明确的目标对象(Object/Human-centric),无法直接扩展至大范围无边界的背景场景或强遮挡室内环境。
- 时序连续性尚待挖掘:虽然单帧前馈效率高达 0.4s,但当前模型仍按独立帧处理视频序列,缺乏帧间运动流或四维时空拓扑约束,未来可拓展至具有时序紧凑性的 4D 高斯表示。
相关工作与启发¶
- vs DepthSplat / GPS-Gaussian: 后两者属于典型的 View-Centric 范式,为每个视点预测密集高斯深度与属性图,在高分辨率或多视点下高斯总数达到 200k-500k+,不仅产生大量空间重叠浮空伪影,且推理与传输开销大;PointSplat 直接在原生 3D 表面点上进行属性预测,以约 71k 高斯实现了更优的锐利度与保真度。
- vs LHM / GauHuman / Diffuman4D: 这类人体专用方法往往重度依赖 SMPL 先验或需耗费数分钟针对特定单人序列执行测试时优化;PointSplat 摆脱了人体参数化骨架的形态束缚,采用纯前馈推断,对宽松服饰及复杂姿态更具普适性。
- vs AnySplat: AnySplat 虽探索了前馈体素化聚集,但其针对无位姿未标定场景设计且依赖额外的几何监督;PointSplat 证明了在标定视点下,通过光线投射与纯 RGB 监督即可稳定驱动高质量、极致紧凑的人体新视角合成。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ 突破视点中心反投影定式,巧妙结合空间雕刻、DDA 光线投射与 Transformer 实现原生 3D 高斯紧凑预测。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 DNA-Rendering、ActorsHQ、THuman2.0、RenderPeople 与 DyMVHumans 多数据集,包含高分辨率零样本评测与详尽消融。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑结构严谨,动机明确,关键公式与实现细节清晰完整。
- 价值: ⭐⭐⭐⭐⭐ 为低带宽沉浸式人体通信与实时流媒体中的三维紧凑表示提供了兼顾极速渲染与高保真度的高效技术路径。