跳转至

MSVS-VAE: Multi-Scale Anchored VecSet for High-Fidelity 3D Reconstruction

会议: ECCV 2026
论文: ECCV 原文
领域: 3D 视觉
关键词: 3D VAE, VecSet, 3D 重建, 点混洗上采样, 局部注意力卷积

一句话总结

针对传统集合式 3D 表示在精细几何重建中面临的过度平滑与空间分辨率受限瓶颈,MSVS-VAE 引入分层点混洗上采样渐进增加锚定潜变量密度,并用轻量局部算子 AVS-Conv 替代全局交叉注意力,在维持紧凑表征的同时实现了媲美高分辨率稀疏体素的高保真重建与约 10 倍的解码加速。

研究背景与动机

高保真 3D 生成模型正普遍转向以隐式扩散(latent diffusion)为核心的主流范式,而在这一范式下,底层 3D 变分自编码器(3D VAE)的几何重构质量与压缩表征能力直接构成了整套管线的性能瓶颈。理想的 3D VAE 需要在看似冲突的双重指标之间寻找平衡:一方面,潜在空间必须保持极高紧凑性,以便降低下游扩散模型的建模复杂度与序列生成开销;另一方面,隐变量又必须具备足够充足的几何表达能力,以便在解码与表面提取时精确还原高频几何细节与复杂薄壁拓扑。

现有的 3D VAE 方案主要分裂为两大表征范式,各自存在显著缺陷。基于稀疏体素(sparse voxel)的方法(如 SparseFlex、Direct3D-S2、SparC3D)直接构建于结构化网格之上,利用 3D 稀疏卷积或局部注意力可轻易恢复锐利几何边缘;然而,这类方法需要保留数万甚至数十万个激活体素(典型规模达 50k 至 210k tokens),极度消耗显存与显存带宽,且由于几何完全绑定在离散网格上,轻微的体素预测误差就会直接引发破洞、不闭合的非流形网格等拓扑崩溃。与之相对,基于集合(set-based)的表征(如 VecSet、Lattice 等)将 3D 物体编码为置换不变的 1D 潜在向量集合,天然支持任意分辨率的连续空间查询与水密网格提取;但其重建保真度长期大幅落后于体素方案。

这一保真度差距的核心矛盾在于现有 VecSet 架构的两大内在机理缺陷:首先,标准 VecSet 解码极度依赖查询点与全量潜在 token 之间的全局交叉注意力(global cross-attention),这种全局软加权机制不可避免地引入了过度平滑效应,平抑了局部的锐利曲率;其次,为了兼顾扩散训练,VecSet 的 token 数量通常严格限制在数千规模(如 4k tokens),比稀疏体素少了数十倍,极其有限的空间潜变量密度使得局部表面无法获得足够的自由度来容纳精细几何细节。

本文的核心 idea 是打破“集合式表示必须全局跨注意力且空间稀疏”的旧框架,提出分层点混洗上采样机制在解码阶段渐进密集化锚定 VecSet,并设计基于动态 KNN 权重的几何局部卷积算子 AVS-Conv 替代全局注意力,结合多尺度查询融合实现体素级精细度与连续集合特性的统一。

方法详解

整体框架

MSVS-VAE 整体流程分为编码器(Encoder)与分层解码器(Decoder)两个主要阶段。在编码阶段,模型输入带有法向量的表面点云与从目标网格提取的体素锚点中心,首先通过轻量 PointNet 提取局部特征,并利用 AVS-Conv 将表面点几何聚集到各个锚点 query 形成初始紧凑潜在集合,随后通过残差自注意力块进一步建模全局关联。在解码阶段,紧凑的锚定潜变量经过分层点混洗上采样模块逐级提升局部空间密度,最后由多尺度查询解码模块同时汇聚粗粒度与细粒度的空间隐变量,精确预测连续空间查询点的截断带符号距离(TSDF)。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入表面点云 + 采样锚点中心"] --> B["AVS-Conv 局部编码<br/>点云特征聚合到锚点 query"]
    B --> C["自注意力块精炼<br/>获得粗尺度锚定潜变量 Z(0)"]
    C --> D["分层点混洗上采样<br/>分裂几何中心 + 特征通道混洗"]
    D --> E["多尺度查询解码<br/>多尺度 AVS-Conv 聚合粗/细特征"]
    E --> F["输出空间连续 TSDF<br/>等值面提取水密 3D 网格"]

关键设计

1. 几何感知局部聚合算子 AVS-Conv:打破全局注意力瓶颈与过度平滑

传统 VecSet 解码阶段使用全局交叉注意力,其计算复杂度随着潜变量规模 \(M\) 和查询采样点数 \(N\) 的增长呈 \(O(MN)\) 爆炸,且会在大尺度范围内无差别加权,抹平薄壁与微小凹凸的几何特征。针对该问题,本文提出基于局部邻域的 AVS-Conv 算子。给定空间查询点 \(q_i\),模型通过欧氏距离检索其在支撑集中的 \(K\) 个最近邻 \(\mathcal{N}(i)\),并以相对坐标偏移 \(\Delta p_{ij} = p_j - q_i\) 经过位置编码 \(\gamma(\cdot)\) 后输入 MLP 计算动态权重: $\(w_{ij} = \mathrm{MLP}(\gamma(\Delta p_{ij})), \quad j \in \mathcal{N}(i)\)$ 随后将动态权重与支撑集特征进行通道级逐点相乘聚合,并叠加局部均值池化(编码阶段)或恒等残差连接(解码阶段)以及标准 FFN 变换。该算子将解码感受野显式约束在几何邻域内,既消除了非必要的全局平滑,又使计算复杂度从随 token 数二次上升骤降为对局部邻域 \(K\) 的常数级依赖,支持极快的高密度推断。

2. 分层点混洗上采样(Hierarchical Point-Shuffle Upsampling):渐进释放局部空间容量

为在保持下游扩散模型输入 token 紧凑(如 4k tokens)的前提下解决空间潜变量分辨率过低的问题,解码器设计了多阶段的点混洗上采样结构。设第 \(l\) 层的潜在集合为 \(\mathcal{Z}^{(l)} = \{(c_m^{(l)}, z_m^{(l)})\}_{m=1}^{M_l}\),模型通过特征混洗 MLP 将通道维度减半并分裂出 \(r\) 个子特征 \(\{\tilde{z}_{m,t}^{(l)}\}_{t=1}^r\),同时通过点分裂 MLP 从父特征预测 \(r\) 个空间几何偏移 \(\{\Delta c_{m,t}^{(l)}\}_{t=1}^r\)。更新后的子锚点中心与特征分别为: $\(c_{m,t}^{(l+1)} = c_m^{(l)} + \Delta c_{m,t}^{(l)}, \quad z_{m,t}^{(l+1)} = \tilde{z}_{m,t}^{(l)}\)$ 该操作以极小的通道维度开销将隐变量数量成倍扩大至 \(M_{l+1} = r \times M_l\),使隐变量物理分布紧密贴合格网微表面。随后,利用 AVS-Conv 在新潜变量集合上执行自聚合精炼,使空间密化的子潜变量之间交换局部结构信息。

3. 多尺度查询解码(Multi-Scale Query Decoding):粗细协同消除超局部伪影

如果空间查询仅依赖最精细层的稠密潜变量,由于局部 KNN 感受野急剧收窄,模型在光滑表面或低曲率区域极易受到局部噪声扰动,产生高频振荡或伪影。为此,多尺度查询解码模块在预测空间查询点 \(q_i\) 的 SDF 时,通过独立的 AVS-Conv 分别从所有 \(L\) 个渐进尺度(包括粗尺度的全景 token 和精细尺度的致密 token)中独立查询邻域特征,将其沿通道维度拼接后输入轻量级融合头部: $\(h_i = \mathrm{Concat}\big(\mathrm{AVS}^{(0)}(q_i; \mathcal{Z}^{(0)}), \dots, \mathrm{AVS}^{(L)}(q_i; \mathcal{Z}^{(L)})\big)\)$ 最终由输出 MLP 映射为带符号距离标量 \(\hat{s}_i\)。粗尺度潜变量负责锚定整体空间拓扑与大范围连续性,细尺度潜变量专注刻画高曲率与薄壁微小几何,实现了兼具低频平滑与高频锋利的重建表现。

损失函数 / 训练策略

训练采用截断带符号距离函数(TSDF)监督近表面区域,将真实 SDF \(s\) 截断归一化为 \(\bar{s} = \mathrm{clamp}(s/\tau, -1, 1)\),截断阈值设为 \(\tau = 1/128\)。总目标函数包含几何重建损失(\(\ell_1\) 结合 \(\ell_2^2\) 范数)与潜在空间的 KL 散度正则化项: $\(\mathcal{L}_{\mathrm{total}} = \lambda_{\mathrm{recon}} \left(\|\hat{s} - \bar{s}\|_1 + \|\hat{s} - \bar{s}\|_2^2\right) + \lambda_{\mathrm{KL}} \mathcal{L}_{\mathrm{KL}}\)$ 为突破高保真连续几何学习中庞大的显存瓶颈,训练策略分为两阶段:首先在完整 3D 资产上使用固定 \(M=4096\) tokens 进行 300k 步全局预训练,捕捉宏观拓扑;随后进行 100k 步分块微调(chunk-based fine-tuning),将同样的 4k tokens 密集分配到局部随机 3D 裁剪块内,仅监督近表面查询点,极大提升了模型对极限微小几何的表征敏锐度。

实验关键数据

主实验

在由 Objaverse、ABO 和互联网采集的挑战性 3D 几何物体构成的多基准测试集上,评估模型在网格距离(MD,数值缩放 \(\times 10^4\))及不同容差下的 F1-score(\(\times 10^2\))表现。对比涵盖经典集合式方法(Dora、HY3D2.1、Lattice)及最先进的稀疏体素方法(Direct3D-S2、SparC3D、SparseFlex)。

方法 表征类型 潜在 Token 数 Objaverse (MD↓ / [email protected]↑) ABO (MD↓ / [email protected]↑) in-the-wild (MD↓ / [email protected]↑)
Direct3D-S2 稀疏体素 \(\sim\)74k 3.301 / 95.100 2.091 / 97.181 2.771 / 97.020
SparC3D 稀疏体素 \(\sim\)50k 2.463 / 97.788 1.515 / 99.354 1.947 / 98.137
SparseFlex-512 稀疏体素 \(\sim\)50k 3.745 / 93.182 2.017 / 97.449 4.404 / 90.634
SparseFlex-1024 稀疏体素 \(\sim\)210k 2.165 / 97.327 1.092 / 99.902 2.014 / 98.944
Dora 集合式 4k 17.352 / 48.450 7.450 / 73.770 14.641 / 44.110
HY3D2.1 集合式 4k 11.485 / 63.085 5.384 / 84.036 11.895 / 57.096
Lattice 集合式 4k 11.502 / 82.365 2.941 / 97.107 10.703 / 74.764
Lattice 集合式 20k 3.183 / 95.373 2.283 / 99.088 3.737 / 91.872
MSVS-VAE (Ours) 集合式 4k 5.644 / 86.779 1.885 / 98.902 4.589 / 87.207
MSVS-VAE (Ours) 集合式 10k 2.422 / 96.458 1.485 / 99.843 2.416 / 95.842
MSVS-VAE (Ours) 集合式 20k 1.695 / 98.930 1.432 / 99.927 1.642 / 98.775
MSVS-VAE (Ours) 集合式 40k 1.395 / 99.621 1.216 / 99.924 1.231 / 99.726

针对 Dora-Bench Level-3 和 Level-4 尖锐几何边缘的高难度子集评测显示,MSVS-VAE-40K 在 Level-3 取得 MD 1.06(SparseFlex 为 1.74)、尖锐边缘 F 分数 S-F 97.4%(SparseFlex 为 95.6%),表现出极高的边缘还原保真度。

消融实验与效率分析

在原论文 Table 3 中,作者在多数据集上剥离多尺度查询解码(MSQ)与点混洗上采样(PSU)模块,检验各核心模块对保真度的贡献。此外,原论文 Table 4 评估了查询延迟(每次前向 200k 点 chunk 查询下的毫秒耗时)。

配置 / 模块去除 Objaverse MD↓ Objaverse [email protected] ABO MD↓ in-the-wild MD↓ 说明
Full model (MSQ + PSU) 1.395 99.621 1.216 1.231 完整模型
w/o MS-Query (MSQ) 1.690 99.322 1.439 1.626 仅依赖细粒度尺度,低曲率平滑区域出现高频伪影
w/o Upsample (PSU) 3.693 93.281 2.818 4.021 缺失上采样密集化,高频几何细节严重退化(最核心模块)

查询解码延迟对比(原论文 Table 4): 在 200k 查询采样点的测试负载下,Lattice 在 10k/20k/40k tokens 下的耗时分别为 792.21ms、1419.27ms、3068.05ms;而 MSVS-VAE 得益于 AVS-Conv 局域 KNN 聚合与 cuBQL 的 BVH 加速,耗时仅分别为 143.75ms、151.22ms、213.29ms,分别实现 5.5×、9.4× 与 14.4× 的解码加速,体现了优异的可扩展性。

关键发现

  • 点混洗上采样(PSU)是提升重构精度的决定性支柱:去除 PSU 后,Objaverse 的 MD 从 1.395 剧烈恶化至 3.693,[email protected] 从 99.621% 跌落至 93.281%,证明仅凭原始稀疏潜变量无法支撑细粒度表面重构。
  • 仅需 20k tokens,MSVS-VAE 在 Objaverse 上的 MD(1.695)便击败了消耗 210k tokens 的 SparseFlex-1024(2.165)以及 SparC3D(2.463),在保留连续集合紧凑性的同时压缩率高出约 10 倍。
  • 相比于 SparseFlex-1024 在极薄结构上频发的破洞与网格断裂,MSVS-VAE 生成的网格保持了严格的水密性(watertight)与连贯拓扑,消除了体素网格离散化误差导致的结构缺陷。

亮点与洞察

  • 上采样解耦生成与解码分辨率:在生成阶段维持下游扩散友好的紧凑序列(如 4k tokens),在解码阶段通过点混洗操作在内部渐进重构空间局部密集度,兼顾了生成轻量化与表面高精度的两全。
  • 以局部算子重塑集合式解码范式:以往普遍认为 VecSet 必须依托 Transformer 全局注意力以保证连续场表征,本文证明基于 KNN 与相对坐标的几何感知卷积 AVS-Conv 能够以快 10 倍的速度恢复更清晰的局部高频边界。
  • 测试期平滑扩展(Test-Time Scaling):模型在推断期展现了根据计算预算随意扩展 token 规模(4k 至 80k)从而无缝提升几何锐利度的灵活性,为可变精度 3D 资产渲染提供了良好接口。

局限与展望

  • 极端锐利边缘仍有平滑隐患:虽然指标大幅超越既有集合方法,但受限于连续隐式距离场的梯度连续先验,面对工业级 CAD 类极端锋利的非光滑直角边时,对比显式多边形 Dual Contouring 仍存在轻微倒角钝化。
  • 解码延迟仍高于纯稠密网格体素前向:尽管相比 Lattice 的全局注意力获得了超 10 倍加速,但由于需要动态执行 BVH 空间查询和局部 MLP 计算,速度仍落后于基于纯 3D 卷积的体素前向网络。
  • 缺乏外观纹理与材质联合建模:当前模型专注于纯几何网格的 TSDF 学习,未将 PBR 材质、反照率及颜色属性统一整合到多尺度潜空间中。

相关工作与启发

  • vs Lattice (ECCV 2024 / arXiv 2024):两者均使用锚定点增强 VecSet 的空间局部性;但 Lattice 解码依然完全仰赖全局交叉注意力,导致 40k tokens 下解码耗时超过 3 秒且重建存在过度平滑;MSVS-VAE 引入分层点混洗上采样与局部 AVS-Conv,在相同 token 规模下 MD 从 2.838 降至 1.395,且实现 14.4 倍延迟加速。
  • vs SparseFlex (ICCV 2025) & SparC3D:稀疏体素依赖巨大的离散激活网格,易产生表面粘连、破洞以及几何拓扑断裂;MSVS-VAE 在仅用其约 10%~40% 潜在 token 的极度紧凑条件下,不仅重构精度更优,还天然维持了无洞、水密且流形的完整几何。

评分

  • 新颖性: ⭐⭐⭐⭐☆ 巧妙将点云混洗上采样与几何卷积融合进集合式 3D VAE,突破了长期存在的过度平滑假说。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖多个主流数据集、极端薄壁测试集、严格的消融实验以及多尺度 token 扩展曲线与真实延迟测算。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑结构严整,痛点分析透彻,数学表述与架构示意图清晰自洽。
  • 价值: ⭐⭐⭐⭐⭐ 为 3D 原生生成扩散模型提供了兼具极致压缩率、超快解码速度与体素级高保真特性的下一代基础几何表征。