跳转至

Point Diffusion Mamba: Unified Diffusion-State-Space Modeling for Single-View 3D Reconstruction under Data Scarcity

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/NWUzhouwei/PDM
领域: 3D视觉
关键词: 单视角3D重建, 扩散模型, 状态空间模型, Mamba, 数据匮乏

一句话总结

针对低数据量下单视角 3D 重建中多义性严重且传统注意力开销巨大的瓶颈,本文提出融合局部几何聚合与双向 Mamba 的扩散状态空间架构 PDM,配合分层特征融合网络与动态加权采样,在极低显存与计算开销下实现了高精度点云重建。

研究背景与动机

从单张 2D 图像恢复完整且精确的 3D 几何结构是计算机视觉的核心挑战之一。由于从二维投影升维到三维空间在物理上具有天然的多义性,模型不仅需要推断可见表面的精细拓扑,还必须合理预测大面积未见区域的遮挡结构。尽管基于去噪扩散概率模型(DDPM)的生成方法在点云补全和细粒度生成上表现出优异潜力,但现有架构普遍高度依赖海量高质量 3D 配对标注数据。在实际应用中,由于高保真 3D 扫描数据稀缺且标注昂贵,处于数据匮乏(Data-Scarce Regime)条件下的 3D 几何恢复问题极度严峻且未被充分探索。

现有基于扩散的 3D 重建方案在架构效率与表征能力上存在根本矛盾。基于纯 MLP 的方法难以建模复杂的三维拓扑几何;基于三维体素与 3D 卷积的方法(如 PC2、Buildiff)具有 \(O(n^3)\) 的立方级显存开销,受限于分辨率且无法捕获长程全局上下文;而采用 Transformer 自注意力机制的方法(如 DiT-3D)受限于 \(O(n^2)\) 的二次计算复杂度,在处理长序列点云 patch 时计算与显存消耗急剧增加。状态空间模型(SSM / Mamba)虽在序列建模中展现出线性计算复杂度,但将其直接迁移至 3D 扩散生成仍面临两大障碍:一是点云具有无序性与空间不规则性,直接采用一维序列扫描容易引入虚假的时序依赖且难以感知细微局部几何;二是 Mamba 块通常在稀疏 patch 层面抽取高阶语义 token,而 3D 扩散去噪却对初始随机扰动点云中的每个点都要求精细的逐点噪声预测。

本文的切入角度是打破注意力机制与三维体素化的开销锁链,在轻量级扩散去噪骨干中系统性解耦局部邻域感知与双向长程上下文,并借助生成先验对冲稀疏监督带来的过拟合。核心 idea:构建集局部几何聚合、双向状态空间去噪与逐点分层传播于一体的统一扩散 Mamba 骨干,并结合生成先验与重建预测的动态加权采样,在低数据量下兼顾亚二次复杂度与高保真几何恢复。

方法详解

整体框架

PDM 的整体目标是以单张 2D 输入图像 \(J\) 为条件,从随机高斯扰动的无序点云 \(X_t \in \mathbb{R}^{N \times 3}\) 中逐步去噪还原出真实三维点云。流程首先使用预训练 ViT-32 提取二维图像多尺度特征,并通过可微分的光栅化投影函数将图像特征反投影至扰动点云表面,得到融合坐标与视觉线索的增强点云 \(X_f^t \in \mathbb{R}^{N \times (3+d_y)}\)。随后,利用最远点采样(FPS)选取 \(s\) 个几何中心点,并通过 K 近邻(KNN)将其划分为 \(s\) 个局部 point patch,经轻量级卷积与最大池化编码为 patch token \(F \in \mathbb{R}^{s \times d}\)。在去噪核心模块中,数据依次经过局部几何聚合模块提取稠密邻域特征,输入结合扩散步长嵌入的双向状态空间模块提取全局上下文,再由分层特征整合网络将抽象 token 上采样传播回全量逐点空间,输出最终的逐点噪声预测。在反向采样阶段,模型利用动态加权采样(DWS)将无条件生成先验与单视角重建预测自适应融合。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["单视角图像 J 与扰动点云 Xt"] --> B["特征光栅化反投影与 FPS-KNN Patch 化"]
    B --> C["1. 局部几何聚合(LGA)<br/>K-Norm 邻域标准化 + K-Pool 双重池化"]
    C --> D["2. 双向状态空间模块与时间条件注入(DDSM & Time Conditioning)<br/>正反双向扫描 + 扩散步长自适应调制"]
    D --> E["3. 分层特征整合网络(HFINet)<br/>多尺度 token 聚合 + 点特征插值传播至逐点空间"]
    E --> F["4. 动态加权采样策略(DWS)<br/>基于空间一致性动态自适应融合先验与重建"]
    F --> G["高精度重构点云输出"]

关键设计

1. 局部几何聚合(LGA):协同规整局部尺度并平衡显著细节与整体平滑 常规 Mamba 模块在直接处理离散 token 时,严重缺乏对三维局部连续几何流形的细粒度捕获能力。为弥补这一短板,LGA 模块通过紧密串联的 K-Norm 与 K-Pool 算子增强邻域几何表达。K-Norm 首先在中心点 token 空间建立 KNN 图(邻域大小为 \(n\)),针对每个局部邻域计算均值 \(\mu_i\) 与标准差 \(\sigma_i\),并通过局部归一化消除因点密度突变和尺度不均导致的特征畸变,将归一化后的中心差分特征与自身 token 拼接得到局部几何特征矩阵 \(G_{ij} \in \mathbb{R}^{2d}\)。紧随其后的 K-Pool 则通过混合池化机制聚合邻域信息: $\(H_i = \phi\left(\max_{j \in \mathcal{N}(i)} G_{ij} + \frac{1}{n}\sum_{j \in \mathcal{N}(i)} G_{ij}\right)\)$ 式中最大池化操作强制保留拐角、边缘与薄壁构件等显著几何突变,而均值池化则有效平抑高频噪声并强化连续平滑表面的稳定性,从而在进入全局序列建模之前构建起高鲁棒性的局部几何表示 \(H \in \mathbb{R}^{s \times d}\)。

2. 双向状态空间模块与时间条件注入(DDSM & Time Conditioning):消除伪序偏差并自适应调控去噪动态 标准 Mamba 依赖因果单向序列扫描,但三维点云由无序几何元素组成,单向扫描必然引入人为的人造序列先后依赖,导致重建结构对点云序列重排极度敏感。本文构建双向状态空间模块(DDSM),同时对正向特征副本 \(H_c\) 和通道翻转的逆向特征 \(H_r\) 执行离散状态空间演算,形式化表示为: $\(\text{DDSM}(H) = H + \zeta(H_c) + \eta(H_r)\)$ 正反双向的信息传递彻底消解了非因果几何体上的方向偏差,实现了全向空间上下文感知。为了将该状态空间骨干无缝适配到扩散去噪任务中,模型引入类似 DiT 的时间条件自适应调制机制(adaLN)。扩散时间步 \(t\) 经嵌入映射生成动态门控系数 \(\alpha(t)\)、自适应缩放因子 \(\beta(t)\) 与偏置因子 \(\gamma(t)\),按如下公式调整特征流: $\(H_{mb} = H + \alpha(t) \cdot \text{DDSM}(H \cdot (1 + \beta(t)) + \gamma(t))\)$ 该设计允许网络根据去噪所处的不同阶段(前期宏观轮廓成形 vs 后期微观细节去噪)自适应伸缩特征动态范围,大幅压制了状态空间在多步采样过程中易累积的随机波动。

3. 分层特征整合网络(HFINet):跨层级桥接稀疏抽象语义与逐点高保真去噪 Mamba 编码器在降采样后的 \(s\) 个 patch 中心上操作,输出的深层特征包含高阶全局语义,却严重丢失了全量 \(N\) 个空间点的坐标映射精度。然而,扩散概率模型的核心目标是对每一个带噪输入点预测其精确的位移向量 \(\epsilon_\theta\)。HFINet 首先拼接 Mamba 骨干中多层级的隐层特征 \(H'_{mb} = \{H_{mb1}, \dots, H_{mbM}\}\),并通过全图最大池化与平均池化提炼出全局上下文向量 \(H_g \in \mathbb{R}^{2d'}\)。随后,利用基于逆距离加权的点特征传播(Point Feature Propagation)算子 \(\tau\),将多层 patch 级特征反向内插回初始增强点云 \(X_f^t\) 的逐点空间,得到局部特征场 \(H_l = \tau(H', X_f^t) \in \mathbb{R}^{N \times d''}\)。最终,逐点局部特征 \(H_l\) 与全局上下文 \(H_g\) 沿通道拼接,经过轻量级多层卷积映射网络输出最终的逐点噪声预测: $\(X_{\text{pred}} = \phi(\text{concat}(H_l, H_g))\)$ 该多尺度分层集成有效避免了直接基于 token 预测点云带来的结构离散与孔洞伪影,显著提升了去噪精度。

4. 动态加权采样策略(DWS):基于空间几何一致性自适应融合生成先验与重建轨迹 在训练样本仅为常规数据集 10% 甚至更低的极端数据匮乏场景下,单视角重建网络容易对有限训练视角的可见表面产生过拟合,对遮挡部位的预测往往出现空洞、断裂或严重变形。本文训练一个同构的无条件 3D 点云生成 Mamba 模型,利用其在大规模未配对无条件形状生成中学到的结构完整性先验。在反向去噪采样过程中,重建模型生成的点云 \(X_r\) 与生成先验模型给出的点云 \(X_g\) 在每隔 32 步进行一次引导对齐。DWS 并非简单地进行全局线性平均,而是依据两模型在空间各个点位置的局域结构一致性计算动态权重: $\(w_j = \frac{1}{1 + \exp\left(-\delta \|x_{g,j} - x_{r,j}\|_2^2\right)}\)$ $\(\hat{X} = \{w_j x_{g,j} + (1 - w_j) x_{r,j}\}_{j=1}^N\)$ 当两模型对某区域预测高度吻合(距离平方较小)时,动态权重倾向于采纳重建预测以紧贴图像约束;而当重建模型在盲区或复杂区域出现崩塌、与先验出现明显空间分歧时,非线性 Sigmoid 权重迅速调整,引入生成先验填补几何断裂,从而在无标注或低标注情境下维持了严密的拓扑闭合性。

损失函数 / 训练策略

模型遵循经典点云扩散训练范式,以去噪均方误差作为全局优化目标: $\(\mathcal{L} = \mathbb{E}_{t, X_0, \epsilon}\left[\|\epsilon - \epsilon_\theta(X_t, t, J)\|^2\right]\)$ 式中 \(\epsilon_\theta\) 为 PDM 网络的预测噪声。在训练阶段,重建网络与用于 DWS 引导的生成模型分别独立训练 140,000 次迭代,二者不共享权重。在采样融合时,核心骨干层保持冻结,仅在特定步数执行基于距离敏感系数 \(\delta\) 的 DWS 轨迹交汇。整个模型训练仅需单张消费级 NVIDIA GeForce RTX 3090 GPU,展现出极高的工程实用性。

实验关键数据

主实验

评估在合成基准 ShapeNet-R2N2(包含 Chair、Airplane、Car 三大代表类别)以及真实场景基准 Pix3D(Chair、Sofa、Table 类别)上展开。评价指标采用 Chamfer Distance(CD \(\times 10^4 \downarrow\))与 [email protected](F1 \(\uparrow\))。

下表为 ShapeNet-R2N2 在不同训练数据比例(10% 数据匮乏、50% 中等规模、100% 全量数据)下的定量对比结果:

方法 会议/来源 Chair (10%) Chair (50%) Chair (100%) Airplane (10%) Airplane (50%) Airplane (100%) Car (10%) Car (50%) Car (100%)
PC2 CVPR 2023 97.25 / 0.393 73.58 / 0.437 65.57 / 0.464 88.00 / 0.605 76.39 / 0.628 65.97 / 0.655 64.99 / 0.524 62.59 / 0.542 64.36 / 0.547
CCD-3DR arXiv 2023 89.79 / 0.418 63.13 / 0.474 58.47 / 0.498 81.29 / 0.612 72.46 / 0.635 62.77 / 0.651 63.13 / 0.531 62.25 / 0.550 61.88 / 0.562
BDM-M CVPR 2024 94.94 / 0.395 71.56 / 0.446 64.48 / 0.468 87.75 / 0.604 73.19 / 0.629 65.16 / 0.653 63.53 / 0.524 60.71 / 0.549 64.16 / 0.554
BDM-B CVPR 2024 94.67 / 0.410 69.99 / 0.463 64.21 / 0.485 83.62 / 0.612 68.66 / 0.641 59.04 / 0.660 60.48 / 0.539 62.58 / 0.554 65.85 / 0.559
MESC-3D CVPR 2025 101.51 / 0.381 73.47 / 0.427 65.69 / 0.458 74.31 / 0.611 51.28 / 0.619 50.54 / 0.714 56.28 / 0.522 44.48 / 0.532 51.99 / 0.602
PDM (本文) ECCV 2026 82.41 / 0.419 68.85 / 0.465 62.14 / 0.488 60.64 / 0.614 50.14 / 0.663 48.66 / 0.719 55.23 / 0.542 55.53 / 0.558 51.54 / 0.607

下表展示真实世界复杂图像 Pix3D 数据集上的泛化对比结果,数据格式为 CD \(\downarrow\) / F1 \(\uparrow\):

方法 会议/来源 Chair (CD↓ / F1↑) Sofa (CD↓ / F1↑) Table (CD↓ / F1↑)
PC2 CVPR 2023 115.94 / 0.443 47.17 / 0.445 202.77 / 0.397
CCD-3DR arXiv 2023 111.42 / 0.456 44.91 / 0.450 196.28 / 0.418
BDM-M CVPR 2024 113.40 / 0.449 44.50 / 0.451 202.08 / 0.413
BDM-B CVPR 2024 110.60 / 0.455 45.05 / 0.455 186.46 / 0.429
MESC-3D CVPR 2025 91.36 / 0.370 41.98 / 0.284 206.16 / 0.306
PDM (本文) ECCV 2026 79.28 / 0.499 41.43 / 0.463 184.35 / 0.422

下表汇总模型运行效率与资源消耗对比(Batch size = 1):

方法 参数量 (M) 推理耗时 (s) 显存占用 (GB)
PC2 / CCD-3DR 47.41 48.46 1.73
BDM-M 74.82 52.47 2.01
BDM-B 73.78 50.81 1.93
MESC-3D 74.84 34.05 0.86
PDM (本文) 56.34 20.73 0.39

消融实验

消融实验均在 Pix3D Chair 基准上进行。下表系统评估了各核心构件的有效性以及不同输入序列长度的影响:

模块消融配置 F1-Score↑ CD↓ 说明 序列长度 F1-Score↑ CD↓
Full Model 0.499 79.28 完整 PDM 模型 128 (默认) 0.499 79.28
w/o LGA 0.478 91.14 去除局部几何聚合,F1 显著下降 0.021 32 0.485 84.31
w/o HFINet 0.435 126.57 去除分层特征整合,误差暴涨 47.29,F1 剧跌 0.064 64 0.474 91.15
Self-Attention 0.481 85.46 Mamba 替换为标准自注意力,速度变慢且精度下降 256 0.491 80.57
One-SSM 0.474 88.72 仅用单向 SSM,无法消除点云无序导致的虚假序列偏置 384 0.487 82.29

下表进一步验证了模型规模扩展性与动态加权采样策略的优越性:

模型规格 结构配置 F1-Score↑ CD↓ 采样策略 F1-Score↑ CD↓ 说明
PDM-S 9 层, 192 隐层维度 0.479 90.87 Direct Sampling 0.483 85.27 传统无先验直接采样
PDM-B 12 层, 384 隐层维度 0.499 79.28 BDM Sampling 0.492 80.23 基于贝叶斯先验的静态融合
PDM-L 18 层, 768 隐层维度 0.492 80.23 Our DWS 0.499 79.28 基于空间一致性动态自适应权值

关键发现

  • 数据匮乏场景下的绝对主导优势:在 10% 低数据量条件下,PDM 在 ShapeNet 椅子上的 Chamfer Distance 达到 82.41,相比次优的 CCD-3DR(89.79)降低约 9%,更显著超越 MESC-3D(101.51)达 23% 之多。在 1% 与 5% 的极限稀缺压力测试中,MESC-3D 发生严重拓扑溃缩,而 PDM 仍能维持完整三维轮廓。
  • 逐点反向传播(HFINet)是性能基石:消融显示去掉 HFINet 后 CD 误差直接从 79.28 飙升至 126.57,跌幅最大。这证明单纯依靠 Mamba 输出的稀疏 patch 语义 token 无法支撑高精度的逐点噪声预测,必须通过分层传播重构逐点几何场。
  • 双向扫描有效消除点云虚假时序:单向状态空间(One-SSM)相比完整的双向扫描(DDSM)F1 降低了 0.025,验证了点云这种非欧氏离散数据结构必须通过双向信息对冲单向扫描的伪序假设。
  • 算力与显存开销成倍压缩:PDM 的推理显存仅需 0.39 GB,约为 MESC-3D(0.86 GB)的 45%,仅为 BDM-M(2.01 GB)的 19.4%;推理耗时从 PC2 的 48.46s 压缩至 20.73s,全面突破了三维体素化与全自注意力的效率瓶颈。

亮点与洞察

  • 将状态空间模型深度引入 3D 扩散生成:突破了现有研究将 Mamba 局限在判别式分类或分割的局限,针对扩散去噪过程重新定制了时间自适应调制与双向流形扫描机制,实现了 \(O(n)\) 复杂度下的高质量几何建模。
  • 空间几何一致性感知的先验加权采样:巧妙利用无条件生成模型对先验流形的记忆能力,以局域点欧氏差异动态调控 Sigmoid 融合权重,为解决低数据监督下的过拟合与遮挡空洞开辟了新范式。
  • 即插即用的轻量三维生成设计思路:避开计算爆炸的三维体素与网格转换,通过“FPS-KNN 局部聚合 + 线性双向时空建模 + 特征反向插值传播”流水线,为在边缘与消费级设备上运行高分辨率 3D 扩散模型提供了高度可行的参考架构。

局限与展望

  • 类别独立训练成本:当前实验中无条件生成模型与条件重建模型需分阶段独立训练,反向采样过程中需额外加载生成分支,增加了多类别大规模落地时的管理负担。
  • 极端几何复杂度的细节保真度:对于具有极度复杂镂空和非刚性薄壁结构的物体,基于 4096 个点的离散点云表示仍难以完全捕捉连续微表面,未来可探索将 PDM 骨干推广至连续隐式场(SDF / NeRF)或 3D Gaussian Splatting 表征。
  • 端到端联合蒸馏方向:未来可探索将生成先验与重建分支在训练期直接进行知识蒸馏或端到端权重交织,从而免除反向推理阶段运行两套模型的显存与计算开销。

相关工作与启发

  • vs PC2 (CVPR 2023):PC2 依赖耗时的 3D 卷积与体素网格(运行时显存高达 1.73 GB),且在数据匮乏下易发生形变;PDM 摒弃体素化,通过点云 patch 与 Mamba 序列建模将显存骤降至 0.39 GB,且在 10% 数据下 CD 领先 14.84。
  • vs BDM (CVPR 2024):BDM 引入双向贝叶斯扩散先验,但骨干网络仍使用二次开销的注意力或体素卷积,推理耗时长达 50s+;PDM 在模型架构上直接换装线性双向 Mamba,并设计更为灵活细粒度的逐点空间动态加权采样(DWS),推理耗时压降至 20.73s。
  • vs MESC-3D (CVPR 2025):MESC-3D 在全量数据下表现较优,但在数据稀缺(10%及以下)时因过拟合而性能急剧恶化(Chair 10% CD 达 101.51);PDM 凭借双向状态空间与生成先验在 10% 数据下取得 82.41 CD,在数据受限场景下鲁棒性大幅胜出。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次系统性提出结合局部几何聚合、双向状态空间与动态生成先验融合的 3D 扩散点云重建框架。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 ShapeNet 多数据比例与真实世界 Pix3D 数据集,提供详尽的模块消融、序列长度、模型尺度及效率对比。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑结构严谨清晰,问题定义切中要害,数学公式与图表配合紧密。
  • 价值: ⭐⭐⭐⭐⭐ 为数据匮乏场景下的轻量级单视角 3D 重建提供了兼具高精度与极致显存效率的优雅解决方案。