DiffGI: Differentiable Geometry Images for High-Fidelity Thin-Shell 3D Generation¶
会议: ECCV 2026
论文: ECCV 原文
项目: https://ejshim.github.io/diffgi/
领域: 3D 视觉
关键词: 几何图像, 可微Marching Squares, 薄壳3D生成, 截断符号距离场, 潜在扩散模型
一句话总结¶
DiffGI 提出将连续 2D 截断符号距离场(TSDF)引入几何图像并构建可微 Marching Squares 算法,结合几何感知法向渲染损失,在极紧凑的 \(32 \times 32 \times 4\) 潜在空间中实现了高保真、亚像素边界精度的薄壳与非流形 3D 表面端到端生成。
研究背景与动机¶
当前 3D 生成模型主要依赖以 SDF、体素占用网格和 NeRF 为代表的隐式体表示。这类方法通过学习连续的 3D 空间函数,在水密网格与平滑几何生成中取得了显著成效。然而,对于服装、板式家具框架等工业与日常场景中广泛存在的薄壳(thin-shell)及非流形(non-manifold)开边界结构,体素隐式场在强行满足闭合表面假设时经常产生虚假厚度或正反面粘连。此外,Marching Cubes 提取的网格天然欠缺 UV 坐标,难以直接对接布料物理仿真、材质贴图等工业下游流水线。
将 3D 表面参数化展开到 2D 正则网格的多图块几何图像(Multi-chart Geometry Images)虽然具有天然的 UV 对齐优势并可直接复用成熟的 2D 生成网络,但现有代表方案(如 Omages、GIMDiffusion、GarmageNet)均采用离散的二值占用图记录有效表面区域。二值掩码以阶跃函数定义边界,不仅严重依赖网格分辨率、在下采样过程中造成严重的阶梯状锯齿和高频边界信息丢失,而且后续的网格重构(如边界吸附)属于非可微后处理,割裂了 2D 潜在表征与 3D 几何损失的端到端联合优化。
针对这一瓶颈,本文切入的角度是:不必将可微等值面提取局限在立方体级 \(O(N^3)\) 的 3D 体素空间,而是将其降维引入 2D UV 几何图像域。核心 idea:使用连续的 2D 截断符号距离场(TSDF)替代离散二值掩码以保留亚像素边界信息,并构建解析线性插值的可微 Marching Squares(DMS)算子与法向渲染监督,在极紧凑的 2D 潜在空间中实现薄壳网格的端到端生成。
方法详解¶
整体框架¶
DiffGI 的全流程围绕“3D 网格 ↔ 2D TSDF 几何图像 ↔ 紧凑隐空间”构建。首先,离线预处理阶段通过 AABB 规则排样、表面重心坐标采样、外扩膨胀与 2D TSDF 变换,将输入 3D 薄壳网格转化为 \(256 \times 256 \times 4\) 的连续几何图像张量(3 通道 3D 坐标位置图 + 1 通道 TSDF 距离场)。随后,DiffGI-VAE 将几何图像压缩至 \(32 \times 32 \times 4\) 的潜在空间。在解码重构阶段,从预测的 TSDF 与坐标图中,通过可微 Marching Squares(DMS)解析提取 2D 边界顶点并双线性采样得到 3D 网格表面,最终结合可微法向光栅化实现 3D 几何损失对 2D 权重的反向传播。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入 3D 薄壳网格"] --> B["亚像素 2D 截断符号距离场表征<br/>AABB 排布 + 连续 2D TSDF 构造"]
B --> C["DiffGI-VAE 潜在压缩<br/>SD 1.5 权重扩展 + 32×32 紧凑隐空间"]
C --> D["可微 Marching Squares 网格重构<br/>解析线性插值 + 零交叉拓扑求解"]
D --> E["几何感知法向渲染损失<br/>nvdiffrast 光栅化 + 3D 表面梯度回传"]
E --> F["潜在扩散模型下游生成<br/>DiT 骨干 + Flow-Matching 多条件生成"]
关键设计¶
1. 亚像素 2D 截断符号距离场表征:消除分辨率敏感与阶梯锯齿
针对传统几何图像采用二值占用图导致网格下采样时边界破坏和严重锯齿的问题,该设计在 2D UV 展开域中以连续的截断符号距离场(TSDF)取代离散二值掩码。具体流程首先采用 AABB 算法对 UV 图块进行全局等比排样与间隙填充,通过重心插值在 \(1024 \times 1024\) 网格上采样 3D 坐标构建 3 通道位置图,并对外围背景像素执行边缘扩张以防边界渗色;随后对每个像素计算其到最近图块轮廓的带符号欧氏距离(图块内为正、图块外为负),并将其截断在 15 像素范围内。经过双线性下采样到 \(256 \times 256 \times 4\) 时,TSDF 仍然平滑保留亚像素级的轮廓零点位置,使得即使经过 \(8\times\) 强下采样也能无损还原精细的衣片开边界。
2. 可微 Marching Squares 网格重构:打通 3D 几何梯度到 2D 张量的通道
针对经典 Marching Squares 使用离散查表无法嵌入深度学习反向传播计算图的矛盾,该设计推导了基于解析线性插值的可微顶点提取公式。当 2D TSDF 网格上相邻两像素的角点值 \(\phi_A\) 与 \(\phi_B\) 异号(\(\phi_A \cdot \phi_B < 0\))时,零交叉点落在其连接边上。为避免两点值接近导致分母归零引发梯度爆炸,算法采用带有正则化常数 \(\epsilon = 10^{-5}\) 的连续插值公式计算相对边界位置:
由于符号函数 \(\operatorname{sgn}(\cdot)\) 在反向传播中被视作常数,几何误差对 3D 顶点位置的梯度 \(\frac{\partial \mathcal{L}}{\partial V}\) 能够平滑穿过该比值传导回 2D TSDF 和位置图张量。对于 Marching Squares 中存在拓扑二义性的鞍点情况(Case 6 与 Case 9),算法确定性地采用将两个图块视为相互独立分离区域的连接约定。该模块完全采用 PyTorch 向量化张量算子实现,复杂度仅为 \(O(N^2)\),显著优于 3D 体素可微网格提取算法 \(O(N^3)\) 的开销。
3. 几何感知法向渲染损失:约束高频曲率与精细褶皱
针对单纯的像素级 L1 坐标重建损失难以有效约束 3D 表面法向和高频曲率、容易导致衣物折痕和锐利折角退化变钝的问题,该设计引入了基于可微光栅化的法向监督回路。利用 DMS 模块从解码特征中可微提取出预测网格 \(\hat{M}\),送入基于 nvdiffrast 的高效可微光栅化器渲染出四个固定视角的表面法向图 \(R(\hat{M})\),并与从真实网格 \(M^*\) 渲染的参考法向图直接对齐:
这一设计使 3D 表面高频几何特征能够直接转化为法向图像域的密集梯度,驱动 VAE 编码器在极度压缩的瓶颈层中优先保留关键的折角与边缘方向信息。
4. 潜在扩散模型下游生成:解耦全局拓扑与局部细节的多条件合成
针对几何图像图块排布具有离散不规则性、传统卷积网络诱导偏置难以捕捉跨图块全局拓扑联系的问题,该设计在 \(32 \times 32 \times 4\) 潜在空间之上构建了基于 Diffusion Transformer(DiT)与流匹配(Flow Matching)的生成框架。针对类别条件生成,采用 DiT-B/2 学习全局几何分布;针对单视角图像到 3D 任务,通过 DINOv2-Large 提取输入图像语义特征并通过交叉注意力注入 DiT-L/2,稳健推断未见背面的几何结构;针对 2D 裁片轮廓(Occupancy)条件下的悬垂生成任务,则选用轻量级 UNet-Tiny 保留局部空间对应。同时,在训练期间对 UV 图块引入随机 90 度旋转与重新排样的几何数据增强,消除了固定排样布局带来的空间先验偏差。
损失函数 / 训练策略¶
DiffGI-VAE 的整体训练目标由像素级重构、距离场对齐、几何感知法向约束与 KL 正则化项加权构成:
其中 \(\mathcal{L}_{\text{Pos}}\) 与 \(\mathcal{L}_{\text{TSDF}}\) 分别为位置图与 TSDF 图的 L1 损失。网络主干使用预训练的 Stable Diffusion 1.5 VAE 进行初始化,将首层卷积扩展为 4 通道并将新增输入通道权重初始化为零,从而在微调初期完整保留自然图像压缩学到的空间下采样表征能力。
实验关键数据¶
主实验¶
论文在工业级家具数据集 ABO 与复杂薄壳布料数据集 GarmageSet 上对几何重构保真度进行了系统评测,对比基线包括前沿几何图像模型 Omages 与 GarmageNet。所有指标中,Chamfer Distance(CD)、Earth Mover's Distance(EMD)和 Jensen-Shannon Divergence(JSD)越低越好,Normal Consistency(NC)越高越好。
| 方法 | 表征尺寸 | 数据集 (ABO) CD (×10⁻³) ↓ | ABO EMD ↓ | ABO JSD (×10⁻³) ↓ | ABO NC ↑ | 数据集 (GarmageSet) CD (×10⁻³) ↓ | GarmageSet EMD ↓ | GarmageSet JSD (×10⁻³) ↓ | GarmageSet NC ↑ |
|---|---|---|---|---|---|---|---|---|---|
| Omages | 64×64×4 | 0.89 | 0.25 | 0.92 | 0.89 | 1.31 | 0.17 | 1.79 | 0.95 |
| GarmageNet (Tess.) | N×72 | - | - | - | - | 2.19 | 0.21 | 32.61 | 0.88 |
| GarmageNet (Official) | N×72 | - | - | - | - | 1.89 | 0.17 | 5.51 | 0.90 |
| Ours (DiffGI-VAE) | 32×32×4 | 0.83 | 0.23 | 0.89 | 0.83 | 0.46 | 0.16 | 1.24 | 0.96 |
在单视角图像生成 3D 任务上,论文进一步与前沿 3D 大模型(TRELLIS、TRELLIS.2)及 GarmageNet 进行了薄壳几何重建性能对比,评估指标包含 CD、F1 分数(阈值 0.01)、Hausdorff 距离(HD)及开边界 Chamfer 距离(BCD):
| 方法 | 平均顶点数 (#Vert.) ↓ | CD (×10⁻²) ↓ | F1-Score ↑ | HD (×10⁻²) ↓ | BCD (×10⁻²) ↓ |
|---|---|---|---|---|---|
| TRELLIS | 109K | 3.44 ± 6.97 | 0.28 ± 0.14 | 15.38 ± 27.57 | N/A |
| TRELLIS.2 (512²) | 380K | 11.01 ± 7.64 | 0.27 ± 0.14 | 69.70 ± 50.00 | 12.44 ± 8.56 |
| GarmageNet | 526K | 4.31 ± 3.03 | 0.20 ± 0.12 | 23.76 ± 11.12 | 5.64 ± 2.94 |
| Ours (DiffGI) | 23K | 1.35 ± 0.47 | 0.48 ± 0.12 | 8.42 ± 3.25 | 2.91 ± 0.83 |
消融实验¶
为厘清 2D 连续 TSDF 表征与几何感知法向渲染损失(\(\mathcal{L}_{\text{Normal}}\))的独立贡献,论文在 GarmageSet 数据集上开展了解耦消融实验。为了在公平条件下评估二值占用基线,作者对其使用了可微版本的 Omages 镶嵌重构:
| 表征类型 (Rep.) | 法向渲染损失 (\(\mathcal{L}_{\text{Normal}}\)) | CD (×10⁻³) ↓ | EMD ↓ | JSD (×10⁻³) ↓ | NC ↑ |
|---|---|---|---|---|---|
| 离散二值占用 (Occ.) | × | 1.503 | 0.171 | 4.539 | 0.906 |
| 离散二值占用 (Occ.) | ✓ | 1.313 | 0.166 | 4.257 | 0.947 |
| 连续 TSDF (TSDF) | × | 0.595 | 0.165 | 2.169 | 0.921 |
| 连续 TSDF (TSDF, Ours) | ✓ | 0.461 | 0.160 | 1.244 | 0.961 |
计算效率与硬件开销对比进一步验证了 2D 潜在扩散在推理速度与显存方面的压倒性优势:
| 方法与任务配置 | 硬件环境 | 峰值显存 (Peak VRAM, GB) ↓ | 单样本生成耗时 (Time, sec) ↓ |
|---|---|---|---|
| TRELLIS-image | RTX A6000 Ada | 16.28 | 4.52 |
| TRELLIS.2 (512²) | RTX A6000 Ada | 2.65 | 12.35 |
| TRELLIS.2 (1024²) | RTX A6000 Ada | 6.41 | 45.14 |
| Omages | RTX A6000 Ada | 2.49 | 52.00 |
| GarmageNet | RTX A6000 Ada | 0.96 | 0.40 |
| Ours-Label | RTX A6000 Ada | 1.18 | 0.50 |
| Ours-Image | RTX A6000 Ada | 3.22 | 0.80 |
| Ours-Image | RTX 4070 (12GB) | 3.22 | 1.21 |
| Ours-Image | MacBook M4 (纯 CPU) | - | 8.52 |
关键发现¶
- 连续 TSDF 表征对整体几何轮廓的提升占主导地位:仅将占用图替换为 TSDF(不加法向损失),CD 即可从 \(1.503 \times 10^{-3}\) 骤降超过一半至 \(0.595 \times 10^{-3}\),且 JSD 降低超过 \(52\%\),直接印证了亚像素距离场在抵御下采样信息灭失方面的核心价值。
- 法向渲染损失是曲率和法向一致性的强力正则项:在 TSDF 基础上引入 \(\mathcal{L}_{\text{Normal}}\),NC 从 0.921 进一步跃升至 0.961,成功滤除了边缘的高频锯齿与非物理波动。
- 薄壳几何下体素大模型存在严重结构失真:通用基础模型 TRELLIS 与 TRELLIS.2 倾向于给薄壳强加体积厚度,导致开边界误差 BCD 高达 \(12.44 \times 10^{-2}\);而 DiffGI 的 BCD 仅为 \(2.91 \times 10^{-2}\),且仅需 2.3 万个网格顶点即可达到更高的 F1 分数(0.48 vs 0.28)。
- 推理速度极快且硬件门槛低:相比 Omages 耗时 52 秒或体素大模型动辄占用 16GB 以上显存,DiffGI 在消费级显卡 RTX 4070 上仅需 1.21 秒与 3.22GB 显存,甚至在苹果 M4 芯片的笔记本 CPU 上也能在 8.52 秒内完成高质量薄壳生成。
亮点与洞察¶
- 将等值面提取降维至 2D 连续空间:巧妙避开了 3D Marching Cubes / DMTet 在三维体素网格上 \(O(N^3)\) 爆炸的内存与计算开销,通过 2D 截断距离场与解析线性插值实现 \(O(N^2)\) 的全可微顶点回传。
- 亚像素边界编码破解几何图像的下采样魔咒:传统几何图像被迫在庞大分辨率(如 \(768 \times 768\))与锯齿走样之间妥协,DiffGI 证明连续 TSDF 能够在 \(32 \times 32\) 超紧凑潜在空间中完整保留工业薄壳几何。
- 具有明确工程落地价值的极低算力架构:无需昂贵的高性能计算集群,单张消费级显卡即可实现 1 秒级生成,并可直接输出带 UV 坐标的物理仿真网格,展现出极强的工业落地潜力。
局限与展望¶
- 极锐利机械边缘的圆角化:基于线性插值的 Marching Squares 对机械零件等极端锐利的几何尖角会产生微小的局部圆角钝化,难以完美重构非平滑奇异点。
- 跨图块边界可能存在接缝:由于各 UV 图块是独立进行 Marching Squares 拓扑提取的,相邻图块边界处可能出现微小的拼缝撕裂,对于极端严苛的闭环物理布料仿真带来潜在挑战。
- 欠缺材质与纹理联合生成:当前框架仅专注于 3D 几何与法向生成,尚未扩展至高质量 RGB 纹理及 PBR 物理材质贴图的联合潜在建模。
相关工作与启发¶
- vs Omages: Omages 直接在 \(64 \times 64\) 分辨率下使用二值占用图生成几何图像,由于缺乏可微网格提取,只能使用固定的离散镶嵌后处理,且推理单样本需 52 秒;DiffGI 引入连续 TSDF 与可微 Marching Squares,在更小的 \(32 \times 32\) 隐空间中兼得更高的边界保真度与 1 秒级生成速度。
- vs GarmageNet: GarmageNet 依赖预定义的单裁片几何向量与多阶段启发式提取算法,单网格提取即耗时约 5.1 秒且无法泛化至家具等通用结构;DiffGI 采用统一的 2D 展开表征,在服装和家具通用数据集上均展现出领先的重构指标与极高的提取效率。
- vs TRELLIS / DMTet: 3D 体素大模型以闭合水密网格为基本假设,处理薄壳衣物时易产生非物理虚假厚度且网格顶点过密(>10万顶点);DiffGI 坚持以表面为中心(surface-centric)的几何图像范式,用轻量网格保留干净利落的开边界。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次将连续 2D TSDF 与可微 Marching Squares 结合引入多图块几何图像,实现端到端薄壳网格生成。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖家具与服装两大基准,进行了严格的解耦消融、效率测试及多种条件生成验证。
- 写作质量: ⭐⭐⭐⭐⭐ 数学推导清晰,核心痛点切入精准,图表详实且论证充分。
- 价值: ⭐⭐⭐⭐⭐ 解决了薄壳 3D 生成中长期存在的虚假厚度与锯齿痛点,直接打通了工业下游轻量化 UV 网格的实用管线。