跳转至

Progressive and Localized Super-Resolution of 3D Objects via Localized Latent Voxel Diffusion

会议: ECCV 2026
论文: ECCV 原文
PDF: ECCV PDF
领域: 3D 视觉
关键词: 3D asset generation, super-resolution, progressive refinement, localized diffusion, sparse voxel latent

一句话总结

针对现有 3D 扩散生成模型受限于固定体素分辨率与显存三次增长瓶颈的问题,PLSR 提出一种基于结构化稀疏隐空间的渐进式局部超分辨率框架,通过关联输入解耦构建局部图文三元组、轻量级低分辨率跨注意力微调 DiT、以及迭代去噪块缝合机制,仅凭单卡低成本微调即可将粗糙几何无缝超分至 \(2560^3\) 级精细几何与纹理。

研究背景与动机

高保真、细节丰富的 3D 资产生成在游戏工业、影视特效与工业设计中扮演着核心角色。近年来,基于原生 3D 扩散与流匹配(Flow Matching)的代表性方法(如 Craftsman、Hunyuan3D 以及 TRELLIS.2)通过在结构化稀疏体素隐空间中建模,极大推动了单图生成 3D 模型的实用化。然而,由于 3D 体素网格的计算与显存开销随分辨率呈立方级膨胀(\(\mathcal{O}(N^3)\)),现有主流生成基模通常只能在固定的适中隐空间分辨率(如 \(64^3\),对应 \(1024^3\) 物理体素)下完成全物体级训练。一旦需要生成工业生产所需的超高精度细节,直接扩大全局生成网格会导致显存溢出,而单纯依赖测试阶段免训练上采样又受制于基模先验的外推极限,容易产生模糊或几何形变。

这一困境的核心矛盾在于:用户对 3D 物体表面的高频几何与纹理细节有着无限精细的需求,但训练与推理阶段全物体级高分辨率监督和全局注意力的显存开销不可承受;与此同时,若像 2D 超分辨率那样切块独立处理,又极易在三维空间中引入接缝断裂、邻域不连续以及跨视角遮挡不一致等严重伪影。此外,现有几何超分辨率方法大多依赖多尺度配对 HR 数据集进行重头预训练,在高质量 3D 数据本就稀缺的背景下成本高昂。

本文的切入角度在于解耦「全局宏观拓扑」与「局部高频细节」:物体的高频几何与表面微结构本质上主要由局部表面邻域与对应局部特写纹理决定,与物体全局的绝对尺寸解耦。核心 idea:将全物体 3D 超分辨率任务分解为局部块级流匹配去噪子任务,构建关联局部三元组并引入轻量级低分辨率局部注意力完成低成本微调,在去噪的每一轮迭代中同步执行局部预测与中心加权加权融合,并以多轮级联方式渐进实现超高分辨率 3D 资产生成。

方法详解

整体框架

PLSR 输入一个由预训练 3D 生成模型给出的粗糙网格 \(O_l\)(或上一轮超分产物)以及参考图像 \(I\)(附带已知或估计的相机位姿),输出高分辨率高频精细网格 \(O_h\)。整个流水线在 TRELLIS.2 的结构化稀疏隐空间中展开,包含三个核心阶段:关联输入解耦、局部隐空间流匹配去噪、以及迭代分块融合与渐进级联。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入:粗糙网格 Ol + 参考图像 I"] --> B["关联输入解耦<br/>3D 体素切块 + 投影相机裁剪 2D 特写"]
    B --> C["局部隐式扩散模型<br/>轻量局部低分辨率注意力 + LoRA 微调"]
    C --> D["迭代分块去噪与缝合<br/>迭代内按中心距离加权聚合速度场"]
    D --> E["渐进式级联超分<br/>当前高分辨率潜码作为下阶段低分辨率输入"]
    E --> F["输出:超高分辨率精细网格 Oh"]

关键设计

1. 关联输入解耦:局部相对坐标与相机投影对齐的三元组构建 针对全局输入显存过高且绝对尺度绑定全局位置的问题,PLSR 提出关联输入解耦(Associative Input Decomposition),将三维全域分解为具备局部对齐条件的子任务三元组 \((P_{h,t}, P_l, I_p)\)。具体而言,系统将高分辨率稀疏体素网格划分为固定尺寸的局部 3D 块(例如 \(32^3\) 窗口),并在低分辨率隐码中对应裁剪出低分辨率块 \(P_l\)。为了彻底阻断模型对全局绝对位置线索的过拟合,模型强制将 \(P_h\) 和 \(P_l\) 内所有有效体素的坐标重新归一化至该局部块的原点相对坐标系。对于条件图像部分,系统将当前 3D 块的三维外接包围盒利用相机内外参投影回全局参考图 \(I\),裁剪出聚焦于当前三维局部的紧致特写图像块 \(I_p\) 并提取 DINOv3 视觉特征 \(F_{I_p}\)。对于多视角图像输入,采用基于体素渲染与深度测试的遮挡感知可见性打分(Visibility Score),在迭代中按可见度加权随机采样视角,对于完全被遮挡的隐蔽块则将视觉特征置零以回退到 3D 低分辨率隐码先验,保证了跨视角的局部几何与纹理对齐。

2. 局部隐式扩散模型:轻量级局部低分辨率注意力与 LoRA 微调 针对粗网格降采样与重网格化带来的微小体素坐标漂移、导致常规通道拼接(Channel Concatenation)因严格空间错位失效的难题,PLSR 避免了简单粗暴的通道拼接或全图自注意力计算,在冻结的 TRELLIS.2 Flow DiT 骨干上扩展了专门的局部条件交互分支。对于低分辨率输入 \(P_l\),首先通过预训练 VAE 解码器的前两个卷积残差块 \(\mathcal{D}_2\) 提取特征并完成 \(\times 2\) 上采样,使其空间尺寸与高分辨率块 \(P_{h,t}\) 对齐;随后,设计了轻量级低分辨率局部注意力层(Lightweight LR Attention),仅在小邻域半径内计算高分辨率体素与对应低分辨率单元之间的交叉注意力,以极低的计算开销实现对微小几何形变的自适应容忍。为了避免破坏基础模型的先验分布并节省参数,LR 注意力层仅插入在 Transformer 块的子集中,其输出特征经过带仿射变换的 LayerNorm 后在后续块中复用,并通过 LoRA 微调模型中除输入输出层之外的全部线性层。模型整体训练遵循条件流匹配(Conditional Flow Matching)目标: $$ \mathcal{L}{\mathrm{CFM}}(\theta) = \mathbb{E}}, \epsilon} \left| v_\theta\left(P_h(t), \mathcal{D2(P_l), F) \right|_2^2 $$ 训练过程完全在从适中分辨率数据多样化采样的局部块上进行,无需代价昂贵的全局超高分辨率 3D 网格监督。}, t\right) - (\epsilon - P_{h,0

3. 迭代分块去噪与缝合:去噪内同步与中心加权边界消除 针对传统分块超分在推断边界处产生的几何断层与拼接缝隙(Seams),PLSR 摒弃了在最终去噪产物上进行一次性静态拼接的策略,创新地将「切块-去噪-融合」机制嵌入到流模型的每一次去噪迭代步 \(\Delta t\) 中。在每个时间步 \(t\),全局高分辨率隐状态 \(Z_{h,t}\) 被划分为带重叠边界的局部块,局部 denoiser 独立并行计算各块的速度预测场;随后在重叠区域采用基于空间距离的高斯式中心衰减权重进行加权平均,使得置信度高的中心区域占主导、缺乏上下文的边缘区域平滑过渡,最终缝合成全局统一的速度场 \(v_{\mathrm{pred}}\),用于执行全局离散 ODE 积分更新: $$ Z_{h, t - \Delta t} = Z_{h,t} + \Delta t \cdot v_{\mathrm{pred}} $$ 由于所有局部块在每一次更新后都会重置回统一连续的全局隐码基础,相邻块之间在生成全程保持了紧密的邻域感知,从根本上消除了块边缘处的不连续性。

4. 渐进式级联超分:无缝支撑任意倍率的分辨率放大 由于局部 SR 模型的训练完全基于相对分辨率比例与局部近邻先验,其学习到的去噪能力脱离了全局绝对物体尺寸的束缚。在实际部署中,PLSR 采用渐进式级联策略(Progressive Cascading):系统以 \(640^3\) 的粗糙隐空间骨架为输入,首轮超分将其上采样至 \(1280^3\);接着将生成的高分辨率隐状态直接作为第二轮的低分辨率输入 \(Z_l\),进一步迭代超分至 \(2560^3\) 极高分辨率。相比一步到位的超大倍率外推,渐进式阶梯放大保证了多尺度高频细节的由粗到细涌现,不仅内存占用固定在单块 GPU 的承受范围之内,还使模型能够灵活适应不同场景下的任意定制化精度需求。

损失函数 / 训练策略

模型在 Objaverse-XL 中筛选出的 30K 美学评分 \(\ge 6.5\) 的 3D 资产上训练,物体预先使用 TRELLIS.2 VAE 编码为 \(64^3\) 隐码,并通过减面重编码构建 \(32^3\) 低分辨率对。训练时局部高分辨率块尺寸为 \(32^3\)(低分辨率为 \(16^3\)),局部图像分辨率为 \(1024^2\)。除流匹配均方误差损失 \(\mathcal{L}_{\mathrm{CFM}}\) 外,引入权重 \(\lambda = 0.005\) 的轻量正则化项以约束图像特征调制通路的退化。优化器采用 AdamW(学习率 \(1\times 10^{-5}\),权重衰减 0.1,EMA 系数 0.999),随机应用颜色抖动、几何仿射变形与局部 Dropout 数据增强以提升鲁棒性。几何与纹理超分模型分别训练 2 个 epoch,单卡 A100 (80GB) 仅耗时约 50 GPU 小时即可完成收敛。

实验关键数据

主实验

论文在两套测试集上展开评估:包含 90 个高精复杂 3D 资产的 Sketchfab Pseudo-GT 测试集(客观指标评测),以及包含 70 个涵盖角色、动物、机械道具的 Open-world 极具挑战性测试集(VLM ELO 盲测评测)。对比基线包括前沿开源方案 TRELLIS.2(分别测试 \(1536^3\) 默认级联与 \(2560^3\) 直接放大)、UltraShape、DetailGen3D 以及 MVPaint UVR。

表 1: Sketchfab Pseudo-GT 客观指标对比(几何 CD 乘以 \(10^3\),HFR 乘以 \(10^2\))

方法 几何 LPIPS ↓ 几何 FID ↓ 几何 HFR ↑ 几何 CD ↓ 几何 F1 ↑ 纹理 LPIPS ↓ 纹理 FID ↓ 纹理 HFR ↑
TRELLIS.2 (1536) 0.122 60.37 0.981 0.0247 0.059 0.150 70.20 1.501
TRELLIS.2 (2560) 0.122 63.19 0.923 0.0225 0.036 0.158 72.77 1.482
UltraShape 0.167 72.03 0.876 1.3982 0.109 - - -
DetailGen3D 0.187 93.35 0.645 0.4600 0.083 - - -
MVPaint UVR - - - - - 0.154 77.18 1.052
Ours (2560) 0.109 55.89 1.088 0.0139 0.145 0.125 59.89 1.646

表 2: Open-world 测试集 GPT-5.2 盲评 ELO 评分对比(基准 1500 分)

方法 几何细节丰富度 ↑ 几何参考对齐 ↑ 几何无伪影 ↑ 几何整体质量 ↑ 纹理细节丰富度 ↑ 纹理参考对齐 ↑ 纹理无伪影 ↑ 纹理整体质量 ↑
TRELLIS.2 (1536) 1775 1774 1736 1790 1553 1621 1624 1599
TRELLIS.2 (2560) 1627 1592 1492 1572 1494 1426 1441 1416
UltraShape / MVPaint 1246 1385 1551 1356 1197 1369 1358 1350
DetailGen3D 869 927 1111 925 - - - -
Ours (2560) 1982 1821 1608 1855 1756 1582 1575 1633

消融实验

论文通过 GPT-5.2 评测系统对比了三种消融变体:(1) 未经局部微调的 TRELLIS.2 原生流模型直接分块推理(w/o model);(2) 去除局部块间重叠融合(w/o overlap);(3) 单步直接超分、不进行多轮级联递增(w/o prog.)。

表 3: 核心组件消融实验(GPT-5.2 评测 ELO 评分)

配置 几何细节丰富度 ↑ 几何参考对齐 ↑ 几何无伪影 ↑ 几何整体质量 ↑ 纹理细节丰富度 ↑ 纹理整体质量 ↑ 说明
w/o model 1291 1281 1209 1281 1288 1271 缺乏局部 SR 微调,直接分块推断出现严重模式坍塌与语义漂移
w/o overlap 1611 1559 1550 1574 1624 1609 去除重叠融合后,局部边界处出现明显的体素断裂与不连续缝隙
w/o prog. 1424 1552 1665 1537 1441 1475 单步大倍率放大无法合成多尺度高频微结构,细节提升幅度受限
Full Model 1672 1606 1575 1605 1645 1643 完整模型在细节合成与结构平滑性之间取得最佳平衡

关键发现

  • 基模外推局限与渐进必要性:直接将 TRELLIS.2 分辨率由 \(1536^3\) 强行提高至 \(2560^3\) 时,几何 FID 从 60.37 恶化至 63.19,ELO 从 1790 骤降至 1572。这表明原生物体级生成模型在未经局部适配时,无法泛化到训练尺度之外;而 PLSR 采用渐进式局部放大将 ELO 提升至 1855,验证了局部相对映射对打破尺度壁垒的关键作用。
  • 去噪迭代内融合是消除缝隙的胜负手:消融表与可视化表明,若不进行重叠加权,即便具有低分辨率几何锚点,网格在 \(32^3\) 块边界依然存在硬接缝;将缝合嵌入至每步流积分后,无伪影评分显著改善,实现了真正视觉无缝的超高分辨率拼接。
  • 多条件视角的增益:将参考图像视点数从 1 增加至 4 时,法向与颜色渲染的 LPIPS 分别由 0.109 / 0.125 进一步降低至 0.103 / 0.119,说明基于相机可见度的视角动态采样有效补充了自遮挡面与背面区域的细节先验。

亮点与洞察

  • 解耦绝对尺寸与相对细节:将 3D 超分任务重构为局部几何-图像关联映射,使得模型既能在大规模中等分辨率资产上低成本高效训练,又能在推理期任意递推至极端超高分辨率。
  • 去噪迭代步内同步缝合机制:不同于在生成完毕后拼合网格的传统做法,在流匹配积分每一步即时加权融合局部速度场,使邻接块在隐空间连续演化中自发对齐,极为优雅地解决了三维切块拼接的接缝顽疾。
  • 低成本单卡微调范式:仅通过 LoRA 微调结合轻量级局部交叉注意力,仅耗费 50 GPU 小时即可将 4B 参数量的复杂 3D 生成大模型转化为强大的局部超分引擎,大幅降低了 3D 超分技术的研究与工业落地门槛。

局限与展望

  • 依赖输入网格的初始宏观拓扑:本方法定位于超分辨率增强,不具备大幅纠正输入粗糙网格全局拓扑错误或拓扑缺失的能力;若初始网格存在严重几何拓扑破损,超分结果将放大这些结构性缺陷。
  • 相机位姿精度与图像质量敏感性:局部图像裁切依赖由 MapAnything 估计的相机参数;若估计位姿严重偏差,将导致局部 3D 几何与投影 2D 细节产生错误匹配或错位纹理。
  • 特定隐空间绑定的迁移成本:当前模型深度依托于 TRELLIS.2 的稀疏体素 VAE 表示;若未来迁移至基于点云、无界 NeRF 或 3DGS 的其他潜在空间,需要重新调整局部离散化逻辑并重新适配。

相关工作与启发

  • vs TRELLIS.2: TRELLIS.2 采用全局稀疏体素隐空间自级联生成,受限于固定分辨率训练和单次全局注意力显存开销,极端分辨率下会出现模糊与伪影;PLSR 则在保留其紧致隐表示的基础上引入局部切块与渐进扩散,以极小的显存开销实现向 \(2560^3\) 的无缝高频超分。
  • vs SDF-Diffusion / SuperCarver: SDF-Diffusion 局限于密集体素或 SDF 场,显存占用极大且难以表征复杂大场景资产;SuperCarver 依赖逆渲染更新多视角法线,优化耗时较长。PLSR 在流匹配隐空间中直接完成几何与 PBR 纹理的联合分块生成,具有显著的推理效率与几何一致性优势。
  • vs UltraShape / LATTICE: UltraShape 等方法需要大规模超高分辨率 3D 数据集的完整端到端重训练,训练算力代价极大;PLSR 通过在冻结基模上低成本插入局部 LR 注意力与 LoRA,提供了一种轻量高效的即插即用升级路径。

评分

  • 新颖性: ⭐⭐⭐⭐☆ [提出基于关联三元组的局部 3D 隐空间流扩散,并巧妙引入去噪步内同步缝合机制]
  • 实验充分度: ⭐⭐⭐⭐⭐ [涵盖客观指标对比、GPT-5.2 盲测 ELO、完整模块消融以及多视角影响分析]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑链条严密,动机具体深入,方法论与实验设计论证自洽]
  • 价值: ⭐⭐⭐⭐☆ [成功打破 3D 生成显存三次扩张壁垒,为低算力条件下生成工业级高精 3D 资产提供了极其落地的方案]