ROAR-3D: Routing Arbitrary Views for High-Fidelity 3D Generation¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/Tencent-Hunyuan/ROAR-3D
领域: 3D 视觉
关键词: 3D生成, 多视角条件, 视角路由, 双流注意力, 无姿态3D重建
一句话总结¶
ROAR-3D 提出一种轻量级多视角 3D 生成范式,通过在预训练单视角扩散模型中引入基于特征亲和度的 Token 级视角路由器、解耦朝向与几何的双流交叉注意力机制及朝向扰动训练策略,无需相机姿态即可灵活融合任意数量未校准视角的几何细节。
研究背景与动机¶
基于扩散模型(Diffusion Transformer, DiT)的单图像到 3D 生成技术取得了显著进展,能够从单幅 2D 图像合成结构完整、几何细致的三维形状。然而,单视角生成在本质上存在固有几何二义性:对于遮挡或未观测到的背面区域,模型只能依赖隐式先验进行合理“幻觉”,无法保证生成几何与用户提供的多视角参考细节严格对齐。
为消解二义性,直觉上的解决方案是引入多视角条件。然而现有方法面临显著两难:一方面,传统多视角重建或固定视角生成方法(如 LRM、LGM)强依赖精确已知的相机位姿或固定的正交规范视角集合,无法处理真实世界中任意角度的拍摄图像、草图及视频抽帧;另一方面,近期尝试引入外部几何重建模块(如 VGGT)提供特征先验的方法,受制于生成隐空间与重建特征之间的巨大域差异,不仅训练开销昂贵,且生成质量被外部模块的重建误差所严格限制。同时,预训练单视角模型通过海量数据已经习得了强大的 2D-3D 空间对应能力,但若直接简单拼接多视角图像输入交叉注意力层,不同视角相互冲突的全局朝向信号会严重破坏原有生成先验。
核心 idea:充分复用预训练单视角 DiT 的空间对齐能力,以 3D 隐式 token 作为空间锚点,通过轻量级 Token 级视角路由器动态为每个 3D token 匹配最具信息量的视角,并结合双流交叉注意力与朝向扰动训练,彻底将全局朝向控制与局部几何细节迁移解耦。
方法详解¶
整体框架¶
ROAR-3D 基于流匹配(Flow-Matching)DiT 与 3DShape2VecSet 隐式三维几何 VAE 构建(以 Hunyuan3D 2.1 为骨干模型)。系统整体输入包含指定的一个主视角(参考视角)以及任意数量 \(V-1\) 个未校准的辅助视角图像,输出为统一规范坐标系下的高精度 3D 几何。方法整体分为三个紧密协同的模块:Token 级视角路由器负责为每个 3D 空间 token 分配最匹配的 2D 视角,双流交叉注意力分别处理全局朝向定位与辅助几何迁移,最后通过基于高分辨率几何表征的精炼网络进一步提升表面细致程度。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["多视角图像输入<br/>主视角 + 任意辅助视角"] --> B["Token 级视角路由器<br/>3D Token 与平均池化补丁特征匹配"]
B --> C["双流交叉注意力架构<br/>主视角流确定朝向 + 辅助流注入几何"]
C --> D["朝向扰动训练策略<br/>离散旋转隐空间破除朝向耦合"]
D --> E["粗粒度 3D 几何隐表征"]
E --> F["两阶段几何精炼网络<br/>高分辨率体素引导与多视角增强"]
F --> G["高质量 3D 网格输出"]
关键设计¶
1. Token 级视角路由器:基于特征亲和度的隐式 2D-3D 空间对应
将多视角图像直接拼接输入交叉注意力机制会导致计算复杂度随视角数线性增加,并使每个 3D token 面临多视角冲突信号。为解决该问题,路由器在 Transformer 每一层独立运作,利用 3D 隐式 token 本身携带的空间语义作为锚点,直接选择亲和度最高的一幅视角。由于选择发生在整幅视角层级而非孤立 patch,若采用图像全局 CLS token 会丢失局部对应关系;ROAR-3D 采用 DINOv2 patch 特征的全局平均池化向量 \(\bar{f}_v\) 作为视角表征。路由器投影矩阵 \(W_q^{(\ell)}\) 与 \(W_k^{(\ell)}\) 直接由预训练交叉注意力模块参数初始化,极大降低了学习成本。为保持端到端可导,前向计算采用硬 Gumbel-Softmax 离散抽取最高分视角 \(v^*_i\),反向传播则通过软概率权重直通传递梯度:
2. 双流交叉注意力架构:解耦全局朝向控制与局部几何结构迁移
单视角模型中的跨模态注意力层同时承担了“根据视角确定三维物体的全局规范朝向”与“将 2D 纹理/几何线索注入 3D 空间”两种相互缠绕的功能。当引入多个未校准视角时,多方向朝向信号交织导致几何变形与双头/多尾等严重伪影。ROAR-3D 构建双流交叉注意力网络:主分支 \(\text{CA}_p\) 继承预训练权重并绑定用户指定的主参考视角,严格锚定输出几何的全局规范姿态并建立基准形貌;辅助分支 \(\text{CA}_a\) 则通过深拷贝 \(\text{CA}_p\) 初始化,专门用于接收被路由器指派到辅助视角的 3D token,仅负责提取各视角的互补几何细节。该设计使得单 token 交叉注意力计算量与单视角基线完全一致,在仅增加轻微推理开销的前提下实现了平滑的多视角融合。
3. 朝向扰动训练策略:破除对齐捷径以强化视角无关几何迁移
尽管通过结构拆分设立了辅助分支 \(\text{CA}_a\),但在常规训练中,3D 真实几何隐空间默认与主视角保持严格规范对齐,导致 \(\text{CA}_a\) 仍倾向于利用潜在的刚体姿态规律抄近道,而在测试面对非标准相对姿态时失效。为此,ROAR-3D 引入朝向扰动策略,以概率 \(p_{\text{pert}}=0.2\) 在训练时激活:首先将点云隐表征随机沿方位角旋转 \(\{0^\circ, 90^\circ, 180^\circ, 270^\circ\}\)(排除与任何输入视角对齐的旋转),打破主视角的规范参照;接着剥离主视角身份,将全部输入视角均视作辅助视角并强制送入 \(\text{CA}_a\);最后仅反向传播更新 \(\text{CA}_a\) 的参数而冻结主分支。这一设计强迫辅助分支必须纯粹依靠内容级特征亲和度进行 2D 到 3D 几何映射,获得真正的视角无关几何迁移能力。
4. 两阶段几何精炼网络:高分辨率几何潜空间的细节增强
为进一步消除网格表面的平滑感与噪声伪影,系统级联了基于 LATTICE 架构的第二阶段几何精炼模块。精炼模型在 6144 个更高分辨率的高阶潜空间 token 上运作,并使用参数量更大的 DINOv2 ViT-G/14 提取细粒度图像特征。该阶段同样完整部署了上述 Token 级视角路由、双流交叉注意力和朝向扰动机制,以第一阶段生成的粗粒度体素网格作为位置先验,充分挖掘多视角下微细几何凹凸与复杂雕花边缘。
损失函数 / 训练策略¶
模型采用 Flow-Matching 条件生成目标进行训练。第一阶段骨干网络基于 Hunyuan3D 2.1 DiT(4096 个 latent token,隐藏维度 2048),图像编码器采用冻结的 DINOv2 ViT-L/14。训练时辅助视角数量在 1 至 4 之间均匀随机采样,以赋予模型任意视角伸缩能力;优化器采用 AdamW,初始学习率 \(1 \times 10^{-5}\) 并配合余弦衰减调度。训练迭代 50K 步,仅需约 3-4 个 GPU 天。在测试阶段,模型能够零样本直接扩展至 1 到 12+ 视角的输入。
实验关键数据¶
主实验¶
在保留的 Objaverse/ObjaverseXL 100 个高质量 3D 物体测试集上,将 ROAR-3D 与单视角生成模型、多视角重建模型及多视角条件生成方法进行量化对比。评估指标包括倒角距离(CD,\(\times 10^{-3}\),越低越好)、F1 分数(阈值 0.1 与 0.05,%,越高越好)以及基于预训练跨模态模型 ULIP 与 Uni3D 的图像-形状语义一致性度量(ULIP-I、Uni-I,越高越好)。
| 方法 | 类型 | CD↓ | F1(0.1)↑ | F1(0.05)↑ | ULIP-I↑ | Uni-I↑ |
|---|---|---|---|---|---|---|
| Hunyuan3D 2.0 | 单视角生成 | 35.421 | 80.5 | 64.2 | 0.141 | 0.302 |
| Hunyuan3D 2.1 | 单视角生成 | 34.031 | 82.6 | 68.7 | 0.147 | 0.317 |
| Trellis2 | 单视角生成 | 33.722 | 84.4 | 71.0 | 0.149 | 0.321 |
| LGM | 多视角重建 | 58.009 | 71.0 | 52.3 | 0.089 | 0.215 |
| VGGT | 多视角重建 | 34.686 | 81.3 | 65.4 | 0.103 | 0.211 |
| Hunyuan3D 2.0-MV | 多视角条件生成 | 33.954 | 82.4 | 67.1 | 0.147 | 0.301 |
| ReconViaGen | 多视角条件生成 | 32.055 | 85.1 | 72.7 | 0.165 | 0.345 |
| ROAR-3D (阶段 1) | 多视角条件生成 (粗几何) | 25.372 | 88.7 | 76.8 | 0.168 | 0.346 |
| ROAR-3D (阶段 2) | 多视角条件生成 (完整模型) | 21.039 | 91.2 | 81.6 | 0.173 | 0.349 |
消融实验¶
在相同训练设置(50K 迭代)下,以朴素拼接多视角 token 的注意力模型作为 Baseline,依次累加各核心设计对第一阶段模型进行消融验证:
| 配置 | CD↓ | F1(0.1)↑ | F1(0.05)↑ | ULIP-I↑ | Uni-I↑ | 说明 |
|---|---|---|---|---|---|---|
| Baseline | 39.412 | 79.6 | 66.3 | 0.154 | 0.322 | 朴素多视角 token 拼接 |
| + Token 级视角路由器 | 28.143 | 86.3 | 73.5 | 0.159 | 0.335 | 解决特征冲突与计算爆炸,CD 大幅下降 11.27 |
| + 双流交叉注意力 | 26.732 | 87.5 | 75.1 | 0.163 | 0.339 | 解耦全局朝向与几何迁移,消除结构漂移 |
| + 朝向扰动策略 (完整阶段 1) | 25.372 | 88.7 | 76.8 | 0.168 | 0.346 | 破除规范姿态先验依赖,达到第一阶段最优性能 |
关键发现¶
- 视角路由器贡献最为显著:从 Baseline 引入 Token 级路由器后,CD 从 39.412 骤降至 28.143(降幅达 28.6%),表明消除多视角间的注意力冲突和建立基于 3D 锚点的特征选择机制是多视角融合的核心瓶颈。
- 解耦朝向对复杂拓扑至关重要:定性实验(如喷气式战机、摩托车)显示,缺乏双流结构与扰动训练的模型容易将机头的进气道/尖锥结构复制到机尾,或生成重复车轮;双流注意力与朝向扰动协同运作,彻底解决了这种多视角下的自相矛盾与对称伪影。
- 无缝测试时视角扩展:虽然训练时仅随机采样 1 至 4 个辅助视角,但由于每 token 只由路由器动态路由到最匹配视角,测试阶段可直接线性扩展至 12+ 视角,且几何保真度随视角增加单调提升。
亮点与洞察¶
- 3D 隐空间作为天然路由锚点:不同于在 2D 像素空间做复杂特征匹配,将结构化 3D latent token 作为 Query 与 2D 池化特征直接比对,巧妙地复用了预训练 DiT 内部已经习得的跨模态空间对应先验,避免从头训练大型对齐网络。
- 双流设计优雅化解姿态与结构的二元对立:通过指定单一主视角把控全局旋转度,将其他所有视角降级为纯粹的“局部表面补丁供给源”,既维护了坐标系的确定性,又最大化吸纳了多视角结构。
- 朝向扰动的对抗式数据构造技巧:人为旋转 3D latent 隐空间并排除输入视角方向,迫使辅助流完全丧失对全局规范姿态的记忆依赖,是保证非受限多视角泛化性的极佳实用技巧。
局限与展望¶
- 主视角选择的依赖性:当前系统仍需指定单张图像作为主参考视角以决定全局坐标系,若主视角存在严重遮挡或视差畸变,可能影响三维整体的姿态稳定性。
- 极端几何遮挡与薄壳结构:在面对多视角均未捕捉到的极度内凹缝隙或微小薄壁部件时,生成仍受限于 VAE 隐表征的离散分辨率上限。
- 纹理材质联合生成:当前架构聚焦于高质量几何表面的恢复,后续可进一步向 PBR 材质生成及高光法线解耦方向拓展。
相关工作与启发¶
- vs ReconViaGen: ReconViaGen 引入外部 VGGT 模型提取几何特征输入 DiT,受制于跨网络表示差距和 VGGT 本身的重建瑕疵;ROAR-3D 无需外部重建模型与位姿输入,计算轻量且几何指标全方位大幅领先(CD 21.039 vs 32.055)。
- vs LGM / InstantMesh: 传统前馈快速重建模型对输入视角严格限定且严重依赖规范位姿;ROAR-3D 原生支持任意视角集合、草图与现实非校准图片,并具备强大的生成补全能力。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 巧妙利用 3D Token 路由与双流注意力实现解耦的多视角无姿态条件生成
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 Objaverse 几何基准、Anyview-200 真实分布及详尽消融
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密,动机分析透彻,架构与机制阐述非常清晰
- 价值: ⭐⭐⭐⭐⭐ 极大拓展了 3D AIGC 在概念设计、多视角草图融合及视频建模场景下的实用边界