跳转至

Inclusive Interactive Collisions for Multi-View Consistent Compositional 3D Generation

会议: ECCV 2026
论文: ECCV 2026 Poster 3923
代码: https://github.com/threestudio-project/threestudio
领域: 3D视觉
关键词: 组合式3D生成、3D高斯泼溅、交互区域碰撞、多视角自适应SDS、多视角一致性

一句话总结

本文提出针对组合式多物体3D生成的优化框架 I2C-3D,通过包容性交互碰撞约束引导高斯基元自然汇聚于物体间接触区,并结合实例与空间词元交叉注意力调控的多视角自适应分数蒸馏采样,显著化解了物体交互失真与多视角幻觉难题。

研究背景与动机

随着预训练2D文本到图像扩散模型和可微渲染技术的飞速发展,基于分数蒸馏采样(SDS)与3D高斯泼溅(3DGS)的单物体3D生成取得了长足进步。然而,将这些技术直接推向包含多个实体及其复杂物理接触的组合式3D场景时,现有方案面临显著瓶颈。一方面,现有的前馈3D重建骨干网络主要在单物体数据集上训练,极度缺乏多物体协同交互的高质量3D数据;另一方面,基于2D扩散先验的SDS优化在处理包含复杂空间关系和多实体的文本提示时,由于2D模型本身缺乏细粒度空间可控性,极易出现属性错位、实体混淆以及视角间几何撕裂的“多面怪”(Janus问题)。

更为根本的物理与几何矛盾在于多物体边界处的高斯基元交互建模。统计分析表明,两个产生交互行为的物体之间,其高斯基元在三维空间中并非均匀随机杂合,而是高度集中于物体包围盒中心连线的中点附近,形成近似柱状的高密度接触区。现有组合式生成方法要么直接孤立优化各物体后再机械拼装,导致交界面悬空或生硬穿模;要么放任全局SDS优化,引发高斯基元过度分散、漂移产生黑色浮空噪点,破坏物体几何完整性。

针对上述难题,本文的核心切入点是跳出单纯依靠2D语义引导接触的思路,将几何包围盒先验与基于三角形两边之和几何定理的物理碰撞约束引入高斯优化过程,并辅以跨视角显式调控的SDS。核心 idea:将组合式3D生成解耦为“LLM主导的粗粒度局部-全局布局规划”与“细粒度高斯精细化优化”两阶段,通过包容性交互碰撞约束(I2C)显式引导高斯基元在中点接触区合理碰撞,并利用视角自适应注意力调控的MV-ASDS实现跨视角一致的高保真生成与渐进式编辑。

方法详解

整体框架

I2C-3D 采用由粗到精(Coarse-to-fine)的两阶段优化管线。首先在粗粒度阶段,利用大语言模型从复杂多实体提示词中解析出物体间的相对拓扑关系与尺寸,构建局部到全局的3D包围盒布局;随后将布局投影为前视2D蓝图,驱动布局引导生成模型生成参考图,由SAM分割出独立前景并通过预训练的大规模多视角高斯模型(LGM)重建出各个实体的初始3DGS资产并合成粗糙场景。在第二阶段精细化优化中,算法引入包容性交互碰撞约束(I2C)分别对包围盒内高斯点实施边界规整并引导少量游离高斯点朝交互接触区汇聚;同时在渲染视点上执行多视角自适应分数蒸馏采样(MV-ASDS),跨视角联合注入空间位置与实例先验,端到端优化场景及实体高斯参数。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入多物体文本提示词"] --> B["阶段1:局部-全局3D布局规划<br/>LLM推断相对拓扑与包围盒尺度"]
    B --> C["阶段2:粗粒度单物体生成与组合<br/>布局引导扩散生成 + SAM分割 + LGM前馈重建"]
    C --> D["包容性交互碰撞约束 (I2C)<br/>盒内填充约束 + 三角边长几何碰撞引导"]
    C --> E["多视角自适应分数蒸馏采样 (MV-ASDS)<br/>空间/实例交叉注意力调制 + 跨视角扩散去噪"]
    D --> F["输出高保真多视角一致3D组合资产<br/>兼具自然物理交互与可扩展3D编辑"]
    E --> F

关键设计

1. 局部-全局3D布局规划与前馈单物体初始化:破解多实体空间混淆与交互破损

现有多模态模型在直接预测复杂多物体3D全局绝对坐标时经常发生坐标重叠或间距过大,使得后续物理接触无法构建。本文设计了层次化的局部-全局布局推断流程:先让LLM解析实体词及其局部空间相对关系,预测出各实体的局部包围盒尺寸;再结合相机视角提示将各局部包围盒嵌入全局统一三维世界坐标系。在初始化阶段,将生成的3D包围盒投影至前视二维平面,驱动布局引导扩散模型生成参考图并由SAM进行无补全(inpainting-free)的实例掩码切割。通过直接借助LGM从带真实接触破损视角的参考图生成初始高斯点云,避免了2D图像修复算法在遮挡接触区域编造虚假结构所带来的多视角几何污染。

2. 包容性交互碰撞约束(I2C):基于几何几何距离准则的双重高斯空间引导

为了使各物体既能维持自身外形饱满度,又能在接触界面产生自然物理挤压碰撞,I2C设计了由K-means聚类支撑的两级约束。首先利用K-means以预设包围盒中心为初始聚类中心,将全局高斯点划分至各实体簇。针对簇内绝大多数高斯基元,施加包围盒内(In-Box)约束:

\[\mathcal{L}_{\text{IB}} = \sum_{i=1}^{k}\sum_{j=1}^{N}\Big[\text{clamp}\big(\max(m_i^j - B_i^{\max}, 0)\big) + \text{clamp}\big(\max(B_i^{\min} - m_i^j, 0)\big)\Big]\]

其中 \(m_i^j\) 表示第 \(i\) 个实体内第 \(j\) 个高斯基元的局部坐标,\(B_i^{\max}\)\(B_i^{\min}\) 分别为包围盒的最长和最短边边界。该损失驱使 \(95\%\) 以上的高斯点充盈包围盒内部,杜绝物体几何扁塌;而对于落在包围盒外部、位于相邻物体过渡空间的剩余少量基元,本文基于初等几何中“三角形两边之和大于第三边”定理设计了交互碰撞损失(Interaction Collision Loss):

\[\mathcal{L}_{\text{IC}} = \sum_{k=1}^{N} \max\big(0, (d_{k,i} + d_{k,j}) - d_{i,j} - \tau\big)\]

式中 \(d_{i,j}\) 为相邻两包围盒中心之间的欧氏距离,\(d_{k,i}\)\(d_{k,j}\) 分别为第 \(k\) 个高斯基元到两盒中心的距离,\(\tau\) 为防过度堆叠挤压的尺度自适应裕度(设为包围盒最大对角线的5%)。当该点恰好位于两盒连线段上时 \(d_{k,i} + d_{k,j} = d_{i,j}\) 取得理论下界,因而损失函数以解析梯度强力拉动交界处基元向连线中点收敛,形成自然紧凑的物理碰撞界面。整体I2C损失为 \(\mathcal{L}_{\text{I2C}} = \lambda_{\text{IB}}\mathcal{L}_{\text{IB}} + \lambda_{\text{IC}}\mathcal{L}_{\text{IC}}\)

3. 多视角自适应分数蒸馏采样(MV-ASDS):双词元注意力解耦与跨视角先验注入

传统SDS在多物体场景中通常无法兼顾物体纹理细节与全局相对方位,仅增强空间词注意力会导致物体局部结构模糊,而单视点蒸馏必然引发严重的视角不一致。为此,本文设计了自适应交叉注意力调制机制,将注意力图按词元属性分类干预:

\[A'_i := \begin{cases} k \cdot A_i, & \text{若 } i \text{ 为空间关系词元 } (i_{\text{spa}}) \\ A_i \cdot M_i + \frac{A_i}{k} \cdot (1 - M_i), & \text{若 } i \text{ 为实体对象词元 } (i_{\text{ins}}) \\ A_i, & \text{其他情况} \end{cases}\]

其中 \(M_i\) 为对应实体的二维前景掩码,\(k=1.25\)。该操作放大了空间词元的全局注意力响应,同时将实体词元的注意力严格收敛于其所属掩码内、抑制掩码外串扰。在此基础上,引入多视角扩散模型(Stable Zero123)构建视角自适应蒸馏梯度:

\[\nabla_\theta \mathcal{L}_{\text{MV-ASDS}} = \mathbb{E}_{t,\epsilon,v} \left[ w(t) \big(\epsilon_{\phi^*}(x_t; y, t, v) - \epsilon\big) \frac{\partial g(\theta, v)}{\partial \theta} \right]\]

除了对拼接后的全场景进行多视角蒸馏外,还将每个实体高斯通过平移 \(\beta = \text{Mean}(B_i)\) 与尺度归一化 \(\gamma = B_{\text{global}}/B_i\) 映射至规范体空间单独计算实体级MV-ASDS,双重拉平跨视角的纹理一致性,彻底根除了多面怪问题。

损失函数 / 训练策略

系统采用 PyTorch 与 ThreeStudio 框架搭建。优化总步数设定为 1000 次迭代。损失超参数中,盒内约束权重 \(\lambda_{\text{IB}} = 0.15\),碰撞约束权重 \(\lambda_{\text{IC}} = 1.0\),盒内基元占比收敛阈值设定为 \(0.95\)。扩散指导模型采用 Stable Zero123,引导采样时间步 \(t=50\),注意力缩放系数 \(k=1.25\)

实验关键数据

主实验

评估在包含50个文本提示及对应真实/扩散生成图像的 ComboVerse 基准数据集上展开。通过 CLIP-Score 评测语义对齐,并借助 GPT-4V 围绕文本对齐度、空间布局、几何保真度及场景质量打分,同时统计多面怪率(Janus Rate, JR)与跨视角一致性准确率(ACC)。

模型 3D表示 CLIP-Score ↑ GPT-4V 文本对齐 ↑ GPT-4V 空间布局 ↑ GPT-4V 几何保真 ↑ GPT-4V 场景质量 ↑ JR (%) ↓ ACC (%) ↑ 训练耗时 ↓
DreamFusion NeRF 0.273 50.6 51.3 50.9 28.5 55.6 42 6.0h
Latent-NeRF NeRF 0.299 67.9 70.6 68.4 67.7 58.6 44 15min
SJC NeRF 0.303 65.2 69.7 67.3 71.2 61.1 48 2.0h
Magic3D NeRF 0.276 55.1 53.4 54.5 52.4 49.4 52 5.3h
GaussianDreamer 3DGS 0.295 78.4 75.3 74.3 67.5 62.5 48 15min
GSGEN 3DGS 0.304 80.9 72.9 73.7 70.2 64.2 50 3.0h
GraphDreamer 3DGS 0.286 78.5 80.3 81.1 79.6 69.7 48 3.0h
I2C-3D (本文) 3DGS 0.314 92.7 84.5 82.6 85.3 17.3 88 28min

消融实验

针对方法的核心组件及关键交互几何裕度参数 \(\tau\) 进行定性与定量分析(对应论文 Section 4.4 与 Fig. 10、Fig. 11):

配置 / 组件 观察现象与量化表现 物理/视觉成因分析
Full Model (完整方案) 实体形态饱满,接触边缘自然挤压,无漂移噪点与纹理模糊 I2C 与 MV-ASDS 协同工作,兼顾拓扑贴合与视角连贯
w/o MV-ASDS 跨视角几何严重走样,纹理外观丢失(如正面圆形枕头侧视变方) 缺失多视角一致扩散先验导致视角间退化与模式坍缩
w/o I2C 约束 物体结构不饱满,外围产生离群高斯杂点,接触边界出现大面积黑斑噪点 缺乏边界拉扯与三角形距离约束,高斯基元发生无序穿透和稀疏化
w/o ASDS 注意力调制 物体表面高频纹理模糊,图案细节丢失(如枕头花纹和板凳木纹消退) 空间词与实体词交叉注意力混叠,局部语义特征被平均稀释
裕度 \(\tau = 0.02\) (过小) 接触物体严重几何穿模,发生非物理的硬性重叠 距离惩罚缺乏缓冲带,基元无序侵入相邻实体内部空间
裕度 \(\tau = 0.5\) (过大) 接触物体间出现肉眼可见的物理脱空缝隙,无法贴合 间距过强推斥,破坏了“放置/接触”的视觉真实性
裕度 \(\tau = 0.2\) (最优自适应) 接触过渡紧致柔和,无穿模且接触受力逼真 尺度自适应的5%最大对角线裕度提供了适宜的物理碰撞容限

关键发现

  • 多视角一致性实现跃迁:I2C-3D 在多面怪发生率(JR)指标上从传统单视角扩散优化的 \(55\%\sim69\%\) 骤降至 \(17.3\%\),同时全场景一致性准确率(ACC)跃升至 \(88\%\),远超次优方法 GraphDreamer(\(48\%\))。
  • 几何与碰撞解耦的有效性:I2C 的设计成功证明了“通过几何解析约束控制高斯基元分布”比单纯用扩散隐式引导更能保证物理接触真实性,消除了接触面常见的黑块伪影。
  • 渐进式编辑扩展性:在保持现有场景拓扑不变的前提下,该方法支持单步新增物体(如从“双人床”逐步增添“床头柜”、“花盆”、“苹果”,并扩展至6~8个物体),具备很强的交互式场景级构建能力。

亮点与洞察

  • 基于初等几何三角形定理的碰撞能量设计:巧妙利用三角形两边之和大于第三边的极值条件,以无需重度物理引擎仿真的极低代价实现了高斯点向包围盒中心连线中点的平滑汇聚引导。
  • 空间/实体交叉注意力分化调制:针对扩散模型中空间关系词元与具体物体名词的语义冲突,对实体掩码内外进行非对称加权调制,为组合式生成提供了免训练的即插即用控制手段。
  • 避免Inpainting引入幻觉的干净初始化:直接在破损但真实的实例视角图上运行LGM重建,把交互融合与修补完全交由3D空间的几何约束处理,规避了2D修复带来的多视角空间冲突。

局限与展望

  • 依赖预训练2D检测与分割质量:粗粒度阶段高度依赖LLM布局推测以及前视2D生成的质量,若SAM分割发生漏检或严重欠分割,将直接污染后续3DGS的聚类中心分配。
  • 复杂形变物体交互受限:目前碰撞约束基于刚体包围盒中心连线模型,对于具有大形变、强凹面几何(如流体、柔软布料包裹复杂网格)的交互区域,凸包连线假设可能会出现局部几何失真。
  • 未来方向:可进一步将可微物理力学仿真(如软体动力学)与点云表面法向量约束深度结合,实现细致到微米级应力变形的高逼真多物体交互生成。

相关工作与启发

  • vs ComboVerse / GraphDreamer: ComboVerse 与 GraphDreamer 分别尝试采用空间感知SDS和场景图来组合物体,但在密集接触区域缺乏底层3D表征的显式几何约束,导致交界处常常悬空或产生黑色离群杂点。I2C-3D 引入针对接触中点的高斯碰撞能量,使接触面更加平滑紧致。
  • vs Layout-your-3D / REPARO: 现有基于布局的方法主要在网格或初级体素上进行排布,难以灵活处理细致的多视角纹理修复。本文在3DGS上将多视角扩散先验与局部-全局尺度变换结合,兼顾了快速优化与连续表面材质的一致性。

评分

  • 新颖性: ⭐⭐⭐⭐☆ (将初等几何三角形两边之和准则引入高斯基元物理接触约束,构思新颖巧妙)
  • 实验充分度: ⭐⭐⭐⭐⭐ (在ComboVerse基准上进行了详实的GPT-4V多维度量化评测,包含多物体渐进式编辑与极端案例)
  • 写作质量: ⭐⭐⭐⭐☆ (数学公式推导与两阶段流水线图示清晰,结构逻辑严密)
  • 价值: ⭐⭐⭐⭐☆ (为解决组合式多物体3D生成中的物理穿模与视角不一致提供了兼顾效率与质量的有效参考方案)