CAST3D: Customizing Arbitrary 2D Assets into 3D World¶
会议: ECCV 2026
论文: ECCV 原文
领域: 3D视觉
关键词: 3D资产定制 / 组合式生成 / 扩散模型 / 随机轨迹调控 / 免训练
一句话总结¶
CAST3D 提出了一个无需训练的定制化 3D 组合生成框架,通过 3D 布局推断与随机轨迹调控,将任意多张 2D 资产图像在文本引导下融合成几何自洽且忠实于原图外观的连贯 3D 对象。
研究背景与动机¶
近年来以扩散模型为代表的生成技术极大地丰富了高质量 2D 视觉资产的创作与编辑生态,但在 3D 领域,构建复杂的 3D 物体与场景仍然高度依赖繁琐的几何结构表达与耗时的物理优化。将现有的丰富 2D 素材(如特定角色、配件、独立道具)灵活组合并转化为三维实体,成为连接 2D 创作生态与 3D 虚拟世界的关键需求。然而现有的 3D 扩散生成模型(如 Trellis、Hunyuan3D)主要针对孤立的单个物体进行优化,缺乏跨资产的可控组合与空间推理能力;而依靠文本或单图驱动的方案,又无法保证多源异构视觉资产之间的语义协调与几何一致性。
直接将现有多模态方法应用于该任务存在两类典型的退化范式。第一种是“先升维后拼接”(Uplift-then-Compose):利用单图生 3D 模型分别重建各个部件,再依据文本空间关系进行放置。这种方式由于各个资产独立生成,往往存在尺度失真、朝向冲突与坐标系不匹配,导致严重的几何重叠与穿模伪影。第二种是“先融合后生成”(Customize-then-Generate):借助 2D 多概念扩散模型或 VLM 先合成一张包含全部资产的完整 2D 效果图,再做单图生 3D。这一路线不仅高度受限于 2D 模型的概念融合精度,更在 2D 到 3D 转换中饱受视角遮挡、信息丢失以及多视角不一致的困扰,极易造成三维几何畸变与局部黑斑。
面对多资产视角不匹配、尺度不一以及空间遮挡难以协调的核心矛盾,本文认为组合与布局推理应当直接在 3D 本生空间中完成,以充分利用预训练 3D 潜扩散模型的丰富几何结构先验。核心 idea:提出一种无需训练的两阶段 3D 组合框架 CAST3D,在 3D 潜空间中直接推断部件布局线索,并设计随机轨迹调控(STM)机制与连通性剪枝策略,实现几何结构约束下的高保真多资产三维融合与外观缝合。
方法详解¶
整体框架¶
CAST3D 接收目标文本提示词 \(c\)、一组 2D 资产图文对 \(\{(o_i, I_i)\}_{i=1}^N\) 以及选定的基座主体(主资产,Anchor)索引 \(i_B\) 作为输入,输出一个全局几何统一且部件细节忠实于原图的 3D 资产。整个生成流程包含“3D 布局推断”(3D Layout Hinting)与“组合式生成”(Compositional Generation)两个连续阶段。在第一阶段,主几何体在目标文本驱动下通过 STM 产生三维布局候选,并借助多视角渲染与二维开放词表分割反投影提取出各部件的 3D 布局线索;在第二阶段,各部件在布局线索与 2D 资产的双重约束下生成细粒度体素几何与外观特征,再经由连通性剪枝剔除穿模残差并缝合平滑外观边界。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入:2D 资产图像集 + 文本提示词"] --> B["3D 布局推断<br/>主几何形变生成与高斯反投影掩码"]
B --> C["随机轨迹调控 (STM)<br/>SDE 逆向重采样与流匹配噪声映射"]
C --> D["连通性剪枝与平滑组合<br/>6-连通残差过滤与高斯软边界外观过渡"]
D --> E["输出:几何一致且忠于资产的 3D 对象"]
关键设计¶
1. 随机轨迹调控(Stochastic Trajectory Manipulation, STM):兼顾几何先验保持与语义编辑自由度 在 Rectified Flow(流匹配)等流模型中,推理通常通过求解确定性的概率流常微分方程(PF-ODE)完成:\(\dif \boldsymbol{x}_t = \boldsymbol{v}(\boldsymbol{x}_t, t)\dif t\)。确定性采样虽然保真度高,但在进行潜空间反转与编辑时极易因线性化累积误差而产生结构漂移。针对这一痛点,本文在流匹配去噪过程中显式引入随机性,构建了具有相同边际概率密度的逆时随机微分方程(SDE): $$ \dif \boldsymbol{x}_t = \left[\boldsymbol{v}(\boldsymbol{x}_t, t) - \frac{1}{2} g^2(t)\nabla \log p_t(\boldsymbol{x}_t)\right]\dif t + g(t)\dif\bar{\boldsymbol{w}} $$ 其中扩散系数设定为 \(g(t) = \sqrt{2\lambda_{\text{diff}} t}\)。在此基础上,STM 提取源样本去噪轨迹各步的有效噪声 \(\boldsymbol{\epsilon}_t^{\text{src}}\),通过噪声映射器 \(\mathcal{F}\)(默认恒等映射)传递给目标轨迹,并配合轨迹生成器 \(\mathcal{G}\) 注入先验样本。该机制统摄了 FlowEdit 与 FlowAlign,其本质在于引入了一种在时间步前期抑制速度差异、后期放大速度差异的积分核,从而在生成初期强力锚定原物体的三维空间位置与粗几何骨架,在生成后期释放编辑自由度以吸纳新的语义修饰。
2. 3D 布局推断(3D Layout Hinting):利用 3D 扩散先验与跨模态反投影建立空间锚点 针对直接拼接导致的尺度失配与空间穿模,该设计先将主资产图像 \(I_B\) 经由 Trellis 的稀疏结构流变换器生成初始主几何体 \(\boldsymbol{p}_B\),随后利用 STM 在全局文本提示词 \(c\) 引导下生成粗略但具备三维上下文关系的布局候选 \(\boldsymbol{p}_C\)。为将整体候选解耦为离散部件的空间占位(Layout Hints),模型将 \(\boldsymbol{p}_C\) 解码为 3D 高斯泼溅(3DGS)辐射场并渲染多视角图像;接着调用开放词汇分割模型(LangSAM)针对各资产词 \(o_i\) 提取视角掩码 \(M_i^v\),并将像素分割置信度沿射线反向投影至三维高斯基元进行加权投票: $$ m_j^i = \text{sgn} \sum_{v \in \mathcal{V}} \sum_{p \in P_j^v} \alpha T_j(p)\left[\mathbb{I}(p \in M_i^v) - \mathbb{I}(p \notin M_i^v)\right] $$ 统计落入各体素内部的高斯掩码占比,滤除低于阈值 \(\tau_{\text{mask}}\) 的噪点后,直接得到各个部件在 3D 场景中的体素化布局线索 \(\boldsymbol{h}_i\),彻底规避了二维图像拼接面临的视点遮挡与尺度模糊。
3. 连通性剪枝与平滑组合(Connectivity-based Pruning & Composition):消除布尔穿模并实现无缝外观融合 在各部件几何 \(\boldsymbol{p}_i\) 依据各自 2D 资产和布局线索独立生成后,简单的网格并集会留下严重的重叠和非物理交错。算法先计算主几何体与布局候选的差异区域 \(\boldsymbol{p}_{\text{diff}} = (\boldsymbol{p}_B \oplus \boldsymbol{p}_C) \odot \sum_{i \ne i_B} \text{Expand}(\boldsymbol{p}_i)\),构建组合基座 \(\hat{\boldsymbol{p}}_B = \boldsymbol{p}_B \oplus \boldsymbol{p}_{\text{diff}}\)。随后利用 6-连通性算法对残差体素进行连通域分析,仅保留最大连通块及未改变原拓扑的大尺寸结构,滤除细碎毛刺与割裂碎片。粗几何拼接后再经由轻量 STM 平滑润色,得到平滑几何 \(\boldsymbol{p}_{\text{GC}}\)。在外观生成阶段,模型将各部件的 SLAT 外观特征 \(\boldsymbol{z}_i\) 定位到几何对应区域并指派最优速度场,在交界过渡带应用高斯滤波构建软边界进行插值;在最后 \(\tau_{\text{fine}}\) 采样步内撤销任何外加干预,使扩散模型自然闭合边界,消除拼接处常见的模糊与接缝瑕疵。
损失函数 / 训练策略¶
CAST3D 属于免训练(Training-Free)推理管线,完全依赖预训练 3D 潜扩散模型 Trellis 的生成能力。推理运行在单块 NVIDIA RTX 4090 GPU 上,采样步数设为 25 步。文本条件分类器自由引导(CFG)尺度设为 7.5,图像条件 CFG 设为 5.0。在 3D 布局推断阶段,STM 的最大调控步数 \(n_{\text{max}}\) 根据文本所需结构改动剧烈程度设定在 \([15, 21]\);而在组合生成阶段设定在 \([9, 14]\)。扩散噪声系数 \(\lambda_{\text{diff}} = 0.6\),体素反投影掩码过滤阈值 \(\tau_{\text{mask}} = 0.9\),外观精细收尾时段 \(\tau_{\text{fine}} = 0.15\)。
实验关键数据¶
主实验¶
评估数据集包含 45 个涵盖真实物体与虚拟概念的 2D 资产,组合构成 27 个高难度定制 3D 场景。基线包括基于 Trellis 质心与体积对齐的“先升维后拼接”(UtC)方案,以及基于多概念图像编辑大模型 Qwen-Image-Edit-2511 驱动的“先融合后生成”(CtG,分别测试单视角与多视角输入)。使用前沿多模态大模型(Gemini 3 Pro)对生成 3D 资产的忠实度(Faithfulness)、美学质量(Aesthetic)与结构合理性(Rationality)进行评分(满分 10 分),并辅助 CLIP 多视角文本对齐分(CLIP-T)与部件级图像保真分(CLIP-I)。
| 方法 | 忠实度 (Faithfulness) ↑ | 美学质量 (Aesthetic) ↑ | 结构合理性 (Rationality) ↑ | 综合均分 (Average) ↑ | CLIP-T ↑ | 部件级 CLIP-I ↑ |
|---|---|---|---|---|---|---|
| 先升维后拼接 (UtC) | 8.33 | 7.25 | 5.29 | 6.96 | 22.80 | 0.762 |
| 先融合后生成 (CtG, 单视角) | 5.73 | 5.75 | 6.87 | 6.12 | 22.78 | 0.733 |
| 先融合后生成 (CtG, 多视角) | 6.77 | 5.89 | 6.03 | 6.23 | 21.64 | 0.695 |
| CAST3D (本文) | 9.19 | 8.68 | 8.65 | 8.84 | 22.84 | 0.789 |
消融实验¶
消融实验聚焦于核心算法 STM 与连通性剪枝策略(Pruning)对最终三维合成质量的影响。同时作者开展了用户主观盲测(User Study),验证真实人类评测者对结构合理度与输入忠实度的感知偏好。
| 评估维度 / 变体 | 忠实度 (Faithfulness) | 结构合理性 (Rationality) | 平均分 | 说明 |
|---|---|---|---|---|
| CAST3D 完整模型 (Full) | 8.62 | 8.49 | 8.55 | 用户主观评测最高分,几何自洽且部件无伪影 |
| 去除 STM (w/o STM) | 6.81 | 6.15 | 6.48 | 布局先验严重漂移,部件空间位置混乱 |
| 去除剪枝 (w/o Pruning) | 7.54 | 6.73 | 7.13 | 部件交界处出现严重几何穿模与飞屑杂质 |
| 用户评测: UtC 基线 | 7.41 | 5.92 | 6.66 | 部件独立生成尚可但装配严重穿模割裂 |
| 用户评测: CtG (单视角) | 6.49 | 6.34 | 6.41 | 受背向遮挡拖累,外观丢失严重 |
| 用户评测: CtG (多视角) | 6.85 | 6.60 | 6.72 | 视角不一致导致三维表面坍塌畸变 |
关键发现¶
- 3D 模态布局优于 2D 图像中转:由 2D 编辑模型生成的中间图像在转为 3D 时,单视角因自遮挡导致背部生成大面积暗色黑斑;多视角则因微小的姿态与特征漂移导致 3D 重建崩溃。CAST3D 直接在 3D 空间进行布局推断,从源头消除了视角不一致难题。
- STM 的早抑晚放特性:STM 所对应的速度差积分核在前期抑制结构漂移,保持了主体与部件的相对几何比例;若完全去除 STM,生成的部件(如帽子、翅膀)无法正确贴合到主体相应解剖学位置。
- 人机评测在多视角感知上的分歧:在 CtG 方案中,多模态大模型对多视角生成的结构打分低于单视角(关注到坍塌细节),而人类评测者则更宽容地认为多视角整体形状更有层次,这突显了 3D 组合任务中多维度评测的必要性。
亮点与洞察¶
- 将流匹配 SDE 转化为可控 3D 编辑工具:巧妙推导了 Rectified Flow 的逆向反演 SDE,在免训练条件下通过噪声映射与先验轨迹生成器实现渐进式几何变形,摆脱了 ODE 积分误差带来的退化。
- 3D 几何与 2D 分割的跨模态闭环:利用 3DGS 快速多视角渲染与 LangSAM 掩码反向投票构建 3D 体素占位线索,以极小计算开销实现了开放词汇三维空间语义定位。
- 拓扑感知剪枝与软边界无缝融合:没有简单依赖粗暴的网格布尔运算,而是结合 6-连通残差过滤与高斯软边界渐进采样,彻底解决了组合模型中常见的硬边拼接与飞面问题。
局限与展望¶
- 主资产(Anchor)强依赖:当前流程需要预先设定一个主基座物体作为布局锚点,若两个资产处于完全平等的对等交互关系(如两只对打的动物),该主从式布局逻辑需要人工干预。
- 极端几何尺度变化的适应性:当输入的 2D 资产之间存在极端的微观/宏观尺度差异(如一只小蚂蚁立在大象背上)时,固定网格体素分辨率可能丢失细节,未来可引入自适应分辨率或分层八叉树结构。
相关工作与启发¶
- vs 先升维后拼接 (UtC):后者独立生成各个 3D 资产后强行空间对齐,忽视了部件接触面复杂的形变适配;CAST3D 通过 3D 布局推断与 STM 让各部件在几何生成阶段就感知到接触面形状。
- vs 基于 2D 扩散的多概念合成 (如 MS-Diffusion, Qwen-Image-Edit):后者局限于 2D 像素网格,缺少真实的三维几何约束与遮挡推理;CAST3D 将 2D 资产作为条件注入预训练 3D 扩散潜空间,实现真正结构层面的 3D 组装。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次提出并系统定义了从任意 2D 资产定制 3D 物体的生成任务,且给出了纯 3D 潜空间的免训练解法。
- 实验充分度: ⭐⭐⭐⭐☆ 评测指标覆盖了多模态大模型、CLIP 特征相似度及人工用户盲测,消融分析细致。
- 写作质量: ⭐⭐⭐⭐⭐ 数学推导严密自洽,将 SDE 调控机制与 3D 组合阶段的映射阐述得极为清晰。
- 价值: ⭐⭐⭐⭐⭐ 为游戏美术道具拼装、个性化虚拟形象定制以及 AIGC 跨资产组装提供了高通用性的落地范式。