跳转至

Know3D: Prompting 3D Generation with Knowledge from Vision-Language Models

会议: ECCV2026
论文: ECCV 原文
项目: Know3D
领域: 多模态 VLM / 3D 视觉
关键词: 单图到3D生成、背面语义控制、扩散隐藏状态、并行交叉注意力、条件流匹配

一句话总结

Know3D 将 Qwen-Image-Edit 的背面生成中间特征注入 TRELLIS.2,使单图到 3D 生成能够接受不可见区域的语言约束,在 HY3D-Bench-test 上取得 ULIP 0.2174、Uni3D 0.3518,但背面指令遵循能力主要由定性案例展示。

研究背景与动机

单图到 3D 模型已经能够生成细节丰富的物体,却始终面对一个输入本身无法解决的问题:正面照片没有告诉模型背面是什么。 可见部分可以依靠图像约束,遮挡部分则主要依赖训练数据形成的形状先验。 这让背面补全出现两种不同失败:结果可能看起来合理却不符合用户设想,也可能连物体的基本结构常识都不满足。 例如,用户需要控制某个背面组件时,提高正面纹理保真度并不会自动增加这种控制能力。 相比互联网规模的图文数据,高质量 3D 数据及文本与 3D 配对数据有限,单靠扩大已有几何模型很难直接获得同等丰富的语义知识。

视觉语言模型(VLM)具有更丰富的物体知识,但把知识迁移到几何生成器并不等于把一段文字接到输入端。 直接让语言模型自回归输出 3D 表示,会把它带入不同于原先语义任务的表示空间,原文认为其几何质量仍落后于专门的 3D 生成模型。 直接注入 VLM 隐藏状态也有另一层困难:抽象语义特征没有显式的图像空间结构,与生成器需要的空间条件不容易对齐。 先生成背面图片、再把它作为第二张输入虽然直观,却可能把错误的部件数量或姿态当作必须忠实重建的证据。 因此,本文关注的不是如何让语言模型取代几何模型,而是怎样找到兼具语义信息与空间结构的中间表示。

Qwen-Image-Edit 提供了一个自然的连接点:VLM 负责理解图像与指令,扩散 Transformer 把理解转化为具有空间组织的图像生成状态。 这些状态不一定要先解码成最终图片,才对三维生成有用。 核心 idea:先让图像编辑模型学会保持主体姿态的背面生成,再把其扩散过程中的结构语义特征作为附加条件注入专用 3D 生成器,以语言控制原本不可见的几何。

方法详解

整体框架

输入是一张物体图像,以及可选的背面部件描述;输出是完整物体的 3D 几何。 框架依次包含语义感知背面生成、扩散隐藏状态提取、并行条件注入三个设计。 Qwen2.5-VL 读取图像和指令,VAE 编码输入图像,二者共同为 Qwen-Image-Edit-2511 的 MMDiT 提供条件。 在背面去噪过程的选定时刻,系统抽取多个中间层特征,供 TRELLIS.2 的粗结构与精细几何两个阶段使用。 原始正面图像条件仍然保留,背面知识是补充信息,不是替换可见区域证据。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
        INPUT["单张图像与<br/>可选背面描述"] --> BACK["语义感知背面生成"]
        PAIRS["训练:真实前后视图<br/>与部件描述"] -.-> BACK
        BACK --> HIDDEN["扩散隐藏状态提取"]
        HIDDEN --> INJECT["并行条件注入"]
        INPUT -->|原始图像条件| INJECT
        INJECT --> COARSE["稀疏结构生成"]
        COARSE --> FINE["精细几何生成"]
        INJECT -->|结构语义条件| FINE
        FINE --> OUTPUT["完整3D几何"]

图中的真实前后视图只用于训练监督,普通推理不要求用户提供真实背面。 背面图像生成器先完成适配,训练 3D 模型时其参数冻结,因此这里不是把所有基础模型端到端联合更新。 提取中间状态也不意味着论文已经证明可以提前终止图像去噪;正文仍描述了完整迭代去噪过程。

关键设计

1. 语义感知背面生成:先校准视角,再学习部件控制

通用图像编辑模型能理解物体和文字,却不一定稳定理解相机旋转后的对应关系。 要求生成背面时,它可能选错观察方向,也可能直接改变人物或物体原有姿态。 Know3D 因而先用真实 3D 资产渲染前后视图,训练模型在改变视角的同时维持同一主体。 每个资产均匀采样方位角,并将相反方向的图像配成一组;这里的“正面”指选定条件视图,不必是物体语义上的正面。 VLM 看到配对图像后,为背面显著组件生成分部件描述,而不是只给整个物体一个泛化类别标签。 这种监督粒度使文本能够指向背面具体内容,同时保留不同组件被单独指定的可能性。

训练提示始终带有固定的相机旋转 180 度说明,再以 0.5 的概率加入从部件描述集合中采样的背面描述。 没有附加描述的样本学习默认补全,有描述的样本学习按用户要求补全;两者都仍然受输入图像约束。 原文所谓“无条件背面生成”应理解为无额外背面语义约束,而不是完全没有条件的自由生成。 Qwen2.5-VL 输出多模态隐藏状态,前视图 VAE latent 则保留可见主体的空间外观信息。 MMDiT 在二者共同作用下学习背视图的潜在生成过程,因此文字不是事后修改网格的独立编辑器。 设计的关键是把“背面是什么”与“确实从相反方向观察同一个主体”放进同一个学习任务。

2. 扩散隐藏状态提取:使用结构形成过程,而非只看最终像素

背面生成器学好之后,还要决定把哪种表示传给 3D 模型。 第一种候选是完全去噪后的 VAE latent,第二种是将其解码成图像后再提取 DINOv3 特征。 前者偏向像素重建,后者需要额外的解码与视觉编码步骤,而且可能把错误生成的局部外观当作可靠条件。 Know3D 采用第三种表示:在某个去噪时刻,从 MMDiT 的多个中间层提取隐藏状态,并拼接为结构语义条件。 它不是直接拼接 VLM 的语言 token;这些特征已经参与图像空间中的条件生成,因而有机会同时携带物体知识和布局线索。

原文将这一多层聚合写作拼接关系,保留如下表示即可理解其信息来源:

\[ H_{\mathrm{DiT}}=\operatorname{Concat}\left(h^{(1)},h^{(2)},\ldots,h^{(n)}\right). \]

这里每个隐藏状态来自同一选定时刻的一个 MMDiT 层;层数及具体层号在所给正文中未明确列出。 时间步消融在 \(t\in\{0,0.25,0.5,0.75\}\) 中比较,\(t=0.25\) 得到最佳稀疏体素结果。 作者认为这类状态已形成全局布局与主要语义,又没有完全退化成对最终像素的执着。 这是由消融支持的解释,不是证明隐藏状态必然编码了正确三维结构的定理。 数值 \(t\) 也不应直接当成采样器执行进度百分比,论文的噪声插值参数与推理执行顺序需要区分。

3. 并行条件注入:保留正面先验,增加背面信息通道

TRELLIS.2 原有的自注意力与图像条件交叉注意力被保留,新增分支与原来的图像条件分支并行。 拼接后的扩散特征先经过线性投影与层归一化,再作为新增交叉注意力的键和值。 查询来自 3D 主干的特征,这让生成器按当前几何状态选择需要的背面信息,而不是无差别覆盖全部表示。 新增分支的输出经过零初始化线性层后,再与原有路径融合。 这种初始化使新增条件路径在训练开始时不向主干注入非零扰动,是稳定适配已有生成先验的手段。 它并不意味着原有网络永远冻结:后续训练仍通过 LoRA 适配 TRELLIS.2。

几何生成沿用两阶段结构,先从噪声生成粗稀疏结构,再在该结构约束下生成高保真的细几何。 两个阶段都接收原始前视图特征和扩散结构语义特征,粗阶段先处理全局拓扑,细阶段再恢复局部几何。 这一顺序很重要:背面组件如果改变了物体的整体连接结构,仅在最后修饰表面并不足以解决问题。 该结构也与“把生成背面图当作第二张照片”的多视图方案不同,附加输入是可学习解释的中间条件,而不是必须逐像素匹配的观测。 作者用错误生成双肩带的案例说明这种差别,但单个案例不能保证模型对任何错误条件都具有鲁棒性。

一个完整示例

以原文图 7 及第 14–15 页讨论的单肩包为例,输入图像显示一个单肩包,背面本身不可见。 背面生成器可能在补全时错误地产生两条肩带,此时单独观察生成图像会得到与正面语义不一致的解释。 如果把该背面图经 DINOv3 编码后输入几何模型,原文观察到模型倾向于拟合这个错误结果。 VAE 表示在该案例中则未能有效注入背面信息,输出接近原 TRELLIS.2 的不合理结构。 Know3D 使用的是扩散中间状态,原文报告它仍能产生较合理的几何,而不是直接复制错误图像。 这个例子展示的是特征表示差异对错误传递的影响,不是定量的肩带计数准确率实验。 对于语言控制,用户可提供背面部件描述,描述经同一背面生成与特征注入路径影响三维结果;正文图 4 展示了这种控制。

损失函数 / 训练策略

背面生成与两个 3D 阶段都采用条件流匹配(CFM):向目标 latent 加入按时间插值的噪声,并学习相应速度场。 背面阶段的监督来自真实背面图像的 VAE latent,3D 阶段的监督来自真实几何 latent,二者的条件与目标空间不同。 所给文本缓存的式 (1)–(5) 存在拼接符号、减号和范数等抽取损坏,因此此处不将猜补后的完整损失写成作者精确公式。 可由正文确认的是条件来源、速度预测目标类型和分阶段优化方式,而不是一套新增的语义分类损失。

背面生成训练使用 TexVerse 中 5k 个高质量资产,每个渲染 12 个均匀方位角视图,构成 6 对前后视图并全部标注。 FoV 从 35、50、85、105、135 度中采样,俯仰角在 -15 到 45 度之间采样;每个资产内部固定,资产之间随机。 该阶段使用 rank 64 的 LoRA,在 32 张 NVIDIA A800 上训练,全局 batch size 为 32。 3D 训练使用 60k 个 TexVerse 网格,每个网格构造 4 对无扰动视图,以及 4 对带 FoV 缩放和小角度偏移的扰动视图。 此时冻结已适配的 Qwen-Image-Edit,TRELLIS.2 使用 rank 64 的 LoRA,新增条件层全部训练。 3D 阶段同样使用 32 张 A800,全局 batch size 为 64;正文未在该处给出完整模型的总训练步数。 70k 步这一数值专属于后述只训练第一阶段的消融设置,不能当作完整系统训练预算。

实验关键数据

主实验

下表摘自原文表 1,第 13 页;在 HY3D-Bench 的 test 与 val 上,以 ULIP 和 Uni3D 衡量输入图像与生成网格的语义一致性,均越高越好。 Hunyuan3D-2MV 接收原始正面和合成背面,而其他列出的基线属于单图到 3D 方法;这不是所有方法条件完全相同的比较。

方法 Test ULIP ↑ Test Uni3D ↑ Val ULIP ↑ Val Uni3D ↑
TRELLIS 0.2143 0.3421 0.2133 0.3464
TRELLIS.2 0.1948 0.3308 0.1967 0.3358
Hunyuan3D-2MV 0.2108 0.3413 0.2111 0.3400
Hunyuan3D-2.1 0.2140 0.3434 0.2122 0.3433
Know3D 0.2174 0.3518 0.2127 0.3512

Know3D 的 test Uni3D 相比 Hunyuan3D-2.1 增加 0.0084,test ULIP 相比 TRELLIS 增加 0.0031。 但 val ULIP 为 0.2127,低于 TRELLIS 的 0.2133,因此不能概括为所有指标全面第一。 这些分数体现图像与网格的整体语义一致性,不直接度量背面指令遵循、物理可制造性或局部拓扑正确率。

消融实验

以下两表来自原文第 14 页表 2、表 3;评估集是未进入训练的 100 个 TexVerse 资产。 消融仅训练生成稀疏体素的第一阶段,使用 60k 训练样本、batch size 64、70k 步,以及 rank 64 的 LoRA。 尤其需要注意:该比较直接使用真实前后视图作为条件,不能解释为完整生成背面管线在测试时的全部收益。 IoU 衡量预测与真实占据集合的交并比,越高越好;CD 即 Chamfer Distance,衡量几何点集距离,越低越好。 正文未在表中说明 CD 的缩放或单位,下面保留原报告数值,不将其解释为米或毫米。

MMDiT 时间步 \(t\) IoU ↑ CD ↓
0.0 0.343 2.376
0.25 0.352 2.262
0.5 0.349 2.272
0.75 0.336 2.452

表 2 中 \(t=0.25\) 优于其他三个选择,但它与 \(t=0.5\) 的差距只有 IoU 0.003、CD 0.010,且没有报告误差条。 这支持“提取时机有影响”,尚不足以声称 0.25 对任意基础模型和数据都最优。

特征来源 IoU ↑ CD ↓
VAE encoder 0.308 2.803
DINOv3 0.342 2.385
MMDiT,\(t=0.25\) 0.352 2.262

表 3 中 MMDiT 相比 DINOv3 的 IoU 增加 0.010、CD 降低 0.123;相比 VAE 的 IoU 增加 0.044。 表格将第一项称为 VAE encoder,方法比较文字则描述完全去噪后的 VAE latent;这里保留原标签,并提示复现时确认具体提取路径。

关键发现

  • 中间扩散特征在这组条件受控的稀疏结构实验中优于另外两种表示,说明信息接口的选择本身值得研究。
  • 主实验支持语义一致性较强,但没有提供独立的背面文本遵循分数,相关能力应结合图 4 的定性展示理解。
  • 图 7 支持“中间特征不一定机械复制错误像素”的可能性;它不是系统性错误率或鲁棒性界限的测量。

亮点与洞察

  • 扩散模型在这里既是生成器,也是跨模态表示接口。把特征取在像素落定之前,为保留语义弹性提供了具体实现路径。
  • 新增交叉注意力保留了原图条件通道。零初始化输出层让附加知识从不扰动原模型的状态开始学习,比直接替换条件更易解释。
  • 部件描述的随机加入把默认补全与语义控制统一起来。用户没有背面要求时仍可生成,有要求时则通过相同接口施加约束。

局限与展望

  • 作者明确承认多模态基础模型误解指令时仍会误导几何生成,语义知识不能代替可靠的空间验证。
  • 从评估角度看,100 个资产上的粗阶段消融与完整网格生成并非同一任务,还需要带合成背面误差的端到端定量实验。
  • 本文未在所给正文中报告背面指令成功率、用户评测或明确推理时延,不能据此宣称可控性和效率已全面验证。
  • 一个可检验的后续方向是同时评估背面组件遵循与正面几何保持,并对不同强度的错误背面条件做压力测试;这是读者建议,不是本文已完成的实验。

相关工作与启发

  • 对比 TRELLIS.2:沿用其稀疏结构到精细几何的生成范式,新增的是来自多模态扩散的条件分支,而不是重新设计一种网格表示。
  • 对比 Hunyuan3D-2MV:该基线把合成背面当第二个图像输入,Know3D 使用隐藏特征;由于主干不同,主表差异不能全部归因于特征表示,表 3 的受控比较更有针对性。
  • 对比 MeshLLM、LLaMA-Mesh:这些方向探索语言模型直接生成网格,Know3D 则保留专门的几何生成器,把 VLM 的角色限定为可迁移的语义先验来源。
  • 研究启发:可将“最终图像条件还是中间生成状态条件”的问题推广到其他受遮挡的几何补全任务,但迁移收益需要重新验证。

评分

  • 新颖性: 4/5,明确比较并利用多模态扩散隐藏状态作为背面几何控制接口。
  • 实验充分度: 3/5,有主实验与表示、时间步消融,但缺少直接的指令遵循量化和完整系统消融。
  • 写作质量: 4/5,问题与方法连接清晰;所给缓存的公式损坏及部分实现细节缺失影响精确复现。
  • 价值: 4/5,为不可见区域的语义控制提供可复用思路,适用边界仍受基础模型理解与生成能力约束。