跳转至

SceneHI: High-Resolution 3D-Consistent Scene Texturing with Controllable Illumination

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/Thanos-DB/SceneHI
领域: 3D视觉
关键词: 场景纹理合成, 高分辨率纹理, 3D一致性, 阴影烘焙, 扩散模型

一句话总结

针对复杂多物体室内场景纹理生成中的视角不一致、表面分辨率受限与物理光照缺失难题,SceneHI 提出了免微调的解析几何映射与高分辨率隐式纹理(HRLT)框架,并引入分块精炼与几何一致阴影烘焙,实现了高保真、多视角一致且光照可控的 3D 场景纹理合成。

研究背景与动机

逼真且高精度的三维纹理是沉浸式游戏、扩展现实(XR)和数字孪生等应用的核心要素。然而,高质量场景纹理的手工绘制极度消耗人力与时间,而三维资产采集的高昂成本导致业内缺乏大规模、高质量的 3D 场景数据集,使得直接端到端训练场景级 3D 纹理生成模型难以实现。尽管预训练 2D 扩散模型在图像合成上展现出惊人的生成能力与先验表现,但现有 3D 纹理合成工作主要聚焦于单一物体,一旦拓展到包含多个网格物体的复杂室内场景,严重的物体间自遮挡与互遮挡、空间几何尺度不一以及跨视角光照不协调等问题便会急剧放大。

现有的场景级纹理生成方案面临诸多结构性缺陷:一类基于分数蒸馏优化的方法(如 SceneTex)在全场景多视角交替反传时耗时极长,且因遮挡区域在多视角下受约束不足,极易产生模糊且丢失高频纹理;另一类依赖全景图投影的方法(如 RoomTex)会引入严重的球面畸变,且因未建立规范的 UV 贴图而无法直接导入工业标准渲染管线;基于局部视角修补(inpainting)的技术(如 RoomPainter)则因缺乏全场景长程特征约束,容易导致接缝撕裂与“多面人”(Janus)伪影。更严重的是,现有方法完全忽视了轻量级生产管线(如移动 XR、Web3D)对预烘焙物理光照(baked illumination)的刚性需求,生成的纹理要么附带杂乱不受控的假高光阴影,要么整体平淡毫无层次。

本文的切入角度在于:充分挖掘 2D 基础扩散模型的生成先验,通过建立数学上严格精确的透视解析映射,在多视角隐空间去噪与共享 UV 纹理画布之间构建确定性双向循环,从而在无需微调模型的前提下彻底规避修补缝合带来的不一致,同时解耦全局基底纹理生成、局部超分增强与光照烘焙。核心 idea:通过基于齐次坐标梯度的解析像素-纹素映射与高分辨率隐式纹理(HRLT)画布,利用多视角并行去噪与法线/众数反渲染循环保证 3D 纹理长程一致性,并模块化集成块级几何引导高分辨率精炼(HDTR)与物理可控几何一致阴影烘焙(GCS)。

方法详解

整体框架

SceneHI 采用分阶段模块化的生成流程:首先根据场景整体文本提示与各物体局部提示,在解析几何映射驱动下执行全局基底纹理的多视角协同去噪,完成全场景与遮挡区域的 3D 一致纹理覆盖;随后通过高分辨率纹理精炼阶段对关键物体实施分块引导去噪,大幅提升表面纹素密度;最后通过几何一致阴影阶段将可微渲染的硬阴影图注入扩散去噪过程,烘焙出物理可信的软阴影与接触阴影。整个流程以物体级 UV 展开空间为统一表达载体,各阶段数据流转与协作机制如下图所示:

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入未纹理化3D场景网格<br/>+ 全局与局部文本提示"] --> B["解析像素-纹素映射与隐式纹理初始化<br/>齐次深度线性插值计算Quad足迹与方差保持缩放"]
    B --> C["多视角并行去噪与反渲染循环<br/>多相机独立去噪 + 法线反渲染 + 众数正向聚合"]
    C --> D["单物体独立去噪补全<br/>固定全景基底 + 局部视角去噪填充遮挡死角"]
    D --> E["高分辨率纹理精炼 (HDTR)<br/>重叠局部视锥分块扩散 + 引导衰减融合"]
    E --> F["几何一致阴影烘焙 (GCS)<br/>可微阴影图先验注入 + 扩散调和与UV烘焙"]
    F --> G["最终带可控阴影的高分辨率UV纹理资产"]

关键设计

1. 解析像素-纹素映射与确定性隐空间同步:消除重采样漂移并严格保持高斯假设

传统基于点采样的反投影方法在离散化映射时不可避免地产生纹素空洞与摩尔纹,而采用平滑滤波或插值则会破坏扩散模型对输入噪声空间独立同分布(i.i.d.)的基本假设,导致生成质量崩塌。SceneHI 基于透视投影的核心几何性质:对于空间平面三角形,齐次坐标深度倒数 \(1/w\) 以及透视校正纹理坐标 \(u/w\)\(v/w\) 在屏幕像素空间呈严格的线性变化。系统在光栅化顶点上携带纹理坐标 \((u, v)\) 与齐次深度 \(w\),并在屏幕空间对它们进行线性插值,利用商法则严格求导得出透视校正梯度的精确值,完全消除了高阶截断误差。

在确定屏幕像素在 UV 空间的对应关系时,算法评估像素四个角点上的齐次坐标比值 \((u/w)/(1/w)\)\((v/w)/(1/w)\),构筑出该像素在纹理空间中覆盖的四边形足迹(Quad footprint)\(\Omega_{ij}\)。由于扩散模型初始步依赖标准高斯噪声,若直接使用未缩放的纹素均值映射回像素,由于大四边形内多个独立高斯变量求和除以基数 \(|\Omega_{ij}|\),会导致像素潜变量的方差坍缩至零,彻底破坏初始噪声分布。SceneHI 针对初始化阶段设计了方差保持缩放机制:

\[\mathcal{R}_{\text{init}}(\Omega_{ij}) = \sqrt{|\Omega_{ij}|} \cdot \left( \frac{1}{|\Omega_{ij}|} \sum_{(u,v) \in \Omega_{ij}} t(u,v) \right) = \frac{1}{\sqrt{|\Omega_{ij}|}} \sum_{(u,v) \in \Omega_{ij}} t(u,v)\]

该设计在采样第一步完整保留了单位方差的高斯统计特性,为多视角联合去噪提供了确定性的几何锚点。

2. 多视角并行去噪与法线/众数反渲染循环:杜绝接缝伪影与低通模糊

为彻底根除现有自回归或修补流水线中因视锥重叠不足而引发的长程几何不连续与接缝问题,SceneHI 在去噪的每一个时间步让 \(M\) 个相机视角完全并行推进扩散单步预测。各个视角在屏幕空间去噪后产生的特征会存在微小分歧,算法利用反渲染映射 \(\mathcal{R}^{-1}\) 将屏幕像素潜变量投射回物体的共享高分辨率隐式纹理(HRLT)画布中。在多视角重叠投射到相同纹素的区域,若简单采用代数加权平均,其效果等同于低通平滑滤波器,会直接抹杀高频细节并引发漫反射模糊。

为保护纹理的高频锐度,SceneHI 在反渲染时引入相机法线对齐优先级判定:对于观测到同一纹素的多个视角,优先选取表面法线与相机视线夹角最小(即在相机视坐标系下投影法线分量 \(\tilde{n}^{(n)}\) 最大)的视角的潜变量:

\[n^* = \arg\max_{n \in \{1,\dots,N\}} \tilde{n}^{(n)}(i,j)\]

而在随后由 HRLT 画布向下一时间步相机视网膜重新正向渲染 \(\mathcal{R}\) 时,算法摒弃线性插值,改用众数直方图选择(mode-based selection),将覆盖该像素四边形足迹 \(\Omega_{ij}\) 中出现频次最高的离散潜变量赋予当前像素:

\[\mathcal{R}(\Omega_{ij}) = \arg\max_{z \in \mathcal{V}} \sum_{(u,v) \in \Omega_{ij}} \mathbb{I}[t(u,v) = z]\]

这种结合法线优先反投影与众数聚合的正向映射,构建了坚固的离散高频信息屏障,既抑制了掠射角视角拉伸畸变,又确保了多视角间双向信息的稳定收敛。

3. 引导衰减的块级高分辨率纹理精炼 (HDTR):兼顾全局风格与局部超精细纹素

受限于 GPU 显存容量与 2D 扩散模型的原生输入分辨率(通常为 \(1024 \times 1024\) 像素,对应潜在空间 \(128 \times 128\)),全局视角的单次采样无法在大型场景的微小物面上赋予足够的纹素密度。SceneHI 的 HDTR 阶段无需全局重跑,而是允许针对用户指定的关键资产(如带有繁复刺绣的地毯、陈设画作等)进行局部视锥推近与重叠分块扩散。算法在物体表面划分空间重叠的 patch 区域,通过局部分块去噪将局部细节纹理回贴至更高精度的独立 UV 空间中,利用重叠边缘实现无缝拼接。

为了防止局部放大去噪时由于缺乏全局视域而发生风格漂移与语义错位,HDTR 在分块去噪轨迹中引入了来自第一阶段低分辨率基底纹理的潜变量引导 \(z_{\text{guid}}\)。系统采用余弦衰减调度策略在时间步 \(\tau \in [1, K]\) 动态融合全局引导与局部细节:

\[\hat{z}_\tau = \gamma_\tau z_{\text{guid}} + (1 - \gamma_\tau) z_\tau, \quad \text{其中 } \gamma_\tau = \left( \frac{1 + \cos(\pi \tau / K)}{2} \right)^\alpha\]

在去噪早期(\(\tau\) 较大),\(\gamma_\tau\) 占据主导地位,强行约束几何轮廓与宏观配色与全局基底对齐;随着去噪步数推进到细节生成阶段,\(\gamma_\tau\) 快速平滑衰减至零,赋予扩散模型充分的自由度去生成丰富生动的高频微观结构。

4. 物理可控几何一致阴影烘焙 (GCS):将可微光线投射转化为可信漫反射阴影

在 3D 渲染引擎与工业图形管线中,离线烘焙阴影是保证轻量化实时渲染真实感的核心技术。直接利用解析光栅化生成的硬阴影图往往边界机械生硬,不仅存在严重的锯齿断层,而且无法表现复杂多光源与互遮挡环境下的半影区、接触硬化及环境反射。SceneHI 将解析阴影渲染作为几何先验与结构条件,通过扩散先验将其润色为自然融入场景材质的逼真阴影。

具体而言,用户可任意指定空间虚拟光源的位置与属性,系统首先利用可微阴影映射技术生成全场景视角的结构阴影图 \(s\);随后按照光照强度系数 \(w \in [0, 1]\) 与前序阶段生成的无光照纯净纹理视景 \(v\) 进行线性色彩预混叠:

\[s_v = s \cdot w + v \cdot (1 - w)\]

混合后的图像注入受控的微弱高斯噪声,作为扩散模型反向去噪的起点。扩散模型在 ControlNet 条件指导下执行少量步数的调和降噪,将生硬的阶跃阴影边缘重塑为柔和细腻的物理半影,并使阴影色彩与物体表面固有材质深度交融;最终再次执行一次解析反渲染 \(\mathcal{R}^{-1}\),将调和后的光影永久沉淀并烘焙至物体独立 UV 图中。

实验关键数据

主实验

实验基于业界通用的 3D-FRONT 室内场景基准套件,选取包含复杂家具组合、严重多层遮挡的 10 个代表性室内房间,每场景配置 2 个多样化提示词并在 25 个未见测试视角下评测。对比基线包括优化类方法 SceneTex、全景两阶段方案 RoomTex 以及单物体拓展基线 Text2Tex(分为单提示全景版 Text2Tex-H 与多提示分物体版 Text2Tex-C)。评估指标涵盖美学评分(Aesthetic Score, AS)、Inception Score (IS)、CLIP Score (CS) 以及全场景纹理合成总耗时(Minutes)。

方法 AS ↑ IS ↑ CS ↑ 耗时 (Minutes) ↓
Text2Tex-H [ICCV 2023] 4.10 2.06 23.4 8
Text2Tex-C [ICCV 2023] 4.22 2.15 23.7 75
SceneTex [CVPR 2024] 4.66 2.07 27.4 1320
RoomTex [ECCV 2024] 4.67 2.07 25.3 1200
SceneHI (Full Model, 本文) 5.04 2.24 28.8 240

此外,针对场景级纹理在动态交互下的 3D 一致性、微观细节丰富度与阴影真实感缺乏客观几何指标的问题,论文组织了 20 位专业评审对漫游渲染视频(fly-throughs)进行了 1–5 分制的双盲用户主观评测(均值±标准差):

评测维度 Text2Tex-H Text2Tex-C SceneTex RoomTex Ours (SceneHI)
多视角一致性 (Consistency) ↑ 2.72 ± 0.64 2.94 ± 0.58 3.31 ± 0.51 3.82 ± 0.42 4.45 ± 0.35
表面细节丰富度 (Fine Detail) ↑ 2.15 ± 0.68 2.65 ± 0.62 3.12 ± 0.55 3.34 ± 0.48 4.62 ± 0.38
阴影物理真实度 (Shadows) ↑ 1.45 ± 0.52 1.68 ± 0.58 2.34 ± 0.62 2.62 ± 0.66 4.68 ± 0.42

消融实验

为精确定量框架中两大核心增量模块——几何一致阴影烘焙(GCS)与高分辨率纹理精炼(HDTR)的独立贡献,论文在保持基础采样与解析映射完全一致的条件下进行了消融评测:

配置 AS ↑ IS ↑ CS ↑ 说明
Full Model (完整方案) 5.04 2.24 28.8 包含基础纹理、局部 HDTR 精炼与 GCS 阴影烘焙
w/o Shadows (无阴影烘焙) 4.88 2.15 27.9 去除 GCS 阶段,仅保留基础几何与 HDTR 纹理
w/o Refinement (无高分精炼) 4.90 2.19 28.2 去除 HDTR 阶段,全场景仅使用基底多视角纹理

关键发现

  • 核心模块贡献:消融数据表明,阴影烘焙与超分精炼对画质均有显著正面拉动。去掉 GCS 阴影烘焙后美学分数由 5.04 下跌至 4.88,即便文本提示中完全未包含任何光影相关词汇,缺乏阴影的场景依然在人类主观评测和美学模型判定中被显著降权,证实物理光影是场景立体感与真实感不可或缺的底层支柱;而在仅对场景中单个重点物体启用 HDTR 精炼的前提下,AS 仍获得 0.14 的纯增益,有效排除了全景远景下的像素化马赛克感。
  • 运算效率巨幅提升:相较于之前领先的场景级方案 SceneTex(需 22 小时)与 RoomTex(需 20 小时),SceneHI 凭借解析无优化的确定性同步机制,在单张 RTX A6000 上将完整生成周期缩减至 4 小时以内,耗时减少超 80%,极大地提升了生产管线实用价值。
  • 长程一致性与边缘锐度:在多物体互相遮挡、沙发背立面以及桌底死角等极端几何视角下,法线反渲染与众数聚合机制杜绝了传统插值带来的模糊扩散,在 180 度翻转视角下亦未出现纹理断裂与错位。

亮点与洞察

  • 解析透视映射代替离散重采样:巧妙利用齐次除法空间中的严格线性不变性,以商法则推导解析导数并推导像素足迹,从根源上消除了反投影过程中的纹素空洞与数值发散误差。
  • 方差保持缩放维护扩散先验稳定性:在初始化 HRLT 映射至屏幕空间时引入 \(\sqrt{|\Omega_{ij}|}\) 缩放因子,解决了大面积纹素求和导致初始高斯白噪声方差坍塌的数学隐患。
  • 法线反投影与众数聚合正投影协同:反渲染时用法线夹角过滤掠射角拉伸畸变,正向投影用众数统计代替均值低通滤波,构建了保护高频表面纹素的离散滤波屏障。
  • 可复用的可控光照生成范式:将传统图形学可微阴影图作为粗糙几何先验引入扩散生成,避免了让 2D 模型凭空幻觉 3D 阴影的几何错位问题,该管线可无缝推广至户外建筑与动态天气环境渲染。

局限与展望

  • 计算资源开销与长耗时:尽管比旧方案提速 80%,单场景平均 4 小时生成耗时在面对大规模交互式设计或实时预览任务时依然偏高,未来可探索流匹配(Flow Matching)少步蒸馏加速。
  • 光照模型局限性:当前 GCS 模块侧重于单点直接光照的遮挡投影与软化,对复杂的间接光照传递(如漫反射色溢、多次弹射全局光照 GI)以及镜面高光 BRDF 材质分离尚未形成显式建模。
  • 复杂破损网格的法线敏感度:解析映射依赖于高质量的网格几何法线,当场景包含严重非流形结构、内翻面或法线混乱的脏网格时,需要依赖自适应导数截断才能防止投影四边形发生形变扭曲。

相关工作与启发

  • vs SceneTex: SceneTex 采用固定的多视角联合反向传播优化全场景纹理贴图,不仅计算极度缓慢(>22 小时),而且在遮挡背面因梯度稀疏易产生大面积低频模糊;SceneHI 采用解析前向反渲染循环与局部独立去噪,无需长时间迭代优化即可完整覆盖死角。
  • vs RoomTex: RoomTex 依赖单点全景深度投影构建全局初胚,全景展开必然伴随严重的极点畸变与拉伸,且缺失标准 UV 贴图支持;SceneHI 基于原生逐物体 UV 空间展开与正交视锥分块精炼,完全契合工业级 3D 渲染工具链。
  • vs RoomPainter: RoomPainter 依靠注意力多视角整合采样进行全屋涂抹,缺乏独立物体的物理分离度,在家具紧贴处及缝隙处经常出现大面积漏涂或纹理混叠;SceneHI 解耦了全景与单物体两级通道,实现了遮挡区域的独立稳健补全。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ [首次在免微调 2D 扩散框架下实现了数学精确的解析像素-纹素映射与 3D 物理一致的交互式可控阴影烘焙]
  • 实验充分度: ⭐⭐⭐⭐⭐ [完备的 3D-FRONT 基准定量对比、全方位的消融实验以及严谨的 20 人双盲漫游视频用户调研]
  • 写作质量: ⭐⭐⭐⭐⭐ [数学推导严密、问题痛点阐述极其透彻、图文设计精致且工业落地导向明确]
  • 价值: ⭐⭐⭐⭐⭐ [打通了从文本描述到带工业级烘焙光照、高分辨率 UV 资产的端到端制作流,对游戏与 XR 资产生成极具推动力]