Under One Sun: Multi-Object Generative Perception of Materials and Illumination¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://vision.ist.i.kyoto-u.ac.jp/research/onesun/
领域: 3D视觉
关键词: 逆向渲染, 生成式感知, 辐射度解耦, 漫反射纹理, 环境光照估计
一句话总结¶
针对单图逆向渲染中材质与光照高度混淆的严重病态性问题,MultiGP 利用同场景多物体共享全局光照的物理共识,通过级联扩散架构、协同调度与轴向注意力机制,实现了漫反射纹理、空间均匀反射率与共享高频光照的联合随机采样解耦。
研究背景与动机¶
物体表面的辐射度观测由几何法线、双向反射分布函数(BRDF)以及周围入射光场共同决定。然而,从单张图像中恢复各个辐射度分量(纹理、材质与光照)是极度病态的反问题。根据信号处理逆向渲染理论,物体的表面反射相当于环境光照在角域上与 BRDF 核进行角卷积运算,不同材质对高频入射光产生严重的低通衰减滤波,导致单物体观测中材质反射率与环境光照深度耦合且伴随不可逆的频域信息丢失。
传统的逆向渲染或确定性回归网络往往通过强加平滑先验或回归均值来产生单一解答,不仅无法恢复真实丰富的高频光照结构,更无法建模多义性分布;已有的生成式感知方法则要么绕开精确物理材质建模直接幻想全景图,要么仅局限于无纹理单一几何体(如 DRM)或忽略全局光照解耦。单物体受限于自身有限的几何视角跨度与特定的材质滤波带宽,无法充当完备的光照探针。
核心 idea:利用同场景多物体受同一环境光照驱动的物理共识,将多个物体视为互补的频域与空域探针,构建端到端级联生成扩散模型以协同解析纹理、材质与全局光照。
方法详解¶
整体框架¶
MultiGP 采用联合后验的级联分解近似 \(q(\mathbf{T}, \mathbf{R}, L \mid I, \mathbf{S}) \approx q_\phi(\mathbf{T} \mid I, \mathbf{S}) q_\theta(\mathbf{R}, L \mid I, \mathbf{S}, \mathbf{T})\)。输入为包含 \(M\) 个已知几何几何体 \(\mathbf{S}=\{\mathbf{n}(x)_m\}_{m=1}^M\) 的单张图像 \(I\)。流水线首先在图像空间通过潜变量扩散模型 \(q_\phi\) 剥离出各物体的漫反射纹理 \(\mathbf{T}\);随后将去除纹理后的外观映射到无几何依赖的高斯球面原始反射图(Raw Reflectance Maps),送入多物体扩散模型 \(q_\theta\) 中,借助协同调度(Coordinated Scheduling)与跨物体轴向注意力(Axial Attention)联合求解各物体的 Disney BRDF 参数 \(\mathbf{R}\) 与共享的环境高频镜面反射图 \(L\);最后利用基于物理渲染器残差的 ControlNet 约束纹理细化,保证全流程物理一致性。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入图像 + 已知形状法线"] --> B["阶段 1: 纹理提取先验 q_phi<br/>潜扩散剥离漫反射纹理并获得去纹理外观"]
B --> C["反射图映射与全局光照补偿<br/>局部视角投影至高斯球面并补全"]
C --> D["阶段 2: 多物体协同调度扩散 q_theta<br/>线性插值收敛至共享镜面光照"]
D --> E["跨物体轴向注意力融合<br/>对齐法线方向共享互补频带与视场"]
E --> F["阶段 3: 渲染器残差 ControlNet 纹理细化<br/>Mitsuba 3 物理重渲染引导观测一致性"]
F --> G["输出: 独立纹理 T + 材质参数 R + 共享全局光照 L"]
关键设计¶
1. 级联图像域与角域分解架构:隔离空间纹理与材质光照优化空间 针对空间高频纹理模式与角域反射材质彼此纠缠的痛点,直接单步联合求解会导致纹理细节伪影渗入环境光。MultiGP 将求解过程解耦为图像域与角域两个子空间:先通过以图像和法线潜变量为条件的潜扩散模型 \(q_\phi\) 预测空间变化的漫反射纹理 \(\mathbf{T}=\{\rho_d(x)_m\}_{m=1}^M\) 及去除纹理的物体外观 \(L_r^{(m)}(x)\);随后将去纹理外观投影到去几何化的法线球面反射图空间,交由多物体扩散模型 \(q_\theta\) 专门处理均匀材质参数 \(\Psi^{(m)}=\{\text{metallic } \gamma, \text{roughness } r, \text{specular } \rho_s\}\) 与环境光照,从而使材质与光照的逆向推理不再受到复杂物体纹理模式的干扰。
2. 多物体协同调度机制:确保多样输入反向扩散收敛至唯一共享环境光 在反向扩散过程中,各物体具有不同的初始材质反射率,若彼此独立去噪,将退化为各自分立且相互矛盾的光照假说。为此,MultiGP 设计了统一的反向扩散时间调度,使所有物体的反射率从各自估计的初始材质 \(\hat{\Psi}^{(m,K)}\) 沿离散步骤 \(k=K,\dots,0\) 线性演变到纯镜面反射状态 \(\Psi_0=\{1, 0, 1\}\): $$ \hat{\Psi}^{(m,k)} = \frac{k}{K}\hat{\Psi}^{(m,K)} + \left(1 - \frac{k}{K}\right)\Psi_0 $$ 总扩散步数 \(K\) 根据各输入材质距离镜面状态的平均欧氏距离自适应设定: $$ K = \left\lfloor \frac{K_{\max}}{M}\sum_{m=1}^M \left\lVert \frac{\hat{\Psi}^{(m,K)} - \Psi_0}{\sqrt{3}} \right\rVert \right\rfloor $$ 当 \(k=0\) 时,所有物体的反射图均严格收敛至代表环境光照本身的镜面反射图 \(L_r^{(0)}(\mathbf{n}) = \hat{L}_i(\mathbf{n})\),避免了传统单物体方法收敛所需无限迭代步数的问题。
3. 跨物体轴向注意力机制:空域视场与频域通带的信息互补与跨物交流 单个物体法线分布往往有限,且粗糙材质具有严重的低通滤波效应导致高频缺失。MultiGP 引入沿多物体维度展开的轴向注意力(Axial Attention),在反射图去噪网络的每个特征层中,将 \(M\) 个物体在相同法线方向(即空间对齐的球面网格坐标)的潜特征进行跨通道交互。高光强烈的镜面物体为粗糙物体补齐高频边缘与方向性光源,大视角广角表面则为局部可见物体补全未覆盖的法线盲区;同时配合局部空间注意力,防止几何法线估计轻微失准导致的错位惩罚。
4. 渲染器残差 ControlNet 纹理细化:物理似然引导的生成式一致性修正 纯生成式采样难以完全杜绝物理违例。MultiGP 将逆向解耦出的因子 \((\mathbf{T}, \mathbf{R}, L)\) 传入 Mitsuba 3 物理渲染引擎重新合成物体外观 \(\hat{L}_r\),计算合成图像与真实观测图像 \(I\) 之间的残差特征 \(c_f = \mathcal{E}(I - \hat{L}_r)\),作为条件注入到 ControlNet 中对初始提取的纹理 \(\mathbf{T}\) 进行后验重采样与细化,确保最终分离出的反照率既剔除了投射阴影与镜面高光,又完美解释了输入观测。
损失函数 / 训练策略¶
多物体扩散网络 \(q_\theta\) 基于物理正向渲染方程的逆向变分下界(ELBO)构建,环境光残差均方误差损失定义为: $$ \mathcal{L}i = \mathbb{E} \right) \right\rVert_2^2 \right] $$ 同时辅以材质参数预测损失 } \left[ \left\lVert \mu'_{\theta_i,\theta_r}\left(L_r^{(m,k)}, k\right) - \left( L_r\left(\Psi^{(m,k-1)}, L_r^{(0)}\right) - L_r^{(m,k)\(\mathcal{L}_r\),整体目标为 \(\mathcal{L} = \lambda_i \mathcal{L}_i + \lambda_r \mathcal{L}_r\)。纹理提取与 ControlNet 则采用潜扩散加噪预测损失,模型在结合 Adobe 3D Assets 与 Poly Haven HDRIs 构建的包含真实路径追踪互反射与投射阴影的多物体数据集上端到端训练。
实验关键数据¶
主实验¶
在合成测试集(Adobe 3D Assets 搭配 MV-Adapter 纹理与独立环境光)上,对光照(128×256)与反射率进行定量对比,MultiGP 采样 10 次取最优 3 次均值,显著优于 SOTA 基线:
| 方法 | 光照 logRMSE ↓ | 光照 PSNR ↑ | 光照 SSIM ↑ | 光照 LPIPS ↓ | 反射率 logRMSE ↓ |
|---|---|---|---|---|---|
| DPI (ACM TOG 2023) | 1.64 | 11.96 | 0.37 | 0.56 | 2.22 |
| DRM (CVPR 2024) | 1.48 | 12.62 | 0.34 | 0.61 | 1.85 |
| DiffusionLight (CVPR 2024) | 1.60 | 11.37 | 0.38 | 0.63 | - |
| MultiGP (single-object) | 1.44 | 12.67 | 0.38 | 0.58 | 2.05 |
| MultiGP (完整多物体) | 1.28 | 13.54 | 0.42 | 0.56 | 1.81 |
同时在漫反射纹理估计(512×512,假设几何已知)上对比:
| 方法 | 纹理 RMSE ↓ | 纹理 PSNR ↑ | 纹理 SSIM ↑ | 纹理 LPIPS ↓ |
|---|---|---|---|---|
| DPI | 0.150 | 24.86 | 0.92 | 0.084 |
| DiffusionRenderer | 0.110 | 27.37 | 0.96 | 0.051 |
| RGB↔X (HDR) | 0.110 | 27.59 | 0.96 | 0.054 |
| MultiGP | 0.081 | 29.99 | 0.97 | 0.031 |
消融实验¶
针对 MultiGP 各关键模块的消融实验(合成测试集光照与纹理):
| 配置 | 光照 logRMSE ↓ | 光照 PSNR ↑ | 反射率 logRMSE ↓ | 纹理 PSNR ↑ | 说明 |
|---|---|---|---|---|---|
| Full model (完整模型) | 1.28 | 13.54 | 1.81 | 29.99 | 表现最优 |
| w/o Coordinated Scheduling (去协同调度) | 1.29 | 13.50 | 1.87 | - | 缺少镜面同步约束导致材质误差增大 |
| w/o Axial Attention (去跨物体轴向注意力) | 1.37 | 12.97 | 1.82 | - | 无法互补频域特征,光照指标显著恶化 |
| w/o Texture Refinement (去 ControlNet 纹理细化) | 1.29 | 13.49 | 1.87 | 29.32 | 纹理重投影一致性下降,PSNR 下降 0.67 dB |
| Global Illumination off (训练去除真实全局光照) | 1.33 | 13.08 | 1.81 | 29.35 | 无法抵御投射阴影与相互反射干扰 |
基于球面调和函数(SH,32 阶保留 99% 方差的 PCA 空间)的多义性感知分布评测表明: - 异质材质组(Heterogeneous reflectances):联合多物体(All)的多元正态对数似然高达 171.9(马氏距离 16.98),显著优于最高频单物体 A 的 169.2(马氏距离 18.42)及低频物体 C 的 -243.6(马氏距离 28.91); - 异质形状组(Heterogeneous masks):多物体融合后对数似然达 61.5(马氏距离 24.18),远胜单物体最大可视面积 A 的 -56.8(马氏距离 27.60)。
关键发现¶
- 跨物体轴向注意力是光照精度提升的核心,移除它导致光照 logRMSE 从 1.28 急剧恶化至 1.37,证实了频带与视角互补的有效性;
- 推理运行效率极高:单张 A100 处理 1024×1024 图像仅耗时 25.3 秒,相比基于优化的 DPI(1167.7 秒)与 DiffusionLight(1280.1 秒)加速近 50 倍。
亮点与洞察¶
- 多物体即多路探针的物理洞察:将不同材质与几何构型的物体视为对全局光照在不同频带(高通/低通)及空间视场上的并行采样通道,巧妙破解单物体逆向渲染的信息亏损瓶颈。
- 协同调度的收敛边界设计:通过构造反向扩散反射率向镜面状态线性演进的调度器,使异构输入在有限步数内确定性收敛至单一镜面环境光图,避免了传统生成逆扩散无法闭合的难题。
- 频域度量体系的创新:提出基于高阶球谐系数 PCA 分布对数似然与马氏距离的评测指标,更真实地刻画了概率生成模型捕捉物理真值分布的能力。
局限与展望¶
- 依赖已知先验 3D 几何:目前方法输入依赖物体网格与精准表面法线,若几何法线存在显著噪声或拓扑偏差,反射图投影与局部对齐效果将受到冲击。
- 远场环境光假设与近场局限:模型基于无穷远定向环境光照假定,在室内近场光源(点光源产生显著位置衰减与局部空间变化)场景下存在物理失配。
- 反射材质空间均匀性假定:目前假设单物体镜面参数为各向同性且空间均匀,未来需扩展至全空间变化的非均质高光材质。
相关工作与启发¶
- vs DRM (CVPR 2024): DRM 首次提出基于反射图的扩散逆向渲染,但仅支持单无纹理物体且需要无限步收敛;MultiGP 将其推广至多物体联合求解,支持复杂纹理并提出有限步协同调度。
- vs DPI (ACM TOG 2023): DPI 依赖基于物理渲染的可微梯度优化并辅以扩散先验,单图优化耗时超 19 分钟;MultiGP 采用端到端级联前向扩散采样,仅需 25 秒且精度更高。
- vs DiffusionLight (CVPR 2024): DiffusionLight 仅依靠扩散模型幻想环境镀铬球,缺乏严格的物理反射与材质分解;MultiGP 实现了纹理、材质与高频光照的物理可解释联合解耦。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 巧妙利用同场景多物体物理共识约束辐射度解耦,构思独特且理论优雅。
- 实验充分度: ⭐⭐⭐⭐⭐ 合成与真实数据集(Stanford-ORB、nLMVS-real、自采数据集)完备,且开创了球谐分布概率评测标准。
- 写作质量: ⭐⭐⭐⭐⭐ 数学建模严密,物理图像清晰,动机与实验设计自洽连贯。
- 价值: ⭐⭐⭐⭐⭐ 为具身智能交互、真实感三维重照明与逆向渲染领域提供了兼具高质量与高速度的范式范本。