跳转至

GAINS: Gaussian-based Inverse Rendering from Sparse Multi-View Captures

会议: ECCV2026
论文: ECCV 2026
领域: 3D视觉
关键词: 逆渲染、稀疏视角、高斯泼溅、材质-光照解耦、重光照

一句话总结

GAINS 在 2D Gaussian Splatting 的两阶段逆渲染框架中系统性地接入五类基础模型先验(单目深度/法线、几何阶段 SDS、SAM 子部件分割、单目内蕴分解 IID、多光照 MI-SDS),在 4–32 个稀疏视角下把几何、材质与环境光解耦开,重光照 PSNR 在 Synthetic4Relight 上达到 28.16(Ref-Gaussian 为 24.29)、在 Shiny Blender 上达到 22.29(Ref-Gaussian 为 17.26)。

研究背景与动机

逆渲染要解决的是从多视角图像里把场景的内蕴属性——几何、材质(BRDF)、光照——一并反解出来,它是可重光照渲染、材质与形状编辑等下游应用的前置步骤。这条技术路线过去十年演进得很快:从早期只用表面法线、反照度加球谐光照的简化表示,发展到今天的 3D 高斯图元、物理 BRDF 与真实感光照。但性能的兑现始终绑在一个隐含前提上——密集多视角采集。密集观测提供了足够强的几何与光度约束,才勉强把纠缠在成像方程里的形状、反射率、光照分开;一旦视角变稀疏,这些约束迅速失效,优化器就开始"把光照画进反照度、把反射烘进漫反射"来拟合有限的几张训练图,学出来的材质一换光就垮。

本文的出发点正是这个稀疏视角下的病态问题。作者观察到,近年稀疏视角重建(NeRF 与 3DGS 两路)之所以能大幅提升,靠的是把单目深度、法线、扩散模型这类学习型先验和显式几何表示结合起来;但把这套思路搬到逆渲染上并不平凡——先验本身带噪、带幻觉、跨视角不一致,用错了会污染材质与光照估计。本文因此没有只引入单一先验,而是针对逆渲染的每个环节挑选互补的先验,并让它们在一个优化框架里共存:几何阶段用逐像素对齐的深度/法线约束加上只在高频上起作用的扩散正则;材质阶段发现分割、IID、扩散三种先验各有各的收益面与失效面(分割提升镜面参数的跨视角一致性却会拖累反照度;IID 给出高质量反照度但跨视角不一致;扩散先验泛化好但材质一致性差),于是把三者叠加使用。

本文的核心 idea 是把"哪里该信哪个先验"做成两阶段优化里的显式分工:在 2DGS 表示上先用单目深度、法线与延迟启动的扩散 SDS 把几何钉住,再在材质与光照联合优化阶段用分割的类内一致性、单目 IID 反照度与多光照 SDS 三条互补正则同时约束镜面、漫反射与泛化性,从而在 4–16 个视角这种高歧义区间显著优于现有高斯逆渲染方法。

方法详解

整体框架

输入是 N 张稀疏 RGB 图像(实验中 N 低至 4,主要评测用 8)与已知内外参,输出是可直接重光照的 2DGS 场景:每颗高斯带着几何(位置、缩放、旋转、不透明度)、BRDF 参数(反照度、粗糙度、金属度)以及一张 128×128 的环境立方体贴图。表示上作者刻意选了 2D Gaussian Splatting [10] 而不是 3DGS [16]——逆渲染里几何误差会直接恶化材质估计,2DGS 的表面化(surfel)参数化配合深度失真损失能得到更准的法线与表面。

整体走的是逆渲染领域标准的"先几何、后材质光照"两阶段管线,本文的贡献全部落在怎么把基础模型先验塞进这两个阶段。Stage I 用 16000 次迭代优化几何,除 2DGS 原有的颜色、深度失真、法线一致性损失外,额外加上单目深度与法线引导,以及从第 10000 次迭代才开始生效的扩散 SDS 正则;若数据集提供 GT alpha 掩码,再加一项外点剔除。Stage II 冻结几何,用 7000 次迭代联合优化材质与环境光,在重渲染损失之外并上三条互补先验:分割引导的类内一致性、单目内蕴分解的反照度先验、以及在随机环境下渲染再打分蒸馏的多光照 SDS(MI-SDS,从第 3000 步开始)。所有超参固定,不做逐场景调参,也不微调任何先验网络。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["稀疏输入视角(4–32 张)"] --> B["Stage I:几何估计<br/>2DGS + 可微光栅化"]
    B --> C["单目深度与法线引导<br/>约束未见视角的几何"]
    B --> D["几何阶段的延迟扩散引导<br/>收敛后只抹高频伪影"]
    C --> E["收敛的几何与法线"]
    D --> E
    E --> F["Stage II:材质与环境光联合优化"]
    F --> G["分割引导的类内一致性<br/>约束镜面材质参数"]
    F --> H["内蕴分解先验<br/>反照度的可靠起点"]
    F --> I["多光照分数蒸馏<br/>解耦材质与环境光"]
    G --> J["重光照 / 新视角合成"]
    H --> J
    I --> J

关键设计

1. 单目深度与法线引导:让几何不只服务于输入的那几个视角

稀疏输入下 2DGS 会迅速过拟合到训练视角,未见视角上出现明显的几何塌陷与飘浮物,而几何一旦不准,后面的 BRDF 估计就成了空中楼阁。这里的关键是先验怎么用才不反噬:单目深度网络(原文用 [15] 的扩散式深度估计器)本身会带系统性偏置甚至幻觉,若直接做 L1/L2 硬约束,几何会被先验的偏置整体拖偏,进而污染材质与光照。所以深度这一路被拆成两项互补损失——一项是尺度不变的相关性损失 \(L_{DC}=1-\text{PCC}(D_i,\hat D_i)\),只要求渲染深度与单目深度的相对结构一致而不锁死绝对尺度;另一项是局部深度排序损失 \(L_{DR}\)(沿用 FSGS/FateGS 一类的做法),用局部相对远近的软约束避免硬约束导致的几何塌缩和远距离歧义。法线这一路则更硬一些,因为法线直接决定 BRDF 的着色,作者用渲染法线与几何法线之间的 L1、渲染法线与单目法线之间的 L1(权重 0.1),再加一项总变分抑制噪点:

\[L_N = L_1(\tilde N_i, \hat N_i) + 0.1\cdot L_1(\tilde N_i, N_i) + TV(\tilde N_i, \hat N_i)\]

配套的还有外点剔除(仅在提供 GT alpha 掩码时启用):对重建 alpha 掩码加 BCE 损失,并每隔 1000 次迭代做一次 KNN 飘浮物清除。消融显示这条设计的收益集中在高频几何保真度上——去掉深度与法线引导后 Normal MAE 从 11.64 暴涨到 32.23,NVS PSNR 从 23.67 掉到 16.73,是 Stage I 里掉点最狠的一项。

2. 几何阶段的延迟扩散引导:只在形体收敛后抹高频伪影

深度和法线给出的是逐像素对齐的约束,它们管不到那些完全没有被任何输入视角覆盖的区域;那里需要的是"看起来像不像一个真实物体"这种视角无关的先验,于是作者用 Score Distillation Sampling(SDS)引入扩散模型。做法是从环绕场景的视角里采样 100 个新视角,渲染后用随机时间步 \(t\sim U(0.02,0.98)\) 加噪成潜变量,再用扩散模型的噪声预测误差回传梯度。真正让它不翻车的是延迟启用:早期几何离目标形状还差得远,此时 SDS 会把扩散模型的"想象"当成监督,直接激发幻觉;因此 SDS 只在第 10000/16000 次迭代之后才开启,此时几何已基本收敛,引导尺度设为 100 的扩散先验主要作用在抑制高频伪影上,幻觉成分有限。消融里去掉 SDS 只掉 0.1 个 PSNR(23.67→23.57),但去掉 SDS 与外点剔除一起掉到 21.75,说明它是在几何骨架已经立住之后做"精修",价值不在兜底。

3. 分割引导的类内一致性:用语义子部件约束镜面参数

漫反射反照度因为纹理变化本就该在空间上剧烈起伏,但镜面材质参数(粗糙度、金属度)在语义相似的区域内通常是均匀的,这一点先验在稀疏视角下尤其宝贵。作者给每颗高斯附加一个 one-hot 类别向量 \(E_j\in\{0,1\}^K\),借"用高斯做 3D 分割提升"的思路(training-free mask lifting)把 2D 分割掩码抬到 3D:从 100 个环绕新视角渲染带球谐颜色的图像,对每张图跑 SAM 得到掩码,并提取掩码区域的 CLIP 与 DINOv2 特征,把每个掩码分配给 alpha 混合贡献最大的高斯,再按几何与特征相似度合并先前累积的高斯对象。由于分割边界并不精确、单个语义对象内部也可能混有多种材质,约束不是"同一子部件内参数相等",而是最小化掩码内的方差,并让权重随掩码尺寸缩放以抑制小掩码的噪声统计。

正则是三项方差项的和:第一项降低粗糙度与金属度在掩码内的方差,直接压住镜面参数的多视角噪点;第二项针对"镜面材质把环境纹理反射进漫反射"这一歧义——在低粗糙度、高金属度的区域里偏置优化,把纹理细节判给镜面反射而不是反照度;第三项给高镜面区域一点额外权重(权重很低),因为这些区域往往几何误差更大、材质估计误差也更大。消融中一个耐人寻味的现象是:去掉分割引导后反照度 PSNR 反而从 21.73 微升到 21.92,但 NVS(23.90→23.75)与重光照(22.29→22.23)双双下降,恰好印证了作者对三种先验收益面的判断——分割管的是镜面一致性,不管反照度。

4. 内蕴分解先验:给漫反射反照度一个可靠的起点

分割先验对高频纹理化的漫反射反照度无能为力,而反照度恰恰是重光照质量的关键:一旦把光照(尤其是阴影与镜面反射)烘进反照度,换光后就会原样复现出"鬼影"。作者的做法是把单目内蕴图像分解网络当成反照度的先验老师,室内数据用 Teamwork [26]、室外数据用 RGB2X [43](作者实测后者在室外场景分解更可靠),在渲染反照度与 IID 预测反照度之间加 L2 损失。考虑到单目 IID 本身跨视角不一致,这个损失乘以一个随迭代线性衰减的权重 \(\beta(\tau)\)

\[L_{IID} = \beta(\tau)\cdot L_2(A_i, \hat A_i)\]

即优化早期强力借用 IID 的分解结果快速把反照度拉到合理范围,随着模型自身收敛逐步放手,让多视角重渲染损失接管。作者刻意把 IID 监督用到粗糙度与金属度上——实验发现这两个通道的 IID 预测稳健性差、跨视角不一致更严重。消融中这条先验是反照度指标的最大贡献者:去掉 IID 后反照度 PSNR 从 21.73 掉到 21.38,重光照从 22.29 掉到 22.07。

5. 多光照分数蒸馏:把材质从学好的环境图里解放出来

分割与 IID 分别改善了镜面与漫反射参数的准确度,但两者都不保证在没见过的视角与没见过的光照下仍然成立。作者沿用 Stage I 的 SDS 思路,但换了一个打分对象:不再是在当前光照下渲染新视角,而是在一个新视角 \(C_j\) 下、用预先准备好的环境图集合 \(\{E_l\}\) 里随机抽一张做重光照渲染 \(R_{mat}(C_j, G, M, E_l)\),对这张重光照图加噪后算 SDS 损失:

\[L_{MI-SDS} = \mathbb{E}_{t,\epsilon}\big[w(t)\,\|\epsilon_\phi(Z_j^l; t)-\epsilon\|_2^2\big],\quad Z_j^l = \alpha_t R_{mat}(C_j, G, M, E_l) + \sigma_t\epsilon\]

这样做的意义在于打断材质与环境光之间的"共谋":如果只用学到的环境图 \(L\) 做监督,材质可以把误差推给光照、光照也可以反向补偿材质,两者一起拟合训练视角却都无法泛化;而在随机第三方光照下渲染,材质若把光照烘进了漫反射,就会在新光照下立刻露馅。与 Stage I 相同,MI-SDS 也延迟到第 3000 步(共 7000 步)才启用,引导尺度同为 100,主要抑制高频伪影。消融显示去掉 MI-SDS 对指标影响最小(重光照 22.29→22.26),但作者强调它带来的是跨视角与新光照下的稳定性,这一点在指标上体现不足而在视觉上可见。

损失函数 / 训练策略

Stage I(几何)的完整损失是 2DGS 原始损失与新增先验的加权和:

\[L_{stage1} = L_{col} + \lambda_{DC}L_{DC} + \lambda_{DR}L_{DR} + \lambda_{NC}L_{NC} + \lambda_{N}L_{N} + \lambda_{SDS}L_{SDS} + \lambda_{BCE}L_{BCE}\]

其中 \(L_{col}\) 是 L1 与 D-SSIM 混合的重渲染损失,\(L_{NC}\) 是渲染法线与深度导出法线的一致性损失。权重为 \(\lambda_{DC}=0.005,\ \lambda_{DR}=10,\ \lambda_{NC}=1,\ \lambda_{N}=0.25,\ \lambda_{SDS}=0.0001,\ \lambda_{BCE}=0.75\)。Stage II(材质与环境光)在冻结几何后用 7000 次迭代联合优化:

\[L_{mat} = L_{color} + \lambda_{ICC}L_{ICC} + \lambda_{IID}L_{IID} + \lambda_{MI\text{-}SDS}L_{MI\text{-}SDS} + \lambda_{TV}L_{TV}\]

其中 \(L_{TV}\) 是对重建光照的总变分平滑项,权重为 \(\lambda_{ICC}=0.1,\ \lambda_{IID}=2,\ \lambda_{MI\text{-}SDS}=0.0001,\ \lambda_{TV}=0.1\)。所有超参在全部场景上固定,不做逐场景搜索,也不对任何先验网络做微调;SDS 的引导尺度均为 100。\(\lambda_{SDS}\)\(\lambda_{MI\text{-}SDS}\) 量级很小(1e-4)是因为 SDS 梯度本身尺度大,真正起作用的是延迟启用的调度。

一个完整示例

以 Ref-Real 数据集里的 sedan 场景为例走一遍:输入是 8 张环绕拍摄的稀疏视角图(外加 GT alpha 掩码)。Stage I 先用 2DGS 建立初始几何,同时每张图过一遍单目深度与法线网络;优化在 10000 步之前完全由颜色损失、深度相关性/排序损失、法线 L1+TV 与外点剔除驱动,几何逐步收敛到车身轮廓;第 10000 步后 SDS 以 1e-4 权重介入,在 100 个环绕新视角上抹掉车顶与轮毂附近的高频飘浮物,到第 16000 步几何定型。进入 Stage II 后,材质与 128×128 环境光开始联合优化:前 3000 步靠分割引导的类内一致性把车身与玻璃的粗糙度/金属度分别压平,靠 IID 先验(此处用室内版 Teamwork)把车门内侧的漫反射反照度拉到合理区间;第 3000 步后 MI-SDS 开始用随机环境图做重光照渲染再打分,把"烤"在反照度里的天空反射剥离出来。最终结果就是 Fig. 3 里那套可在三个新环境图下重光照的材质图——相比 GI-GS 在车身上出现的噪点法线与 Ref-Gaussian 的飘浮物,本文的反照度、粗糙度、金属度都更干净。

实验关键数据

主实验

评测基线覆盖 6 个高斯逆渲染方法(Ref-Gaussian [39]、GI-GS [3]、GaussianShader [12]、R3DG [6]、MaterialRefGS [46]、SVG-IR [32]),数据集为 Synthetic4Relight [48]、Shiny Blender [33](扩增了 GT 反照度与重光照、去掉了 ball 物体)与真实数据 Ref-Real [33]。主表统一用从密集视角里均匀采样的 8 个稀疏视角训练;反照度评价做尺度不变的 MSE 归一以规避反照度-光照固有歧义。GIR [30] 在真实场景上无法重建出有意义的几何与反射率且单场景训练超过 7 小时,只做了定性对比。

数据集 指标 本文 之前SOTA 提升
Synthetic4Relight(重光照) PSNR ↑ / SSIM ↑ / LPIPS ↓ 28.16 / 0.93 / 0.09 27.42 / 0.90 / 0.10(R3DG) +0.74 PSNR
Synthetic4Relight(NVS) PSNR ↑ 29.32 27.04(GI-GS) +2.28
Synthetic4Relight(反照度) PSNR ↑ 22.34 22.15(R3DG) +0.19
Synthetic4Relight(粗糙度) MSE ↓ 0.04 0.03(SVG-IR) 略逊于 SVG-IR
Shiny Blender(重光照) PSNR ↑ / SSIM ↑ / LPIPS ↓ 22.29 / 0.89 / 0.12 17.26 / 0.66 / 0.20(Ref-Gaussian) +5.03 PSNR
Shiny Blender(反照度) PSNR ↑ 21.73 21.37(GI-GS) +0.36
Shiny Blender(法线) MAE ↓ 11.64 24.43(R3DG) 误差减半以上
Ref-Real(NVS,真实数据) PSNR ↑ / SSIM ↑ 20.28 / 0.56 19.64 / 0.44(GI-GS) +0.64 PSNR / +0.12 SSIM
运行时间 单场景 ≈1h20m ≈1h30m(R3DG / GI-GS) 与最快方法同一量级

其中 Shiny Blender 与 Synthetic4Relight 上重光照的具体对手值分别为:Synthetic4Relight 上 GI-GS 23.92、Ref-Gaussian 24.29,本文 28.16;Shiny Blender 上 GI-GS 15.44、Ref-Gaussian 17.26,本文 22.29。

消融实验

Stage I 消融在 Shiny Blender 的 8 视角设定下进行(只保留几何阶段、不接 Stage II):

配置 NVS PSNR ↑ 反照度 PSNR ↑ 重光照 PSNR ↑ 法线 MAE ↓ 说明
Full(含深度、法线、SDS、外点剔除) 23.67 21.18 21.96 11.64 完整 Stage I
w/o SDS 23.57 21.09 21.91 11.70 影响最小,SDS 是精修项
w/o SDS, OR 21.75 19.98 21.26 13.79 外点剔除去掉后掉点明显
w/o Normal, SDS, OR 19.42 18.79 19.41 19.38 法线先验贡献突出
w/o Depth, Normal, SDS, OR 16.73 16.41 16.71 32.23 深度先验是几何的根基

Stage II 消融同样在 Shiny Blender 8 视角下进行(几何用完整 Stage I,只切换材质阶段的先验组合):

配置 NVS PSNR ↑ 反照度 PSNR ↑ 重光照 PSNR ↑ 说明
Full 23.90 21.73 22.29 三条先验全开
w/o MI-SDS 23.88 21.66 22.26 指标掉幅最小,收益在跨视角稳定性
w/o Seg 23.75 21.92 22.23 反照度反而略升,但 NVS/重光照下降
w/o IID 23.84 21.38 22.07 反照度掉点最多(−0.35)
w/o Seg, IID, MI-SDS 23.67 21.18 21.96 退化回纯 2DGS 几何阶段的水平

关键发现

  • 深度先验是几何的根基,扩散先验是精修。Stage I 里去掉深度/法线后 Normal MAE 从 11.64 恶化到 32.23、NVS 掉 6.9 个 PSNR;而单独去掉 SDS 仅掉 0.1。这与 SDS 延迟到 10000/16000 步才启用的设计一致——它承担的是收敛后的高频清理,不是兜底。
  • 三种材质先验的收益面互不重叠。IID 是反照度的最大贡献者(去掉后反照度 −0.35 PSNR、重光照 −0.22),分割是镜面一致性的贡献者(去掉后反照度 PSNR 反而 +0.19,但 NVS −0.15、重光照 −0.06),MI-SDS 对三项指标影响都很小却负责未见视角与新光照下的稳定性。作者据此论证"只有三者合用才能兼顾参数准确度、多视角一致性与泛化性"。
  • 视角数增加后优势收窄,但起点更高。在 4–8 视角的极端稀疏区间,GAINS 在 NVS/反照度/重光照三项上全面大幅领先;16–32 视角时 GI-GS 在 NVS 上追平甚至反超,但重光照仍由 GAINS 保持领先;到 64–100 视角,Ref-Gaussian 在 NVS 上超过 GAINS 并追平重光照——作者解释为 Ref-Gaussian 的优化目标更宽松(不显式优化反照度、直接靠 Stage I 的球谐表示拟合外观,并在 Stage II 继续致密化)。换句话说,本文的价值集中在稀疏区间。
  • 指标之外的差异:GI-GS 在 NVS 上排第二,但它的法线明显更噪(sedan 场景车身),作者判断其 NVS 成绩来自过拟合而非真的恢复了形状;定性对比中 Ref-Gaussian 存在飘浮物、GI-GS 常能给出合理几何但反照度与粗糙度不稳定,GAINS 的主要可视收益是反射不易被"烘"进材质,重光照时地面与天空的反射能随光照正确变化。
  • 诚实提一句:粗糙度 MSE 上 SVG-IR(0.03)优于本文(0.04),本文并非所有指标全面领先。

亮点与洞察

  • 把"互补先验"的判断做成可验证的实验结论。论文没有笼统地说"我们用了基础模型先验",而是逐一说明分割提升镜面一致性但伤反照度、IID 提升反照度但跨视角不一致、扩散提升泛化但材质不一致,并让消融数字与这个论断一一对应(w/o Seg 反照度反升这一反直觉现象就是最好的证据)。这种"先验收益面分析"的写法本身值得迁移到任何多先验融合的工作里。
  • 延迟启用扩散先验是个便宜且有效的 trick。SDS 在稀疏视角几何任务里极易制造幻觉,本文的处理极其简单——只在几何基本收敛后(10000/16000、3000/7000)开启,并把引导尺度定在 100 让它主要抹高频。这个调度不增加任何计算成本,却把 SDS 从"可能带偏"变成"稳定精修"。
  • MI-SDS 切断材质与环境光的共谋是全文最漂亮的一步。在自学的环境图下渲染,材质和光照可以互相补锅;换成随机第三方环境图渲染再打分,任何被烘进材质的反射都会立刻暴露。这个思路可以直接迁移到任何存在"两变量互相补偿"歧义的逆问题(如本征分解、阴影去除、白平衡)。
  • 权重随迭代衰减的软先验调度(IID 的 \(\beta(\tau)\) 线性下降)是把"跨视角不一致的强先验"用好的通用范式:早期当初始化用、后期让多视角数据接管,比硬性全程约束稳健得多。
  • alpha 掩码的有无被显式区分处理:有掩码时用 BCE + KNN 清飘浮物,没掩码时就让场景连背景一起重建,避免了为合成数据设计的机制在真实数据上失效。

局限与展望

  • 作者承认的第一条局限是忽略全局光照:本文只建模直接光,物体只接收来自环境图的方向性入射,没有二次反弹与相互反射。这对孤立物体尚可接受,对完整室内场景会明显失真(GI-GS 正是主打这一点的对比方法)。
  • 第二条是法线的微小起伏:虽然加了平滑约束,几何法线仍会略有波浪,在强镜面材质上尤其明显;波浪法线会让部分镜面高光被烘进漫反射反照度。作者建议把几何法线与着色法线分离建模来缓解,但没有实现。
  • 自己观察到的一点:所有超参、先验网络与迭代预算都是固定的,这既是"无需逐场景调参"的优点,也意味着在极端不同的场景(例如大面积半透明或强各向异性材质)上没有适配余地;另外 Stage II 三条先验都依赖外部大模型(SAM、CLIP、DINOv2、Teamwork/RGB2X、扩散模型),整体推理开销与实际部署成本论文没有报告。
  • 改进方向:把直接光扩展到环境光遮蔽/相互反射的近似全局光照;引入几何法线与着色法线的解耦表示;让 IID 与分割先验的权重也随几何置信度自适应(目前分割权重只按掩码尺寸缩放,未考虑该区域的重建质量)。

相关工作与启发

  • vs Ref-Gaussian [39] / GI-GS [3]:这两者是本文最主要的对比对象,共同点是都用 2D/3D 高斯 + 物理 BRDF + 延迟着色做逆渲染,也都假设密集视角。GI-GS 额外建模全局光照,在 NVS 上很强(密集视角下可超过本文),但本文的实验显示它在稀疏视角下法线噪声大、反照度与粗糙度不稳定,重光照明显落后;Ref-Gaussian 在 64–100 视角的 NVS 上反超本文,但它靠球谐外观拟合、不显式优化反照度,稀疏时空视角下会出现飘浮物与反射"烘烤"。本文与它们的根本区别是不改渲染管线、而是在优化目标里补上学习型先验。
  • vs 稀疏视角几何重建(FSGS、SparseGS、GaussianObject、FateGS 等 [11,37,38,49]):这批工作已经证明单目深度/法线与扩散先验能大幅改善稀疏视角的几何,但它们只优化外观与形状,不恢复材质与光照。本文把同一套先验搬进逆渲染,并额外指出:深度先验的偏置在几何任务里可以容忍,但在逆渲染里会顺着几何误差污染材质与光照,因此需要相关性损失 + 排序损失这种"只锁结构不锁尺度"的软化处理。
  • vs 单图/稀疏视角逆渲染的早期方法 [17,28,29] 与 RelitLRM [45]:前者从合成数据学先验但不显式建模几何与光传输,对复杂真实场景泛化差;后者用大重建模型做物体重光照,但不估计内蕴分量(材质参数)也难以推广到复杂场景。本文的定位介于两者之间:保留物理光传输与显式 BRDF,用基础模型补上稀疏观测缺失的约束。
  • vs 神经逆渲染(NeRFactor [47]、TensoIR [13]、GaNI [35] 等):NeRF 系方法用隐式表示 + 简化 BRDF/光照模型,质量高但训练慢;本文沿用高斯表示以换取效率(单场景约 1h20m),代价是无法像 GaNI 那样自然引入近场光照与神经辐射缓存。

评分

  • 新颖性: ⭐⭐⭐ [框架是"2DGS + 基础模型先验"的工程化组合,单个组件(深度/法线/SDS/IID/分割)都被他人用过,新意主要在互补先验的分工设计与 MI-SDS 这一改造]
  • 实验充分度: ⭐⭐⭐⭐ [两个合成数据集加一个真实数据集、6 个基线、视角数从 4 扫到 100、两阶段各自的消融,覆盖完整;但真实数据只评了 NVS,材质与重光照缺定量指标]
  • 写作质量: ⭐⭐⭐⭐ [先验收益面的分析清晰、消融与论断对得上,公式与损失权重交代完整;不足是部分公式在排版上有损坏,且 Stage II 各先验的交互效应只给了单变量消融]
  • 价值: ⭐⭐⭐⭐ [给出了稀疏视角逆渲染的可复现配方(先验选择 + 延迟调度 + 软权重衰减),对做 3D 重建与重光照的工程实践有直接参考价值]