跳转至

Learning Spectral and Polarimetric Clues for One-to-Multimodal Novel View Synthesis

会议: ECCV 2026
论文: ECCV 原文
项目主页: https://medialab.dei.unipd.it/paper_data/SPoILeR/
领域: 3D 视觉
关键词: 多模态神经渲染, 新视角合成, 字典基底分解, 光谱与偏振先验, 隐式辐射场

一句话总结

针对非传统传感器数据采集成本高昂的难题,本文提出 SPoILeR 隐式辐射场架构,通过跨场景多模态预训练学习多源波段互相关先验,仅需目标场景单视角/多视角普通 RGB 图像微调,即可合成多视角严格一致的多光谱、近红外与偏振新视角图像。

研究背景与动机

神经辐射场(NeRF)与 3D 高斯泼溅(3DGS)在新视角合成与 3D 几何重建任务上取得了极高保真度,这一飞跃很大程度上依赖于互联网上极度充裕的 RGB 图像数据。然而在物理测量、材料识别、去反光及穿透感知等专业任务中,可见光波段之外的多光谱(MS)、近红外(NIR)以及偏振(Pol)成像具有不可替代的物理鉴别能力。近年来涌现的 X-NeRF、NeSpoF 以及 MultimodalStudio 等多模态辐射场方法,虽然拓展了神经渲染的物理模态,但无一例外要求对每个待建场景部署全套高灵敏度、价格昂贵的专业相机阵列进行密集多视角标定与采集,导致其实用性与可推广性受到极大制约。

更为关键的技术矛盾在于:在缺乏目标场景非常规传感器观测时,现有的跨模态生成路线陷入了两难境地。若采用单图像直接转换方案(如用于光谱超分辨率的 MST++ 或用于偏振估计的 PolarAnything),由于其仅基于单帧 2D 图像进行前向推断,不同视角生成的物理属性在几何与光照物理上缺乏多视角一致性,若强行输入 3D 渲染框架进行多视角体渲染,会导致三维空间特征均值模糊或产生剧烈的伪影;若直接在 3D 框架内由 RGB 单一监督进行逆问题优化,未受监督波段的特征表示极易在隐空间发生漂移甚至崩溃。

本文的切入视角是解耦跨场景共享的多模态物理辐射相关性与场景特有的几何纹理:既然不同传感器探测的本质上是同一场景表面对电磁波谱的反射与偏振响应,其模态间物理关联具备跨场景不变性。核心 idea:将多模态辐射场分解为全局共享的基底字典与场景专有的系数网格,在预训练阶段通过多场景全模态学习鲁棒的多模态隐空间及解码映射,在目标场景微调时仅优化轻量系数与几何,配合隐空间几何、逆函数与亮度正则化损失,实现仅凭 RGB 监督即可零样本外推高质量、多视角严格一致的非传统模态渲染。

方法详解

整体框架

SPoILeR 建立在 SDF 几何神经隐式表面与字典场解耦表示之上。在跨场景预训练(PT)阶段,模型接收包含 RGB、NIR、单色(Mono)、偏振(Pol)与多光谱(MS)多模态图像的场景集合,交替训练场景专有的系数/几何模块与全局共享的基底/辐射解码模块;在目标场景微调(FT)阶段,冻结所有多模态先验解码器与基底,仅需目标场景的单模态(如普通 RGB)密集图像优化场景特定系数,进而前向解码合成任意缺失波段的新视角。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    In["输入:3D 采样点 x、视线方向 v 与几何特征 g"] --> DecoupledField["基底与系数解耦场<br/>c(x) 场景系数与 b(γ(x)) 共享基底逐点内积"]
    DecoupledField --> LatentEnc["共享隐空间编码与多波段解码<br/>J 投影 + Z 隐式编码 + 多模态独立解码器 D_l"]
    LatentEnc --> Regularization["隐空间三重结构化正则机制<br/>几何测距一致 L_lsg + 逆映射锚定 L_inv + 模态亮度对齐 L_m2l"]
    Regularization --> Sched["双阶段交替优化与梯度门控调度<br/>PT 阶段跨模态预训练 + FT 阶段单模态冻结微调"]
    Sched --> Out["输出:多视角一致的 RGB / NIR / Mono / Pol / MS 图像"]

关键设计

1. 基底与系数解耦场:分离全局模态先验与局部场景特征 传统单场景多模态 NeRF 模型将所有容量固化在独立哈希网格中,无法在场景间迁移电磁反射先验。SPoILeR 借鉴字典场(Dictionary Fields)思想,将空间点 \(\mathbf{x}\) 的辐射信号参数化为场景专属系数场 \(\mathbf{c}(\mathbf{x}) \in \mathbb{R}^D\) 与全局共享基底场 \(\mathbf{b}(\gamma(\mathbf{x})) \in \mathbb{R}^D\) 的点乘结合,其中 \(\gamma(\cdot)\) 为多频锯齿周期坐标映射函数,促使相同基底能够在不同空间位置复用: $\(f = \mathbf{c}(\mathbf{x})^\top \mathbf{b}(\gamma(\mathbf{x}))\)$ 这种设计构成了严格的归纳偏置:与特定场景绑定的反射率强弱、高频材质纹理被吸纳进紧凑的系数场 \(\mathbf{c}\) 中;而表征不同电磁波段如何共同响应物理材质的基础跨模态物理规律,则被永久固化在基底场 \(\mathbf{b}\) 内,为后续缺乏多波段标注场景的泛化外推奠定结构基础。

2. 共享隐空间编码与多波段解码:构建轻量化紧凑辐射通路 在基底与系数点积特征 \(f\) 之后,模型依次通过投影函数 \(\mathcal{J}\)、隐式编码器 \(\mathcal{Z}\) 以及针对每个传感器波段独立的模态解码器 \(\mathcal{D}_l\)。编码器 \(\mathcal{Z}\) 将投影特征与相机视角 \(\mathbf{v}\) 及来自 SDF 几何分支的局部几何特征 \(\mathbf{g}\) 拼接,映射到紧凑而富含语义的潜在向量 \(\mathbf{z}\),最终由各波段解码器预测对应通道辐射度: $\(\mathcal{P}(f, \mathbf{v}, \mathbf{g}, l) = \mathcal{D}_l(\mathcal{Z}(\mathbf{g}, \mathcal{J}(f), \mathbf{v}))\)$ 所有解码与编码模块均设计为浅层 MLP,将绝大部分参数量留给基底网格。这一设计有效避免了深度 MLP 在单模态微调时因过度参数化带来的非凸过拟合,保证了即使在监督波段极度匮乏时,隐空间向量 \(\mathbf{z}\) 亦能由 RGB 信号稳健激发并正确激活多光谱及偏振解码器。

3. 隐空间三重结构化正则机制:防止缺失波段隐式表征漂移 当微调阶段仅有 RGB 图像提供梯度时,未受监督波段的隐空间表征极易发生灾难性漂移。为此,本文设计了互补的三重正则化约束: - 隐空间几何损失 \(\mathcal{L}_{lsg}\):为消除微小潜在扰动被放大为剧烈辐射波动的敏感性,强制光线积分隐向量 \(\hat{\mathbf{z}}\) 的成对欧氏距离分布,通过 KL 散度拟合解码后全波段多模态辐射值 \(\hat{\mathbf{m}}\) 的成对空间距离分布: $\(\mathcal{L}_{lsg} = \mathrm{KL}\left(\mathrm{softmax}_{\mathrm{row}}(-D_z), \, \mathrm{softmax}_{\mathrm{row}}(-D_m)\right)\)$ - 逆函数损失 \(\mathcal{L}_{inv}\):预训练一个逆映射浅层 MLP \(\mathcal{I}_\Theta(\hat{\mathbf{m}}) \to \hat{\mathbf{z}}_e\),在微调时冻结 \(\mathcal{I}_\Theta\),利用解码辐射度逆推隐向量作为基准锚点,施加均方误差约束 \(\mathcal{L}_{inv} = \mathrm{MSE}(\hat{\mathbf{z}}_e, \hat{\mathbf{z}})\),防止微调潜变量偏离预训练流形。 - 模态-亮度对齐损失 \(\mathcal{L}_{m2l}\):训练映射器 \(\mathcal{M}_\Theta(\hat{\mathbf{m}}_l, l) \to g_e\),强制任意模态解码通道估计出的灰度强度与 RGB 计算的真实亮度 \(g\) 对齐:\(\mathcal{L}_{m2l} = \mathrm{MSE}(g_e, g)\)。该项对于 NIR 与偏振尤为关键,迫使捕捉红外成分的传感器与可见光共享内在连贯基准,避免其演化为正交孤立子空间。

4. 双阶段交替优化与梯度门控调度:保护全局先验免受局部几何污染 在预训练阶段,模型引入周期轮换调度策略:每个场景分配 \(B=15\) 步迭代,其中前 80% 步数仅优化场景系数与几何模块,后 20% 步数交替冻结场景参数转而优化全局共享基底与多模态解码器。为防止场景特异性几何特征 \(\mathbf{g}\) 窃取辐射多模态信息(否则在微调时缺失的模态信息会因几何特征未共享而丢失),预训练中对 \(\mathbf{g}\) 实施梯度门控 Dropout:每步迭代仅允许随机抽取的单一模态梯度反向传播穿透几何特征,从而迫使真正的跨模态相关性沉淀至共享基底与辐射 MLP 中。微调阶段则全量冻结共享参数,仅优化目标场景系数,训练耗时缩短至单场景从头训练的四分之一。

损失函数 / 训练策略

模型综合优化目标包含多模态光度重构损失 \(\mathcal{L}_{mod}\)、SDF Eikonal 表面正则项 \(\mathcal{L}_{eik}\)(权重 \(\lambda_{eik} = 0.1\))、曲率光滑项 \(\mathcal{L}_{curv}\)(权重 \(\lambda_{curv} = 0.0005\))以及三重隐式正则损失: $\(\mathcal{L} = \mathcal{L}_{mod} + \lambda_{eik}\mathcal{L}_{eik} + \lambda_{curv}\mathcal{L}_{curv} + \lambda_{lsg}\mathcal{L}_{lsg} + \lambda_{inv}\mathcal{L}_{inv} + \lambda_{m2l}\mathcal{L}_{m2l}\)$ 在跨场景预训练(PT)阶段,采用单张 NVIDIA RTX 6000 Ada 训练 100 万步,设置 \(\lambda_{lsg} = 0.1, \lambda_{inv} = 1.0, \lambda_{m2l} = 1.0\);在目标场景微调(FT)阶段,仅迭代 3 万步即可收敛,禁用几何流形损失(\(\lambda_{lsg} = 0\)),并将逆函数与亮度正则项微调为 \(\lambda_{inv} = 0.01, \lambda_{m2l} = 0.02\)。

实验关键数据

主实验

实验在 MMS-DATA 数据集上进行(包含 32 个目标级场景,27 个场景用于 PT,5 个保留场景用于 FT,包含 RGB、NIR、Mono、Pol、MS 共 5 种模态)。主要评价指标为峰值信噪比(PSNR,单位 dB)及结构相似性(SSIM)。基准模型 MMS-FW 为单场景全参从头训练,参数量约 12M,需优化 10 万步;SPoILeR 微调阶段总参数仅 4.1M,且可训练参数仅占 7%(约 300k 参数),3 万步即完成。

下表对比了在仅提供 RGB 训练图像(标准单模态输入)以及提供全部模态图像(全监督上限)时,SPoILeR 与基线方法 MMS-FW 的渲染质量:

评估配置 训练模态 测试模态 SPoILeR (本文) PSNR ↑ SPoILeR SSIM ↑ MMS-FW [42] PSNR ↑ MMS-FW SSIM ↑ 性能增益 / 说明
标准测试 (单输入) RGB RGB 30.07 — 29.53 — +0.54 dB (预训练先验反哺 RGB 重建)
标准测试 (单输入) RGB Mono 25.78 0.88 无法生成 — 零样本多模态外推
标准测试 (单输入) RGB NIR 26.55 0.87 无法生成 — 零样本红外辐射合成
标准测试 (单输入) RGB Pol 24.25 — 无法生成 — 零样本偏振矢量重构
标准测试 (单输入) RGB MS 25.45 — 无法生成 — 零样本多光谱频段合成
全监督上限 (参考) 全部 (ALL) RGB 30.54 — 32.77 — -2.23 dB (容量差距与冻结基底限制)
全监督上限 (参考) 全部 (ALL) Mono 29.21 0.93 32.98 0.94 SSIM 保持高度接近
全监督上限 (参考) 全部 (ALL) NIR 32.12 0.92 34.25 0.93 仅差 2.13 dB,参数量仅其 1/3
全监督上限 (参考) 全部 (ALL) Pol 29.32 — 30.66 — 差距小于 1.34 dB
全监督上限 (参考) 全部 (ALL) MS 28.46 — 31.42 — 维持高水准多光谱上限

在与 2D 模态转换方案(MST++ 用于多光谱超分辨、PolarAnything 用于偏振角 AoP 与偏振度 DoP 估计)结合 NeRF 的对比中: - 在 MS 图像合成上,MST++ 估计后输入 NeRF 重建的 PSNR 仅为 21.99 dB,而 SPoILeR 仅凭 RGB 直接输出达到 25.45 dB(大幅领先 +3.46 dB)。 - 在偏振估计上,PolarAnything + NeRF 得到的 AoP 平均角度误差(MAngE)为 44.13°、DoP 平均绝对误差(MAbsE)为 0.089;SPoILeR 取得了 30.05°(误差直降 14.08°)以及 0.045(误差降低 近 50%),充分验证了 3D 隐式先验消除 2D 视角不一致噪声的决定性优势。

消融实验

在仅使用 RGB 图像进行目标场景微调的严格设定下,对预训练引入的三个潜在正则化损失进行剥离消融分析:

测试配置 RGB (dB) Mono (dB) NIR (dB) Pol (dB) MS (dB) 核心观察与物理归因
完整模型 (Ours) 30.07 25.78 26.55 24.25 25.45 各波段保持最佳综合渲染质量
去掉隐空间几何损失 \(w/o \; \mathcal{L}_{lsg}\) 29.90 (-0.17) 25.44 (-0.34) 26.30 (-0.24) 23.08 (-1.18) 23.14 (-2.31) MS 与 Pol 发生显著劣化 (-2.31 dB / -1.18 dB)
去掉逆函数损失 \(w/o \; \mathcal{L}_{inv}\) 29.96 (-0.11) 25.54 (-0.25) 25.96 (-0.58) 24.01 (-0.24) 25.28 (-0.17) 隐空间发生全局轻微漂移,NIR 受损较为明显
去掉模态亮度对齐 \(w/o \; \mathcal{L}_{m2l}\) 29.95 (-0.12) 21.04 (-4.38) 22.91 (-3.64) 23.73 (-0.52) 25.36 (-0.09) Mono 与 NIR 发生雪崩式崩溃 (-4.38 dB / -3.64 dB)

关键发现

  • 模态-亮度对齐损失 \(\mathcal{L}_{m2l}\) 是连接红外波段与可见光的生命线:Mono 与 NIR 均响应部分近红外光谱,若缺乏亮度对齐约束,隐空间在无红外真值监督时倾向于将不可见的红外分量正交孤立,导致微调推断的 Mono 和 NIR PSNR 暴跌 4.38 dB 与 3.64 dB。
  • 隐空间几何测距损失 \(\mathcal{L}_{lsg}\) 决定高维信息模态(MS / Pol)的解码鲁棒性:多光谱与偏振拥有极高维度的通道间互相关联。\(\mathcal{L}_{lsg}\) 确保了潜在空间距离分布与物理辐射距离分布同构,使得即使微调产生的隐向量略有偏差,解码器依然能平滑投射到正确的光谱与偏振曲线上。
  • 不平衡稀疏输入极端鲁棒:在保留全部 45 帧 RGB 但额外模态仅给 1 帧的极端非对称采集设置下,SPoILeR 在 MS、Pol 和 NIR 上的合成性能分别比 MMS-FW 高出惊人的 ~8 dB、~7 dB 与 ~6 dB;MMS-FW 需要多达 25 帧额外模态才能追平 SPoILeR 的水平。

亮点与洞察

  • 模态互相关跨场景解耦机制:巧妙借助字典场思想,将跨波段电磁耦合固化在全局基底中,而将易变的场景几何纹理下放给系数矩阵,打破了神经渲染对单场景全套高精度传感器的刚性依赖。
  • 以 3D 隐式流形阻断 2D 跨模态误差累积:传统 2D 模态转换方法(MST++、PolarAnything)因视角独立导致严重的多视角几何与光度冲突;SPoILeR 在 3D 隐式流形上原生优化,天然继承多视角几何与光照物理一致性。
  • 几何特征梯度门控技术:通过在预训练期随机对几何特征 \(g\) 进行单波段梯度反传门控(Gradient Dropout),巧妙解决了场景特定几何特征“偷跑”辐射先验的隐蔽失效模式,极富工程启发。

局限与展望

  • 先验依赖特定材质与光照分布:跨模态推断依赖于预训练见过的材质物理特性。若新场景包含前所未见的奇异超材料或极端反射介质,仅靠 RGB 难以准确猜中其偏振或红外反射谱。
  • 静态可控采集假设严格:目前预训练与微调均假设固定曝光、白平衡以及恒定室内受控照明环境;在开放动态室外光照及未知光谱响应下可能出现预测偏差。
  • 未来方向:探索引入非受控多谱照明解耦机制,并将该字典解耦机制推广至实时 3D 高斯泼溅(3DGS)渲染引擎中。

相关工作与启发

  • vs MultimodalStudio (MMS-FW):MMS-FW 依赖针对每一场景同时采集 5 种传感器的全量视点并从头优化 10 万步;SPoILeR 通过跨场景预训练提炼可迁移先验,仅需 RGB 图像优化 3 万步即可合成多模态,微调参数量与耗时大幅削减,且在非平衡极少帧条件下具有压倒性优势。
  • vs 2D Modality Conversion (MST++ / PolarAnything):2D 估计算法在单帧上虽有极高细节,但在三维旋转视角下完全缺失多视角一致性;SPoILeR 从三维辐射场隐空间层面直接解码不同模态,从几何构造上彻底根除了多视角闪烁与空间均值模糊。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次系统性提出单模态(RGB)外推多视角物理一致多光谱与偏振新视角的神经辐射场架构。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 5 种物理传感器模态,包含非平衡模态实验、跨模态 SOTA 对比与详尽消融分析。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密,物理动机、数学形式化与系统调度阐述极其清晰自洽。
  • 价值: ⭐⭐⭐⭐⭐ 极大降低了多模态数字孪生与特殊传感 3D 重建的硬件门槛,对工业检测与遥感感知具有重大参考价值。