跳转至

SMP-UWGS: Coupled Physics-Geometry Optimization for Scalable Multi-Partition Underwater 3D Reconstruction

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/vicliuuuu/SMP-UWGS
领域: 3D视觉
关键词: 水下3D重建, 3D高斯泼溅, 物理引导渲染, 多分区并行优化, 衰减与后向散射

一句话总结

针对大规模水下场景中光衰减与几何深度高度耦合导致的计算爆炸与色偏退化问题,提出 SMP-UWGS 框架,将多分区高斯架构与可微物理渲染网络(DPR-Net)联合优化,实现了高保真、可扩展且实时渲染的水下三维重建。

研究背景与动机

水下三维重建在海洋生态监测、水下考古和自主水下机器人导航等领域具有至关重要的价值。然而,水下光学成像面临着极度严苛的介质退化挑战:水体对光线的波长选择性吸收与悬浮颗粒引起的强烈后向散射,导致图像普遍存在对比度下降、严重蓝绿色偏以及随拍摄距离显著增强的模糊伪影。近年来,以 3D Gaussian Splatting(3DGS)和神经辐射场(NeRF)为代表的神经渲染技术极大地推动了场景重建的发展,但直接迁移至大规模水下场景时却陷入了两难境地。

现有水下物理增强渲染方法(如 SeaThru-NeRF、UW-GS 和 SeaSplat)通过显式建模光线波长吸收和散射模型,有效恢复了真实色彩,但其依赖稠密体素采样或全场景全局光学参数联合优化,在大规模场景下显存占用和训练时间呈指数级上升;另一方面,大场景显式划分方法(如 VastGaussian、Mega-NeRF)通过空间分块和点云裁剪实现并行可扩展性,却普遍将传输介质假设为均匀空气,彻底忽略了水下辐射传输与相机-物体距离(深度)的强相关性。一旦空间分区切断了几何与介质衰减的连续性,深水区域就会产生严重的色彩失真与边界接缝。

这一两难境地的根源在于割裂了水下辐射传输与三维场景几何之间的内在耦合关系。水下光学的衰减与后向散射在本质上是由深度决定的空间连续场,孤立的几何切分会割裂衰减连续性,而脱离空间局部性的全局物理模型在计算上又无法扩展。本文的切入角度是:必须将可扩展空间划分与物理辐射传输视为单一的约束学习问题同步求解。核心 idea:将大规模水下三维重建重构为深度感知的辐射高斯联合学习问题,提出多分区高斯架构以跨区域可见性与深度加权保证几何连续性,并结合可微物理渲染网络(DPR-Net)解耦全局水体光学参数与局部衰减-后向散射精细化,通过物理-统计混合约束实现高效可扩展的高保真水下重建。

方法详解

整体框架

SMP-UWGS 的整体管线输入为水下多视角图像序列、相机位姿以及 COLMAP 稀疏重建点云,输出为几何连续且去除水下介质畸变的全局高斯辐射场。系统首先沿 XZ 水平投影面对相机轨迹和点云进行层次化空间多分区,构建包含边界相机的重叠子区域;随后针对深水区域衰减导致的信噪比与梯度衰减,引入深度感知区域加权与梯度调制;在物理建模侧,嵌入可微物理渲染网络(DPR-Net),先由 WaterParamPredict 模块从高斯可微深度图回归全局水体光学参数作为强先验,再由双分支差分精细化模块(DBDR)解耦空间非均匀的衰减与后向散射;最后通过融合物理成像退化、物理感知暗通道先验(PA-DCP)以及边缘保留深度平滑的混合损失进行端到端联合训练。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入: 水下图像序列 / 相机位姿 / 稀疏点云"] --> B["层次化多分区与边界增强架构<br/>XZ平面层次切分 + 边界相机共享 + 三层高斯融合"]
    B --> C["深度感知区域加权与梯度调制<br/>视锥相交分析 + 深度对数缩放 + 区域自适应梯度调制"]
    C --> D["双阶段可微物理渲染网络 (DPR-Net)<br/>WaterParamPredict全局先验 + DBDR局部衰减散射精细化"]
    D --> E["物理-统计混合约束与通道自适应先验<br/>FiLM视角解耦 + PA-DCP重加权 + 边缘感知深度平滑"]
    E --> F["输出: 物理一致性全局高斯场与高保真去水渲染"]

关键设计

1. 层次化多分区与边界增强架构:保障大规模场景几何连续性与可扩展性

大规模水下场景中相机通常沿复杂轨迹大范围移动,若使用传统的规则三维体素网格切分,极易造成局部区域相机分布失衡以及边界区域高斯基元断裂。针对这一痛点,SMP-UWGS 采用投影至 XZ 水平面的层次化划分策略,先根据相机 X 坐标排序划分 \(m\) 个主要分区,并在各分区最外侧设立共享边界相机;随后在每个分区内部沿 Z 轴进一步细分 \(n\) 个子区域,形成包含平衡相机密度的 \(m \times n\) 个重叠子区域。为了彻底消除分区拼接缝隙,引入边界感知区域增强(BARE),对边缘分区采用 2.0 倍、内部区域采用 1.5 倍的自适应扩展包围盒,并建立由“全局高斯层(维持全局骨架)、区域高斯层(局部精细化缝合 \(G_{\text{enhanced}} = G_{\text{global}} \cup G_{\text{focus}}\))以及邻域高斯层(跨边界直接交互)”构成的三层融合机制。跨区域高斯缝合由相机视锥与分区三维包围盒的投影覆盖率 \(\rho \ge \tau\) 严格控制,从而在分布式并行优化的同时保证全局几何与视角的严格自洽。

2. 深度感知区域加权与梯度调制:补偿深水区域衰减导致的优化失衡

在水下成像中,光线穿透厚重水体时发生指数级衰减,深水区域接收到的反射光强极弱,导致反向传播时对应的图像重构梯度幅值大幅衰减,传统优化器往往严重偏向高信噪比的浅水或近景区域,造成远景与深水几何欠拟合。为解决介质衰减引起的优化失衡,SMP-UWGS 设计了结合视锥可见性与深度统计的区域加权机制。每个分区 \(i\) 的优化权重定义为:

\[w_i = (\bar{r}_i + \beta) \cdot \tau_{\text{init}} \log(d'_i) \cdot \gamma_{\text{geo}}\]

其中 \(\bar{r}_i\) 表示通过包围盒投影交集计算的平均可见性比例,\(\beta=0.01\) 避免奇异权重,\(d'_i\) 为相机坐标系下提取的中位数深度 \(\bar{d}_i = \text{median}\{z_c \mid \mathbf{p} \in \mathcal{P}_i\}\) 经尺度归一化后的值,\(\gamma_{\text{geo}}\) 针对稀疏边界与转角分区给予 1.5 至 2.0 的几何增益。总损失直接表示为加权和 \(\mathcal{L}_{\text{total}} = \sum_i w_i \mathcal{L}_i\)。该设计在无需修改底层优化器内部状态的前提下,通过标量权重自适应放大深水与远景区域的高斯梯度,实现全水深范围内的均衡收敛。

3. 双阶段可微物理渲染网络(DPR-Net):显式解耦水下全局光学参数与局部精细场

水下成像模型遵循改进版水下图像形成模型(UIFM):观测图像 \(I(x,y) = J(x,y) e^{-\beta_d(x,y) z(x,y)} + B_\infty(1 - e^{-\beta_b(x,y) z(x,y)})\),其中直接透射衰减系数 \(\beta_d\)、后向散射系数 \(\beta_b\) 与背景光 \(B_\infty\) 具有强烈的非线性指数特性,若直接端到端同时拟合高斯几何与介质参数,极易陷入几何退化与色彩崩塌的局部极小值。DPR-Net 将该过程解耦为双阶段:第一阶段由 WaterParamPredict 模块执行全局粗估计,将 3DGS 自身光栅化生成的可微深度图输入至带有 SE-ResNet 编码器和注意力门控解码器的 U-Net 结构中,映射出 9 维全局物理参数向量并通过激活函数约束:

\[\beta_d^c = \operatorname{softplus}(p_c), \quad \beta_b^c = \operatorname{softplus}(p_{c+3}), \quad B_\infty^c = \sigma(p_{c+6}), \quad c \in \{R,G,B\}\]

第二阶段在全局参数初始化的平稳点上激活双分支差分精细化模块(DBDR),利用共享卷积核预测空间变化的局部修正量 \([\beta_d(x,y), \beta_b(x,y)] = \operatorname{ReLU}(\text{Scale} \cdot \sigma(W z(x,y)))\)。这种由全局物理先验到局部空间异质性精细调整的两阶段策略,从根本上消除了指数衰减项在梯度传导中的数值不稳定性。

4. 物理-统计混合约束与通道自适应先验:消除水下色偏与多义性退化

针对水下严重蓝绿色偏和水体浑浊导致的视角依赖退化,SMP-UWGS 构造了物理成像与统计先验相结合的混合目标函数。首先利用特征线性调制(FiLM)结合视角嵌入向量将观测图像解耦为水下分量与场景真实反射率,并施加 \(L_1\) 与 SSIM 组合的物理保真损失 \(\mathcal{L}_{\text{phys}}\)。针对传统暗通道先验(DCP)将红光强衰减误判为浓厚水雾导致去水后严重发绿的缺陷,提出物理感知暗通道先验(PA-DCP):先计算去后向散射信号 \(\hat{J} = \hat{I} - B\),再利用衰减系数倒数构造通道自适应权重 \(w_c \propto (\beta_d^c + \epsilon)^{-1}\),定义暗通道图为:

\[D_{PA}(\mathbf{x}) = \min_{c \in \{R,G,B\}} \left( \min_{\mathbf{y} \in \Omega(\mathbf{x})} w_c \hat{J}^c(\mathbf{y}) \right)\]

颜色一致性损失采用非对称惩罚 \(\mathcal{L}_{\text{color}} = \lambda_{\text{dcp}} \|\operatorname{ReLU}(D_{PA})\|_1 + \lambda_{\text{neg}} \|\operatorname{ReLU}(-D_{PA})\|_{\text{smooth}}\)(\(\lambda_{\text{neg}}=1000\)),既压制残留后向散射又严防过度补偿。再配合由局部图像梯度导向的边缘感知深度平滑损失 \(\mathcal{L}_{\text{depth}}\)、背景透明度正则项 \(\mathcal{L}_{bg}\) 以及参数范数约束 \(\mathcal{L}_{\text{param}}\),在强散射复杂环境下锁定了物理参数与几何结构的唯一解。

损失函数 / 训练策略

整个框架采用多阶段分步训练策略以确保参数收敛。对于大规模分区场景,总训练迭代次数设为 12,000 次: 1. 0 ~ 3,000 次迭代:固定 3DGS 基础优化并激活 WaterParamPredict,仅由物理重构损失 \(\mathcal{L}_{\text{phys}}\) 驱动全局水体参数 \(\beta_d, \beta_b, B_\infty\) 的鲁棒拟合; 2. 3,000 ~ 8,000 次迭代:激活 DBDR 模块进行局部介质场微调,同时引入颜色损失 \(\mathcal{L}_{\text{color}}\)、深度平滑损失 \(\mathcal{L}_{\text{depth}}\) 与背景正则项 \(\mathcal{L}_{bg}\); 3. 8,000 ~ 12,000 次迭代:冻结介质参数网络,集中细化高斯位置、旋转、缩放与球谐不透明度,完成全局缝合与最终几何固化。

总优化目标为:

\[\mathcal{L}_{\text{total}} = \mathcal{L}_{\text{phys}} + \mathcal{L}_{\text{color}} + \mathcal{L}_{\text{depth}} + \mathcal{L}_{bg} + \mathcal{L}_{\text{param}}\]

在输入端,所有图像均经过 IEC 61966-2-1 逆传递函数反伽马矫正转换至线性辐射空间,确保物理传输定律与衰减指数公式严格在辐射度线性度上成立。

实验关键数据

主实验

在公开的 SeaThru-NeRF、BVI-Coral、UVEB 数据集以及作者自建的 OTNN 大型水下沉船遗址数据集上,将 SMP-UWGS 与神经渲染经典方法 SeaThru-NeRF、标准 3DGS 以及最新水下高斯方法 UW-GS、SeaSplat 进行新视点合成量化对比。

数据集 场景 指标 SeaThru-NeRF 3DGS UW-GS SeaSplat SMP-UWGS (本文)
SeaThru-NeRF IUI3 Red Sea PSNR ↑ / SSIM ↑ / LPIPS ↓ 25.908 / 0.785 / 0.304 22.980 / 0.843 / 0.246 27.652 / 0.863 / 0.185 26.670 / 0.870 / 0.210 27.829 / 0.907 / 0.180
SeaThru-NeRF Curaçao PSNR ↑ / SSIM ↑ / LPIPS ↓ 30.193 / 0.873 / 0.210 28.313 / 0.873 / 0.221 30.171 / 0.851 / 0.172 30.300 / 0.900 / 0.190 31.551 / 0.937 / 0.154
SeaThru-NeRF J.G. Red Sea PSNR ↑ / SSIM ↑ / LPIPS ↓ 21.841 / 0.767 / 0.249 21.493 / 0.854 / 0.216 22.947 / 0.830 / 0.190 22.700 / 0.870 / 0.180 23.289 / 0.895 / 0.174
SeaThru-NeRF Panama PSNR ↑ / SSIM ↑ / LPIPS ↓ 27.846 / 0.834 / 0.224 29.200 / 0.893 / 0.152 30.190 / 0.911 / 0.160 28.760 / 0.900 / 0.150 31.642 / 0.925 / 0.137
BVI-Coral Lagoon PSNR ↑ / SSIM ↑ / LPIPS ↓ 23.542 / 0.759 / 0.286 22.351 / 0.739 / 0.285 23.210 / 0.754 / 0.188 26.250 / 0.779 / 0.289 25.953 / 0.816 / 0.221
BVI-Coral Seabed PSNR ↑ / SSIM ↑ / LPIPS ↓ 22.705 / 0.641 / 0.346 21.919 / 0.743 / 0.283 24.809 / 0.800 / 0.263 25.346 / 0.774 / 0.252 24.461 / 0.769 / 0.299
BVI-Coral Reef PSNR ↑ / SSIM ↑ / LPIPS ↓ 18.551 / 0.408 / 0.552 20.381 / 0.714 / 0.286 22.008 / 0.712 / 0.284 24.316 / 0.754 / 0.258 23.022 / 0.754 / 0.291
BVI-Coral Marine PSNR ↑ / SSIM ↑ / LPIPS ↓ 18.103 / 0.571 / 0.458 16.120 / 0.670 / 0.365 19.406 / 0.703 / 0.308 19.986 / 0.710 / 0.336 20.159 / 0.718 / 0.313
OTNN MingWreck2 PSNR ↑ / SSIM ↑ / LPIPS ↓ 22.186 / 0.791 / 0.254 20.089 / 0.756 / 0.287 23.719 / 0.797 / 0.229 23.828 / 0.732 / 0.267 23.706 / 0.801 / 0.237
OTNN BlueThistle PSNR ↑ / SSIM ↑ / LPIPS ↓ 23.934 / 0.796 / 0.265 21.964 / 0.772 / 0.299 24.008 / 0.802 / 0.352 22.012 / 0.785 / 0.263 24.530 / 0.813 / 0.293
UVEB BioConservation PSNR ↑ / SSIM ↑ / LPIPS ↓ 19.137 / 0.707 / 0.270 18.549 / 0.742 / 0.321 21.980 / 0.721 / 0.272 23.245 / 0.767 / 0.232 22.487 / 0.772 / 0.263
UVEB GeoExploration PSNR ↑ / SSIM ↑ / LPIPS ↓ 17.421 / 0.675 / 0.260 15.418 / 0.639 / 0.288 24.442 / 0.775 / 0.372 27.303 / 0.765 / 0.311 26.707 / 0.788 / 0.303

在计算开销与硬件效率对比中(MingWreck1 场景,RTX 3090 GPU): - 训练时间: SMP-UWGS 仅需 13 分钟,相比 3DGS(42 分钟)提速 3.2 倍,相比 SeaSplat(81 分钟)提速 6.2 倍,相比 SeaThru-NeRF(10 小时)提速 46 倍; - 显存占用: SMP-UWGS 仅占用 10.9 GB,大幅低于 SeaSplat(16.0 GB)和 SeaThru-NeRF(14.6 GB); - 推理渲染帧率: 达到创纪录的 434 FPS,具备出色的工业级实时检视性能。

消融实验

在 BVI-Coral 的 Lagoon 场景上对各核心组件进行消融分析,验证物理渲染(DPR-Net、WaterParamPredict、DBDR)与空间划分策略(SMP、DARWS、BARE)的不可替代性。

配置 (Model Setting) PSNR ↑ SSIM ↑ LPIPS ↓ 训练时间 (Time) 说明
基线模型 (3DGS) 22.351 0.739 0.285 43 min 纯空气介质假设,严重色偏与几何发散
完整模型 w/o SMP 架构 26.275 0.793 0.271 1 h 13 min 移除分区并行,全场景联合训练耗时骤增 5.2 倍
完整模型 w/o DPR-Net 23.002 0.726 0.297 10 min 缺失物理渲染模型,PSNR 骤降 2.95 dB,视觉感知显著退化
完整模型 w/o WaterParamPredict 24.803 0.770 0.240 17 min 缺乏全局初值导致优化收敛迟缓且易陷入局部极值
完整模型 w/o DBDR 模块 24.970 0.783 0.235 12 min 忽略空间异质性衰减与散射微调,细节重构精度下降
完整模型 w/o DARWS 策略 25.230 0.796 0.230 14 min 移除深度感知区域加权,深水远景梯度不足
完整模型 w/o BARE 增强 23.019 0.729 0.301 14 min 移除边界感知区域增强,分区交界面出现断层与伪影
完整模型 (Full Model) 25.953 0.816 0.221 14 min 在高保真重构与极致优化效率间实现最优权衡

关键发现

  • 物理先验初始化的决定性作用:WaterParamPredict 模块不仅带来了约 1.15 dB 的 PSNR 增益,更关键的是避免了指数衰减项在梯度优化初期的震荡,使得 12k 步以内的超快稳定收敛成为可能;若完全舍弃 DPR-Net,PSNR 出现近 3 dB 的断崖式下跌。
  • 边界感知与深度加权对几何一致性的保护:消融 BARE 导致 SSIM 跌至 0.729、LPIPS 恶化至 0.301,证明若无三层高斯增强与自适应扩展边界,单纯空间分块会割裂跨区域一致性;DARWS 则成功平衡了浅水区与深水区的梯度贡献。
  • 算力效率的飞跃:得益于 XZ 投影多分区与高效并行,SMP-UWGS 将大规模水下场景的训练时长压入 15 分钟以内,彻底改写了以往水下物理神经渲染动辄数小时的计算瓶颈。

亮点与洞察

  • 物理与几何的深度耦合求解:敏锐捕捉到水下介质衰减本质上是“深度条件场”这一核心物理事实,将空间分块、视锥可见性与指数衰减传输统一于单一优化目标,避免了后处理式拼接的伪影。
  • 物理感知暗通道先验(PA-DCP)的权重逆转机制:巧妙利用衰减系数的倒数 \(w_c \propto (\beta_d^c + \epsilon)^{-1}\) 对 RGB 通道重新赋权,彻底扭转了传统暗通道先验因红光在水中强吸收而产生的病态色偏,为水下视觉去雾/去水提供了优雅的先验形式。
  • 可扩展性设计与深度梯度调制的工程范式:通过自适应区域标量加权直接调节反向传播梯度幅值,无缝嵌入常规优化器而无需修改优化器内核状态,为大规模室外或非均匀介质的三维高斯分块训练提供了极佳的迁移模板。

局限与展望

  • 环境光均匀性假设的约束:模型假设环境背景光在空间上各向同性且均匀分布,这一假设在自然漫反射采光下成立,但难以应对搭载强点光源前照灯或随水下航行器(ROV/AUV)移动的主动同轴光源场景;
  • 静态场景假设与动态悬浮物干扰:沿袭 3DGS 的静态刚体假设,当水下存在游动鱼群、漂浮海草或密集运动海洋雪颗粒(Marine Snow)时,由于缺乏动态运动解耦机制,可能产生半透明鬼影伪影;
  • 未来改进方向:可进一步探索结合非均匀动态光场建模的主动光源补偿机制,以及引入时空 4D 高斯或时序动态掩膜过滤游动生物与悬浮颗粒。

相关工作与启发

  • vs SeaThru-NeRF: SeaThru-NeRF 开创性地将 UIFM 物理模型引入 NeRF,色彩还原精准但受制于体素采样的极慢渲染和高显存瓶颈(单场景训练需 10 小时);本文借助 3DGS 显式表征与多分区并行,将训练加速 46 倍,渲染帧率提升至 434 FPS。
  • vs UW-GS & SeaSplat: UW-GS 和 SeaSplat 探索了水下高斯建模,但在大场景下缺乏深水梯度补偿与自适应空间切分机制,易在边缘和深景产生优化停滞或显存爆炸(16 GB);SMP-UWGS 显存降低至 10.9 GB,且在复杂地形(BVI-Coral)与沉船大场景(OTNN)中大范围刷新了 SSIM 与感知指标。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次提出将水下物理辐射传输与大规模高斯多分区架构深度耦合,提出了 PA-DCP 与深度感知梯度调制。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 4 大主流与自建基准,包含详尽的定量对比、收敛曲线、训练预算公平性验证与消融实验。
  • 写作质量: ⭐⭐⭐⭐⭐ 动机阐述深刻,物理模型公式完备严谨,系统架构清晰连贯。
  • 价值: ⭐⭐⭐⭐⭐ 突破了大规模复杂水下场景高保真 3D 重建的计算效率瓶颈,对水下机器人与海洋测绘具有重大应用价值。