Wat3R: Underwater 3D Geometry Learning without Underwater Annotations¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/LSXI7/Wat3R
领域: 3D 视觉
关键词: 水下3D重建 / 跨域半监督学习 / 基础几何模型 / 跨视角一致性 / 前景静态掩膜
一句话总结¶
Wat3R 是首个面向水下复杂环境的前馈式 3D 几何估计半监督框架,通过物理渲染合成水下数据与大规模无标注真实水下视频的协同训练,结合前景静态掩膜引导的跨视角几何一致性损失,在完全不依赖真实水下 3D 标注的前提下实现了高精度的前馈多视角深度、位姿与点云重建。
研究背景与动机¶
水下三维视觉几何估计旨在从多视角水下图像中单次前向恢复相机的精确位姿、稠密深度图和场景三维点云,对水下机器人自主导航、避障路径规划、海洋环境测绘以及水下文化遗产保护具有极高的实用价值。然而,与陆地环境相比,水体介质对光线存在严重的选择性吸收与强烈的悬浮粒子散射,造成红光波段快速衰减、整体对比度严重骤降、前向与后向散射雾化,以及强烈的视点相关退化。这种恶劣的成像机理导致在真实深水与复杂海洋水体中采集大规模、高精度的三维几何真值(如密集点云与连续位姿)极为困难且成本高昂,构成了水下几何感知领域长期难以逾越的数据瓶颈。
近年来以 DUSt3R、VGGT 等为代表的前馈式基础几何模型,彻底改变了传统多阶段 Structure-from-Motion (SfM) 依赖繁琐特征匹配与全局非线性优化的低效范式,展现出极强的通用先验能力。然而,这些模型的高性能建立在数十万计标注完备的陆地场景监督之上;一旦将其直接置于低能见度、蓝绿偏色和浑浊散射的水下环境,严重的跨域分布偏移会使其几何预测产生严重畸变与空洞。针对水下场景的特定三维方案(如 NeRF 与 3D 高斯泼溅)通常依赖逐场景的慢速优化且高度依赖已知相机位姿;而“水下图像增强 + 陆地三维模型”的两阶段级联方案往往在去雾过程中丢失几何高频细节或破坏多视角光度一致性。
解决该困境的关键矛盾在于:如何在零水下密集三维几何标注的极端限制下,将陆地基础几何模型的强大结构先验平滑、稳健地泛化至复杂恶劣的真实水下域。本文的切入视角是跳出对人工三维标注的依赖,利用水体成像物理模型合成带先验的模拟数据,并深度挖掘海量无标注真实水下视频,利用时序多视角之间的几何内在冗余构建互补监督。核心 idea:构建基于 Mean Teacher 的跨域半监督前馈几何学习架构,通过陆地真实标注驱动的物理水下退化模拟建立初始先验,依托无标注真实水下视频与强弱扰动进行域迁移,并提出由前景静态掩膜过滤的跨视角几何一致性损失,借助多视角几何互补补偿单视角因水体吸收与散射导致的信息缺失。
方法详解¶
整体框架¶
Wat3R 采用基于前馈多任务视觉几何模型(以 VGGT 为基础网络)的端到端架构。给定包含 \(N\) 帧水下 RGB 图像的输入序列 \((I_i)_{i=1}^N\),网络通过单次前向推理同时预测每一视角相对于参考基准坐标系的几何属性 \(y_i = (g_i, D_i, P_i)\),其中 \(g_i \in \mathbb{R}^9\) 编码相机旋转四元数、平移向量与视场角 (FoV),\(D_i \in \mathbb{R}^{H \times W}\) 为稠密深度图,\(P_i \in \mathbb{R}^{3 \times H \times W}\) 为当前视角在第一相机坐标系下的三维点云图。
为在零水下标注条件下完成模型跨域自适应,系统构建了 Mean Teacher 半监督学习流水线:Teacher 网络采用 Student 网络参数的指数移动平均 (EMA) 演进,在弱数据增强下为无标注水下视频生成高质量伪标签;Student 网络在强数据扰动下同时接受物理合成水下数据的有监督损失、真实无标注视频的单视角伪标签监督,以及基于跨视角几何投影视差的自监督一致性约束。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入水下多视角序列 (I_i)"] --> B["物理驱动水下合成与真实视频挖掘<br/>有标注陆地合成 + 真实无标注视频"]
B --> C["Mean Teacher伪标签几何自监督<br/>弱增强Teacher提供稳定伪标签,强增强Student梯度回传"]
C --> D["静态掩膜引导的跨视角一致性损失<br/>重投影视差比对,抑制水体背景与动态漂浮干扰"]
D --> E["前馈输出几何属性<br/>相机位姿 g_i / 稠密深度 D_i / 3D点云 P_i"]
关键设计¶
1. 物理驱动水下合成与真实视频挖掘:在零水下标注下构建几何先验与域泛化池 为了解决水下场景彻底缺乏真值几何监督的冷启动问题,Wat3R 并不凭空合成不可靠的三维形貌,而是基于修正的水体物理成像方程,在包含陆地三维标注的原始多视角数据集上模拟水下外观衰减。水下图像生成遵循退化模型: $\(I = J e^{-\beta^D z} + B^\infty (1 - e^{-\beta^B z})\)$ 式中 \(J\) 为清晰陆地图像,\(I\) 为退化结果,\(z\) 为场景深度。为防止原有陆地多视角数据集粗糙或稀疏的深度标注在渲染时产生破面伪影,该方法使用单目大模型 DA3MONO-LARGE 估计出的平滑稠密深度作为渲染引导,同时严格保留原数据的准确相机与三维几何真值作为监督目标。物理衰减系数 \(\beta^D\) 和后向散射系数 \(\beta^B\) 在采样时严格施加红光衰减显著快于绿蓝光的物理约束,并叠加高斯平滑噪声图模拟水体在空间中的非均匀浑浊。
与此同时,为了使模型适应真实海洋的光学多样性与悬浮物分布,研究团队收集整理了超 10,000 段水下原始视频,经人工多轮清洗剔除包含剪辑跳切、剧烈运动模糊、大面积开放水域或移动生物占据的不可靠片段,最终沉淀出 5,504 段连续稳定拍摄的真实水下视频片段(共 35.9 万帧高质量未标注图像),为无监督跨域迁移提供了丰富而真实的表征空间。
2. Mean Teacher伪标签几何自监督:以非对称扰动稳定跨域几何先验传递 面对无标注真实水下视频的自适应学习,纯自监督对比或自重构极易因水体散射雾霾导致几何坍缩。Wat3R 引入 Mean Teacher 架构,Student 模型权重 \(\theta_s\) 接受梯度回传,而 Teacher 模型权重 \(\theta_t\) 则通过指数移动平均平滑更新: $\(\theta_t^k = (1 - \lambda)\theta_t^{k-1} + \lambda \theta_s^k\)$ 针对视频序列中视角重叠大但轨迹多样性有限的问题,算法设计了序列级非对称数据增强机制:Teacher 分支输入随机抽取并打乱顺序的 24 到 36 帧序列,仅保留弱扰动以维持稳固的几何推理能力;Student 分支则从相同片段中抽取 2 到 12 帧,再次打乱顺序,并施加 90°/180°/270° 随机旋转、剧烈色彩抖动、灰度转换以及高斯模糊等强扰动。
在单视角伪标签损失 \(\mathcal{L}_{\text{per-view}}\) 中,Teacher 生成的高质量位姿、深度图及由位姿深度联合反投影得到的点图作为伪真值,通过 Huber 损失和多尺度梯度约束强制约束 Student 克服剧烈外观变异并保持鲁棒预测。
3. 静态掩膜引导的跨视角一致性损失:利用多视角重投影几何互补抵御水体退化 在真实水下拍摄中,强吸收与散射往往使某些视角因远距离或特定背光方向而发生严重的信息退化,但临近或侧向视角仍保留清晰的局部几何轮廓。为了让网络学会跨视角“借光补缺”,Wat3R 设计了跨视角几何一致性损失。然而,简单进行全图重投影会引入两类灾难性噪声:一是无限远的无纹理水体背景区域,二是游动的鱼类、潜水员等动态目标。
针对这一瓶颈,算法首先对 Teacher 预测的深度图执行两类聚类 K-means,自动剥离远景开放水体,提取有效近景前景区域 \(M^{\text{fg}}_i(x)\)。随后,将视角 \(i\) 的有效像素反投影到 3D 空间再重投影至其余视角 \(j\),通过深度一致性阈值 \(\delta\) 检验其多视角互可见性指标: $\(V_{i \to j}(x) = \mathbf{1}\left(|D_j^t(u_{i \to j}(x)) - D_{i \to j}^t(x)| < \delta \land u_{i \to j}(x) \in \Omega_j\right)\)$ 仅当像素在至少 \(k = N - 2\) 个伴随视角中均保持严格几何一致时,才保留在静态有效掩膜中: $\(M_i^{\text{static}}(x) = \mathbf{1}\left(\sum_{j \neq i} V_{i \to j}(x) \ge k\right) M_i^{\text{fg}}(x)\)$ 在 Student 训练时,任意抽取的帧对 \((i, j)\) 之间,利用 Teacher 视角 \(i\) 的投影深度对 Student 在视角 \(j\) 的预测深度施加加权 \(L_1\) 一致性惩罚: $\(\mathcal{L}_{\text{cross-view}} = \frac{1}{|S|(|S|-1)} \sum_{i \in S} \sum_{j \in S, j \neq i} L_1\left(D_j^s, D_{i \to j}^t, M_j^{\text{static}}\right)\)$ 这一设计使网络学会在水体浑浊区域聚合多视角的确定性线索,同时主动规避动态干扰。
损失函数 / 训练策略¶
模型整体训练目标由三部分线性加权构成: $\(\mathcal{L}_{\text{total}} = \mathcal{L}_{\text{supervised}} + \lambda_u \left(\mathcal{L}_{\text{per-view}} + \mathcal{L}_{\text{cross-view}}\right)\)$ 在优化策略上,Wat3R 采用四卡 NVIDIA RTX 4090 分布式并行训练共 19,200 个迭代步。前 6,400 步专用于物理合成水下数据的有监督预热训练,使模型快速建立对水下色偏的初步适应;随后无监督权重 \(\lambda_u\) 随训练进程逐步提升,至第 12,800 步达到峰值 0.5。未标注与标注数据的样本比例控制为 1:3,ViT 主干与几何解码头的最大学习率分别设置为 \(5 \times 10^{-6}\) 和 \(5 \times 10^{-5}\),采用 bfloat16 混合精度与梯度检查点技术以在单卡上适配大序列几何注意力开销。
实验关键数据¶
主实验¶
论文在公开基准 Sea-thru、FLSea-Stereo 以及全新构建的真实场景基准 Water3D(涵盖 42 个多水质复杂水下场景,包含高精度位姿与深度真值)上进行了系统评测。
在多视角深度估计任务中,评估采用 10 视角乱序协议与 100 帧长序列评测,评估指标包括绝对相对误差 (Rel)、对数误差 (log10)、均方根误差 (RMSE) 以及阈值精确度 (\(\delta_1 < 1.25\)):
| 方法 | Sea-thru: Rel ↓ | Sea-thru: \(\delta_1\) ↑ | Sea-thru: RMSE ↓ | FLSea-Stereo: Rel ↓ | FLSea-Stereo: \(\delta_1\) ↑ | FLSea-Stereo: RMSE ↓ |
|---|---|---|---|---|---|---|
| WaterSplatting (3DV'25) | — | — | — | 0.427 | 0.415 | 1.476 |
| Fast3r (CVPR'25) | 0.277 | 0.713 | 0.631 | 0.290 | 0.529 | 1.355 |
| MapAnything (3DV'26) | 0.216 | 0.800 | 0.454 | 0.146 | 0.841 | 0.798 |
| \(\pi3\) (ICLR'26) | 0.185 | 0.909 | 0.358 | 0.139 | 0.856 | 0.837 |
| DA3 (ICLR'26) | 0.187 | 0.892 | 0.333 | 0.141 | 0.851 | 0.872 |
| VGGT (基线, CVPR'25) | 0.190 | 0.891 | 0.380 | 0.137 | 0.849 | 0.760 |
| VGGT + Semi-UIR (图像增强) | 0.201 | 0.846 | 0.387 | 0.136 | 0.861 | 0.784 |
| VGGT + PSPL (图像增强) | 0.209 | 0.836 | 0.419 | 0.160 | 0.817 | 0.911 |
| Wat3R (本文方法) | 0.167 | 0.946 | 0.290 | 0.119 | 0.885 | 0.720 |
| 相对基线 VGGT 提升幅度 | +12.1% | +6.2% | +23.7% | +13.1% | +4.2% | +5.3% |
在自主构建的综合性评测基准 Water3D 上的多视角点云重建对比(Sim(3) 对齐后计算 Accuracy、Completeness 及 Overall,均越低越好):
| 方法 | Accuracy Mean ↓ | Accuracy Median ↓ | Completeness Mean ↓ | Completeness Median ↓ | Overall Mean ↓ | Overall Median ↓ |
|---|---|---|---|---|---|---|
| Fast3r (CVPR'25) | 1.216 | 0.531 | 2.444 | 0.784 | 1.830 | 0.658 |
| MapAnything (3DV'26) | 0.643 | 0.284 | 0.666 | 0.277 | 0.655 | 0.281 |
| \(\pi3\) (ICLR'26) | 0.491 | 0.168 | 0.413 | 0.184 | 0.452 | 0.176 |
| DA3 (ICLR'26) | 0.679 | 0.187 | 0.528 | 0.160 | 0.604 | 0.174 |
| VGGT (CVPR'25) | 0.486 | 0.193 | 0.762 | 0.191 | 0.624 | 0.192 |
| Wat3R (点云头直接预测) | 0.444 | 0.148 | 0.409 | 0.165 | 0.427 | 0.157 |
| Wat3R (深度+位姿联合反投) | 0.446 | 0.162 | 0.366 | 0.143 | 0.406 | 0.153 |
消融实验¶
论文在多视角深度估计任务(Sea-thru 与 FLSea-Stereo)上展开了细致的递进式消融研究,逐项验证物理合成数据、真实无标注视频、序列级强数据增强、跨视角一致性损失 \(\mathcal{L}_{\text{cross-view}}\) 以及静态前景掩膜 \(M^{\text{static}}\) 的作用:
| 配置 | 合成数据 | 真实视频 | 强数据增强 | \(\mathcal{L}_{\text{cross-view}}\) | \(M^{\text{static}}\) | Sea-thru: Rel ↓ | Sea-thru: \(\delta_1\) ↑ | FLSea-Stereo: Rel ↓ | FLSea-Stereo: \(\delta_1\) ↑ |
|---|---|---|---|---|---|---|---|---|---|
| (1) 基线模型 (VGGT) | — | — | — | — | — | 0.190 | 0.891 | 0.137 | 0.849 |
| (2) 仅合成水下数据有监督 | ✓ | — | — | — | — | 0.173 | 0.920 | 0.135 | 0.860 |
| (3) 引入真实视频(常规增强) | ✓ | ✓ | — | — | — | 0.181 | 0.906 | 0.165 | 0.793 |
| (4) 引入强序列级增强 | ✓ | ✓ | ✓ | — | — | 0.172 | 0.936 | 0.126 | 0.871 |
| (5) 引入全图跨视角一致性 | ✓ | ✓ | ✓ | ✓ | — | 0.167 | 0.949 | 0.126 | 0.869 |
| (6) 仅依赖无掩膜一致性 | ✓ | — | ✓ | ✓ | ✓ | 0.174 | 0.929 | 0.130 | 0.871 |
| (7) Wat3R 完整模型 | ✓ | ✓ | ✓ | ✓ | ✓ | 0.167 | 0.946 | 0.119 | 0.885 |
关键发现¶
- 纯图像增强的负面效应:两阶段级联方案(前置 Semi-UIR 或 PSPL 增强后输入 VGGT)在 Sea-thru 上 Rel 误差从 0.190 恶化至 0.201 和 0.209。实验证明单纯追求色彩恢复的图像增强会破坏多视角光度与几何连续性,引入高频虚假特征,反而劣化了几何估计;将水下退化直接纳入端到端几何学习才是正解。
- 真实未标注视频与强增强的协同临界点:对比消融表中的第 (2) 与 (3) 行,如果不施加强序列级扰动,直接加入真实视频会导致 FLSea-Stereo 上的 Rel 误差从 0.135 剧烈恶化至 0.165,发生模型过拟合与表征坍缩;引入视角随机抽样、多角度旋转与扰动后(第 (4) 行),误差显著降至 0.126,证明非对称时序扰动是半监督几何泛化的关键支柱。
- 静态掩膜对复杂水体的关键净化作用:对比消融表 (5) 与 (7),在场景较为静态干净的 Sea-thru 上加入掩膜变化有限(Rel 均为 0.167),但在水流复杂、泥沙悬浮明显的 FLSea-Stereo 上,静态掩膜使 Rel 进一步由 0.126 下降至 0.119,证明过滤水体散射与动态干扰在深水实测中至关重要。
- 跨头预测的物理自洽性:Wat3R 直接由点云头回归的 3D 点云与由深度和相机姿态反投影生成的点云性能高度接近(Overall 误差分别为 0.406 与 0.427),显著优于基线 VGGT 的点云完整度(Completeness 提升达 52.0%),表明多任务损失与跨视角自监督使多分支头在无真实水下标下自发保持了严格的几何物理共识。
亮点与洞察¶
- 零真实水下标下的跨域闭环:提出“物理合成初筛 + 海量无标注视频深度泛化”的跨域自监督设计,巧妙化解了极端水下环境下三维真值稀缺与前馈基础模型数据饥渴之间的核心矛盾。
- 鲁棒的抗退化几何重投影机制:基于水下成像退化的非均匀性,利用静态掩膜引导的重投影损失,创造性地将“视点互补”转化为模型自监督信号,让模型自发学会在重度雾化视角借助清晰视角的几何线索进行补全。
- 极具行业价值的 Water3D 严苛基准:打破了过去水下三维评测场景少(通常仅 4-5 个)、位姿或深度标注不齐的困境,通过集成 MINIMA 高鲁棒特征匹配与人工严格几何质检,为水下具身三维感知建立了高标准评估体系。
局限与展望¶
- 极端开阔水域与超浑浊工况的信号稀疏:作者指出,当场景处于近乎纯蓝的开阔大洋或极度泥泞的浑水时,图像中几乎不存在可靠的纹理特征与几何匹配点。此时保守的静态掩膜 \(M^{\text{static}}\) 会滤除几乎所有像素,导致跨视角自监督信号急剧退化。
- 高动态生物与移动物体的建模盲区:目前框架将所有动态前景一律视作干扰进行过滤,尚未引入显式的前景运动轨迹分离或动态场解耦机制,在海洋鱼群或潜水作业动态交互场景下的几何还原依然受限。
- 未来方向:探索引入水体介质传输方程的光度可微分渲染损失,将静态水体散射系数与三维几何进行隐式联合解耦优化;同时向水下 SLAM 与机器人轨迹级实时闭环系统进一步拓展。
相关工作与启发¶
- vs VGGT / DUSt3R: 后者开创了无需标定的前馈单步三维重建,但严重依赖陆地密集点云和精准位姿数据,直接迁移到水下时因吸收与散射严重失效。Wat3R 在其网络骨架上扩展了 Mean Teacher 半监督机制与物理水下合成管线,实现了零真实水下标下的无缝域迁移。
- vs SeaThru-NeRF / WaterSplatting: 后者基于体积渲染与高斯泼溅显式建模水下光传输方程,重建精度高,但属于逐场景慢速优化方法,强依赖已知相机位姿且难以实时泛化。Wat3R 则是纯粹的前馈神经网络,无需已知位姿且单次推理仅需毫秒级,推理泛化能力显著更强。
- vs 级联式水下图像增强 (UIE): 传统管线先进行深度学习色彩恢复与去雾再送入 3D 模型,实验证明这种分离式设计会引入严重的高频假象并破坏多视角一致性。Wat3R 证明了将退化感知内化于几何表征学习是解决恶劣介质三维感知的根本范式。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ [首次将前馈基础几何大模型拓展至零标注真实水下领域,跨视角互补损失与静态掩膜设计针对性强]
- 实验充分度: ⭐⭐⭐⭐⭐ [覆盖单目/多视角深度、位姿 AUC、点云重建等全栈几何任务,自建包含 42 个多质水体场景的真实基准]
- 写作质量: ⭐⭐⭐⭐⭐ [框架逻辑严密,物理公式推导与实验消融设计自洽,对比基线全面透彻]
- 价值: ⭐⭐⭐⭐☆ [为水下机器人三维建图与恶劣介质环境下的神经几何感知提供了极具实用价值的范式参考]