WaterGen: Decoupling Scene and Medium in Underwater Image Generation¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/jiayi-wu-umd/WaterGen
领域: 图像生成 / 水下视觉
关键词: 水下图像生成, 潜扩散模型, 场景介质解耦, 水下成像模型, 条件解码
一句话总结¶
WaterGen 提出将水下图像生成解耦为无退化的语义场景生成与基于水下光学物理的条件解码两个阶段,实现了场景几何与水体退化参数(如透射率与后向散射)的独立精确控制,并能作为高质量合成数据引擎显著增强下游水下恢复与分割任务。
研究背景与动机¶
海洋生物学探索、水下考古发掘与离岸工业检测高度依赖水下计算机视觉技术(如目标检测、图像恢复与语义分割),但这些任务的实际落地长期受到高质量、多样化标注数据匮乏的严重制约。水下成像环境极其恶劣,光线在散射介质传播中遭受波长选择性吸收衰减、前向散射与背景散射干扰,导致图像严重偏色、对比度衰减且能见度低;而在真实水下场景中部署潜水员或自主水下航行器(AUV/ROV)采集大规模数据并获取准确的深度真值与逐像素语义标注,成本极高且在技术上极其困难。
现有的水下数据扩充与合成方案难以同时兼顾语义多样性与物理真实性。基于物理水下成像模型(UIFM)的传统渲染方法通常依赖陆地清晰图像配合合成深度图,不仅存在显著的陆地-水下语义域鸿沟,且无法生成原生水下结构;基于 GAN 等数据驱动的图像风格迁移算法受限于源域图像的拓扑结构,仅能在既有图像上迁移表面色彩与雾度,缺乏场景多样性,且难以准确模拟与深度紧密相关的非均匀退化规律;而近期直接微调的大规模文本引导潜扩散模型(如 SDXL),由于缺乏显式的光学成像物理约束,模型会将水体散射效应与场景几何语义混杂在同一个潜空间中,生成结果不仅容易出现过度饱和或卡通化的伪影,而且无法根据物理参数独立调节水质类型,一旦修改提示词中的水体描述甚至会导致画面主体几何结构发生突变。
造成上述困境的核心矛盾在于:水下场景内容生成属于高层语义生成任务,依赖全局上下文推演与丰富的语义多样性;而水体介质退化本质上属于局部、辐射度量级的逐像素物理过程,取决于具体的介质吸收衰减与深度分布。将物理退化强行塞入扩散骨干网络,既破坏了预训练模型的无退化先验,又难以实现像素级的精确控制。核心 idea:将水下图像生成解耦为潜扩散骨干网络生成纯净无水场景表示,以及在解码阶段注入物理水下介质参数进行多尺度条件解码,从而实现“单一场景、多重水质”的独立高保真控制。
方法详解¶
整体框架¶
WaterGen 将水下图像合成解耦为两个串联阶段:第一阶段为无退化水下场景潜扩散(Semantic Scene Latent Diffusion),第二阶段为多尺度介质条件解码(Multi-scale Medium-conditioned Decoding)。在第一阶段,预训练的 SDXL 骨干网络通过轻量级 LoRA 适配层在无水体退化的纯净水下图像上微调,专门负责根据文本提示词推断水下场景的几何布局与高层语义潜变量 \(z_{clean}\);在第二阶段,利用水体物理参数 \(\Phi = \{B^\infty, \beta^D, \beta^B\}\)(背景光强、直接衰减系数和后向散射系数)结合单目深度估计,在解码网络中构造逐像素的透射率图与后向散射图,并通过零卷积(Zero-Conv)以空间条件形式注入图像解码器,完成向真实水体退化图像的物理映射。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["文本提示词 + 水体参数"] --> B["阶段1:纯净场景潜扩散<br/>LoRA 建模水下几何语义"]
B --> C["纯净场景潜变量"]
C --> D["阶段2:多尺度介质条件解码<br/>物理参数调制与零卷积注入"]
D --> E["双路物理输出<br/>纯净真值图像 / 退化水下图像"]
E --> F["下游水下视觉任务<br/>图像恢复 / 鲁棒语义分割"]
关键设计¶
1. 纯净场景潜扩散:隔离水体干扰的无水语义建模
以往直接在真实水下图像上微调扩散模型会导致潜空间的退化,破坏模型生成高频细节和遵循提示词的能力。为了在扩散骨干网络中建立强烈的“无退化水下语义”归纳偏置,作者使用前沿水下恢复模型 SLURPP 对来自 UIIS10K、USIS10K、SUIM、USOD10K、UIEB 和 UF7D 等 6 个真实基准数据集的图像进行离线去退化处理,并利用 BLIP-2 生成精准的文本标注,构建出高质量的纯净数据集 WaterGen-Clean。在训练阶段,完全冻结 SDXL 的 VAE 与原始 U-Net 权重,仅对注意力模块中插入的 LoRA 层(rank=32, \(\alpha=16\))计算相对于无退化潜变量的扩散去噪损失。这种隔离训练使得扩散骨干网络仅学习水下物体、珊瑚、礁石与潜水员等原生水下几何与语义分布,将潜在的介质伪影隐式当作噪声滤除,彻底避免了因水体浑浊导致的潜空间流形畸变。
2. 多尺度介质条件解码:基于改进水下成像模型的逐像素物理注入
水体对场景光辐射的调制本质上是逐像素且由深度决定的连续物理变换。基于改进的水下成像模型(Revised Underwater Image Formation Model):
其中 \(c \in \{R, G, B\}\) 为色彩通道,\(d\) 为场景物体距离(深度),\(J\) 为无水体场景辐射率,\(B^\infty\) 为无穷远处背景水体颜色,\(\beta^D\) 与 \(\beta^B\) 分别代表直接衰减系数与后向散射系数。WaterGen 在解码阶段显式建模此过程:利用深度估计模块(Depth Pro)预测纯净潜表示对应的深度图 \(d\),结合输入的介质参数 \(\Phi = \{B^\infty, \beta^D, \beta^B\}\) 解析计算出逐像素直接透射图 \(T_c = e^{-\beta^D_c d}\) 与后向散射图 \(B_c = B_c^\infty \cdot (1 - e^{-\beta^B_c d})\)。这两个物理图谱随后输入介质编码器,并通过多层零卷积(Zero-Conv)作为空间引导直接注入图像解码器的各级特征层中。由于物理调制被限制在解码重构阶段,系统原生支持“单一场景、多重水质”渲染——只需冻结第一阶段生成的纯净潜变量 \(z_{clean}\),调整介质参数 \(\Phi\),即可连续渲染出深蓝、蓝绿、浅绿以至高浊度等多样水体类型,且物体形态与相对位置严格保真。
3. 双向物理一致性约束与随机介质噪声注入:保障解码鲁棒性与物理保真
在训练介质条件解码器时,若仅使用合成退化数据做单向重构,解码网络容易退化为简单的加权叠加器,且难以应对第一阶段潜扩散可能残留的微弱介质伪影。为此,作者利用大规模陆地图像作为纯净真值 \(J\),通过 UIFM 物理采样生成精确配对的 \((J, I, \Phi)\) 三元组。在训练时引入随机介质噪声注入机制:在图像编码前向输入施加轻微的随机物理扰动,生成受扰动的潜变量,迫使解码器忽略潜变量自带的微弱色调风格,完全依赖输入的物理参数 \(\Phi\) 进行恢复与调制。同时,在每个训练迭代中实施双前向传递(\(\Phi=0\) 解码纯净图 \(\hat{J}\),\(\Phi=\Phi_{input}\) 解码退化图 \(\hat{I}\)),并施加双向物理一致性损失约束:
该损失不仅约束正向物理退化模拟(\(\hat{J} \to I_{gt}\)),更强制反向物理还原(\(\hat{I} \to J_{gt}\))在代数与物理上闭环,彻底根除了颜色失真与错误物理伪影的累积。
损失函数 / 训练策略¶
Stage 1 纯净场景潜扩散采用标准扩散去噪均方误差损失,学习率为 \(10^{-5}\)。Stage 2 介质条件解码器在单张 NVIDIA A6000 GPU 上独立训练约 1 天,学习率同样为 \(10^{-5}\)。Stage 2 的完整优化目标为:
其中单项重建损失 \(\mathcal{L}_{rec}\) 组合了像素级、结构级与感知级差异:\(\mathcal{L}_{rec} = \lambda_1 L_1 + \lambda_{ssim} L_{SSIM} + \lambda_{lpips} L_{LPIPS}\)。论文实现中设置超参数权重为 \(\lambda_1 = 1.0\),\(\lambda_{ssim} = 1.0\),\(\lambda_{lpips} = 0.5\),以及 \(\lambda_{uifm} = 0.3\)。
实验关键数据¶
主实验¶
论文在 SynTIDE 提供的 5,451 条水下场景提示词上,与两大主流水下生成基线 Atlantis 及 TIDE 进行了多维度对比评估。为公平衡量纯净场景生成的视觉保真度与文本对齐度,基线方法生成结果经过 SLURPP 恢复模型后处理,与 WaterGen 的无退化输出(\(B=0, T=1\))进行无参考水下画质指标(UIQM、MUSIQ)及跨模态对齐(CLIP Score)评测。如表 1 所示,WaterGen 在画质与语义对齐上全面胜出,并唯一具备直接的介质物理可控性。
| 方法 | UIQM ↑ | MUSIQ ↑ | CLIP Score ↑ | 可控性维度 |
|---|---|---|---|---|
| Atlantis (CVPR 2024) | 2.8338 ± 0.1927 | 67.5437 ± 1.7373 | 0.2457 ± 0.0274 | 仅文本 |
| TIDE (CVPR 2025) | 2.3725 ± 0.3816 | 66.4304 ± 2.1780 | 0.2305 ± 0.0118 | 仅文本 |
| WaterGen (本文) | 3.0239 ± 0.1317 | 69.2638 ± 0.8813 | 0.2614 ± 0.0073 | 文本 + 物理介质 |
进一步评估合成数据对真实下游任务的赋能效果: 1. 水下图像恢复:利用 WaterGen 生成 20,000 对严密配对的清晰-退化图像作为扩充训练数据,在 UIIS10K 测试集上评估 4 种代表性恢复网络。加入合成数据后,所有网络在 UIQM 与 MUSIQ 指标上均获得明显提升(如表 2)。
| 模型 | UIQM (基线) | UIQM (+本文数据) | MUSIQ (基线) | MUSIQ (+本文数据) |
|---|---|---|---|---|
| WaterNet | 3.067 | 3.141 (+0.074) | 66.866 | 68.322 (+1.456) |
| Phaseformer | 2.239 | 2.272 (+0.033) | 67.400 | 69.165 (+1.765) |
| DeepWaveNet | 2.685 | 2.731 (+0.046) | 66.843 | 67.937 (+1.094) |
| Histoformer | 2.994 | 3.048 (+0.054) | 66.178 | 66.924 (+0.746) |
- 水下语义分割:生成 40,000 对样本并在纯净图像上提取伪标签,在 UIIS 与 USIS10K 两个分割数据集上微调 3 种分割架构(SegFormer、Mask2Former、ViT-Adapter)。相比仅使用真实数据,引入 WaterGen 数据在 UIIS 上为 SegFormer 带来了高达 5.4% 的 mIoU 增益(从 70.2% 跃升至 75.6%),超越了 SynTIDE 合成数据(75.4%)。
消融实验¶
为了验证介质注入机制与各个内部模块的物理控制精度,论文通过提取生成图像中的背景光参数,与输入的真实条件比对,系统评估了均方根误差(RMSE)、平均角度误差(MAE)以及 CIEDE2000 色差(\(\Delta E_{00}\)),如表 3 所示。
| 介质注入机制 / 配置 | RMSE (↓) | MAE (↓) | \(\Delta E_{00}\) (↓) | 说明 |
|---|---|---|---|---|
| ControlNet + SDXL | 0.45 | 21.05° | 43.70 | 扩散骨干内直接控制,色散与衰减严重失控 |
| T2I-Adapter + SDXL | 0.30 | 9.96° | 30.10 | 适配器注入依然难以解耦低频光度物理变化 |
| 本文方法 (w/o 退化噪声注入) | 0.07 | 7.01° | 7.27 | 缺乏扰动导致解码器过度依赖潜在残留样式 |
| 本文方法 (w/o 双向UIFM一致性) | 0.07 | 7.31° | 6.90 | 缺少反向约束,物理退化映射存在微小漂移 |
| 本文完整模型 (Full) | 0.06 | 4.42° | 5.44 | 双向闭环与噪声注入协同,物理控制精度最高 |
关键发现¶
- U-Net 注入 vs. Decoder 注入的本质差异:将 ControlNet 或 T2I-Adapter 等传统结构注入机制直接用于水体物理控制(表 3)表现极差,色差 \(\Delta E_{00}\) 高达 43.70 与 30.10。这表明扩散过程负责的是全局高层语义去噪,强行让其负责低频背景散射和光衰减,会与预训练去噪先验产生严重梯度冲突;将物理建模移入 Decoder 后,色差骤降至 5.44,控制精度显著提高。
- 双向物理一致性是物理泛化的基石:消融表表明,双向 UIFM 损失将角度误差从 7.31° 压制到 4.42°,有效防止了条件解码网络过度拟合合成数据的局部统计特征,保证了前向退化与逆向复原的物理可逆性。
- 纯净配对生成破解标注瓶颈:实验证明在生成的纯净无水图像上跑现成感知模型获取伪标签,再监督对应物理退化图像,能极大地提升分割模型在浑浊、色偏等极端水下场景中的抗干扰能力,且伪标签边缘锐利度远高于在退化图像上直接标注。
亮点与洞察¶
- 场景与介质物理级解耦:将生成模型擅长的“内容语义想象”与成像物理擅长的“光线散射衰减”划清边界,用扩散网络专职生成无退化场景潜变量,用物理引导的条件解码专职负责介质退化。架构设计优雅且完全符合第一性原理。
- “一景多水”的完美配对数据引擎:通过锁定潜变量 \(z_{clean}\) 并遍历介质参数 \(\Phi\),能够无损获得同一空间几何在深海、蓝绿浅滩、泥沙浑浊等数十种水质下的严密成对图像。这为水下恢复与自监督表征学习提供了近乎无限且无视差的高保真训练对。
- 随机介质噪声注入破除恒等映射:在 Stage 2 训练中主动向输入潜表示掺入微小物理退化,巧妙打破了解码器对潜空间残余水下风格的隐式记忆,强制网络将物理参数 \(\Phi\) 作为唯一的退化控制源。
局限与展望¶
- 水下成像模型的理论简化:当前物理注入建立在简化的大气/水下单散射与均匀介质假设(JM 模型及 Akkaynak 改进模型)之上,尚未显式建模严重的人工光源定向光斑(如探照灯焦散效应)、前向多重米氏散射引起的局部强雾化模糊以及水面波纹焦散(Caustics)。
- 极度复杂动态水体泛化:当水体中漂浮大量非均匀悬浮颗粒物(海雪,Marine Snow)时,由于缺乏专门的颗粒动力学模拟分支,生成的介质主要偏向连续衰减雾状,对大颗粒遮挡的模拟稍显欠缺。
- 未来方向:可进一步将瞬态光场或 3D 场景表征(如 3D Gaussian Splatting)与 WaterGen 的解耦思想相结合,拓展至可漫游水下神经辐射场与动态视频生成领域。
相关工作与启发¶
- vs. Atlantis (CVPR 2024):Atlantis 依靠深度控制网络(Depth2Underwater ControlNet)指导图像生成,但其训练直接在退化水下图像上进行,水体风格与场景深度深度耦合,生成图像常呈现过度饱和与卡通质感;WaterGen 采用两阶段解耦,不仅生成画质(UIQM 3.02 vs. 2.83)与文本对齐度更优,而且支持直接输入物理参数控制水体色泽与浊度。
- vs. TIDE (CVPR 2025):TIDE 尝试在单模型中统一生成水下图像与密集多模态标注,但因缺乏明确的物理成像约束,生成的物体几何与边界容易模糊;WaterGen 专注于通过纯净场景生成高质量伪标注,再精准投影到多水质退化域,下游任务表现全面超越 TIDE。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ [首次在潜扩散模型中实现水下场景语义与介质物理退化的彻底解耦与精确参数控制]
- 实验充分度: ⭐⭐⭐⭐⭐ [覆盖图像生成质量、控制精度消融、下游恢复与分割等全套客观与定量评测,数据扎实]
- 写作质量: ⭐⭐⭐⭐⭐ [物理模型阐述清晰,解耦逻辑严密,图表对比直观]
- 价值: ⭐⭐⭐⭐⭐ [不仅是高性能水下生成模型,更为整个水下计算机视觉领域提供了急需的可控双语配对数据引擎]