跳转至

NUN: Nested Unfolding Network for Real-World Concealed Object Segmentation

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/ChunmingHe/NUN
领域: 语义分割
关键词: 深度展开网络, 隐藏目标分割, 真实世界退化, 双层优化, 双向展开交互

一句话总结

针对真实退化条件下隐藏目标视觉线索微弱且易受干扰的问题,NUN 首次提出“DUN-in-DUN”双层嵌套深度展开架构,由外层分割展开网络 SODUN 嵌套内层退化鲁棒恢复网络 DeRUN,通过参数解耦的双层优化与双向交互机制,从数学与架构上消除了低层恢复与高层语义分割间的梯度冲突。

研究背景与动机

隐藏目标分割(Concealed Object Segmentation, COS)旨在从复杂背景中分割出具有极高伪装性、视觉线索极微弱的目标,如伪装动物、息肉病灶、透明物体及细微缺陷。然而真实应用环境通常充斥着低光照、雾气和低分辨率等恶劣成像退化,这些低层退化会进一步模糊微弱的判别线索,导致传统在洁净数据上训练的 COS 算法发生灾难性性能衰减。

面对这一挑战,直觉上需要联合执行图像恢复与语义分割,但两者在优化目标上存在根本性冲突:恢复任务追求细粒度的高频纹理重构,而分割任务则高度聚焦于高层语义对比与边界判据。现有的两阶段流水线(先恢复后分割)割裂了任务反馈,导致恢复过程无法利用分割语义指导;而近期的耦合展开方法虽然将两任务交织迭代,但由于共享参数空间,导致反向传播时恢复损失与分割损失剧烈冲突,产生互相拉扯的折中梯度。

为了化解这一核心矛盾,必须在保证恢复与分割各自在独立子空间充分优化的同时,实现有受控的跨任务互相引导。核心 idea:构建首个 DUN-in-DUN 嵌套深度展开框架(NUN),将退化鲁棒展开网络 DeRUN 嵌入分割导向展开网络 SODUN 的每个阶段中,通过参数集合解耦在数学上消减梯度冲突,并利用 IQA 优选与跨阶段一致性实现双向受控交互。

方法详解

整体框架

NUN 建立在双层优化(Bi-level Optimization, BLO)的思想之上:外层循环负责前背景可逆估计与掩码预测,内层循环则专注于无先验盲退化建模与高质量图像复原。在宏观流程上,NUN 包含 \(K\) 个外层阶段(Stage \(k \in [1, K]\),默认 \(K=4\)),每个外层阶段包含一轮 SODUN 步骤;而在每个阶段内部,嵌套执行 \(N\) 次内层近端梯度迭代(Iteration \(n \in [1, N]\),阶段内迭代数设为 \(N \in \{4, 3, 3, 2\}\))。两者通过双向展开交互(BUI)动态传递特征,最后通过图像质量评估(IQA)挑选最优复原帧回传给后续阶段。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["退化输入图像 Y"] --> B["外层阶段 SODUN<br/>可逆前背景掩码/残差估计"]
    B --> C["内层嵌套 DeRUN<br/>盲退化算子逼近与近端去退化"]
    C --> D["双向展开交互 BUI<br/>IQA 质量优选 + 掩码先验注入"]
    D --> E["跨阶段一致性约束<br/>对齐最优与次优预测防止扰动"]
    E --> F["输出: 精确隐藏掩码 MK + 高质复原图 XTK1"]

关键设计

1. SODUN:可逆前背景联合优化与视觉状态空间建模 针对隐藏目标与背景边缘高度模糊且容易产生漏检假阳性的痛点,SODUN 将分割问题建模为图像在前背景掩码域和 RGB 域的可逆分解。在第 \(k\) 个外层阶段,网络首先基于前一阶段背景估计 \(\mathbf{B}_{k-1}\) 与上一阶段选出的恢复图像 \(\mathbf{X}_{k-1}^{T1}\),执行梯度下降步得到中间掩码 \(\hat{\mathbf{M}}_k\)。随后近端项利用视觉状态空间(Visual State Space, VSS)模块提取长程依赖,同时融合来自骨干编码器在恢复图与原始退化图上的拼接特征 \(E(\text{con}(\mathbf{X}_{k-1}^{T1}, \mathbf{Y}))\),既借助复原细节又避免复原伪影偏差,并联合前景与互补背景权重生成细化掩码 \(\mathbf{M}_k\)。紧接着,背景估计器 \(\mathcal{B}\) 在 RGB 域依据 \(\mathbf{M}_k\) 进行反向残差梯度更新并经轻量 U 型网络近端细化,形成掩码与色彩背景相互校验的可逆约束,强迫模型对边缘歧义区域保持敏感。

2. DeRUN:无预设退化算子的可学习近端梯度展开 针对真实世界退化类型未知、多退化交织以及无法提前获得退化矩阵 \(\mathbf{D}\) 的痛点,DeRUN 在每个 SODUN 阶段内部执行 \(N\) 步近端梯度展开,完全无需手工预设退化模型。核心机制是引入结构共享的可学习残差卷积算子 \(RC_{k,n}^\mathbf{D}(\cdot)\)\(RC_{k,n}^{\mathbf{D}T}(\cdot)\) 来隐式逼近退化算子 \(\mathbf{D}\) 及其转置 \(\mathbf{D}^T\): $\(RC_{k,n}^\mathbf{D}(\mathbf{X}) = \boldsymbol{\sigma}_{k,n} \odot (CRC(\mathbf{X})) + \boldsymbol{\mu}_{k,n}\)$ 其中 \(CRC(\cdot)\) 为卷积-ReLU-卷积块,调制参数 \(\{\boldsymbol{\sigma}_{k,n}, \boldsymbol{\mu}_{k,n}\}\) 默认由冻结的通用视觉退化模型 DA-CLIP 提取语义描述符后经线性映射得到(亦可纯隐式端到端学习)。在近端步中,DeRUN 除了常规复原分支 \(\mathcal{X}_1\) 外,创新性地引入分割互补项 \(\mathcal{X}_2(\hat{\mathbf{X}}_{k,n}, \mathbf{B}_k, \mathbf{M}_k, \mathbf{Y})\),将来自 SODUN 的掩码置信度与背景先验反哺注入给复原网络,让去噪与去模糊模块自适应把算力集中在语义不确定度极高、边界模糊的关键暗含区域。

3. 双向展开交互与理论梯度冲突消除:BUI 与一致性约束 针对单向级联结构信息割裂与耦合结构中严重的参数梯度干扰,NUN 在两套展开循环之间搭建了受控的双向桥梁。一方面,DeRUN 的内部中间结果利用综合图像质量评估(集成了 TOPIQ、Q-Align 与 MUSIQ)计算感知评分 \(S(\mathbf{X}_{k-1,n})\),贪心选取评分最高者 \(\mathbf{X}_{k-1}^{T1}\) 替换后续各阶段的参考图像输入。另一方面,为防止早期掩码误差在两模块间滚雪球放大,设计了跨阶段一致性损失 \(\mathcal{L}_{csc}\),强迫由 Top-1 与 Top-2 候选图像产生的掩码预测 \(\mathbf{M}_k\)\(\mathbf{M}_k^{T2}\) 相互对齐。在理论层面,DeRUN 参数集 \(\theta_{res}\) 与 SODUN 参数集 \(\theta_{seg}\) 完全互斥独立,从根源上消除了 \(\langle \nabla \mathcal{L}_{seg}, \nabla \mathcal{L}_{res} \rangle < 0\) 引起的参数级梯度对消;同时论文证明了在局部强凸与 Lipschitz 连续条件下,退化算子对分割误差的影响被上界严格限制为 \(\mathcal{O}(\delta_k + \delta_{res})\),内层优化误差 \(\delta_k\) 随迭代次数 \(N\) 呈指数级收敛衰减。

损失函数 / 训练策略

NUN 采用全端到端联合训练策略,总损失由基础多尺度监督损失 \(\mathcal{L}_{basic}\) 与跨阶段一致性损失 \(\mathcal{L}_{csc}\) 加权组合而成: $\(\mathcal{L}_{total} = \mathcal{L}_{basic} + \epsilon \mathcal{L}_{csc}\)$ 基础损失在所有 \(K\) 个阶段上进行指数衰减加权,同时监督掩码精度与图像复原保真度: $\(\mathcal{L}_{basic} = \sum_{k=1}^K \frac{1}{2^{K-k}} \left[ \mathcal{L}_{BCE}^w(\mathbf{M}_k, GT_s) + \mathcal{L}_{IoU}^w(\mathbf{M}_k, GT_s) + \|\mathbf{X}_k - \mathbf{X}\|_1 \right]\)$ 其中 \(\mathcal{L}_{BCE}^w\)\(\mathcal{L}_{IoU}^w\) 为加权交叉熵与加权交并比损失,\(\mathbf{X}\) 为洁净参考图。一致性损失 \(\mathcal{L}_{csc} = \sum_{k=1}^K \frac{1}{2^{K-k}} [ \mathcal{L}_{BCE}^w(\mathbf{M}_k, \mathbf{M}_k^{T2}) + \mathcal{L}_{IoU}^w(\mathbf{M}_k, \mathbf{M}_k^{T2}) ]\) 则在 Top-1 与 Top-2 质量输入生成的预测之间施加对称伪标签约束。模型使用两张 NVIDIA RTX 4090 GPU、Adam 优化器训练,初始学习率为 \(1 \times 10^{-4}\),批大小为 36,输入分辨率统一为 \(352 \times 352\)

实验关键数据

主实验

在涵盖 4 个标准 COD 洁净基准、3 种退化(低光照、大雾、低分辨率及其复合退化)、真实世界退化数据集 PCOD-LQ / MCOD-LQ,以及医学图像息肉分割(PIS)、透明物体检测(TOD)和缺陷检测(CDD)总计 12 个基准上,NUN 均刷新了 SOTA。下表呈现原论文 Table 5 在合成复合退化(低分辨率+低光照+大雾)下 COD 基准的主结果对比。

原论文 Table 5 节选(复合退化场景性能对比):

方法 骨干网络 CAMO (M ↓) CAMO (Fβ ↑) COD10K (M ↓) COD10K (Fβ ↑) NC4K (M ↓) NC4K (Fβ ↑)
FEDER ResNet50 0.169 0.391 0.104 0.322 0.147 0.408
FSEL ResNet50 0.173 0.394 0.110 0.317 0.150 0.397
RUN ResNet50 0.169 0.394 0.100 0.345 0.143 0.547
NUN (Ours) ResNet50 0.137 0.463 0.068 0.448 0.096 0.572
RUN PVT V2 0.142 0.496 0.085 0.429 0.115 0.543
NUN (Ours) PVT V2 0.077 0.770 0.035 0.732 0.048 0.815

消融实验

消融实验均在 ResNet50 骨干下,基于 COD10K 复合退化测试集开展。下表汇聚原论文 Table 9(系统宏观模块消融)与 Table 11(DeRUN 与 BUI 机制消融)。

原论文 Table 9 & Table 11 消融汇总:

配置 / 变体 M ↓ Fβ ↑ Eϕ ↑ Sα ↑ 说明
SODUN- (无背景估计分支) 0.102 0.328 0.603 0.583 仅保留掩码单分支展开
SODUN 完整 0.093 0.362 0.619 0.592 引入可逆前背景双域建模
SODUN + DeRUN (无 BUI) 0.076 0.406 0.646 0.618 引入内层盲退化近端展开
完整 NUN (Ours) 0.068 0.448 0.686 0.643 全套嵌套展开 + BUI 闭环
w/o \(X_2(\cdot)\) (去除分割先验注入) 0.071 0.430 0.671 0.633 复原过程缺失高层语义引导
w/o IQA (去除质量优选) 0.072 0.421 0.655 0.626 随机/默认末帧输入导致误差累积
w/o \(\mathcal{L}_{csc}\) (去除跨阶段一致性) 0.071 0.428 0.665 0.633 去除预测稳定性对齐约束

关键发现

  • 双层解耦消除负迁移:在复合退化下,传统耦合单循环展开模型 RUN 在 COD10K 上的 \(F_\beta\) 为 0.345,而 NUN 直接跃升至 0.448(ResNet50 下相对提升 29.8%);换用 PVT-V2 骨干更从 0.429 飙升至 0.732,证明参数空间正交与独立内外层循环彻底化解了优化对抗。
  • 图像复原质量与分割双赢:在恢复质量对比(Table 12)中,耦合展开的 RUN 在退化图上的 PSNR 仅为 15.21 dB,甚至落后于纯复原模型 DiffIR(18.63 dB);而 NUN 达到了 22.37 dB 与最低 FID 73.15,用户评分第一(3.92/5.0),证实高层语义分割反馈有效反哺了低层纹理重建。
  • 真实退化零样本泛化出众:在未经合成训练匹配的真实世界低质子集 PCOD-LQ 和 MCOD-LQ 上(Table 6),NUN 在 \(F_{\beta}^{max}\) 上分别达到 0.674 与 0.556,显著超出 FEDER(0.585 / 0.440)和 RUN(0.653 / 0.490),验证了盲退化建模与一致性约束对分布外噪声的超强泛化性。

亮点与洞察

  • DUN-in-DUN 嵌套新范式:首创在计算机视觉领域将一个深度展开网络嵌套于另一个深度展开网络内。这一架构巧妙地映射了双层优化(BLO)数学结构,使不同抽象层次(低层物理退化 vs 高层语义对比)的视觉任务得以在各自保真空间解耦推演。
  • 动态闭环的双向交互(BUI):不仅顺向利用 IQA 优选高质量复原图像输入外层分割,逆向更将分割置信度与背景掩码注入内层去噪核,迫使复原网络集中算力修复高不确定度的边界细节。
  • 严格的理论收敛与误差敏感度界:给出了内层展开在局部强凸下的线性收敛保证,并建立了分割性能退化对复原残差误差的灵敏度上界 \(\mathcal{O}(\delta_k + \delta_{res})\),为多任务深度学习提供了少有的严谨理论保障。

局限与展望

  • 作者承认的局限:目前的理论分析建立在阶段间假定选定恢复图 \(\mathbf{X}_k^{T1}\) 为静态输入的代理建模上;双层优化在严格数学意义上对最优恢复映射 \(\mathbf{X}^*(\mathbf{M}, \mathbf{B})\) 梯度的严谨隐函数理论证明仍留待未来探索。
  • 计算复杂度与推理延迟:内层展开循环在每个外层阶段都要进行多轮近端梯度迭代(总步数达 4+3+3+2=12 次近端前向),配合 IQA 评估与 VSS 模块,其推理时间相对单阶段纯前馈网络(如 22ms 级别)有所增长(Tab. 14 记录为 38ms~44ms),在极度要求轻量实时的嵌入式平台上存在部署阻力。
  • 改进思路:可引入早停策略或根据场景复杂度动态自适应决定内层展开步数 \(N_k\);同时将 DA-CLIP 等重型语义先验蒸馏至展开算子内,进一步压缩计算开销。

相关工作与启发

  • vs RUN (ICML 2025): RUN 首次在 COS 中引入单层可逆展开网络,但将恢复与分割简单耦合在同级参数和交替步中,严重受困于梯度对抗,且复原模块依赖预设退化模式;NUN 将其革新为双层嵌套(DUN-in-DUN),解耦参数并引入可学习盲退化算子,在复合退化下的 COD10K 指标取得了超过 20% 的断层式领先。
  • vs FEDER / FSEL: 传统基于手工边缘重构或特征分解的 COS 模型假设输入图像完全洁净,在低光照、雾天等退化下性能严重腰斩(Fβ 从 0.7~0.8 跌至 0.2~0.4);NUN 证明了在前端嵌入物理展开机制是提升复杂感知鲁棒性的最优解。
  • vs RobustSAM / SAM-Adapter: 即使基于庞大 ViT-H 骨干的 SAM 变体,在面对严重复合退化时依然受限于退化表征混乱(Table 13 中 RobustSAM 退化 Fβ 仅为 0.669);NUN 搭配 ViT-H 后取得了高达 0.806 的 Fβ,表明底层展开复原结构是通用大模型落地真实物理世界的核心补丁。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次提出 DUN-in-DUN 嵌套展开体系与双向展开交互,理论推导扎实,架构构想极具创新性。
  • 实验充分度: ⭐⭐⭐⭐⭐ 跨越 12 个学术基准、合成与真实分布外退化、3 大不同视觉应用及多种骨干网络,对比极为详尽。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑结构严谨连贯,从模型机理、理论推导到实验论证步步为营,公式清晰,图表完备。
  • 价值: ⭐⭐⭐⭐⭐ 不仅彻底解决了退化隐藏目标分割痛点,更建立了一套普适于自动驾驶恶劣天气、水下机器人与医学影像的“退化恢复-语义感知”统一双层优化范式。