跳转至

HIDA: A Human-Intuition-Guided Depth-Aware Framework for Zero-Shot Amodal Segmentation

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/lipenghuai/HIDA
领域: 语义分割
关键词: 非模态分割 / 零样本泛化 / 伪深度先验 / 软路由MoE / 视觉基础模型

一句话总结

HIDA 将冻结的 SAM 与 Depth Anything V2 作为即插即用的先验抽取器,通过基于深度极性的自适应裁剪定位遮挡区域,并配合遮挡感知软路由 MoE 增强轻量 ViT 表征,仅凭可见边界框即实现高精度零样本与全监督非模态分割。

研究背景与动机

人类视觉系统具有天然的非模态感知能力,即使物体局部被遮挡,也能凭借物理常识与空间几何关系敏锐推断出物体的完整轮廓。在计算机视觉领域,非模态分割(Amodal Segmentation)要求算法完整补全被遮挡目标的不可见区域,对自动驾驶环境感知、机器人抓取规避、图像去遮挡及三维场景重建等下游任务至关重要。然而,绝大多数传统方法强依赖于封闭域内的人工标注进行全监督训练,不仅数据标注昂贵,而且面对未知类别与开集场景时泛化性能严重衰减。

随着视觉基础模型的发展,近期研究开始尝试将大模型的通用先验引入零样本非模态补全。例如 SAMBA 通过对 SAM 编码器施加额外层结构进行微调,展现出了较强的零样本能力;而 Pix2Gestalt 则构建了庞大的扩散模型进行掩码生成。然而,这类方案要么受制于微调单个基础模型的极高计算开销与结构绑定,要么依赖生成式扩散模型而忽视了场景固有的三维几何连续性。人类识别遮挡关系的核心直觉遵循简洁的深度几何法则:在三维空间中只有离视点更近的前景物体才会遮挡后方目标。若能显式引入单目深度先验与高质量可见轮廓约束,就能将难题从“全图盲猜补全”转化为有几何锚点的“局部边界外推”。

受此启发,本文提出了两阶段免微调的即插即用框架 HIDA。模型完全冻结 SAM 与 Depth Anything V2 两大视觉基础模型,仅将其作为离线先验生成器,并设计基于深度极性的非对称自适应裁剪机制,再通过轻量级 ViT 编码器配合遮挡感知的软路由 MoE 模块自适应建模被遮挡区域。核心 idea:将非模态补全解耦为冻结基础模型提取三维几何与可见轮廓先验、深度极性引导自适应局部裁剪、以及遮挡感知软路由 MoE 驱动轻量网络完成轮廓外推。

方法详解

整体框架

HIDA 仅接收待分割目标的可见边界框 \(B_m\) 和原始图像 \(I\) 作为输入,目标是预测覆盖目标可见与不可见区域的完整二值非模态掩码 \(\tilde{M}^a \in \{0, 1\}^{H \times W}\)。整体流程划分为不可训练的先验生成阶段与可训练的轻量分割阶段:首先利用并行运行的 Depth Anything V2 提取图像的伪深度图(PDM)\(D\),同时调用 SAM 生成高质量的初始可见掩码 \(\tilde{M}^m\);随后利用可见轮廓与深度极性打分计算目标各边缘的遮挡概率,自适应向真实发生遮挡的侧向扩展边界框并完成图像、深度与可见掩码的对齐裁剪;最后将裁剪后的多模态特征输入轻量级 ViT 编码器,由内部集成的遮挡感知软路由 MoE 动态强化边界与隐蔽区域表征,并与 SAM 特征通道拼接后通过轻量解码器回归最终的非模态掩码。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入:原图 I + 可见框 Bm"] --> B["阶段 1:冻结双基础模型先验提取<br/>SAM 提可见掩码 / Depth-Anything-V2 提深度图"]
    B --> C["阶段 2:基于深度极性的自适应目标裁剪<br/>计算边界外侧深度极性打分,向遮挡侧非对称扩展"]
    C --> D["阶段 3:遮挡感知软路由 MoE 编码<br/>轻量 ViT 结合遮挡信号 occ 动态软路由多专家"]
    D --> E["阶段 4:双特征拼接与轻量解码<br/>融合轻量 ViT 特征与冻结 SAM 特征回归完整掩码"]
    E --> F["输出:映射回原图尺寸的非模态掩码 Ma"]

关键设计

1. 基于深度极性的自适应目标裁剪:引导网络专注遮挡侧上下文

常规目标裁剪通常采用对称固定比例放大可见框,这不仅会引入过多与补全无关的遥远背景噪点、降低信噪比,还会导致细长物体出现大量无效留白,使编码器感受野被背景大量浪费。为此,HIDA 依据“前景遮挡物在深度图上数值更大(距离相机更近)”的物理常识,设计了面向目标上下左右四个边 \(s \in \{l, r, t, b\}\) 的遮挡评分机制。在可见掩码 \(\tilde{M}^m\) 的外侧定义不重叠的不规则条带 \(\Omega_s\),条带内各像素赋予随距离线性衰减的权重 \(w(p)\)。通过腐蚀 \(\tilde{M}^m\) 获取宽度为 5 像素的内边界带 \(band_{in}\) 并计算其中值深度,边缘外侧遮挡得分定义为: $\(score_s = \frac{\sum_{p \in \Omega_s} \mathbf{1}[D(p) \ge \text{med}(D(band_{in})) + \Delta] w(p)}{\sum_{p \in \Omega_s} w(p)}\)$ 其中 \(\Delta\) 为深度裕度阈值。若外侧像素深度显著大于内边界中值,判定该侧存在遮挡物。随后在设定的扩展率区间 \([E_{r,\min}, E_{r,\max}] = [0.2, 0.6]\) 内,按各侧得分占比非对称分配水平与垂直扩展尺寸: $\(E_{r,left} = \min\left\{\max\left(E_{r,\min}, \frac{score_{left}}{score_{left} + score_{right} + \varepsilon} \times E_{r,\max}\right), E_{r,\max}\right\}\)$ 该机制让裁剪窗口主动向发生真实遮挡的方向延伸,不仅剔除了无关背景,更让目标在裁剪视野中居中且尺度稳定,有效消除了随机扩框带来的尺度抖动。

2. 遮挡感知软路由 MoE:按遮挡强度自适应路由多专家表征

非模态分割面临的深层难题是可见区域与被遮挡区域在纹理和深度分布上存在明显的表征鸿沟。硬路由 MoE 往往会导致专家选择离散且不稳定,而在边界过渡带连续分配专家权重更为合理。HIDA 从深度图与可见掩码中提取三个低分辨率先验:Sobel 滤波器提取并归一化得到的深度梯度幅值 \(g\)(表征深度突变强度)、可见掩码边缘 \(d\) 以及下采样掩码 \(m\),构造遮挡敏感路由信号: $\(occ = [\sigma(g + d) \parallel d \parallel m]\)$ 在轻量 ViT 骨干网内部,空间位置 \((i, j)\) 处的特征 \(x_{i,j}\) 先经 \(1\times 1\) 卷积降维为 \(z\),随后与 \(occ\) 拼接后输入路由器 \(R\),经 Softmax 激活输出连续的专家门控概率向量 \(g_{k,i,j} = \text{softmax}(R([z \parallel occ]))_k\)。各位置特征经 \(K\) 个轻量卷积专家 \(E_k\) 加权组合并以残差形式叠加: $\(y_{i,j} = \sum_{k=1}^K g_{k,i,j} E_k(x_{i,j}) \quad \text{s.t.} \quad g_{k,i,j} \ge 0, \sum_{k=1}^K g_{k,i,j} = 1\)$ 内部或明确背景区域由单一主力专家高效主导,而遮挡边界与模糊隐蔽区域则由互补的多个专家共同协作表达,使表征跨越遮挡边界平滑外推。

3. 双基础模型先验与轻量网络协同:冻结大模型与轻量 ViT 互补解码

为兼顾零样本泛化能力与训练推理开销,HIDA 坚持不对参数量庞大的 SAM(ViT-H)与 Depth Anything V2(Large)进行任何权重反向传播或微调。所有基础模型先验均在训练前离线抽取并缓存。进入轻量解码网络时,仅有轻量级 ViT 编码器(4-8 层)、软路由 MoE 模块以及轻量级解码器参与反向传播。裁剪后的 RGB 图像经冻结 SAM 编码器抽取的富语义特征与轻量 ViT 编码器输出的几何增强特征在通道维度直接对齐拼接,既复用了 SAM 强大的开集表征与物体边界识别能力,又弥补了其无法主动外推隐藏区域的缺陷,将可训练参数压缩至仅 77.86M。

损失函数 / 训练策略

模型训练在合成遮挡数据集 pix2gestalt(84.9 万张由 SA-1B 生成的遮挡样本)上以完全类别无关(class-agnostic)的方式进行,图像统一重采样至 \(256 \times 256\) 且不添加额外数据增强。优化目标由非模态掩码分割损失 \(\mathcal{L}_{seg}\) 与专家负载均衡正则项 \(\mathcal{L}_{LB}\) 构成: $\(\mathcal{L} = \mathcal{L}_{seg} + \mathcal{L}_{LB}\)$ 分割损失采用二值交叉熵与 Dice 损失的加权组合: $\(\mathcal{L}_{seg} = \mathcal{L}_{BCE}(\tilde{m}^a, m^a) + \mathcal{L}_{Dice}(\tilde{m}^a, m^a)\)$ 为防止软路由门控塌缩到少数优势专家,利用批次与全图空间均值门控 \(\bar{g}_k = \frac{1}{B \times H \times W} \sum_{b,i,j} g_{b,i,j,k}\) 构建最大熵形式的负载均衡损失: $\(\mathcal{L}_{LB} = -\sum_{k=1}^K \bar{g}_k \log(\bar{g}_k + \epsilon)\)$ 网络采用 AdamW 优化器,在单张 NVIDIA RTX 4090 上端到端训练 15 个 epoch,初始学习率为 \(1 \times 10^{-4}\),配合余弦退火调度逐步衰减。零样本评估时直接加载该权重;全监督设定下则在具体数据集上以零样本权重为底座微调。

实验关键数据

主实验

评估在三个公开基准数据集(COCOA-cls 验证集、D2SA 验证集、KINS 测试集且限车辆高度 \(>50\text{px}\))上进行,评估指标为平均交并比(mean IoU, %)。实验对比了全监督 SOTA 方法与主流零样本方法。

方法 类型 / 发表处 COCOA-cls (val) D2SA (val) KINS (test)
GIN 全监督 (TMM 2023) 72.46 78.23 68.31
SAM 零样本可见基线 (ICCV 2023) 73.10 84.65 75.88
C2F-Seg 全监督 (ICCV 2023) 80.28 89.10 82.22
SDXL-Inpainting† 零样本扩散修复 (ICLR 2024) 73.65 80.53 76.19
Pix2Gestalt† 零样本扩散生成 (CVPR 2024) 79.08 81.82 81.45
SDAmodal 全监督 (CVPR 2024) 80.01 - -
SAMBA† 零样本微调 SAM (CVPR 2025) 81.82 90.98 88.47
HIDA† (本文零样本) 零样本 83.16 91.11 86.71
HIDA (本文全监督) 全监督 85.56 93.33 91.50

注:† 表示零样本评估方法。

消融实验

1. 编码器特征源与伪深度先验贡献消融(COCOA-cls 验证集,零样本)

配置序号 SAM 编码特征 可训练 ViT 特征 伪深度图 (PDM) IoU (%) 单 Epoch 训练耗时 (h)
1 60.90 3.5
2 81.56 5.3
3 81.78 6.1
4 (Full) 83.16 6.1

2. 软路由 MoE 专家数量与轻量 ViT 编码器层数消融(COCOA-cls 验证集)

消融维度 具体设置 编码器参数量 (M) 编码器计算量 (FLOPs/G) IoU (%) 训练耗时/Epoch (h)
专家数量 \(K\) \(K=1\) 60.29 17.68 81.98 -
\(K=2\) 61.93 18.10 82.69 -
\(K=4\) (默认) 65.23 18.95 83.16 6.1
\(K=8\) 71.87 20.65 82.97 -
ViT 层数 4 层 6.43 3.89 82.18 4.5
6 层 24.81 8.58 83.05 5.1
8 层 (默认) 65.23 18.95 83.16 6.1

关键发现

  • 几何深度先验至关重要:在双编码器特征齐备的情况下,直接移除伪深度输入(PDM 置零)会导致零样本 IoU 从 83.16% 跌落至 81.78%(净降 1.38%),有力证明了单目深度提供的三维前后遮挡相对关系是非模态边界推断的关键使能因素。
  • 软路由 MoE 存在容量适度阈值:将专家数从 1 扩充至 4 时,IoU 从 81.98% 稳步提升至 83.16%;然而继续增加至 8 个专家后指标反而微降至 82.97%。这说明过度庞大的专家池会增加路由分配的学习难度并引发过拟合,4 个轻量卷积专家即可充分兼顾内部平滑区、前景可见区、外侧背景与遮挡交界区。
  • 特定场景全监督迁移增益更显著:全监督微调下,HIDA 在超市结账密集遮挡场景 D2SA 上达到 93.33%(相比此前 SOTA C2F-Seg 的 89.10% 大幅领先 4.23%),在自动驾驶街景 KINS 上达到 91.50%(相比 C2F-Seg 领先 9.28%),表明深度引导在强遮挡且具场景偏置的应用中具有极高落地价值。

亮点与洞察

  • 即插即用、完全免除基础模型微调:与 SAMBA 修改 SAM 结构或 Pix2Gestalt 训练巨型扩散模型不同,HIDA 冻结 SAM ViT-H 与 Depth Anything V2 Large,将它们视为纯粹的先验黑盒。仅需离线缓存特征后训练 77.86M 参数的轻量级网络,即可在消费级 RTX 4090 上高效完成训练。
  • 基于深度极性的非对称自适应裁剪:利用目标内边界与外部条带的深度差值确定遮挡概率,打破了传统“居中无偏等比扩框”的思维惯性,将感受野自适应倾斜至真实被遮挡的方位,兼具高信噪比与尺度一致性。
  • 遮挡引导的软路由 MoE 机制:将深度梯度与边缘掩码显式聚合成遮挡引导信号 \(occ\),促使底层专家在浅层形成锐利的边界分工,并在深层形成平滑连贯的语义拓扑,有效缓解了遮挡导致的表征鸿沟。

局限与展望

  • 接触性深度混叠(Depth Aliasing)导致的轮廓溢出:当远端细长目标与前景遮挡物物理贴合极其紧密时,单目深度估计模型的深度不连续性可能减弱甚至发生前后颠倒,导致边界归属歧义,引起非模态掩码对遮挡物的过度延伸或补全不足。未来需要引入更高精度的物理遮挡边界判别或多尺度深度一致性建模。
  • 单帧推理延迟有待压缩:当前端到端推理依赖于串行运行大型基础模型(SAM ViT-H 与 Depth Anything V2 Large),在 RTX 4090 上单张图像单实例推理耗时约 0.8 秒,难以满足自动驾驶等超高帧率实时感知场景。后续工作可探索轻量级单目深度模型与蒸馏版 SAM 替换。

相关工作与启发

  • vs SAMBA (CVPR 2025):SAMBA 在 SAM 编码器后串接复杂模块进行端到端微调,导致训练成本高昂且完全受限于 SAM 的结构和分辨率;HIDA 坚持冻结基础模型,以双模型多模态先验互补,且通过轻量软 MoE 实现更高零样本精度。
  • vs Pix2Gestalt (CVPR 2024):Pix2Gestalt 依赖 8.6 亿参数的生成式扩散模型,单步生成开销巨大且易产生幻觉几何;HIDA 仅有 77.86M 可训练参数,通过显式深度极性约束实现了稳定可控的确定性分割。
  • vs C2F-Seg (ICCV 2023):C2F-Seg 依赖全监督粗到细形状先验补全,严重依赖特定域先验;HIDA 通过引入通用单目深度关系,兼具强大的域外零样本泛化能力和全监督迁移潜力。

评分

  • 新颖性: ⭐⭐⭐⭐ [创新地将单目深度极性与软路由 MoE 结合到非模态补全任务中,架构构思巧妙]
  • 实验充分度: ⭐⭐⭐⭐⭐ [三大经典真实基准评测,覆盖全监督与零样本,消融实验指标翔实完备]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑严密,三维直觉与动机交代清晰,方法与可视化图表丰富]
  • 价值: ⭐⭐⭐⭐ [免微调基础模型的即插即用范式对具身智能和受控场景感知补全具有很高的工程借鉴意义]