Liquid Fusion of Heterogeneous Representations Towards General Salient Object Detection¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/cke520/LFNet
领域: 语义分割
关键词: 显著性目标检测、异构特征融合、状态空间模型、液态神经网络、频域上采样
一句话总结¶
针对单一模型在通用显著性目标检测中存在的频域偏置盲区,LFNet 将 VMamba 的连续全局语义与 ConvNeXt 的局部网格细节分别建模为液态神经网络的“演化状态”与“外生刺激”,配合频空协同的显著性引导上采样算子,在 RGB、RGB-D、RGB-T、VSOD 和 VDT 五大任务上全面超越现有纯 SSM 与 Transformer 方案。
研究背景与动机¶
显著性目标检测(Salient Object Detection, SOD)旨在从复杂场景中准确识别并分割出最引人注目的前景对象。随着研究深入,任务范式已从单纯的单模态 RGB 图像拓展至融合深度或热成像的跨模态 RGB-D/T、时序建模的视频显著性(VSOD)乃至可见光-深度-热成像三模态(VDT)场景,即通用 SOD(General SOD)。该任务对特征表征提出了兼顾“全局语义上下文定位”与“细粒度结构边界勾勒”的双重苛刻要求。虽然基于 Transformer 的架构凭借自注意力取得了出色表现,但其二次计算复杂度严重制约了高分辨率密集预测的实用性;而近期兴起的状态空间模型(如 Mamba、Samba)虽具备线性复杂度与长程建模能力,却往往试图通过工程化愈发繁复的空间扫描路径(如对角扫描、嵌套 S 型扫描)来强迫单一骨干网络兼顾全频域上下文。
然而,从信号处理的角度分析,单一网络范式本身具有难以回避的固有频域偏置。作者对四阶段特征进行二维快速傅里叶变换(2D FFT)并分析其径向频谱分布后发现:轻量 CNN(ConvNeXt)与视觉状态空间模型(VMamba)在不同尺度阶段的频谱能量分布存在明显的相交与互补现象——CNN 更擅长高频局部网格纹理的捕捉,而 SSM 则在中低频全局语义感知上表现出显著优势。这种结构性异构特性在数学上表明两者的特征具有本质互补性,仅靠复杂的空间扫描重排无法根除纯 SSM 模型的频域表征盲区。
因此,解决通用 SOD 的关键切入点在于如何以优雅且高效的机制协调 SSM 与 CNN 的异构特征,而非一味堆叠复杂的扫描策略。受液态神经网络(Liquid Neural Networks, LNNs)连续时间动态特性的启发,本文的核心 idea 是将 VMamba 提取的连续全局状态与 ConvNeXt 捕捉的局部网格特征分别映射为液态动力系统中的演化隐状态与外生突触刺激,利用动态门控调节外生刺激的注入渗透率,并在上采样阶段通过频域-空间双分支协同消除混叠伪影与语义衰减。
方法详解¶
整体框架¶
LFNet 的整体架构采用由异构混合编码器、模态融合块(MFB)、液态融合模块(LFM)和显著性引导上采样(SGU)构成的自顶向下金字塔解码流水线。对于输入的单模态或多模态信号,模型分别通过预训练的 VMamba-Small 与 ConvNeXt-Pico 骨干抽取 4 个层级的多尺度特征。针对非 RGB 模态(如深度、热红外、时序帧),ConvNeXt 侧利用 MFB 灵活完成辅助模态注入。在解码阶段,各层级的异构特征经由 LFM 进行状态-刺激动态平衡聚合,并由高层至浅层逐级通过 SGU 算子完成分辨率恢复,最终在多尺度深度监督下输出高精度显著性预测图。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
In["多模态输入<br/>(RGB / 深度 / 热红外 / 时序帧)"] --> Enc["异构混合编码器<br/>VMamba (全局) + ConvNeXt (局部)"]
Enc --> MFB["模态融合块 (MFB)<br/>适配单/双/三模态输入"]
MFB --> LFM["液态融合模块 (LFM)<br/>状态-刺激动态自适应门控"]
LFM --> SGU["显著性引导上采样 (SGU)<br/>频域复数调制 + 空间边缘增强"]
SGU --> Out["多尺度显著性预测图<br/>(深监督输出 $O_1 \sim O_4$)"]
关键设计¶
1. 异构混合编码器与模态融合块:解耦全频域建模与多模态扩展
传统单一 SSM 骨干在面对高频细节缺失时往往诉诸复杂的扫描策略,增加了优化难度与计算冗余。LFNet 采用双流异构骨干,利用 VMamba-Small 提供具备线性时间复杂度的连续状态空间表示 \(\mathbf{f}_i^v \in \mathbb{R}^{C_i \times H_i \times W_i}\),利用轻量级 ConvNeXt-Pico 提供标准网格归纳偏置以补充高频细节。为了以极低开销接纳多模态输入,ConvNeXt 分支配备了统一模态融合块(MFB):在单模态 RGB 场景下仅施加 \(1\times 1\) 投影;在双模态任务(RGB-D、RGB-T、VSOD)中嵌入单个 LFM 聚合辅助线索;在三模态 VDT 任务中则构建级联 LFM 架构逐步吸收深度与热辐射特征。该设计既保留了全频域感知优势,又避免了跨模态自注意力机制二次方显存开销的瓶颈。
2. 液态融合模块:基于连续动力学状态-刺激交互的特征聚合
传统简单的元素级加和、拼接或静态卷积无法动态适应不同空间位置上全局上下文与局部细节的需求权重。LFM 借鉴连续时间封闭形式神经网络(CfC)的衰减与门控思想,将 VMamba 特征视为系统演化的连续内部状态,而将 ConvNeXt 特征视为输入系统的瞬时外生刺激。首先,VMamba 状态经过 \(1\times 1\) 与 \(3\times 3\) 卷积形成平滑嵌入 \(\tilde{\mathbf{f}}_i^v\),并通过空间平均池化与最大池化生成通道注意力掩码,对 ConvNeXt 刺激特征进行自适应通道调制: $\(\tilde{\mathbf{f}}_i^c = \text{Conv}_{1\times 1}(\mathbf{f}_i^c) \odot \sigma\left(\mathcal{M}(\text{AvgP}(\tilde{\mathbf{f}}_i^v)) + \mathcal{M}(\text{MaxP}(\tilde{\mathbf{f}}_i^v))\right)\)$ 随后,通过拼接特征图学习出动态空间渗透率门控 \(\mathbf{G}_i = \sigma(\text{Conv}_{1\times 1}(\text{Conv}_{3\times 3}([\tilde{\mathbf{f}}_i^v, \tilde{\mathbf{f}}_i^c])))\)。最终融合特征由门控闭式动态平衡公式计算: $\(\mathbf{f}_i = \text{Conv}_{3\times 3}\left((1 - \mathbf{G}_i) \odot \tilde{\mathbf{f}}_i^v + \mathbf{G}_i \odot \tilde{\mathbf{f}}_i^c\right)\)$ 当 \(\mathbf{G}_i \to 1\) 时系统大幅吸收 ConvNeXt 的高频细节刺激;当 \(\mathbf{G}_i \to 0\) 时系统倾向于保持 VMamba 的长程演化语义状态,实现了真正的内容自适应异构融合。
3. 显著性引导上采样:频域-空间双分支协同的抗混叠恢复
解码器常用的双线性插值会造成高频频谱混叠失真,而简单的反卷积容易产生棋盘效应并丢失弱小目标的宏观轮廓。SGU 算子在将融合特征 \(\mathbf{f}_i\) 经 \(2\times\) 插值升采样为 \(\mathbf{f}'_i\) 后,设计了并行双分支结构:频域分支利用二维快速傅里叶变换将特征映射至复数频域空间,乘以可学习复数权重矩阵 \(\mathbf{w}_i\) 进行全频谱滤波与全局几何结构保护后执行逆傅里叶变换: $\(\mathbf{F}_i^{spec} = \text{IFFT}(\text{FFT}(\mathbf{f}'_i) \odot \mathbf{w}_i)\)$ 空间分支则通过堆叠的双层 \(3\times 3\) 卷积专注于抽取边缘与纹理高频残差。两个分支的特征拼接后经 \(3\times 3\) 卷积压缩,并与来自输入的 \(1\times 1\) 残差路径相加,从而在恢复高分辨率空间定位的同时严格抑制上采样高频畸变。
损失函数 / 训练策略¶
为保障多尺度特征自浅至深的表征判别力,LFNet 在解码器各尺度输出端采用深度监督。总损失函数 \(\mathcal{L}_{total}\) 由二值交叉熵损失(BCE)与交并比损失(IoU)联合构成: $\(\mathcal{L}_{total} = \sum_{k=1}^4 \left(\mathcal{L}_{bce}(\mathbf{O}_k, \mathbf{GT}) + \mathcal{L}_{iou}(\mathbf{O}_k, \mathbf{GT})\right)\)$ 其中 \(\mathbf{O}_k\) 代表第 \(k\) 级特征解码预测的显著性图,\(\mathbf{GT}\) 为真实标签。优化器选用 AdamW,初始学习率为 \(1\times 10^{-4}\),预训练骨干学习率设为其 \(5\%\) 以保护基础表征;采用 5 个 epoch 的线性预热及随后的余弦退火衰减,配合自动混合精度(AMP)与阈值为 0.5 的梯度裁剪确保训练稳定性。
实验关键数据¶
主实验¶
论文在五大通用 SOD 任务上均进行了全面评测。以下精选单模态 RGB SOD(表 1 节选)与三模态 VDT SOD(表 5 节选)对比数据:
| 任务 / 数据集 | 方法 | 类型 | 参数量 (M) | \(S_m \uparrow\) (%) | \(F_m \uparrow\) (%) | \(E_m \uparrow\) (%) |
|---|---|---|---|---|---|---|
| RGB SOD (DUTS) | ICON-S | Transformer | 94.30 | 91.7 | 91.1 | 96.0 |
| RGB SOD (DUTS) | VST-S++ | Transformer | 74.90 | 90.9 | 89.7 | 94.7 |
| RGB SOD (DUTS) | Samba | Mamba | 49.59 | 93.2 | 93.0 | 96.6 |
| RGB SOD (DUTS) | LFNet (本文) | Mamba+CNN 混合 | 43.23 | 93.6 | 93.6 | 97.0 |
| RGB SOD (DUT-O) | Samba | Mamba | 49.59 | 88.9 | 85.9 | 92.2 |
| RGB SOD (DUT-O) | LFNet (本文) | Mamba+CNN 混合 | 43.23 | 90.4 | 88.4 | 93.8 |
| VDT SOD (VDT-2048) | MFFNet | CNN | 103.24 | 93.6 | 90.1 | 99.0 |
| VDT SOD (VDT-2048) | DWFPR | CNN | - | 93.8 | 90.1 | 99.0 |
| VDT SOD (VDT-2048) | Samba | Mamba | 60.28 | 93.8 | 91.0 | 99.0 |
| VDT SOD (VDT-2048) | LFNet (本文) | Mamba+CNN 混合 | 46.07 | 94.2 | 91.9 | 99.2 |
消融实验¶
论文在 DUTS、DUT-O、NJUD、NLPR 及 VDT-2048 上对骨干架构、融合策略与上采样模块进行了详尽消融(表 6 节选):
| 设定类别 | 实验配置 | DUTS (\(S_m\) / \(F_m\)) | DUT-O (\(S_m\) / \(F_m\)) | VDT-2048 (\(S_m\) / \(F_m\)) | 说明 |
|---|---|---|---|---|---|
| 完整模型 | LFNet (Full) | 93.6 / 93.6 | 90.4 / 88.4 | 94.2 / 91.9 | 异构双流 + LFM + SGU |
| A: 骨干架构 | A1: 仅 VMamba 单流 | 92.0 / 91.7 | 89.5 / 87.1 | 91.4 / 87.4 | 缺少局部高频网格归纳偏置 |
| A2: 仅 ConvNeXt 单流 | 84.8 / 82.5 | 83.3 / 78.3 | 86.8 / 80.9 | 缺乏全局长程上下文,性能大幅下滑 | |
| A3: 朴素双流基线 | 92.5 / 92.2 | 89.8 / 87.5 | 93.0 / 90.5 | 简单结合但无动态交互机制 | |
| B: 融合策略 | B1: 加法融合 (替换 LFM) | 92.7 / 92.6 | 89.9 / 87.8 | 93.5 / 90.9 | 静态融合导致跨尺度频域混叠 |
| B2: 特征拼接 (替换 LFM) | 93.0 / 92.8 | 90.1 / 88.0 | 93.7 / 91.2 | 缺乏基于状态的自适应过滤 | |
| B3: 交叉注意力 (替换 LFM) | 93.2 / 93.1 | 90.2 / 88.1 | 94.0 / 91.6 | 计算开销大且全局语义平衡弱于 LFM | |
| C: 上采样策略 | C1: 双线性插值 (替换 SGU) | 92.9 / 92.8 | 89.8 / 87.7 | 93.2 / 90.9 | 频谱混叠严重导致细长边界模糊 |
| C2: 转置卷积 (替换 SGU) | 93.2 / 93.1 | 90.1 / 88.0 | 93.5 / 91.3 | 虽有局部学习能力但缺乏全局频域约束 |
关键发现¶
- 异构双流互补性显著:对比 A1 与 A2 可以看出,单纯使用轻量级 ConvNeXt 时性能极为贫弱(DUTS 上 \(S_m\) 仅 84.8%),但在加入 VMamba 形成双流后显著跃升至 92.5% 以上,充分验证了频域分析中 CNN 与 SSM 在频谱能量偏好上的互补假说。
- 动态液态门控超越传统注意力:在融合策略对比中,基于 LNN 演化动态的 LFM 全面击败了参数量更大的交叉注意力机制(B3),表明以时变动力学状态-刺激为视角的闭式解能更自然地在语义保真与边缘注入间取得平衡。
- 频域上采样的边界护航效果:去掉 SGU 改用传统双线性插值时,复杂场景下的 \(S_m\) 指标下降达 0.6% 至 1.0%,定性结果也表明 SGU 对多空隙结构(如椅腿、栏杆)的边界分离至关重要。
亮点与洞察¶
- 从频域能量偏置切入异构设计:不同于一味发明复杂扫描机制的纯 SSM 工作,作者从 2D FFT 能量谱切入,从机理上揭示了 CNN 与 SSM 的天然频段互补性,立论逻辑坚实。
- 将液态时间常数动力学巧妙空间化:将 LNN 的连续时间 ODE 闭式解重新诠释为空间维度上的全局状态(Memory)与外生刺激(Stimulus)博弈,构造了简洁高效且可优雅拓展至三模态的 LFM。
- 兼顾极端精度与极致轻量:在参数量仅为 Transformer 方案(如 ICON-S、CATNet)一半甚至三分之一的情况下,LFNet 在五类显著性任务上刷新了 SOTA,工程实践价值极高。
局限与展望¶
- 作者承认的局限:目前骨干网络依赖于离散的预训练模型组合,未在更大尺度的密集预测场景(如全景分割、自动驾驶复杂场景感知)中验证统一预训练权重的可行性。
- 思考发现的局限:虽然 LFM 的闭式解规避了数值求解 ODE 的时延,但双流骨干在移动端硬件部署时仍涉及两套不同的运算算子支持(Mamba 选择性扫描与深度可分离卷积),算子生态的异构性可能影响特定边缘加速器的推理效率。
- 未来改进方向:可尝试将该液态融合框架扩展为共享底层的单骨干频域可调网络,或将 SGU 的频空联合上采样设计迁移至图像超分辨率与去雾等低阶视觉密集预测任务中。
相关工作与启发¶
- vs Samba:Samba 是通用的纯 Mamba 显著性检测框架,试图以单一 SSM 模型统揽全局与局部,但在高频细节频段存在固有表征偏置;LFNet 引入 ConvNeXt 与液态状态-刺激动力学,参数量更低(RGB 任务 43.23M vs 49.59M)且精度全面胜出。
- vs VSCode / VST-S++:基于 Transformer 的代表性方案通过自注意力建立长程依赖,参数量大(74M+)且计算复杂度高;LFNet 利用状态空间与卷积互补,在保持线性计算效率的同时有效克服了边界细节平滑问题。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ (将液态神经网络状态-刺激动力学应用于空间异构特征融合,并结合频域分析,构思巧妙)
- 实验充分度: ⭐⭐⭐⭐⭐ (全面覆盖 RGB、RGB-D、RGB-T、VSOD、VDT 五大任务,评测与消融极其详尽扎实)
- 写作质量: ⭐⭐⭐⭐⭐ (从频域分析到方法论述推导严谨,图表完备,论据自洽)
- 价值: ⭐⭐⭐⭐☆ (为高效密集预测模型提供了一套兼顾高低频与多模态输入的通用混合范式,开源代码利于复现)