Intra-Class Consistency Guided Class-Agnostic Event Segmentation¶
会议: ECCV 2026
论文: ECCV 原文
代码: 待开源
领域: 语义分割
关键词: 事件相机, 类别无关分割, 类内一致性, 知识蒸馏, SAM 迁移
一句话总结¶
针对事件流空间稀疏性导致的类内一致性匮乏问题,提出 IC2-ESeg 框架,通过物理生成机理无学习地显式挖掘噪声、运动与亮度表征,并借助分阶段轻量注入与跨模态蒸馏将 SAM 的开集通用分割能力迁移至事件相机。
研究背景与动机¶
类别无关分割(Class-Agnostic Segmentation)旨在摆脱对预定义封闭类别标签的依赖,仅根据视觉实体的通用“物体性”(Objectness)定位并分割任意前景物体与背景 Stuff。随着以 Segment Anything Model(SAM)为代表的视觉基础模型崛起,基于海量真实图像与提示工程的开集零样本分割取得了突破性进展。然而,传统可见光相机在高速运动模糊、极端低光或高动态光照场景下易发生信息严重退化。事件相机凭借微秒级时间分辨率、极高动态范围与超低延迟特性,为极端视觉条件下的稳健感知带来了新契机。
然而,将开集类别无关分割拓展至事件模态面临着严峻的模态鸿沟。现有方法如 EventSAM 虽尝试将 SAM 的知识迁移至事件域,但往往仅在特征层面做浅层适配,忽略了输入层面的本质差异。RGB 图像具有稠密的色彩与纹理支撑,同一物体内部自然呈现高度的类内一致性;而事件相机仅异步记录像素对数亮度的相对变化,产生的数据高度空间稀疏且边缘化,物体内部出现大量信息真空,导致严重的类内一致性缺失,在密集分割时极易引起前景与背景黏连混淆或边缘细节破碎。
针对事件数据缺乏类内一致性的根本症结,本文的切入点是从事件传感器的底层物理生成机制中逆向挖掘场景内在的连贯物理属性。散粒噪声事件频次定量反映了背景绝对光强,时空聚类蕴含了光流运动场,而二者的耦合关系又决定了边界亮度梯度的方向与幅度。核心 idea:基于事件物理生成机理以无学习方式显式构建噪声、运动与亮度三大类内一致性表征,并通过残差连接与视觉 Prompt 适配器分阶段注入图像编码器,结合跨模态特征蒸馏与伪标签监督实现高精度类别无关事件分割。
方法详解¶
整体框架¶
IC2-ESeg 框架由三大协同模块构成:无学习的类内一致性挖掘模块(Intra-Class Consistency Mining, ICM)、轻量级信息注入模块(Lightweight Information Injection, LIJ)以及基于教师-学生范式的跨模态蒸馏模块(Cross-Modal Distillation, CMD)。系统输入为离散化为 3 个时间 bin 的事件体素网格(Voxel Grid),ICM 模块从中解析出噪声、运动与亮度表征;LIJ 模块采用分阶段策略将连续亮度残差融合并以视觉 Prompt 挂载至 Transformer 层;CMD 模块由冻结的 SAM ViT-H 教师模型指导学生网络完成特征与分割掩码对齐。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
In["异步原始事件流<br/>Event Stream"] --> ICM["无学习类内一致性挖掘<br/>构建噪声/运动/亮度表征"]
In --> Voxel["事件体素化<br/>Voxel Grid (3 bins)"]
ICM --> LIJ["轻量级分阶段信息注入<br/>残差相加 + Visual Prompt"]
Voxel --> LIJ
LIJ --> Student["学生网络 Image Encoder<br/>微调 FFN + 挂载 Adapter"]
Teacher["冻结教师模型<br/>SAM ViT-H (RGB 输入)"] -->|特征对齐 Lsim| Student
Teacher -->|离线伪标签监督 Lseg| Decoder["Mask Decoder<br/>两阶段微调解码"]
Student --> Decoder
Decoder --> Out["密集类别无关分割掩码<br/>Class-Agnostic Masks"]
关键设计¶
1. 无学习类内一致性挖掘:物理机理驱动的三维场景属性反演
针对事件数据空间稀疏导致物体内部缺乏统计连贯性的痛点,ICM 模块完全脱离沉重且易产生伪影的循环神经网络(如 E2VID),纯粹依靠物理生成先验以无学习方式并行构建三类互补表征: - 噪声表征(Noise Representation):光子散粒噪声在事件流中表现为时空孤立点。利用 KD-Tree 快速检测时空局部邻域 \(\mathcal{N}(e_k)\) 内事件数低于阈值 \(N_{\min}\) 的孤立噪声。根据高斯光子散粒模型,光照强度越低、触发单位相对变化所需的随机光子扰动相对越显著,事件触发概率与局部绝对强度成反比。通过误差函数理论公式分别估计正负极性光强并取均值,得到环境底色强度图。 - 运动表征(Motion Representation):运动物体内部各点具有时空连续的刚体或非刚体速度场。基于活跃事件表面(Surface of Active Events, SAE)理论,事件触发时间梯度倒数直接正比于局部运动速度 \((v_x, v_y)\)。采用多尺度时空邻域窗口进行自适应局部平面拟合,构建多尺度融合的稀疏运动矢量场。 - 亮度表征(Brightness Representation):根据一阶亮度守恒假设,事件触发率(事件密度 \(E\))等于亮度梯度与运动速度的内积:\(E = -\nabla L \cdot \mathbf{v}\)。利用前面已求得的运动场 \(\mathbf{v}\) 与两极性事件计数 \(E\),反解出空间各向异性的边界对比度梯度 \(\nabla L\);随后通过泊松表面重建(Poisson Reconstruction)求解泊松方程,仅凭单个切片事件即可直接生成平滑且反差真实的稠密场景亮度图。
2. 轻量级分阶段信息注入:异构物理属性与预训练编码器的解耦融合
若将噪声、运动、亮度和事件体素直接在通道维度简单拼接(Channel Concatenation),由于异构物理信号统计分布跨度大,易干扰预训练权重的特征提取。LIJ 模块设计了分阶段混合注入机制: - 对于与自然图像最贴近的稠密空间亮度表征 \(x_b\),采用轻量残差卷积结构(\(3 \to 16 \to 3\) 通道扩展压缩),将其残差直接累加到基础事件体素 \(x_v\) 上: $\(y = x_v + \mathcal{F}(x_b; \Theta)\)$ - 对于运动表征 \(x_m\) 与噪声表征 \(x_n\),通过降采样卷积压缩特征维度至 \(C/s\) 后与 Patch Embedding 进行特征级加和:\(F_i = F_{\text{pe}} + F_m + F_n\)。随后送入包含两层 MLP 与 GELU 非线性激活的轻量级 Adapter 适配器生成多层共享的视觉提示向量 \(P_i\): $\(P_i = \text{MLP}_{\text{up}}(\text{GELU}(\text{MLP}_{\text{tune}}^i(F_i)))\)$ 最后将提示向量注入 SAM 编码器的每一个 Transformer Block 中。全套模块仅引入 76.7K 参数(+0.08%)和 13.2% 推理计算开销,保证高效率与灵活性。
3. 跨模态教师-学生蒸馏:保持通用物体性认知的渐进微调策略
为了将 SAM 学习自 11 亿掩码(SA-1B)的大规模通用“物体性”与拓扑几何先验平滑迁移到事件域,CMD 模块构建了非对称蒸馏体系。教师网络采用强大的 ViT-H 架构在配对图像上离线生成高质量边界伪标签;学生网络基于轻量高效的 ViT-B 架构。在微调策略上,学生编码器仅放开 Patch Embedding 层以适应事件输入,并仅微调每个 Transformer Block 的前馈网络(FFN),其余多头自注意力权重完全冻结以防止灾难性遗忘。Prompt 编码器保持冻结;Mask Decoder 则采取两阶段策略(前 2 个 epoch 彻底冻结,后续阶段以 \(2 \times 10^{-7}\) 超低学习率微调)。
损失函数 / 训练策略¶
总训练损失结合特征级关键对齐与掩码级密集监督: $\(\mathcal{L} = \mathcal{L}_{\text{sim}} + \alpha \mathcal{L}_{\text{seg}}\)$ 其中平衡因子设为 \(\alpha = 0.1\)。特征相似度损失 \(\mathcal{L}_{\text{sim}}\) 采用相关性感知加权损失,强力对齐跨模态的关键 Token 嵌入;分割掩码损失 \(\mathcal{L}_{\text{seg}}\) 沿用 SAM 的 Focal Loss 与 Dice Loss 线性加权(比例 20:1)。训练时从伪标签实例掩码中随机抽取 8 个正点作为 Prompt 输入,采用 Adam 优化器在 2 张 RTX 3090 上训练 10 个 epoch,初始学习率分别为图像编码器 \(2 \times 10^{-4}\)、LIJ 模块 \(1 \times 10^{-4}\)。
实验关键数据¶
主实验¶
在代表性类别无关分割基准 RGBE-SEG(包含 VisEvent 与 COESOT 转换的 65,957 对样本)上,本文方法与传统重建后分割、无监督域自适应及跨模态蒸馏 SOTA 方法进行了系统对比。在最核心的全局平均交并比(mIoU)与面积加权交并比(aIoU)上均创下最优记录。
| 方法 | 模态 / 输入模式 | Easy (mIoU/aIoU) | Medium (mIoU/aIoU) | Hard (mIoU/aIoU) | All (mIoU) | All (aIoU) | All (mP) | All (mR) |
|---|---|---|---|---|---|---|---|---|
| SAM (RGB baseline) | RGB 自动模式 | 0.39 / 0.58 | 0.25 / 0.41 | 0.15 / 0.29 | 0.26 | 0.43 | 0.39 | 0.73 |
| E2VID + SAM | 事件重建灰度 | 0.38 / 0.54 | 0.32 / 0.44 | 0.26 / 0.36 | 0.32 | 0.45 | 0.54 | 0.61 |
| ETNet + SAM | 事件视频重建 | 0.40 / 0.51 | 0.35 / 0.42 | 0.31 / 0.35 | 0.35 | 0.42 | 0.63 | 0.53 |
| DTL (Dual Transfer) | 事件特征迁移 | 0.40 / 0.59 | 0.28 / 0.46 | 0.20 / 0.35 | 0.29 | 0.46 | 0.44 | 0.71 |
| ESS (UDA) | 事件域自适应 | 0.40 / 0.57 | 0.27 / 0.45 | 0.18 / 0.32 | 0.28 | 0.45 | 0.42 | 0.74 |
| EventSAM (CVPR 2024) | 事件自动模式 | 0.49 / 0.65 | 0.40 / 0.54 | 0.34 / 0.47 | 0.41 | 0.55 | 0.59 | 0.71 |
| IC2-ESeg (本文) | 事件自动模式 | 0.51 / 0.67 | 0.43 / 0.57 | 0.36 / 0.49 | 0.43 | 0.57 | 0.56 | 0.77 |
| EventSAM* (CVPR 2024) | 事件 Prompt 模式 | 0.56 / 0.73 | 0.49 / 0.60 | 0.43 / 0.53 | 0.49 | 0.61 | 0.57 | 0.83 |
| IC2-ESeg* (本文) | 事件 Prompt 模式 | 0.67 / 0.74 | 0.65 / 0.71 | 0.63 / 0.69 | 0.65 | 0.71 | 0.83 | 0.77 |
在跨场景与跨分辨率零样本迁移评测中,针对自动驾驶三维感知的 MVSEC(346×260)及作者自研的高分辨率(964×696,FLIR+EVK4)ComScene 数据集进行验证: - 在 MVSEC 数据集上,纯点提示下 mIoU 相比 EventSAM 提升 28.0%(从 0.50 升至 0.64),aIoU 提升 13.6%(从 0.625 升至 0.71); - 在 ComScene 的生活、办公、体育、交通四大场景下,纯点提示平均 mIoU 达到 0.56,相比 EventSAM 的 0.38 取得了 48.0% 的巨大飞跃。
消融实验¶
在 RGBE-SEG 数据集的 Prompt 模式下对各设计组件进行逐项剔除消融,量化各模块的作用:
| 配置 | 核心改动 | mIoU | aIoU | 性能影响 |
|---|---|---|---|---|
| Full Model | 完整 IC2-ESeg 模型 | 0.65 | 0.70 | 基准配置 |
| w/o Brightness Repr. | 剔除泊松重构亮度表征 | 0.55 | 0.63 | 剧烈掉点 -0.10 mIoU(绝对核心) |
| w/o Motion Repr. | 剔除多尺度 SAE 运动表征 | 0.61 | 0.65 | 显著掉点 -0.04 mIoU |
| w/o Noise Repr. | 剔除散粒噪声光强表征 | 0.64 | 0.68 | 掉点 -0.01 mIoU(辅助补充) |
| w/o Residual Conn. | 亮度表征改为通道拼接 | 0.62 | 0.68 | 掉点 -0.03 mIoU(结构解耦重要) |
| w/o Visual Prompts | 剔除轻量 Adapter Prompt | 0.61 | 0.66 | 掉点 -0.04 mIoU |
| w/o \(\mathcal{L}_{\text{sim}}\) | 仅用伪标签损失 \(\mathcal{L}_{\text{seg}}\) | 0.57 | 0.60 | 掉点 -0.08 mIoU(特征对齐缺失) |
| w/o \(\mathcal{L}_{\text{seg}}\) | 仅用特征对齐损失 \(\mathcal{L}_{\text{sim}}\) | 0.48 | 0.59 | 掉点 -0.17 mIoU(缺乏边界细节) |
在类内紧凑度量化验证中,以平均余弦相似度(mCS)与平均特征方差(mFV)度量: - RGB 原图特征:mCS 为 0.85,mFV 为 0.12; - 事件 Baseline 特征:mCS 为 0.77,mFV 为 0.18; - 加入 ICM 后的事件特征:mCS 提升至 0.80(+3.9%),mFV 降至 0.16(-11.1%),直接证实了类内一致性的显式增强。
关键发现¶
- 亮度表征决定性能下限:消融显示去除亮度表征会导致 mIoU 暴跌 10 个百分点,是挽救空间信息真空、连通实体边缘的最关键推手。
- 噪声表征的环境敏感性:细分场景分析表明,噪声表征在慢速运动(mIoU 0.612 \(\to\) 0.636)和强光照(0.621 \(\to\) 0.639)场景下收益最为明显,因为慢速时有效边缘事件极少,散粒噪声提供的底色信息成为关键线索。
- 编码器泛化通用性:将骨干网络替换为 DINOv2 和 MAE 时,分别取得 0.64 与 0.67 的 mIoU,证明 ICM 与 LIJ 机制对通用视觉大模型编码器均具备高度可移植性。
亮点与洞察¶
- 将“传感器噪声”转化为有效感知线索:传统事件视觉算法将微弱的时空离散事件视作有害噪点直接过滤,本文巧妙发现散粒噪声频率与绝对光强度的物理函数映射关系,实现了无学习的“以噪测光”。
- 单切片无学习物理反演超越循环网络:摒弃了耗时且存在冷启动延迟的端到端神经视频重建网络(如 E2VID),仅基于 SAE 局部拟合与泊松方程求解便能在 24.3ms 内完成稠密梯度积分,兼顾高保真度与实时性。
- 参数高效的跨模态认知注入:仅微调 FFN 并引入 0.08%(76.7K)的新增参数,即可将 SAM 在密集静态图像上积累的强大学习认知零样本泛化至动态事件模态。
局限与展望¶
- 物理前处理模块的计算延迟:ICM 虽然无需神经网络前向传播,但时空近邻 KD-Tree 检索与泊松表面重建仍需消耗约 24.3 ms,在微秒级事件流场景下仍存在优化空间。
- 纯前馈分段推理缺乏时间记忆:当前模型采用离散时间切片进行前馈预测,无法跨时间帧沉淀时序时空记忆;未来可考虑引入时序递归或轻量状态空间模型(SSM/Mamba)增强多帧连贯性。
相关工作与启发¶
- vs EventSAM (CVPR 2024):EventSAM 是首个探索类别无关事件分割的方法,但它只在深层特征做 pivotal token 对齐,对输入端事件流的空洞稀疏性无能为力;本文在输入层通过 ICM 显式重建物理先验,全指标取得 4.9%(自动)至 32.7%(Prompt)的断代式超越。
- vs E2VID / ETNet 重建派:重建法需长序列预热、计算昂贵且伴随伪影;本文单切片 Poisson 重构速度快且不依赖海量图像重建对训练。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 巧妙利用散粒噪声物理机制估计光强,摆脱对黑盒重建模型的依赖,思路极具启发性。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖自动与交互式提示模式、全维度消融、类内一致性量化及自建高分辨率 ComScene 验证。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑推导严密清晰,动机直击事件模态核心瓶颈。
- 价值: ⭐⭐⭐⭐⭐ 为事件相机结合视觉基础模型开拓了物理驱动与参数高效适配的高可行性范式。