EDM:Event-guided Diffusion Model for Video Shadow Detection in Complex Dynamic Scenes¶
会议: ECCV 2026
论文: ECCV 原文
代码: 待开源
领域: 视频理解
关键词: 视频阴影检测、事件相机、扩散模型、运动轨迹注意力、双模态引导
一句话总结¶
首次将事件相机引入视频阴影检测任务,提出基于事件流运动轨迹注意力与双向掩码生成的扩散模型 EDM,并构建真实多模态基准 EVSD,有效破解高速运动与极端光照下的阴影漏检与边界模糊难题。
研究背景与动机¶
视频阴影检测(Video Shadow Detection, VSD)是计算机视觉中场景理解的关键基础任务。阴影不仅蕴含场景的几何结构、深度与光源方向等三维线索,在下游应用中也常常带来严重的视觉歧义。在自动驾驶与移动机器人感知中,车辆投射在路面上的动态阴影极易被语义分割或目标检测模块误判为实体障碍物,导致误刹车或轨迹规划失误;在视频目标跟踪中,目标与伴随阴影的黏连也会干扰边界定位。因此,在复杂多变的动态环境中精准分割视频阴影,具有重要的实用价值。
然而,现有视频阴影检测方法主要面向光照稳定且运动缓慢的常规场景,当面对高速动态运动或剧烈光照交替时,性能会出现断崖式下跌。常规基于帧的 RGB 相机受限于固定的曝光时间与较窄的动态范围,在高速运动下必然产生严重的运动模糊,使得阴影的本影与半影边界模糊不清;在强逆光、低照度或过曝环境下,像素动态范围受限导致暗部细节丢失,模型极易将暗色物体纹理与真实阴影混淆。虽然事件相机具备微秒级时间分辨率、超高动态范围(>120 dB)且无运动模糊,理论上是捕获快速阴影形变与突变光照边缘的绝佳补充模态,但事件流本质上由异步二值脉冲构成,完全缺乏颜色与绝对纹理信息。直接将稀疏无序的原始事件与 RGB 特征简单拼接不仅难以带来稳定增益,甚至可能破坏图像主干的语义表征。
如何从连续事件流中提取高质量的时空运动线索,并在生成式去噪过程中建立细粒度、双模态的时间连续约束,成为跨模态视频阴影检测的核心挑战。核心 idea:利用事件流的高时间分辨率直接提取像素级运动位移场并构建跨帧轨迹注意力,结合双向时序掩码插值生成密集先验,通过双模态时序引导模块注入扩散模型的连续去噪过程,实现动态复杂场景下的鲁棒阴影分割。
方法详解¶
整体框架¶
EDM 的整体架构划分为两个核心阶段:粗粒度初级掩码预测阶段(Stage 1)与细粒度扩散去噪预测阶段(Stage 2)。在第一阶段中,模型以连续 \(2i+1\) 帧 RGB 图像以及相邻帧间的 \(2i\) 段事件体素作为输入,通过轻量运动编码器提取事件位移场,利用运动轨迹注意力模块(MTA)沿运动轨迹聚合跨帧视觉特征,输出初步 RGB 阴影掩码;随后利用双向掩码生成模块(BMG)在相邻帧间插入中间状态掩码,构建时间分辨率翻倍的密集时序掩码序列。在第二阶段中,事件流通过事件单次积分(ESI)重构为光强图并生成事件初级掩码,双模态时序引导模块(DMTG)整合 RGB 帧、密集 RGB 掩码以及事件掩码,将其作为条件嵌入注入扩散去噪模型;扩散模型采用模拟比特(Analog Bits)策略将离散二值掩码转化为连续表征,经少量步数去噪直接生成最终的精准阴影掩码。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["多帧 RGB 图像 + 帧间事件流"] --> B["运动轨迹注意力 (MTA)<br/>轻量卷积预测位移场并沿轨迹聚合跨帧特征"]
B --> C["初级 RGB 阴影掩码预测"]
C --> D["双向掩码生成 (BMG)<br/>双向循环预测插值生成帧间密集掩码序列"]
D --> E["双模态时序引导 (DMTG)<br/>融合 ESI 重构事件掩码与密集 RGB 掩码"]
E --> F["扩散去噪掩码预测<br/>Analog Bits 连续化表征 + DDIM 迭代逆扩散"]
F --> G["最终视频阴影二值掩码"]
关键设计¶
1. 运动轨迹注意力(MTA):基于事件位移场的显式跨帧轨迹聚合
常规光流算法严重依赖灰度不变性假设,在阴影运动、光线骤变与运动模糊区域计算极不稳定。为此,MTA 避开高开销的稠密光流估计,直接利用事件流内蕴的局部亮度瞬态变化。模块采用包含 5 层步长为 2 的 \(3\times3\) 卷积块构成的轻量 MotionEncoder 提取事件位移特征,并通过多层感知机(MLP)直接回归像素级的二维位移场:
在得到相邻帧位移场后,MTA 在 RGB 特征图上执行 patch 级别的轨迹跟踪。以第一帧位置 \((x_0, y_0)\) 为起点,利用位移场迭代递推各后续帧中的对应坐标 \((x_{t+1}, y_{t+1}) = (x_t + \Delta x_t(x_t, y_t),\, y_t + \Delta y_t(x_t, y_t))\),从而在整段视频剪辑内抽取各空间块的运动演化轨迹 \(\tau_{x_0, y_0}\)。随后,模块收集同一轨迹上的全部 patch 嵌入向量,通过多头自注意力机制进行信息聚合。查询向量 \(z(x_k, y_k)\) 仅与同轨迹上其余时刻的特征向量计算注意力权重,不引入额外位置编码,迫使网络精准追踪剧烈形变阴影的时空对应关系。
2. 双向掩码生成(BMG):事件驱动的帧间高帧率掩码插值与误差消除
在扩散去噪阶段,相邻帧的先验掩码序列为模型提供了关键的时序边界约束。然而在高速运动下,常规视频相邻帧间位移跨度过大,断裂的时序先验不仅无法引导去噪,反倒容易引入伪影。BMG 模块利用事件相机微秒级的异步触发特性,提取帧间半步时刻的事件流 \(E_{T+k+1/2}\),并在其驱动下估计帧间过渡掩码。
为保证主模型训练的稳定性和收敛效率,BMG 采用轻量循环架构 ECOSNet,仅在当前训练集上独立预训练后冻结参数,用于纯时序插值而不增加反向传播梯度。由于单向 LSTM 循环推断在长序列或剧烈运动下易出现累积漂移误差,BMG 引入了前后双向对称推断机制:分别从首帧正向递推与尾帧逆向回溯生成两组中间掩码,并采用随时间步线性衰减的权重张量进行融合:
融合后的中间掩码与原始初级掩码交错拼合,形成时间采样密度翻倍的序列 \(\{M_{T+k}\}_{k=-i}^i \cup \{M_{T+k+1/2}\}_{k=-i}^{i-1}\),为扩散模型提供高度平滑、细粒度的连续时序先验。
3. 双模态时序引导(DMTG):事件光强重构与多模态先验联合注入
原始事件点云过于离散稀疏,直接以体素栅格(Voxel Grid)或时间表面(Time Surface)形式作为扩散条件时,容易引入高频噪声并干扰扩散骨干的收敛。DMTG 采用事件单次积分法(ESI)将局部时间窗内的事件流直接重构成高质量的绝对光强图像序列 \(E'_{T+k}\),在剔除随机噪点的同时完整保留事件相机的超宽动态范围与锐利边界。
重构后的光强图被送入轻量 ResNet 编码器,在二值交叉熵监督下预测事件模态的初级掩码序列 \(\{M'_{T+k}\}_{k=-i}^i\)。DMTG 将 RGB 密集初级掩码、事件初级掩码以及原始 RGB 图像序列进行通道拼接与特征投影,形成兼顾外观颜色、锐利轮廓与亚帧运动位移的统一双模态条件嵌入 \(g\),全程引导逆扩散去噪轨迹。
4. 扩散去噪掩码预测:模拟比特(Analog Bits)与快速掩码解码
传统扩散模型大多基于庞大的 U-Net 预测连续高斯噪声,在像素级分割任务中存在显存开销大、采样耗时长的缺陷。EDM 采用直接预测目标掩码的紧凑扩散范式,引入模拟比特(Analog Bits)技术将离散二值标签 \(y \in \{0, 1\}\) 映射到连续实数空间,前向扩散过程按照预定余弦噪声调度逐步添加高斯扰动生成隐变量 \(z_t\):
在逆向去噪过程中,网络 \(p_\theta(z_{t-1} \mid z_t, x, g)\) 综合输入图像 \(x\) 与 DMTG 提供的双模态条件嵌入 \(g\),逐步滤除噪声并重建干净潜变量 \(z_0\)。推理阶段采用 DDIM 采样策略,仅需 15 步去噪即可完成高分辨率阴影二值掩码的快速精准生成。
损失函数 / 训练策略¶
模型采用多任务联合优化方案。对于扩散模型输出的最终阴影掩码 \(\hat{y}\),采用二值交叉熵损失(BCE)与 Lovász-Hinge 损失联合监督,平衡类别不平衡并优化交并比指标;同时,对第一阶段中 RGB 预测头生成的初级掩码 \(\hat{r}\) 以及 ESI 分支生成的事件初级掩码 \(\hat{e}\) 施加辅助二值交叉熵监督。总损失函数定义为:
实验中权重固定设为 \(\lambda_1 = \lambda_2 = 0.5\)。RGB 特征提取骨干采用 MixTransformer-B3,优化器使用 AdamW,初始学习率为 \(1 \times 10^{-5}\),批大小为 2。输入包含 3 帧连续 RGB 图像与对应的帧间事件累积流,输入尺寸统一缩放至 \(512 \times 512\)。模型在 8 张 NVIDIA A6000 GPU 上联合训练 18 个 epoch。
实验关键数据¶
主实验¶
论文在所构建的真实双模态基准 EVSD 以及合成基准 Event-ViSha 上,与图像阴影检测(ISD)、视频目标分割(VOS)、RGB-事件语义分割(ERSS)及视频阴影检测(VSD)四大类别的 16 种先进方法进行了全面定量对比。
| 数据集 | 任务类型 | 代表方法 | MAE ↓ | \(F_\beta\) ↑ | IoU ↑ | BER ↓ |
|---|---|---|---|---|---|---|
| Event-ViSha | ISD | SDDNet (ACM MM'23) | 0.040 | 0.754 | 0.548 | 14.05 |
| Event-ViSha | VOS | SAM 3 (2025) | 0.031 | 0.799 | 0.632 | 13.47 |
| Event-ViSha | ERSS | CMNeXt (CVPR'23) | 0.043 | 0.773 | 0.623 | 9.87 |
| Event-ViSha | VSD | TVSD (CVPR'21) | 0.033 | 0.757 | 0.567 | 17.70 |
| Event-ViSha | VSD | Scotch&SODA (2023) | 0.029 | 0.793 | 0.640 | 9.07 |
| Event-ViSha | VSD | TBGDiff (ACM MM'24) | 0.023 | 0.797 | 0.667 | 8.58 |
| Event-ViSha | VSD | DTTNet (2025) | 0.016 | 0.849 | 0.718 | 6.45 |
| Event-ViSha | 本文 | EDM (Ours) | 0.015 | 0.861 | 0.739 | 5.76 |
| EVSD (真实场景) | ISD | SDDNet (ACM MM'23) | 0.076 | 0.638 | 0.522 | 17.78 |
| EVSD (真实场景) | VOS | SAM 3 (2025) | 0.046 | 0.661 | 0.594 | 14.97 |
| EVSD (真实场景) | ERSS | CMNeXt (CVPR'23) | 0.043 | 0.673 | 0.625 | 13.78 |
| EVSD (真实场景) | VSD | TVSD (CVPR'21) | 0.076 | 0.658 | 0.584 | 18.97 |
| EVSD (真实场景) | VSD | Scotch&SODA (2023) | 0.073 | 0.625 | 0.586 | 18.05 |
| EVSD (真实场景) | VSD | TBGDiff (ACM MM'24) | 0.054 | 0.644 | 0.612 | 16.13 |
| EVSD (真实场景) | VSD | DAS (TCSVT'24) | 0.066 | 0.673 | 0.601 | 15.99 |
| EVSD (真实场景) | 本文 | EDM (Ours) | 0.035 | 0.724 | 0.664 | 11.05 |
在真实复杂场景 EVSD 上,EDM 相较于此前在 EVSD 上最优的视频阴影检测基线 DAS,IoU 实现了绝对提升 6.3%(0.664 vs 0.601),平衡错误率 BER 显著下降了 4.94(11.05 vs 15.99),同时大幅领先纯 RGB 扩散模型基线 TBGDiff。
消融实验¶
论文通过系统性消融验证了核心组件、运动场抽取方式、patch 大小以及事件表征对最终阴影分割性能的贡献。
1. 核心模块有效性消融(表 3):
| 配置 | MTA | BMG | DMTG | Event-ViSha IoU ↑ | Event-ViSha BER ↓ | EVSD IoU ↑ | EVSD BER ↓ | 说明 |
|---|---|---|---|---|---|---|---|---|
| Baseline | × | × | × | 0.605 | 11.74 | 0.563 | 19.12 | 纯静态去噪基线 |
| EDM w/o MTA | × | ✓ | ✓ | 0.692 | 7.35 | 0.633 | 13.21 | 移除轨迹注意力,BER 上升 2.16 |
| EDM w/o BMG | ✓ | × | ✓ | 0.706 | 6.64 | 0.645 | 11.98 | 移除帧间密集插值掩码 |
| EDM w/o DMTG | ✓ | ✓ | × | 0.663 | 8.72 | 0.602 | 15.64 | 移除双模态融合时序条件 |
| EDM w/o event | - | - | - | 0.621 | 9.88 | 0.585 | 17.32 | 完全剔除事件流信号 |
| EDM (完整模型) | ✓ | ✓ | ✓ | 0.739 | 5.76 | 0.664 | 11.05 | 各项指标最优 |
2. 运动场估计与事件表征消融(表 4、表 6 与表 7):
| 实验组 | 策略选项 | EVSD MAE ↓ | EVSD \(F_\beta\) ↑ | EVSD IoU ↑ | EVSD BER ↓ | 核心结论 |
|---|---|---|---|---|---|---|
| 运动场抽取方式 | RGB-based RAFT | 0.048 | 0.689 | 0.615 | 13.97 | 传统光流在阴影与过曝处计算失真 |
| 运动场抽取方式 | Event-based E-RAFT | 0.047 | 0.712 | 0.632 | 12.86 | 事件光流精度较好但计算笨重 |
| 运动场抽取方式 | Event-based Motion (Ours) | 0.035 | 0.724 | 0.664 | 11.05 | 轻量卷积直出位移场效率与精度兼备 |
| BMG 预测方向 | 单向递归 (Unidirectional) | 0.046 | 0.707 | 0.643 | 11.47 | 单向长程递推引入累积误差 |
| BMG 预测方向 | 双向加权融合 (Bidirectional) | 0.035 | 0.724 | 0.664 | 11.05 | 双向时序对称平滑消除误差累积 |
| 事件先验表征 | w/o Event Mask | 0.064 | 0.596 | 0.618 | 14.69 | 缺乏事件独立先验导致暗部边界退化 |
| 事件先验表征 | Voxel-based Mask | 0.057 | 0.632 | 0.582 | 17.94 | 体素网格引入离散噪声干扰 |
| 事件先验表征 | TimeSurface-based Mask | 0.035 | 0.693 | 0.652 | 13.24 | 时间表面丢失绝对强度线索 |
| 事件先验表征 | ESI-based Mask (Ours) | 0.035 | 0.724 | 0.664 | 11.05 | 光强重构保留完整动态范围与锐利边界 |
关键发现¶
- 复杂工况优势显著:分场景评估显示,在高速运动子集中,EDM 的 IoU 达到 0.647(相比 DAS 的 0.532 领先 11.5%),在低照度子集达到 0.682(相比 DAS 的 0.573 领先 10.9%),充分证明事件相机高动态范围与抗运动模糊特性对解决极端动态阴影的关键价值。
- 模块贡献度排序:消融显示 DMTG 对真实场景 EVSD 影响最大(移除后 IoU 从 0.664 骤降至 0.602,BER 恶化 4.59),表明多模态时序引导直接决定了扩散去噪的稳定性;MTA 带来的轨迹特征追踪则对高速形变起到核心保底作用。
- Patch 尺寸权衡:MTA 块大小实验表明,32×32 窗口在量化误差与局部运动平滑性之间取得最佳平衡(Event-ViSha 上 BER 为 5.76,优于 16×16 的 6.89 和 64×64 的 6.23)。
亮点与洞察¶
- 模态互补的针对性设计:将事件相机的微秒级脉冲转化为连续时序位移场(MTA)与亚帧密集掩码(BMG),用事件的时空连续性弥补 RGB 的运动模糊与帧率不足,再以 RGB 语义特征弥补事件无纹理色彩的缺陷。
- 免光流假设的运动轨迹建模:传统光流在光照变化与阴影覆盖处天然失效,MTA 避开耗时的外部光流网络,通过 5 层轻量卷积直接从事件切片中提取位移场,速度更快且在非刚性阴影形变下更鲁棒。
- 模拟比特与生成去噪结合:采用 Analog Bits 将离散语义分割形式化为连续扩散去噪问题,摆脱庞大 U-Net 与超长采样链,以 15 步 DDIM 逆扩散实现高精度边界细化。
局限与展望¶
- 硬件依赖与跨传感器泛化:方法依赖事件相机与标准 RGB 相机的精密硬件时间同步与空间对准,在缺少事件硬件的现有存量视频监控与车载视频流中无法直接运行。
- 极慢运动下的事件静默挑战:事件相机依赖相对运动引发的亮度对数变化触发脉冲。在相机与物体均保持静止的极端静态阴影场景中,事件信号将趋于完全静默,此时模型对静态微弱阴影的辨识收益受限。
- 未来方向:探索无需硬件成对同步的半监督跨模态知识蒸馏,将事件流指导下的强时序感知能力蒸馏迁移至纯 RGB 视频模型中。
相关工作与启发¶
- vs TBGDiff (ACM MM'24): TBGDiff 虽首次将扩散模型引入视频阴影检测,但仅依赖纯 RGB 帧间注意力与边缘图先验,在剧烈运动模糊和极端逆光过曝时因输入退化而频繁崩溃;EDM 引入事件流硬件级物理先验,从输入层根本消除模糊阻碍。
- vs DAS (TCSVT'24) & SAM 3: 基础大模型在静态分割上泛化出色,但在视频动态连贯性与半影微弱过渡区识别上缺乏时序物理连续性约束;EDM 证明了轻量多模态融合网络在特定时空物理任务上依然具备不可替代的精度与效率优势。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ [首次将事件相机引入视频阴影检测任务,设计了贴合事件物理特性的位移场轨迹注意力与扩散去噪框架]
- 实验充分度: ⭐⭐⭐⭐⭐ [自建真实事件基准 EVSD 并拓展 Event-ViSha,横跨四大领域 16 种先进 baseline 对比,消融分析极其详实]
- 写作质量: ⭐⭐⭐⭐⭐ [篇章逻辑严密,方法推导清晰完整,图表详实规范]
- 价值: ⭐⭐⭐⭐⭐ [为智能驾驶与无人系统在极端光照和高动态环境下的阴影抑制与鲁棒感知提供了全新技术路径]