跳转至

E-MOTION: A Dataset for Event-Based Scene Flow Estimation with Independent Moving Objects

会议: ECCV 2026
论文: ECCV 原文
代码: https://emotion.hds.utc.fr/
领域: 语义分割
关键词: 事件相机 / 场景流估计 / 独立运动物体 / 稠密深度估计 / 动态数据集

一句话总结

E-MOTION 是首个基于真实高分辨率双目事件相机打造的大规模场景流基准数据集,提供在独立运动物体与手持相机复杂动态下的 200 Hz 亚毫米级稠密 3D 场景流、深度、光流及物体分割真值。

研究背景与动机

三维场景流(3D Scene Flow)描述了真实物理世界中所有可见表面点的瞬时笛卡尔运动矢量,是自主移动机器人导航、非刚体运动分析与动态人机交互的核心底层感知表征。相较于传统帧式相机受制于运动模糊与曝光受限、LiDAR 受制于低时序刷新率与点云稀疏性,事件相机(Event Camera)具备微秒级时间分辨率、高动态范围与超低时延等物理优势,理论上是高动态复杂场景流估计的最佳传感器选型。然而,事件相机在 3D 场景流领域的发展长期滞后,学术界在此方向的算法探索甚至寥寥可数。

这一滞后背后的核心瓶颈在于真实世界高质量场景流基准数据的极度匮乏。获取精确的 3D 场景流真值不仅需要高精度的传感器自身 6DoF 轨迹,更需要场景内所有几何表面以及所有独立运动物体(Independent Moving Objects, IMOs)在微秒时间尺度上的精确几何模型、运动位姿与瞬时速度。以往的主流事件相机数据集(如 MVSEC、DSEC、M3ED 等)为了降低数据生成复杂度,普遍强行假设场景绝对静态,仅利用 LiDAR 地图投射或单相机里程计生成深度与光流;一旦视野中出现行人、飞鸟或运行车辆等独立动态目标,由于忽略了物体的自主运动,真值映射便会出现致命的运动不连续性与投影伪影。现有仅有的两个包含 IMOs 的事件场景流数据集(EKubric 与 BlinkVision)皆为合成渲染数据集,难以反映真实事件传感器的模拟域噪声分布、非理想偏置特性以及剧烈运动带来的光电效应,严重限制了算法从仿真向真实世界的迁移。

为了填补这一关键空白,本文研制并开源了 E-MOTION 数据集。核心 idea:利用硬件硬同步的高分辨率立体事件相机(Prophesee EVK4)与 33 台动捕相机系统,结合场景毫米级激光扫描与前景刚体三维重建,通过时空联合全局优化与分层 Delaunay 三角剖分技术,构建了首个涵盖复杂独立运动物体与多种相机运动姿态的真实高分辨率 200 Hz 稠密 3D 场景流基准。

方法详解

整体框架

E-MOTION 数据集的生成管线旨在从多模态物理测量中解析出高时空一致性的连续物理真值。整个流水线接收四个数据输入:手持立体 EVK4 事件相机生成的原始双目事件流、Optitrack 高精光学动捕系统测量的刚体轨迹、FARO Focus3D 激光扫描仪获取的静态室内场景毫米级三维点云,以及四旋翼无人机与 YCB 交互物体的厘米/毫米级三维几何模型。数据处理流水线划分为硬件级时间同步与全链路空间标定、高保真几何重建与前景分层 Delaunay 稠密化、基于李代数微分的场景流与光流解析合成三大核心阶段,最终输出 200 Hz 频率下的稠密深度图、双向光流图、三维场景流矢量图、6DoF 物体位姿以及独立运动物体实例分割掩码。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["多模态源数据输入<br/>双目事件流 + Optitrack位姿 + FARO激光点云 + 物体3D模型"] --> B["硬件级时间同步与全链路空间标定<br/>eSync 2方波触发 + 准牛顿手眼联合优化"]
    B --> C["高保真几何重建与前景分层Delaunay稠密化<br/>背景底图补全 + 局部三角剖分 + 深度Z-buffering"]
    C --> D["基于李代数微分的场景流与光流解析合成<br/>20ms滑动滤波 + 40ms Lie twist解算 + 投影方程时间微分"]
    D --> E["高精度稠密基准输出<br/>200 Hz场景流 / 稠密深度 / 2D光流 / 6DoF位姿 / IMO分割掩码"]

关键设计

1. 硬件级时间同步与全链路空间标定:消解亚毫秒级时钟漂移与毫米级刚体坐标偏差

事件相机的数据流具有异步、连续的时序特性,微秒级的时钟偏差即可导致高速运动物体的反投影几何严重错位。为此,系统采用 Optitrack eSync 2 同步控制器输出周期方波方脉冲,动捕系统每次完成帧采样的边沿电平直接作为特殊外部硬件事件(Special Event)注入两台 EVK4 相机的数据包,利用硬件时间戳将动捕时钟与左右相机本地时钟实现绝对对齐。在空间坐标系方面,动捕系统测量的刚体原点位于相机支架(\(H\))和物体反光标记点外壳(\(I_i\)),与相机物理光心(\(L, R\))、静态场景原点(\(M\))以及物体网格模型中心(\(M_i\))存在未知的刚体外参变换。

为求解手眼外参 \(^{H}T_L\) 与相机内参 \(\theta_L\),研究团队利用高频图像重建算法从事件流中恢复灰度帧以检测 AprilGrid 标定板标定角点,通过最小化所有角点在左右相机上的重投影误差构建目标函数:

\[f(^{O}T_P, {}^{H}T_L, \theta_L) = \sum_{i=0}^{n-1} \|\pi(P_i(^{O}T_P, {}^{H}T_L), \theta_L) - p_i\|^2\]

式中 \(\pi(P, \theta)\) 表示将世界坐标点投影至含径向和切向畸变的相机像平面,\(^{O}T_P\) 为标定板在动捕全局系下的位姿。通过准牛顿算法(Quasi-Newton)对标定板位姿、手眼变换矩阵及相机内参进行全局迭代交替优化,成功将重投影误差直方图从初始分散的 6-8 像素压缩至 1 像素以内的极窄分布。对于场景模型外参 \(^{O}T_M\) 与物体外参 \(^{I_i}T_{M_i}\),则利用高分辨率点云中反向识别出的动捕红外相机与标记点精密物理点对,实现平均仅 1.1 cm 的高精度全局对齐。

2. 高保真几何重建与前景分层Delaunay稠密化:解决点云穿透与物体边界像素空隙

如果将环境整体激光点云与物体模型直接投影至像平面,由于点云离散采样密度在透视变换下的不均性,会导致两大严重伪影:一是前景物体边缘出现大量漏射穿透(Background Bleeding),背景深处的点穿过前景稀疏网格打到物体表面,引发深度不连续跳变;二是物体表面存在未被点覆盖的空隙像素。为根除该缺陷,E-MOTION 设计了分层渲染与局部网格化策略。

系统首先在三维场景中剔除所有前景物体(包含静态摆件与动态 IMOs),仅将静态背景点云投影至左相机视锥,对背景内部因射线发散产生的微小空隙,采用最邻近深度聚类进行背景底图稠密化补全。随后,针对每个前景物体单独执行空间坐标变换与局部视锥投影,获得稀疏前景点集;为了在完全贴合物体轮廓的前提下生成稠密表面,算法在投影点集上执行 2D Delaunay 三角剖分,设定几何阈值仅保留三边长度均小于 4 像素的高质量微三角形,并在三角形内部完成逐像素插值填充,从而精准生成无空隙的前景深度图与清晰的二值分割掩码(Segmentation Mask)。最后,将所有前景层按照各自深度叠加至背景底图,在发生遮挡重叠的像素处严格执行 \(Z_{\text{final}} = \min(Z_{\text{fg}}, Z_{\text{bg}})\) 的 Z-buffering 深度判别,彻底消除了边缘穿透效应。

3. 基于李代数微分的场景流与光流解析合成:滤除高频微分噪声并建立连续物理映射

场景流本质是三维点在相机坐标系下的绝对线速度矢量。直接对高采样率动捕位姿进行有限差分会导致高频数值噪声急剧放大,破坏速度矢量的平滑度。E-MOTION 引入分层微分机制:首先对 200 Hz 的 Optitrack 原始 6DoF 位姿采用 20 ms 滑动窗口执行均值滤波,消除标记点检测残差;接着在连续时间域上取 40 ms 时间窗,计算窗口起始位姿到结束位姿在 SE(3) 李代数上的相对李扭转(Lie twist),由李代数生成元直接提取出平滑且准确的瞬时 3D 线速度 \(v \in \mathbb{R}^3\) 与角速度 \(\omega \in \mathbb{R}^3\)。

基于刚体运动学,物体表面任意三维空间点 \(P = [X, Y, Z]^T\) 相对相机光心的瞬时相对速度即为该像素对应的三维场景流真值 \(\dot{P} = [\dot{X}, \dot{Y}, \dot{Z}]^T\)。随后,对针孔相机透视投影方程 \(p = [u, v]^T = \frac{1}{Z} K [X, Y, Z]^T\) 对时间 \(t\) 应用链式法则进行解析微分,推导出图像平面光流与三维空间场景流之间的刚性数学映射:

\[\begin{bmatrix} \dot{u} \\ \dot{v} \end{bmatrix} = \frac{1}{Z^2} K \begin{bmatrix} Z\dot{X} - X\dot{Z} \\ Z\dot{Y} - Y\dot{Z} \end{bmatrix}\]

式中 \(K\) 为相机内参矩阵。该公式不仅允许在去畸变校正像平面上输出标准二维光流图 \([\dot{u}, \dot{v}]^T\) 与轴向运动图(Axial Motion, \(\dot{Z}\)),而且在包含非线性畸变参数的原始图像坐标系下同样给出了完备的畸变修正光流,使得基于原始事件脉冲与基于重构图像的算法均能获得严谨可信的连续物理真值。

一个完整示例

以数据集最具代表性的复杂动态序列 drone_fast_1 为例:该场景中,操作者手持立体 EVK4 相机以最高 \(1.67\text{ m/s}\) 的平移线速度和 \(202^{\circ}/\text{s}\) 的高角速度进行剧烈晃动,同时一架 Parrot AR 2.0 Elite 四旋翼无人机在视野前景高速穿梭,形成复杂的双重相对运动与螺旋桨旋转。 1. 脉冲对齐与位姿平滑:eSync 2 在 200 Hz 采样时刻产生电平跳变,事件相机将其记录为带有时基戳 \(t_k\) 的特殊数据包;系统提取动捕在 \([t_k - 10\text{ms}, t_k + 10\text{ms}]\) 窗口内的位姿取平均,随后在 40 ms 窗口上求解李扭转,解算出此时相机线速度 \(v_C = [0.82, -0.45, 1.21]^T\text{ m/s}\) 与无人机线速度 \(v_D = [-1.10, 0.60, -0.30]^T\text{ m/s}\)。 2. 前景分离与 Delaunay 密化:剔除无人机后的静态背景网格投影到 \(1280 \times 720\) 画面,经邻近填充后构成完整背景深度底图;无人机网格单独投影至前景,形成约 15,000 个稀疏投影点,系统运行 2D Delaunay 剖分生成数万个边长 \(\le 4\text{ px}\) 的微小三角形并插值,生成无人机的高保真掩码与前景深度(平均深度 \(1.35\text{ m}\))。 3. 合成与场景流输出:在无人机所在区域,\(Z_D (1.35\text{ m}) < Z_{\text{bg}} (3.80\text{ m})\),Z-buffering 覆盖背景点,输出纯净的独立运动分割掩码;随后依据合成的相对速度场,逐像素计算三维场景流矢量,在无人机前部边缘解析出强烈的运动不连续性,并经微分投影矩阵转化为 \(1280 \times 720\) 的密集光流场与轴向运动场。

实验关键数据

主实验

下表系统展示了 E-MOTION 与当前领域内主流事件相机深度、光流、场景流及运动估计数据集的横向对比。对比维度涵盖传感器分辨率、立体双目配置、真实物理场景支持、独立运动物体(IMOs)有效真值建模、稠密真值生成能力以及场景流支持情况。

数据集 相机型号 分辨率 立体双目 真实数据 IMOs 支持 稠密真值 标注频率 [Hz] 记录时长 [min] 深度真值 光流真值 场景流真值
MVSEC [42] DAVIS 346 \(346 \times 260\) ✓ ✓ ✗ ✗ 20 43 ✓ ✓ ✗
DSEC [10] Prophesee Gen3 \(640 \times 480\) ✓ ✓ ✗ ✗ 20 53 ✓ ✓ ✗
SHEF [38] Prophesee Gen3 \(640 \times 480\) ✓ ✓ ✗ ✓ 125 23 ✓ ✗ ✗
VECtor [9] Prophesee Gen3 \(640 \times 480\) ✓ ✓ ✗ ✗ 120 21 ✓ ✗ ✗
EVIMO2 [2] DVS-Gen3 / Sam. \(640 \times 480\) ✓ ✓ ✓ ✓ 200 41 ✓ ✓ ✗
M3ED [4] Prophesee IMX636 \(1280 \times 720\) ✓ ✓ ✗ ✗ 10 203 ✓ ✓ ✗
CoSEC [29] Prophesee IMX636 \(1280 \times 720\) ✓ ✓ ✗ ✗ \(\le 20\) 60 ✓ ✓ ✗
EKubric [37] ESIM 仿真器 \(960 \times 540\) ✗ ✗ ✓ ✓ NA 15K 帧 ✓ ✓ ✓
BlinkVision [22] DVS-Voltmeter \(640 \times 480\) ✗ ✗ ✓ ✓ NA 15K 帧 ✓ ✓ ✓
E-MOTION (本文) Prophesee IMX636 \(1280 \times 720\) ✓ ✓ ✓ ✓ 200 42 ✓ ✓ ✓

消融与序列分析

E-MOTION 涵盖 43 个序列,分为无动态目标的纯静态场景(Scene)、四旋翼飞行器动态场景(Drones)以及手持 YCB 常见物体交互场景(YCB)。下表梳理了数据集中具有代表性的关键序列在相机动态、运动物体数量、事件发射规模以及极限线速度与角速度上的分布统计。

类别 序列名称 划分 IMOs 数量 持续时长 [s] 轨迹长度 [m] 事件总数 [百万] 线速度均值 / 最大 [m/s] 角速度均值 / 最大 [°/s] 动态特性与场景挑战
Scene transl_slow_1 训练 (TR) 0 100 10.57 25 0.11 / 0.27 3 / 21 缓速手持平移,光流平滑且事件率均匀
Scene transl_fast_1 训练 (TR) 0 31 19.93 82 0.90 / 2.09 20 / 962 高速大平移运动,剧烈动态与高事件率
Scene rot_fast_1 训练 (TR) 0 24 3.28 184 0.26 / 0.95 69 / 1140 纯旋转且峰值角速度超 \(1000^{\circ}/\text{s}\)
Scene rand_normal_1 测试 (TE) 0 77 20.65 71 0.30 / 0.78 26 / 2422 自由手持随机运动,多轴姿态复合变化
Drones drone_static 训练 (TR) 1 38 0.00 0.02 0.00 / 0.00 0 / 20 静止相机观测自由飞行无人机
Drones drone_slow_1 测试 (TE) 1 39 4.83 60 0.14 / 0.73 18 / 860 缓速运镜 + 单机飞行,验证基础分离
Drones drone_fast_1 测试 (TE) 1 40 17.43 202 0.64 / 1.67 73 / 1825 高速运镜 + 快速飞行,运动解耦极具挑战
Drones two_drones_1 测试 (TE) 2 73 14.34 67 0.23 / 0.79 22 / 1890 双无人机交替穿梭,频繁发生相互动态遮挡
YCB mustard_bottle 训练 (TR) 1 136 10.44 246 0.36 / 1.84 30 / 3304 钓鱼线手持黄芥末瓶,含非刚性随机晃动
YCB mult_2 测试 (TE) 2 60 17.28 105 0.35 / 1.46 19 / 1199 多物体复合交互运动,测试集严苛基准

为了进一步探究现有事件视觉代表性算法在面对 E-MOTION 复杂动态场景时的实际表现,论文在典型序列上评测了顶级多时序立体深度算法 MCEMVS 与基于对比度最大化(Contrast Maximization)的光流算法,揭示出传统算法在处理独立运动物体时的固有缺陷:

评估算法 评测任务 慢速运动序列表现 (drone_slow_1) 快速运动序列表现 (drone_fast_1) IMOs 目标区域表现 (无人机/YCB) 算法失效根因分析
MCEMVS [12] 双目立体深度估计 静态背景区域深度估计优良,点云稠密 快速运动下有效深度估计点急剧减少 目标深度完全丢失(空洞),无法重建 强依赖静态环境假设,动态物体引发的非极线事件被判定为离群噪点
对比度最大化 [32] 密集二维光流估计 静态背景光流矢量方向与相机自运动吻合 剧烈非刚体运动下事件堆叠模糊,光流噪化 运动物体边界产生严重速度发散与方向误判 单一时间切片内自运动与独立目标运动复合,单一速度补偿模型无法对齐双重运动

关键发现

  • 独立运动物体的系统性缺位破坏了现有 SOTA 算法:正如基准测试所证实,当前无论基于几何优化的双目深度方法(如 MCEMVS)还是基于对比度最大化的光流算法,其核心假设均建立在“全画幅事件流仅由相机自运动产生”的刚性静态场景前提上。当无人机飞入视野时,因其自主速度破坏了极线几何或全局运动补偿,算法直接将真实物体事件剔除或计算出严重失真的速度矢量。
  • 动态难度的阶梯性分布为模型训练与评测提供完整梯度:从缓速平移(线速度 \(<0.3\text{ m/s}\))到极速随机运动(角速度峰值突破 \(2000^{\circ}/\text{s}\)、线速度超 \(2\text{ m/s}\)),事件生成速率和运动离散度跨越多个数量级,充分暴露了现有模型在极低时延与高速退化场景下的鲁棒性边界。
  • 200 Hz 高帧率稠密标注揭示了传统离散差分的局限:在微秒级事件流下,若直接使用原始动捕位姿做数值差分,速度噪声将显著淹没物理流场;而李代数微分配合 20ms 滑动窗口平均,能够稳定恢复出物理连续且高信噪比的 3D 场景流矢量。

亮点与洞察

  • 首创真实高分辨率立体事件场景流基准:打破了过去事件场景流仅能在合成本地模拟器(EKubric / BlinkVision)中探索的局限,首次在 \(1280 \times 720\) 的真实 Sony IMX636 工业级芯片上落地,为解决 Sim-to-Real 泛化瓶颈提供了不可替代的物理事实参考。
  • 精妙的分层 Delaunay 几何遮挡处理:点云反投影中的背景穿透与离散空隙是学术界的长期痛点;论文没有依赖粗暴的双边滤波或高斯平滑,而是利用前景/背景解耦投影结合微小三角形拓扑约束,以纯几何方式生成锐利的深度边缘和像素级完美的 IMO 分割图。
  • 可复用的李代数微分与流场解析投影工具链:论文公开了由动捕刚体位姿经 SE(3) 李群扭转平滑微分求解 3D 速度矢量,并进一步投影至含畸变像平面的完整数学推导与代码,为后续多模态自动驾驶与机器人视觉数据集制作提供了标准范式。

局限与展望

  • YCB 物体悬挂线带来的伴生视觉干扰:为了实现自由空间 6DoF 悬垂运动,YCB 物体采用透明钓鱼线由人工手持牵引,部分强光照射视角下钓鱼线反光会产生少量偶发杂散事件,且在个别极端运动序列中边缘隐约可见人工手部干扰。
  • 缺少机载 IMU 真实物理量测:双目相机硬件平台上未集成高频硬件 IMU,虽然作者提供了基于动捕高精位姿加权高斯噪声合成虚拟 IMU 数据的脚本,但对于依赖真实传感器偏置漂移(Bias Drift)和温漂噪声的紧耦合 VIO/SLAM 研究仍存在微小仿真差异。
  • 未来改进方向:可进一步引入机械臂受控驱动或微型固定磁悬浮装置实现物体完全自主操控,并在传感器硬件支架上原生集成高精工业级 IMU 模块;同时结合更丰富的户外与自然光照变化,拓展至更复杂的全场景环境。

相关工作与启发

  • vs DSEC [10] & M3ED [4]: DSEC 和 M3ED 分别聚焦于车载与多机器人平台,虽然也具备高分辨率立体事件相机,但其深度与光流真值均基于静态地图点云投射,遇到路面行人和动态车辆时真值必然失效;E-MOTION 专注于攻克独立运动物体(IMOs)与高帧率场景流,真值完全覆盖动态物体。
  • vs EVIMO2 [2]: EVIMO2 是早期探索事件相机独立运动物体分割与位姿跟踪的杰作,但其传感器局限于老旧的 \(640 \times 480\) 分辨率,且未提供三维场景流(3D Scene Flow)的完整物理速度真值定义;E-MOTION 升级至百万像素 IMX636,并补全了从 3D 笛卡尔速度到 2D 像平面光流的完整场景流表征。
  • vs BlinkVision [22]: BlinkVision 借助 Blender 与仿真器构建了包含丰富动态与场景流的虚拟基准,但在真实世界的电路物理噪声、暗电流、时间抖动与反光材质响应上无法替代真实物理传感器;E-MOTION 是其通向物理落地不可或缺的真实验证场。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次打破真实双目事件相机场景流与独立运动物体高精基准的空白,硬件与标定方案设计极具开拓性。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 43 个序列、42 分钟丰富多动态工况,提供 200 Hz 完备的深度、光流、场景流及掩码数据,并开展了详实的基线失效分析。
  • 写作质量: ⭐⭐⭐⭐⭐ 全文数学推导严谨自洽,硬件标定与分层几何重建细节阐述清晰明了。
  • 价值: ⭐⭐⭐⭐⭐ 为事件相机 3D 视觉、高速场景流解算与具身动态交互感知提供了关键的基础设施级支撑。