跳转至

Cooking beyond Frames: A Stereo Event Camera Dataset in the Kitchen

会议: ECCV 2026
论文: ECCV 2026
代码: https://chengmingf.github.io/EventKitchen.github.io/
领域: 自动驾驶
关键词: 事件相机、双目立体视觉、第一人称视角、动作识别、立体深度估计

一句话总结

本文构建了首个大规模真实世界第一人称双目事件相机厨房日常活动基准数据集 EventKitchen,提供 5.5 小时多模态同步记录、超万条动作片段与目标框标注以及稠密立体深度真值,系统评测了动作识别、目标检测与立体深度估计三大任务。

研究背景与动机

事件相机(神经形态相机)凭借微秒级超高时间分辨率、极高动态范围(HDR)与低功耗特性,在应对剧烈运动模糊和极端光照突变方面展现出显著优势。然而,现有事件视觉研究与基准数据集严重偏向自动驾驶(如 1Mpx、GEN1、DSEC)与无人机竞速场景,以人为中心(human-centric)的日常生活场景长期处于极度匮乏的状态。这种应用失衡严重制约了神经形态感知算法向具身机器人、室内人机协作及可穿戴智能设备的迁移与泛化。

现有少数事件动作数据集存在显著局限性。一方面,早期数据集多采用预设脚本在受限实验室内采集,动作机械单一,且多采用固定静态视角,背景缺少因观察者运动产生的丰富事件流;另一方面,部分研究依赖事件模拟器(如 ESIM 生成的 N-EPIC-Kitchens)或通过事件相机翻拍显示屏(如 UCF-Crime-DVS),但受限于源 RGB 视频帧率、显示器刷新率及色域动态范围,存在显著的 Sim-to-Real 鸿沟与传感器物理噪声失真。真实室内烹饪场景高度动态,伴随快速手眼协调、严重的手物遮挡、微小餐具交互以及复杂的空间深度变化,亟需一个原生、真实且多任务兼容的大规模立体基准。

针对真实日常活动中传感器穿戴负荷、非脚本自然行为捕获以及高噪事件流真值标定困难等壁垒,本文设计了一套多传感器头戴采集系统,并在 13 处多样化真实厨房中完成了多参与者、完全无脚本的烹饪交互记录。核心 idea:构建首个大规模、真实世界第一人称双目事件相机多模态基准 EventKitchen,结合跨模态点云反投影流水线提供高质量动作、检测与立体深度标注,为非自动驾驶领域的神经形态具身感知提供极具挑战性的多任务评测基准。

方法详解

整体框架

EventKitchen 数据集围绕“多模态硬件同步采集”、“多传感器联合标定与几何对齐”、“跨模态点云反投影真值生成”以及“跨厨房环境泛化基准划分”构建了一整套严密的流程规范。系统以穿戴式头盔集成双路高清事件相机、双路 CMOS 彩色相机与深度传感器,通过 ROS 时间戳统一对齐底层事件与帧数据,再经由 3D 几何映射将 RGB 域的高置信度人工标注无损反投影至双目事件坐标系,最终支撑起三大下游感知任务。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["头戴多模态传感系统<br/>双目事件 + 双目RGB + 深度/IMU"] --> B["多传感器联合标定与时间同步<br/>E2Calib重建 + ROS统一时间戳"]
    B --> C["跨模态3D几何反投影流水线<br/>D-RGB真值向双目事件域平滑对齐"]
    C --> D["跨厨房评测协议划分<br/>9训练厨 vs 4测试厨完全隔离"]
    D --> E["多任务基准评测<br/>动作识别 / 目标检测 / 立体深度估计"]

关键设计

1. 多模态头戴式同步采集与多传感器标定系统:突破真实厨房近身交互的数据捕获瓶颈

针对室内具身烹饪场景对大视场、双手运动与深度感知的综合要求,研究团队研制了基于轻量头盔的便携穿戴设备。硬件载荷包含两台 Prophesee Gen4 高清事件相机(分辨率 \(1280 \times 720\))构成双目立体基线,两侧紧邻两台 CMOS RGB 相机(30 fps)形成双目彩色对照,上方安置一台 Intel RealSense 深度相机(输出 D-RGB 图像与 16-bit 深度图,15 fps)及内置 6 轴 IMU(200 fps)。全传感器经由 USB 3.0 连接至背包笔记本电脑,依托 ROS 框架由系统纳秒级硬件与软件时间戳实现严格时序对齐。在标定层面,针对事件相机无法直接运行传统棋盘格角点检测的固有难题,采用 E2Calib 将动态事件流先逆向重构为灰度帧,再利用 OpenCV 标准标定算法解算各相机内参;随后以深度相机为全局参考系解算外参矩阵,并最终将左事件相机设定为立体双目与深度测量的基准坐标系,将全系统内参及外参重投影误差严格控制在 2 个像素以内。

2. 跨模态跨视场 3D 点云反投影与立体校正流水线:解决事件相机高噪低辨识度下的真值标注难题

事件相机输出稀疏离散的异步脉冲流,直接在事件极性图上手工圈定物体边界或微小动作起始极易受噪声干扰和边缘缺失影响。为此,本文设计了基于高置信度 RGB-D 域引导的 3D 反投影标注管线。在目标检测层面,标注人员首先在 D-RGB 彩色帧中以每 4 秒 1 帧的采样率标定餐具类目标(涵盖碗、刀、砧板、铲子等 12 类刚性厨房器具);随后利用 D-RGB 与深度图的像素级对齐关系,将二维标注框内的像素反解为相机三维点云坐标,再借助内外参刚体变换矩阵投影至左、右事件相机成像平面;针对投影引入的多边形形变,算法沿宽度方向对 y 轴坐标平滑均值化、沿高度方向对 x 轴平滑均值化,剔除超出事件相机视场(FoV)的无效框,生成了 13,482 个亚像素级对齐的双目事件检测框。在深度真值层面,考虑到 RealSense 与 Prophesee 相机的视场差异,算法先将原始深度点云投射至左事件相机的视场内,再与双目事件系统进行立体极线校正(rectification),生成 297,457 张高质量对齐的稠密立体深度真值图。

3. 非脚本化自然长序列与厨房级跨环境评测划分:逼近真实世界长尾交互的泛化挑战

为了完全摆脱实验室预设脚本(scripted actions)带来的机械感,EventKitchen 邀请了 10 位不同国籍、性别与年龄的志愿者,在 8 处私人厨房与 5 处公共厨房中自主选择烹饪任务(如切面包、煎蛋、做沙拉、洗碗等 13 种常见活动),期间不给予任何动作序列指令或操作限制。平均每段序列时长达 180 秒,充分保留了人类日常活动中自然的停顿、犹豫、动作反复和长尾交互模式,标注出包含 32 个动作动词、268 个细粒度动作类别的 10,762 个动作片段。在评测协议上,数据集摒弃随机抽帧或片段划分,采取严格的“厨房环境隔离划分”(Kitchen-level split):将 9 个厨房(82 个序列,占比约 80%)分配为训练集,将完全独立的 4 个厨房(28 个序列,占比约 20%)保留为测试集。该协议切断了背景纹理、厨房台面布局与光照的泄露渠道,对算法在未知环境下的视觉泛化能力提出了严苛考验。

损失函数 / 训练策略

针对动作识别、目标检测与立体深度估计三大任务,基准模型采用了统一的双目事件融合表征,将左右两路事件流在时间窗口内积算累加后作为网络输入: - 动作识别:采用在 Kinetics-400 上预训练的 TSM(ResNet-50 骨干)与 Video Swin Transformer(Swin-Base 骨干),在筛选出的 69 个高频动作类别(测试集样本数 \(\ge 5\))及对应的 18 个动词类别上通过标准交叉熵损失 \(\mathcal{L}_{cls} = - \sum_{k} y_k \log \hat{y}_k\) 进行微调。 - 目标检测:评测了基于帧的 YOLOv10-x(COCO 预训练)与专为事件设计的 RVT-Base 及 EvRT-DETR-B(1Mpx 数据集预训练),采用多任务检测损失函数 \(\mathcal{L}_{det} = \lambda_{cls} \mathcal{L}_{cls} + \lambda_{box} \mathcal{L}_{box} + \lambda_{dfl} \mathcal{L}_{dfl}\) 进行端到端优化。 - 立体深度估计:采用基于“按事件数量堆叠”(Stacking by Number, SBN)表征的 SE-CFF 模型从零训练,在有效深度截断范围 \([200\,\text{mm}, 1500\,\text{mm}]\) 内使用平滑 \(L_1\) 损失监督预测视差图;同时对比了基于 E2VID 重构灰度图像的零样本 FoundationStereo 基准。

实验关键数据

主实验

在严格隔离的测试集厨房环境下,主流动作识别与目标检测算法在 EventKitchen 上的主评测结果如下表所示。多模型较低的绝对精度充分印证了第一人称自然事件视觉的难度。

任务 模型 骨干网络 / 预训练源 关键指标 (Top-1 / AP) 次要指标 (Top-5 / AP50) 宽松指标 (AP05)
动作分类 (\(C_{69}^{a}\)) TSM ResNet-50 (Kinetics-400) 19.23% 42.26% —
动作分类 (\(C_{69}^{a}\)) Video Swin Swin-Base (Kinetics-400) 24.69% 56.48% —
动词识别 (\(C_{18}^{v}\)) TSM ResNet-50 (Kinetics-400) 38.17% 87.20% —
动词识别 (\(C_{18}^{v}\)) Video Swin Swin-Base (Kinetics-400) 46.08% 90.67% —
目标检测 (12类) YOLOv10-x YOLOv10-x (COCO) 16.2% 29.9% 38.1%
目标检测 (12类) RVT-Base RVT-B (1Mpx) 7.6% 16.1% 22.7%
目标检测 (12类) EvRT-DETR RT-DETR-B (1Mpx) 8.5% 16.7% 22.7%

消融实验

针对事件双目立体深度估计任务,对比了不同事件堆叠容量、采样频率配置下的 SE-CFF 与零样本立体匹配大模型 FoundationStereo;下表同时给出了测试集真值深度的固有离散度参考。

方法 / 算法配置 堆叠容量与采样率 输入模态 RMSE (mm) ↓ MAE (mm) ↓ 相对真值 STD 状态
SE-CFF 5M @ 3Hz 纯事件 (Event-only) 88.19 59.32 低于真值 STD (有效)
SE-CFF 5M @ 1Hz 纯事件 (Event-only) 88.21 57.38 低于真值 STD (有效)
SE-CFF 15M @ 1Hz 纯事件 (Event-only) 84.91 54.84 最优误差收敛
FoundationStereo 零样本测试 E2VID 重构灰度图 155.06 123.85 高于真值 STD (失效)
Ground Truth 参考 — RealSense 原始真值 STD: 106.26 MAD: 82.00 基准分布方差

此外,在细粒度类别性能分析中,不同目标类别的检测难度分化极其剧烈: - 大尺寸、放置平稳的器皿检测表现相对较好:平底锅(Pan)在 YOLOv10 下达到 36.5% AP,砧板(Chopping board)达到 32.2% AP,碗(Bowl)达到 26.0% AP。 - 小尺寸、手持交互频繁且运动剧烈的餐具几近崩溃:叉子(Fork)的 AP 仅为 1.1%(RVT 和 EvRT-DETR 为 0.0%),勺子(Spoon)的 AP 仅为 1.0%(RVT 为 0.1%,EvRT-DETR 为 0.2%)。

关键发现

  • 大分辨率下事件累积量比采样率更关键:在立体深度估计中,将事件堆叠上限由 5M 提升至 15M(同为 1Hz),RMSE 从 88.21 mm 明显下降至 84.91 mm;而改变采样频率(1Hz vs 3Hz)影响极其微弱(88.21 mm vs 88.19 mm)。这表明高分辨率事件相机在静态或慢速背景下的空间纹理覆盖率高度依赖累积脉冲总量。
  • 自动驾驶专属事件检测模型在具身场景遭遇负迁移:在 1Mpx 自动驾驶数据集上分别达到 47.4% 和 50.1% 高 AP 的 RVT 与 EvRT-DETR,迁移到 EventKitchen 后 AP 暴跌至 7.6% 与 8.5%,甚至落后于通用的图像检测器 YOLOv10-x(16.2% AP)。其根源在于自动驾驶数据多为大物体、刚性匀速运动,而第一人称厨房充斥着手部非刚性遮挡、小目标高频旋转及剧烈自发性晃动。
  • 重构再识别范式受制于跨模态域差距:FoundationStereo 依赖 E2VID 重构图像进行零样本立体匹配,其 MAE 高达 123.85 mm,远超真值固有的绝对平均偏差(MAD 82.00 mm)。重构图像引入的伪影和边缘退化严重破坏了立体匹配基线的极线一致性,证实了从原生神经形态脉冲流端到端学习立体视差的必要性。

亮点与洞察

  • 多模态刚体几何反投影标注策略:设计了一套通过“RGB 标定 \(\rightarrow\) 3D 点云变换 \(\rightarrow\) 事件平面投影与平滑”的标注流水线。这一方案绕开了直接在稀疏高噪事件流上标注边界的认知障碍,以极高几何精度实现了跨传感器、跨模态真值传递。
  • 首个非脚本化真实厨房事件全景图谱:彻底打破了以往事件动作数据集依赖单调实验室脚本的范式,通过头戴式无干预记录捕捉到诸如“倒牛奶”、“搅拌麦片”等极其细腻真实的双手操作,其动词频次分布(前两位同为 Put、Take)高度契合 EPIC-KITCHENS,证明了数据的原生真实性。
  • 揭示了神经形态感知向具身室内泛化的严峻鸿沟:实验直接证实了在室外车载场景行之有效的事件特征提取器在面对小物体、手物交叠及长尾行为时泛化能力骤降,为后续具身智能、触觉/事件手眼系统开辟了关键基准。

局限与展望

  • 作者承认的局限:作为真实世界无脚本采集的数据集,动作类别与目标类别存在显著的长尾分布不平衡;此外受限于高质量人工逐帧复核的极高成本,目前目标检测框标注总量为 1.3 万余个,相较于车载自动驾驶领域的千万级规模仍有扩充空间。
  • 深入观察的局限:目前目标检测类别仅覆盖了 12 种刚性厨房用具,刻意排除了在烹饪过程中形态剧烈变化的可变食材(如蔬菜、肉类、液体等);然而食材状态转换(如切片、加热变色、融化)恰恰是具身烹饪理解的核心要素。
  • 未来改进方向:可进一步融合手部三维位姿(3D Hand Pose)估计真值,将双目事件感知与人手网格(MANO)跟踪结合;同时探索大语言/多模态模型驱动的开放词表事件目标定位与弱监督食材状态识别。

相关工作与启发

  • vs N-EPIC-Kitchens / UCF-Crime-DVS: 后两者依赖仿真合成(ESIM)或翻拍屏幕,存在严重的物理噪声失真与刷新率天花板;EventKitchen 采用真实 Prophesee Gen4 双目事件相机在原生厨房物理环境中直接记录,保留了高动态范围与真实微秒级异步脉冲特性。
  • vs HARDVS / DailyDVS-200 / THUMV-EACT-50: 现有真实事件动作数据集普遍采用静态第三方视角或严格的实验室动作脚本,动作种类机械;EventKitchen 是首个第一人称(egocentric)、非脚本化(unscripted)、双目立体配置且多任务支持的真实生活基准。
  • vs DSEC / 1Mpx: DSEC 与 1Mpx 牢牢占据自动驾驶与大尺度车载感知生态;EventKitchen 则将高分辨率双目事件相机的研究阵地拓展至近身人机交互、厨房具身操作与室内三维重构,填补了神经形态智能在具身家庭服务领域的空白。

评分

  • 新颖性: ⭐⭐⭐⭐⭐(首个第一人称、非脚本化、多任务双目事件相机真实厨房基准)
  • 实验充分度: ⭐⭐⭐⭐⭐(横跨动作、目标检测与立体深度三大任务,涵盖 7 种主流基线模型深度剖析)
  • 写作质量: ⭐⭐⭐⭐⭐(系统设计详实,硬件标定、几何反投影流水线与任务评测定义高度严谨清晰)
  • 价值: ⭐⭐⭐⭐⭐(为神经形态视觉从自动驾驶迈向具身机器人与日常生活交互提供了极具分量的基石数据集)