遇见数据集

EventKitchen

收藏
arXiv2026-08-05 更新2026-08-07 收录
官方服务:

资源简介:

EventKitchen是一个由代尔夫特理工大学和意法半导体联合创建的大规模立体事件相机基准数据集,聚焦于厨房场景下的自然人机活动。数据集包含5.5小时立体事件记录,同步RGB、深度和IMU多模态数据,并提供10,762个动作片段与13,482个边界框的精细标注。数据采集自10名参与者在13个不同厨房中无脚本指导的自然烹饪行为,确保真实性与多样性。该数据集旨在突破现有事件相机数据集在自动驾驶领域的局限,为动作识别、目标检测和立体深度估计等任务提供具有挑战性的评测基准。

EventKitchen is a large-scale stereo event camera benchmark dataset jointly created by Delft University of Technology and STMicroelectronics, focusing on natural human-machine activities in kitchen scenarios. The dataset contains 5.5 hours of stereo event recordings, paired with synchronized multi-modal data including RGB, depth and IMU, and provides fine-grained annotations for 10,762 action segments and 13,482 bounding boxes. The data was collected from unscripted natural cooking behaviors of 10 participants across 13 distinct kitchens, ensuring the authenticity and diversity of the samples. This dataset is designed to break through the limitations of existing event camera datasets in the autonomous driving field, serving as a challenging evaluation benchmark for tasks such as action recognition, object detection and stereo depth estimation.

创建时间:
2026-08-05
原始信息汇总

EventKitchen 数据集详情

一、数据集简介

EventKitchen 是一个大规模立体事件相机基准数据集,聚焦于人类在厨房中的烹饪活动。该数据集由代尔夫特理工大学(Delft University of Technology)与意法半导体(STMicroelectronics)的研究团队共同构建,相关论文已被 ECCV 2026(Spotlight)接收。

二、采集设备与数据构成

  • 传感器配置
    • 一对 Prophesee Gen4 立体事件相机
    • 一对 CMOS 立体相机
    • RealSense D435i/D455 深度相机
  • 数据模态与时长
    • 5.5 小时同步立体事件记录
    • 30 fps 立体 RGB 视频
    • 15 fps 深度相机 RGB 视频
    • 15 fps 16 位深度视频
    • 200 fps IMU 数据

三、数据采集场景与特点

  • 采集方式:由 10 名参与者在 13 个不同的厨房中佩戴集成多种传感器的头盔,进行自然的烹饪活动,全程无脚本化动作。
  • 核心特性
    • 以自我为中心(egocentric)视角采集
    • 覆盖真实、自然的人类日常活动,而非人为编排的行为

四、标注信息

  • 动作分割标注:10,762 个动作片段
  • 目标检测标注:13,482 个边界框

五、支持任务与基准

EventKitchen 支持以下基于事件的任务,并提供了基线模型训练结果:

  • 动作识别
  • 目标检测
  • 立体深度估计

该数据集为超越自动驾驶场景的神经形态视觉研究建立了具有挑战性的基准。

六、获取方式

数据集可通过 arXiv、4TU.ResearchData 以及官方工具包(Toolkit)获取。

搜集汇总
数据集介绍
EventKitchen 数据集图片
构建方式
事件相机因其高时间分辨率和低功耗在计算机视觉领域备受关注,但现有数据集多集中于自动驾驶,针对人类日常生活场景的构建仍显匮乏。为此,EventKitchen数据集采用穿戴式头盔,集成双Prophesee Gen4事件相机、双CMOS RGB相机、Intel RealSense深度相机及IMU,在13个风格迥异的厨房环境中,招募10位参与者进行无脚本烹饪活动,共采集5.5小时立体事件流,同步记录RGB、深度和IMU数据。通过E2Calib与OpenCV完成传感器标定,利用ROS实现硬件同步,确保多模态数据的时间一致性。
特点
EventKitchen具有以下显著特点:基于真实世界、自我中心视角,通过无指导的自然行为捕捉,最大程度还原人类活动的真实性与多样性;提供立体事件数据及多模态同步信息,为三维感知提供可靠基准;包含10,762个动作片段和13,482个边界框的人工精细标注,覆盖268个动作类别和12种厨房常见物体;此外,数据采集跨越私人与公共厨房,涵盖不同年龄、性别和国籍的参与者,呈现丰富的场景与动作差异,挑战现有模型的泛化能力。
使用方法
EventKitchen支持事件基础的多项任务,包括动作识别、物体检测和立体深度估计。研究者可依据提供的校准矩阵与标注,将RGB帧上的注释投影至事件域,或直接使用深度图进行监督。数据集采用按厨房划分的训练/测试集,测试厨房完全未在训练中出现,以评估模型的环境泛化性能。该数据集及其工具包公开可获取,便于进行基线对比与算法开发,为神经形态视觉在日常生活场景中的研究提供坚实平台。
背景与挑战
背景概述
事件相机(event cameras)作为一种神经形态视觉传感器,凭借其高时间分辨率、高动态范围与低功耗特性,在自动驾驶与无人机领域取得了显著进展。然而,以人为中心的日常活动场景在神经形态视觉研究中仍处于相对空白的状态,现有的事件基人类活动数据集大多基于脚本动作或固定视角采集,难以捕捉真实世界中人行为的自然性与复杂性。为弥合这一鸿沟,代尔夫特理工大学的研究团队于2026年推出了EventKitchen数据集,该数据集通过可穿戴头盔搭载立体事件相机、RGB相机、深度相机及惯性测量单元,在13个多样化厨房环境中采集了10名参与者共5.5小时的无脚本烹饪活动数据,并提供了10,762个动作分段与13,482个边界框的人工标注。EventKitchen作为首个大规模、真实世界、自我中心视角的立体事件相机基准数据集,为事件基动作识别、目标检测与立体深度估计等多任务研究提供了全新平台,显著推动了神经形态视觉向人类日常场景的拓展。
当前挑战
EventKitchen所面临的挑战体现在两个层面:就领域问题而言,事件相机在自动驾驶场景中已形成成熟的数据基准,但人类日常活动的非脚本性、环境多样性及高度动态性对现有模型提出了严苛考验。厨房场景中物体种类繁多、动作细致快速,且背景事件丰富,导致动作识别与目标检测的准确率显著低于传统数据集(如YOLOv10的AP仅16.2%),而立体深度估计则面临近场深度变化剧烈、遮挡频繁的难题。就数据集构建而言,事件相机的异步输出特性使得传统标定方法失效,需借助E2Calib等重建技术;多传感器同步与穿戴设备设计需兼顾舒适性与数据质量;此外,在事件域直接标注难以实现,必须通过RGB帧标注后投影至事件相机,这一过程涉及复杂的3D坐标变换与视场裁剪,且需严格控制标定重投影误差,所有过程的精度与一致性都是构建该数据集的重要挑战。
常用场景
经典使用场景
EventKitchen作为首个大规模、真实世界、立体事件相机人体活动数据集,其最经典的使用场景是支持事件相机领域中的多任务基准测试。该数据集通过可穿戴头盔式设备,在13个真实厨房环境中采集了10名参与者自然烹饪时的立体事件流,并同步提供RGB、深度和IMU数据,辅以10,762段动作标注和13,482个边界框。这一设计使研究者能够在统一框架下评估和比较事件相机在动作识别、目标检测和立体深度估计等核心任务上的性能,填补了该领域缺乏真实、非脚本化、复杂日常活动基准的空白。
实际应用
在实际应用层面,EventKitchen的数据特性使其在增强现实、虚拟现实、人机交互和可穿戴AI等领域具有广阔前景。其事件相机的高时间分辨率与高动态范围特性,结合人类日常烹饪活动的自然采集,为开发实时、低功耗的感知系统提供了训练和验证数据。例如,可用于构建面向智能厨房的辅助机器人,实现动作识别与物体定位;或用于开发轻量化、隐私保护的日常活动监测设备,适用于健康护理和智能家居场景。此外,该数据集的立体事件流和深度信息也有助于提升近场3D感知精度,支持如手势识别、物体操作追踪等需要精细空间理解的交互应用。
衍生相关工作
EventKitchen的发布预期将催生一系列衍生研究工作。基于其多任务基准,研究者可开发更鲁棒的事件表示学习方法,如针对长尾分布的小样本学习算法。该数据集为动作识别、目标检测和深度估计的基线方法(如TSM、Swin、YOLOv10、RVT等)提供了挑战性测试平台,激励领域内提出更具泛化能力的模型架构。同时,其多模态同步数据可促进事件-RGB融合策略、跨模态知识蒸馏以及模拟到真实迁移的研究。此外,基于该数据集,还可能衍生出事件相机领域中的自监督预训练范式、以及面向人机协同的实时感知系统设计等新方向,从而推动神经形态视觉在更广泛场景中的落地与创新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务