遇见数据集

Chinese_Commercial_Kitchen_Manipulation_Dataset_Preview

收藏
Hugging Face2026-06-10 更新2026-06-11 收录
官方服务:

资源简介:

Chinese Commercial Kitchen Manipulation Dataset — Sample Pack v0.1 是亚洲首个真实商业厨房操作数据集,专为机器人学、具身人工智能、模仿学习和视觉动作理解研究设计。该数据集在中国广东省中山市一家运营中的商业中餐厅厨房采集,由拥有约20年经验的专业厨师演示真实烹饪工作流程,而非模拟演示。数据内容包含多视角同步或任务对齐的视频采集:第一人称视角(头戴式运动相机)、侧视角(固定手机相机)和俯视角(Intel RealSense D435I RGB-D相机)。样本包当前包含两个烹饪任务:切菜任务提供三个相机视角(第一人称、侧视、俯视)以及对齐的深度数据(HDF5格式,480×848分辨率,2379帧);翻炒任务提供两个视角(第一人称和侧视)。深度数据中,像素值为65.535米表示无效深度测量,典型有效像素率约为86%。技术规格方面:样本包中的第一人称视频为1080p预览编码(1920×1080,30fps),完整4K源录像(3840×2160,29.97fps)可申请获取;侧视角视频为1920×1080分辨率(60fps或30fps);俯视角RGB视频为1280×720分辨率,15fps;深度数据为480×848分辨率,浮点32位,单位为米。数据集适用于机器人操作、模仿学习、动作理解、深度估计等任务,特别关注工具使用、双手协调和精细食物操作等挑战。完整数据集计划扩展至包括包饺子、揉面、炸、煎、炖煮、勾芡、腌制/调味等7个额外烹饪任务,并可提供任务级或动作级标注。数据采集已获得所有参与者的充分知情同意。

Chinese Commercial Kitchen Manipulation Dataset — Sample Pack v0.1 is Asia's first real-world commercial kitchen manipulation dataset, specifically designed for research in robotics, embodied artificial intelligence, imitation learning, and visual action understanding. The dataset was collected in an operating commercial Chinese restaurant kitchen in Zhongshan City, Guangdong Province, China, with professional chefs possessing approximately 20 years of experience demonstrating authentic cooking workflows rather than simulated ones. The data includes multi-view synchronized or task-aligned video recordings: first-person view (captured via a head-mounted action camera), side view (captured via a fixed smartphone camera), and top-down view (captured via an Intel RealSense D435I RGB-D camera). The current sample pack contains two cooking tasks: the vegetable cutting task provides three camera views (first-person, side view, top-down view) along with aligned depth data in HDF5 format (480×848 resolution, 2379 frames); the stir-frying task provides two views (first-person and side view). For the depth data, a pixel value of 65.535 meters indicates an invalid depth measurement, with a typical valid pixel rate of approximately 86%. Regarding technical specifications: the first-person videos in the sample pack are encoded as 1080p previews (1920×1080, 30fps), while the full 4K source footage (3840×2160, 29.97fps) is available upon request; the side-view videos have a resolution of 1920×1080 at either 60fps or 30fps; the top-down RGB videos have a resolution of 1280×720 at 15fps; the depth data has a resolution of 480×848, 32-bit floating-point format, with units in meters. This dataset is applicable to tasks such as robotic manipulation, imitation learning, action understanding, and depth estimation, with particular focus on challenges including tool use, bimanual coordination, and fine food manipulation. The full dataset is planned to expand to include 7 additional cooking tasks such as dumpling wrapping, dough kneading, deep frying, pan-searing, stewing, thickening with starch slurry, and marinating/seasoning, and task-level or action-level annotations can be provided. Full informed consent was obtained from all participants prior to data collection.

创建时间:
2026-06-05
原始信息汇总

数据集概述:Chinese Commercial Kitchen Manipulation Dataset — Sample Pack v0.1

该数据集是亚洲首个真实商业厨房操作数据集,包含在中国一家正在营业的中餐馆内录制的专业厨师烹饪演示。

核心特点

  • 场景与人员:采集于广东中山的真实商业中餐厅,由一位拥有约20年经验的专业厨师操作。
  • 任务类型:涵盖真实的中餐烹饪任务,涉及工具使用、双手协调和精细食物操作。
  • 视角与传感器:提供第一人称(自拍视角)、侧方和俯视多视角RGB视频,以及俯视视角的Intel RealSense D435I深度数据。
  • 数据用途:专为机器人技术、具身智能、模仿学习和视觉动作理解等研究领域设计。

样本包内容

样本包包含两个示例任务的数据:

任务 中文名 包含视角 深度数据
任务1:切菜 切菜 3个视角(自拍、侧方、俯视) ✅ 包含(HDF5格式,480×848,2379帧)
任务2:翻炒 翻炒 2个视角(自拍、侧方) ❌ 不包含(可申请获得)

各视角视频规格:

  • 自拍视角:头戴运动相机,预览版为1080p 30fps,原始采集为4K 30fps。
  • 侧方视角:固定手机,任务1为1080p 60fps,任务2为1080p 30fps。
  • 俯视RGB:RealSense D435I摄像头,1280×720,15fps。
  • 俯视深度:RealSense D435I摄像头,848×480,HDF5文件,帧数2379,深度值单位为米(float32),无效像素值为65.535米,典型有效像素率约86%。

文件结构

样本包的文件目录结构如下:

task_01_cutting/ ├── egocentric_1080p.mp4 ├── side_view.mp4 ├── overhead/ │ ├── overhead.mp4 │ └── overhead_.PNG ├── depth/ │ ├── depth.hdf5 │ └── check_.jpg ├── egocentric_screenshot_.PNG └── side_view_.PNG task_02_stir_fry/ ├── egocentric_1080p.mp4 ├── side_view.mp4 ├── egocentric_screenshot_.PNG └── side_view_.PNG

  • 深度数据读取(Python示例): python import h5py with h5py.File("task_01_cutting/depth/depth.hdf5", "r") as f: depth = f["depth_meters"][:] # (2379, 480, 848) float32, meters ts = f["timestamps"][:]

采集环境与许可

  • 地点:中国广东省中山市一家正在营业的商业中餐馆。
  • 参与者知情同意:所有参与者均签署了完整知情同意书。
  • 许可证:该数据集采用 CC BY-NC 4.0 许可协议(非商业使用)。

完整数据与额外资源

公开样本包主要用于技术评估和早期研究反馈。可通过联系邮箱 andy@dynamicnova.com 申请获取完整数据,包括:

  • 全4K自拍视频
  • 更长的多视角MP4视频
  • 额外的HDF5深度序列
  • RealSense原始.bag文件
  • 任务级或动作级标注
  • 格式转换支持(HDF5、RLDS或LeRobot)
  • 针对特定厨房流程的定制采集

完整数据集计划包括的任务有:切菜、翻炒、包饺子、揉面、油炸、煎、炖煮、勾芡、腌制/调味。

搜集汇总
数据集介绍
Chinese_Commercial_Kitchen_Manipulation_Dataset_Preview 数据集图片
构建方式
该数据集采集于广东省中山市一家正在运营的中式商业厨房,由一位拥有近二十年从业经验的专业厨师执行操作。数据采集过程中部署了多视角摄像系统,包括头戴式第一人称运动相机、固定侧方手机摄像头以及顶部安装的Intel RealSense D435I RGB-D传感器,同步录制了厨师在真实烹饪环境中的操作流程。采集任务涵盖了切菜与翻炒两项典型中式烹饪动作,其中切菜任务提供了对齐的深度数据,以HDF5格式存储为浮点型米制深度图。数据以预览编码的1080p视频文件形式提供,完整4K源文件与原始RealSense .bag记录则可按需申请获取。
特点
作为亚洲首个真实商业厨房操作数据集,其核心特色在于聚焦专业厨师在真实后厨环境中的工作流,而非实验室场景下的桌面演示。数据包含第一人称、侧方与俯拍三重视角,其中俯视视角提供配准的RGB-D数据,支持机器人操作学习与视觉动作理解研究。任务涉及工具使用、双手协调以及精细的食物操控,难度覆盖中等至高,并计划扩展至包饺子、揉面、油炸等更复杂的烹饪工序。原始采集采用4K画质与最高60帧率,确保了细节捕捉的精度。
使用方法
数据以任务为单位组织,每个任务目录下包含视角视频文件与预览截图。深度数据可通过Python的h5py库读取HDF5文件中的depth_meters数组,获得每秒15帧、分辨率480×848的米制深度图,需注意无效像素标记为65.535米。用户可依据任务标签与视角组合灵活选取数据,用于模仿学习模型的训练与评估。如需完整数据集或特定格式转换(如RLDS、LeRobot),可通过邮件联系数据提供方定制获取。
背景与挑战
背景概述
Chinese_Commercial_Kitchen_Manipulation_Dataset_Preview是亚洲首个真实商业厨房操作数据集,由Nova Dynamics Limited于2026年5月在中国广东中山的一家运营中餐馆内采集完成。该数据集聚焦于拥有二十年经验的职业厨师的工作流程,而非实验室环境下的桌面演示,旨在为机器人操作、具身智能、模仿学习和视觉动作理解等研究领域提供真实、复杂的人体示范数据。通过多视角RGB-D视频(包括第一人称视角、侧视角和俯视角)以及度量深度信息,该数据集填补了现实厨房场景中精细双人协作与工具操作数据匮乏的空白,对推动机器人从模拟环境向真实场景迁移的研究具有重要价值。
当前挑战
该数据集主要应对两大挑战。在领域问题层面,真实厨房环境中的操作任务(如切菜、翻炒)涉及双人协调、精细力控和时序敏感动作,传统桌面数据集无法捕捉此类高度动态与不可重复的流程,严重制约了模仿学习与机器人泛化能力的突破。在构建过程中,团队需在嘈杂、湿热且空间受限的商用厨房现场部署多视角拍摄设备,同步对齐不同帧率的RGB与深度流(如1280×720的俯视RGB与848×480的深度图),并处理传感器约14%无效深度像素的噪声问题;同时,确保连续操作视频中关键动作的标注一致性,以及应对4K原始视频的大规模存储与预处理需求,构成了显著的技术与工程挑战。
常用场景
经典使用场景
Chinese Commercial Kitchen Manipulation Dataset为具身智能与机器人操作领域提供了一个面向真实中餐后厨场景的多视角RGB-D操作数据集。该数据集捕捉了拥有二十年经验的专业厨师在营业餐厅中执行切菜、翻炒等典型烹饪任务的全过程,包含第一人称视角、侧方视角与俯视视角的同步视频以及高精度深度信息。研究者可将其用于模仿学习算法的训练与评估,尤其是基于人类示教数据引导机器人学习复杂双手协调与精细食物操作技能,是连接真实人类操作与机器人执行之间鸿沟的重要桥梁。
衍生相关工作
该数据集的出现有望衍生一系列重要研究工作。参照EgoMimic等以自我中心视觉驱动模仿学习的代表性工作,研究者可基于此数据集探索以自我为中心的多视角结合深度信息如何更高效地迁移人类技能至机器人。未来可衍生的工作包括构建大规模中餐操作的动作基元库、开发可泛化的双手协同烹饪策略、以及设计面向真实后厨环境的鲁棒感知与规划算法,进一步推动具身智能在复杂服务场景中的落地应用。
数据集最近研究
最新研究方向
Chinese_Commercial_Kitchen_Manipulation_Dataset_Preview作为亚洲首个真实商业厨房操作数据集,聚焦于机器人操作、具身智能与模仿学习的前沿交叉领域。该数据集由资深厨师在真实餐厅环境中采集,提供多视角RGB-D与自我中心视频,精准捕捉中餐烹饪中双手协调、工具使用及精细食物操作等复杂技能。其独特价值在于弥合了实验室仿真与现实餐饮作业的鸿沟,为长时序动作理解、动作标签细粒度标注及多视角数据对齐提供了稀缺资源。随着EgoMimic等研究强调自我中心数据对规模化模仿学习的推动作用,该数据集有望加速具身智能体在非结构化动态环境中的泛化能力研究,对推动机器人进入真实厨房场景具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务