everyday-manipulation-3d
收藏资源简介:
everyday-manipulation-3d 是一个由 CaryX AI 发布的面向机器人学习的人机交互数据集。该数据集记录自 iPhone Pro(ARKit LiDAR),作为 Everyday Manipulation 1 (EM1) 的一部分,并经过 CaryX AI 的标注和打包,形成单个多 episode 的 LeRobot v3.0 格式数据集。数据集的每一帧都包含度量深度、6-DoF 相机位姿、MANO 手部姿态、每只手的物体接触信息、手和物体的分割掩码以及时间对齐的语言标签,使得模型可以直接针对任意一个或多个通道进行测试,无需额外收集或标注数据。这是一个小规模研究语料库,包含 32 个 episode、9161 帧(15 fps)、4 个任务(折叠衣物、开闭罐子、舀取谷物、扫地)和 2 名参与者。数据格式为 512×384 的 RGB 图像(来自 1440×1920 的等比例缩放)、256×192 的度量深度图(米制,ARKit 原生网格)、7 维状态向量(手腕位置、旋转和抓取状态)、7 维动作向量(位置和旋转增量)、4×4 相机位姿、2×2 接触强度矩阵、2×21×3 的 MANO 关节坐标、2×58 的 MANO 参数、以及分割掩码视频通道。所有空间通道在已旋转的帧中保持一致。数据集提供了官方训练/验证/测试划分(24/4/4 个 episode),并附带每个 episode 的详细侧边栏文件(如开放自我注释、语言跨度、深度几何、精确掩码、接触信息等)。该数据集适用于机器人学习方法开发和单通道评估,尤其适合基于视觉和手部姿态的操纵任务研究。
everyday-manipulation-3d is a human-robot interaction dataset released by CaryX AI for robot learning. Recorded from an iPhone Pro (ARKit LiDAR) as part of Everyday Manipulation 1 (EM1), the dataset has been annotated and packaged by CaryX AI into a single multi-episode LeRobot v3.0 format dataset. Each frame of the dataset contains metric depth, 6-DoF camera pose, MANO hand pose, object contact information for each hand, segmentation masks for hands and objects, and time-aligned language labels, enabling models to directly test on any one or multiple channels without additional data collection or annotation. This is a small-scale research corpus consisting of 32 episodes, 9161 frames (15 fps), 4 tasks (folding clothes, opening/closing cans, scooping grains, sweeping) and 2 participants. Data format includes 512×384 RGB images (scaled from 1440×1920), 256×192 metric depth maps (in meters, ARKit native mesh), 7-dimensional state vectors (wrist position, rotation, and grip status), 7-dimensional action vectors (position and rotation deltas), 4×4 camera poses, 2×2 contact strength matrices, 2×21×3 MANO joint coordinates, 2×58 MANO parameters, and segmented mask video channels. All spatial channels are consistent across rotated frames. The dataset provides official training/validation/test splits (24/4/4 episodes) and includes detailed sidebar files for each episode (e.g., open self-annotations, language spans, depth geometry, precise masks, contact information, etc.). This dataset is suitable for robot learning method development and single-channel evaluation, especially for manipulation tasks based on vision and hand pose.
CaryX Everyday Manipulation 3D 数据集概述
基本信息
- 数据集名称: everyday-manipulation-3d (CaryX Everyday Manipulation 3D)
- 发布方: CaryX AI
- 许可证: CC-BY-NC-SA-4.0(非商业用途),其中MANO相关数据受MANO许可证约束
- 数据集规模: 32个episode,9161帧,15 fps,版本v0.4
- 任务类型: 机器人学(robotics),聚焦人类操作(human manipulation)
任务分布
| 任务 | episode数 | 帧数 |
|---|---|---|
| fold_laundry | 9 | 2387 |
| jar_open_close | 3 | 488 |
| scoop_grain | 11 | 4488 |
| sweep | 9 | 1798 |
数据特性
- 拍摄设备: iPhone Pro(ARKit LiDAR),第一人称视角(egocentric)
- 数据格式: 多episode的LeRobot v3.0数据集,需使用Python 3.12+及
lerobot==0.6.0 - 核心优势: 每帧均包含公制深度、6自由度相机位姿、MANO手部姿态、单手物体接触、手和物体分割以及时间对齐的语言标注,无需额外采集或标注即可针对任意通道进行模型测试
主要数据通道
- RGB图像: 512×384×3,第一人称视角,原图1440×1920统一降采样(无纵横比失真)
- 深度图像: 256×192×1,公制单位米,原生ARKit sceneDepth网格(未重采样),12位对数HEVC量化,范围[0.1, 5.0]米
- 状态数据: 7维向量
[x, y, z] + [rx, ry, rz] + grasp,世界坐标系的腕部位置与手部旋转,每帧跟踪一只手(右手优先,否则左手) - 状态有效性: 1维标志位,9161帧中有2296帧为占位符(无有效手部姿态)
- 动作数据: 7维世界坐标系位置增量与相对旋转,仅在相邻帧状态均有效且为同一只手时为真实增量
- 相机位姿: 4×4矩阵,相机到世界的公制变换,已进行重力验证
- 接触数据: 2×2矩阵,左右手与物体槽位的接触强度[0, 1]
- MANO手部关节: 2×21×3,以腕部为原点重新根化,包含关节位置
- MANO参数: 2×58,包含global_orient(3) ⊕ pose(45) ⊕ betas(10)
- 物体掩码: 512×384×3视频通道(R=物体槽0,B=物体槽1),全分辨率精确掩码在
object_mask.npz - 手部掩码: 512×384×3视频通道(R=左手,B=右手),已经评审员修正
数据集划分
- 划分规则: 按任务内捕获时间的顺序,每个任务最后一个episode为test,倒数第二个为val,其余为train
- train: 24个episode,7117帧
- val: 4个episode,973帧
- test: 4个episode,1071帧
- 建议在test上报告结果,在val上调整参数
数据侧车文件(每episode)
- openego_sidecar.json: OpenEgo标注的发布副本,含标注者参数和来源标签
- language_spans.json: 稠密子步骤动作标签(以秒计,与timestamp同一时钟),标注来源为VLM或人工
- depth_geometry.json: 深度相机的内参和外参
- object_mask.npz: 精确的物体掩码
- hand_mask.npz: 精确的手部掩码(评审员修正版本)
- hand_object_contact.npz: 完整的手-物体接触归属数据
- object_object_contact.npz: 物体间接触(仅多物体episode,12/32个)
- contact_corrections.npz: 评审员的接触窗口裁定
- object_registry.json: 物体ID与人类标签及掩码颜色槽位的对应关系
元数据与辅助文件
- meta/foundry.json: 包含方向标志、状态来源、源帧索引、接触槽ID等每episode元数据
- meta/tasks.parquet: 原生LeRobot任务定义
- meta/stats.json: 全语料库所有帧的统计(非抽样)
- meta/checksums.json: sha256清单
- meta/splits.json: 固定的划分方案
数据保真度说明
- RGB: 原生1440×1920统一缩放至384×512,无纵横比失真
- 深度: 量化误差低于约0.5 mm p99(最大约0.9 mm),远低于LiDAR传感器噪声
- 掩码: 视频通道轮廓处有轻微编解码损耗(约0.03-0.04%像素),精确掩码在npz文件中
- 时间: 基于时间重采样的15 fps源片段,无帧丢弃
- 状态: 位置和旋转均已零相位平滑,原始拟合可从MANO参数恢复
数据来源
- 由CaryX AI自行采集,2名成年参与者在私人住宅中录制
- 标注由CaryX AI管线使用第三方模型生成,并经过人工评审
配套数据
- 原始全分辨率RGB-D片段已另行发布为CaryxAI/everyday-manipulation-3d-raw(CC BY 4.0,无标注)




