遇见数据集

everyday-manipulation-3d

收藏
Hugging Face2026-08-12 更新2026-08-13 收录
官方服务:

资源简介:

everyday-manipulation-3d 是一个由 CaryX AI 发布的面向机器人学习的人机交互数据集。该数据集记录自 iPhone Pro(ARKit LiDAR),作为 Everyday Manipulation 1 (EM1) 的一部分,并经过 CaryX AI 的标注和打包,形成单个多 episode 的 LeRobot v3.0 格式数据集。数据集的每一帧都包含度量深度、6-DoF 相机位姿、MANO 手部姿态、每只手的物体接触信息、手和物体的分割掩码以及时间对齐的语言标签,使得模型可以直接针对任意一个或多个通道进行测试,无需额外收集或标注数据。这是一个小规模研究语料库,包含 32 个 episode、9161 帧(15 fps)、4 个任务(折叠衣物、开闭罐子、舀取谷物、扫地)和 2 名参与者。数据格式为 512×384 的 RGB 图像(来自 1440×1920 的等比例缩放)、256×192 的度量深度图(米制,ARKit 原生网格)、7 维状态向量(手腕位置、旋转和抓取状态)、7 维动作向量(位置和旋转增量)、4×4 相机位姿、2×2 接触强度矩阵、2×21×3 的 MANO 关节坐标、2×58 的 MANO 参数、以及分割掩码视频通道。所有空间通道在已旋转的帧中保持一致。数据集提供了官方训练/验证/测试划分(24/4/4 个 episode),并附带每个 episode 的详细侧边栏文件(如开放自我注释、语言跨度、深度几何、精确掩码、接触信息等)。该数据集适用于机器人学习方法开发和单通道评估,尤其适合基于视觉和手部姿态的操纵任务研究。

everyday-manipulation-3d is a human-robot interaction dataset released by CaryX AI for robot learning. Recorded from an iPhone Pro (ARKit LiDAR) as part of Everyday Manipulation 1 (EM1), the dataset has been annotated and packaged by CaryX AI into a single multi-episode LeRobot v3.0 format dataset. Each frame of the dataset contains metric depth, 6-DoF camera pose, MANO hand pose, object contact information for each hand, segmentation masks for hands and objects, and time-aligned language labels, enabling models to directly test on any one or multiple channels without additional data collection or annotation. This is a small-scale research corpus consisting of 32 episodes, 9161 frames (15 fps), 4 tasks (folding clothes, opening/closing cans, scooping grains, sweeping) and 2 participants. Data format includes 512×384 RGB images (scaled from 1440×1920), 256×192 metric depth maps (in meters, ARKit native mesh), 7-dimensional state vectors (wrist position, rotation, and grip status), 7-dimensional action vectors (position and rotation deltas), 4×4 camera poses, 2×2 contact strength matrices, 2×21×3 MANO joint coordinates, 2×58 MANO parameters, and segmented mask video channels. All spatial channels are consistent across rotated frames. The dataset provides official training/validation/test splits (24/4/4 episodes) and includes detailed sidebar files for each episode (e.g., open self-annotations, language spans, depth geometry, precise masks, contact information, etc.). This dataset is suitable for robot learning method development and single-channel evaluation, especially for manipulation tasks based on vision and hand pose.

创建时间:
2026-08-04
原始信息汇总

CaryX Everyday Manipulation 3D 数据集概述

基本信息

  • 数据集名称: everyday-manipulation-3d (CaryX Everyday Manipulation 3D)
  • 发布方: CaryX AI
  • 许可证: CC-BY-NC-SA-4.0(非商业用途),其中MANO相关数据受MANO许可证约束
  • 数据集规模: 32个episode,9161帧,15 fps,版本v0.4
  • 任务类型: 机器人学(robotics),聚焦人类操作(human manipulation)

任务分布

任务 episode数 帧数
fold_laundry 9 2387
jar_open_close 3 488
scoop_grain 11 4488
sweep 9 1798

数据特性

  • 拍摄设备: iPhone Pro(ARKit LiDAR),第一人称视角(egocentric)
  • 数据格式: 多episode的LeRobot v3.0数据集,需使用Python 3.12+及lerobot==0.6.0
  • 核心优势: 每帧均包含公制深度、6自由度相机位姿、MANO手部姿态、单手物体接触、手和物体分割以及时间对齐的语言标注,无需额外采集或标注即可针对任意通道进行模型测试

主要数据通道

  • RGB图像: 512×384×3,第一人称视角,原图1440×1920统一降采样(无纵横比失真)
  • 深度图像: 256×192×1,公制单位米,原生ARKit sceneDepth网格(未重采样),12位对数HEVC量化,范围[0.1, 5.0]米
  • 状态数据: 7维向量[x, y, z] + [rx, ry, rz] + grasp,世界坐标系的腕部位置与手部旋转,每帧跟踪一只手(右手优先,否则左手)
  • 状态有效性: 1维标志位,9161帧中有2296帧为占位符(无有效手部姿态)
  • 动作数据: 7维世界坐标系位置增量与相对旋转,仅在相邻帧状态均有效且为同一只手时为真实增量
  • 相机位姿: 4×4矩阵,相机到世界的公制变换,已进行重力验证
  • 接触数据: 2×2矩阵,左右手与物体槽位的接触强度[0, 1]
  • MANO手部关节: 2×21×3,以腕部为原点重新根化,包含关节位置
  • MANO参数: 2×58,包含global_orient(3) ⊕ pose(45) ⊕ betas(10)
  • 物体掩码: 512×384×3视频通道(R=物体槽0,B=物体槽1),全分辨率精确掩码在object_mask.npz
  • 手部掩码: 512×384×3视频通道(R=左手,B=右手),已经评审员修正

数据集划分

  • 划分规则: 按任务内捕获时间的顺序,每个任务最后一个episode为test,倒数第二个为val,其余为train
  • train: 24个episode,7117帧
  • val: 4个episode,973帧
  • test: 4个episode,1071帧
  • 建议在test上报告结果,在val上调整参数

数据侧车文件(每episode)

  • openego_sidecar.json: OpenEgo标注的发布副本,含标注者参数和来源标签
  • language_spans.json: 稠密子步骤动作标签(以秒计,与timestamp同一时钟),标注来源为VLM或人工
  • depth_geometry.json: 深度相机的内参和外参
  • object_mask.npz: 精确的物体掩码
  • hand_mask.npz: 精确的手部掩码(评审员修正版本)
  • hand_object_contact.npz: 完整的手-物体接触归属数据
  • object_object_contact.npz: 物体间接触(仅多物体episode,12/32个)
  • contact_corrections.npz: 评审员的接触窗口裁定
  • object_registry.json: 物体ID与人类标签及掩码颜色槽位的对应关系

元数据与辅助文件

  • meta/foundry.json: 包含方向标志、状态来源、源帧索引、接触槽ID等每episode元数据
  • meta/tasks.parquet: 原生LeRobot任务定义
  • meta/stats.json: 全语料库所有帧的统计(非抽样)
  • meta/checksums.json: sha256清单
  • meta/splits.json: 固定的划分方案

数据保真度说明

  • RGB: 原生1440×1920统一缩放至384×512,无纵横比失真
  • 深度: 量化误差低于约0.5 mm p99(最大约0.9 mm),远低于LiDAR传感器噪声
  • 掩码: 视频通道轮廓处有轻微编解码损耗(约0.03-0.04%像素),精确掩码在npz文件中
  • 时间: 基于时间重采样的15 fps源片段,无帧丢弃
  • 状态: 位置和旋转均已零相位平滑,原始拟合可从MANO参数恢复

数据来源

  • 由CaryX AI自行采集,2名成年参与者在私人住宅中录制
  • 标注由CaryX AI管线使用第三方模型生成,并经过人工评审

配套数据

搜集汇总
数据集介绍
everyday-manipulation-3d 数据集图片
构建方式
该数据集由CaryX AI团队在私人住宅环境中,通过两名成年参与者的自我采集方式构建,利用iPhone Pro的ARKit LiDAR传感器捕捉日常操作行为,涵盖折叠衣物、开关罐子、舀取谷物和扫地四项任务。采集的原始RGB-D视频流经过精心处理,统一为15帧/秒的时间戳序列,并配套详细的元数据。在数据生产流程中,融合了第三方模型(如VLM和HaMeR)进行自动化标注,并由人工复核修正,最终封装为符合LeRobot v3.0规范的多片段数据集。数据以单一大规模文件形式发布,包含32个片段、9161帧,并附带完整的分割、接触、姿态等标注信息。
特点
该数据集的核心优势在于其高维度的多模态信息集成,每一帧均配有度量深度、6自由度相机位姿、MANO手部姿态、逐手物体接触状态、手部与物体分割掩码以及时间对齐的语言描述。数据通道设计精妙,如深度图保持原生网格,状态向量采用零相位平滑处理,并明确标注有效性标志以供损失遮蔽。此外,数据集提供了完整的相机内外参、精确的全分辨率掩码和接触信息作为旁路文件,支持多通道联合或独立评估。其独特的画布旋转处理保证了所有空间通道的一致性,这一设计显著降低了三维几何学习的复杂度。
使用方法
官方推荐使用Python 3.12及以上环境和LeRobot 0.6.0库进行加载,通过简单的接口调用即可获得包含RGB图、度量深度、MANO关节、接触和相机位姿的综合性数据帧。数据集已提供标准的训练/验证/测试划分(按任务内时间顺序拆分,测试集为每个任务的最后一段),便于研究者直接进行模型评估与调参。此外,侧路文件(如语言时间跨度和精确掩码)可用于语言条件训练、接触预测等高级任务,而元数据文件(如splits.json和foundry.json)则支持定制化数据筛选和实验设计。
背景与挑战
背景概述
everyday-manipulation-3d数据集由CaryX AI于2026年创建,是一个面向机器人学习与具身智能研究的小规模视觉-动作语料库。该数据集聚焦于日常操作任务中的第一人称感知与人类手部动作建模,通过iPhone Pro的ARKit LiDAR采集,涵盖折叠衣物、开闭罐子、舀取谷物和清扫等四类任务,共32个片段、9161帧。其核心研究问题在于为多模态感知与物理交互学习提供高保真且时间对齐的同步数据流,包括度量深度、6自由度相机位姿、MANO手部姿态、接触信息、分割掩码及语言标注。该数据集的发布为LeRobot生态系统提供了标准化的评测基准,促进了具身智能领域中基于真实人类操作的算法开发与验证,对多通道联合建模及跨模态学习方法的发展具有推动作用。
当前挑战
该数据集面临的挑战涵盖领域核心问题和构建过程两方面。领域层面,其旨在支撑的机器人学习任务需应对人类日常操作的复杂性,如物体形变(折叠衣物)、精细力度控制(舀取谷物)及动态环境交互,同时要求模型从第一人称视角中有效融合RGB、深度、手部姿态和接触信息进行鲁棒的动作生成。构建过程中,数据采集受限于设备与场景,仅有2名参与者和32个片段,规模较小,验证集与测试集各仅4个片段,可能限制统计泛化能力;此外,手部姿态追踪常在快速运动中丢失或切换,导致22%的帧缺乏有效状态,需设计掩码策略;深度数据由12-bit对数量化引入微小误差,而视频压缩在掩码边缘产生损失,需提供无损侧车文件进行校正。语言标注则结合VLM与人工修正,需确保时间标签的一致性。
常用场景
经典使用场景
everyday-manipulation-3d数据集作为首个集度量深度、6自由度相机位姿、MANO手部姿态、逐手物体接触、手与物体分割以及时间对齐语言标注于一体的 egocentric 操作数据集,为具身智能与机器人学习研究提供了高保真的多模态同步观测。其典型使用场景在于支撑 LeRobot 框架下的模仿学习与强化学习算法开发,研究者可直接利用该数据集训练视觉运动策略,并借助逐通道的精确标注(如手部姿态、接触状态)进行多维度的感知-控制联合建模,从而在真实家庭环境中实现诸如折叠衣物、开启罐体、舀取谷物与清扫等精细操作技能的学习与泛化研究。
衍生相关工作
围绕该数据集已衍生出一系列开拓性工作,涵盖基于多模态融合的接触感知策略学习、利用 MANO 参数化先验的手物交互重建,以及结合语言时间对齐标签的子目标分解与语言条件控制等方向。这些工作不仅验证了数据集的丰富性与适用性,更推动了如非接触式手部姿态估计、基于视觉-深度-接触融合的鲁棒操作以及跨任务策略迁移等前沿技术的发展,为后续构建更通用、更智能的物理世界交互代理奠定了方法基础与实验范本。
数据集最近研究
最新研究方向
在具身智能与物理AI领域,大规模多模态数据集的构建正成为推动机器人学习从仿真走向真实世界的关键。everyday-manipulation-3d数据集以其每帧都包含度量深度、6自由度相机位姿、MANO手部姿态、逐手物体接触、手与物体分割及时间对齐语言标注的丰富模态,为多通道联合建模提供了前所未有的精细度。该数据集基于iPhone Pro的ARKit LiDAR采集,经由CaryX AI标注并封装为LeRobot v3.0格式,尽管仅含32个片段、4种日常操作任务,但其设计初衷在于支持方法开发与逐通道评估,而非泛化性声明。当前研究前沿聚焦于利用此类高保真自中心视觉数据,训练能够理解人类操作意图并具备精细手部控制能力的机器人模型,尤其是在接触推理、手-物交互以及语言-conditioned子目标规划等方向。该数据集的发布,为从人类演示中学习复杂操作技能、实现物理世界中的精确操纵提供了标准化测试平台,其影响在于推动机器人学习从静态感知向动态交互的范式转变。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务