遇见数据集

play_human_can_1_eef

收藏
Hugging Face2026-08-15 更新2026-08-16 收录
官方服务:

资源简介:

play_human_can_eef_1 是一个机器人操作数据集,是 aytsaiusc/play_human_can_1 的 LeRobot 重新发布版本,并添加了右手末端执行器(EEF)注释。该数据集包含人类操作罐子(can task)的演示,任务为三维空间中的自由操作(无z平面锁定)。手部关键点检测采用 HaMeR 模型,将21个关键点的手部形状通过刚性拟合(缩放+平移)与相机深度图像对齐,生成3D世界坐标下的关键点。相机校准使用真实机器人校准参数(aytsai REAL rig calib),坐标系统与机器人世界坐标系共享(与 play_robot_can_*_eef 系列一致)。数据集中,95%的帧检测成功,所有检测到的帧中深度提升收敛率为100%,其余帧通过插值与平滑处理。数据集包含完整21个关键点的2D全帧像素坐标(kpts21_2d)和3D世界度量坐标(kpts21_3d_world),以及从原始图像裁剪(60,60,390,390)并缩放至128x128的2D关键点(kpt2d_crop128_*)。

play_human_can_eef_1 is a robot manipulation dataset, a LeRobot re-release of aytsaiusc/play_human_can_1 with added right-hand end-effector (EEF) annotations. It contains human demonstrations of manipulating a can (can task) in 3D free space (no z-plane locking). Hand keypoints are detected using the HaMeR model, where a 21-keypoint hand shape is aligned with camera depth images via rigid fitting (scaling + translation) to generate 3D world coordinates. Camera calibration uses real robot calibration parameters (aytsai REAL rig calib), and the coordinate system is shared with the robot world coordinate system (consistent with the play_robot_can_*_eef series). In the dataset, 95% of frames are successfully detected, with a 100% convergence rate of depth lifting for all detected frames; the remaining frames are interpolated and smoothed. The dataset includes full-frame 2D pixel coordinates (kpts21_2d) and 3D world metric coordinates (kpts21_3d_world) for all 21 keypoints, as well as 2D keypoints cropped from the original image (60,60,390,390) and scaled to 128x128 (kpt2d_crop128_*).

创建时间:
2026-08-02
原始信息汇总

数据集概述

基本信息

  • 数据集名称: play_human_can_eef_1
  • 数据来源: 由 aytsaiusc/play_human_can_1 重新发布,并添加了右手 EEF(末端执行器)标注
  • 任务类型: 罐体操作任务(3D 空间任务)

关键特性

3D 数据链

  • 使用 HaMeR 21 关键点手部模型进行刚性拟合(包括缩放和平移变换,并进行了裁剪)
  • 关键点像素位置与对齐的深度图相结合,实现深度提升
  • 无 z 平面锁定:罐体任务在 3D 空间中进行,不再限制于单一平面

坐标系统

  • 采用机器人世界坐标系(ROBOT-WORLD frame),与 play_robot_can_*_eef 数据集共享坐标系
  • 相机标定基于真实的机械臂刚体标定(calib/can_rig_real_calib.json
  • 标定精度经过交叉验证:与机械臂 ICP 自标定相比误差约 2cm(此前 URDF 标称位姿存在 273mm/9.5° 的偏差)

数据内容

  • 检测覆盖率: 95.0% 的视频帧中检测到手部
  • 深度提升成功率: 所有成功检测的帧中,深度提升收敛率为 100%(其余帧采用插值和平滑处理)
  • 关键点类型:
    • kpts21_2d: 全帧像素坐标的 21 个关键点
    • kpts21_3d_world: 世界坐标系下的 21 个关键点(米制单位)
    • kpt2d_crop128_*: 基于裁剪区域 (60,60,390,390) 缩放至 128 像素的关键点坐标
搜集汇总
数据集介绍
play_human_can_1_eef 数据集图片
构建方式
在机器人学习领域,高质量的人类演示数据对于技能迁移至关重要,而该数据集通过对原始数据集的重发布,旨在为右手末端执行器(EEF)任务提供精确的三维标注。具体构建时,首先利用HaMeR模型检测手部21个关键点,再结合对齐的深度图进行刚性拟合,包括尺度和平移的调整与裁剪,从而获得关键点像素处的三维坐标。整个过程中采用了aytsai的真实机械臂校准文件,确保相机标定准确,避免了使用过时的URDF标称位姿,并通过与机械臂ICP自校准的交叉验证将误差控制在约2厘米以内。最终,所有坐标均统一到机器人世界坐标系下,与play_robot_can_*_eef系列数据集保持一致。
特点
该数据集的核心特点在于其高精度的三维标注和广泛的检测覆盖率。在95.0%的帧中成功检测到手部,且在全部检测结果中深度提升的收敛率达到100.0%,未收敛的部分则通过插值和平滑处理补充,保证了数据的连续性与完整性。数据集提供了完整的21个关键点信息,包括全帧像素坐标(kpts21_2d)和世界坐标系下的三维坐标(kpts21_3d_world),同时针对下游任务还提供了裁剪并缩放至128×128分辨率的2D关键点版本(kpt2d_crop128_*)。此外,该数据集未采用z平面锁定,而是保留了三维空间中的自然运动,更贴合can任务的真实场景。
使用方法
使用该数据集时,研究者可依据机器人世界坐标系下的三维关键点进行模仿学习或策略训练。对于需要二维输入的任务,可直接使用全帧像素坐标或裁剪缩放后的128×128关键点数据。由于坐标系统一,该数据集可与play_robot_can_*_eef系列数据集无缝结合,用于跨域或联合训练。在应用前,建议参考提供的校准文件(can_rig_real_calib.json)以复现相机标定参数。此外,深度提升过程中生成的关键点数据已包含插值和平滑处理,因此无需额外后处理即可用于模型训练,但需注意检测缺失帧(约5%)可能对时序任务的影响,可结合插值策略进一步优化。
背景与挑战
背景概述
在具身智能与机器人学习领域,人类演示数据的高效利用对于技能迁移至关重要。play_human_can_1_eef数据集由LeRobot团队基于aytsaiusc/play_human_can_1重新发布,专注于为右手操作任务提供末端执行器(EEF)标注。该数据集解决了传统人类演示中手部姿态与机器人坐标系对齐的难题,通过融合HaMeR手部模型与深度提升技术,实现了高精度的三维手部关键点重建。其核心研究问题在于如何将人类操作的自然动作精确映射至机器人世界坐标系,从而促进模仿学习与机器人控制策略的开发。该数据集为机器人操作任务提供了宝贵的真实世界人类演示资源,推动了跨域技能迁移研究的发展。
当前挑战
该数据集面临的挑战包括:在领域问题层面,如何从单目或深度相机中准确估计手部三维姿态,并处理遮挡、快速运动及复杂背景的干扰;同时,需确保人类手部动作与机器人末端执行器的语义对齐,以支持有效的策略学习。在构建过程中,挑战体现在深度提升的鲁棒性——尽管95.0%的帧可检测到手部,但仅100.0%的检测能成功收敛深度提升,其余需插值与平滑;此外,相机标定误差(URDF标称位姿偏差达273mm/9.5度)要求采用真实标定并交叉验证,以确保坐标系的精确性。这些挑战共同凸显了高质量人类演示数据采集与标注的复杂性。
常用场景
经典使用场景
在机器人学习与模仿学习领域,基于人类演示的示教数据已成为训练灵巧操作策略的关键范式。该数据集通过精细标注人类操作罐头任务时的右手末端执行器(EEF)位姿,为机器人从人类视频中习得三维操作技能提供了高质量的监督信号。其经典使用场景集中于手-物交互的3D轨迹建模与策略学习,研究者借助21个手部关键点的二维像素坐标与三维世界坐标,构建从视觉观测到动作序列的映射,实现跨域(人类到机器人)的技能迁移。
衍生相关工作
围绕该数据集,衍生了一系列经典工作。例如,基于其三维关键点标注的模仿学习算法改进了扩散策略与行为克隆框架,实现了高精度的手-臂协同控制;跨域对齐研究利用其坐标系一致性,探索了人类视频到机器人动作空间的映射方法;此外,深度提升与关键点插值技术亦被后续数据集采纳,成为无标记运动捕捉的参考流程。这些工作共同推动了灵巧操作与示教学习领域的发展。
数据集最近研究
最新研究方向
在具身智能与三维视觉交叉领域,基于人类演示的机器人技能习得正从平面操作向复杂三维空间任务演进。play_human_can_1_eef数据集通过HaMeR手部建模与深度提升技术,将真实人手21个关键点刚性拟合至对齐深度,生成机器人世界坐标系下的度量级三维标注,规避了传统z平面锁定的简化假设。该工作回应了当前模仿学习中手-物交互三维精度不足的痛点,为从人类视频中直接提取可迁移的末端执行器轨迹提供了校准严谨的数据基础,推动了无标记人类演示向真实机器人操作策略的端到端迁移研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务