遇见数据集

wb_take_lifted_clothes_to_basket

收藏
Hugging Face2026-09-02 更新2026-08-31 收录
官方服务:

资源简介:

这是一个全身体操控数据集,数据来自Unitree G1全身体机器人,以LeRobot v2.1格式发布。数据集包含42个片段(episode),共21787帧(约12分钟,30帧/秒),每个片段长度在143到689帧之间(中位数518帧)。任务是从人类手中拿起举起的衣服,然后放入洗衣篮。数据集包含两个摄像头(640×480分辨率,H264编码),状态和动作均为43维关节向量。数据集有两个分支:main分支的手部状态全为零(仅用于身体运动),real_inspair分支包含Inspire手部估计值(0.50-1.00)和原生命令(0.50-1.00)以及二进制开关触发。还提供了手部(MediaPipe)和身体(RTMO)的姿态注释,作为parquet列存储,包括关键点坐标、置信度等。数据被划分为训练集(0:42)。

This is a full-body manipulation dataset, collected from the Unitree G1 full-body robot, released in LeRobot v2.1 format. The dataset contains 42 episodes with a total of 21,787 frames (approximately 12 minutes at 30 fps). Each episode length ranges from 143 to 689 frames (median 518 frames). The task is to pick up a lifted garment from a human hand and place it into a laundry basket. The dataset includes two cameras (640×480 resolution, H264 encoding). The state and action are both 43-dimensional joint vectors. The dataset has two branches: the main branch has all hand states set to zero (only for body movement), and the real_inspair branch contains Inspire hand estimates (0.50-1.00) and raw commands (0.50-1.00) along with a binary switch trigger. Additionally, hand (MediaPipe) and body (RTMO) pose annotations are provided as parquet columns, including keypoint coordinates, confidence, etc. The data is split into a training set (0:42).

提供机构:
DaoyuanZhu
创建时间:
2026-08-31
原始信息汇总

数据集概述:wb_take_lifted_clothes_to_basket

基本信息

  • 数据集名称:wb_take_lifted_clothes_to_basket
  • 许可证:Apache-2.0
  • 任务类型:机器人技术(robotics)
  • 语言:英语
  • 标签:LeRobot、机器人技术、人形机器人、unitree-g1、全身控制、远程操作、inspire-hand、姿态估计
  • 数据规模:10K < n < 100K

任务描述

将人类举起的衣物放入洗衣篮中。

数据概况

  • 回合数(Episodes):42
  • 帧数(Frames):21,787帧(约12分钟,30帧/秒)
  • 回合长度:143–689帧(中位数518帧)
  • 摄像头:2个640×480 H264摄像头
  • 状态/动作维度:43维关节向量 / 43维关节向量
  • 数据划分:训练集包含全部42个回合

分支版本

数据集提供两个分支,仅在灵巧手维度上存在差异:

  • main分支:手部状态全为零(未记录),手部动作为原始Dex3遥操作向量(含负值),适用于仅需身体/运动控制的场景
  • real_inspair分支:手部状态为Inspire估计值(0.50–1.00),手部动作为Inspire原生指令(0.50–1.00),最后一个槽位为二值开/关触发器,适用于任何需要手部信息的场景

注意:训练抓取任务时请使用real_inspair分支,main分支的手部状态列为零,模型无法从中学习到任何信息。

数据模式(Schema)

observation.stateaction均为43维,排列顺序如下:

  • 0–11:腿部(左右髋关节俯仰/侧倾/偏航、膝关节、踝关节俯仰/侧倾)
  • 12–14:腰部(偏航、侧倾、俯仰)
  • 15–21:左臂(肩部俯仰/侧倾/偏航、肘部、腕部侧倾/俯仰/偏航)
  • 22–28:左手(index_0、index_1、middle_0、middle_1、thumb_0、thumb_1、thumb_2)
  • 29–35:右臂(肩部俯仰/侧倾/偏航、肘部、腕部侧倾/俯仰/偏航)
  • 36–42:右手(index_0、index_1、middle_0、middle_1、thumb_0、thumb_1、thumb_2)

real_inspair分支中,Inspire手部报告6维估计值:槽位22–27/36–41携带数值,槽位28/42保持零填充。动作侧对应槽位携带原生指令,最后一个槽位为二值触发器(0.0/1.0)。

注意real_inspair分支的手部状态为估计值(从记录过Inspire反馈的采集数据中迁移而来),并非记录的 ground truth,应描述为“估计/迁移的Inspire手部状态”。

视频数据

视频键 内容 编码
observation.images.cam_chest 胸部摄像头原始画面 h264
observation.images.cam_chest_hand_overlay 胸部摄像头 + MediaPipe手部关键点叠加 h264
observation.images.cam_chest_pose_overlay 胸部摄像头 + RTMO身体骨架叠加 h264
observation.images.cam_head 头部摄像头原始画面 h264
observation.images.cam_head_hand_overlay 头部摄像头 + MediaPipe手部关键点叠加 h264
observation.images.cam_head_pose_overlay 头部摄像头 + RTMO身体骨架叠加 h264

所有视频均为H.264编码。

姿态标注

关键点作为parquet列随帧存储,无需单独的标注文件:

列名 来源 内容
observation.human_hand.<cam>.landmarks_uv MediaPipe Hands 每只手21个关键点,像素u/v坐标,左槽位后右槽位
observation.human_hand.<cam>.landmarks_2d MediaPipe Hands 相同关键点,归一化x/y/z
observation.human_hand.<cam>.world_landmarks MediaPipe Hands 公制风格的世界x/y/z坐标
observation.human_hand.<cam>.valid / .score 左手/右手存在标志和置信度
observation.human_body.<cam>.landmarks_uv RTMO(rtmo-m_16xb16-600e_body7) COCO-17身体关键点,像素u/v
observation.human_body.<cam>.landmarks_2d RTMO 相同关键点,归一化
observation.human_body.<cam>.scores / .valid 每个关键点置信度和逐帧标志

坐标全为零且valid = 0表示未检测到目标,数据中无NaN值。

标注过滤方法

  • 身体检测:按回合进行后处理,包括分数阈值、基于边界框包含关系的重复抑制(普通IoU无法处理覆盖真实框的大面积误检框)、片段合并、基于运动轨迹(在饱和度掩膜的躯干色调直方图上合并)构建单一身份锁定。时间上重叠的轨迹永远不会合并。
  • 手部候选:锚定到中心人物的手腕——距手腕超过半个肩宽的检测结果会被拒绝,以此排除手形道具的干扰。

数据布局

data/chunk-000/episode_000000.parquet 每个回合对应一个parquet文件 videos/chunk-000/<video_key>/episode_000000.mp4 每个回合每个视频键对应一个视频片段 meta/info.json 特征模式 meta/episodes.jsonl 回合索引和长度 meta/tasks.jsonl 任务字符串 meta/stats.json 各特征统计信息

二维码
社区交流群
二维码
科研交流群
商业服务