wb_take_lifted_clothes_to_basket
收藏资源简介:
这是一个全身体操控数据集,数据来自Unitree G1全身体机器人,以LeRobot v2.1格式发布。数据集包含42个片段(episode),共21787帧(约12分钟,30帧/秒),每个片段长度在143到689帧之间(中位数518帧)。任务是从人类手中拿起举起的衣服,然后放入洗衣篮。数据集包含两个摄像头(640×480分辨率,H264编码),状态和动作均为43维关节向量。数据集有两个分支:main分支的手部状态全为零(仅用于身体运动),real_inspair分支包含Inspire手部估计值(0.50-1.00)和原生命令(0.50-1.00)以及二进制开关触发。还提供了手部(MediaPipe)和身体(RTMO)的姿态注释,作为parquet列存储,包括关键点坐标、置信度等。数据被划分为训练集(0:42)。
This is a full-body manipulation dataset, collected from the Unitree G1 full-body robot, released in LeRobot v2.1 format. The dataset contains 42 episodes with a total of 21,787 frames (approximately 12 minutes at 30 fps). Each episode length ranges from 143 to 689 frames (median 518 frames). The task is to pick up a lifted garment from a human hand and place it into a laundry basket. The dataset includes two cameras (640×480 resolution, H264 encoding). The state and action are both 43-dimensional joint vectors. The dataset has two branches: the main branch has all hand states set to zero (only for body movement), and the real_inspair branch contains Inspire hand estimates (0.50-1.00) and raw commands (0.50-1.00) along with a binary switch trigger. Additionally, hand (MediaPipe) and body (RTMO) pose annotations are provided as parquet columns, including keypoint coordinates, confidence, etc. The data is split into a training set (0:42).
数据集概述:wb_take_lifted_clothes_to_basket
基本信息
- 数据集名称:wb_take_lifted_clothes_to_basket
- 许可证:Apache-2.0
- 任务类型:机器人技术(robotics)
- 语言:英语
- 标签:LeRobot、机器人技术、人形机器人、unitree-g1、全身控制、远程操作、inspire-hand、姿态估计
- 数据规模:10K < n < 100K
任务描述
将人类举起的衣物放入洗衣篮中。
数据概况
- 回合数(Episodes):42
- 帧数(Frames):21,787帧(约12分钟,30帧/秒)
- 回合长度:143–689帧(中位数518帧)
- 摄像头:2个640×480 H264摄像头
- 状态/动作维度:43维关节向量 / 43维关节向量
- 数据划分:训练集包含全部42个回合
分支版本
数据集提供两个分支,仅在灵巧手维度上存在差异:
- main分支:手部状态全为零(未记录),手部动作为原始Dex3遥操作向量(含负值),适用于仅需身体/运动控制的场景
- real_inspair分支:手部状态为Inspire估计值(0.50–1.00),手部动作为Inspire原生指令(0.50–1.00),最后一个槽位为二值开/关触发器,适用于任何需要手部信息的场景
注意:训练抓取任务时请使用
real_inspair分支,main分支的手部状态列为零,模型无法从中学习到任何信息。
数据模式(Schema)
observation.state和action均为43维,排列顺序如下:
- 0–11:腿部(左右髋关节俯仰/侧倾/偏航、膝关节、踝关节俯仰/侧倾)
- 12–14:腰部(偏航、侧倾、俯仰)
- 15–21:左臂(肩部俯仰/侧倾/偏航、肘部、腕部侧倾/俯仰/偏航)
- 22–28:左手(index_0、index_1、middle_0、middle_1、thumb_0、thumb_1、thumb_2)
- 29–35:右臂(肩部俯仰/侧倾/偏航、肘部、腕部侧倾/俯仰/偏航)
- 36–42:右手(index_0、index_1、middle_0、middle_1、thumb_0、thumb_1、thumb_2)
在real_inspair分支中,Inspire手部报告6维估计值:槽位22–27/36–41携带数值,槽位28/42保持零填充。动作侧对应槽位携带原生指令,最后一个槽位为二值触发器(0.0/1.0)。
注意:
real_inspair分支的手部状态为估计值(从记录过Inspire反馈的采集数据中迁移而来),并非记录的 ground truth,应描述为“估计/迁移的Inspire手部状态”。
视频数据
| 视频键 | 内容 | 编码 |
|---|---|---|
observation.images.cam_chest |
胸部摄像头原始画面 | h264 |
observation.images.cam_chest_hand_overlay |
胸部摄像头 + MediaPipe手部关键点叠加 | h264 |
observation.images.cam_chest_pose_overlay |
胸部摄像头 + RTMO身体骨架叠加 | h264 |
observation.images.cam_head |
头部摄像头原始画面 | h264 |
observation.images.cam_head_hand_overlay |
头部摄像头 + MediaPipe手部关键点叠加 | h264 |
observation.images.cam_head_pose_overlay |
头部摄像头 + RTMO身体骨架叠加 | h264 |
所有视频均为H.264编码。
姿态标注
关键点作为parquet列随帧存储,无需单独的标注文件:
| 列名 | 来源 | 内容 |
|---|---|---|
observation.human_hand.<cam>.landmarks_uv |
MediaPipe Hands | 每只手21个关键点,像素u/v坐标,左槽位后右槽位 |
observation.human_hand.<cam>.landmarks_2d |
MediaPipe Hands | 相同关键点,归一化x/y/z |
observation.human_hand.<cam>.world_landmarks |
MediaPipe Hands | 公制风格的世界x/y/z坐标 |
observation.human_hand.<cam>.valid / .score |
— | 左手/右手存在标志和置信度 |
observation.human_body.<cam>.landmarks_uv |
RTMO(rtmo-m_16xb16-600e_body7) | COCO-17身体关键点,像素u/v |
observation.human_body.<cam>.landmarks_2d |
RTMO | 相同关键点,归一化 |
observation.human_body.<cam>.scores / .valid |
— | 每个关键点置信度和逐帧标志 |
坐标全为零且valid = 0表示未检测到目标,数据中无NaN值。
标注过滤方法
- 身体检测:按回合进行后处理,包括分数阈值、基于边界框包含关系的重复抑制(普通IoU无法处理覆盖真实框的大面积误检框)、片段合并、基于运动轨迹(在饱和度掩膜的躯干色调直方图上合并)构建单一身份锁定。时间上重叠的轨迹永远不会合并。
- 手部候选:锚定到中心人物的手腕——距手腕超过半个肩宽的检测结果会被拒绝,以此排除手形道具的干扰。
数据布局
data/chunk-000/episode_000000.parquet 每个回合对应一个parquet文件 videos/chunk-000/<video_key>/episode_000000.mp4 每个回合每个视频键对应一个视频片段 meta/info.json 特征模式 meta/episodes.jsonl 回合索引和长度 meta/tasks.jsonl 任务字符串 meta/stats.json 各特征统计信息



