sink10k_mug_g2_grasp
收藏资源简介:
该数据集是sink10k_mug数据集的第二阶段(抓取),由RB-Y1移动机械臂在NVIDIA Isaac Lab模拟环境中生成,任务是从厨房台面上抓取杯子并举起。包含9801个演示,总帧数2,621,199,使用3个320x240 RGB摄像头(前后左右腕),控制率20 Hz。任务提示为“Grasp the mug and lift it.”。
This dataset is the second stage (grasping) of the sink10k_mug dataset, generated by the RB-Y1 mobile manipulator in the NVIDIA Isaac Lab simulation environment. The task is to grasp a mug from a kitchen countertop and lift it. It contains 9,801 demonstrations with a total of 2,621,199 frames, using three 320x240 RGB cameras (front, back, left/right wrist), with a control rate of 20 Hz. The task instruction is "Grasp the mug and lift it."
sink10k-mug: phase 2, grasp 数据集概述
基本信息
- 数据集地址:https://huggingface.co/datasets/exaFLOPs09/sink10k_mug_g2_grasp
- 任务类别:robotics(机器人)
- 标签:LeRobot、robotics、simulation、isaac-lab、mobile-manipulation、kitchen、rby1
- 配置:config_name 为 default,data_files 为 data//.parquet
任务描述
- 该数据集为完整演示的第二阶段(grasp),仅包含合拢夹爪抓住杯子并将其提起的部分。
- 机器人类型:RB-Y1 移动机械臂。
- 任务内容:从厨房台面上拿起一个杯子,并将其放入厨房水槽。
- 生成方式:仿真环境(NVIDIA Isaac Lab),无任何硬件录制数据。
- 每一帧的提示词(prompt):
Grasp the mug and lift it.
数据规模
| 项目 | 数值 |
|---|---|
| 演示数量 | 9,801 |
| 帧数 | 2,621,199 |
| 厨房数量 | 122 |
| 厨房场景(厨房 × 布局变体) | 223 |
| 控制与视频频率 | 20 Hz |
| 相机数量 | 3 |
| 格式 | LeRobot v3.0 |
相机
三个相机均为 320x240 RGB、h264 编码、20 Hz,与控制流频率一致。
| 键名 | 位置 |
|---|---|
observation.images.front |
头部相机,安装在机器人头部连杆上,向下俯仰 50 度 |
observation.images.wrist_left |
左腕 |
observation.images.wrist_right |
右腕 |
机器人信号
训练前必读:action.joint 为冻结快照,每个 episode 仅写入一次且此后不再变化,因此一个演示的每一帧都携带相同的 29 个数值。它不能作为学习目标,不得在其上训练。本数据集中真正的关节信号是 joint_angles。action.joint 仅被保留以使 schema 与其合并来源的导出版本保持一致。
| 键名 | 形状 | 说明 |
|---|---|---|
observation.state |
23 | 每条机械臂为 [position(3), 6D rotation(6), gripper(1)],其后是底座扭转 (v_x, v_y, omega) |
action |
23 | 相同布局的指令版本 |
joint_angles |
24 | 测得的关节角度——即关节信号 |
action.joint |
29 | 指令关节目标。在一个 episode 内恒定。不得在其上训练。 |
关于 observation.state 的警告:该数据合并来源的导出版本为其携带了错误的通道名称,本仓库中的名称已修正。导出版本将两个夹爪标记为索引 18 和 19,导致从索引 9 到 18 的每个标签都相对其命名通道偏移一位——r_x 实际上命名的是夹爪。真实布局为按臂分块,每条臂的夹爪位于其自身块的末尾,两个夹爪通道按修正后的名称所示方向对应:索引 9 是右夹爪,索引 19 是左夹爪。该结论通过测量得出,而非假设——索引 10:13 与正确命名的 action[10:13] 以 r > 0.98 相关,索引 9 与 gripper_finger_r1 关节角相关,索引 19 落在相同单位下左夹爪静止时的位置。仅更改了标签,未改动任何一个记录的数值。
每一帧还携带 kitchen_num、kitchen_sub_num、kitchen_type、initial_pose、is_first、is_last 和 subtask_index。确切的数据类型和逐关节名称见 meta/info.json。
关于 initial_pose 的说明:initial_pose 并非初始姿态。它携带机器人底座在每一帧的 (x, y, qw, qx, qy, qz),且每帧都会变化——一个 596 帧的 episode 有 596 个不同的值。应将其理解为底座的实时姿态,而非每个 episode 的常量。
四个阶段
每个演示也按四个阶段发布。切分按帧进行,因此四个阶段精确划分每个 episode,其帧数之和等于完整数据集的帧数。全部五个数据集都包含相同的 9,801 个演示;仅帧范围和提示词不同。
| 阶段 | 仓库 | 提示词 | episodes | 帧数 |
|---|---|---|---|---|
| approach | exaFLOPs09/sink10k_mug_g1_approach | Move to the mug. |
9,801 | 3,567,659 |
| grasp | exaFLOPs09/sink10k_mug_g2_grasp | Grasp the mug and lift it. |
9,801 | 2,621,199 |
| carry | exaFLOPs09/sink10k_mug_g3_carry | Carry the mug to the sink. |
9,801 | 4,426,741 |
| place | exaFLOPs09/sink10k_mug_g4_place | Put the mug in the sink and return the arm home. |
9,801 | 1,015,587 |
完整任务为 exaFLOPs09/sink10k_mug,提示词为 Grasp the mug and put it in the sink.。
全部五个数据集
- exaFLOPs09/sink10k_mug
- exaFLOPs09/sink10k_mug_g1_approach
- exaFLOPs09/sink10k_mug_g2_grasp(本数据集)
- exaFLOPs09/sink10k_mug_g3_carry
- exaFLOPs09/sink10k_mug_g4_place
伸手路径直接度与未过滤说明
右手到杯子的路径有多直因演示而异。基于全部 9,801 个 episode(非抽样)测量,仅在 arm.grasp 步骤上,以右末端执行器路径长度除以该路径起点到终点的直线距离计算。比值为 1.0 表示完全直接的伸手。
reach_detour_ratio |
数值 |
|---|---|
| 中位数 | 1.1913 |
| 75 百分位 | 1.4085 |
| 90 百分位 | 1.7478 |
| 99 百分位 | 2.3558 |
| 最大值 | 12.7992 |
| 超过 2.0 的 episode 数 | 404 |
| 超过 10.0 的 episode 数 | 1 |
伸手本身的长度中位数为 0.4209 m。对于更宽的 grasp 阶段,故意不发布绕行比率:该阶段包含伸手、合拢和提起,而提起会使手返回到接近起点的位置,因此分母中的直线距离塌缩,此处的比率将衡量回路闭合程度而非路径直接度。对于该窗口,文件提供诚实的量——grasp_path_len_m(实际行进距离,中位数 0.9559 m)和 grasp_straight_line_m(净位移)。
没有任何演示因该指标或任何其他运动质量指标被过滤或丢弃。 较不直接的伸手与直接的伸手一起存在于数据集中,这是有意为之,以便选择权在于用户,而非由用户看不见的阈值预先决定。
逐 episode 的数值随数据提供为 episode_motion_stats.csv,包含全部 9,801 个演示各一行:episode_index、kitchen、sub,以及伸手的 reach_frames、reach_path_len_m、reach_straight_line_m、reach_detour_ratio 和 reach_peak_right_arm_joint_speed_rad_s,以及整个 grasp 阶段的 grasp_frames、grasp_path_len_m、grasp_straight_line_m 和 peak_right_arm_joint_speed_rad_s(伸手期间右臂关节峰值速度:中位数 0.9363 rad/s,90 百分位 5.3364 rad/s,最大值 10.8871 rad/s)。episode_index 在全部五个数据集中标识同一个演示,因此针对一个数据集所做的选择适用于其中任何一个。
关于恢复的说明
9,801 个演示中有 468 个(294 个生成批次中的 24 个)在写入磁盘时缺少 parquet 文件尾,通过重新读取行组进行了重建。重建的 episode 与其余部分携带相同的列和帧数,并通过了相同的检查;此处特别说明是因为重建文件是数据的一个值得了解的事实,而非因为已知其存在任何问题。
检查方式
在合并后的数据集上测量得出,而非断言:
- 9,801 个 episode 和 2,621,199 帧,该数值在
meta/info.json、parquet 文件尾和 parquet 行中一致。 episode_index从 0..9,800 运行,无重复;index从 0..2,621,198 按序运行,无重复。- 逐 episode 长度在
meta/episodes与数据之间一致;frame_index在每个 episode 中从 0 重新开始。 - 单一任务字符串
Grasp the mug and lift it.被每一帧引用。 - 60 个 episode 与其来源导出版本进行了逐值比较,其中一半位于合并边界上。
- 全部 29,403 个视频窗口对照其指向文件的时长进行了检查;882 个合并视频文件对照其来源进行了检查,其中 30 个通过 sha256 检查;从 60 个 episode 中解码了 180 个真实帧并与来源逐像素比较。



