stack_three_cups
收藏资源简介:
该数据集是使用LeRobot框架创建的机器人操作数据集,专注于UR5机械臂执行叠三个杯子(stack_three_cups)的演示任务。数据通过遥操作收集,包含50个完整演示回合,共计17945帧,每帧以15帧/秒的速率记录。每个样本包含7维关节动作(包括夹爪位置)和7维机器人状态(与动作空间相同),以及左右两个RGB摄像头图像(720×1280像素,AV1编码)和左右两个深度图像(单通道720×1280,HEVC无损编码,深度单位为毫米,有效范围0.01至10米)。此外,还提供时间戳、帧索引、回合索引、任务索引等元数据。数据集适用于机器人模仿学习、行为克隆、强化学习等任务,目标是在操作环境中学习将三个杯子叠放的动作策略。
This dataset is a robot manipulation dataset created using the LeRobot framework, focusing on the UR5 robotic arm performing the task of stacking three cups (stack_three_cups). Data is collected via teleoperation, containing 50 complete demonstration episodes with a total of 17,945 frames recorded at 15 frames per second. Each sample includes 7-dimensional joint actions (including gripper position) and 7-dimensional robot states (same as action space), as well as left and right RGB camera images (720×1280 pixels, AV1 encoded) and left and right depth images (single-channel 720×1280, HEVC lossless encoding, depth in millimeters, valid range 0.01 to 10 meters). Additionally, metadata such as timestamps, frame indices, episode indices, and task indices are provided. The dataset is suitable for tasks such as robot imitation learning, behavioral cloning, and reinforcement learning, aiming to learn action strategies for stacking three cups in a manipulation environment.
数据集概述
该数据集名为 khoviadin/stack_three_cups,是一个用于机器人操作任务(堆叠三个杯子)的机器人数据集,基于 LeRobot 框架创建。
基本信息
- 许可协议:Apache 2.0
- 任务类型:机器人操作(Robotics)
- 数据格式:Parquet(特征数据)与 MP4(视频数据)混合格式
- 代码版本:LeRobot v3.0
- 机器人类型:Mantis Follower(UR5 机械臂)
数据规模
- 总片段数(Episodes):50
- 总帧数(Frames):17,945
- 总任务数(Tasks):1(堆叠三个杯子)
- 数据文件大小:约 100 MB(Parquet)+ 200 MB(视频)
- 训练/测试划分:仅包含训练集(
train: 0:50),共 50 个片段全部用于训练
数据采集频率与分辨率
- 采样频率:15 FPS
- 图像分辨率:720 × 1280 像素
数据特征
每个数据样本包含以下关键特征:
-
动作(Action)
- 维度:7 维
- 数据类型:float32
- 内容:UR5 机械臂 6 个关节位置(left_shoulder_pan、left_shoulder_lift、left_elbow、left_wrist_1、left_wrist_2、left_wrist_3)以及夹爪位置(gripper.pos)
-
观察状态(Observation.state)
- 维度:7 维
- 数据类型:float32
- 内容:与动作相同的 7 个状态变量(关节位置 + 夹爪位置)
-
观察图像(Observation.images)
- 左相机(left):RGB 视频,720×1280×3,AV1 编码
- 右相机(right):RGB 视频,720×1280×3,AV1 编码
- 左深度相机(left_depth):深度视频,720×1280×1,HEVC 无损编码,单位毫米,深度范围 0.01–10.0 米
- 右深度相机(right_depth):深度视频,720×1280×1,HEVC 无损编码,单位毫米,深度范围 0.01–10.0 米
-
其他元数据
timestamp:float32,时间戳frame_index:int64,帧索引episode_index:int64,片段索引index:int64,全局索引task_index:int64,任务索引
数据获取方式
- 该数据集由 LeRobot 框架(https://github.com/huggingface/lerobot)生成,可用于机器人操作任务的学习与评估。
- 提供了可视化工具链接:https://huggingface.co/spaces/lerobot/visualize_dataset?path=khoviadin/stack_three_cups
引用信息
该数据集的 BibTeX 引用信息目前暂未提供(标注为 [More Information Needed])。




