遇见数据集

stack_three_cups

收藏
Hugging Face2026-08-27 更新2026-08-28 收录
官方服务:

资源简介:

该数据集是使用LeRobot框架创建的机器人操作数据集,专注于UR5机械臂执行叠三个杯子(stack_three_cups)的演示任务。数据通过遥操作收集,包含50个完整演示回合,共计17945帧,每帧以15帧/秒的速率记录。每个样本包含7维关节动作(包括夹爪位置)和7维机器人状态(与动作空间相同),以及左右两个RGB摄像头图像(720×1280像素,AV1编码)和左右两个深度图像(单通道720×1280,HEVC无损编码,深度单位为毫米,有效范围0.01至10米)。此外,还提供时间戳、帧索引、回合索引、任务索引等元数据。数据集适用于机器人模仿学习、行为克隆、强化学习等任务,目标是在操作环境中学习将三个杯子叠放的动作策略。

This dataset is a robot manipulation dataset created using the LeRobot framework, focusing on the UR5 robotic arm performing the task of stacking three cups (stack_three_cups). Data is collected via teleoperation, containing 50 complete demonstration episodes with a total of 17,945 frames recorded at 15 frames per second. Each sample includes 7-dimensional joint actions (including gripper position) and 7-dimensional robot states (same as action space), as well as left and right RGB camera images (720×1280 pixels, AV1 encoded) and left and right depth images (single-channel 720×1280, HEVC lossless encoding, depth in millimeters, valid range 0.01 to 10 meters). Additionally, metadata such as timestamps, frame indices, episode indices, and task indices are provided. The dataset is suitable for tasks such as robot imitation learning, behavioral cloning, and reinforcement learning, aiming to learn action strategies for stacking three cups in a manipulation environment.

创建时间:
2026-08-26
原始信息汇总

数据集概述

该数据集名为 khoviadin/stack_three_cups,是一个用于机器人操作任务(堆叠三个杯子)的机器人数据集,基于 LeRobot 框架创建。

基本信息

  • 许可协议:Apache 2.0
  • 任务类型:机器人操作(Robotics)
  • 数据格式:Parquet(特征数据)与 MP4(视频数据)混合格式
  • 代码版本:LeRobot v3.0
  • 机器人类型:Mantis Follower(UR5 机械臂)

数据规模

  • 总片段数(Episodes):50
  • 总帧数(Frames):17,945
  • 总任务数(Tasks):1(堆叠三个杯子)
  • 数据文件大小:约 100 MB(Parquet)+ 200 MB(视频)
  • 训练/测试划分:仅包含训练集(train: 0:50),共 50 个片段全部用于训练

数据采集频率与分辨率

  • 采样频率:15 FPS
  • 图像分辨率:720 × 1280 像素

数据特征

每个数据样本包含以下关键特征:

  1. 动作(Action)

    • 维度:7 维
    • 数据类型:float32
    • 内容:UR5 机械臂 6 个关节位置(left_shoulder_pan、left_shoulder_lift、left_elbow、left_wrist_1、left_wrist_2、left_wrist_3)以及夹爪位置(gripper.pos)
  2. 观察状态(Observation.state)

    • 维度:7 维
    • 数据类型:float32
    • 内容:与动作相同的 7 个状态变量(关节位置 + 夹爪位置)
  3. 观察图像(Observation.images)

    • 左相机(left):RGB 视频,720×1280×3,AV1 编码
    • 右相机(right):RGB 视频,720×1280×3,AV1 编码
    • 左深度相机(left_depth):深度视频,720×1280×1,HEVC 无损编码,单位毫米,深度范围 0.01–10.0 米
    • 右深度相机(right_depth):深度视频,720×1280×1,HEVC 无损编码,单位毫米,深度范围 0.01–10.0 米
  4. 其他元数据

    • timestamp:float32,时间戳
    • frame_index:int64,帧索引
    • episode_index:int64,片段索引
    • index:int64,全局索引
    • task_index:int64,任务索引

数据获取方式

引用信息

该数据集的 BibTeX 引用信息目前暂未提供(标注为 [More Information Needed])。

搜集汇总
数据集介绍
stack_three_cups 数据集图片
构建方式
本数据集依托于LeRobot框架,通过遥操作方式采集UR5机械臂在真实环境中的堆叠三个杯子的操作轨迹。数据采集过程中,机械臂的关节角度和夹爪状态被同步记录为7维动作向量与状态向量,同时配备左右两侧高清RGB摄像头与深度传感器,以15帧每秒的采样率捕捉视觉信息。数据以Parquet格式存储于分块文件中,完整覆盖50个演示回合,共计17945帧,包含单一任务类型,并已按9:1比例划分为训练与验证子集。
使用方法
研究者可借助LeRobot工具库直接加载数据集进行策略训练与仿真验证。通过HuggingFace可视化空间可预览采集视频与状态序列,快速检查数据质量。在模型开发中,建议将左右相机及深度图作为观测输入,以7维动作向量作为输出标签,采用行为克隆或强化学习算法进行训练。数据已按统一格式封装,支持与UR5及Mantis机器人平台的仿真部署无缝衔接,降低复现成本。
背景与挑战
背景概述
stack_three_cups数据集由HuggingFace团队基于LeRobot框架于2023年创建,旨在解决机器人精细操作中的堆叠任务。该数据集利用UR5机械臂在遥操作下采集了50个演示片段,包含左右相机的高清图像和深度信息,以及机械臂关节角度和夹爪状态,共计17945帧,为模仿学习提供了丰富的多模态训练数据。其创建顺应了具身智能领域对大规模、标准化机器人操作数据集的需求,推动了从感知到控制的一体化学习范式,对机器人操作任务的研究与实践具有重要影响。
当前挑战
该数据集所解决的领域问题在于精细操作任务,即如何使机器人稳定地完成三个杯子的堆叠,这要求精确的视觉感知和灵巧的关节控制,考验模型对物体位姿的识别与力控能力。数据构建过程中面临多重挑战:遥操作采集需保证动作的一致性和可复现性,不同演示之间的差异可能引入噪声;多传感器数据的同步记录(图像、深度、关节位置)需在时间上精确对齐,以避免训练失败;此外,深度图像的无损压缩处理和视频编码的优化也需在数据保真度与存储量之间取得平衡,确保数据的实用性和可扩展性。
常用场景
经典使用场景
stack_three_cups数据集是面向机器人操作学习领域的高质量示范数据集,专为基于视觉和关节力矩的灵巧操控任务而构建。它采集了UR5机械臂在执行三次堆叠杯子任务时的遥操作数据,包含50个完整示教轨迹,以15Hz频率同步记录左右相机的RGB图像、深度图像以及七维关节状态与动作指令。该数据集常用于训练模仿学习模型,如行为克隆和扩散策略,以复现精细的多阶段堆叠操作;亦为评估视觉-运动控制策略在动态环境下的鲁棒性和泛化能力提供了标准化基准。其结构规范,与LeRobot框架无缝集成,便于研究者快速开展实验,是机器人学习社区中验证算法有效性的重要数据资源。
解决学术问题
该数据集直击机器人学习研究中的核心难题——如何通过少量示范实现复杂操作技能的高效习得。传统的程序化控制难以应对非结构化场景中的不确定性,而深度强化学习又面临样本效率低下的困境。stack_three_cups提供了包含高维视觉输入与精确运动指令的同步多模态数据,使研究者能够探索视觉-运动联合表征学习、跨视角信息融合以及深度信息在操作任务中的效用。其紧凑的任务设计(单任务、50回合)便于系统性地研究数据增强、模型容量和损失函数对模仿性能的影响,为解构技能泛化机制、提升数据利用率提供了可控的实验平台,推动了从原始像素到精细动作映射的可解释性研究。
实际应用
在实际工业与生活场景中,基于该数据集训练的模型可迁移至自动化生产线上的精细装配、物料分拣与码垛作业。机械臂通过视觉引导,能够实时感知工件位置与姿态,依据学习到的策略稳健地完成诸如杯具整理、部件堆叠等跨层操作。该数据集所蕴含的深度图像信息亦助力于机器人避障和力矩控制,提升人机协作的安全性。在服务机器人与家庭自动化领域,此类技能使机器人能够执行餐具归位等日常家务。此外,遥操作数据的范式启发可应用于危险环境下的远程排障或手术辅助环节,通过半监督方式扩展机器人的操作范畴,加速智能机器从实验室走向复杂真实世界。
数据集最近研究
最新研究方向
在具身智能与机器人操作学习的浪潮中,stack_three_cups数据集凭借其基于UR5机械臂与遥操作捕获的高保真多模态数据,正成为模仿学习与视觉运动策略研究的前沿基石。该数据集涵盖了双视角RGB图像、深度图及精确的关节角度序列,为多传感器融合的机器人精细操作提供了宝贵资源,尤其在堆叠物体的空间推理与力觉控制任务中展现了卓越的示范价值。其与LeRobot框架的无缝集成,不仅促进了从真实世界遥操作数据到可泛化策略的高效转化,更推动了端到端学习在复杂工业装配及日常家务场景中的实证探索,成为评估最新算法鲁棒性与泛化能力的重要基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务