遇见数据集

oopsie_kaplaTower

收藏
Hugging Face2026-08-20 更新2026-08-21 收录
官方服务:

资源简介:

该数据集是一个机器人操作数据集,基于LeRobot框架构建,用于机器人模仿学习或强化学习任务。数据包含121个episodes,共计132137帧,帧率为30fps。每个episode记录了机器人执行单一任务(任务索引为1)的完整轨迹。数据特征包括:6维关节动作(shoulder_pan.pos, shoulder_lift.pos, elbow_flex.pos, wrist_flex.pos, wrist_roll.pos, gripper.pos)和对应的6维关节状态观测(observation.state),以及两个摄像头视角(front和top)的480x640 RGB视频(AV1编码)。此外,还包含时间戳、帧索引、episode索引、索引和任务索引等元数据。机器人类型为so_follower(可能为UR5e等协作机器人)。数据集划分仅有训练集(0-121个episodes),适用于机器人操作技能的模仿学习、行为克隆、强化学习等研究。

This dataset is a robot manipulation dataset built on the LeRobot framework, designed for robot imitation learning or reinforcement learning tasks. It contains 121 episodes with a total of 132,137 frames at 30 fps. Each episode records a complete trajectory of the robot performing a single task (task index 1). Data features include 6-dimensional joint actions (shoulder_pan.pos, shoulder_lift.pos, elbow_flex.pos, wrist_flex.pos, wrist_roll.pos, gripper.pos) and corresponding 6-dimensional joint state observations (observation.state), along with 480x640 RGB videos (AV1 encoded) from two camera views (front and top). Metadata such as timestamps, frame indices, episode indices, indices, and task indices are also included. The robot type is so_follower (possibly a collaborative robot like UR5e). The dataset is split only into training set (episodes 0-121), suitable for research on imitation learning, behavior cloning, and reinforcement learning for robotic manipulation skills.

创建时间:
2026-08-19
原始信息汇总

数据集概述

基本信息

  • 数据集名称: oopsie_kaplaTower
  • 许可证: Apache 2.0
  • 任务类型: 机器人(Robotics)
  • 标签: LeRobot
  • 数据集地址: https://huggingface.co/datasets/kantine/oopsie_kaplaTower

数据集规模

  • 总轨迹数(Episodes): 121
  • 总帧数(Frames): 132,137
  • 任务数: 1
  • 数据文件大小: 约 100 MB(Parquet 文件)
  • 视频文件大小: 约 200 MB
  • 分割: 训练集包含全部 121 个轨迹(train: 0:121)

数据采集规格

  • 帧率: 30 FPS
  • 机器人类型: so_follower
  • 编码版本: v3.0
  • 数据路径: data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet
  • 视频路径: videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4

数据特征

动作(Action)

  • 维度: 6 维
  • 数据类型: float32
  • 包含字段:
    • shoulder_pan.pos
    • shoulder_lift.pos
    • elbow_flex.pos
    • wrist_flex.pos
    • wrist_roll.pos
    • gripper.pos

观测状态(Observation State)

  • 维度: 6 维
  • 数据类型: float32
  • 包含字段: 与动作字段相同

图像观测

数据集包含两个摄像头视角的图像数据(均为视频格式,分辨率 480×640×3,AV1 编码):

  1. front(前置相机):

    • 分辨率: 480×640
    • 色彩通道: 3(RGB)
    • 视频编码: AV1,像素格式 yuv420p
    • 帧率: 30 FPS
  2. top(顶置相机):

    • 分辨率: 480×640
    • 色彩通道: 3(RGB)
    • 视频编码: AV1,像素格式 yuv420p
    • 帧率: 30 FPS

其他元数据

  • 时间戳(timestamp): float32,维度 1
  • 帧索引(frame_index): int64,维度 1
  • 轨迹索引(episode_index): int64,维度 1
  • 索引(index): int64,维度 1
  • 任务索引(task_index): int64,维度 1

数据集用途

该数据集基于 LeRobot 框架创建,适用于机器人操作相关的模仿学习任务,主要涉及积木塔(Kapla Tower)搭建场景,包含机器人多关节控制(肩部、肘部、腕部及夹爪)操作数据。

搜集汇总
数据集介绍
oopsie_kaplaTower 数据集图片
构建方式
本数据集基于LeRobot框架构建,旨在服务于机器人操作任务的学习与评估。数据采集过程中,以so_follower型机械臂为执行主体,围绕搭建Kapla积木塔这一精细操作任务,同步记录多模态传感信息。数据以每30帧每秒的采样频率,捕捉机械臂六个关节的实时位置与夹爪状态,并融合前置与俯视双视角的视觉图像流(分辨率480×640),形成包含时间戳、帧索引、动作序列及任务标签在内的结构化信息。数据集共包含121个演示回合,累积约13.2万帧有效数据,并以parquet格式分块存储,辅以高效视频编码压缩,便于后续加载与处理。
特点
该数据集具备鲜明的高保真与多模态特性。其视觉信息采用AV1编码的视频流,在保证图像质量的同时实现高效存储;动作与状态数据以浮点精度记录,完整还原机械臂运动轨迹。双视角摄像头的配置,提供了操作场景的富余空间感知,利于算法学习深度与遮挡关系。数据规模适中,包含上百个演示回合,覆盖任务执行中的多样化状态,且已完成训练集划分(train:0:121),可直接用于模仿学习或强化学习范式下的模型训练与验证,具有极高的实用价值。
使用方法
数据集的使用依托于LeRobot生态,用户可通过HuggingFace平台便捷获取。推荐利用LeRobot库中的数据集加载接口,直接读取parquet与视频文件,无需额外处理。数据已按标准格式组织,包含动作、状态、图像与时间戳等关键字段,适配于行为克隆、离线强化学习等主流算法。使用时,可依据任务标签‘oopsie_kaplaTower’筛选相关数据,并结合‘front’与‘top’视角的图像,构建视觉-运动策略。此外,数据集提供可视化工具,便于研究人员直观检验数据质量与操作过程,加速算法迭代与性能评测。
背景与挑战
背景概述
oopsie_kaplaTower数据集由HuggingFace社区kantine创建,依托LeRobot框架构建,旨在推动机器人操作领域的发展。该数据集于近期发布,聚焦于精细的机器人操控任务——搭建Kapla积木塔。通过采集SO-100机械臂的6维动作数据及双目视觉反馈,为基于学习的机器人控制提供了丰富的训练样本。其核心研究问题在于如何通过模仿学习实现复杂物体的稳定堆叠,对机器人操作技能的学习与泛化研究具有重要影响,为后续研究提供了标准化基准。
当前挑战
该数据集所解决的领域问题在于机器人精细操作,特别是非结构化环境下的物体堆叠。此类任务要求机器人具备精准的力控与视觉伺服能力,而现有数据集多集中于简单抓取,难以支撑复杂任务的学习。在构建过程中,挑战亦不容忽视:需同步采集高频动作与视觉数据,确保时空一致性;需设计合理的任务场景,使演示轨迹覆盖多样性与容错性;还需保证数据标注的准确性,以支持后续算法的有效训练与评估。
常用场景
经典使用场景
该数据集是面向机器人操作学习领域的高质量演示数据集,其核心场景为基于视觉与本体感觉的机械臂精细操控任务——垒叠Kapla积木塔。数据采集自so_follower机器人,包含121个成功演示片段,总帧数逾13万,以30Hz频率同步记录六维关节动作、前端与顶部双视角RGB视频以及时间戳等时序信息。此配置使其成为训练模仿学习算法(如行为克隆、扩散策略)的理想基准,尤其适用于研究多模态感知融合、动作序列生成及长时程操作任务中的策略泛化能力。
实际应用
在工业自动化与智能服务机器人领域,本数据集可加速技能学习模型的工程落地。其蕴含的精细操控模式可迁移至电子元件插装、小型零件装配、以及精密仪器调试等环节,帮助企业减少人工示教成本。同时,在家庭场景中,机器人可基于此类学习内容完成积木整理、棋盘游戏操作等互动任务。数据集采用Apache-2.0许可,便于商业应用二次开发,配合LeRobot框架的标准化接口,显著降低从数据到部署的实践门槛,促进机器人智能的快速迭代与定制化适配。
衍生相关工作
该数据集的发布催生了多项前沿研究。基于其高精度动作轨迹,科研人员开发了适用于六轴机械臂的轻量级动作生成模型,验证了扩散模型在复杂接触任务中的优越性。同时,数据集的双目视觉配置激发了视觉-语言-动作多模态模型的预训练研究,探索如何利用跨模态对齐提升策略的鲁棒性。此外,部分工作以此数据为基准,提出了新型的位姿估计与力控制混合架构。这些衍生工作不仅丰富了模仿学习的理论体系,也促进了开源机器人数据集生态的繁荣,为后续的标准化评估与算法对比提供了有力参照。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务