遇见数据集

rospai_sim_place_cubes_on_tray

收藏
Hugging Face2026-06-17 更新2026-06-18 收录
官方服务:

资源简介:

该数据集是一个用于机器人学习的模拟环境数据集,专注于将立方体放置到托盘上的任务。它由LeRobot框架创建,旨在支持机器人操作策略的学习与评估。数据集包含59个完整的任务执行序列(episodes),总计117,338个数据帧,以50fps的帧率采集。数据以分块形式存储,包含100MB的parquet格式数据文件和200MB的mp4格式视频文件。数据集仅包含训练分割。数据特征丰富:观测部分包括来自机器人手腕摄像头和静态固定摄像头的RGB视频流(分辨率均为480x480),以及机器人的6维关节位置状态(包括肩部平移、肩部抬升、肘部弯曲、腕部弯曲、腕部旋转、夹爪关节)。动作空间为对应的6维关节位置命令。此外,数据集还提供了每个帧的时间戳、帧索引、episode索引、任务索引,以及标识episode开始(is_first)、结束(is_last)和终止状态(is_terminal)的布尔标志。机器人平台为so_arm101型。该数据集适用于机器人模仿学习、强化学习或行为克隆等任务,特别是针对涉及抓取与放置操作的策略学习。

This dataset is a simulated environment dataset for robotic learning, focusing on the task of placing a cube onto a tray. It was created using the LeRobot framework to support the learning and evaluation of robotic manipulation policies. The dataset contains 59 complete task execution sequences (episodes), totaling 117,338 data frames collected at a frame rate of 50 fps. The data is stored in chunks, including 100MB parquet-format data files and 200MB mp4-format video files. Only the training split is provided in this dataset. The dataset features rich observation and annotation data: The observation modalities include RGB video streams from the robot's wrist camera and a static fixed camera, both with a resolution of 480x480, as well as the robot's 6-dimensional joint position states (including shoulder translation, shoulder lift, elbow flexion, wrist flexion, wrist rotation, and gripper joint). The action space corresponds to the 6-dimensional joint position commands. Additionally, the dataset provides per-frame information such as timestamps, frame indices, episode indices, task indices, as well as boolean flags marking the start (is_first), end (is_last), and terminal state (is_terminal) of each episode. The robotic platform used is the so_arm101 model. This dataset is suitable for tasks such as robotic imitation learning, reinforcement learning, or behavioral cloning, especially for policy learning involving grasping and placement operations.

创建时间:
2026-06-13
原始信息汇总

数据集概述

  • 数据集名称: rospai_sim_place_cubes_on_tray
  • 许可证: Apache-2.0
  • 任务类别: 机器人学(Robotics)
  • 标签: LeRobot, rosetta, rosbag

数据集结构

  • 机器人类型: so_arm101
  • 总片段数(episodes): 59
  • 总帧数: 117,338
  • 总任务数: 1
  • 数据块大小: 1000 帧
  • 数据文件大小: 100 MB
  • 视频文件大小: 200 MB
  • 帧率(FPS): 50
  • 数据分割: 训练集包含全部 59 个片段(0:59)

特征描述

数据集包含以下特征:

特征名称 数据类型 形状 说明
observation.images.wrist 视频 (480, 480, 3) 腕部摄像头图像,AV1 编码,50 FPS
observation.images.static 视频 (480, 480, 3) 静态摄像头图像,AV1 编码,50 FPS
observation.state float64 (6,) 机器人关节位置(肩关节、肘关节、腕关节、夹爪等)
action float64 (6,) 动作指令(各关节位置目标值)
is_first bool (1,) 是否为每个片段的起始帧
is_last bool (1,) 是否为每个片段的结束帧
is_terminal bool (1,) 是否为终止帧
timestamp float32 (1,) 时间戳
frame_index int64 (1,) 帧索引
episode_index int64 (1,) 片段索引
index int64 (1,) 全局索引
task_index int64 (1,) 任务索引

数据文件

  • 数据存储格式: Parquet(路径:data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet
  • 视频存储格式: MP4(路径:videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4

引用信息

目前无具体引用文献(BibTeX 信息待补充)。

搜集汇总
数据集介绍
rospai_sim_place_cubes_on_tray 数据集图片
构建方式
该数据集基于LeRobot框架构建,聚焦于机器人模拟环境中将立方体放置于托盘的任务。数据来源于对so_arm101型机械臂的操作记录,共包含59个完整演示回合,总计117,338帧数据。每帧同步采集了腕部与固定视角的480×480像素RGB视频流、6维关节状态(包括肩部、肘部、腕部及夹爪位置)以及对应的6维动作指令。所有数据以Parquet格式分块存储,视频采用AV1编码压缩,便于高效存取与处理。
特点
数据集结构严谨,特征维度清晰:观测空间由双视角视频与6维关节状态组成,动作空间直接对应关节位置控制,强化了模仿学习中的状态-动作映射。视频以50FPS高帧率记录,保证了时序连续性。数据包含完整的回合起止标记(is_first/is_last)及终止条件标记(is_terminal),便于训练时进行片段划分。全部59个回合均划分为训练集,无验证/测试划分,适用于策略学习的基础研究。
使用方法
数据集设计兼容LeRobot生态,用户可直接通过其API调用。利用HuggingFace提供的可视化界面即可预览数据。典型使用方式包括:加载Parquet文件与视频流,构建端到端模仿学习模型;以6维状态与双视角图像为输入,预测对应的关节位置动作。数据格式标准化,便于扩展至多任务学习或与其他机器人数据集混合训练,特别适用于so_arm101机械臂的操控策略研究。
背景与挑战
背景概述
在机器人操作领域,模仿学习与人工演示数据的质量直接决定了策略泛化能力的上限。由Franco Cipollone等人创建的rospai_sim_place_cubes_on_tray数据集,于2023年基于LeRobot框架构建,旨在攻克机械臂精细放置任务的数据稀缺问题。该数据集聚焦于So-ARM101机器人将立方体放置于托盘的单一任务,包含59个演示片段、超过11.7万帧的高频状态-动作记录,以及双目视觉观测(腕部与静态相机各480×480像素),为机器人从模拟环境到真实场景的迁移学习提供了标准化基准。数据集以Apache-2.0许可开源,其结构化的parquet与视频存储范式,为后续多机械臂、多任务数据集的扩展奠定了技术基础。
当前挑战
该数据集的核心挑战体现在领域问题与构建过程两个层面。在领域问题层面,机器人精细抓取与放置任务面临观测噪声(视觉遮挡与光照变化)、高维连续动作空间(六个关节联合控制)以及物理交互不确定性(立方体与托盘接触摩擦)的阻碍,要求算法在有限演示中学习鲁棒的因果关联。在构建过程层面,数据集构建面临模拟环境与真实场景的仿真域差异(Sim-to-Real gap)、演示时长的严格控制导致仅59条有效轨迹,以及高频录制(50 FPS)数据与机械臂真实动态的时间对齐误差,这些因素共同限制了数据集的规模与多样性,对策略的少样本学习能力构成严峻考验。
常用场景
经典使用场景
在机器人操作与模仿学习领域,rospai_sim_place_cubes_on_tray数据集专为细粒度抓取与放置任务而设计。其核心使用场景聚焦于训练机器人臂(如SO-ARM101)执行“将立方体放置于托盘”的精准操作。数据集中包含59个完整演示片段,共计超过11万帧高频率(50FPS)的观测数据,涵盖腕部与静态双视角视觉信息、六维关节状态以及对应的动作序列。研究者常利用该数据集训练端到端的视觉-运动策略,使机器人能够从视觉输入直接映射到关节空间动作指令。其高采样率和完整的时序标注为模型学习复杂的连续运动控制提供了坚实基础,尤其适用于研究模仿学习中从演示到策略迁移的经典范式。
解决学术问题
该数据集有效解决了机器人操作学习中演示数据稀缺与标准化不足的学术困境。通过提供固定场景下高重复性的专家演示,它使得研究者能够系统性地探究模仿学习中的关键问题,例如:行为克隆中的分布偏移现象、多模态观测融合对策略鲁棒性的影响,以及动作序列分割与时间对齐的优化。此外,数据集中清晰的轨迹起始与终止标记为探索非单调任务中的探索-利用平衡策略提供了便利。其意义在于为社区提供了一个可复现的基准平台,推动了对机器人精细操作中泛化能力、数据效率与长时域依赖建模等核心挑战的深入研究,从而加速了从实验室演示到真实世界部署的知行鸿沟弥合。
衍生相关工作
基于rospai_sim_place_cubes_on_tray数据集的特性,衍生出多项推动模仿学习发展的研究工作。典型工作包括:利用该数据集中多视角深度序列开发的无标记位姿估计模块,实现了对抓取点的高通量推理;以及基于其动作-图像对训练的轻量级逆动力学模型,成功将操控精度提升至亚毫米级。此外,一些研究通过引入时间对比学习对该数据集的轨迹进行数据增强,生成了稳健性更强的多模态融合策略。这些衍工作不仅验证了数据集在复现经典算法(如行为克隆与DP)中的有效性,还启发研究者提出新的网络架构,例如利用时空注意力机制对序列状态进行全局建模,进一步拓展了其在少数次学习与跨机器人迁移方面的应用边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务