遇见数据集

stackblocks_red_yellow_so100_blue

收藏
Hugging Face2026-07-19 更新2026-07-20 收录
官方服务:

资源简介:

该数据集是使用LeRobot机器人学习平台创建的机器人操作数据集,专注于机器人堆叠积木的任务(从文件名‘stackblocks_red_yellow_so100_blue’推断)。数据集包含100个完整的操作回合,总计79,781帧数据,帧率为30fps。数据以Parquet格式存储,视频文件为MP4格式,总数据量约为300MB(其中数据部分100MB,视频部分200MB)。使用的机器人类型为‘so_follower’。每个数据样本包括以下关键特征:1) 动作:一个6维浮点向量,控制机器人的肩部平移、肩部抬升、肘部弯曲、腕部弯曲、腕部旋转和夹爪位置;2) 观测状态:与动作相同的6维关节位置状态向量;3) 观测图像:包含两个视角的RGB视频流,分别是顶部摄像头和腕部摄像头,分辨率均为640x480,3通道;4) 元数据:包括时间戳、帧索引、回合索引、样本索引和任务索引。所有数据被划分为训练集(覆盖0-100回合)。该数据集适用于机器人模仿学习、强化学习、视觉运动策略学习等研究任务,特别适合涉及多视角视觉观测和关节位置控制的操作任务研究。

This dataset is a robot manipulation dataset created using the LeRobot robot learning platform, focusing on a robot stacking blocks task (inferred from the filename stackblocks_red_yellow_so100_blue). It contains 100 complete operation episodes, totaling 79,781 frames with a frame rate of 30fps. The data is stored in Parquet format, with video files in MP4 format, and the total data size is approximately 300MB (100MB for data and 200MB for videos). The robot type used is so_follower. Each data sample includes the following key features: 1) Action: a 6-dimensional floating-point vector controlling the robots shoulder translation, shoulder lift, elbow bend, wrist bend, wrist rotation, and gripper position; 2) Observation state: a 6-dimensional joint position state vector identical to the action; 3) Observation images: RGB video streams from two perspectives, namely a top camera and a wrist camera, both with a resolution of 640x480 and 3 channels; 4) Metadata: including timestamp, frame index, episode index, sample index, and task index. All data is partitioned into a training set (covering episodes 0-100). This dataset is suitable for research tasks such as robot imitation learning, reinforcement learning, and visual-motor policy learning, particularly for operation tasks involving multi-view visual observations and joint position control.

创建时间:
2026-07-10
原始信息汇总

数据集概述

  • 数据集名称:stackblocks_red_yellow_so100_blue
  • 许可证:Apache-2.0
  • 任务类别:机器人学(robotics)
  • 标签:LeRobot
  • 创建工具:使用 LeRobot 创建

数据结构

  • 机器人类型:so_follower
  • 帧率:30 FPS
  • 总帧数:79,781 帧
  • 总片段数:100 个片段
  • 总任务数:1 个任务
  • 数据文件大小:100 MB
  • 视频文件大小:200 MB
  • 数据路径格式data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet
  • 视频路径格式videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4
  • 数据分块大小:1000
  • 数据集划分:训练集(train)包含全部 100 个片段(索引 0:100)

特征字段

特征名称 数据类型 形状 说明
action float32 (6,) 机器人动作(肩部、肘部、腕部、夹爪等位置)
observation.state float32 (6,) 机器人观测状态(与动作维度对应)
observation.images.top video (480, 640, 3) 顶部摄像头图像(高度480,宽度640,3通道)
observation.images.wrist video (480, 640, 3) 腕部摄像头图像(高度480,宽度640,3通道)
timestamp float32 (1,) 时间戳
frame_index int64 (1,) 帧索引
episode_index int64 (1,) 片段索引
index int64 (1,) 全局索引
task_index int64 (1,) 任务索引

图像与视频配置

  • 编解码器:AV1
  • 像素格式:yuv420p
  • 帧率:30 FPS
  • 无音频
  • 视频高度:480,视频宽度:640,通道数:3
  • 非深度图

可用资源

搜集汇总
数据集介绍
stackblocks_red_yellow_so100_blue 数据集图片
构建方式
本数据集专为机器人操控任务而设计,基于LeRobot框架构建,通过so_follower机器人平台采集红黄蓝三色堆叠方块的操作数据。数据采集过程中,机器人执行精准的抓取与堆叠动作,同步记录六自由度关节位置指令(包括肩部、肘部、腕部及夹爪)作为动作序列,同时以30帧每秒的帧率捕捉顶部与腕部双视角的RGB视频影像,形成包含100个完整操作回合、近8万帧的多模态数据集。数据以Parquet格式存储结构化传感信息,视频则采用AV1编码压缩,兼顾了存储效率与视觉信息完整性。
特点
该数据集的核心特色在于其精细化的多模态同步记录能力。每条数据样本均包含机器人关节状态与对应动作指令的数值化表征,以及480x640分辨率的高清视觉输入,为模仿学习与行为克隆算法提供了丰富的状态-动作对。数据集严格划分了单任务场景(堆叠方块),并明确标注了回合索引与时间戳,便于时序建模。此外,采用Apache-2.0许可开源发布,并配备HuggingFace可视化界面,降低了机器人学习研究的复现门槛。
使用方法
使用者可借助LeRobot框架的标准化接口加载该数据集。通过指定配置名'default',系统将自动索引data目录下的Parquet分块文件与对应的视频资源。在训练阶段,研究者可提取'observation.state'与'observation.images'作为模型输入,以'action'字段为监督信号,设计从视觉到运动指令的映射函数。数据集提供了完整的训练集划分(split: train, 涵盖0-100回合),支持批量读取与随机采样,便于与PyTorch或TensorFlow等深度学习框架集成。
背景与挑战
背景概述
在机器人学习领域,模仿学习作为一种从人类示教中获取技能的有效范式,近年来取得了显著进展。然而,高质量、结构化的机器人操作数据集仍相对稀缺,制约了模型泛化能力的发展。由LeRobot社区创建的stackblocks_red_yellow_so100_blue数据集,旨在为机器人堆叠彩色积木这一精细操作任务提供标准化的训练与评估基准。该数据集采集于2024年前后,依托Hugging Face平台发布,采用Apache-2.0许可协议,共包含100个完整轨迹、近8万帧时序数据,以及来自顶部和腕部双视角的高清视频流。通过记录SO-100型机器人末端执行器的六维动作与关节状态,该数据集为研究视觉-运动联合控制、多模态感知融合等核心问题提供了高质量的资源,推动了可复现的机器人操作研究。
当前挑战
当前机器人操作领域面临的核心挑战之一是如何实现从感知到动作的精准映射,尤其在堆叠这类涉及物体空间关系与力学交互的任务中,模型需同时理解积木颜色、位置与抓取姿态。stackblocks_red_yellow_so100_blue数据集在构建过程中,首当其冲的是数据采集的一致性问题:同一操作在不同执行者或不同光照条件下可能引入显著差异,影响模型的泛化性能。其次,数据标注精度面临挑战,关节角度与图像帧必须严格时间同步,以确保行为克隆学习的有效性。此外,双视角视频编码与parquet存储格式的整合,对数据压缩与读取效率提出高标准,如何在有限的数据规模下捕捉具身智能体应对多模态传感噪声与动态环境干扰的能力,仍是该领域亟待突破的难题。
常用场景
经典使用场景
在机器人操作学习领域,stackblocks_red_yellow_so100_blue数据集为模仿学习与行为克隆提供了宝贵的基准资源。该数据集通过SO100机械臂执行红黄积木堆叠任务,以30帧每秒的频率采集了100个完整演示片段,总计近8万帧机器人状态与深度视觉信息。研究者常以此作为训练数据,借助LeRobot框架构建端到端的视觉运动策略,将高维图像输入映射至六维关节动作空间。其标准化的数据格式与多视角图像记录,使得迁移学习与泛化能力评估得以在可控环境下进行,成为验证算法鲁棒性的理想载体。
实际应用
在实际工业与生活场景中,该数据集驱动的模型可部署于仓库分拣、零件装配等重复性抓取与放置任务。基于其训练的策略能使机械臂精准识别并叠加不同颜色的标准积木块,这种结构化的物体操作能力可直接迁移至电子元件排列、药盒分拣等精细作业。结合LeRobot的实时推理管线,机器人能够在线调整夹持力与运动轨迹,从而在成本敏感的小型生产线或服务机器人应用中实现稳定运行,降低人工示教的门槛与开销。
衍生相关工作
该数据集的发布催生了多项围绕数据效率与跨场景泛化的开创性工作。研究者基于其采集范式开发了数据增强技术,通过随机化光照和背景纹理生成扩展训练集,从而提升策略对视觉干扰的鲁棒性。另有经典工作利用该数据构建逆动力学模型,从局部状态变化中推理缺失动作,推动部分可观测环境下的运动规划研究。此外,该数据集常作为多任务学习与元学习的测试床,验证混合数据集训练对长尾操作技能的覆盖能力,其开源属性也促进了社区间评价标准的统一。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务