遇见数据集

rollout_stackblocks_iter2_rollout

收藏
Hugging Face2026-07-19 更新2026-07-20 收录
官方服务:

资源简介:

该数据集是使用LeRobot框架创建的机器人操作数据集,包含67个episodes,总计50729个frames,以30帧每秒的速率采集。数据集的核心内容包括:机器人的动作指令(包含6个关节位置:肩部平移、肩部抬升、肘部弯曲、腕部弯曲、腕部旋转和夹爪位置),机器人的状态观测(与动作相同的6个关节位置),以及来自两个摄像头的视觉观测——一个顶部摄像头和一个腕部摄像头,每个提供480x640分辨率的RGB视频。此外,数据集还包含干预信号、下一步是否成功的标志、时间戳以及多个索引(帧索引、episode索引、总体索引和任务索引)。数据以parquet文件格式组织,并包含相应的MP4视频文件,总大小约为300MB。该数据集适用于机器人学习任务,如模仿学习、强化学习或行为克隆,特别是涉及多模态感知(状态+视觉)和操作的任务。

This dataset is a robot manipulation dataset created using the LeRobot framework. It contains 67 episodes, totaling 50729 frames, collected at a rate of 30 frames per second. The core content of the dataset includes: robot action commands (comprising 6 joint positions: shoulder translation, shoulder lift, elbow bend, wrist bend, wrist rotation, and gripper position), robot state observations (the same 6 joint positions as the actions), and visual observations from two cameras—a top camera and a wrist camera, each providing RGB video at 480x640 resolution. Additionally, the dataset contains intervention signals, a flag indicating success in the next step, timestamps, and multiple indices (frame index, episode index, overall index, and task index). The data is organized in parquet file format and includes corresponding MP4 video files, with a total size of approximately 300MB. This dataset is suitable for robot learning tasks such as imitation learning, reinforcement learning, or behavior cloning, particularly those involving multimodal perception (state + vision) and manipulation.

创建时间:
2026-07-14
原始信息汇总

数据集概述

  • 数据集名称:rollout_stackblocks_iter2_rollout
  • 许可证:Apache-2.0
  • 任务类别:机器人学(robotics)
  • 标签:LeRobot

数据集结构

  • 数据格式:使用 Parquet 文件存储,路径为 data/*/*.parquet
  • 帧率(FPS):30
  • 总集数(Episodes):67
  • 总帧数(Frames):50,729
  • 总任务数(Tasks):1
  • 机器人类型:so_follower
  • 数据切分
    • 训练集:索引 0 至 66(共 67 集)

特征(Features)

  • 动作(action):6 维浮点数,包含机械臂各关节位置(shoulder_pan、shoulder_lift、elbow_flex、wrist_flex、wrist_roll)及夹爪位置(gripper)
  • 观察状态(observation.state):6 维浮点数,与动作特征相同
  • 观察图像(observation.images)
    • 顶部摄像头(top):视频数据,分辨率 480×640,3 通道,编码为 AV1,帧率 30 FPS
    • 腕部摄像头(wrist):视频数据,分辨率 480×640,3 通道,编码为 AV1,帧率 30 FPS
  • 干预标签(intervention):布尔值,1 维
  • 下一步成功标志(next.success):布尔值,1 维
  • 时间戳(timestamp):浮点数,1 维
  • 帧索引(frame_index):整数,1 维
  • 集数索引(episode_index):整数,1 维
  • 索引(index):整数,1 维
  • 任务索引(task_index):整数,1 维

数据文件信息

  • 数据文件大小:约 100 MB
  • 视频文件大小:约 200 MB
  • 数据文件路径data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet
  • 视频文件路径videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4

创建工具

搜集汇总
数据集介绍
rollout_stackblocks_iter2_rollout 数据集图片
构建方式
该数据集名为 rollout_stackblocks_iter2_rollout,基于 LeRobot 框架构建,专注于机器人堆叠方块任务的滚动式数据收集。数据以 Parquet 格式存储,包含 67 个片段,总计 50729 帧,均由单一任务驱动。每个片段记录了机器人执行堆叠操作时的完整轨迹,包括 6 维动作向量(肩部、肘部、腕部及夹爪位置)与对应的观察状态。图像数据通过顶部和腕部摄像头以每秒 30 帧的频率采集,分辨率为 480x640,采用 AV1 编码压缩,并辅以干预标志、成功标志及时间戳等信息。所有数据按 1000 帧为块进行组织,便于高效读取与处理。
特点
该数据集最显著的特点在于其结构化与多模态特性。它同时提供动作状态与视觉观测,支持模仿学习等算法的训练。图像流以高压缩比的视频编码存储,兼顾数据规模与质量。此外,数据集包含布尔型干预标志,可区分自动执行与人工干预的轨迹片段,为探索混合式控制策略提供了可能性。成功标志记录了每个样本的任务完成情况,便于进行目标导向的建模。整体上,数据集以 67 个片段构成紧凑的训练集,涵盖完整的堆叠任务流程,且机器人类型明确,适用于现实世界中的灵巧操作研究。
使用方法
使用该数据集时,可通过 LeRobot 库直接加载,将 Parquet 文件与视频数据整合为易于迭代的格式。训练时,需利用动作向量与观察状态进行策略网络的设计,视觉图像可作为输入特征增强感知能力。建议先读取 meta/info.json 文件了解特征维度与编码细节,再通过数据加载器按片段或帧索引访问。由于数据集仅提供训练拆分,用户可自行划分验证集。在模型评估中,可利用成功标志量化任务完成率,并结合干预标志分析策略的依赖性。对于视频数据,需确保环境支持 AV1 解码以正确读取图像帧。
背景与挑战
背景概述
在机器人学习领域,模仿学习作为一种高效策略,使机器人能够通过观察专家演示来习得复杂操作技能。然而,真实环境中数据采集成本高昂且可扩展性受限,促使研究者构建结构化数据集以推动算法验证与迁移。rollout_stackblocks_iter2_rollout数据集由Hugging Face社区与LeRobot框架联合发布,基于so_follower机器人平台收集,聚焦于积木堆叠这一精细操作任务。该数据集包含67个演示片段、共计50729帧,以30帧每秒采集了机器人关节状态、动作指令及来自顶部和腕部摄像头的视觉信息,为研究关节空间与视觉模态的协同学习提供了标准化基准。其Apache-2.0许可协议促进了学术与工业界的广泛复用,显著推进了具身智能领域中从仿真到真实场景的算法泛化能力研究。
当前挑战
该数据集所解决的领域问题聚焦于机器人精细操作中的模仿学习瓶颈,尤其是多模态信息融合与长时域任务执行的一致性挑战。积木堆叠要求机器人精确控制六自由度机械臂及夹爪,并在视觉反馈下实时调整姿态,对动作序列的平滑性和鲁棒性构成严峻考验。在构建过程中,研究者需应对高维状态空间与动作空间的匹配难题,确保从人类演示到机器人策略的迁移不因系统动态差异而失真;同时,数据采集时需平衡场景多样性(如光照变化、积木位姿变异)与标注精度的矛盾,避免过拟合于特定环境。此外,视频压缩编码与实时性约束(如FPS保真度)亦对数据质量与存储效率的权衡提出了挑战。
常用场景
经典使用场景
在机器人学习领域,rollout_stackblocks_iter2_rollout数据集作为模仿学习与行为克隆范式的核心训练资源,其经典使用场景聚焦于基于视觉的精细操作任务——积木堆叠。该数据集通过采集机器人从初始状态到成功完成堆叠的全轨迹数据,包含高帧率的顶部与腕部双视角视频流、六维关节位姿信息以及动作序列。研究者通常利用其中的“观察-动作”对,训练端到端的神经网络模型,使其习得从视觉输入映射至机械臂运动指令的复杂策略,尤其适用于验证离线强化学习算法的泛化能力与鲁棒性。
衍生相关工作
受该数据启发,学界衍生出多项开创性工作。基于其高保真回放轨迹,研究者提出了利用扩散模型生成多样化演示的“数据增强”策略,有效扩大了策略的泛化范围。同时,结合Transformer架构的工作探索了时序注意力机制在多步堆叠规划中的潜力,衍生出如“动作分块”(Action Chunking)与“观测预测”等经典范式。另一些工作则围绕其开源框架LeRobot,构建了标准化的基准测试套件,催生了跨平台评估体系,加速了机器人学习社区的协作与复现,成为验证新算法有效性的标杆。
数据集最近研究
最新研究方向
该数据集聚焦于机器人操作领域的模仿学习与强化学习结合的前沿探索,特别是通过LeRobot框架实现的堆叠方块任务(StackBlocks)的迭代式数据采集与策略优化。当前研究热点集中于利用大规模、高帧率的多模态数据(包括顶部与腕部摄像头视频、6维关节状态及动作序列)训练机器人泛化操作能力,并探讨人类干预(intervention)标记对数据质量与策略鲁棒性的影响。随着具身智能与机器人的深度融合,此类细粒度、带任务成功标记(next.success)的仿真与真实世界混合数据集,正成为推动机器人从简单抓取向复杂装配行为演进的关键基石,对构建可复用、可扩展的机器人学习基准具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务