遇见数据集

HyeonseokE/SO101-StackBlock_Ours_80epi

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集使用LeRobot工具创建,专注于机器人学任务。数据集包含80个训练片段,共69000帧,采样率为10fps。机器人类型为so101_follower,数据以Parquet格式存储,总数据文件大小为100MB,视频文件大小为200MB。特征包括机器人关节位置状态(6维浮点数组)、动作(6维浮点数组)、来自顶部和左腕摄像头的视频观察(分辨率480x640,3通道RGB,H.264编码)、末端执行器位置和姿态(6维浮点数组)、二值化夹爪状态、技能自然语言描述、技能验证问题、技能类型、技能进度、技能目标位置(关节空间和机器人坐标系)、子任务自然语言描述、子任务对象名称、子任务目标位置、时间戳、帧索引、片段索引、索引和任务索引。所有数据均用于训练分割。

This dataset was created using the LeRobot tool and focuses on robotics tasks. It contains 80 training episodes with a total of 69,000 frames at a sampling rate of 10fps. The robot type is so101_follower, and the data is stored in Parquet format, with a total data file size of 100MB and video file size of 200MB. Features include robot joint position states (6-dimensional float array), actions (6-dimensional float array), video observations from top and left wrist cameras (resolution 480x640, 3-channel RGB, H.264 encoded), end-effector position and pose (6-dimensional float array), binarized gripper state, skill natural language descriptions, skill verification questions, skill types, skill progress, skill goal positions (in joint space and robot coordinates), subtask natural language descriptions, subtask object names, subtask target positions, timestamps, frame indices, episode indices, indices, and task indices. All data is used for the training split.

提供机构:
HyeonseokE
搜集汇总
数据集介绍
HyeonseokE/SO101-StackBlock_Ours_80epi 数据集图片
构建方式
SO101-StackBlock_Ours_80epi数据集基于LeRobot框架构建,专为机器人操作任务设计。通过实际机器人平台采集,共包含80个演示回合,总帧数达69000帧,数据以10帧/秒的帧率记录。数据集结构清晰,使用Parquet格式存储状态与动作数据,并配备独立的MP4视频文件记录视觉观测。所有数据分为训练集(0至79回合),并遵循统一的元信息结构,便于后续处理与分析。
特点
该数据集的一个显著特色在于其多模态特性,融合了关节角度状态、末端执行器位姿、二进制夹爪状态以及从顶部和左手腕视角获取的高清视觉图像(480×640像素)。尤为突出的是,它引入了层级化的任务语义标注,包含自然语言描述的技能与子任务、目标位置及验证问题,为复杂任务学习提供了丰富的上下文信息。总数据量约300MB,兼顾了数据规模与采样精度。
使用方法
数据集依托LeRobot生态,可直接通过其可视化工具进行浏览与预览。使用时,研究人员可加载Parquet数据文件,提取6维状态与动作序列,并结合视频帧进行模仿学习或强化学习训练。建议首先通过`meta/info.json`了解数据分片结构与特征定义,再依据任务需求(如堆叠方块)筛选对应回合与技能标注。对多步技能建模,可充分利用自然语言与进度标注信息进行序列分解。
背景与挑战
背景概述
SO101-StackBlock_Ours_80epi数据集由HyeonseokE团队于近期构建,基于LeRobot框架,专注于机器人操作领域中的堆叠方块任务。该数据集依托SO101型机器人平台,通过80个示范片段采集了约69,000帧的高质量数据,涵盖关节角度、末端执行器位姿、多视角图像及语言描述等多模态信息。其核心研究问题在于推动机器人从人类示范中学习精细操作技能,尤其是在结构化环境中完成堆叠任务。该数据集为模仿学习、行为克隆及机器人任务规划等领域提供了标准化基准,对提升机器人操作泛化能力具有重要价值。
当前挑战
该数据集所解决的领域问题集中在机器人精细操作控制,尤其是堆叠任务中面临的视觉与物理交互双重挑战,如物体姿态估计、力控制及误差累积。构建过程中,挑战包括:1) 多模态数据同步采集——需协调6自由度关节状态、10fps视频流及语言标注的精确时间对齐;2) 示范多样性不足——仅80个片段可能难以覆盖所有操作变化;3) 传感器噪声与标定误差——机器人运动学模型与视觉系统的联合校准直接影响数据质量;4) 任务复杂性——堆叠操作要求连续姿态调整,对动作序列的时序一致性提出了严苛要求。
常用场景
经典使用场景
在机器人操作与模仿学习领域,SO101-StackBlock_Ours_80epi数据集为堆叠方块(Stack Block)这一经典灵巧操作任务提供了精细化、结构化的训练与评估基准。该数据集基于SO101机器人平台采集,包含80个完整示范片段,总帧数达69000帧,以10Hz频率同步记录6维关节状态、6维末端执行器位姿、夹爪状态以及来自顶部和左腕的双视角RGB视频流。其数据格式遵循LeRobot规范,支持端到端的行为克隆、隐式策略学习以及基于扩散模型的机器人策略训练。研究者可借助该数据集直接训练机器人从视觉输入映射至低维动作指令,验证算法在小样本场景下对精细操作任务的泛化能力。
解决学术问题
该数据集旨在解决机器人学习中长程操作任务的表征学习与精确控制难题。传统方法常面临状态维度冗余、视觉与运动模态对齐不充分以及非凸优化空间下的策略收敛困难等问题。SO101-StackBlock_Ours_80epi通过提供同步的高保真视觉与低维状态-动作序列,使得研究者能够深入探索视觉运动映射、多视角融合以及子任务拆解等关键学术问题。其内置的自然语言描述与验证问题字段为技能库构建与层次化任务分解提供了数据支撑,推动了从简单轨迹复现向可解释、可迁移的技能学习范式演进。该数据集的意义在于为机器人灵巧操作提供了一个可复现、可控变量的标准化测试平台,有助于公平对比不同算法的性能差异。
衍生相关工作
该数据集推动了一系列基于模仿学习的代表性研究,如借助隐式行为克隆(IBC)、扩散策略(Diffusion Policy)以及基于Transformer的时间序列预测网络等框架进行灵巧操作建模。相关工作常以此数据集为基准,探讨多视角融合策略在遮挡环境下的鲁棒性、滑动窗口的预测长度对动作平滑性的影响,以及利用子目标条件式策略实现复杂任务拆解的方法。此外,研究中涌现了结合数据增强与域随机化的泛化技巧,提升了从80个示范泛化至新方块颜色、纹理与光照条件的性能。这些工作共同勾勒出小样本机器人操作学习的发展脉络,而SO101-StackBlock_Ours_80epi作为标准评估组件在其中扮演了关键角色。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务