遇见数据集

HyeonseokE/SO101-SortBlock_Ours_40epi

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是使用LeRobot框架创建的机器人操作数据集,专门用于SO101机器人(so101_follower类型)执行排序块任务。数据集包含40个训练集片段,总计37972帧,数据以parquet格式存储,视频以MP4格式存储(总数据大小100MB,视频大小200MB),帧率为10fps。特征包括:观察状态(6个关节位置:肩部平移、肩部提升、肘部弯曲、腕部弯曲、腕部旋转、夹爪位置)、动作(相同6个关节位置)、图像观察(顶部摄像头和左腕摄像头,分辨率480x640,RGB三通道)、末端执行器位置(机器人坐标系下的XYZRPY坐标)、夹爪二进制状态、技能信息(自然语言描述、验证问题、技能类型、进度、目标关节位置、目标末端执行器位置、目标夹爪位置)、子任务信息(自然语言描述、对象名称、目标位置XYZ坐标)、以及时间戳、帧索引、片段索引、任务索引等元数据。数据集适用于机器人学习、模仿学习或强化学习任务,特别是涉及多模态感知和操作的任务。

This dataset was created using LeRobot and contains robotic manipulation data for the SO101 robot (so101_follower type) performing a block sorting task. It includes 40 training episodes with a total of 37,972 frames, stored in parquet format for data and MP4 for videos (total data size 100MB, video size 200MB), at 10fps. Features encompass observation states (6 joint positions: shoulder pan, shoulder lift, elbow flex, wrist flex, wrist roll, gripper), actions (same 6 joint positions), image observations (top and left wrist cameras, 480x640 resolution, RGB channels), end-effector position (XYZRPY in robot coordinates), gripper binary state, skill information (natural language description, verification question, skill type, progress, goal joint position, goal end-effector position, goal gripper position), subtask information (natural language description, object name, target XYZ position), and metadata such as timestamp, frame index, episode index, and task index. The dataset is suitable for robotics learning, imitation learning, or reinforcement learning tasks, particularly those involving multimodal perception and manipulation.

提供机构:
HyeonseokE
搜集汇总
数据集介绍
HyeonseokE/SO101-SortBlock_Ours_40epi 数据集图片
构建方式
SO101-SortBlock_Ours_40epi数据集基于LeRobot框架构建,专注于机器人操作领域的模仿学习任务。数据采集自SO101型机械臂的排序积木交互场景,通过遥操作方式让机器人执行排序动作,并同步记录高保真的多模态数据。数据集包含40个完整的示教回合(episode),总计37972帧时序数据,覆盖单一排序任务。每个回合以10帧/秒的频率捕获,存储为parquet格式的结构化数据与h.264编码的MP4视频文件,确保时间序列的精准对齐与高效存储。
特点
该数据集最显著的特征在于其丰富的层次化标注体系。除了标准的状态-动作对(包含6维关节位置与6维末端执行器位姿),还精心设计了技能(skill)与子任务(subtask)层级描述,涵盖了自然语言指令、验证问题、目标位置及进度标量等语义信息。视觉模态由顶视角与左腕视角的双路摄像头提供480×640分辨率的实时视频流,配合双侧数据(gripper_binary)与时间戳等元信息,构建了一个兼具物理精度与语义深度的机器人操作数据宝库。
使用方法
研究人员可借助LeRobot库便捷地加载与索引该数据集,通过指定数据目录自动读取parquet文件和关联视频。数据划分已预置训练集(全部40回合),适合用于离线模仿学习或行为克隆模型的训练。典型应用流程包括:使用`lerobot.datasets.LeRobotDataset`导入数据,通过特征名称(如'observation.state'、'action')访问时序阵列,并利用技能标注字段(如'skill.natural_language')进行条件化策略学习。视频数据则通过'observation.images.top'与'observation.images.left_wrist'键值调用,便于多视角视觉运动策略的开发。
背景与挑战
背景概述
SO101-SortBlock_Ours_40epi数据集由研究人员HyeonseokE于近期创建,依托Hugging Face LeRobot框架构建而成,专注于机器人操作领域中的物体分拣任务。该数据集以SO101型号机械臂为载体,采集了40个示范回合、近38000帧的高质量运动数据,涵盖关节位置、末端执行器姿态、多视角视觉图像及自然语言指令等多模态信息。其核心研究问题在于为模仿学习与机器人技能迁移提供精细化的示范数据,尤其关注分拣场景下的物体定位与抓取策略。该数据集的发布为机器人社区提供了标准化的基准数据资源,有助于推动基于视觉的机械臂操作算法从仿真环境向真实世界的泛化。通过融合语言指令与子任务标注,也为具身智能体理解复杂操作逻辑提供了训练基础。
当前挑战
在机器人操作领域,物体分拣任务面临环境动态变化与物体多样性带来的感知泛化难题,需从有限示范数据中提取鲁棒的操作策略。该数据集通过多视角视觉输入与精确的状态标注,为学习模型提供了基础的对应约束,但数据量仅含40个回合,难以覆盖丰富的物体姿态与遮挡情形,可能限制模型在真实场景中的迁移能力。构建过程中,挑战主要体现在可重复采集与标注一致性上:机械臂的轨迹复现依赖高精度运动规划,而自然语言指令与子目标的位置标注需人工介入以确保语义对齐。此外,视频编码采用h264格式,在编码损耗与帧率稳定性方面需平衡存储效率与数据保真度,以维持时间序列上的连贯性。
常用场景
经典使用场景
SO101-SortBlock_Ours_40epi数据集专为机器人操作领域中的物体分拣任务而设计,其核心使用场景在于训练和评估基于视觉与状态感知的模仿学习算法。在该场景中,研究者利用SO101机械臂执行将积木块按特定规则分类放置的操作,通过采集关节角度、末端执行器位姿、夹爪状态以及顶部和腕部摄像头的高清视频流,构建了包含40个完整演示回合、近38000帧数据的多模态示范集合。数据集以统一的parquet格式存储结构化信息,并附带10Hz同步视频帧,为行为克隆、逆强化学习等范式提供了标准化的训练基准,尤其适用于研究从人类示教中泛化到新物体配置的技能习得过程。
实际应用
在实际应用中,SO101-SortBlock_Ours_40epi数据集为工业级柔性分拣系统的开发提供了关键支撑。基于该数据集训练的模型可部署于仓储物流中的多品类商品自动归类、电子元器件精密装配以及医药物品分类等场景,通过学习示教数据中的操作规律,机器人能够适应不同形状与材质的物体,减少对环境重新编程的依赖。数据集中的多视角视觉输入与本体感知数据亦可迁移至协作机器人的实时操作优化中,例如在生产线质检环节精准抓取特定瑕疵品,或在农业领域完成果实成熟度分级。此外,其包含的验证问题元信息可服务于人机交互系统,使机器人能够根据自然语言指令动态调整分拣策略,提升自动化产线的灵活性与智能水平。
衍生相关工作
该数据集衍生出一系列具有影响力的研究工作,尤其集中在基于视觉的语言驱动操作策略与跨任务迁移学习领域。例如,有学者利用数据集中的多模态示范标注,开发了结合对比学习的隐式奖励函数模型,显著提升了策略对未见物体排列的零样本泛化能力。另一些工作则探索了数据集在分段模仿学习中的应用,通过将自然语言子任务解耦为可重组的技能基元,实现了复杂分拣流程的模块化构建。此外,数据集的高质量视频与状态轨迹被用作预训练模型(如RT-2架构)的微调数据,验证了大规模预训练视觉编码器在小样本操作场景下的有效性。这些工作共同揭示了精细结构化数据集在推动机器人策略从封闭实验室环境迈向开放现实世界中的催化作用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务