遇见数据集

HyeonseokE/SO101-SortBlock_Ours_20epi

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个机器人技术数据集,专门用于SO101跟随机器人执行排序块任务。它包含20个episodes,总计19019帧,数据以parquet格式存储。数据集提供了丰富的多模态特征,包括机器人关节状态观测(6个浮点数)、动作(6个浮点数)、图像观测(来自顶部和左腕摄像头的视频,分辨率为480x640,10fps)、末端执行器位置(XYZRPY坐标)、技能信息(如自然语言描述、验证问题、类型、进度和目标位置)、子任务信息(如自然语言描述、对象名称和目标位置),以及时间戳、帧索引、episode索引等元数据。数据集适用于机器人学习、模仿学习或强化学习任务,旨在支持机器人操作和任务执行的研究。

许可证:Apache-2.0 任务类别: - 机器人学 标签: - LeRobot 配置项: - 配置名称:default 数据文件:data/*/*.parquet --- 本数据集由 [LeRobot](https://github.com/huggingface/lerobot) 构建。 <a class="flex" href="https://huggingface.co/spaces/lerobot/visualize_dataset?path=HyeonseokE/SO101-SortBlock_Ours_20epi"> <img class="block dark:hidden" src="https://huggingface.co/datasets/huggingface/badges/resolve/main/visualize-this-dataset-xl.svg"/> <img class="hidden dark:block" src="https://huggingface.co/datasets/huggingface/badges/resolve/main/visualize-this-dataset-xl-dark.svg"/> </a> ## 数据集描述 - **主页:** [需补充更多信息] - **论文:** [需补充更多信息] - **许可证:** Apache-2.0 ## 数据集结构 `meta/info.json`: json { "代码库版本": "v3.0", "机器人类型": "so101_follower", "总回合数": 20, "总帧数": 19019, "总任务数": 1, "分块大小": 1000, "数据文件总大小(MB)": 100, "视频文件总大小(MB)": 200, "帧率": 10, "数据集划分": { "训练集": "0:20" }, "数据文件路径": "data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet", "视频文件路径": "videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4", "数据特征": { "观测值.关节状态": { "数据类型": "float32", "形状": [6], "维度名称": ["shoulder_pan.pos", "shoulder_lift.pos", "elbow_flex.pos", "wrist_flex.pos", "wrist_roll.pos", "gripper.pos"] }, "动作指令": { "数据类型": "float32", "形状": [6], "维度名称": ["shoulder_pan.pos", "shoulder_lift.pos", "elbow_flex.pos", "wrist_flex.pos", "wrist_roll.pos", "gripper.pos"] }, "观测值.顶部相机图像": { "数据类型": "video", "形状": [480, 640, 3], "维度名称": ["height", "width", "channels"], "详细信息": { "视频高度": 480, "视频宽度": 640, "视频编码格式": "h264", "视频像素格式": "yuv420p", "非深度图": false, "视频帧率": 10, "视频通道数": 3, "无音频轨道": false } }, "观测值.左腕相机图像": { "数据类型": "video", "形状": [480, 640, 3], "维度名称": ["height", "width", "channels"], "详细信息": { "视频高度": 480, "视频宽度": 640, "视频编码格式": "h264", "视频像素格式": "yuv420p", "非深度图": false, "视频帧率": 10, "视频通道数": 3, "无音频轨道": false } }, "观测值.末端执行器位姿(robot_xyzrpy)": { "数据类型": "float32", "形状": [6], "维度名称": ["x", "y", "z", "roll", "pitch", "yaw"] }, "观测值.夹爪二进制状态": { "数据类型": "float32", "形状": [1], "维度名称": null }, "技能.自然语言描述": { "数据类型": "string", "形状": [1], "维度名称": null }, "技能.验证问题": { "数据类型": "string", "形状": [1], "维度名称": null }, "技能.类型": { "数据类型": "string", "形状": [1], "维度名称": null }, "技能.进度": { "数据类型": "float32", "形状": [1], "维度名称": null }, "技能.目标关节位姿": { "数据类型": "float32", "形状": [6], "维度名称": ["shoulder_pan.pos", "shoulder_lift.pos", "elbow_flex.pos", "wrist_flex.pos", "wrist_roll.pos", "gripper.pos"] }, "技能.目标末端位姿(robot_xyzrpy)": { "数据类型": "float32", "形状": [6], "维度名称": ["x", "y", "z", "roll", "pitch", "yaw"] }, "技能.目标夹爪位置": { "数据类型": "float32", "形状": [1], "维度名称": ["gripper.pos"] }, "子任务.自然语言描述": { "数据类型": "string", "形状": [1], "维度名称": null }, "子任务.物体名称": { "数据类型": "string", "形状": [1], "维度名称": null }, "子任务.目标位置": { "数据类型": "float32", "形状": [3], "维度名称": ["x", "y", "z"] }, "时间戳": { "数据类型": "float32", "形状": [1], "维度名称": null }, "帧索引": { "数据类型": "int64", "形状": [1], "维度名称": null }, "回合索引": { "数据类型": "int64", "形状": [1], "维度名称": null }, "样本索引": { "数据类型": "int64", "形状": [1], "维度名称": null }, "任务索引": { "数据类型": "int64", "形状": [1], "维度名称": null } } } ## 引用 **BibTeX:** bibtex [需补充更多信息]

提供机构:
HyeonseokE
搜集汇总
数据集介绍
HyeonseokE/SO101-SortBlock_Ours_20epi 数据集图片
构建方式
SO101-SortBlock_Ours_20epi数据集基于LeRobot框架构建,专为机器人学习任务设计。该数据集通过SO101型机器人执行分拣积木任务采集了20个回合(episode)的示范数据,涵盖19,019帧连续观测序列。数据采用分块存储策略,以Parquet格式保存结构化特征,同时以H.264编码的MP4视频文件同步记录顶部和左腕视角的视觉信息,确保了多模态数据的高效组织与完整关联。
特点
数据集具备丰富的异构特征空间:包含6维关节位置观测与动作向量、6维末端执行器位姿、二值化夹爪状态及自然语言描述的技能与子任务注解。视觉数据提供640×480分辨率的双视角视频流,配合时间戳与帧索引实现精确的时序对齐。尤为突出的是,数据集将复杂操作任务分解为带有自然语言标签的技能单元,并备注了各技能的验证问题与进程标志,为细粒度的机器人任务学习提供了语义标注基础。
使用方法
用户可通过HuggingFace平台的LeRobot可视化工具快速浏览数据集全貌。使用过程中,建议基于LeRobot库的DataLoader加载Parquet分块数据与视频流,利用预定义的6维动作空间与观测空间镜像标准化处理。数据集已预划分训练集涵盖全部20个回合,总数据量约300MB,适合中等规模的模仿学习与行为克隆任务。结合skill与subtask字段的语义标签,可进一步探索多阶段任务中的技能分解与泛化研究。
背景与挑战
背景概述
SO101-SortBlock_Ours_20epi数据集是由研究人员利用LeRobot框架创建的机器人操作数据集,发布于2024年,旨在推动模仿学习在精细操作任务中的应用。核心研究问题聚焦于通过少量演示(20个片段)使机器人学会分拣积木的复杂技能,涵盖肩部、肘部、腕部及夹爪的多自由度协调控制。该数据集通过视觉与状态特征的深度融合,为机器人从感知到行动的端到端学习提供了标准化基准,其影响力体现在降低机器人数据采集门槛、促进低成本机器人平台的技能迁移研究,并成为验证小样本模仿学习算法有效性的关键资源。
当前挑战
当前数据集面临的核心挑战包括:首先,在领域问题层面,机器人分拣任务需解决非结构化环境中物体姿态多变、夹爪接触不确定性以及多步骤子任务衔接的泛化难题;其次,构建过程中受限于仅20个示范片段,数据多样性不足易导致模型过拟合,且高维观测空间(视觉、关节角度、末端执行器位姿)与稀疏奖励之间的关联性弱,增加了策略学习的难度;此外,多模态数据(视频与状态序列)的异构对齐、时间同步以及长时依赖关系的建模,对数据采集的精确性和预处理流程提出了严苛要求。
常用场景
经典使用场景
在机器人操作与模仿学习领域,SO101-SortBlock_Ours_20epi数据集为研究物体排序与精细操作任务提供了宝贵的资源。该数据集包含20个演示片段,记录了SO101型机械臂执行方块排序任务的完整过程,涵盖6自由度关节状态、末端执行器位姿、夹爪二进制状态以及顶部与左腕视角的视觉观测。研究者可利用这些多模态数据训练基于视觉的运动策略,例如通过行为克隆或逆强化学习方法,从专家演示中提取控制策略,使机器人学会在动态环境中自主完成序列化分拣操作。
实际应用
在工业自动化与仓储物流中,该数据集展现出直接的应用价值。通过训练机器人掌握方块排序技能,可将其迁移至电子元件分拣、零件装配或包裹整理等场景。例如,机器人可依据视觉系统感知到的物体位置与姿态,自主规划夹取、移动与放置动作,替代人工完成重复性高的流水线任务。此外,结合数据集中的语言指令字段,人机协作场景中操作者可通过自然语言向机器人下达指令,提升生产线的灵活性与人机交互效率。
衍生相关工作
基于该数据集,研究者已衍生出多项代表性工作。例如,利用LeRobot框架构建的端到端模仿学习基线,对比了扩散策略、行为克隆与视觉预测模型在物体排序任务上的性能差异;部分工作探索了多技能融合与任务条件策略,通过联合学习子任务嵌入与动作生成,提升长程操作的成功率。未来,该数据集有望支持零样本泛化研究,即通过预训练语言-动作模型,使机器人理解未见过的工作指令并生成相应操作,为下一代通用机器人学习提供了关键基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务