遇见数据集

HyeonseokE/SO101-PickandPlace_Ours_80epi

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个用于机器人任务的数据集,专门针对拾取和放置任务,使用LeRobot框架创建。数据集包含80个完整的情节(episodes),总计26,488帧,帧率为10 FPS。数据以Parquet格式存储,总数据文件大小为100 MB,视频文件大小为200 MB。数据集结构包括观察状态(如机器人关节位置、末端执行器位置和夹爪状态)、动作(关节位置控制)、图像观察(来自顶部和左腕摄像头的视频,分辨率为480x640,RGB三通道)、技能信息(如自然语言描述、验证问题、技能类型、进度和目标位置)、子任务信息(如自然语言描述、对象名称和目标位置)以及元数据(如时间戳、帧索引、情节索引等)。机器人类型为so101_follower,适用于机器人学习和控制研究。

This is a robotic task dataset specifically designed for pick-and-place tasks, developed using the LeRobot framework. The dataset consists of 80 complete episodes, totaling 26,488 frames with a frame rate of 10 FPS. The data is stored in Parquet format, with a total data file size of 100 MB and a video file size of 200 MB. The dataset includes multiple components: observation states (such as robot joint positions, end-effector positions and gripper status), actions (joint position control commands), image observations (videos captured by the top and left-wrist cameras, with a resolution of 480x640 and 3 RGB channels), skill information (including natural language descriptions, validation questions, skill types, progress status and target positions), subtask information (such as natural language descriptions, object names and target positions), and metadata (including timestamps, frame indices, episode indices and other related information). The robot type involved is so101_follower, which is suitable for robotic learning and control research.

提供机构:
HyeonseokE
搜集汇总
数据集介绍
HyeonseokE/SO101-PickandPlace_Ours_80epi 数据集图片
构建方式
SO101-PickandPlace_Ours_80epi数据集基于LeRobot框架构建,专注于机器人抓取与放置任务。数据通过SO101跟随机器人采集,包含80个完整演示回合,共计26488帧,以10帧/秒的速率记录。每个回合涵盖机器人六自由度关节状态(肩部、肘部、腕部及夹爪位置)、末端执行器位姿(XYZRPY)、夹爪二进制状态及多模态观测信息,包括顶置与左手腕摄像头提供的640×480分辨率H.264编码视频。数据以Parquet格式存储状态与动作,视频另行归档,并附有任务标签、自然语言描述的子目标及验证问题,确保结构化记录的完整性。
特点
该数据集的核心特点在于其丰富的多模态融合设计。除6维关节动作与状态数据外,还包含来自两个视角的高清视频流,支持视觉-运动联合建模。数据集引入分层标注体系,涵盖总体技能描述、子目标自然语言指令、目标关节位置与夹爪位置,以及任务进度指标,为细粒度技能分解与模仿学习提供了结构化监督信号。此外,每个回合关联验证问题,可用于评估机器人对任务理解与执行正确性,增强了数据集在复杂操作场景下的实用性。
使用方法
使用该数据集时,推荐采用LeRobot库进行加载与可视化,其内置的dataset viewer可直观浏览回合轨迹。数据以chunk分块形式存储,每块约1000帧,训练集包含全部80个回合。研究者可提取观测状态与动作序列用于行为克隆或强化学习训练,结合两个摄像头视角的图像进行视觉策略学习。技能与子任务的自然语言字段支持语言条件策略的研发,验证问题字段则适用于训练具身智能体的自我评估模块。数据按Apache-2.0许可发布,便于学术与工业界复现与扩展。
背景与挑战
背景概述
SO101-PickandPlace_Ours_80epi数据集由HyeonseokE等人创建,旨在服务于机器人操控领域的模仿学习与技能获取研究。该数据集依托LeRobot框架构建,聚焦于SO101型机械臂在拾取与放置(Pick-and-Place)任务中的演示数据采集。数据集包含80个完整演示片段的26488帧时序数据,涵盖了关节角度、末端执行器位姿、双视角视觉图像(顶部与手腕视角)及任务语义标签等多模态信息。通过自然语言指令与子任务分解的标注方式,该数据集为研究细粒度技能分解、多模态感知与动作映射提供了基准资源,在机器人学习社区中推动了从原始演示到结构化技能表征的转化探索。
当前挑战
该数据集面临的核心挑战在于解决机器人操控中技能泛化与数据效率的瓶颈。尽管提供了结构化的拾取放置任务演示,但单一任务(Pick-and-Place)与有限物体类别限制了模型对新物体形状、纹理及摆放位置的泛化能力。构建过程中,数据采集依赖于遥操作演示,面临人为操作不一致性、运动轨迹多样性不足等难题,且机械臂关节空间与任务空间的高维冗余增加了有效特征提取的复杂度。此外,多模态传感器(如视觉与关节编码器)之间的时序对齐与噪声处理、语义标签的主观性偏差以及80个片段的较小规模,均对基于该数据集训练的策略在真实环境中的鲁棒迁移构成挑战。
常用场景
经典使用场景
SO101-PickandPlace_Ours_80epi数据集在机器人学领域扮演着基础性角色,尤其适用于模仿学习与行为克隆研究。该数据集记录了80个由SO101型机器人完成的拾放操作任务,包含近2.6万帧的高保真观测数据,涵盖了关节位置、末端执行器姿态、夹爪状态及多视角视觉信息(顶部与左腕相机)。其结构化的特征空间——包括6维的观测状态与动作变量——为训练端到端的机器人操控策略提供了天然的训练素材。研究者常利用此数据集作为基线基准,通过与真实轨迹对齐与误差最小化,验证模型在重复性拾放任务中的泛化能力与操作精度。
解决学术问题
该数据集系统性地解决了机器人操控领域中标注数据匮乏与任务泛化性不足的核心瓶颈。传统研究中,针对精细拾放操作的示教数据往往采集成本高昂且场景单一,难以支撑深度模型对复杂操控动态的学习。此数据集通过提供80个完整episode的标准化任务序列,配合自然语言描述的子技能标签(如目标物体名称与空间坐标),使得研究者能够探索多模态感知与动作之间的因果映射关系。其发布促进了关于数据效率提升、行为克隆中的分布外鲁棒性以及任务层级规划等学术问题的深入讨论,推动了基于示教学习的机器人技能迁移理论的发展。
衍生相关工作
基于该数据集,学术界与工业界已衍生出一系列具有影响力的研究工作。在模型架构层面,研究者借鉴其多模态特征设计,提出了融合视觉-运动联合编码的Transformer变体(如HBT-Transformer),显著提升了长时域任务中的动作预测一致性。在算法评估方向,该数据集被引入作为LeRobot开源生态的核心测试用例,催生了关于基于扩散策略的机器人动作生成与基于能量的模仿学习的对比分析。同时,其分层任务标注(包括自然语言子技能与目标位置)启发了关于可解释任务规划的先驱工作,例如利用预训练语言模型为机器人操控生成模块化行为序列。这些衍生成果共同标志着从数据驱动到认知决策的机器人研究转型。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务