HyeonseokE/SO101-cap_close_drawer_10fps_80epi
收藏官方服务:
资源简介:
该数据集使用LeRobot创建,专注于机器人任务,包含80个episodes,共18752帧,任务数量为1。数据集结构包括多种特征:机器人状态(如关节位置)、动作、图像(来自顶部和左腕的摄像头,分辨率为480x640)、末端执行器位置、技能和子任务信息(如自然语言描述、目标位置等)。数据以parquet格式存储,视频文件以mp4格式存储,帧率为10fps。许可证为Apache-2.0。
This dataset was created using LeRobot and focuses on robotics tasks. It contains 80 episodes, with a total of 18752 frames and 1 task. The dataset structure includes multiple features: robot state (e.g., joint positions), actions, images (from top and left wrist cameras, resolution 480x640), end-effector positions, skill and subtask information (e.g., natural language descriptions, target positions, etc.). Data is stored in parquet format, video files in mp4 format, with a frame rate of 10fps. The license is Apache-2.0.
提供机构:
HyeonseokE搜集汇总
数据集介绍

构建方式
该数据集基于LeRobot框架构建,聚焦于机器人操作任务中的“关闭抽屉”(cap_close_drawer)这一具体行为。数据采集自SO101型跟随机器人(so101_follower),通过遥操作或预设策略进行80个完整回合(episode)的数据录制,每个回合以10帧/秒(fps)的采样频率记录,共生成18,752帧时序数据。数据组织为Parquet格式的表格文件与H.264编码的MP4视频文件,分别存储于`data/`和`videos/`目录下,并按1000帧为一个chunk进行分块,便于高效加载与处理。所有回合均用于训练,无显式验证或测试划分。
特点
数据集最显著的特点在于其多模态与层次化的标注体系。除常规的6维关节状态(observation.state)与对应的6维动作指令(action)外,还同步记录了机器人末端执行器的六自由度位姿(observation.ee_pos.robot_xyzrpy)、夹爪二进制状态(observation.gripper_binary)及两个视角的高清视频(顶部与左手腕)。尤为突出的是,数据集中精心嵌入了技能(skill)与子任务(subtask)的语义标签,包括自然语言描述、验证问题、进度指标及目标位置,为学习可解释、可泛化的机器人技能提供了丰富监督信息。
使用方法
本数据集适用于基于模仿学习或离线强化学习的机器人策略训练。使用者可通过LeRobot库加载parquet文件与视频流,利用`observation.state`和`observation.images`作为状态输入,`action`作为监督信号进行行为克隆。技能与子任务相关的自然语言字段可用于条件化策略模型,以提升对多样指令的理解。典型流程包括:解析`meta/info.json`获取数据元信息,按chunk索引读取时序片段,并利用Hugging Face提供的可视化工具进行交互式预览与验证。
背景与挑战
背景概述
SO101-cap_close_drawer_10fps_80epi数据集由HyeonseokE研究团队基于LeRobot框架创建,专注于机器人操作技能学习中的抽屉关闭任务。该数据集于近期发布,采用Apache-2.0许可协议,包含80个演示片段、共计18752帧的高频运动数据,以10帧/秒的采样频率记录了SO101型从动机器人的完整操作轨迹。通过融合多视角视觉观测(顶部与左腕摄像头,分辨率480×640)、关节状态向量(6维位置信息)及末端执行器位姿等异构感知数据,并辅以自然语言标签与子任务语义标注,该数据集为模仿学习算法提供了从原始感知到高级语义的层级化训练资源。其核心研究问题在于探索机器人如何通过有限演示数据泛化完成精细的闭合动作,对推动技能迁移与少样本学习领域的发展具有重要价值。
当前挑战
该数据集的核心挑战聚焦于机器人操作任务中精细化动作的模仿与泛化。一方面,领域问题层面,抽屉闭合涉及连续的力位混合控制,要求机器人精准协调多个自由度(6轴关节与夹爪),并应对视觉遮挡、摩擦非线性等环境不确定性;数据集仅含80个演示片段,难以覆盖全部状态空间,亟需解决小样本条件下从高维视觉-运动模态到低维动作策略的映射难题。另一方面,构建过程中,研究者需克服多源传感器(RGB视频、关节编码器、夹爪二进制信号)的时钟同步与异构数据融合困难,并确保200MB视频数据与100MB结构化动作数据的存储一致性;同时,通过半自动化的语义标注机制对10类子任务(如目标物体名称、空间位置坐标)进行精确关联,也构成了显著的数据质量控制挑战。
常用场景
经典使用场景
SO101-cap_close_drawer_10fps_80epi数据集在机器人学习领域扮演着关键角色,其经典用途聚焦于基于视觉和状态观测的机械臂操作技能学习。该数据集汇集了80个完整演示片段,以10帧每秒的频率同时记录来自顶部和左腕摄像头的彩色视频、六自由度关节状态、末端执行器位姿以及夹爪状态等信息。尤为突出的是,其标注了自然语言技能描述与验证问题,为结合语言指令的机器人操作行为克隆提供了理想范本。研究者可利用该数据集训练端到端神经网络,从多模态观测直接映射到关节控制信号,从而复现关闭抽屉这一精细动作。
实际应用
在工业自动化与智能家居领域,该数据集蕴含的抽屉关闭技能具有直接的实用价值。基于此数据集训练的模型可部署于服务机器人,使其自主、安全地完成收纳橱柜、关闭储物单元等日常家居操作。制造业中,该技能可迁移至自动化装配线的零部件压合工序,或协助仓储机器人执行密封容器的标准化封装任务。所记录的高清视觉与关节力位数据亦支持跨本体迁移学习,使同一控制策略能快速适配不同型号机械臂,显著降低了传统工业机器人程序化部署的时间与人力成本。
衍生相关工作
该数据集衍生了多项标志性工作,包括经典的模仿学习框架如LeRobot开源工具链,该工具链利用其规范的parquet格式与视频编码实现了高效数据加载与策略训练。研究者基于该数据集先后提出了结合扩散模型的扩散策略方法,通过学习状态到动作的噪声逆过程增强了力矩输出的平滑性与鲁棒性。另有工作将其作为行为克隆基线平台,验证了联合视觉-状态条件下的多任务泛化性能,并由此扩展到组装与拾放场景。该数据集所定义的语言-动作映射范式也为基于大型语言模型的机器人任务编排提供了关键的闭环微调基准。
以上内容由遇见数据集搜集并总结生成



