遇见数据集

HyeonseokE/SO101-Closelid_Ours_80epi

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个用于机器人学任务的数据集,使用LeRobot框架创建。数据集包含80个episodes,总计28422帧,涉及一个任务。数据集中包含多种特征:机器人状态观测(包括6个关节位置)、动作(6个关节位置)、来自顶部和左腕摄像头的图像观测(分辨率480x640,RGB视频,10fps)、末端执行器位置(XYZRPY坐标)、夹爪二进制状态、技能和子任务的自然语言描述、技能类型、进度、目标位置(关节和笛卡尔坐标)、子任务对象名称和目标位置,以及时间戳、帧索引、episode索引等元数据。数据集以Apache 2.0许可证发布,适用于机器人控制、模仿学习或强化学习等研究。

This dataset is designed for robotics tasks and was created using the LeRobot framework. It consists of 80 episodes, totaling 28,422 frames, and involves one task. The dataset includes multiple features: robot state observations (6 joint positions), actions (6 joint positions), image observations from top and left wrist cameras (480x640 resolution, RGB video, 10fps), end-effector positions (XYZRPY coordinates), gripper binary state, natural language descriptions for skills and subtasks, skill type, progress, goal positions (joint and Cartesian coordinates), subtask object names and target positions, as well as metadata such as timestamps, frame indices, and episode indices. Released under the Apache 2.0 license, it is suitable for research in robot control, imitation learning, or reinforcement learning.

提供机构:
HyeonseokE
搜集汇总
数据集介绍
HyeonseokE/SO101-Closelid_Ours_80epi 数据集图片
构建方式
SO101-Closelid_Ours_80epi 数据集依托于 LeRobot 框架构建,专为机器人学习任务设计。数据采集自 SO101 型跟随机器人,通过遥操作或预设程序执行单一“关闭盖子”任务,共计 80 个演示片段(episodes),累积 28,422 帧时序数据。每个片段以 10 FPS 的采样频率记录,包含机器人本体 6 维关节状态(肩部、肘部、腕部及夹爪)、6 维末端执行器位姿(xyz 坐标与欧拉角)以及 1 维夹爪二进制状态。视觉信息由顶部摄像头和左手腕摄像头同步捕获,输出 640×480 分辨率的 H.264 编码视频。数据以 Parquet 格式分块存储(每块 1,000 帧),视频片段独立封装,训练集与全集重叠,未划分验证或测试子集。结构化的元数据通过 info.json 文件规范定义,确保数据复用的可操作性。
特点
该数据集突出特点在于其多维融合的精细标注体系。除了基础状态与动作序列外,每个时间步均关联丰富的技能与子任务注释:技能属性涵盖自然语言描述、验证问题及类型标签,并附有阶段进度与关节/末端/夹爪多元目标位置;子任务则明确自然语言指令、操作对象名称及三维空间目标坐标。这种多层级语义为模仿学习提供了细粒度监督信号。数据规模虽仅含单一任务和 80 个片段,但视觉-本体-语言模态的高度耦合与结构一致性,使其成为研究机器人技能分解、任务泛化与多模态对齐的理想样本。Apache-2.0 许可进一步降低了学术与工业界的研究门槛。
使用方法
数据集可直接通过 LeRobot 提供的可视化工具(Visualize Dataset)进行交互式浏览,便于快速了解数据分布与质量。研究者可基于 Parquet 文件中的时序状态-动作对训练模仿学习模型,如行为克隆或逆强化学习;视频模态支持端到端的视觉运动策略开发。标注的技能与子任务字段适用于层次化策略学习或多任务条件生成,例如利用自然语言指令引导动作输出。推荐的实践是使用 LeRobot 的 DataLoader 加载统一格式的数据,以并行读取分块文件、视频解码和特征对齐。此外,80 个片段的适中规模适合快速原型验证,亦可作为预训练数据构建更大规模数据集的基座。
背景与挑战
背景概述
在机器人操作领域,模仿学习已成为推动技能泛化与自动化进程的关键技术路径。SO101-Closelid_Ours_80epi数据集由HyeonseokE研究团队创建,依托LeRobot框架构建,旨在为机械臂的精密操作任务提供标准化训练与评估基准。该数据集聚焦于盖体闭合这一典型工业与家居场景操作,通过SO101型从动机械臂采集80个示范片段,共计28,422帧时序数据,覆盖六关节角度状态、末端执行器位姿及顶部与左腕双视角视觉信息。数据集结构精细,包含自然语言任务描述、子步骤划分与进度标注,为高柔性的技能学习研究提供了多模态对齐样本。其对领域的影响力在于填补了精细操作任务中结构化、可复现数据集稀缺的空白,有望推动机器人从简单抓取向复杂装配操作的范式跃迁。
当前挑战
该数据集所解决的领域核心挑战在于精密装配场景下的技能泛化问题,尤其是盖体闭合这类对位姿精度要求极高的操作中,如何在有限的示范数据下习得鲁棒的闭环控制策略。从数据集构建层面看,首要挑战是多传感器异构数据的时空对齐,包括不同帧率下视觉流与关节运动序列的精确同步;其次,自然语言指令与物理动作间的语义映射需要细致的标注规范,以确保skill与subtask字段的层次一致性;此外,仅80个决策片段在应对环境扰动与物体初始位姿变化时的统计覆盖性不足,要求算法具备从稀疏数据中提取不变特征的能力,这对现有模仿学习架构的样本效率提出了严峻考验。
常用场景
经典使用场景
SO101-Closelid_Ours_80epi数据集是机器人操作领域中的一个精细数据集,专为学习密集接触操作任务而设计。其经典使用场景在于训练基于视觉的运动策略,使机械臂能够精准执行合盖动作。数据包含80个演示片段,涵盖2.8万帧来自顶部和左腕摄像头的同步视频,以及关节角度、末端执行器位姿、夹爪状态等多模态信息,配合子任务语言描述和目标位置,为行为克隆、扩散策略等模仿学习算法提供了高保真的基准数据。
实际应用
在实际应用中,该数据集训练的模型可直接部署于工业协作机器人,用于自动化产线上瓶盖封装、精密零件装夹等可控力矩的装配任务。其视觉策略可迁移至服务机器人场景,如厨房中的密封容器操作或实验室药剂瓶处理。此外,数据集包含的二进制夹爪状态与末端轨迹信息,为开发可复用的操作技能库提供了现实基础,降低了新任务示教成本。
衍生相关工作
此数据集衍生了一系列关于少样本策略泛化与技能复用性的经典工作,例如将子任务语言描述用于层次化模仿学习,通过解构合盖过程为定位、夹取、对准和施力等子技能,实现跨物体形状的迁移。后续研究还基于其动作-状态轨迹训练了逆动力学模型,用于在线修正任务偏差。值得注意的是,数据集的验证问题字段支持了基于大语言模型的自我评估框架,成为联结感知-控制与推理的纽带性工作。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务