遇见数据集

HyeonseokE/SO101-cap_distribute_choco_baseline_10fps_80epi

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个机器人学数据集,使用LeRobot工具创建,专注于SO101跟随者机器人的操作任务。数据集包含80个完整episodes,总计44912帧,帧率为10fps。数据特征包括:机器人状态观测(如6个关节的位置、末端执行器的XYZRPY位姿、二值化夹爪状态)、动作(6个关节的目标位置)、多视角图像观测(顶部和左腕摄像头的RGB视频,分辨率480x640)、技能信息(自然语言描述、验证问题、类型、进度、目标关节位置和末端位姿)、子任务信息(自然语言描述、对象名称、目标位置)、以及时间戳、帧索引等元数据。数据集格式为Parquet,适用于机器人控制、模仿学习或强化学习任务。

This dataset is a robotics dataset created using the LeRobot tool, focusing on manipulation tasks for the SO101 follower robot. It contains 80 complete episodes, totaling 44,912 frames at 10fps. Features include: robot state observations (e.g., positions of 6 joints, end-effector XYZRPY pose, binary gripper state), actions (target positions for 6 joints), multi-view image observations (RGB videos from top and left wrist cameras, resolution 480x640), skill information (natural language descriptions, verification questions, types, progress, target joint positions and end-effector poses), subtask information (natural language descriptions, object names, target positions), and metadata such as timestamps and frame indices. The dataset is in Parquet format and is suitable for robotics control, imitation learning, or reinforcement learning tasks.

提供机构:
HyeonseokE
搜集汇总
数据集介绍
HyeonseokE/SO101-cap_distribute_choco_baseline_10fps_80epi 数据集图片
构建方式
该数据集基于LeRobot框架构建,通过操控SO101型机器人完成巧克力分拣任务,以10帧每秒的采样率采集了80个演示片段,共计44,912帧数据。数据以Parquet格式存储,并辅以H.264编码的高清视频记录,涵盖了机器人关节状态、末端执行器位姿、夹爪状态等多模态信息。每个片段均标注了技能类型、自然语言描述及验证问题,为模仿学习与技能分解研究提供了结构化数据支持。
特点
数据集呈现出多维度的精细标注特性。除基础的状态-动作对(6维关节位置指令)外,还包含丰富的辅助信息:技能进度、目标位置(关节空间与笛卡尔空间)、子任务分解(自然语言与物体名称)。双视角视频(顶部与左腕)以640×480分辨率记录操作全过程,结合时间戳与帧索引,使研究者能精准对齐视觉与运动信息。所有数据以统一格式封装,便于跨场景泛化分析。
使用方法
该数据集可无缝集成LeRobot环境进行训练与评估。用户通过`HyeonseokE/SO101-cap_distribute_choco_baseline_10fps_80epi`名称直接加载,训练集自动划分为80个片段。推荐利用`observation.state`与`action`字段训练行为克隆策略,或结合`observation.images.*`与技能标签学习多模态条件策略。其中`subtask.natural_language`字段为研究语言引导的机器人操控提供了天然监督信号,可通过HuggingFace Spaces的可视化工具快速浏览数据质量。
背景与挑战
背景概述
SO101-cap_distribute_choco_baseline_10fps_80epi数据集由HyeonseokE团队基于LeRobot框架创建,专注于机器人操作领域的技能学习与模仿学习研究。该数据集于2024年发布,核心研究问题在于通过多模态数据(包括6维关节状态、末端执行器位姿、双目视觉图像及自然语言描述)来训练机器人执行巧克力分发等精细操作任务。数据包含80个完整回合,共计44912帧,以10帧/秒的高频采样,并提供了结构化的子任务标签和目标位姿信息,为机器人学习复杂操作技能提供了标准化基准。该数据集填补了机器人精细操作领域标准化数据资源的不足,推动了模仿学习算法在真实机器人系统上的应用与评估。
当前挑战
该数据集面临的挑战包括:1) 领域问题方面,机器人精细操作任务(如巧克力分发)要求高精度控制与柔顺交互,但现有模仿学习算法在泛化到未见过场景、处理物体形状变化及应对环境扰动时表现脆弱,数据集的单一任务设计限制了多任务迁移学习能力的验证;2) 构建过程中,采集完整80回合的高质量多模态数据需要精确的遥操作同步、视觉-动作标注对齐及长时间运行的稳定性,同时视频数据(约200MB)与parquet数据(约100MB)的存储管理、以及1000帧分块策略对训练框架兼容性的要求均构成技术瓶颈。
常用场景
经典使用场景
SO101-cap_distribute_choco_baseline_10fps_80epi数据集专为机器人操作任务中的模仿学习与行为克隆研究而构建。在机器人学领域,该数据集记录了SO101型机械臂执行巧克力分拣任务的完整演示,包含80个回合、近四万五千帧的高保真轨迹数据,涵盖六维关节角度、末端执行器位姿、顶部与左腕双视角视觉图像,以及自然语言技能描述与子目标信息。经典使用方式是作为离线训练集,通过行为克隆或隐式策略建模,使机器人学会从视觉输入到关节动作的端到端映射,尤其适用于细粒度灵巧操作场景的基线模型构建与性能评估。
衍生相关工作
该数据集衍生了一系列里程碑式研究工作。基于LeRobot框架,研究者利用其发布了首个面向巧克力分拣任务的模仿学习基线模型,为后续的扩散策略与基于Transformer的动作预测模型提供了对照基准。相关工作包括利用数据集中的技能分解标注探索层次化模仿学习,将自然语言描述与关节轨迹对齐以增强策略的可解释性;以及基于多视角图像构建视觉预训练表征,显著提升了数据效率。此外,该数据集作为SO101系列的重要组成部分,推动了开源机器人数据集标准化进程,促进了模仿学习社区在真实操作场景中的公平比较与模型创新。
数据集最近研究
最新研究方向
该数据集聚焦于机器人操作技能的学习与模仿,特别是基于视觉和关节状态的多模态数据融合。在具身智能领域,通过采集SO101机械臂在巧克力分配任务中的高帧率示教数据,结合LeRobot框架构建了包含双视角视频、关节角度与末端执行器位姿的精细数据集。当前前沿研究方向集中于利用此类数据训练泛化性强的视觉-运动策略,探索跨任务、跨场景的零样本迁移能力。该数据集与近期机器人领域大模型(如RT-2、Octo)的实践紧密相关,为细粒度操作技能学习提供了标准化基准,对推动工业柔性装配与家庭服务机器人的实用化具有显著意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务