遇见数据集

HyeonseokE/SO101-cap_distribute_choco_baseline_10fps_40epi

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是使用LeRobot创建的机器人数据集,专门用于SO101跟随机器人。数据集包含40个完整的情节(episodes),总计22,451帧,以每秒10帧的速率采集。数据集中仅包含一个任务。数据以parquet文件格式存储,总数据文件大小为100MB,视频文件大小为200MB。数据集的特征包括:机器人关节状态观测(6个浮点数,表示肩部平移、肩部提升、肘部弯曲、腕部弯曲、腕部旋转和夹爪位置)、动作(相同6个浮点数结构)、图像观测(顶部摄像头和左腕摄像头,均为480x640分辨率、3通道的RGB视频)、末端执行器位置(6个浮点数,表示XYZ位置和RPY姿态)、夹爪二进制状态、技能信息(自然语言描述、验证问题、类型、进度、目标位置关节和笛卡尔坐标)、子任务信息(自然语言描述、对象名称、目标位置)以及时间戳、帧索引、情节索引等元数据。数据集适用于机器人控制、模仿学习或强化学习任务。

This dataset is a robotics dataset created using LeRobot, specifically for the SO101 follower robot. It contains 40 complete episodes, totaling 22,451 frames, captured at 10 frames per second. The dataset includes only one task. Data is stored in parquet format, with a total data file size of 100MB and video file size of 200MB. Features of the dataset include: robot joint state observations (6 floats for shoulder pan, shoulder lift, elbow flex, wrist flex, wrist roll, and gripper positions), actions (same 6-float structure), image observations (top camera and left wrist camera, both 480x640 resolution, 3-channel RGB videos), end-effector position (6 floats for XYZ position and RPY orientation), gripper binary state, skill information (natural language description, verification question, type, progress, goal positions in joint and Cartesian space), subtask information (natural language description, object name, target position), and metadata such as timestamp, frame index, and episode index. The dataset is suitable for robotics control, imitation learning, or reinforcement learning tasks.

提供机构:
HyeonseokE
搜集汇总
数据集介绍
HyeonseokE/SO101-cap_distribute_choco_baseline_10fps_40epi 数据集图片
构建方式
该数据集基于LeRobot框架构建,专为机器人操作任务设计,聚焦于巧克力分配这一特定场景。数据集共包含40个演示片段(episodes),以10帧每秒(fps)的采样频率捕获了总计22,451帧数据。每个片段均以Parquet格式存储结构化的时间序列信息,并辅以MP4格式的高清视频流,分别记录来自顶部和左手腕两个视角的视觉观测,视频分辨率为640×480像素。数据集通过将连续操作拆分为固定大小的数据块(chunk_size=1000)进行组织,所有片段默认划归训练集,便于直接用于模仿学习或行为克隆等算法的训练流程。
特点
该数据集最为显著的特征在于其多模态与结构化的信息融合能力。除了基础的机器人关节状态(6维,涵盖肩部、肘部、腕部及夹爪的位姿)与末端执行器位姿(xyzrpy)外,还特别引入了丰富的技能与子任务元数据,包括自然语言指令、验证问题、技能类型及进度标记。这种设计使得数据集不仅记录了“如何做”,还标注了“做什么”以及“做到哪一步”,为分层强化学习或基于语言调控的机器人策略提供了宝贵基础。此外,所有传感器数据与动作指令均保持同步的时间戳与帧索引,确保了时间维度的精确对齐。
使用方法
使用该数据集时,最直接的途径是加载LeRobot库,通过其提供的可视化工具在线预览数据片段。在编程应用中,用户可利用Hugging Face Datasets库读取Parquet文件,获取包括视觉图像、低维状态向量及文本注释在内的全部特征。由于数据已按标准格式组织,研究人员可轻松将其适配至基于Transformer的决策模型或扩散策略(Diffusion Policy)等主流算法。对于需要精细化控制的场景,还可利用其中的技能目标位置与子任务目标坐标作为动作监督信号,构建从感知到执行的端到端学习管线。
背景与挑战
背景概述
在机器人学习领域,模仿学习(Imitation Learning)与示教学习(Learning from Demonstration)共同构成了技能获取的核心范式,其关键在于收集高质量、多模态的机器人操作数据。SO101-cap_distribute_choco_baseline_10fps_40epi数据集由HyeonseokE等人采用LeRobot框架构建,于近期发布,旨在为SO101型机械臂的精密操作任务提供标准化训练资源。该数据集聚焦于“巧克力分发”这一具有代表性的物体操控场景,以10帧/秒的频率记录了40个完整回合(episode)的演示,总计22,451帧。数据包含了来自顶部和左手腕的640×480分辨率视频流、六维关节角度与末端执行器位姿、夹爪状态、以及语言指令与子任务标注。作为具身智能研究中为数不多的、针对特定操作技能且附带详细结构化注释的公开数据集,它为验证和基准测试基于视觉和状态的运动规划算法提供了关键支撑,推动了机器人精细操作技能的可复现研究。
当前挑战
该数据集面临的核心挑战源自其应用场景与构建过程的双重复杂性。在领域问题层面,机器人操作“巧克力”这类柔性易变形物体时,需要精确感知物体的形状变化与滑动状态,并协调高自由度的机械臂运动,这区别于刚性物体的抓取与放置,对模型的泛化能力和鲁棒性提出了更高要求。在数据集构建过程中,挑战体现为多模态数据的精确时空同步:需要将不同视角的2D视频、关节编码器反馈、夹爪力/位置信号以及人为标注的语言指令精准对齐至同一时间戳,以消除时序偏差。此外,40个回合的有限样本量在覆盖物体初始位置、角度及操作轨迹的多样性上面临显著约束,如何在小样本条件下有效引导模型学习分布外(Out-of-Distribution)情况下的应对策略,仍是制约该数据集效用的关键瓶颈。
常用场景
经典使用场景
在机器人学习与操控领域,SO101-cap_distribute_choco_baseline_10fps_40epi数据集以其采集自SO101型机械臂、执行巧克力分发这一精细操作任务的独特特性,成为模仿学习与示教学习研究的理想基准。该数据集包含40个完整示教回合,以每秒10帧的频率同步记录机械臂六关节状态、末端执行器位姿、夹爪状态及多视角视觉图像,为学习从感知到动作的端到端映射提供了结构化、多模态的示范轨迹。研究者常以该数据集作为输入,训练基于行为克隆、逆强化学习或扩散策略的操控策略,尤其在需要处理柔顺接触与精准定位的工业装配、物料搬运等场景中,其规范化的数据格式(LeRobot标准)极大便利了算法对比与复现。
解决学术问题
在学术研究中,该数据集核心解决了机械臂在非结构化环境下执行类人精细操作策略的获取难题。传统基于物理建模的方法难以应对巧克力盒这类柔性物体在抓取、转移与放置过程中的动力学不确定性,而该数据集通过采集人类示教者的多模态演示数据,为研究“如何从有限示例中泛化出鲁棒操控行为”提供了实验支撑。它推动了模仿学习领域关于数据效率提升(如利用隐式场景表示)、多任务视觉运动策略的通用性,以及结合自然语言指令的分层任务规划等关键问题的探索。其附带技能语义标签与子任务划分,使得研究可深入至“细粒度动作分解”与“语义引导的操控规划”理论,对理解人类示教中的意图传递与机器人自主决策的融合具有重要启发。
衍生相关工作
该数据集催生了一系列围绕高效模仿学习与机器人技能泛化的衍生工作。基于其结构化特征,研究者开发了结合扩散模型的策略学习方法,在巧克力分发任务中实现了优于传统行为克隆的复杂轨迹生成能力;另有工作利用数据集中的自然语言技能标签,探索了语言条件行为克隆(LCBC)框架,使机器人能根据口头指令切换操控子任务。在数据增强层面,针对其高保真多视角视频,衍生出利用神经辐射场(NeRF)构建可交互场景表征的技术,提升了策略对物体交互动力学的迁移能力。此外,该数据集还作为LeRobot公开基准的组成部分,被广泛用于评测各类离线策略优化算法(如IQL、CQL)在真实机器人数据上的性能,推动了面向变形体操控的策略学习理论演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务