遇见数据集

HyeonseokE/SO101-cap_distribute_choco_baseline_10fps_20epi

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个机器人技术数据集,使用LeRobot创建,专门针对so101_follower机器人。它包含20个episodes,总计11221帧,涉及1个任务,数据以parquet格式存储,视频以MP4格式存储,帧率为10fps。数据集特征丰富,包括机器人的状态观测(如关节位置、末端执行器位置)、动作控制、图像观测(从顶部和左腕摄像头获取的视频)、技能信息(如自然语言描述、验证问题、目标位置)和子任务细节(如对象名称、目标位置)。此外,还包含时间戳、帧索引、episode索引等元数据,适用于机器人学习和控制任务。

This dataset is a robotics dataset created using LeRobot, specifically for the so101_follower robot. It contains 20 episodes, totaling 11221 frames, and involves 1 task. The data is stored in parquet format, with videos in MP4 format at a frame rate of 10fps. The dataset features include robot state observations (e.g., joint positions, end-effector positions), actions, image observations (videos from top and left wrist cameras), skill information (e.g., natural language descriptions, verification questions, goal positions), and subtask details (e.g., object names, target positions). Additionally, it includes metadata such as timestamps, frame indices, and episode indices, making it suitable for robot learning and control tasks.

提供机构:
HyeonseokE
搜集汇总
数据集介绍
HyeonseokE/SO101-cap_distribute_choco_baseline_10fps_20epi 数据集图片
构建方式
该数据集基于LeRobot框架构建,专注于机器人巧克力分拣任务。数据通过SO101型机械臂以10帧每秒的采样频率收集,共包含20个完整操作回合,总计11221帧。采集过程中,机械臂通过顶置摄像头与左腕摄像头同步记录视觉信息,同时精确捕获6维关节状态、末端执行器位姿及夹爪状态等本体感知数据。每个回合均以Parquet格式存储结构化数据,视觉信息则以H.264编码的MP4视频保存,确保了数据的高效压缩与完整性。
使用方法
用户可通过LeRobot库便捷加载与使用该数据集。数据已预先划分为训练集(全部20个回合),并支持按帧索引或回合索引进行访问。推荐在机器人模仿学习任务中,将观测状态与视觉图像作为输入,以机械臂关节动作为预测目标进行模型训练。同时,数据集内嵌的自然语言标签可用于训练语言条件策略,实现通过指令驱动机器人执行“打开瓶盖”等具体操作。
背景与挑战
背景概述
SO101-cap_distribute_choco_baseline_10fps_20epi数据集由HyeonseokE团队于近期创建,基于LeRobot框架构建,专注于机器人操作任务中的模仿学习与技能获取。该数据集以SO101型机械臂为硬件载体,采集了20个示范轨迹,包含约11221帧视觉与关节状态数据,核心研究问题在于如何通过少量示范(20个回合)使机器人掌握‘分拣巧克力’这一精细操作任务。数据集融合了多模态信息,包括640×480像素的顶置与腕部相机视频、6维关节状态、末端执行器位姿及自然语言指令,为机器人学习领域提供了高保真的示范数据。其在开源社区中的发布,尤其是与LeRobot生态的兼容性,推动了低样本机器人技能学习的可复现研究,成为验证模仿学习算法从单任务示范泛化到复杂操作场景的重要基准。
当前挑战
该数据集面临的挑战包含双重维度。在领域问题层面,其针对的‘分拣巧克力’任务属于高精度抓取与放置操作,要求机器人从杂乱的散装巧克力中完成单个物品的识别、定位与稳定抓取,这对视觉感知的鲁棒性、动作执行的精准度以及面对不同物体外观与位置的泛化能力构成显著难题。在构建过程中,挑战集中于数据采集效率与质量——仅依赖20个示范回合(约100MB数据量)难以覆盖巧克力随机堆叠、光照变化等多变工况,而10fps的帧率可能错过关键接触动力学细节;此外,多模态数据(6维关节动作、视频流、语言指令)的时空对齐与一致性标注,以及从单一任务(基线分拣)向其他操作技能(如排列、分类)的迁移能力,均是算法验证中需要克服的障碍。
常用场景
经典使用场景
SO101-cap_distribute_choco_baseline_10fps_20epi数据集在机器人学习领域扮演着基石性角色,尤其适用于模仿学习与行为克隆任务。该数据集包含20个完整演示片段,记录了一台SO101型机械臂执行巧克力分发操作的全过程。通过高精度六维关节状态与末端执行器位姿数据,配合每秒10帧的俯视及左腕视角视频流,研究人员能够借此训练机器人系统精准复现复杂抓取与放置动作。其结构化的多模态特征设计,为构建端到端的视觉-运动控制策略提供了理想的训练素材与基准评估环境。
解决学术问题
该数据集旨在解决机器人精细操作技能学习中数据稀缺性与多模态融合两大核心难题。通过提供包含关节角度、笛卡尔空间位姿、二元夹爪状态、视觉图像及自然语言任务描述的丰富特征,它支撑了从单一动作模仿到语义理解的多级研究。具体而言,它助力学术界探索如何减轻策略迁移中的差距问题,揭示视觉与本体感知信息的最佳融合机制,并推动闭环控制中时序依赖性的建模进展。其公开的20个高质量演示片段,为对比不同模仿学习算法在相同硬件条件下的泛化能力提供了标准化评估基准。
实际应用
在实际应用中,该数据集训练出的模型可直接部署于智能仓储物流中巧克力等易损物品的分拣与包装场景。基于其高频位置与力反馈数据衍生的控制策略,能够使机器人快速适应不同尺寸、摆放姿态的巧克力盒,实现稳定而柔性的抓取轨迹规划。此外,其内置的子任务描述与自然语言技能标注,为开发人机协作中的语音指令引导系统搭建了桥梁,使得非专业用户也能通过简单口令指挥机器人完成复杂的包装作业流程,显著提升产线自动化程度。
数据集最近研究
最新研究方向
该数据集聚焦于机器人操作技能的模仿学习,特别是针对巧克力分拣与配送这一精细化工业场景。在当前具身智能与少样本学习前沿浪潮中,研究者正借助LeRobot框架,通过高保真的视觉-动作联合表征(10fps的顶部与腕部双视角视频、机械臂六维关节状态及末端执行器位姿),探索将人类示教数据高效转化为机器人策略的途径。数据集内嵌的自然语言技能标签与子任务目标坐标,为结合大语言模型实现跨任务泛化与任务分解提供了稀缺的标注样本;其20个回合的紧凑规模恰适用于验证元学习与条件模仿学习在有限数据下的鲁棒性。这一方向正助推食品自动化领域迈向柔性装配与个性化定制的新境界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务