遇见数据集

HyeonseokE/SO101-DistributeChoco_Ours_60epi

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个用于机器人技能学习的多模态数据集,由LeRobot框架创建。数据集包含60个训练集片段,总计29525帧,数据文件大小为100MB,视频文件大小为200MB,帧率为10fps。数据特征包括:机器人状态观测(6维关节位置)、动作(6维关节位置)、两个视角的图像观测(顶部和左腕摄像头,均为480x640分辨率RGB视频)、末端执行器位置(6维XYZRPY坐标)、抓取器二进制状态、技能和子任务的自然语言描述、技能类型、进度、目标位置(关节空间、笛卡尔空间和抓取器位置)、时间戳和索引等。数据集适用于机器人模仿学习或强化学习任务,支持多模态输入(如视觉和状态)到动作的映射。

This dataset is a multimodal dataset for robot skill learning, created using the LeRobot framework. It contains 60 training episodes, totaling 29,525 frames, with data files of 100MB and video files of 200MB, at a frame rate of 10fps. Features include: robot state observations (6-dimensional joint positions), actions (6-dimensional joint positions), image observations from two viewpoints (top and left wrist cameras, both 480x640 resolution RGB videos), end-effector position (6-dimensional XYZRPY coordinates), gripper binary state, natural language descriptions for skills and subtasks, skill type, progress, goal positions (joint space, Cartesian space, and gripper position), timestamps, and indices. The dataset is suitable for robot imitation learning or reinforcement learning tasks, supporting multimodal input (e.g., vision and state) to action mapping.

提供机构:
HyeonseokE
搜集汇总
数据集介绍
HyeonseokE/SO101-DistributeChoco_Ours_60epi 数据集图片
构建方式
SO101-DistributeChoco_Ours_60epi数据集依托于LeRobot框架构建,专为机器人操作任务设计。数据采集自SO101型跟随机器人,通过远程操控或示教技术录制60个演示片段,总计包含29525帧时间序列数据,采样频率为每秒10帧。每个片段记录了机器人从初始状态到完成指定目标的完整轨迹,涵盖了6维关节位置(肩部旋转、肩部抬升、肘部弯曲、腕部弯曲、腕部滚动及夹爪状态)的观测状态与动作序列。同时,来自顶部和左腕双视角的640×480分辨率视频流被同步采集,以提供视觉模态信息。数据集还标注了末端执行器的三维位置与姿态(x、y、z、roll、pitch、yaw)及夹爪二进制状态,并结构化存储于Parquet文件与H.264编码的MP4视频文件中,整体数据与视频文件大小分别约为100MB和200MB。
使用方法
数据集通过LeRobot库可直接加载与交互,用户可通过Hugging Face Spaces提供的可视化界面在线预览片段内容。在Python环境中,使用LeRobot的Dataset类加载后,可获取标准化格式的状态、动作、图像及元数据张量。研究者可直接利用该数据训练基于行为的克隆(Behavioral Cloning)或隐式策略模型,亦可结合图像编码器(如ResNet)与状态编码器构建端到端模型。数据中丰富的技能与子任务标注支持基于语言条件或目标条件的策略学习,便于开发具备任务理解与泛化能力的机器人智能体。建议在应用时注意标准化状态与动作空间的边界,并利用时间戳信息进行时间对齐与数据增强。
背景与挑战
背景概述
SO101-DistributeChoco_Ours_60epi数据集由研究者HyeonseokE于近年创建,依托HuggingFace社区及LeRobot框架,专注于机器人操作领域的模仿学习。该数据集的核心研究问题在于如何通过少量演示数据,使机械臂高效习得精细的物体分发任务,例如在特定场景中抓取并放置巧克力。数据集包含60个演示片段,共计近3万帧,记录了SO101型机械臂在单一任务下的完整操作轨迹,融合了关节状态、末端执行器位姿、多视角视觉信息以及自然语言指令。其发布为机器人技能学习提供了结构化的多模态基准,推动从感知到动作映射的算法评估,对基于模仿学习的机器人抓取与操作研究具有重要参考价值。
当前挑战
该数据集所应对的领域挑战集中于机器人从有限演示中泛化技能的能力,尤其是细粒度的物体分发任务,要求模型精确理解序列化操作并适应环境变化。构建过程中,研究者面临多重困境:首先,数据采集需确保机械臂在60个片段的重复演示中保持一致性,但关节与视觉数据的同步误差难以避免;其次,多模态特征(如关节空间、图像)的异构对齐增加了预处理复杂度;最后,由于演示数量有限,如何利用这些数据训练出鲁棒策略,避免过拟合至特定轨迹,仍是该数据集推动解决的核心难题。
常用场景
经典使用场景
SO101-DistributeChoco_Ours_60epi数据集是面向机器人操作学习领域的高质量示范数据集,其核心应用场景聚焦于基于视觉和状态信息的机器人技能模仿学习。该数据集记录了SO101型机械臂在执行分发巧克力这一精细操作任务时的完整轨迹,包含60个演示片段,总计近3万帧数据。每个样本均同步采集了顶部与左腕部摄像头提供的640×480像素视觉图像、6维关节状态、末端执行器位姿以及夹爪状态等多模态信息,并配有自然语言描述的子任务与技能标签。研究者可利用此数据集训练机器人从观测到动作的端到端映射模型,实现复杂操作技能的泛化与迁移。
解决学术问题
该数据集为机器人学习领域的关键学术难题——如何从有限人类示范中高效学习精细操作技能——提供了标准化研究平台。其多模态、多粒度的标注体系(包含技能类型、验证问题、进度指标等高级语义信息)使得研究者能够深入探索分层强化学习、隐式策略建模及视觉-语言-动作联合表示等前沿课题。通过提供结构化的动作空间(6自由度关节控制)与丰富的环境感知信息,该数据集有力推动了机器人领域关于小样本模仿学习、操作技能的可迁移性以及多任务泛化能力等核心问题的实证研究,为构建通用智能操作体奠定了数据基础。
实际应用
在实际工业与社会服务场景中,该数据集所支撑的机器人技能学习技术具有广阔应用前景。具体而言,基于该数据集训练的操作模型可直接部署于食品加工流水线上的自动化分拣包装环节,实现糖果、巧克力等柔性物品的精准拾取与放置。在餐饮服务领域,机器人可学会将巧克力制品按指定数量分配到不同容器中的社交礼仪操作。此外,该技术还能迁移至医疗辅助场景中的药片分装、实验室的样品制备等精细操作任务,有效降低人工重复劳动强度,提升生产效率与操作一致性。
数据集最近研究
最新研究方向
在机器人学习与灵巧操作领域,SO101-DistributeChoco_Ours_60epi数据集聚焦于基于视觉与触觉融合的精细操作任务。该数据集利用LeRobot框架采集了60个高质量演示轨迹,涵盖超过2.9万帧6自由度机械臂的关节状态与动作序列,并配以顶部和左腕的双视角视频流,为模仿学习与行为克隆提供了丰富的多模态训练样本。结合当前具身智能与端到端机器人技能学习的热潮,该数据集特别引入了自然语言技能描述、验证问题与子任务分解等语义标签,推动了从单纯轨迹复现向语言引导的机器人自主学习范式的演进。其发布的Apache-2.0许可降低了研究门槛,有望加速机器人在制造业分拣、物流配送等场景中的泛化能力突破,成为连接仿真训练与现实部署的关键数据基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务