遇见数据集

CoRL2026-CSI/SO101-DistributeChoco_Ours_100epi_table1

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个机器人操作数据集,使用LeRobot工具创建。它包含100个训练集片段,总计56722帧数据,涉及2个任务。数据特征包括机器人状态观测(6维关节位置)、动作(6维关节位置)、两个摄像头图像(顶部和左手腕视角,均为480x640分辨率、10fps的RGB视频)、末端执行器位置与姿态(6维XYZRPY坐标)、夹爪二进制状态、技能信息(自然语言描述、验证问题、类型、进度、关节和笛卡尔空间目标位置)、子任务信息(自然语言描述、物体名称、3维目标位置)以及时间戳、帧索引、片段索引和任务索引。数据集主要用于机器人学习任务,如模仿学习或强化学习。

This dataset is a robotic manipulation dataset created using the LeRobot tool. It contains 100 training episodes, totaling 56,722 frames, and involves 2 tasks. The data features include robot state observations (6-dimensional joint positions), actions (6-dimensional joint positions), two camera images (top and left wrist views, both 480x640 resolution RGB videos at 10fps), end-effector position and orientation (6-dimensional XYZRPY coordinates), gripper binary state, skill information (natural language description, verification question, type, progress, joint and Cartesian goal positions), subtask information (natural language description, object name, 3-dimensional target position), as well as timestamps, frame indices, episode indices, and task indices. The dataset is primarily intended for robot learning tasks such as imitation learning or reinforcement learning.

提供机构:
CoRL2026-CSI
搜集汇总
数据集介绍
CoRL2026-CSI/SO101-DistributeChoco_Ours_100epi_table1 数据集图片
构建方式
该数据集基于LeRobot框架构建,旨在为机器人操作任务提供高质量的演示数据。数据集涵盖100个完整运行片段(episodes),总计56,722帧,帧率为10 FPS。数据以Parquet格式存储,视频则采用H.264编码的MP4格式,分别存放于data和videos目录下。每条记录包含多模态观测信息,如6维关节状态、末端执行器位姿、两路480×640分辨率的RGB图像(顶部视角与左手腕视角),以及对应的6维动作指令。此外,数据集还细致地标注了技能级别的自然语言描述、验证问题、进度指标,以及子任务级别的目标物体名称与三维空间坐标,为模仿学习与多阶段任务建模提供了结构化支持。
特点
该数据集的核心特点在于其高度的结构化与多粒度标注。它不仅记录了完整的机器人操作轨迹,还嵌入了技能(skill)与子任务(subtask)两个层级的语义信息。技能层包含自然语言指令、进度状态及关节空间与笛卡尔空间的双重目标位置;子任务层则具体到操作对象名称与目标坐标。这种设计使得数据集既能用于端到端的策略学习,也能支持分阶段的任务分解与推理。此外,SO101机器人本体独特的6自由度构型,以及100个片段的规模,为研究非精确抓取、分配操作等细粒度动作提供了丰富的样本。
使用方法
该数据集可通过LeRobot工具链便捷加载与可视化。用户可直接在HuggingFace Spaces上利用可视化工具查看数据和回放演示。在代码中,使用LeRobot的数据集加载接口指定数据集名称和配置即可读取Parquet文件与对应的视频流。数据特征已预定义好字典结构,用户可按需提取observation.state、action、observation.images等关键字段,用于训练模仿学习或强化学习模型。对于研究多任务或语言条件策略的学者,可直接利用skill.natural_language与subtask.natural_language等文本字段进行条件建模,极大简化了数据处理流程。
背景与挑战
背景概述
在机器人学习领域,模仿学习已成为解决复杂操作任务的核心范式之一,其对高质量、多样化示范数据的依赖日益凸显。SO101-DistributeChoco_Ours_100epi_table1数据集由CoRL2026-CSI团队创建,依托LeRobot框架构建,聚焦于“分发巧克力”这一典型精细操作场景。该数据集于近期发布,包含100个示范回合、共计56,722帧的高频多模态观测数据,涵盖机器人本体6自由度关节状态、双视角RGB视觉流(俯视与左腕)、末端执行器位姿及夹爪二值状态等信息。核心研究问题在于如何通过小样本、高精度的示范数据驱动机器人学习可泛化的物体操作技能,尤其是面向桌面环境中的目标分布与放置任务。该数据集为机器人模仿学习、技能泛化及多任务联合训练提供了标准化的测试基准,有望推动具身智能在服务与工业领域的实际落地。
当前挑战
该数据集所面对的挑战体现在两个层面。在领域问题层面,机器人需在仅有100个示范回合的条件下,从高维状态-动作空间中习得鲁棒的分布策略,应对物体初始位置变化、抓取姿态偏移及环境光照干扰等真实世界的不确定性,避免过拟合于特定演示轨迹。在数据集构建层面,多模态数据的精确同步是一大难点,需保证10Hz帧率下关节状态、图像流与时间戳的严格对齐;同时,2类子任务(技能类型)的精细标注要求人工逐帧校验,而基于自然语言的技能描述与验证问题的嵌入,进一步提升了数据采集与质量控制的复杂度。此外,从600×480分辨率的视频中提取有效视觉特征,并实现其与低维状态信息的融合,仍是后续算法开发的核心瓶颈。
常用场景
经典使用场景
SO101-DistributeChoco_Ours_100epi_table1数据集专为机器人操作学习中的物体分发任务而设计,尤其聚焦于巧克力物品的抓取与放置。该数据集包含了100个完整操作回合,通过SO101机器人平台采集,记录了超过5.6万帧的高频状态与视觉信息。其经典使用场景是作为模仿学习范式的训练数据源,研究者可利用其中的机器人关节状态、末端执行器位姿以及双视角(顶部与左腕)视觉流,训练模型学习从观察到动作的映射。数据集内嵌了自然语言技能描述与验证问题,为多模态融合与指令跟随提供了支撑,成为评估机器人精细操作能力的重要基准。
实际应用
该数据集在工业与生活服务机器人领域具有广阔的应用前景。在智能仓储场景中,机器人可基于学习到的分发策略自主完成包裹的分类与递送;在医疗辅助领域,其抓取与放置能力可复用于药瓶或器械的精准分拣。数据集所包含的多视角视觉与位姿信息,使模型能够适应不同照明与视角条件,降低了对硬编码规则的依赖。此外,自然语言标注模块使得非专业用户可以通过口头指令指导机器人执行任务,为人机协作的柔性生产线、家庭服务等实际部署场景提供了可迁移的技能基座。
衍生相关工作
该数据集的发布推动了多项机器人操作研究的深入开展。基于此类结构化数据,研究者开发了一系列高效模仿学习算法,如行为克隆与逆强化学习的混合框架,显著提升了策略的泛化能力。同时,其丰富的多模态标注催生了视觉-语言-动作联合建模的经典工作,例如将自然语言指令转化为原子操作序列的技能组合方法。在域迁移研究中,该数据集被用作源域样本验证对抗学习与域随机化技术的有效性,实现了从仿真环境到真实机器人的零样本策略迁移。这些突破性工作进一步巩固了该数据集作为机器人操作学习领域标杆的地位。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务