遇见数据集

HyeonseokE/SO101-DistributeChoco_Ours_80epi

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集使用LeRobot框架创建,专注于机器人操作任务。数据集包含80个训练片段,总计40667帧数据,帧率为10fps。机器人类型为so101_follower,数据以parquet格式存储,并附带MP4格式的视频文件。数据集特征包括:机器人关节状态观测(6维位置)、对应的动作控制(6维关节位置)、来自顶部和左腕摄像头的图像观测(分辨率480x640,RGB三通道)、末端执行器的位置和姿态(XYZRPY)、二进制夹爪状态、技能和子任务的自然语言描述、技能类型和进度、目标关节位置和末端位姿、子任务对象名称和目标位置,以及时间戳、帧索引、片段索引等元数据。该数据集适用于机器人模仿学习、强化学习及多模态任务研究。

This dataset was created using the LeRobot framework and focuses on robotic manipulation tasks. It consists of 80 training episodes with a total of 40,667 frames at 10 fps. The robot type is so101_follower, and data is stored in parquet format along with MP4 video files. Dataset features include: robot joint state observations (6-dimensional positions), corresponding action controls (6-dimensional joint positions), image observations from top and left-wrist cameras (resolution 480x640, RGB three channels), end-effector position and orientation (XYZRPY), binary gripper state, natural language descriptions for skills and subtasks, skill type and progress, target joint positions and end-effector poses, subtask object names and target positions, as well as metadata such as timestamps, frame indices, and episode indices. This dataset is suitable for research in robot imitation learning, reinforcement learning, and multimodal tasks.

提供机构:
HyeonseokE
搜集汇总
数据集介绍
HyeonseokE/SO101-DistributeChoco_Ours_80epi 数据集图片
构建方式
该数据集基于LeRobot框架构建,旨在为机器人模仿学习提供高质量的训练数据。数据采集过程采用SO101跟随机器人(so101_follower)作为执行平台,通过遥操作或预设策略收集了80个完整演示回合(episodes),总计40667帧数据。每帧数据以10帧/秒的采样频率记录,包含机器人6个关节的位置状态(肩部旋转、肩部抬升、肘部弯曲、腕部弯曲、腕部滚动及夹爪位置)以及对应的动作指令。多模态感知信息通过顶部和左手腕两个视角的摄像头以640×480分辨率的H.264编码视频形式捕获,同时辅以末端执行器位姿(xyzrpy)和夹爪状态等数据。数据以Parquet文件和MP4视频分块存储,其中100MB的表格数据与200MB的视频文件,共同构成了这一结构化的机器人操作数据集。
特点
本数据集的一个显著特点在于其丰富的语义标注与层级化任务结构。除了基本的运动学数据外,每个时间步均配备了自然语言描述的高级技能(skill)、子任务(subtask)指示以及验证问题,使得数据集不仅适用于低层级的运动控制学习,更能支持高层级的任务规划与语言引导策略。此外,数据集明确记录了技能进度(progress)和目标位姿(goal_position),为评估机器人操作过程中的阶段性达成情况提供了基准。所有80个训练回合均统一归属于单一任务,且数据特征空间包含18个不同维度,从视觉观测到本体感觉,从实时的关节状态到离散的夹爪二进制信号,为开发复杂的多模态机器人策略提供了宝贵的资源。
使用方法
使用该数据集时,推荐通过LeRobot生态进行加载与可视化。用户可直接访问Hugging Face Spaces上的可视化工具,以交互式方式浏览各演示回合的序列帧与状态变化。在训练流程中,可通过LeRobot的Dataset API读取Parquet文件中存储的观测与动作数据,并同步解码对应的视频帧。数据集已按标准分割策略将全部80个回合划归为训练集,开发者可基于此开展模仿学习或强化学习的策略训练。对于需要自然语言理解能力的模型,可以利用skill.natural_language和subtask.natural_language字段实现语言条件策略的协同学习,而目标位姿信息则可服务于基于目标的条件化策略设计。
背景与挑战
背景概述
SO101-DistributeChoco_Ours_80epi数据集由HyeonseokE等人基于LeRobot框架创建,专注于机器人操作任务中的物体分发场景,具体涉及巧克力类物品的抓取与放置操作。该数据集以SO101仿人机械臂为平台,采集了80个演示回合,共计40667帧数据,涵盖六自由度关节状态、末端执行器位姿、双目视觉图像(顶部与左腕视角)及底层动作序列等多元模态信息。其核心研究问题在于为模仿学习与行为克隆算法提供高保真的专家演示数据,推动机器人从预设编程向自主学习范式演进。该数据集填补了精细操作任务中多模态耦合数据资源的空白,为机器人领域关于灵巧操作与任务泛化的研究提供了基准性支持,在少样本学习与跨任务迁移等方向上具有潜在影响力。
当前挑战
该数据集所应对的领域挑战在于解决机器人精细分发任务中的状态空间复杂性与动作连续性约束问题,巧克力类易损物品的抓取需同时考虑接触力控制与轨迹平滑性,这对模型从高维视觉与低维关节数据中提取鲁棒特征构成严峻考验。构建过程中面临的挑战包括:多传感器异构数据的时空对齐,需同步6维关节状态、6自由度末端位姿及每秒10帧的双目视频流;任务标注的精细度要求,需为每个子步骤提供自然语言描述与目标位置的语义化关联,保证80个演示回合内操作风格的一致性;此外,在有限演示样本下(80回合)需避免过拟合,平衡数据多样性采集成本与模型泛化性能之间的固有矛盾。
常用场景
经典使用场景
SO101-DistributeChoco_Ours_80epi数据集专为机器人操作技能学习而设计,聚焦于巧克力分发这一精细操作任务。该数据集包含了由SO101型从动臂机器人执行的80个完整演示回合,录制约4万帧的高频运动数据与视觉影像。每一条轨迹均详细记录了六自由度关节状态、末端执行器位姿及夹爪开合信息,同时辅以顶视与左腕双视角视频流,为模仿学习与行为克隆提供了丰沛的多模态训练素材。数据集中还标注了自然语言指令、子目标位置及技能进度等语义信息,使得任务拆解与语言引导的机器人学习成为可能。该数据集最经典的用途是训练机器人通过观看人类演示来复现巧克力分发的操作流程,从而验证模仿学习算法在真实精细操作中的迁移能力。
实际应用
在实际产业场景中,该数据集所承载的操作范式可直接迁移至食品包装、药品分拣及电子元件装配等需要高精度抓取与放置的自动化环节。基于该数据集训练的视觉-运动策略,能够使机器人仅依赖单目或双视角视觉输入即可完成诸如巧克力条从输送带拾取并有序摆放至包装盒内的连续动作。这种端到端的感知-控制闭环极大地简化了传统工业机器人的编程复杂度,特别适用于生产任务频繁变更的柔性制造线。此外,数据集中包含的自然语言指令为未来的人机协作奠定了基础——工人可以通过语音或文本下达“将牛奶巧克力放至左侧格位”等命令,机器人随即解析意图并执行相应操作,显著提升了人机交互的直观性与效率。
衍生相关工作
该数据集的推出激发了多项具有代表性的后续研究。在算法层面,研究人员基于其多模态特性开发了融合视觉与关节状态的 transformer 架构,显著提升了长时序动作预测的准确性。自然语言标注部分催生了语言条件式策略网络的工作,使机器人能够依据文本命令动态调整操作方法。数据集中清晰的子任务划分为层次化强化学习提供了天然的测试床,相关成果在复杂装配任务上展现了卓越的泛化性能。在基准平台方面,该数据集与 LeRobot 生态的深度集成,促使社区涌现了多个针对巧克力分发任务改进的基线模型,例如结合扩散策略的动作生成器与使用占用网络的精确抓取规划器。这些衍生工作共同验证了该数据集作为精细操作研究基准的权威性和引领作用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务