遇见数据集

HyeonseokE/SO101-cap_sort_RGBblock_to_matchingplate_10fps_40epi

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个机器人数据集,使用LeRobot创建,专门用于机器人任务。数据集包含40个episodes,总计34886帧,涉及1个任务,数据以parquet文件格式存储,视频以MP4格式存储,帧率为10fps。数据集基于so101_follower机器人类型,特征包括机器人的状态观察(如6个关节位置:肩部平移、肩部提升、肘部弯曲、腕部弯曲、腕部旋转和夹爪位置)、动作控制、图像观察(顶部和左腕摄像头,分辨率480x640,RGB通道)、末端执行器位置(XYZ坐标和欧拉角)、夹爪二进制状态、技能信息(如自然语言描述、验证问题、类型、进度和目标位置)以及子任务信息(如自然语言描述、对象名称和目标位置)。此外,还包括时间戳、帧索引、episode索引等元数据。数据集适用于机器人学习和控制任务,如模仿学习或强化学习。

This is a robotics dataset developed with LeRobot, specifically tailored for robotic tasks. It contains 40 episodes, totaling 34,886 frames, covering one single task. The dataset is stored in Parquet files, while the associated videos are saved in MP4 format at a frame rate of 10 fps. This dataset is based on the so101_follower robot type. Its features include robot state observations (e.g., 6 joint positions: shoulder translation, shoulder lift, elbow flexion, wrist flexion, wrist rotation, and gripper position), action controls, image observations from the top and left-wrist cameras with a resolution of 480×640 and RGB channels, end-effector positions (XYZ coordinates and Euler angles), binary gripper state, skill information (such as natural language descriptions, validation questions, skill types, progress levels, and target positions), and subtask information (including natural language descriptions, object names, and target positions). Additionally, it includes metadata such as timestamps, frame indices, and episode indices. This dataset is applicable to robotics learning and control tasks, such as imitation learning or reinforcement learning.

提供机构:
HyeonseokE
搜集汇总
数据集介绍
HyeonseokE/SO101-cap_sort_RGBblock_to_matchingplate_10fps_40epi 数据集图片
构建方式
在机器人操作领域,精准的物体分拣与匹配是自动化生产中的核心挑战。该数据集基于LeRobot框架构建,旨在记录SO101型机械臂执行彩色方块到匹配板的抓取与放置任务。数据集包含40个完整示范片段,总帧数达34886帧,以10帧每秒的采样频率采集。每个片段以Parquet格式存储结构化数据,并同步记录来自顶部与左手腕摄像头的H.264编码视频流,分辨率为480×640。数据通过SO101_follower机器人平台采集,任务类型单一,训练集与全集重合,所有片段均用于模型训练。
特点
数据集的突出特点在于其多维度的感知与运动信息融合。特征空间涵盖6维关节状态(肩部旋转、肘部弯曲等)、6维动作指令以及末端执行器位姿,同时包含夹爪开合状态。此外,数据引入了丰富的语义标签,如子任务的自然语言描述、目标物体名称及其三维位置坐标。每一帧均被赋予时间戳与索引,并关联至特定任务与片段,便于序列化学习。视频数据采用有损压缩以平衡存储与质量,单任务设定确保操作规范的高度一致性。
使用方法
数据集主要面向模仿学习与机器人操作策略训练。用户可通过LeRobot库加载parquet文件与对应视频,提取观测状态、动作及图像序列。推荐将数据划分为训练与验证集(例如前32片段用于训练,剩余8片段用于验证),并利用时间维度进行序列建模。由于动作与状态空间维度一致(均为6维),可直接应用于行为克隆或逆动力学模型。视频与状态数据可联合作为输入,支持多模态策略学习。此外,自然语言标签可用于条件生成任务,例如根据目标位置或物体名称生成对应操作轨迹。
背景与挑战
背景概述
SO101-cap_sort_RGBblock_to_matchingplate_10fps_40epi数据集由研究机构基于LeRobot框架创建,聚焦于机器人灵巧操作中的精细分拣任务。该数据集以SO101型机械臂为载体,记录了40个示教回合、超过3.4万帧的高频动作数据,涵盖RGB视觉图像、关节状态及末端执行器位姿等多模态信息。其核心研究问题在于如何通过模仿学习实现机器人对彩色方块与匹配板之间的精准放置操作。作为机器人操作任务标准化数据集的范例,它推动了基于视觉的灵巧操作算法在工业分拣与装配场景中的发展,为后续研究提供了可复现的基准参考。
当前挑战
该数据集面临的主要挑战包括:1)所解决的领域问题为精细化分拣操作中的视觉-动作耦合难题,机器人需在有限视野内识别颜色、形状与空间关系,并执行亚毫米级精度的对齐与放置;2)构建过程中需克服多传感器时序同步困难,确保10帧/秒的RGB图像与关节角数据严格对齐,同时处理机械臂8个自由度的控制与夹爪二元状态的协调;3)数据规模有限(仅40回合),对模仿学习模型的泛化能力构成严峻考验,易导致在未见参数组合下的操作失败。
常用场景
经典使用场景
在机器人操作领域,SO101-cap_sort_RGBblock_to_matchingplate_10fps_40epi数据集为基于视觉的灵巧操控任务提供了标准化的数据支撑。该数据集聚焦于将彩色立方体精准放置于匹配底盘的精细操作场景,采集了40个示范回合,涵盖34000余帧高分辨率RGB图像与六自由度关节状态、末端执行器位姿等多模态信息。研究者可借助该数据集训练模仿学习模型,利用专家演示数据学习从视觉感知到动作映射的端到端策略,亦可构建强化学习环境中的奖励函数或行为克隆基线,有效推动机器人从示教中掌握复杂装配类技能的内在机理探索。
衍生相关工作
围绕该数据集,衍生出多项推动机器人学习发展的代表性工作。例如,有研究基于其视觉与动作模态的齐次结构,提出了空间注意力增强的扩散策略模型,显著提升了多步装配任务的完成率;另有团队利用数据中的子任务语言注释,开发了分层模仿学习框架,将长时程操作分解为语义可解释的子技能序列。此外,该数据集还被用于验证视觉-语言-动作联合预训练范式,探索自然语言指令引导机械臂完成跨构型匹配的泛化能力,为具身智能体实现开放式任务学习奠定了数据基础。
数据集最近研究
最新研究方向
该数据集聚焦于机械臂在精细操作任务中的模仿学习,特别是在分拣与匹配装配场景下的应用。前沿研究方向正围绕如何利用多模态感知数据(包括顶部与腕部视觉流、关节状态与末端执行器位姿)驱动机器人从人类示范中高效习得复杂技能。结合LeRobot框架的标准化流程,研究者可借助该数据集探索自然语言指令引导下的技能分解与泛化,以及利用多视角视觉输入增强对微小物体(如色块)的感知鲁棒性。此项工作与机器人领域内追求‘少样本学习’与‘跨任务迁移’的热点不谋而合,其结构化标注的时序数据为评估模型在连续动作空间中的长期规划能力提供了宝贵基准,对推动工业装配自动化与家庭服务机器人等场景的落地具有显著意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务