遇见数据集

so101_pick_up_cylinder_20260707_181214

收藏
Hugging Face2026-07-20 更新2026-07-21 收录
官方服务:

资源简介:

该数据集是一个机器人操作数据集,由LeRobot项目创建。数据集包含用于训练或评估机器人控制策略的演示数据。数据以片段(episodes)形式组织,总共有50个训练片段,共计18422帧数据,采样频率为30Hz。每个数据样本包含多模态信息:1) 动作指令:一个6维浮点向量,指定了机器人肩部平移、肩部抬升、肘部弯曲、腕部弯曲、腕部旋转和夹爪这6个关节的目标位置。2) 观测状态:一个6维浮点向量,记录了机器人上述6个关节的实际位置。3) 视觉观测:来自腕部摄像头的RGB视频流,分辨率为480x640,使用AV1编码。4) 元数据:包括时间戳、帧索引、片段索引、全局索引和任务索引。数据集专门针对‘so_follower’类型的机器人。所有数据均被划分为训练集。数据以Parquet文件格式存储,总数据量约为300MB(其中结构化数据约100MB,视频数据约200MB)。该数据集适用于机器人模仿学习、强化学习或行为克隆等任务。

This dataset is a robot manipulation dataset created by the LeRobot project. It contains demonstration data for training or evaluating robot control policies. The data is organized in episodes, with a total of 50 training episodes comprising 18,422 frames at a sampling frequency of 30Hz. Each data sample includes multimodal information: 1) Action command: a 6-dimensional floating-point vector specifying target positions for the robots shoulder translation, shoulder lift, elbow bend, wrist bend, wrist rotation, and gripper joints. 2) Observation state: a 6-dimensional floating-point vector recording the actual positions of the robots aforementioned six joints. 3) Visual observation: an RGB video stream from a wrist-mounted camera with a resolution of 480x640, encoded using AV1. 4) Metadata: including timestamps, frame index, episode index, global index, and task index. The dataset is specifically designed for the so_follower type of robot. All data is partitioned into the training set. The data is stored in Parquet file format, with a total size of approximately 300MB (including about 100MB of structured data and 200MB of video data). This dataset is suitable for tasks such as robot imitation learning, reinforcement learning, or behavior cloning.

创建时间:
2026-07-08
原始信息汇总

数据集概述:so101_pick_up_cylinder_20260707_181214

该数据集是一个面向机器人操作任务的仿真/真实数据集,演示了机械臂抓取圆柱体的动作。

  • 任务类型:机器人学(Robotics)
  • 许可协议:Apache 2.0
  • 创建工具:使用 LeRobot 框架生成
  • 可视化可视化数据集

数据集结构

  • 总集数(Episodes):50
  • 总帧数(Frames):18,422
  • 总任务数:1
  • 帧率(FPS):30
  • 数据集拆分:训练集(train):集数 0-49(共50集)
  • 机器人类型:so_follower

特征字段

字段名 数据类型 形状 说明
action float32 (6,) 动作空间,包含6个关节位置:shoulder_pan、shoulder_lift、elbow_flex、wrist_flex、wrist_roll、gripper
observation.state float32 (6,) 观测状态,与动作空间相同的6个关节位置
observation.images.wrist 视频 (480, 640, 3) 腕部摄像头图像,分辨率480x640,RGB三通道,AV1编码,30帧/秒
timestamp float32 (1,) 时间戳
frame_index int64 (1,) 帧索引
episode_index int64 (1,) 集索引
index int64 (1,) 全局索引
task_index int64 (1,) 任务索引

数据文件规格

  • 数据文件大小:100 MB(Parquet格式)
  • 视频文件大小:200 MB(MP4格式)
  • 数据文件路径data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet
  • 视频文件路径videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4
  • 块大小:1000帧/块
搜集汇总
数据集介绍
so101_pick_up_cylinder_20260707_181214 数据集图片
构建方式
该数据集面向机器人操作任务,聚焦于机械臂的圆柱抓取动作,采用LeRobot框架进行采集。数据集包含50个演示片段,总计18,422帧,采样频率为30帧/秒。机械臂为SO-100型号的从动臂,动作空间涵盖6个自由度,包括肩部俯仰、升降、肘部弯曲、腕部屈伸及旋转,以及夹爪开合。数据以Parquet格式存储动作与状态序列,并辅以腕部摄像头录制640×480分辨率的RGB视频,经AV1编码压缩存储于独立的MP4文件中。数据集结构遵循统一的元数据规范,按1,000帧为分块单位进行组织,便于高效加载。
特点
该数据集具有多模态融合的显著特征,同时记录了机械臂的低维关节状态(action与observation.state)和高维视觉观测(observation.images.wrist)。其视频数据保留了丰富的环境纹理与操作细节,帧率为30Hz,确保时间分辨率与动作精度相匹配。数据集规模适中,总视频文件约200 MB,数据文件约100 MB,适合验证模仿学习或行为克隆算法的性能。此外,数据集采用标准化机器人特征命名,如“shoulder_pan.pos”等,具备良好的跨平台可迁移性,且所有任务均基于单一圆柱抓取目标,提供了专注的实验基准。
使用方法
该数据集通过HuggingFace的LeRobot生态可直接使用。用户可通过lerobot库的接口加载预定义的训练/测试集拆分(全部50个片段用于训练)。调用时需指定机器人类型为“so_follower”,并利用Parquet文件中的动作向量(6维浮点数)与图像序列进行策略学习。视频解码依赖PyAV后端,支持实时帧提取。数据集还提供可视化工具,在HuggingFace Space中可交互浏览演示片段,便于定性评估模型表现。建议与标准监督学习或离线强化学习框架集成,例如结合关键的“frame_index”与“episode_index”进行序列建模。
背景与挑战
背景概述
该数据集由mot-prog研究团队于2026年7月7日创建,基于LeRobot框架构建,专注于机器人操作领域中的圆柱体抓取任务。核心研究问题在于利用模仿学习使机器人能够从视觉与状态观测中学习精确的抓取动作,数据集包含50个演示片段,总计18422帧,动作空间涵盖六自由度关节位置与夹爪控制。其影响力体现在为机器人技能学习提供了标准化数据范式,推动了基于视觉-动作映射的模仿学习在工业与家庭环境中的应用发展,为后续多任务机器人数据集构建奠定了基础。
当前挑战
所解决的领域挑战主要包括:第一,机器人面对圆柱体这类形状对称、表面光滑物体时的抓取稳定性问题,传统规划方法难以适应物体姿态变化;第二,模仿学习中对高维视觉输入与连续动作空间进行有效映射的困难,需要大量高质量演示数据来泛化到未见过场景。构建过程中遇到的挑战包括:使用so_follower机器人采集50个高质量演示时,需确保动作轨迹的精确性与一致性,避免传感器噪声与延迟导致的偏差;同时,30 FPS的视频流与关节位置数据需严格同步,以维持状态-动作对的时间对齐,这对数据标注与后处理流程提出了较高要求。
常用场景
经典使用场景
在机器人学习与操作领域,so101_pick_up_cylinder_20260707_181214数据集专注于机械臂的抓取任务,尤其针对圆柱形物体的拾取操作。该数据集以6自由度机械臂为平台,记录了肩部、肘部、腕部及夹爪的位姿动作序列与同步腕部视觉观测,为模仿学习与行为克隆提供了高质量的专家示范轨迹。其经典使用场景是训练基于视觉的运动策略,例如通过端到端神经网络将腕部摄像头捕捉的实时画面映射到机械臂各关节的控制指令,从而复现精确的抓取动作。数据集以30Hz高频采样,包含50个演示片段,覆盖了同一任务下不同的初始姿态与环境条件,有效支撑了策略泛化能力的验证。研究者可借助该数据集系统地评估动作预测精度、轨迹平滑度以及任务成功率,推动灵巧操作技能的迁移学习研究。
解决学术问题
该数据集的核心价值在于解决机器人精细操作中从感知到动作的映射难题。传统方法依赖手工设计的特征提取与运动规划,难以适应复杂环境中的不确定性。so101_pick_up_cylinder_20260707_181214通过提供同步的关节状态、夹爪位置及第一人称视角视觉数据,为端到端模仿学习提供了标准化的训练基准。学术上,它助力解决动作策略的可泛化性问题,即如何在有限演示下学习鲁棒的控制策略。此外,数据集的结构化设计,包括动作空间与观测空间的对齐,使得研究者可以深入探索隐式策略表示、状态估计误差补偿以及多模态融合中的关键科学问题。该数据集的发布推动了机器人学中“少样本学习”与“技能迁移”方向的实证评估,为验证新型模仿学习算法提供了可重复的实验平台,进而丰富了机器人操作领域的理论体系。
衍生相关工作
基于so101_pick_up_cylinder_20260707_181214数据集,学术界衍生出一系列代表性研究工作。在算法层面,研究者开发了基于扩散策略的动作生成模型,将抓取任务建模为条件概率分布的采样过程,显著提升了动作的多模态性与鲁棒性。同时,表征学习方向的进展将对比学习框架引入视觉状态编码,使得策略能从有限的观测中提取强泛化的特征,降低对特定抓取姿态的过拟合。在系统层面,该数据集催生了针对机械臂软硬件协同优化的研究,例如结合力感知与视觉反馈的混合控制策略,提升了精密抓取的成功率。此外,多任务迁移学习的工作探索了将圆柱体抓取技能如何快速适应不同形状物体的操作,推动了机器人操作领域基础技能的积累。这些衍生工作不仅验证了数据集的有效性,也为构建人机协作中可信赖的操作智能夯实了基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务