遇见数据集

so101_pick_block_bowl_20260718_211257

收藏
Hugging Face2026-07-23 更新2026-07-24 收录
官方服务:

资源简介:

该数据集使用LeRobot工具创建,专注于机器人操作任务,具体任务为“拾取方块并将其放入碗中”。数据集包含50个训练片段(episodes),总计32,504帧数据,采样频率为30fps。数据采用多模态结构,包含机器人的动作指令(6维关节位置:肩部平移、肩部升降、肘部弯曲、腕部弯曲、腕部旋转、夹爪位置)、状态观测(6维关节位置)以及视觉观测(腕部摄像头和外部摄像头视频,分辨率480x640,AV1编码,RGB三通道)。此外,数据集还包含时间戳、帧索引、片段索引等元数据。数据以parquet格式存储,视频以mp4格式存储,总数据量约300MB。该数据集已成功用于训练ACT(10万步)和Diffusion Policy(20万步)两种策略,并在真实SO-101机械臂上验证了任务执行效果。数据集采用Apache 2.0许可证,适用于机器人模仿学习、策略训练等研究任务。

This dataset was developed using the LeRobot tool, focusing on robotic manipulation tasks, specifically the task of "picking up a cube and placing it into a bowl". The dataset contains 50 training episodes, totaling 32,504 frames of data sampled at 30fps. It features a multimodal structure, including robotic action commands (6-dimensional joint positions: shoulder translation, shoulder lift, elbow flexion, wrist flexion, wrist rotation, gripper position), state observations (6-dimensional joint positions), and visual observations (videos from the wrist camera and external camera, with a resolution of 480x640, AV1 encoding, and RGB three channels). Additionally, the dataset includes metadata such as timestamps, frame indices, and episode indices. Non-video data is stored in Parquet format, while videos are stored in MP4 format, with an overall data size of approximately 300 MB. This dataset has been successfully applied to train two policies: ACT (100,000 training steps) and Diffusion Policy (200,000 training steps), and its task execution effectiveness has been validated on a real SO-101 robotic arm. The dataset is licensed under Apache 2.0, and is applicable to research tasks such as robotic imitation learning and policy training.

创建时间:
2026-07-18
原始信息汇总

数据集概述

数据集名称:sahilapage/so101_pick_block_bowl_20260718_211257
许可证:Apache-2.0
任务类别:机器人学(robotics)
标签:LeRobot

任务描述

数据集对应机器人操作任务:“拾取积木并放入碗中”(pick up the block and place it in the bowl)。

数据集来源

该数据集使用 LeRobot 创建。

数据集结构

  • 总集数:50
  • 总帧数:32,504
  • 任务数量:1
  • 帧率:30 FPS
  • 数据文件格式:Parquet
  • 数据文件大小:100 MB
  • 视频文件大小:200 MB
  • 数据划分:全部 50 集用于训练(train: 0:50)
  • 机器人类型:so_follower

特征信息

  • action:6维浮点数组,对应机械臂关节位置(shoulder_pan.pos、shoulder_lift.pos、elbow_flex.pos、wrist_flex.pos、wrist_roll.pos、gripper.pos)
  • observation.state:与 action 相同的6维关节状态信息
  • observation.images.wrist:腕部摄像头视频,分辨率480x640,3通道,AV1编码,30 FPS
  • observation.images.external:外部摄像头视频,分辨率480x640,3通道,AV1编码,30 FPS
  • timestamp:时间戳(float32)
  • frame_index:帧索引(int64)
  • episode_index:集索引(int64)
  • index:全局索引(int64)
  • task_index:任务索引(int64)

预训练策略

基于该数据集训练了两个策略模型,均在真实 SO-101 机械臂上验证成功完成拾取与放置任务:

可视化与引用

  • 可通过 可视化工具 浏览数据集内容
  • 引用信息:暂缺(需补充)
搜集汇总
数据集介绍
so101_pick_block_bowl_20260718_211257 数据集图片
构建方式
在机器人操作领域,精细化的抓取与放置任务一直是研究热点。so101_pick_block_bowl_20260718_211257数据集正是为此而设计,旨在为SO-101机械臂的“拾取积木并放入碗中”任务提供高质量的示范数据。该数据集依托LeRobot框架构建,通过人工遥操作或预设策略采集了50个完整演示片段,共计32,504帧,以30帧每秒的速率记录了机械臂六个关节的位置指令(包括肩部、肘部、腕部及夹爪)与对应的多模态观测信息。数据以Parquet格式高效存储,并辅以AV1编码的视频流,分别来自腕部摄像头和外部固定摄像头,分辨率为480×640,确保了动作与视觉信息的高保真对齐。
特点
该数据集的核心特点在于其结构化与多模态的深度融合。每个时间步均包含精确的关节角度动作指令、实时机器人状态反馈、双视角同步视觉观察(腕部第一人称与外部第三人称)以及时间戳与帧索引等元数据,形成完整的“感知-动作”闭环。数据总量虽控制在300MB左右,但涵盖50个高质量演示,且基于相同的任务,为策略学习提供了稳定且一致的基准。此外,内置的训练/测试集划分(全量用于训练)与标准化特征命名,极大便利了模仿学习算法的复现与对比,已基于此训练出ACT和Diffusion Policy等成功策略。
使用方法
该数据集主要面向机器人模仿学习与策略优化研究,可通过LeRobot工具库直接加载与处理。用户利用HuggingFace数据集库的“load_dataset”函数,指定数据集路径后便能够以Python字典形式获取动作、状态及图像序列。典型的使用场景包括训练基于行为的克隆算法(如ACT)或扩散策略模型。由于数据已按episode分块,且包含预定义的训练分割,开发者无须额外划分即可启动训练流程。同时,借助LeRobot的可视化工具,可在浏览器中动态回放演示,便于数据质量验证与策略效果调试,降低了入门门槛。
背景与挑战
背景概述
该数据集由研究者sahilapage于2026年7月创建,依托LeRobot开源机器人学习框架构建,聚焦于SO-101机械臂的精细抓取与放置任务。核心研究问题在于如何通过模仿学习使机械臂高效完成“拾取积木并放入碗中”这一基础操作,属于机器人操作学习领域的关键课题。数据集中包含了50个演示片段,共计超过3.2万帧的高频视觉与六维关节状态数据,并基于此训练了ACT与扩散策略两种模仿学习模型,均在实际机械臂上验证成功。该数据集为小样本模仿学习与策略泛化研究提供了标准化基准,对推动机器人学习在真实世界中的落地具有重要参考价值。
当前挑战
该数据集所解决的领域问题在于实现机械臂对精细抓取-放置任务的模仿学习,面临模仿动作精度不足与策略泛化能力弱的挑战。在构建过程中,主要挑战包括:1)需要同步采集30FPS的高分辨率腕部与外部视觉图像,确保数据质量与动作一致性;2)仅通过50个演示片段生成有效策略,需克服数据量稀疏带来的过拟合风险;3)机械臂六自由度关节动作与夹爪控制的精细协调,对数据采集的机械重复性和传感器标定提出了极高要求;4)视频数据采用AV1编码压缩,在减少存储体积的同时需保证后续模型训练的解码效率与信息完整性。
常用场景
经典使用场景
so101_pick_block_bowl_20260718_211257 数据集由 LeRobot 框架构建,聚焦于机器人抓取与放置这一经典操作任务。其核心场景为训练机械臂精准执行‘拾取方块并放入碗中’的序列动作,借助高保真的多模态观测数据,包括腕部与外部摄像头所采集的视觉影像,以及关节角度、夹爪状态等本体感受信息,为模仿学习与行为克隆提供了高质量的示范轨迹。该数据集包含50个完整演示片段,共计32504帧,每个片段均记录了从初始姿态到任务完成的全流程动作序列,是研究机器人精细操作技能获取的宝贵资源。
衍生相关工作
基于该数据集衍生出的两项核心工作包括 ACT 策略(100k步训练)与扩散策略(200k步训练),两者均在真实机械臂上通过了任务验证。这些工作不仅独立贡献了针对‘拾取-放置’任务的专用模型库,还催生了LeRobot社区内关于多任务学习与数据增强的后续探索。相关模型可作为预训练基准,被后续研究用于对比不同行为克隆方法的样本效率,或结合强化学习微调以提升鲁棒性,形成了持续演进的学术生态节点。
数据集最近研究
最新研究方向
在机器人操作领域,so101_pick_block_bowl_20260718_211257数据集聚焦于精细化的物体拾取与放置任务,代表了模仿学习在前沿应用中的重要进展。该数据集基于SO-101机械臂,记录了30帧每秒的高频运动轨迹与多视角视觉信息,为训练高精度行为克隆模型提供了丰富样本。当前研究热点集中于将ACT(Action Chunking Transformer)与扩散策略(Diffusion Policy)应用于此类数据,已验证这两种模型在真实硬件上成功完成块状物体的抓取与归位操作。这一工作呼应了近年来具身智能中“从示范中学习”的范式转型,尤其强调小样本、高鲁棒性的策略泛化能力。数据集引入多模态观测(腕部与外部相机)与六自由度动作空间,为联合视觉-运动表征的学习奠定了基准,对推动家庭服务与工业装配领域的机器人自主化具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务