遇见数据集

so101_ball_box_1

收藏
Hugging Face2026-05-26 更新2026-05-27 收录
官方服务:

资源简介:

该数据集是使用LeRobot平台创建的机器人学数据集,专门用于机器人控制与模仿学习任务。数据集聚焦于一个名为so101_ball_box_1的特定任务场景,包含101个情节(episodes)和总计24,580帧数据。数据以分块形式组织,每块包含1000个数据点,总数据文件大小约为100MB,关联的视频文件大小约为200MB。每个数据点提供多模态观测信息和对应的机器人动作:动作(action)是一个6维浮点数组,对应肩部平移、肩部抬升、肘部弯曲、腕部弯曲、腕部旋转和夹爪的位置指令;状态观测(observation.state)也是一个6维浮点数组,表示机器人的当前关节位置;视觉观测包括两个视角的RGB视频流,分别为前视摄像头(observation.images.front)和腕部摄像头(observation.images.wrist),分辨率均为480x640,帧率30fps;元数据包括时间戳、帧索引、情节索引、全局索引和任务索引。数据格式为Parquet,视频编码为AV1,数据集已预划分为训练集,包含所有101个情节。

This dataset is a robotics dataset created using the LeRobot platform, suitable for robot control and imitation learning tasks. It includes a specific task scenario named so101_ball_box_1, with a total of 101 episodes and 24,580 frames. The data is organized in chunks, each containing 1000 data points, with a total data file size of approximately 100MB and associated video files of about 200MB. Each data point provides multimodal observation information and corresponding robot actions: the action is a 6-dimensional float array corresponding to shoulder translation, shoulder lift, elbow bend, wrist bend, wrist rotation, and gripper position commands; the state observation (observation.state) is also a 6-dimensional float array representing the current joint positions of the robot; visual observations include two perspective RGB video streams, namely front camera (observation.images.front) and wrist camera (observation.images.wrist), both with a resolution of 480x640 and a frame rate of 30fps; metadata includes timestamp, frame index, episode index, global index, and task index. The data format is Parquet, video encoding is AV1, and the dataset is pre-partitioned into a training set containing all 101 episodes.

创建时间:
2026-05-22
原始信息汇总

数据集概述:so101_ball_box_1

  • 数据集地址: https://huggingface.co/datasets/lorenzouttini/so101_ball_box_1
  • 许可协议: Apache-2.0
  • 任务类别: 机器人技术 (Robotics)
  • 标签: LeRobot

数据集基本信息

  • 机器人类型: so_follower
  • 总片段数 (Episodes): 101
  • 总帧数 (Frames): 24580
  • 总任务数: 1
  • 帧率 (FPS): 30
  • 数据文件大小: 约 100 MB
  • 视频文件大小: 约 200 MB
  • 分块大小: 1000
  • 数据拆分: 训练集 (train) 包含所有 101 个片段 (索引 0 至 101)

数据集结构

数据集包含以下特征 (features):

  • action (动作): 包含6个关节位置指令 (float32 类型):

    • shoulder_pan.pos
    • shoulder_lift.pos
    • elbow_flex.pos
    • wrist_flex.pos
    • wrist_roll.pos
    • gripper.pos
  • observation.state (观测状态): 包含与 action 相同的6个关节位置 (float32 类型)。

  • observation.images.front (前视摄像头图像): 视频类型,分辨率 480x640,3通道,编码为 AV1,帧率 30 FPS。

  • observation.images.wrist (腕部摄像头图像): 视频类型,分辨率 480x640,3通道,编码为 AV1,帧率 30 FPS。

  • timestamp (时间戳): float32 类型,形状为 [1]。

  • frame_index (帧索引): int64 类型,形状为 [1]。

  • episode_index (片段索引): int64 类型,形状为 [1]。

  • index (索引): int64 类型,形状为 [1]。

  • task_index (任务索引): int64 类型,形状为 [1]。

数据文件与视频文件路径

  • 数据路径: data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet
  • 视频路径: videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4

数据集创建

该数据集使用 LeRobot 创建。

搜集汇总
数据集介绍
so101_ball_box_1 数据集图片
构建方式
该数据集基于LeRobot框架构建,旨在为机器人操作任务提供高质量的训练数据。数据通过so_follower机器人平台采集,包含101个完整演示回合,总计24580帧数据,涵盖从初始状态到目标状态的动作轨迹。每个回合以30帧每秒的采样率记录,原始数据存储为Parquet格式,共计100MB;视频数据采用AV1编码,以480×640分辨率分别从前置摄像头和腕部视角记录,合计200MB。数据被划分为1000帧大小的块,便于高效存取,且所有回合均用于训练集,无显式验证或测试划分。
特点
数据集聚焦于单一任务,即球体入盒操作,具有明确的动作和状态空间。动作和观测状态均包含6维浮点型运动指令,分别对应肩部旋转、肩部升降、肘部屈伸、腕部屈伸、腕部旋转和夹爪位置,确保了对机器人末端执行器全自由度建模。视觉输入包括两个同步视频流:前置和腕部摄像头,提供场景全局与局部细节,有助于开发基于视觉的策略。数据以连续帧序列形式组织,附带时间戳、回合与任务索引,便于时序建模。整体结构紧凑,100MB的观测数据与200MB的视频数据适合快速加载与预处理。
使用方法
使用LeRobot库可轻松加载该数据集,通过指定配置名'default'自动读取Parquet和视频文件。数据以字典形式返回,包含'action'、'observation.state'、'observation.images.front'与'observation.images.wrist'等键。用户可直接利用预定义的训练/测试分割(此处仅含完整训练集)进行模仿学习或强化学习模型训练。建议结合LeRobot提供的可视化工具(如HuggingFace Spaces上的交互式界面)浏览样本。数据集兼容PyTorch、TensorFlow等框架,适合用于机器人操控策略的端到端学习或行为克隆研究。
背景与挑战
背景概述
随着机器人学习领域的快速发展,基于人类演示的模仿学习已成为解决复杂操作任务的重要范式。在此背景下,so101_ball_box_1数据集由研究人员利用LeRobot框架构建,专注于单任务机器人操作场景。该数据集包含101个演示回合,共计24580帧高分辨率视觉与运动状态数据,通过前视与腕部双摄像头以30帧/秒的帧率采集,并同步记录六自由度关节动作序列。其核心研究问题在于为“将球放入盒子”这一具体任务提供标准化训练基准,推动机器人从感知到动作的端到端策略学习。该数据集以Apache-2.0开源许可发布,为机器人社区提供了可复现的细粒度操作数据,在模仿学习与行为克隆领域具有重要参考价值。
当前挑战
该数据集所针对的领域挑战主要源于机器人操作任务的高维连续控制与动态不确定性:球体抓取与放置涉及非刚性接触、目标位姿变化及力反馈调节,传统规划方法难以适应此类精细操作。在构建过程中,挑战集中于高质量演示数据的获取与表征——确保101个回合间操作风格的一致性、关节角度与视觉流的时间对齐精度,以及在不同光照与背景条件下保持图像质量稳定。此外,仅6维动作空间难以完整捕捉灵巧操作所需的力控信息,而单一任务设定也限制了策略的泛化能力,需在数据规模与任务多样性间寻求平衡,这对未来多任务学习与域迁移研究提出更高要求。
常用场景
经典使用场景
在机器人操作与模仿学习领域,so101_ball_box_1数据集以其精细的结构化设计,成为了研究基于视觉反馈的机械臂控制与抓取任务的经典资源。该数据集由SO-100系列机械臂在真实环境中采集,包含了101个完整操作回合,每个回合均记录了机械臂六个关节的运动轨迹、末端执行器状态以及两个视角(前视与腕部)的高清视频流。研究者常利用这些多模态数据训练端到端的神经网络模型,通过视觉输入直接映射到关节动作,从而实现机器人对小球入盒这类精确操作任务的模仿与泛化。数据集提供的30帧每秒的连贯序列,为时序建模和动作预测提供了高时间分辨率的真实样本。
衍生相关工作
so101_ball_box_1数据集在机器人学习社群中激发了多项衍生研究。其中最具影响力的工作包括对抗性模仿学习框架,它利用数据集中的正例演示来约束机器人的探索行为,从而提升策略在复杂扰动下的安全性。另一类衍生工作是面向少样本的元学习算法,研究者将数据集的101个回合重新组织为多任务元训练集,探索如何在仅看到少量新的演示后即可完成全新的放置任务。此外,该数据集还被用于验证基于扩散模型的动作生成方案,通过将视频序列视为扩散过程的条件,展现了对多峰动作分布出色的拟合能力。这些衍生工作共同推动了轻量级机械臂从单纯的数据采集平台向通用操作学习基石的转变。
数据集最近研究
最新研究方向
在具身智能与机器人学习的前沿疆域,so101_ball_box_1数据集聚焦于基于视觉的机械臂精细操作任务,尤其针对球体抓取与放置这一典型灵巧操控场景。该数据集利用LeRobot框架采集,涵盖了101个演示回合与逾2.4万帧高保真观测数据,融合了前置与腕部双视角视频流及六自由度关节状态与动作序列,为模仿学习与行为克隆提供了丰富的多模态训练素材。当前,围绕该数据集的研究热潮涌动于离线强化学习、视觉-运动控制耦合以及少样本泛化等方向,其在机器人操控领域的影响力正随着开源生态的繁荣而持续攀升,成为推动低成本、可复现的机器人学习基准实验的重要基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务