遇见数据集

so101_pp_stationery_5obj_lightbox

收藏
Hugging Face2026-06-19 更新2026-06-20 收录
官方服务:

资源简介:

该数据集是一个用于机器人操作任务的开源数据集,使用LeRobot工具创建。数据集包含144个完整的操作序列(episodes),总计110,039个数据帧,覆盖5种不同的操作任务。数据以30帧/秒的速率采集。每个数据样本包含:1)机器人的动作指令,为一个6维浮点向量,分别对应肩部平移、肩部抬升、肘部弯曲、腕部弯曲、腕部旋转和夹爪的位置控制;2)机器人的状态观测,同样为6维关节位置向量;3)视觉观测,包含两个视角的RGB视频流:一个顶部安装的摄像头(分辨率480x640)和一个腕部安装的摄像头(分辨率720x1280);4)元数据,包括时间戳、帧索引、episode索引、任务索引等。数据集采用Apache-2.0许可证,所有数据均划分为训练集。数据以parquet文件格式组织,总数据文件大小约100MB,视频文件约200MB。该数据集适用于机器人模仿学习、视觉伺服控制、策略学习等研究领域。

This dataset is an open-source dataset for robotic manipulation tasks, created using the LeRobot tool. It contains 144 complete operation episodes, totaling 110,039 data frames, covering 5 different manipulation tasks. Data is collected at a rate of 30 frames per second. Each data sample includes: 1) robot action commands, represented as a 6-dimensional floating-point vector corresponding to shoulder translation, shoulder lift, elbow bend, wrist bend, wrist rotation, and gripper position control; 2) robot state observations, also a 6-dimensional joint position vector; 3) visual observations, consisting of RGB video streams from two perspectives: a top-mounted camera (resolution 480x640) and a wrist-mounted camera (resolution 720x1280); 4) metadata, including timestamps, frame indices, episode indices, task indices, etc. The dataset uses the Apache-2.0 license, with all data divided into a training set. Data is organized in parquet file format, with a total data file size of approximately 100MB and video files of about 200MB. This dataset is suitable for research areas such as robot imitation learning, visual servoing control, and policy learning.

创建时间:
2026-06-19
原始信息汇总

数据集总览

  • 名称: so101_pp_stationery_5obj_lightbox
  • 许可证: Apache-2.0
  • 任务类别: 机器人技术 (robotics)
  • 标签: LeRobot
  • 创建工具: LeRobot
  • 总数: 共287个片段 (episodes),212,430帧,5个任务

数据构成

特征 (Features)

  • 动作 (action): 6维向量,包含肩部旋转、肩部抬升、肘部弯曲、腕部弯曲、腕部滚动和夹爪位置,数据类型float32。
  • 观测状态 (observation.state): 同样为6维向量,与动作空间相同,数据类型float32。
  • 观测图像 (observation.images):
    • 顶部摄像头 (top): 分辨率480x640,3通道,HEVC编码,30 FPS。
    • 腕部摄像头 (wrist): 分辨率720x1280,3通道,HEVC编码,30 FPS。
  • 时间戳 (timestamp): float32, 形状 [1]。
  • 帧索引 (frame_index): int64, 形状 [1]。
  • 片段索引 (episode_index): int64, 形状 [1]。
  • 索引 (index): int64, 形状 [1]。
  • 任务索引 (task_index): int64, 形状 [1]。

存储结构

  • 数据文件: Parquet格式,路径为 data/*/*.parquet
  • 视频文件: MP4格式,按摄像头类型分目录存储,路径为 videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4
  • 元数据文件: meta/info.json,包含代码库版本、帧率、特征定义、片段数、帧数、任务数、数据与视频文件大小等信息。
  • 数据大小: 数据文件约100 MB,视频文件约200 MB。
  • 机器人类型: so_follower

数据集划分

  • 训练集 (train): 第0至286个片段。

引用信息

  • 引用格式: BibTeX 待提供。
搜集汇总
数据集介绍
so101_pp_stationery_5obj_lightbox 数据集图片
构建方式
该数据集基于LeRobot框架构建,专注于机器人操控任务,采集环境为配备轻便灯箱的工作台面,操作对象涵盖五种常见文具。数据集通过SO-Follower机器人进行遥操作收集,共包含287个完整演示回合,总计212,430帧时序数据。每个回合记录了六维关节动作指令(关节位置与夹爪状态)与对应的观测状态,同时提供顶部摄像头(480×640分辨率)和腕部摄像头(720×1280分辨率)的双视角高清视频流,编码格式为HEVC,帧率为30FPS。数据以Parquet格式存储结构化信息,视频文件则独立保存为MP4格式,并通过分块索引(chunk-xxx/file-xxx)实现高效组织与访问。
特点
数据集具有多模态融合与精细标注的显著特点。其观测空间同步包含机器人本体状态(关节角度)与双视角视觉信息,顶部视角提供全局操作视野,腕部视角聚焦末端执行器与物体的精细交互,二者互补增强了感知的鲁棒性。数据以30Hz高频采样,确保了时序动作的连续性。此外,数据集预设了5种不同的任务类别(对应五种文具),每个演示回合均标注了任务索引,便于进行多任务学习与策略泛化研究。总体数据量约300MB(含视频),规模适中,既保留了任务多样性,又降低了存储与计算门槛。
使用方法
数据集默认划分为训练集(全部287个回合),可直接用于模仿学习或强化学习的策略训练。推荐使用LeRobot的API进行加载与预处理,通过指定数据集标识符即可自动将Parquet结构化数据与视频文件对齐为统一的仿真环境。研究人员可提取action字段作为策略输出目标,observation.state与双视角图像作为模型输入,构建端到端的操控策略。由于数据遵循Apache-2.0开源协议,开发者可自由修改、分发及用于商业项目,适用于机器人抓取、物体操作等领域的算法验证与迁移学习研究。
背景与挑战
背景概述
该数据集由研究者aShunSasaki创建并发布于HuggingFace平台,旨在推动机器人操作技能学习的研究。其核心研究问题聚焦于如何通过模仿学习使机器人掌握精细的物体操控能力,特别是在桌面环境中对五种文具(如笔、尺等)进行抓取、移动等操作。数据集采用LeRobot框架构建,记录了SO-100双臂协作机器人的287个演示回合,包含超过21万帧的视觉与动作序列。通过顶部与腕部双摄像头视角,数据集提供了丰富的多模态观测信息,为机器人领域中的行为克隆、策略泛化等任务提供了重要基准。该数据集的开源发布(Apache-2.0许可)为机器人学习社区提供了可复现的研究基础,尤其在低成本硬件平台上验证算法有效性方面具有显著影响力。
当前挑战
数据集的领域挑战在于解决机器人精细操作中的策略泛化与鲁棒性问题:五种文具的形状、材质与摆放位置差异巨大,要求模型能适应非结构化环境。同时,构建过程面临多重技术挑战:1) 数据采集需同步6自由度关节角度与双摄像头视频流,确保30帧率的精确时序对齐;2)使用Parquet格式存储高维时序数据,需平衡压缩效率与后续训练加载速度;3)HEVC视频编码虽节省存储空间,但解码开销可能影响实时训练流水线;4)287个演示回合的规模对覆盖任务变化性仍显有限,需通过数据增强策略弥补多样性不足。
常用场景
经典使用场景
在机器人操作与模仿学习领域,so101_pp_stationery_5obj_lightbox数据集为研究者提供了一个针对六自由度机械臂进行精细抓取与放置任务的理想基准。该数据集聚焦于五种常见文具的操控,包含约21万帧的高质量演示数据,通过顶部和腕部双视角摄像头记录,并结合机械臂六维关节状态与动作序列。经典的使用方式是利用行为克隆或逆强化学习算法,从专家演示中学习从视觉输入到末端执行器位姿的映射关系,从而在仿真或真实环境中复现准确的抓取策略。
解决学术问题
该数据集核心解决了机器人领域中复杂物体泛化抓取与少样本模仿学习的学术挑战。传统方法往往依赖精确的几何模型或大量手工标注,而此数据集通过提供多视角视觉与低维状态信息的对齐序列,使得研究者能够探索如何从有限演示中提取鲁棒的操作策略。它推动了端到端学习在精密操控任务中的应用,显著降低了针对特定物体(如笔、尺、橡皮等)部署机器人技能的门槛,为研究视觉-运动协同、跨物体姿态估计等问题提供了坚实的数据基石。
衍生相关工作
围绕so101_pp_stationery_5obj_lightbox数据集,衍生出多项推动机器人学习领域发展的经典工作。研究者已基于此数据训练出可泛化至未见文具形状的轻量级策略网络(如基于ResNet-18的视觉编码器与MLP动作解码器),并验证了数据增强与域随机化对策略鲁棒性的提升。此外,该数据集被用于对比不同模仿学习框架(如Diffusion Policy与ACT)在小规模演示下对精密操作任务的适配效率,以及作为评估机器人预训练-微调范式的基准,相关成果在CoRL、ICRA等机器人顶会上持续涌现。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务