遇见数据集

task11-place-beaker-on-storage-shelf_0804

收藏
Hugging Face2026-08-06 更新2026-08-07 收录
官方服务:

资源简介:

该数据集是用于机器人操作任务的开源数据集,具体任务为“将烧杯放置在存储架上”(place beaker on storage shelf)。数据集采用LeRobot格式,由移动AI机器人(mobileai_robot)收集。数据包含200个演示片段(episodes),总计66376帧,帧率为30fps,所有数据均用于训练(无验证/测试划分)。每个样本包含:16维动作向量(左右手臂各6个关节位置以及移动基座的线速度和角速度)、16维观测状态(与动作结构相同,代表当前机器人状态)、三个摄像头视角的高清图像(高视角cam_high、左腕cam_left_wrist、右腕cam_right_wrist,均为480×640像素,RGB,H.264编码视频),以及时间戳、帧索引、片段索引、全局索引和任务索引等元数据。数据以Parquet文件存储结构化数据,视频以MP4文件存储。该数据集适用于机器人模仿学习、行为克隆、强化学习等任务,尤其适合需要多视角视觉输入和连续控制的研究场景。

This dataset is an open-source dataset for robot manipulation tasks, specifically the task of place beaker on storage shelf. It is formatted in LeRobot format and collected by a mobile AI robot (mobileai_robot). The dataset contains 200 demonstration episodes, totaling 66,376 frames at 30 fps, all used for training (no validation/test split). Each sample includes: a 16-dimensional action vector (6 joint positions for each arm plus linear and angular velocity of the mobile base), a 16-dimensional observation state (same structure as actions, representing current robot state), high-definition images from three camera views (cam_high, cam_left_wrist, cam_right_wrist, all 480×640 pixels, RGB, H.264 encoded video), as well as metadata such as timestamps, frame indices, episode indices, global indices, and task indices. Data is stored as Parquet files for structured data and MP4 files for videos. The dataset is suitable for robot imitation learning, behavioral cloning, reinforcement learning, and other tasks, especially for research scenarios requiring multi-view visual input and continuous control.

创建时间:
2026-08-04
原始信息汇总

数据集概述

基本信息

  • 数据集名称:task11-place-beaker-on-storage-shelf_0804
  • 许可证:Apache-2.0
  • 任务类别:机器人(Robotics)
  • 标签:LeRobot
  • 创建工具:由LeRobot创建

数据集结构

  • 版本:codebase v3.0
  • 机器人类型:mobileai_robot
  • 总轨迹数:200
  • 总帧数:66,376
  • 任务数:1
  • 块大小:1,000
  • 数据文件大小:约100 MB
  • 视频文件大小:约200 MB
  • 帧率:30 fps

数据划分

  • 训练集:0至200(全部200个轨迹用于训练)

数据特征

动作与状态特征

  • 动作:包含16维特征,涉及左右机械臂各6个关节位置、左右托架关节位置、移动速度(x.vel)和角速度(theta.vel)。
  • 观测状态:与动作特征维度相同,共16维。

图像观测

  • cam_high:高视角摄像头,分辨率480×640,3通道,H.264编码,30 fps。
  • cam_left_wrist:左手腕摄像头,分辨率480×640,3通道,H.264编码,30 fps。
  • cam_right_wrist:右手腕摄像头,分辨率480×640,3通道,H.264编码,30 fps。

其他特征

  • timestamp:时间戳(float32)
  • frame_index:帧索引(int64)
  • episode_index:轨迹索引(int64)
  • index:索引(int64)
  • task_index:任务索引(int64)

数据存储路径

  • 数据文件data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet
  • 视频文件videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4

引用信息

  • BibTeX:暂无可用引用信息。
搜集汇总
数据集介绍
task11-place-beaker-on-storage-shelf_0804 数据集图片
构建方式
该数据集基于LeRobot框架构建,旨在捕捉移动机械臂在仓储环境中执行‘将烧杯放置于储物架’任务的完整操作过程。数据采集自mobileai_robot型机器人,共包含200个演示片段,总计66376帧,以30帧每秒的频率记录。每个片段均同步存储了机器人关节状态、线速度与角速度等16维动作信息,以及来自高置摄像头和左右腕部摄像头的三路高清视频流。数据以parquet格式保存状态与动作数据,视频则采用H.264编码,确保了数据采集的完整性与高效性。
特点
该数据集的一个显著特点在于其多模态融合设计,将高维状态空间与视觉观测紧密结合。动作与状态空间均包含16个维度,覆盖了双臂各关节位置及移动底座速度,为精细操控研究提供了丰富信息。三路摄像头视角(高置、左腕、右腕)从不同角度捕捉任务执行细节,增强了模型对环境与操作对象的感知能力。此外,数据集按1000帧单位进行分块存储,便于高效加载与流式处理,且所有数据均以Apache-2.0许可证发布,促进了学术与工业界的广泛应用。
使用方法
该数据集可直接通过LeRobot库加载与处理,适用于模仿学习、强化学习以及机器人操作策略的预训练与评估。使用时,用户可通过可视化工具浏览数据,并利用提供的parquet文件访问状态、动作与时间戳等结构化数据,配合关联的视频文件进行多模态模型训练。数据集的splits配置将全部200个片段作为训练集,便于进行端到端策略学习。研究者可根据自身需求,灵活调用各特征分量,如联合位置、图像序列或速度指令,以支持不同算法的输入要求,从而推动具身智能在仓储场景下的应用研究。
背景与挑战
背景概述
随着具身智能与机器人学习领域的蓬勃发展,大规模、高质量的操作数据集成为推动仿人机器人技能学习的关键基础设施。task11-place-beaker-on-storage-shelf_0804数据集由gistailab团队于近期基于HuggingFace LeRobot框架构建,旨在捕获移动双臂机器人在真实环境中执行‘将烧杯放置于储物架’这一精细操作任务的完整演示轨迹。该数据集包含200个演示片段、超过6.6万帧视觉与状态-动作数据,通过高帧率(30fps)同步记录多视角视觉信息、关节角度及线速度与角速度,为研究多模态感知与运动控制的深度融合提供了丰富素材。其创建紧扣模仿学习与行为克隆的前沿议题,为机器人从人类演示中泛化操作技能、应对复杂空间约束与物体交互提供了基准性资源,对推动机器人操作领域的实证研究具有显著支撑作用。
当前挑战
该数据集所致力解决的领域问题,在于赋予机器人在非结构化环境中对可变形或刚性物体进行精准空间操作的能力,此类任务长期受困于物体位姿不确定性、双臂协同控制及动态环境干扰等核心难点。就构建过程而言,团队面临多重挑战:首当其冲的是数据采集的物理一致性,需确保多视角相机(高位与双腕部)的时间同步与空间标定精度,以规避视觉-动作数据错位风险;其次,动作空间涵盖16维运动指令,包括双臂关节角与移动底盘速度,如何高效编码并压缩高维时序数据以避免冗余,成为特征工程的关键掣肘;再者,演示精度的稳定性受限于遥操作或示教过程中的专家变异性,此外,上百GB的视频与parquet数据的高效存储、分块管理及跨平台可复现性,亦对数据管线的鲁棒性提出了严苛要求。
常用场景
经典使用场景
该数据集专为机器人操控任务设计,聚焦于将烧杯稳稳放置于储物架上的精细操作。其核心应用场景在于模仿学习与强化学习算法的训练与评估,通过记录双机械臂的16维关节位置与速度信息,结合高清视觉观测(包括全局视角与双腕部近视角),为智能体提供多模态感知与动作的同步数据流。研究者可利用此数据集构建端到端的视觉运动策略,探索在复杂环境下物体的精准抓取、搬运与放置,进而验证算法在真实物理世界中的泛化能力与鲁棒性。
实际应用
在实际应用中,此数据集为工业与家庭服务机器人的技能部署奠定了数据基石。机器人可通过在此类数据上习得的策略,安全高效地完成实验室器皿的整理、生产线上的物料放置乃至厨房中的餐具归位等任务。由于数据采集自真实的移动AI机器人,其涉及的视觉与本体感觉信息贴近现实环境,使得训练出的模型具备更强的鲁棒性,可无缝迁移至仓储物流、医疗护理和日常协助等场景,从而提升自动化水平并降低人力成本,展现出广阔的应用前景。
衍生相关工作
基于此数据集的结构与格式,已衍生出多个影响深远的学术工作。例如,在LeRobot框架下,研究者利用其开放的parquet与视频格式开发了先进的视觉运动策略,如基于扩散策略的动作生成模型,显著提升了操控的精确度。此外,该数据集刺激了关于多视角融合、跨任务迁移学习以及回放缓冲采样策略的后续探索,催生了更高效的模仿学习算法和机器人数据集标准化工具,为建立大规模、多任务的机器人学习基准提供了宝贵参考与数据支撑,深刻影响了具身智能领域的研究趋势。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务