遇见数据集

WarehousePick-v0

收藏
Hugging Face2026-09-04 更新2026-09-05 收录
官方服务:

资源简介:

该数据集使用 LeRobot 框架创建,旨在为机器人操控学习提供训练数据。数据集包含来自 SO-101 跟随者型机器人的真实操控数据,涵盖 40 个完整演示轮次,共 29,707 帧,采样率为 30 fps。数据集中包含一个单一任务。数据文件总大小约 100 MB,视频文件总大小约 200 MB。特征包括:动作(6 维,对应肩部旋转、肩部升降、肘部弯曲、腕部弯曲、腕部转动、夹爪位置)、机器人状态(同样 6 维,与动作维度对应)、三个摄像头视角的图像观测(innomaker 摄像头:720x1280 RGB 视频;intel_rgb 摄像头:424x240 RGB 视频;front 摄像头:720x1280 RGB 视频),所有视频均采用 AV1 编码,无音频。此外还包含时间戳、帧索引、轮次索引、样本索引和任务索引等辅助信息。数据集适用于模仿学习、机器人运动规划、视觉-运动控制等任务。

This dataset was created using the LeRobot framework, aiming to provide training data for robot manipulation learning. It contains real manipulation data from the SO-101 follower robot, covering 40 complete demonstration episodes with a total of 29,707 frames at a sampling rate of 30 fps. The dataset includes a single task. The data files total approximately 100 MB, and the video files total approximately 200 MB. Features include: actions (6-dimensional, corresponding to shoulder rotation, shoulder lift, elbow flexion, wrist flexion, wrist rotation, and gripper position), robot states (also 6-dimensional, corresponding to the action dimensions), and image observations from three camera views (innomaker camera: 720x1280 RGB video; intel_rgb camera: 424x240 RGB video; front camera: 720x1280 RGB video). All videos are encoded with AV1 and have no audio. Additionally, auxiliary information such as timestamps, frame indices, episode indices, sample indices, and task indices are included. The dataset is suitable for imitation learning, robot motion planning, visual-motor control, and other tasks.

创建时间:
2026-09-02
原始信息汇总

数据集概述:WarehousePick-v0

基本信息

  • 许可证:Apache-2.0
  • 任务类别:机器人技术(robotics)
  • 标签:LeRobot
  • 创建工具:使用LeRobot框架创建(https://github.com/huggingface/lerobot)

数据集规模

  • 总回合数(episodes):40
  • 总帧数(frames):29,707
  • 总任务数:1
  • 数据文件大小:约100 MB
  • 视频文件大小:约200 MB
  • 帧率(fps):30
  • 分块大小(chunks_size):1000

数据划分

  • 训练集:包含全部40个回合(索引0至40),无单独验证集或测试集划分。

机器人信息

  • 机器人类型:so101_follower(SO-101机械臂)

特征描述

数据集每个样本包含以下特征:

动作(action)与观测状态(observation.state)

  • 数据类型:float32
  • 维度:6维
  • 字段含义:肩部旋转位置、肩部抬升位置、肘部弯曲位置、腕部弯曲位置、腕部滚动位置、夹爪位置

图像观测(三组摄像头)

摄像头 分辨率 编码格式 帧率
innomaker 1280×720 AV1 30 fps
intel_rgb 240×424 AV1 30 fps
front 1280×720 AV1 30 fps

所有图像均为RGB三通道,不包含深度信息,无音频。

元数据字段

  • timestamp:时间戳(float32)
  • frame_index:帧索引(int64)
  • episode_index:回合索引(int64)
  • index:样本索引(int64)
  • task_index:任务索引(int64)

数据格式

  • 数据文件路径data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet
  • 视频文件路径videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4
  • 代码库版本:LeRobot v3.0

引用信息

暂无引用信息(BibTeX待补充)。

搜集汇总
数据集介绍
WarehousePick-v0 数据集图片
构建方式
在机器人学习领域,高质量的操作数据集是训练通用策略的基石。WarehousePick-v0由LeRobot框架生成,记录了so101_follower机械臂在仓储拣选任务中的完整操作过程。数据采集历经40个回合,累计29707帧,涵盖单一任务场景,每帧包含6维关节位置动作与状态,并同步采集三路视频流。数据以Parquet文件与AV1编码视频分块存储,依据分块大小与视频大小参数进行组织,训练集划分覆盖全部回合。
使用方法
使用该数据集时,可依托LeRobot工具链加载与解析。研究人员通过HuggingFace数据集接口获取Parquet文件与视频流,利用meta/info.json中的特征定义对齐多模态输入。训练集划分明确,适合直接用于模仿学习或强化学习算法的离线训练。视频路径与数据路径遵循分块命名规则,便于大规模读取。调用时需注意帧索引、回合索引及任务索引的对应关系,以确保时序逻辑正确。
背景与挑战
背景概述
仓储拣选作为物流自动化与智能制造的核心环节,长期依赖人工操作,效率与精度难以兼顾。WarehousePick-v0数据集依托LeRobot框架构建,聚焦于SO101六自由度机械臂在仓储场景下的抓取任务。该数据集包含40个训练回合、29707帧图像与动作序列,采集频率为30Hz,融合了innomaker、intel_rgb与front三路视觉观测,旨在为机器人视觉-动作映射研究提供真实场景下的多模态数据支持。其核心研究问题在于如何通过端到端学习实现从高维视觉输入到精细关节控制的直接映射,从而推动仓储自动化中拣选作业的智能化进程,对机器人学习与物流自动化领域具有重要的基础支撑价值。
当前挑战
WarehousePick-v0所解决的领域问题——视觉引导的机械臂拣选,面临多重挑战。在任务层面,密集堆叠与遮挡场景下的目标识别与抓取规划对视觉感知与泛化能力提出极高要求,单一任务设定难以覆盖真实仓储中的多样化物体与布局。在构建层面,多相机同步采集与动作空间高维连续输出的精确标注涉及复杂的硬件协调与时间对齐,而40个回合的数据规模在训练深度策略时易导致过拟合,泛化至未知环境的能力受限。此外,从仿真到真实场景的迁移、动态环境下的实时响应以及长时序任务中的误差累积,均为该数据集后续研究需直面的关键难题。
常用场景
经典使用场景
在机器人学习与具身智能领域,基于视觉的抓取与放置任务长期被视为验证算法泛化能力的关键基准。WarehousePick-v0数据集恰为这一经典场景提供了高质量的示范资源,其涵盖40个完整回合、29707帧、30fps的同步多视角视频流与六自由度机械臂位姿记录,研究者可据此训练端到端的视觉-动作映射模型。该数据集最典型的用法是模仿学习与离线强化学习,通过示范轨迹直接学习从原始图像到关节位置的控制策略,或利用其构建状态-动作对进行价值函数估计,从而在仓储拣选这一结构化环境中实现稳定可靠的物体抓取与转移。
解决学术问题
针对机器人操作研究中示范数据稀缺、多模态同步困难以及真实世界策略泛化性不足等核心学术问题,WarehousePick-v0提供了统一的、标准化的数据格式与丰富的传感器观测。其29707帧的时间对齐数据解决了视觉-运动时序建模中常见的异步采样偏差问题,三路不同分辨率的视频流则为跨模态表征学习与视角不变性研究提供了可控的实验条件。该数据集使得研究者能够系统地探究数据规模、视觉表征质量与策略鲁棒性之间的定量关系,进而推动模仿学习算法在真实机械臂上的可复现评估,对缓解学术研究中基准不统一、结果难以横向比较的困境具有积极意义。
实际应用
在仓储物流与智能制造的实际场景中,机械臂需要从杂乱或半结构化环境中高效完成拣选与放置作业。WarehousePick-v0数据集直接面向此类应用需求,其采集自真实机械臂的示范轨迹可用于训练部署于分拣线、订单履行中心或柔性装配单元的视觉伺服系统。通过在该数据集上预训练或微调,机器人能够学习到应对不同光照、遮挡与物体位姿变化的抓取策略,从而降低现场调试成本,提升自动化系统的部署效率与运行稳定性,为无人仓与黑灯工厂的落地提供数据基础。
数据集最近研究
最新研究方向
在具身智能与机器人操作研究迅猛发展的背景下,WarehousePick-v0作为基于LeRobot框架构建的仓储拣选数据集,正推动着以视觉-语言-动作模型为核心的前沿探索。该数据集涵盖40个演示回合、近3万帧、30fps的多视角视频流(包括innomaker、intel_rgb和front三个视角)与6自由度机械臂的位姿和夹爪状态,为模仿学习、跨模态表征学习及策略泛化研究提供了高保真数据基础。当前研究热点聚焦于利用此类多视角、高帧率数据提升机器人在非结构化仓储环境中的长程任务规划与鲁棒抓取能力。其发布契合了通用机器人操作基准构建的趋势,对推动从仿真到现实迁移、降低数据采集成本具有重要影响,为社区提供了可复现的仓储拣选研究平台。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务