maniskill-pickcube
收藏官方服务:
资源简介:
该数据集是一个用于机器人操作任务(具体为拾取立方体任务)的模拟训练数据集,使用LeRobot工具创建。数据集包含来自模拟环境(Maniskill)中Franka Panda机械臂(带腕部摄像头配置)执行任务时采集的多模态时序数据。数据规模为300个完整任务片段(episodes),共计23,317个时间步(帧)的观测-动作对。核心数据特征包括:来自两个摄像头的视觉观测(基础摄像头和腕部摄像头,均为480x480分辨率、20帧/秒的RGB视频流)、机器人的9维关节位置状态(observation.state)和9维关节速度状态(observation.qvel)、以及8维的动作控制指令(action)。此外,数据集还包含立方体尺寸(cube_half_size)、时间戳(timestamp)、以及用于标识数据顺序和来源的多种索引字段(frame_index, episode_index, index, task_index)。数据集以Parquet文件形式组织,总大小约为300MB(其中视频数据约200MB,其他数据约100MB)。该数据集适用于机器人学习领域的研究,特别是基于视觉的机械臂操作策略学习、模仿学习或强化学习算法的训练与评估。
创建时间:
2026-07-18
原始信息汇总
数据集概述:maniskill-pickcube
- 数据集地址:https://huggingface.co/datasets/KelinLiIC/maniskill-pickcube
- 许可证:Apache-2.0
- 任务类别:机器人学(Robotics)
- 标签:LeRobot, maniskill, 机器人, panda, 仿真, pick-cube, 多摄像头
- 创建工具:该数据集使用 LeRobot 创建。
数据集描述
- 机器人类型:panda_wristcam(带有腕部摄像机的Panda机器人)
- 仿真环境:ManiSkill模拟环境
- 任务:拾取立方体(pick-cube)
- 数据集规模:
- 总片段数:300
- 总帧数:23317
- 总任务数:1
- 帧率:20 FPS
- 数据文件大小:100 MB
- 视频文件大小:200 MB
- 划分:训练集包含所有300个片段(索引0至299)。
数据集结构
数据集包含以下特征(Features),存储在Parquet文件和视频文件中:
| 特征名称 | 数据类型 | 形状 | 说明 |
|---|---|---|---|
observation.images.base_camera |
视频(video) | (480, 480, 3) | 基础摄像头图像,分辨率480x480,RGB三通道,AV1编码,20 FPS |
observation.images.wrist_camera |
视频(video) | (480, 480, 3) | 腕部摄像头图像,分辨率480x480,RGB三通道,AV1编码,20 FPS |
observation.state |
float32 | (9,) | 机器人关节位置(qpos),9维 |
observation.qvel |
float32 | (9,) | 机器人关节速度(qvel),9维 |
action |
float32 | (8,) | 机器人动作指令,8维 |
cube_half_size |
float32 | (1,) | 立方体半边长 |
timestamp |
float32 | (1,) | 时间戳 |
frame_index |
int64 | (1,) | 帧索引 |
episode_index |
int64 | (1,) | 片段索引 |
index |
int64 | (1,) | 索引 |
task_index |
int64 | (1,) | 任务索引(固定为0,因为只有一个任务) |
数据存储格式
- 数据路径:
data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet - 视频路径:
videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4 - 分块大小:每块最多1000个样本
可视化
您可以通过以下空间在线可视化该数据集(链接无需访问):
Visualize this dataset
搜集汇总
数据集介绍

构建方式
本数据集由LeRobot框架生成,专注于模拟环境中Panda机器人执行抓取立方体(pick-cube)任务的精细操作轨迹。数据采集过程结合仿真技术,记录机器人从初始状态到成功抓取的全过程,涵盖多视角视觉观测与关节状态数据。每一条轨迹以20帧/秒的采样频率捕捉,确保动作的连续性与高保真度。数据集共包含300个独立情节,总计23317帧图像与状态信息,采用Parquet格式存储结构化数据,并以AV1编码压缩视频流,兼顾存储效率与数据质量。
特点
该数据集的核心特性在于其多模态感知与动作标注的完整性。视觉信息由基座摄像头与腕部摄像头同步提供,均为480×480像素的RGB图像,覆盖全局与局部视角。状态空间包含9维度关节位置与速度向量,动作指令则为8维连续控制信号,精准映射至Panda机器人的自由空间。此外,数据集中嵌入立方体尺寸参数,便于泛化到不同尺寸物体的抓取任务。所有数据按情节与帧索引严格结构化,支持高效加载与序列化处理。
使用方法
作为标准化机器人学习资源,数据集可直接用于模仿学习与强化学习算法的训练与验证。用户可通过LeRobot库调用API加载数据,按‘train’划分索引0至299的情节序列。视觉输入支持从MP4视频文件中解码帧序列,状态与动作则从Parquet表中提取为浮点型张量。建议在训练时以20帧/秒的时间分辨率对齐多模态流,并利用数据集内置的帧索引实现时间对齐。教程与可视化工具可通过Hugging Face Spaces交互式探索数据集内容。
背景与挑战
背景概述
在机器人操作领域中,从仿真环境获取高质量演示数据以训练模仿学习模型已成为重要研究方向。maniskill-pickcube数据集于2024年期间由HuggingFace社区成员KelinLiIC采用LeRobot框架创建,专注于经典的抓取立方体任务。该数据集依托于ManiSkill模拟环境,以Franka Emika Panda机械臂为操作平台,通过多视角相机(包括底座相机与腕部相机)记录分辨率为480x480的视觉观测,并同步采集关节位置、速度及动作等状态信息。数据集包含300个完整演示轨迹,共计23317帧数据,为机器人单任务模仿学习提供了标准化的训练资源。其发布推动了仿真数据在机器人技能学习中的标准化进程,尤其为策略泛化与多模态融合研究奠定了数据基础。
当前挑战
该数据集所面对的领域挑战集中于从仿真到现实(Sim-to-Real)的迁移难题,仿真环境中的光照、物理参数与真实世界的差异往往导致策略在现实部署时性能衰减。此外,单一任务数据(抓取立方体)限制了策略泛化能力,难以应对物体形状、材质或初始位置的变化。在构建过程中,挑战体现在确保动作轨迹的准确性与一致性,多相机视角的同步校准,以及通过强化学习或专家演示生成高质量控制策略的复杂性。数据存储方面,采用AV1视频编码与Parquet格式虽优化了压缩效率,但视频元信息中额外编码参数的调优仍需兼顾保真度与存储成本。
常用场景
经典使用场景
在机器人操作学习领域,maniskill-pickcube数据集被广泛用于训练和评估机械臂的抓取与放置技能。该数据集包含了大量由Panda机械臂在仿真环境中执行立方体抓取任务的高质量示范,每一条轨迹均记录了来自基座摄像头和腕部摄像头的多视角视觉信息,以及机械臂的关节位置、速度与动作指令。这些丰富的多模态观测数据为研究者提供了理想的学习资源,可用于训练基于视觉的行为克隆模型、模仿学习算法以及强化学习策略,使机器人能够从人类示范中习得精细的物体操作能力。
实际应用
基于maniskill-pickcube数据集训练的模型具有广泛的工业应用潜力,例如在智能仓储系统中,机械臂可通过视觉引导自主识别并抓取不同尺寸的立方体货物,完成分拣与码垛任务。此外,在家庭服务机器人场景中,经过该数据集训练的机器人能够学习抓取日常物品,为老年人或行动不便者提供辅助服务。该数据集所依托的Panda机械臂仿真环境与真实硬件高度一致,使得在仿真中学习的策略能够便捷地迁移到实体机器人上,显著缩短了从算法研发到实际部署的周期。
衍生相关工作
maniskill-pickcube数据集衍生了一系列具有影响力的研究工作,例如基于扩散策略的机器人操控方法,通过将数据集中的视觉与运动信息建模为条件扩散过程,实现了高精度的多模态行为生成。此外,该数据集还被用于开发具身智能中的视觉表示学习方法,研究者利用其多摄像头视角探索跨视角特征对齐技术,有效提升了策略对观测变化的鲁棒性。部分工作则聚焦于数据增强策略,通过引入随机化环境变量来评估和增强学习到的抓取策略的泛化能力,这些成果共同推动了机器人学习从单一任务向通用技能聚合的方向演进。
以上内容由遇见数据集搜集并总结生成



