遇见数据集

02062026_single_plate_pick

收藏
Hugging Face2026-06-03 更新2026-06-04 收录
官方服务:

资源简介:

该数据集是使用LeRobot平台创建的机器人操作数据集,记录了AgileX Piper双手机器人执行单一任务(总任务数为1)时的多模态交互数据。数据规模包含113个episodes,共计73,232帧数据(以20fps采样),以分块形式存储(块大小1000),总数据文件约100MB,视频文件约200MB。数据集包含训练集分割(所有113个episodes)。数据内容包括:1) 观察状态:14维浮点向量,表示机器人左右臂各6个关节角度以及左右夹爪的状态;2) 动作:14维浮点向量,对应左右臂各关节和夹爪的控制指令;3) 多视角视觉观测:来自三个相机(front, right, left)的RGB视频流,每帧分辨率为640x480,3通道,采用h264编码,帧率20fps;4) 时间信息:每个视觉观测对应的时间戳(纳秒级);5) 遥测数据:左右臂各6个关节的角度(度);6) 索引信息:时间戳、帧索引、episode索引、全局索引和任务索引。该数据集适用于机器人学习任务,特别是涉及双手机器人操作、模仿学习、强化学习或从多模态感知数据中学习策略的研究。

This robotic manipulation dataset was created using the LeRobot platform, which records multimodal interaction data from the AgileX Piper dual-arm robot executing a single task (total 1 task). The dataset includes 113 episodes, totaling 73,232 frames sampled at 20 fps, and is stored in chunks with a chunk size of 1000. The total size of non-video data files is approximately 100 MB, while the video files amount to around 200 MB. The dataset provides a training split covering all 113 episodes. The dataset includes the following components: 1) Observation state: A 14-dimensional floating-point vector representing the joint angles of the robot's left and right arms (6 joints per arm) and the states of the left and right grippers. 2) Action: A 14-dimensional floating-point vector corresponding to the control commands for each joint and gripper of the left and right arms. 3) Multi-view visual observations: RGB video streams from three cameras (front, right, left). Each frame has a resolution of 640×480 with 3 channels, encoded with the h264 codec, and captured at 20 fps. 4) Timing information: Nanosecond-precision timestamps corresponding to each visual observation. 5) Telemetry data: Joint angles (in degrees) of the 6 joints for each of the left and right arms. 6) Index information: Timestamps, frame indices, episode indices, global indices, and task indices. This dataset is suitable for robotic learning tasks, particularly research involving dual-arm robot manipulation, imitation learning, reinforcement learning, or policy learning from multimodal perceptual data.

创建时间:
2026-06-02
原始信息汇总

数据集概述

  • 数据集名称: PranayTest/02062026_single_plate_pick
  • 许可证: Apache-2.0
  • 任务类别: 机器人(Robotics)
  • 标签: LeRobot
  • 创建工具: 使用 LeRobot 创建

数据集结构

  • 代码库版本: v3.0
  • 机器人类型: Agilex Piper 双臂机器人(agilex_piper_bimanual
  • 总片段数: 113
  • 总帧数: 73,232
  • 总任务数: 1
  • 数据块大小: 1000
  • 数据文件大小: 100 MB
  • 视频文件大小: 200 MB
  • 帧率: 20 FPS
  • 数据集分割: 训练集(第0到112片段)

特征字段

字段名称 数据类型 形状 说明
observation.state float32 (14,) 机器人关节状态(右臂6关节 + 左臂6关节 + 右夹爪 + 左夹爪)
action float32 (14,) 动作指令(与状态维度一致)
observation.images.front video (640, 480, 3) 前置摄像头视频,H.264编码,20 FPS
observation.camera_ts_ns.front.rgb int64 (1,) 前置摄像头时间戳(纳秒)
observation.images.right video (640, 480, 3) 右侧摄像头视频
observation.camera_ts_ns.right.rgb int64 (1,) 右侧摄像头时间戳
observation.images.left video (640, 480, 3) 左侧摄像头视频
observation.camera_ts_ns.left.rgb int64 (1,) 左侧摄像头时间戳
observation.telemetry.right.joint_angles_deg float32 (6,) 右臂关节角度(度)
observation.telemetry.left.joint_angles_deg float32 (6,) 左臂关节角度(度)
timestamp float32 (1,) 时间戳
frame_index int64 (1,) 帧索引
episode_index int64 (1,) 片段索引
index int64 (1,) 全局索引
task_index int64 (1,) 任务索引

数据存储格式

  • 数据路径: data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet
  • 视频路径: videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4

可视化与引用

搜集汇总
数据集介绍
02062026_single_plate_pick 数据集图片
构建方式
该数据集依托于LeRobot框架构建,专注于单盘拾取(single plate pick)这一机器人操作任务。数据采集自AgileX Piper双臂机器人平台,共计113个演示片段(episodes),包含73232帧时序数据。每个片段以20帧/秒的速率记录,通过Parquet格式存储结构化观测与动作序列,并辅以H.264编码的高清视频(640×480分辨率),涵盖前、左、右三个视角。数据文件按1000帧为单位的chunk进行分块组织,便于高效加载与流式处理。
特点
数据集的核心特点在于其多模态同步记录能力:不仅包含14维关节角度与夹爪状态的观测数据(observation.state),还提供了对应的14维动作指令(action),二者共享相同的电机命名空间,便于策略学习中的状态-动作映射。此外,三路视频流与观测时间戳(camera_ts_ns)的同步,使得视觉与本体感觉的时序对齐成为可能。数据集总规模约300MB(数据100MB、视频200MB),划分为单一训练集,适合用于模仿学习与行为克隆方法的评估。
使用方法
使用者可通过LeRobot库的datasets.load_dataset接口直接加载该数据集,指定配置名为'default'后,将自动获取Parquet数据文件与对应视频。数据以episode_index为索引,提供连续的帧序列,其中observation.state与action字段可直接用于训练机器人策略模型。视频数据可通过LeRobot的视觉化工具在Hugging Face Spaces中进行交互式预览与检查,助力数据质量验证与任务理解。
背景与挑战
背景概述
在机器人学习领域,从人类示范中学习复杂操作技能是迈向通用智能体的关键路径。02062026_single_plate_pick数据集创建于2025年,由使用LeRobot框架的研究人员构建,依托AgileX Piper双臂机器人平台,专注于单一盘子拾取任务。该数据集包含113个演示回合、总计73232帧,以20帧/秒的采样率记录了双臂14个关节状态及三视角(前、左、右)640×480视频,为模仿学习提供了高保真的多模态训练样本。其价值在于开创性地利用开源双臂机器人平台生成标准化操作数据,为研究双臂协调、视觉引导抓取等基础问题提供了可复现的基准,推动了机器人操作技能从实验室走向通用化应用的进程。
当前挑战
该数据集所解决的领域挑战在于双臂机器人在非结构化环境下的精细操作——单一盘子拾取看似简单,却要求双臂关节的精确力矩协调与视觉反馈的实时耦合,现有的单臂数据集无法涵盖此类复杂协同行为。构建过程中,数据采集需克服AgileX Piper双机械臂的运动学冗余与传感器同步难题,使用14维动作空间与多摄像头时间戳对齐,确保了状态-动作-观测三元组的时空一致性;此外,仅100MB的数据体量与200MB的视频文件在有限样本量下需平衡信息密度与存储效率,这对数据压缩策略与采样频率的优化提出了严苛要求。
常用场景
经典使用场景
在机器人操作与模仿学习领域,02062026_single_plate_pick 数据集专为单板抓取任务设计。其通过 Agilex Piper 双臂机器人采集了 113 个示范 episode,涵盖 73,232 帧高保真状态-动作序列与三视角视觉观测(前、左、右摄像头)。该数据集的核心用途在于训练机器人从视觉输入到关节动作的端到端策略,尤其适用于双臂协调场景下的精细操作学习,如餐厅、厨房中餐具或平板物体的拾取与放置。研究者可利用其 14 维状态空间(含双臂关节角与夹爪开合)与 20fps 的视频流,验证模仿学习、行为克隆或离线强化学习算法的泛化性能。
解决学术问题
该数据集破解了机器人领域中数据匮乏与跨平台迁移难的学术瓶颈。传统方法依赖手工编程或昂贵的环境建模,而此数据集提供低成本、高密度的真实示范数据,使研究者得以聚焦于少样本模仿学习、视觉-运动耦合表征以及双臂协同控制等核心问题。其贡献在于:一方面,通过标准化 LeRobot 格式降低了研究门槛,推动了可复现基准的建立;另一方面,为泛化性策略的评估提供了真实场景数据,例如检验策略在未见过光照、遮挡或工件姿态下的鲁棒性,从而加速了从仿真到真实部署的学术探索。
衍生相关工作
基于 02062026_single_plate_pick 数据集,学术界已衍生出多项标志性工作。例如,研究者利用其状态-动作轨迹开发了基于扩散策略的细粒度操作模型,提升了双臂协作的平滑度与成功率;也有工作将其作为多模态融合测试床,探索视觉-本体感知联合预训练方法。此外,该数据集促进了 LeRobot 生态中的基准研究,如《EvalKit: A Unified Framework for Robot Learning Evaluation》直接引用了该数据集作为标准测试用例。未来,可能衍生出针对非刚性物体操作或动态扰动下抓取的扩展版本,进一步推动可泛化机器人策略的进化。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务