遇见数据集

dice_white_pnp_und_500_b01

收藏
Hugging Face2026-09-04 更新2026-09-05 收录
官方服务:

资源简介:

该数据集是使用Fanuc CRX-5iA机器人进行白色骰子拾取与放置任务的机器人操作数据集。数据集通过LeRobot框架收集,包含82个演示片段(episodes),共计52546帧,帧率为30fps,总演示时长约1752秒。每个样本包含来自四个视角的摄像头图像(夹爪相机、cam0、cam1、cam2,均为480x640分辨率、AV1编码的彩色视频),以及13维的机器人状态和动作数据,具体包括6个关节角度(J1-J6)、工具末端位置(x, y, z)、姿态(W, P, R)和夹爪开合度(gripper)。数据集还提供了时间戳、帧索引、episode索引等辅助信息。该数据集适用于机器人模仿学习、行为克隆、动作规划等任务,特别是针对精细的抓取与放置操作。数据集的收集指标显示,其具有较高的动作质量(如低重复姿态比、平稳的抓取深度等),适合用于训练高精度机器人控制模型。

This dataset is a robot manipulation dataset for the pick-and-place task of white dice using a Fanuc CRX-5iA robot. It was collected via the LeRobot framework and contains 82 demonstration episodes, totaling 52,546 frames at 30 fps, with a total demonstration duration of approximately 1,752 seconds. Each sample includes camera images from four viewpoints (gripper camera, cam0, cam1, cam2, all 480x640 resolution, AV1-encoded color videos), as well as 13-dimensional robot state and action data, specifically including 6 joint angles (J1-J6), tool end-effector position (x, y, z), orientation (W, P, R), and gripper opening degree (gripper). The dataset also provides auxiliary information such as timestamps, frame indices, and episode indices. This dataset is suitable for robot imitation learning, behavior cloning, motion planning, and other tasks, especially for fine-grained grasping and placing operations. The collection metrics indicate high action quality (e.g., low repetition pose ratio, stable grasping depth), making it suitable for training high-precision robot control models.

创建时间:
2026-09-04
原始信息汇总

数据集概述:azorematter/dice_white_pnp_und_500_b01

基本信息

  • 许可证: Apache-2.0
  • 任务类型: 机器人技术(Robotics)
  • 标签: LeRobot, FANUC, CRX-5iA, 拾放操作(Pick-and-Place), 骰子, 真实机器人, 无畸变(Undistorted)
  • 数据规模: 100K < n < 1M(共333,586帧)
  • 机器人类型: FANUC CRX-5iA

数据内容简介

该数据集由FANUC CRX-5iA机器人通过脚本伺服(scripted servo)模式记录,展示骰子拾放操作,动作为将骰子拾起并放置到空白色块上。共包含500个演示片段333,586帧(30 fps)、演示时长约11,120秒。每个片段均通过收集器验证骰子正确就位后才保存。

相机配置与图像规格

  • 相机数量: 4个(gripper, cam0, cam1, cam2)
  • 分辨率: 640×480,RGB三通道
  • 视频编码: AV1,30 fps
  • 图像预处理: 所有帧均已去畸变处理(undistorted),使用工厂镜头标定参数(OpenCV rational model,全部14项系数,K保留),标定参数存储于 meta/undistort.json。推理时亦需使用相同去畸变模式处理输入帧。

状态与动作空间

observation.stateaction 维度均为 13,包含:

通道 描述
J1–J6 六个关节角度(度)
X, Y, Z 工具尖端在机器人基坐标系下的位置(毫米)
W, P, R FANUC工具姿态角(度)
grip 夹爪状态(1.0=打开,0.0=闭合)

动作定义: action[t] 等于 observation.state[t+1](最后一帧重复),即绝对目标位姿而非增量。位姿来自控制器125 Hz状态流,按每帧相机采集时间戳采样,无插值。

采集质量指标

位姿通道指标

  • 连续重复位姿占比: 0.0%
  • 纯线性斜坡帧占比: 23.1%
  • 静止帧占比(关节速度<0.5°/s): 39.1%
  • 静止运行长度中位数/90分位/最大(帧): 10 / 50 / 89
  • 关节速度中位数/90分位/最大(°/s): 4.1 / 47.9 / 79.8

抓取几何指标

  • 含闭合/释放操作的片段数: 500 / 500
  • 闭合点高于下降底部距离中位数/90分位/最大(mm): 0.05 / 0.09 / 0.14(限值3)
  • 闭合前深度停留帧数中位数/90分位/最大: 12 / 13 / 14
  • 闭合时Z值中位数/90分位/最大(mm): -126.5(恒值)
  • 释放时Z值中位数/90分位/最大(mm): -125.0(恒值)

同步与产出指标

  • 产出率: 500/546 = 92%(丢弃46个未知原因样本)
  • 位姿节奏中位数/90分位/最大(ms): 8.00(标称值)
  • 位姿最大间隙中位数/90分位/最大(ms): 8.0 / 8.0 / 32.0
  • 相机间偏移中位数/90分位/最大(ms): 50 / 51 / 54
  • 腕部相机与位姿延迟中位数/|中位数|/最大(ms): 20.7 / 25.3 / 204.4

相机质量指标

相机 中位亮度 裁剪像素占比
gripper 30 0.01%
cam0 97 0.61%
cam1 1 0.46%
cam2 1 0.69%

数据文件结构与格式

  • 数据路径: Parquet文件(data/*/*.parquet),按 data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet 组织
  • 视频路径: MP4视频文件(AV1编码),按 videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4 组织
  • 数据文件大小: 约100 MB,视频文件约200 MB
  • 分割: train: 0:500(全部500个片段用于训练)
  • 数据集结构版本: v3.0(LeRobot codebase)
  • 任务数: 1个
  • 块大小: 1000帧

特征字段列表

  • observation.state(float32, 13维)
  • action(float32, 13维)
  • observation.images.gripper / cam0 / cam1 / cam2(视频,480×640×3,AV1编码)
  • timestamp(float32, 1维)
  • frame_index(int64, 1维)
  • episode_index(int64, 1维)
  • index(int64, 1维)
  • task_index(int64, 1维)
搜集汇总
数据集介绍
dice_white_pnp_und_500_b01 数据集图片
构建方式
该数据集由FANUC CRX-5iA机械臂在脚本化伺服控制下完成骰子拾取与放置任务,依托LeRobot框架构建。采集过程中,系统以30 fps同步记录四路摄像头(夹爪、cam0、cam1、cam2)的640×480图像,并实时采集控制器125 Hz状态流中的关节角度与笛卡尔位姿。为确保数据质量,每段演示仅在验证骰子准确置于白色方块上后方予保存,且对位姿空洞、闭合高度超限或摄像头失步的片段进行剔除,最终从546次尝试中保留500条有效轨迹,涵盖333586帧、约11120秒的示范数据。
特点
数据集的核心特征在于其高保真同步与去畸变处理。所有图像均基于工厂镜头标定参数(OpenCV有理模型,保留全部14项系数)进行去畸变重映射,推理时须采用相同模式。状态与动作向量均为13维,包含六个关节角度、工具尖端世界坐标、FANUC工具姿态及夹爪开合状态,且动作被定义为下一时刻的绝对状态目标,而非增量。采集指标显示,连续相同位姿占比为零,精确线性斜坡帧仅占23.1%,静止帧占比39.1%,闭合高度偏差中位数仅0.05毫米,体现出高质量、低冗余的示范特性。
使用方法
使用该数据集时,需通过LeRobot工具链加载,并依据meta/info.json解析数据结构。训练策略网络时,输入图像必须预先执行与采集阶段一致的去畸变操作(fanuc_control.undistort,模式keep),以保持视觉特征的空间一致性。观测状态与动作可直接用于行为克隆或策略学习,动作空间为绝对目标,无需额外积分。数据集划分训练集涵盖全部500条轨迹,用户可结合可视化工具在线检视演示过程,确保模型输入与训练数据分布匹配。
背景与挑战
背景概述
在机器人学习领域,高质量的真实世界操作数据集对于训练鲁棒且可泛化的策略至关重要。dice_white_pnp_und_500_b01数据集于2026年9月由研究团队基于FANUC CRX-5iA协作机械臂构建,通过脚本化伺服采集了500个骰子拾取-放置演示回合,共计333,586帧、约11,120秒、30 fps、四路640×480摄像头,并采用工厂镜头标定进行去畸变处理。该数据集聚焦于拾取骰子并放置于白色空块上的精细操作任务,每个成功回合均经收集器自动验证后保存。其丰富的同步视觉-位姿-动作流为视觉-运动策略学习、多模态表征与绝对目标控制研究提供了可复现的基准资源。
当前挑战
在领域问题层面,该数据集旨在攻克真实机器人高精度拾取-放置中的核心挑战:绝对位姿控制、多相机时空同步、以及视觉观测与动作序列的严格对齐。构建过程中面临的挑战更为具体:保持位姿流与相机帧在毫秒级同步(中位相机-位姿滞后20.7 ms,最大204.4 ms),同时将跨相机偏斜控制在100 ms阈值内;确保闭合操作发生在下降底部上方不超过3 mm处,且深度领先中位400 ms;避免静止帧过多(站定帧占39.1%,30帧连续静止块占15.2%)带来的动作标签歧义;此外,相机亮度中位偏低(cam1和cam2亮度均为1)可能影响视觉策略的泛化能力。
常用场景
经典使用场景
在机器人学习领域,基于视觉的抓取与放置任务长期被视为检验模仿学习算法性能的试金石。该数据集依托FANUC CRX-5iA协作机械臂,以白块收集器脚本驱动完成骰子拾取并精确放置于空白白块之上的操作,500条演示轨迹、333586帧、30fps的采样率配合四路640×480相机(夹爪、cam0、cam1、cam2),构成了多视角视觉-动作联合建模的典型范本。研究者通常以此训练ACT、Diffusion Policy等端到端策略网络,利用去畸变后的图像帧与13维状态动作向量,探究高精度抓取与空间泛化能力。
解决学术问题
该数据集直面机器人模仿学习中演示数据质量参差不齐这一核心痛点。采集过程中严格校验骰子落座后方才保存轨迹,闭合高度超过下降底部3毫米以上的片段被剔除,姿态空洞或相机陈旧帧亦被过滤,最终生成92%良率的高保真演示。此举有效缓解了策略网络对静止帧、线性插值帧的过拟合,为研究动作分块歧义、停驻帧处理以及视觉-本体感觉时序对齐等关键问题提供了干净且可复现的实验基准,推动了数据驱动抓取研究从粗放采集向精细化质量控制的范式转变。
衍生相关工作
围绕该数据集,研究者已衍生出若干经典工作。一方面,基于LeRobot框架的标准化接口催生了多种策略基线在该数据上的横向评测,如ACT、Diffusion Policy及VQ-BeT等模型在骰子放置任务上的表现对比,揭示了不同动作表示对精抓取精度的影响。另一方面,数据集中高比例停驻帧与绝对动作标签的特性,激发了关于动作分块边界模糊性与时序平滑正则化的方法创新,相关成果已被用于改进模仿学习在精密插入与放置任务中的稳定性。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务