dice_white_pnp_und_sf_500_b03
收藏官方服务:
资源简介:
该数据集由 LeRobot 创建,包含在 FANUC CRX-5iA 机器人上通过脚本化伺服系统(白色块收集器)记录的骰子拾取和放置演示。数据集共 500 个片段,704172 帧,帧率 30 fps,使用 4 个摄像头(gripper、cam0、cam1、cam2)采集,图像分辨率为 640x480。所有图像帧均经过去畸变处理(使用工厂镜头标定,OpenCV rational 模型,保留原始视野)。任务目标是从工作区拾取骰子并将其放置在空的白色块上。每个片段仅在收集器确认骰子已就位后才保存。 状态观测(observation.state)和动作(action)均为 13 维向量,包含 6 个关节角度(J1-J6,单位度)、工具末端在机器人基座坐标系下的位置(X,Y,Z,单位毫米)、工具姿态(W,P,R,单位度)以及夹爪开合度(grip,1.0 为打开,0.0 为闭合)。动作是绝对目标姿态,即 action[t] 等于 observation.state[t+1](最后一帧重复)。位姿数据来自控制器 125 Hz 状态流,按每帧相机捕获时间戳采样,未进行插值。收集过程中丢弃了存在帧流空洞、夹爪闭合高度超过底部 3 mm 或相机帧过期的片段。 数据收集指标:总时长 23472 秒,生成时间 2026-09-30T15:02:09Z。片段保留率为 78%(500/643)。帧同步和采样质量经过严格监控。数据集结构包含 4 个摄像头视频流(AV1 编码,480x640,30fps)以及状态、动作、时间戳、帧索引、片段索引、任务索引等字段。所有数据以 Parquet 和 MP4 格式存储,分为训练集(前 500 个片段)。
创建时间:
2026-09-30
搜集汇总
数据集介绍

构建方式
该数据集依托LeRobot框架构设,于FANUC CRX-5iA机械臂实体单元上采集骰子拾取放置任务示教。示教由脚本化伺服控制器驱动执行,机械臂须将骰子拾起并稳妥置于白色空块之上,每一回合均在确认骰子安坐后方予留存。采集过程同步记录四路相机视觉(夹爪相机及cam0、cam1、cam2,分辨率640×480)与13维状态向量,涵盖六关节角度、工具尖端在基坐标系下的毫米级笛卡尔坐标、FANUC姿态角及夹爪开合标量。位姿数据取自控制器125 Hz状态流并按各帧相机曝光时间戳采样,杜绝插值;凡出现姿态空洞、闭合点偏离下降底部逾3毫米或相机帧陈旧者,皆于采集阶段一并剔除,最终形成500回合、704172帧、累计23472秒的示教语料。
特点
数据集在构建中严格约束了多种损坏源,拥有显著的质量特性。图像帧均经工厂镜头标定进行去畸变重映射,参数存于meta/undistort.json,推理端须以同模式馈入。动作定义为绝对目标位姿而非增量,action[t]即observation.state[t+1],状貌确定。采集指标显示,连续相同位姿占比为0.0%,精确线性插值帧仅14.5%,静止帧占31.9%,关节速度中位数与90分位分别为3.4与23.1度每秒。抓取几何上,500回合均含闭合与释放,闭合点高于下降底部的中位数为0.01毫米,抓取前在深度停留恒为18帧,闭合点与释放点高度分别为-126.5与-125.0毫米。放置位置x、y坐标范围分别为[155.13, 450.43]与[335.22, 509.05]毫米,98%落于随机化区域内。同步层面,相机间偏斜中位数为58毫秒,位姿节奏中位数为8毫秒。
使用方法
该数据集以LeRobot标准格式组织,数据文件为Parquet,视频为AV1编码,配套meta/info.json载明特征、路径与划分信息,训练集覆盖全部500回合。使用者可依照info.json中的data_path与video_path模板读取各chunk下的数据与视频,features中已定义observation.state、action与四路observation.images视频字段的名称与形状。策略训练时,视觉输入必须为保持工厂标定的未畸变帧,推理亦然,可调用fanuc_control.undistort并指定mode为keep完成重映射。状态与动作均为13维,字段依次为J1至J6关节角度、X/Y/Z工具尖端坐标(毫米,世界系原点位于机器人底座)、W/P/R姿态角(度)及grip(1.0为张开、0.0为闭合)。此外可借助Hugging Face空间进行数据可视化预览,以便核验回合内容与帧序。
背景与挑战
背景概述
在机器人学习领域,高质量的真实世界演示数据是训练稳健策略的基石。dice_white_pnp_und_sf_500_b03数据集于2026年由LeRobot平台构建,采用FANUC CRX-5iA协作机械臂,通过脚本化伺服控制完成骰子拾取与放置任务。数据集包含500条成功演示,总计704172帧,以30帧/秒的速率记录了四路摄像头视角,所有图像均基于工厂镜头标定进行了去畸变处理。每个回合仅当收集器确认骰子准确置于白色方块上后才予保存,从而确保了演示的精确性与一致性。该数据集为机器人操作策略学习,尤其是拾取-放置任务中的视觉-运动映射研究,提供了大规模、高保真的真实世界基准。
当前挑战
该数据集所应对的领域问题在于真实世界机器人拾取-放置任务中的泛化性与精确性,要求策略能够处理骰子位姿变化,同时克服视觉干扰与机械误差。在构建过程中,面临多重挑战:多相机同步需保证帧间时间偏差低于100毫秒,但实际数据中仍出现相机3滞后及帧流空洞导致的丢弃;机械臂运动存在大量静止片段(31.9%帧关节速度低于0.5度/秒),且13.2%的30行动作块处于“停留”状态,造成标签歧义;此外,11次放置点位于随机化区域之外,收集良率仅78%,这些因素共同增加了策略学习的难度,并对数据清洗与增强提出了更高要求。
常用场景
经典使用场景
在机器人学习领域,基于视觉的抓取与放置任务长期依赖大规模、高保真的真实演示数据。该数据集最经典的使用场景在于训练端到端的视觉-动作策略,使FANUC CRX-5iA机械臂能够从多视角视觉观测中直接学习将骰子拾取并放置到白色方块上的精细操作。研究者通常将四个摄像头采集的未畸变图像与十三维状态-动作对联合输入,借助模仿学习或行为克隆方法,让机械臂在非结构化场景中习得稳定、精准的拾放技能,进而评估策略对物体位姿变化与视觉扰动的鲁棒性。
实际应用
在工业自动化与仓储物流场景中,该数据集所承载的技能具有直接迁移价值。基于其训练的视觉策略可部署于装配线上,完成小型零部件的定点拾取与放置,或应用于分拣系统中对散乱工件进行有序归位。由于数据采用绝对关节角度与工具位姿作为动作标签,策略输出可直接映射至FANUC控制器指令,降低了从仿真或离线数据到真实产线的落地门槛。此外,多相机配置与未畸变处理流程亦为其他需要高精度视觉伺服的机器人任务提供了可复用的数据采集与预处理范本。
衍生相关工作
依托该数据集,研究者得以在统一基准上开展多项衍生工作,包括对比不同视觉编码器在未畸变图像上的特征提取能力、探索多相机融合策略对抓取成功率的影响,以及验证时间序列建模方法在绝对动作预测中的有效性。其严格的数据采集协议与详尽的采集指标亦被后续数据集构建工作引为参考,用以定义演示质量的下限标准。围绕该数据集形成的可视化工具与评估流程,进一步催生了面向工业机械臂的模仿学习算法比较研究,为社区积累了可复现的实验基线。
以上内容由遇见数据集搜集并总结生成




