遇见数据集

ant0nh/pnp_pencil_case_tray

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集由LeRobot创建,是一个机器人操作数据集,专门用于机器人学任务。数据集包含25个episodes,总计18642帧,数据以parquet格式存储,视频以mp4格式存储。数据集的特征包括:动作数据(6个关节位置:肩部平移、肩部提升、肘部弯曲、手腕弯曲、手腕旋转和夹爪位置)、观察状态(与动作相同的6个关节位置)、两个摄像头图像(手腕摄像头和前置摄像头,分辨率均为480x640,帧率30fps,编码为av1,像素格式yuv420p,非深度图),以及时间戳、帧索引、episode索引、索引、任务索引等元数据。机器人类型为so_follower,数据集总大小约为300MB(数据文件100MB,视频文件200MB),训练分割覆盖所有episodes(0:25)。

This dataset was created using LeRobot and is a robotics manipulation dataset designed for robotics tasks. It consists of 25 episodes with a total of 18,642 frames, stored in parquet format for data and mp4 format for videos. The dataset features include: action data (6 joint positions: shoulder pan, shoulder lift, elbow flex, wrist flex, wrist roll, and gripper positions), observation state (same 6 joint positions as action), two camera images (wrist and front cameras, both with 480x640 resolution, 30 fps, av1 codec, yuv420p pixel format, non-depth maps), and metadata such as timestamp, frame index, episode index, index, and task index. The robot type is so_follower. The total dataset size is approximately 300MB (100MB for data files and 200MB for video files), with a training split covering all episodes (0:25).

提供机构:
ant0nh
搜集汇总
数据集介绍
ant0nh/pnp_pencil_case_tray 数据集图片
构建方式
在机器人操作技能学习中,高质量的演示数据是训练策略模型的基础。本数据集依托LeRobot框架构建,采用so_follower机器人平台,以30帧每秒的采样率记录了25个针对铅笔盒托盘的抓取与放置任务片段,累计18642帧。数据采集过程中,操作者通过遥操作控制机器人完成目标任务,同时同步记录机器人关节位置、末端执行器动作以及腕部与正面两个视角的视频流。所有数据以Parquet格式存储,视频采用高效AV1编码,确保存储效率与解码性能的平衡。
特点
该数据集在结构与内容上展现出多重特性。动作空间与状态空间均包含六个自由度,涵盖肩部旋转、肩部升降、肘部弯曲、腕部弯曲、腕部旋转及夹爪位置,完整刻画了机械臂的运动状态。视觉模态提供腕部与正面双视角视频,分辨率达480×640,为策略学习提供丰富的空间信息。数据以情节为组织单元,共25个情节,每个情节对应单一任务,便于按需抽取与训练。元信息文件详细规定了数据路径、视频路径及分块策略,提升了数据管理的规范性。
使用方法
使用该数据集时,研究者可借助LeRobot工具链直接加载Parquet数据文件与对应视频,获取动作、状态及视觉观测序列。数据按情节划分,训练集覆盖全部25个情节,便于进行行为克隆或离线强化学习。用户可通过HuggingFace Spaces提供的可视化工具在线浏览数据集内容,直观检查任务执行质量。若需自定义训练流程,可依据meta/info.json中的特征定义与路径模板解析数据,并利用时间戳与帧索引进行序列对齐。该数据集遵循Apache-2.0许可,允许在合规前提下自由使用与修改。
背景与挑战
背景概述
在具身智能与机器人学习迅猛演进的浪潮中,面向桌面级精细操作的数据集成为连接感知与行动的关键纽带。pnp_pencil_case_tray数据集于2026年5月由研究者ant0nh基于LeRobot框架构建,聚焦于将笔袋拾取并放置于托盘这一典型的pick-and-place任务。该数据集包含25个演示回合、18642帧同步记录,涵盖六自由度机械臂本体状态、腕部与前置视角视频流以及动作指令,为模仿学习与视觉-语言-动作模型训练提供了真实的物理交互样本,其开放许可与标准化结构对推动可复现机器人研究具有积极意义。
当前挑战
该数据集所面对的挑战源于物体操作固有的复杂性。笔袋形状多样、材质柔软且易变形,其位姿估计与稳定抓取远超刚性物体,对策略泛化构成严峻考验。托盘目标区域狭小,要求机械臂在放置阶段具备高精度末端控制与空间推理能力,稍有偏差即导致任务失败。构建过程中,多模态数据的高频同步采集与存储需要保证时间戳一致性,腕部与前置相机视角的对齐增加了标定难度,而仅25个回合的有限演示规模也可能限制模型在真实场景中的鲁棒迁移。
常用场景
经典使用场景
在具身智能与机器人学习领域,该数据集最经典的使用场景是作为视觉-动作策略学习(visuomotor policy learning)的训练语料,具体任务为从托盘中拾取铅笔盒并完成放置。数据集收录了25个演示回合、18642帧30fps的同步数据,包含腕部与前置双视角RGB视频流以及六自由度机械臂的关节位置与夹爪状态,研究者可据此训练行为克隆或模仿学习模型,使so_follower机械臂在真实环境中复现抓取-放置操作。
衍生相关工作
依托LeRobot开源生态,该数据集衍生出一系列经典工作,包括基于扩散策略(Diffusion Policy)与ACT(Action Chunking Transformer)的抓取放置策略训练、多视角视觉编码器对比研究以及真实机器人模仿学习基准评测。其标准化特征定义与视频编码格式亦被后续数据集沿用,促进了机器人操作数据的规范化积累与跨任务迁移研究。
数据集最近研究
最新研究方向
在具身智能与机器人操作学习范畴内,pnp_pencil_case_tray数据集依托LeRobot框架构建起一套面向抓取与放置任务的视觉-动作联合建模资源。其以三十赫兹采样频率同步采集腕部与前置双视角视频流,并配对六自由度关节位置指令,为模仿学习与视觉-语言-动作模型提供了高时序对齐的训练样本。当下研究前沿聚焦于借此类真实遥操作数据弥合仿真到现实的感知鸿沟,探索策略泛化能力与长程任务规划的内在机理。该数据集对推动桌面级精细操作的可复现研究、降低真实机器人数据采集门槛具有切实意义,亦为开源机器人学习生态的基准构建注入动力。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务