遇见数据集

pnp_act_v4

收藏
Hugging Face2026-07-21 更新2026-07-22 收录
官方服务:

资源简介:

该数据集是一个机器人操作数据集,使用LeRobot框架创建,专门用于拾放任务。数据集包含266个完整操作序列,总计61366帧数据,以30fps的频率采集。数据采用Parquet文件格式存储,总数据量约为300MB(其中结构化数据100MB,视频数据200MB)。数据集的核心特征包括:1) 观测状态:包含7个机械臂关节位置(lj0-lj6),数据类型为float32;2) 动作指令:包含7个关节位置和1个左夹爪开合状态,共8维float32向量;3) 多视角视觉观测:包含zed和fish0两个相机视角的RGB视频,分辨率均为360x640,3通道,H.264编码,30fps;4) 时序与索引信息:时间戳、帧索引、序列索引、任务索引等。该数据集适用于机器人模仿学习、强化学习、行为克隆等研究,特别是机械臂抓取与放置任务的算法开发与评估。

This robotic manipulation dataset was developed using the LeRobot framework, specifically tailored for pick-and-place tasks. The dataset contains 266 complete manipulation sequences, totaling 61,366 frames collected at 30 fps. The data is stored in Parquet file format, with an overall size of approximately 300 MB (100 MB of structured data and 200 MB of video data). The core features of the dataset are listed below: 1) Observation state: includes 7 robotic arm joint positions (lj0-lj6) with a data type of float32; 2) Action commands: consists of 7 joint positions and 1 left gripper open/close state, forming an 8-dimensional float32 vector; 3) Multi-view visual observations: provides RGB videos from two camera perspectives (zed and fish0), both with a resolution of 360×640, 3 color channels, encoded in H.264 format, and captured at 30 fps; 4) Temporal and index information: includes timestamps, frame index, sequence index, task index, etc. This dataset is applicable to research fields such as robotic imitation learning, reinforcement learning and behavioral cloning, and is particularly suitable for algorithm development and evaluation of robotic arm grasping and pick-and-place tasks.

创建时间:
2026-07-11
原始信息汇总

数据集概述:adityx23/pnp_act_v4

许可证:Apache-2.0
任务类别:机器人学
标签:LeRobot, robotics, act, pick-and-place, yor

数据集结构

  • 数据集来源:使用 LeRobot 创建。
  • 数据文件:位于 data/*/*.parquet

数据集特性

特征(Features)

特征名 数据类型 形状 说明
observation.state float32 [7] 机器人关节状态,包含 7 个关节(lj0 至 lj6)
action float32 [8] 机器人动作,包含 7 个关节和夹爪(lj0 至 lj6 + left_gripper)
observation.images.zed video [3, 360, 640] 来自 ZED 相机的视频流(H264 编码,30fps)
observation.images.fish0 video [3, 360, 640] 来自鱼眼相机 0 的视频流(H264 编码,30fps)
timestamp float32 [1] 时间戳
frame_index int64 [1] 帧索引
episode_index int32 [1] 回合索引
index int64 [1] 索引
task_index int32 [1] 任务索引(当前为 0)

数据规模

  • 总回合数:266
  • 总帧数:61366
  • 总任务数:0
  • 数据文件大小:100 MB
  • 视频文件大小:200 MB
  • 帧率:30 fps

数据文件组织

  • 数据路径data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet
  • 视频路径videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4
  • 分块大小:1000

其他信息

  • 主页:[更多信息待补充]
  • 论文:[更多信息待补充]
  • 机器人类型:未指定
  • 数据集划分:无
搜集汇总
数据集介绍
pnp_act_v4 数据集图片
构建方式
pnp_act_v4数据集是专为机器人抓取与放置任务设计的精细操控数据集,依托LeRobot开源框架构建而成。数据采集过程中,通过高精度传感器记录机器人7个关节的状态信息,并同步捕捉包含8维动作指令的控制信号,其中末位维度专用于夹爪控制。视觉感知部分由两台摄像头协同完成:ZED深度相机提供全局视角,鱼眼相机(fish0)补充近距离细节,二者均以30帧每秒的速率采集分辨率360×640的H.264编码视频。整个数据集包含266个完整动作片段,共计61366帧时序数据,按1000帧为单位分块存储为Parquet格式,配套视频文件以MP4封装,确保数据读取的高效性与结构化一致性。
特点
该数据集的突出特点在于其多模态融合与精细化标注。每一时间步均提供7维关节状态向量、8维动作向量以及双路视觉图像,构成丰富的状态-动作-观测三元组,为模仿学习与行为克隆算法提供充足的监督信号。数据集内置帧索引、片段索引与时间戳字段,便于用户按时间序列或完整任务片段进行切片与重组。值得注意的是,其动作空间明确包含夹爪控制维度,而状态空间则完整覆盖所有自由度,使得模型能够精准学习从感知到末端执行的完整映射。此外,Apache-2.0许可证赋予了研究者自由修改与分发的权限,降低了学术与工业应用的门槛。
使用方法
使用者可通过LeRobot库内置的API高效加载pnp_act_v4数据集。在HuggingFace平台中,利用`lerobot.Dataset`接口指定数据集名称即可自动按Parquet分块文件与视频目录构建数据管道。推荐将数据集重组为批量片段序列,以匹配ACT(Action Chunking Transformer)等算法对连续帧预测的需求。由于数据已包含标准化的`observation.state`与`action`字段,可直接输入至策略网络进行端到端训练。可视化工具也一并提供,通过HuggingFace Spaces的交互式界面可直观播放任意片段,便于在模型部署前验证数据质量与动作序列的合理性。
背景与挑战
背景概述
pnp_act_v4数据集由研究人员adityx23基于LeRobot框架创建,发布于2023年,专注于机器人抓取与放置(pick-and-place)任务。该数据集通过模拟真实环境下的机器人操作行为,采集了包含7维关节状态、8维动作指令以及多视角视觉观测(包括zed深度相机和fish0广角相机)的高频数据,帧率达到30FPS。数据集共包含266个操作片段,超过6万帧图像与运动状态数据,为机器人模仿学习中的行为克隆算法(如ACT)提供了高质量的训练与评估基准。其在机器人操作学习领域具有一定影响力,推动了低样本、高精度的机器人操作技能迁移研究。
当前挑战
该数据集所解决的领域问题在于如何使机器人从少量示例中高效学习复杂的抓取与放置操作,以克服传统手工编程费时且泛化性差的局限。构建过程中面临的挑战包括:多视角视觉数据与关节状态数据的精确同步,确保时间戳一致性;在有限的操作片段(266个)中保持动作轨迹的多样性与代表性,避免过拟合;同时,相机配置(如zed与fish0)的标定差异及光照变化给特征提取与建模带来额外难度。此外,数据集尚未明确标注任务类型(total_tasks为0),增加了对无监督或零样本泛化能力的要求。
常用场景
经典使用场景
在机器人学习领域,pnp_act_v4数据集专为模仿学习中的抓取与放置任务设计,尤其适用于基于视觉的运动策略训练。数据集包含两个摄像头视角(ZED立体相机与鱼眼相机)的高清视频流,同步记录了机器人7个关节状态与8维动作指令(含夹爪控制)。借助LeRobot框架,研究者可轻松提取时序一致的观测-动作对,用于训练端到端的神经网络模型,如行为克隆或基于Transformer的决策架构。
实际应用
在实际应用中,该数据集可直接用于训练工业机械臂的自主拾取-放置技能,例如在仓储物流中的货物分拣、电子元件的精密装配等场景。通过迁移学习或微调,利用pnp_act_v4训练的策略可适配不同构型的机械臂,降低工程部署成本。此外,数据集的标准化格式便于集成到机器人操作系统(ROS)中,加速从仿真到真实环境的策略部署。
衍生相关工作
基于pnp_act_v4,衍生出若干关键研究工作。例如,利用多视角视频融合的残差网络提升操作成功率;或通过对比学习提取状态-动作的潜在表征,实现少样本迁移。此外,该数据集常作为基线测试平台,评估各类模仿学习算法(如Action Chunking with Transformers)的效能,并催生数据增强策略以提升策略的鲁棒性。其Apache-2.0许可协议亦支持学术界与工业界进行二次开发与复现。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务