遇见数据集

ddduk/Pick_and_place_merged

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集由LeRobot创建,用于机器人任务。数据集包含机器人动作(如肩部、肘部、腕部和抓手的位姿)、观察状态(包括两个视角的图像:顶部和腕部摄像头,分辨率为480x640,30帧/秒)、时间戳、帧索引、任务索引等特征。总共有38个集数、16580帧、4个任务,数据以parquet格式存储,视频以mp4格式存储。机器人类型为“so_follower”,适用于机器人学习和控制研究。

--- 许可证:Apache 2.0 任务类别: - 机器人学 标签: - LeRobot 配置项: - 配置名称:default 数据文件:data/*/*.parquet --- 本数据集基于[LeRobot](https://github.com/huggingface/lerobot)开发框架构建。 <a class="flex" href="https://huggingface.co/spaces/lerobot/visualize_dataset?path=ddduk/Pick_and_place_merged"> <img class="block dark:hidden" src="https://huggingface.co/datasets/huggingface/badges/resolve/main/visualize-this-dataset-xl.svg"/> <img class="hidden dark:block" src="https://huggingface.co/datasets/huggingface/badges/resolve/main/visualize-this-dataset-xl-dark.svg"/> </a> ## 数据集说明 - **主页:** [更多信息待补充] - **论文:** [更多信息待补充] - **许可证:** Apache 2.0 ## 数据集结构 `meta/info.json` 文件内容如下: json { "代码库版本": "v3.0", "帧率": 30, "特征": { "动作": { "数据类型": "float32", "名称": [ "shoulder_pan.pos", "shoulder_lift.pos", "elbow_flex.pos", "wrist_flex.pos", "wrist_roll.pos", "gripper.pos" ], "形状": [6] }, "观测.状态": { "数据类型": "float32", "名称": [ "shoulder_pan.pos", "shoulder_lift.pos", "elbow_flex.pos", "wrist_flex.pos", "wrist_roll.pos", "gripper.pos" ], "形状": [6] }, "观测图像.顶部相机": { "数据类型": "视频", "形状": [480, 640, 3], "名称": ["高度", "宽度", "通道数"], "详细信息": { "视频.高度": 480, "视频.宽度": 640, "视频.编解码器": "av1", "视频.像素格式": "yuv420p", "视频.是否为深度图": false, "视频.帧率": 30, "视频.通道数": 3, "是否含音频": false, "视频.g": 2, "视频.恒定速率因子": 30, "视频.编码预设": 12, "视频.快速解码": 0, "视频.后端": "pyav", "视频.额外选项": {} } }, "观测图像.腕部相机": { "数据类型": "视频", "形状": [480, 640, 3], "名称": ["高度", "宽度", "通道数"], "详细信息": { "视频.高度": 480, "视频.宽度": 640, "视频.编解码器": "av1", "视频.像素格式": "yuv420p", "视频.是否为深度图": false, "视频.帧率": 30, "视频.通道数": 3, "是否含音频": false, "视频.g": 2, "视频.恒定速率因子": 30, "视频.编码预设": 12, "视频.快速解码": 0, "视频.后端": "pyav", "视频.额外选项": {} } }, "时间戳": { "数据类型": "float32", "形状": [1], "名称": null }, "帧索引": { "数据类型": "int64", "形状": [1], "名称": null }, "回合索引": { "数据类型": "int64", "形状": [1], "名称": null }, "全局索引": { "数据类型": "int64", "形状": [1], "名称": null }, "任务索引": { "数据类型": "int64", "形状": [1], "名称": null } }, "总回合数": 38, "总帧数": 16580, "总任务数": 4, "分块大小": 1000, "数据文件总大小(MB)": 100, "视频文件总大小(MB)": 200, "数据文件路径模板": "data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet", "视频文件路径模板": "videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4", "机器人类型": "so_follower", "数据集划分": { "训练集": "0:38" } } ## 引用 **BibTeX格式:** bibtex [更多信息待补充]

提供机构:
ddduk
搜集汇总
数据集介绍
ddduk/Pick_and_place_merged 数据集图片
构建方式
该数据集通过LeRobot框架构建,聚焦于机器人领域的拾取与放置任务,涵盖38个episode共计16580帧数据。数据以高采样率(30fps)采集,存储格式为parquet与视频文件,并划分为训练集(所有38个episode)。其构建凝聚了多视角观测数据(顶部摄像头与腕部摄像头)及机器人运动状态与动作序列。
特点
数据集特点在于具备丰富的多模态信息,包含6维动作指令(肩部、肘部、腕部及夹爪位置)及对应状态,同步记录双视角视频流(480x640分辨率,AV1编码)。此外,数据覆盖4类任务,包含时间戳与帧索引等结构化元信息,易于场景复现。采用压缩编码以平衡存储(总量约300MB)与质量,适配真实机器人操控场景。
使用方法
使用数据集时,可借助LeRobot库加载parquet格式的采样帧数据,通过读取'observation.state'与'action'字段获取机器人的状态-动作对;同时利用'observation.images.top'及'observation.images.wrist'提取视觉输入。数据集提供预定义训练分割,支持序列化模型训练与评估,并可通过HuggingFace可视化工具直接查看样本。
背景与挑战
背景概述
Pick_and_place_merged数据集由LeRobot社区基于HuggingFace平台构建,诞生于2024年,旨在推动机器人操作任务的模仿学习研究。该数据集聚焦于机械臂的抓取与放置核心技能,通过记录So_Follower机器人执行4种不同任务时的38个完整episode,涵盖16580帧视觉与运动状态数据。其核心研究问题在于如何利用多模态观测(包括顶部与腕部摄像头图像及六维关节状态)高效学习机器人动作策略,对低成本机器人平台上的行为克隆与强化学习研究具有重要参考价值。作为LeRobot生态的组成部分,该数据集为机器人领域提供了标准化的数据收集与评估基准。
当前挑战
该数据集所解决的领域挑战在于:机器人抓取与放置操作需要同时处理高维视觉输入与连续运动控制的协同问题,传统规则方法难以适应非结构化环境中的物体位置与姿态变化。构建过程中面临的核心困难包括:需要精确定义机械臂6个自由度的动作空间与对应观测状态的一致性标注;双视角视频数据(顶部与腕部)的同步采集与时空对齐;仅有38个episode的小样本规模限制了模型泛化能力的训练保障;此外,从遥操作获取的演示数据中有效提取任务无关特征并消除人为噪声,也是数据构建时的关键挑战。
常用场景
经典使用场景
在机器人学习与操控领域,Pick_and_place_merged数据集为模仿学习与行为克隆提供了理想的数据基础。它包含来自两台摄像头(顶部与腕部)的高清视觉观测,以及六自由度关节空间的状态与动作序列,覆盖了四种不同的拾放任务。研究者常利用这些数据训练端到端策略,使机器人能够从视觉输入直接映射出精确的关节运动,从而复现复杂的抓取与放置行为。该数据集以30帧每秒的高频采样记录38个完整回合,特别适合于学习连续控制策略,是验证机器人技能泛化能力的标准基准。
解决学术问题
该数据集系统性地解决了机器人领域中“少样本技能泛化”与“多模态感知融合”两大核心难题。通过提供统一的动作状态空间与同步的视觉模态数据,研究者得以探究如何在有限示范下高效习得可迁移的操控策略。它还为评估模仿学习算法的数据效率、抗噪能力及跨任务泛化性提供了标准化测试平台。其深远意义在于推动了从固定编程向数据驱动的机器人自主学习范式转变,使智能体能够从人类演示中自然习得精细操作技能。
衍生相关工作
围绕该数据集,研究者已开展了多项开创性工作,例如基于扩散策略(Diffusion Policy)的机器人操控模型,它利用数据集的多模态信息生成平滑的动作轨迹。此外,视觉语言模型与示教学习的结合也在此数据上得到验证,模型能理解自然语言指令并执行对应的拾放任务。数据集还催生了离线强化学习算法在真实机器人场景的改进,如隐式Q学习(IQL)与保守Q学习(CQL)的变体,以及时序动作分割和预训练视觉特征迁移的相关探索,均显著提升了机器人在动态环境中的适应能力。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务