遇见数据集

saipuneethgottam/pickplace_134cam_newdemos_20260526_161032_remapped

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个用于机器人拾取放置任务的数据集,使用LeRobot工具创建。数据集包含100个训练集episodes,总帧数为53178帧,帧率为30fps。数据格式为parquet文件,特征包括动作(6个关节位置:肩部平移、肩部提升、肘部弯曲、手腕弯曲、手腕旋转、夹爪位置)、观察图像(来自三个摄像头:camera1和camera2分辨率为1280x720,camera3分辨率为640x480,均为RGB视频)、观察状态(6个关节位置)、episode索引、帧索引、任务索引和时间戳。数据集专为so_follower机器人类型设计,视频文件使用AV1编码,总大小为200MB,数据文件大小为100MB。

This dataset is designed for robotic pick-and-place tasks, created using the LeRobot tool. It contains 100 training episodes with a total of 53,178 frames at a frame rate of 30fps. The data is stored in parquet format, featuring actions (6 joint positions: shoulder pan, shoulder lift, elbow flex, wrist flex, wrist roll, gripper), observation images (from three cameras: camera1 and camera2 at 1280x720 resolution, camera3 at 640x480, all RGB videos), observation states (6 joint positions), episode index, frame index, task index, and timestamps. The dataset is tailored for the so_follower robot type, with video files encoded in AV1, total video size of 200MB, and data file size of 100MB.

提供机构:
saipuneethgottam
搜集汇总
数据集介绍
saipuneethgottam/pickplace_134cam_newdemos_20260526_161032_remapped 数据集图片
构建方式
该数据集依托LeRobot框架构建,面向机器人操作任务中的抓取与放置场景,通过SO-Follower机械臂平台采集多视角演示数据。采集过程中,系统以30帧每秒的频率同步记录三路摄像头视频流以及六自由度关节位置与夹爪状态,形成动作-观测对的时序序列。原始数据经重映射处理后,统一整合为Parquet文件与视频文件,并按照分块索引方式组织存储,最终形成包含100个回合、总计53178帧的标准化数据集。
特点
数据集的核心特征体现在多模态同步与精细动作标注方面。其涵盖三路视觉观测,其中两路为1280×720高分辨率视频,另一路为640×480视频,能够提供丰富的空间视角信息;状态与动作空间均以六维浮点向量表示,涵盖肩部旋转、肩部抬升、肘部弯曲、腕部弯曲、腕部旋转及夹爪开合等关节位置。所有视频采用AV1编码,帧率为30,兼顾存储效率与解码性能。数据以分块Parquet格式存储,便于大规模并行读取与训练。
使用方法
使用者可通过HuggingFace平台提供的可视化工具在线浏览数据集内容,亦可借助LeRobot库直接加载Parquet数据文件与对应视频流。典型使用流程包括读取meta/info.json获取数据结构与分片信息,再依据data_path与video_path模板定位具体文件,进而构建模仿学习或强化学习训练管道。数据集以训练集形式提供,索引范围为0至100,可直接用于机器人操作策略的学习与评估,无需额外标注。
背景与挑战
背景概述
机器人操作技能学习长期依赖真实世界演示数据,而高质量、多视角、可复现的数据集稀缺。pickplace_134cam_newdemos_20260526_161032_remapped数据集于2026年5月26日构建,采用LeRobot框架,以SO-100 follower机械臂为平台,采集了100条抓取放置任务的演示轨迹,累计53178帧,帧率30Hz,同步记录三路摄像头视频(两路1280×720,一路640×480)及六维关节位置与动作。该数据集聚焦视觉-动作映射的模仿学习,为视觉运动策略研究提供了标准化基准,推动了机器人操作领域的数据驱动方法发展。
当前挑战
该数据集所应对的核心领域难题在于:机器人抓取放置任务要求策略在非结构化环境中实现精确的物体定位、抓取与放置,而多视角视觉输入与高维动作空间的耦合加剧了学习难度。构建过程中亦面临多重挑战:三路摄像头时空同步与标定需保证视觉观测与关节状态在30Hz下严格对齐;演示数据需覆盖多样物体位姿与放置目标以提升泛化性;视频编码采用AV1格式需在压缩率与解码质量间权衡;此外,动作空间仅包含六自由度关节位置,未涉及力控或触觉信息,限制了策略对接触丰富场景的适应能力。
常用场景
经典使用场景
在机器人学习与具身智能研究领域,抓取与放置任务长期被视为检验操作策略泛化能力的基准命题。该数据集依托LeRobot框架构建,通过SO跟随者机械臂与三路视觉传感器同步采集100条演示轨迹、逾五万帧图像与状态-动作对,构成典型的视觉-语言-动作模仿学习语料。其最经典的使用场景在于训练端到端的视觉运动策略,使智能体能够从多视角观测中提炼空间表征,并将六自由度关节位置指令映射为连贯的抓放动作序列,进而完成从原始像素到物理操作的闭环映射。
实际应用
在真实部署层面,该数据集可服务于仓储分拣、桌面整理与柔性产线上下料等需要精确抓放的操作场景。基于其训练的策略模型能够迁移至同构或近似构型的机械臂平台,配合视觉感知模块实现从物品识别到位姿调整的完整作业流程。对于中小规模自动化改造而言,此类演示数据可显著压缩示教编程成本,使操作技能以数据驱动方式快速注入,进而提升设备对物体位姿变化与轻度环境扰动的适应能力。
衍生相关工作
围绕该数据集,衍生工作主要沿两条脉络展开:其一是基于LeRobot生态的策略训练与评估脚本,推动模仿学习算法在标准化管线中的快速迭代;其二是多视角视觉表征学习与动作分块建模等方法的实证研究,借助三路相机数据检验时序建模与视角融合策略的有效性。这些工作共同拓展了抓放任务在数据规模、感知模态与算法架构上的边界,为该领域的后续基准构建与横向比较积累了可参照的实践范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务