遇见数据集

saipuneethgottam/pickplace_135cam_newdemos_20260526_161032_remapped

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个用于机器人技术的数据集,专门针对抓取放置任务(pickplace),由LeRobot创建。数据集包含100个episodes,总帧数为53178,帧率为30fps。数据特征包括机器人的动作(如肩部、肘部、腕部和抓手的位姿)、观察图像(来自三个摄像头,分辨率分别为1280x720、1280x720和640x480,均为RGB视频)、观察状态(机器人的关节位姿),以及episode索引、帧索引、任务索引和时间戳。机器人类型为so_follower,数据以parquet格式存储,视频以mp4格式存储。数据集适用于机器人学习任务,如模仿学习或强化学习。

This dataset is a robotics dataset specifically designed for pick-and-place tasks, created using LeRobot. It contains 100 episodes with a total of 53,178 frames at a frame rate of 30fps. The features include robot actions (such as positions for shoulder, elbow, wrist, and gripper), observation images (from three cameras with resolutions of 1280x720, 1280x720, and 640x480, all in RGB video format), observation states (robot joint positions), along with episode index, frame index, task index, and timestamp. The robot type is so_follower, and the data is stored in parquet format with videos in mp4 format. The dataset is suitable for robotics learning tasks, such as imitation learning or reinforcement learning.

提供机构:
saipuneethgottam
搜集汇总
数据集介绍
saipuneethgottam/pickplace_135cam_newdemos_20260526_161032_remapped 数据集图片
构建方式
该数据集依托LeRobot框架构建,采用遥操作方式采集机器人执行抓取与放置任务的演示数据。采集过程中,操作者通过主从控制策略驱动so_follower机械臂完成预定动作序列,同步记录六维关节位置、夹爪开合状态以及三路同步视频流。原始数据经remapped处理流程进行时间戳对齐与命名规范映射,最终以分块Parquet与MP4文件形式组织,形成包含100个回合、53178帧的标准化机器人学习数据集。
特点
数据集以多模态同步采集为核心特征,融合本体感知状态与视觉观测,涵盖两个1280×720高清视角及一个640×480辅助视角,帧率统一为30帧/秒。状态与动作空间均为六自由度,包括肩部旋转、肩部抬升、肘部弯曲、腕部弯曲、腕部旋转及夹爪位置,任务类型单一且标注明确。数据以分块方式存储,每块包含1000个索引单元,兼顾存储效率与读取便利性,适用于模仿学习与视觉运动策略研究。
使用方法
使用者可借助LeRobot提供的可视化空间在线浏览数据集内容,直观检验视频与状态序列的对应关系。本地使用时,可通过PyTorch等框架读取Parquet文件中的状态与动作张量,并利用PyAV解码对应视频流,实现多模态输入的同步加载。数据按时间戳对齐,支持按回合或按帧索引进行采样,便于构建行为克隆、扩散策略或视觉语言动作模型的训练与评估流程。
背景与挑战
背景概述
机器人操作技能的学习与泛化是具身智能领域的核心议题,而高质量示范数据的稀缺长期制约着该方向的发展。pickplace_135cam_newdemos_20260526_161032_remapped数据集依托LeRobot框架构建,采集自so_follower机械臂,涵盖100个回合、逾五万帧的多视角操作示范,旨在为抓取放置任务提供标准化的模仿学习资源。该数据集以三路摄像头同步记录机械臂的关节位姿与视觉观测,通过统一的数据格式与任务标注降低了算法复现与横向比较的门槛,对推动机器人操作策略的端到端学习具有基础性支撑作用。
当前挑战
抓取放置任务本身要求智能体在杂乱或动态环境中完成目标识别、抓取位姿估计与精准放置,其难点在于视觉遮挡、物体位姿不确定性以及长时序动作的误差累积。构建此类数据集面临多重挑战:多相机时序同步与标定误差会引入观测噪声,示范者的操作风格差异导致动作分布不一致,不同光照与背景条件下视觉特征的域偏移亦难以避免。此外,该数据集仅含单一任务类型,任务多样性与场景泛化能力有限,如何在有限示范下实现跨物体、跨环境的策略迁移,仍是亟待解决的开放性难题。
常用场景
经典使用场景
在机器人操作学习领域,基于视觉的抓取与放置任务一直是检验模仿学习算法性能的经典基准。该数据集通过三路摄像头(camera1、camera2、camera3)同步采集720p与480p分辨率的视觉观测,配合六自由度机械臂的关节位置与夹爪状态,构建了端到端的视觉-动作映射范例。研究者常利用其进行行为克隆训练,让机械臂从演示中学习将目标物体从初始位置精准搬运至指定区域,这一场景构成了机器人模仿学习最基础且最核心的评估任务。
实际应用
在实际应用层面,该数据集可服务于仓储物流中的货品分拣、家庭服务机器人的物品整理以及工业装配线上的零件取放等场景。其采集的机械臂类型与动作空间契合常见的协作机器人平台,开发者能够借助该数据快速构建抓取放置原型系统,降低真实环境部署的试错成本,提升自动化作业的柔性与智能化水平。
衍生相关工作
以该数据集为基石,衍生了一系列围绕视觉-语言-动作模型、扩散策略以及Transformer架构的经典工作。研究者在此基础上探索了多任务学习、动态环境适应以及长时序规划等方向,并催生了针对三摄像头融合策略的改进算法。这些工作进一步丰富了LeRobot生态,为机器人学习社区提供了宝贵的训练资源与评测标准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务