遇见数据集

YuBin103/Pick_and_place_blue_box

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个机器人操作数据集,通过LeRobot创建,包含20个episodes和8718帧数据,帧率为30fps。数据特征包括机器人的动作(如肩部、肘部、腕部和夹爪的位置)、观测状态(与动作相同的位置信息)、以及来自顶部和手腕视角的图像观测(分辨率为480x640,3通道彩色视频)。数据集还包含时间戳、帧索引、episode索引、任务索引等元数据。数据以parquet格式存储,总数据文件大小为100MB,视频文件大小为200MB,使用Apache 2.0许可证。数据集适用于机器人学习和控制任务,如拾取和放置操作。

This dataset is a robotics manipulation dataset created using LeRobot, containing 20 episodes and 8718 frames at a frame rate of 30 fps. The features include robot actions (e.g., positions of shoulder, elbow, wrist, and gripper), observation states (same position information as actions), and image observations from top and wrist perspectives (with a resolution of 480x640, 3-channel color video). The dataset also includes metadata such as timestamps, frame indices, episode indices, and task indices. Data is stored in parquet format, with a total data file size of 100MB and video file size of 200MB, licensed under Apache 2.0. It is suitable for robotics learning and control tasks, such as pick-and-place operations.

提供机构:
YuBin103
搜集汇总
数据集介绍
YuBin103/Pick_and_place_blue_box 数据集图片
构建方式
该数据集基于LeRobot框架采集,聚焦于机器人抓取与放置蓝色方块的精细操作任务。数据来自so_follower机器人平台,包含20个示范片段(episodes),总计8718帧数据,以每秒30帧的速率记录。构建过程中,每个片段均同步采集了机器人六个关节的位置指令(action)与状态观测(observation.state),同时经由顶部和腕部两个视角的摄像头捕获了分辨率为480×640的RGB视频流,编码格式为AV1,确保了视觉与运动信息的时空对齐。
特点
数据集的核心特色在于其多模态融合与精细化标注。它同时提供了低维的关节空间控制信号(6维动作向量)和高维的视觉观测,便于直接训练端到端的模仿学习模型。视觉信息涵盖顶视与腕部视角,提供了从全局场景到局部操作点的双重观察维度,增强了模型对空间关系的理解。此外,数据集明确区分了2种任务类型(task_index),并按照8:2的比例划分了训练与验证集,总计约100MB的数据文件和200MB的视频文件,结构清晰,便于复用。
使用方法
数据集设计兼容LeRobot生态,用户可通过HuggingFace的`datasets`库或LeRobot的专用可视化工具直接加载与浏览。建议使用者首先利用`datasets.load_dataset`方法加载parquet格式的结构化数据,其中包含了动作、状态、时间戳及帧索引等关键字段。对于视觉部分,可依据`observation.images.top`和`observation.images.wrist`路径下的MP4视频文件,结合LeRobot的`VideoFrame`解码器进行逐帧提取。典型应用场景包括基于行为克隆(BC)或扩散策略(Diffusion Policy)的机器人操作技能学习。
背景与挑战
背景概述
在机器人操控领域,模仿学习依赖高质量的专家演示数据集以习得泛化策略。Pick_and_place_blue_box数据集由Hugging Face LeRobot平台创建,聚焦于机械臂对蓝色箱体的拾取与放置任务,核心研究问题在于如何通过多模态感知(包括顶部与腕部摄像头视觉流及关节状态序列)驱动灵巧操作。该数据集以30帧每秒的采样率记录20个演示片段,共计8718帧,涵盖6维关节动作空间(肩部、肘部、腕部及夹爪),为端到端机器人策略学习提供了标准化基准。其采用Apache-2.0许可发布,降低了学术与工业界的复现门槛,推动了具身智能领域从仿真到真实场景的迁移研究。
当前挑战
该数据集所解决的领域挑战在于:机器人精细操作任务中,如何从高维视觉与低维运动数据的异质模态中提取一致的操控策略,尤其需应对目标物体(蓝色箱体)在不同光照与背景下的视觉鲁棒性。构建过程中面临三重挑战:首先,20个演示的有限规模难以覆盖复杂装配环境的多样化情形,可能诱发策略过拟合;其次,SO_Follower机械臂的6自由度控制需在夹爪精准力控与腕部运动学约束间权衡;最后,AV1压缩编码的视觉数据在30帧每秒高保真要求下,需平衡存储效率(200 MB视频文件)与输入质量,以防策略学习中的时序信息退化。
常用场景
经典使用场景
在机器人操作与模仿学习的前沿探索中,Pick_and_place_blue_box数据集为学习精细抓取与放置行为提供了标准化的高保真轨迹资源。该数据集聚焦于机械臂对蓝色方块的拾取与归位任务,包含来自so_follower机器人的8478帧动作与状态观测数据,以30Hz的频率同步记录了六自由度关节状态、末端夹爪位置以及顶置与腕部高清视觉信息。其核心用途是训练基于视觉与状态反馈的端到端策略模型,使机器人能够从多视角图像中理解目标物体位置,并生成精准的抓取与放置动作序列。借助LeRobot框架的统一格式,研究者可直接利用该数据集进行行为克隆、逆强化学习或离线强化学习算法的验证与对比,尤其适合作为低维度精细操作任务的基准测试平台。
实际应用
在实际应用层面,该数据集的设计与内容高度契合现代智能工厂与仓储物流的自动化需求。机械臂精准抓取与放置蓝色方块这一基础能力,可无缝迁移至流水线上对特定尺寸物料的分拣、组装或包装作业中。借助该数据集训练的策略,机器人能够借助顶部摄像头进行全局定位,同时利用腕部摄像头进行末端精细调整,从而在结构化或半结构化环境中实现低错误率的实时操作。此外,so_follower机器人的构型使该数据集特别适用于人机协作场景,如辅助工人从料箱中取放零件,或配合视觉引导系统在移动平台(如AGV)上完成动态抓取任务,展现了从实验室原型到工业部署的直接潜力。
衍生相关工作
围绕Pick_and_place_blue_box数据集,衍生出一系列推动机器人学习边界的经典工作。研究者依托该数据集验证了扩散策略在机器人动作生成中的卓越表现,通过将图像序列与状态噪声进行逆向扩散,实现了对抓取轨迹的平滑且多模态的预测。同时,它作为LeRobot生态系统中的标杆数据集,被广泛用于评测基于Transformer的时间序列动作模型,这类工作探索了如何利用自注意力机制捕捉长程关节状态依赖关系。另外,该数据集的简洁结构催生了关于隐式策略(如能量基模型)与显式策略融合的研究,以及基于视频预测的预训练-微调范式在机器人领域的有效性论证,这些成果共同丰富了机器人技能学习的理论工具箱。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务