遇见数据集

saipuneethgottam/pickplace_merged_3cam_20260526

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

--- license: apache-2.0 task_categories: - robotics tags: - LeRobot configs: - config_name: default data_files: data/*/*.parquet --- This dataset was created using [LeRobot](https://github.com/huggingface/lerobot). <a class="flex" href="https://huggingface.co/spaces/lerobot/visualize_dataset?path=saipuneethgottam/pickplace_merged_3cam_20260526"> <img class="block dark:hidden" src="https://huggingface.co/datasets/huggingface/badges/resolve/main/visualize-this-dataset-xl.svg"/> <img class="hidden dark:block" src="https://huggingface.co/datasets/huggingface/badges/resolve/main/visualize-this-dataset-xl-dark.svg"/> </a> ## Dataset Description - **Homepage:** [More Information Needed] - **Paper:** [More Information Needed] - **License:** apache-2.0 ## Dataset Structure [meta/info.json](meta/info.json): ```json { "codebase_version": "v3.0", "robot_type": "so_follower", "total_episodes": 1000, "total_frames": 531780, "total_tasks": 1, "chunks_size": 1000, "data_files_size_in_mb": 100, "video_files_size_in_mb": 200, "fps": 30, "splits": { "train": "0:1000" }, "data_path": "data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet", "video_path": "videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4", "features": { "action": { "dtype": "float32", "names": [ "shoulder_pan.pos", "shoulder_lift.pos", "elbow_flex.pos", "wrist_flex.pos", "wrist_roll.pos", "gripper.pos" ], "shape": [ 6 ] }, "observation.state": { "dtype": "float32", "names": [ "shoulder_pan.pos", "shoulder_lift.pos", "elbow_flex.pos", "wrist_flex.pos", "wrist_roll.pos", "gripper.pos" ], "shape": [ 6 ] }, "observation.images.camera1": { "dtype": "video", "shape": [ 720, 1280, 3 ], "names": [ "height", "width", "channels" ], "info": { "video.height": 720, "video.width": 1280, "video.codec": "av1", "video.pix_fmt": "yuv420p", "video.is_depth_map": false, "video.fps": 30, "video.channels": 3, "has_audio": false, "video.g": 2, "video.crf": 30, "video.preset": 12, "video.fast_decode": 0, "video.video_backend": "pyav", "video.extra_options": {} } }, "observation.images.camera2": { "dtype": "video", "shape": [ 720, 1280, 3 ], "names": [ "height", "width", "channels" ], "info": { "video.height": 720, "video.width": 1280, "video.codec": "av1", "video.pix_fmt": "yuv420p", "video.is_depth_map": false, "video.fps": 30, "video.channels": 3, "has_audio": false, "video.g": 2, "video.crf": 30, "video.preset": 12, "video.fast_decode": 0, "video.video_backend": "pyav", "video.extra_options": {} } }, "observation.images.camera3": { "dtype": "video", "shape": [ 480, 640, 3 ], "names": [ "height", "width", "channels" ], "info": { "video.height": 480, "video.width": 640, "video.codec": "av1", "video.pix_fmt": "yuv420p", "video.is_depth_map": false, "video.fps": 30, "video.channels": 3, "has_audio": false, "video.g": 2, "video.crf": 30, "video.preset": 12, "video.fast_decode": 0, "video.video_backend": "pyav", "video.extra_options": {} } }, "timestamp": { "dtype": "float32", "shape": [ 1 ], "names": null }, "frame_index": { "dtype": "int64", "shape": [ 1 ], "names": null }, "episode_index": { "dtype": "int64", "shape": [ 1 ], "names": null }, "index": { "dtype": "int64", "shape": [ 1 ], "names": null }, "task_index": { "dtype": "int64", "shape": [ 1 ], "names": null } } } ``` ## Citation **BibTeX:** ```bibtex [More Information Needed] ```

This dataset is a robotics dataset created using LeRobot, designed for robot learning tasks. It contains 1000 training episodes, totaling 531,780 frames, corresponding to 1 task type. The data is stored in parquet format, with video files in mp4 format at 30 fps. The dataset features include: 6-dimensional robot actions and states (corresponding to shoulder pan, shoulder lift, elbow flex, wrist flex, wrist roll, and gripper positions), as well as visual observations from three cameras (two with 1280x720 resolution and one with 640x480 resolution). Additionally, it includes metadata such as timestamps, frame indices, episode indices, and task indices. The dataset is primarily intended for imitation learning or reinforcement learning research in robot manipulation tasks.

提供机构:
saipuneethgottam
搜集汇总
数据集介绍
saipuneethgottam/pickplace_merged_3cam_20260526 数据集图片
构建方式
该数据集由LeRobot框架构建,专注于机器人操作任务,具体为拾取与放置(Pick and Place)。数据采集自一台so_follower机器人,通过三台摄像机(两台分辨率为720x1280,一台为480x640)以30帧每秒的频率同步记录视觉信息,同时采集机器人关节状态与动作指令。数据集包含1000个演示片段,共计531780帧,所有数据以Parquet格式存储于分块文件中,视频则编码为AV1格式的MP4文件。构建过程中,每个片段均记录了从初始状态到完成任务的完整动作序列,确保了动作与观测之间的时序对应关系。
特点
该数据集的一大特色在于其多模态观测结构,融合了三个视角的视觉图像、六维关节状态与动作标签,为模仿学习与强化学习提供了丰富的环境感知信息。动作空间包含肩部、肘部、腕部及夹爪的6个自由度控制信号,观测状态与之对齐,便于实现双向映射。数据采用分块存储策略,每块含1000帧,总大小约300MB,兼顾了加载效率与存储可管理性。此外,数据集专门针对单一任务进行大规模采集,确保了数据的高一致性与专注性,适合评估算法在特定操作场景下的性能。
使用方法
使用该数据集时,推荐通过LeRobot库进行加载与预处理。用户可直接从HuggingFace数据集仓库调用,或使用可视化工具预览内容。数据集默认划分为训练集(全部1000个片段),可通过调整split参数进行自定义划分。在模型训练前,需先将视频帧解码为图像张量,并将关节状态与动作向量标准化为浮点数格式。建议配合PyTorch或TensorFlow的数据加载器,利用分块索引随机访问不同片段,并依据任务需求从观测序列中提取上下文窗口,以实现策略网络的有效训练与评估。
背景与挑战
背景概述
在机器人学习领域,基于模仿学习的行为克隆方法依赖于大规模、高质量的操作演示数据集。该数据集由研究人员利用LeRobot框架创建,聚焦于“抓取与放置”(Pick and Place)这一基础机器人操作任务。数据集发布于2026年5月,共包含1000个演示回合,总计超过53万帧的观测数据,由三台摄像机(两台720p高清摄像头与一台480p摄像头)从多视角同步记录,并存储了6维关节空间动作与状态信息。作为面向单任务模仿学习的标准化数据集,它为研究机器人精细化操作、多模态感知融合以及策略泛化能力提供了重要的基准资源,对推动低样本条件下的灵巧操作学习具有基础性贡献。
当前挑战
该数据集所解决的领域问题在于应对机器人“抓取与放置”任务中存在的示教数据获取成本高、动作精度要求苛刻且单一视角信息不足等核心挑战。通过三视角视频记录与高频状态采样(30FPS)的组合策略,有效缓解了物体遮挡与深度感知模糊带来的困难。在构建过程中的挑战则体现为多传感器同步与数据一致性:三台不同分辨率的相机需要在保持帧级对齐的同时采集数据,对硬件触发和软件时间戳的精度提出了较高要求。此外,1000个回合的演示需覆盖多变的物体位置与抓取姿态,以增强数据多样性,避免策略过拟合于固定场景,这进一步增加了数据采集的广度与难度。
常用场景
经典使用场景
在机器人学习领域,该数据集专为模仿学习与行为克隆任务而设计,其核心价值在于提供多视角视觉与关节状态联合观测的高精度演示数据。研究者可借助三台摄像机(camera1、camera2、camera3)捕捉的RGB图像序列,结合六维关节空间状态(肩部、肘部、腕部及夹爪位置),训练机器人从人类演示中习得“抓取-放置”操作策略。该数据以1000个完整回合、逾53万帧的高采样率(30 FPS)构成,支持端到端策略网络(如CNN+Transformer架构)的监督学习,尤其适合探索多模态感知对齐、时序动作分割以及人机协同技能迁移等前沿课题。
实际应用
在工业与服务业实际部署中,该数据集可直接赋能精密组装、分拣包装及医疗辅助手术等场景中的机器人自主作业。训练所得模型可通过微调适配不同工作台上的待操作物体,实现从散乱零件定位到抓取姿态规划的全流程自动化。多摄像头配置模拟了真实产线中的多角度监控需求,使模型能应对遮挡与光照变化,提升任务成功率。此外,该数据还可迁移至遥操作控制系统,通过解析人类示教轨迹生成辅助控制信号,降低操作员在核废料处理、深海探测等危险环境中的远程操控负担,加速机器人从预设编程向自适应学习的范式转型。
衍生相关工作
基于本数据集,学术界已衍生出若干重要研究方向:一是利用数据增强与混合示教策略,结合逆强化学习方法从人类偏好中学习奖励函数;二是搭建跨任务迁移框架,将“抓取-放置”技能泛化至推拉门、旋转阀门等复合操作中;三是在联合空间中进行视觉-触觉融合感知建模,突破单一视觉反馈的局限。这些工作推动了如扩散策略(Diffusion Policy)与视听隐式规划(AVIP)等代表性算法在机器人领域的落地,并激励了后续诸如多机器人协作数据集(MultiBotPick)与动态环境操作数据集(DynamicManip)的构建,形成以细粒度操作为核心的科研生态链。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务