遇见数据集

rdfeoma/pick-and-sort

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

--- license: apache-2.0 task_categories: - robotics tags: - LeRobot configs: - config_name: default data_files: data/*/*.parquet --- This dataset was created using [LeRobot](https://github.com/huggingface/lerobot). <a class="flex" href="https://huggingface.co/spaces/lerobot/visualize_dataset?path=rdfeoma/pick-and-sort"> <img class="block dark:hidden" src="https://huggingface.co/datasets/huggingface/badges/resolve/main/visualize-this-dataset-xl.svg"/> <img class="hidden dark:block" src="https://huggingface.co/datasets/huggingface/badges/resolve/main/visualize-this-dataset-xl-dark.svg"/> </a> ## Dataset Description - **Homepage:** [More Information Needed] - **Paper:** [More Information Needed] - **License:** apache-2.0 ## Dataset Structure [meta/info.json](meta/info.json): ```json { "codebase_version": "v3.0", "robot_type": "so_follower", "total_episodes": 50, "total_frames": 38090, "total_tasks": 1, "chunks_size": 1000, "data_files_size_in_mb": 100, "video_files_size_in_mb": 200, "fps": 30, "splits": { "train": "0:50" }, "data_path": "data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet", "video_path": "videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4", "features": { "action": { "dtype": "float32", "names": [ "shoulder_pan.pos", "shoulder_lift.pos", "elbow_flex.pos", "wrist_flex.pos", "wrist_roll.pos", "gripper.pos" ], "shape": [ 6 ] }, "observation.state": { "dtype": "float32", "names": [ "shoulder_pan.pos", "shoulder_lift.pos", "elbow_flex.pos", "wrist_flex.pos", "wrist_roll.pos", "gripper.pos" ], "shape": [ 6 ] }, "observation.images.wrist": { "dtype": "video", "shape": [ 480, 640, 3 ], "names": [ "height", "width", "channels" ], "info": { "video.height": 480, "video.width": 640, "video.codec": "av1", "video.pix_fmt": "yuv420p", "video.is_depth_map": false, "video.fps": 30, "video.channels": 3, "has_audio": false } }, "observation.images.context": { "dtype": "video", "shape": [ 480, 640, 3 ], "names": [ "height", "width", "channels" ], "info": { "video.height": 480, "video.width": 640, "video.codec": "av1", "video.pix_fmt": "yuv420p", "video.is_depth_map": false, "video.fps": 30, "video.channels": 3, "has_audio": false } }, "timestamp": { "dtype": "float32", "shape": [ 1 ], "names": null }, "frame_index": { "dtype": "int64", "shape": [ 1 ], "names": null }, "episode_index": { "dtype": "int64", "shape": [ 1 ], "names": null }, "index": { "dtype": "int64", "shape": [ 1 ], "names": null }, "task_index": { "dtype": "int64", "shape": [ 1 ], "names": null } } } ``` ## Citation **BibTeX:** ```bibtex [More Information Needed] ```

This dataset was created using LeRobot and is a robotics dataset focused on robot manipulation tasks. It contains 50 episodes, totaling 38090 frames, with 1 task. The data is stored in parquet format, and videos are in mp4 format with a frame rate of 30fps. Features include actions (6-dimensional joint positions such as shoulder pan, shoulder lift, elbow flex, wrist flex, wrist roll, and gripper positions), observation states (same joint positions), wrist camera images (480x640 RGB video), and context camera images (480x640 RGB video), along with metadata such as timestamps, frame indices, and episode indices. The robot type is so_follower. The dataset is suitable for research in robot control, imitation learning, or reinforcement learning.

提供机构:
rdfeoma
搜集汇总
数据集介绍
rdfeoma/pick-and-sort 数据集图片
构建方式
在机器人学习领域,高质量的操作数据集是训练模仿学习与强化学习策略的基础。该数据集依托LeRobot框架构建,采集自so_follower型机械臂在标准化任务场景下的操作轨迹。整个采集过程涵盖50个独立回合,累计38090帧,以30帧每秒的频率同步记录关节动作与视觉观测。底层数据以Parquet格式列式存储,视频文件采用AV1编码压缩为MP4,并借助meta/info.json统一声明数据划分、路径模板及特征模式,从而保证数据集结构的一致性与可复现性。
特点
该数据集面向机器人抓取与分拣任务,具备多模态、高时序对齐的特点。观测空间融合本体状态与视觉信息:六维关节位置向量涵盖肩部、肘部、腕部及夹爪,同时提供腕部与上下文两路480×640分辨率的视频流,形成互补视角。全部50个回合共享单一任务索引,动作与观测维度严格对应,时间戳与帧序号逐帧对齐。数据集划分为训练集,整体规模适中,适合作为算法验证与快速原型开发的基准资源。
使用方法
该数据集通过LeRobot工具链进行加载与解析。用户可依据meta/info.json中定义的数据路径与视频路径模板,利用Parquet读取接口获取动作、状态及索引字段,并借助视频解码库按时间戳对齐视觉帧。HuggingFace平台提供了可视化空间,便于直观回放操作轨迹并检查数据质量。在模型训练阶段,可将动作序列作为监督信号,将双路视频与状态向量作为输入,用于模仿学习或视觉-动作联合建模。使用时需遵循Apache-2.0许可协议。
背景与挑战
背景概述
机器人操作领域长期依赖真实世界交互数据来训练策略,而高质量、标准化的开源数据集稀缺。pick-and-sort数据集于2024年前后由LeRobot社区贡献者rdfeoma创建,基于HuggingFace的LeRobot框架构建,采用so_follower机械臂,包含50个回合、38090帧、单一任务(抓取与分拣)的演示数据。该数据集核心研究问题在于提供可复现的机器人抓取与分拣操作示范,推动模仿学习与视觉-动作策略的发展。作为LeRobot生态的一部分,它降低了机器人学习研究的门槛,促进了社区基准测试与算法比较。
当前挑战
该数据集所解决的领域问题是机器人抓取与分拣任务中的视觉运动控制,要求策略在非结构化环境中识别目标、规划抓取轨迹并完成分类放置。构建过程中面临多重挑战:真实机器人操作数据采集需保证动作一致性与时序同步,视频与状态信号的精确对齐对硬件与软件同步提出高要求;仅50个回合、单一任务的数据规模限制了策略的泛化能力,易导致过拟合;此外,任务多样性不足,缺乏不同物体、光照与布局的变化,难以评估模型在现实扰动下的鲁棒性。
常用场景
经典使用场景
在机器人学习与具身智能研究领域,pick-and-sort数据集凭借其精确的机械臂关节状态与多视角视觉观测的同步记录,成为训练视觉-动作映射策略的经典资源。该数据集通过so_follower机械臂采集了50个演示回合、共38090帧操作序列,涵盖夹爪位姿与腕部、环境两路视频流,使研究者能够构建端到端的抓取与分类放置模型。其高频30fps采样与规范化的parquet存储格式,为模仿学习与行为克隆实验提供了标准化的多模态输入,尤其适用于训练机械臂在非结构化环境中完成物品分拣的连续控制任务。
衍生相关工作
依托pick-and-sort数据集及其LeRobot生态,研究者已衍生出多项经典工作,涵盖基于扩散策略的轨迹生成、视觉-语言-动作模型的条件控制以及自监督预训练表征在操作任务中的迁移。该数据集常被用作策略评估的基准之一,催生了针对机械臂抓放的对比实验与消融研究,并启发了多任务学习框架在单一抓取数据集上的扩展。相关衍生物包括改进的模仿学习算法、数据增强流程以及跨具身迁移方法的验证,持续推动着开放源代码机器人学习工具链的发展。
数据集最近研究
最新研究方向
在机器人学习领域,抓取与分拣任务长期被视为检验感知-决策-控制闭环能力的试金石。依托LeRobot框架构建的pick-and-sort数据集,以50条演示轨迹、约3.8万帧、30fps的SO-100 follower机械臂多模态记录,涵盖关节位置、腕部与场景双视角视频,为模仿学习与视觉-语言-动作模型提供了贴近真实操作的高质量语料。当前前沿研究聚焦于利用此类低成本开源数据开展跨本体策略迁移、动作分块Transformer的时序建模以及基于扩散策略的鲁棒抓取生成,并探索在数据稀缺条件下借助预训练视觉表征提升样本效率。该数据集回应了社区对可复现、标准化机器人操作基准的迫切需求,其Apache-2.0许可与LeRobot生态的兼容性,有力推动了开放机器人学习从仿真走向真实场景的进程,对加速通用操作策略的迭代具有切实的支撑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务