遇见数据集

saipuneethgottam/pickplace_356cam_newdemos_20260526_161032_remapped

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个机器人学数据集,专门用于拾取和放置任务。它包含100个训练片段,总计53178帧数据,帧率为30 fps。数据特征包括机器人的动作(如肩部平移、肩部提升、肘部弯曲、手腕弯曲、手腕旋转和夹爪位置)和观察状态(与动作相同的6个关节位置)。观察数据还包括来自三个摄像头的图像:camera1和camera2提供720x1280分辨率的RGB视频,camera3提供480x640分辨率的RGB视频。数据集使用Apache 2.0许可证,基于LeRobot平台创建,适用于机器人控制和视觉导航研究。

This is a robotics dataset specifically designed for pick-and-place tasks. It contains 100 training segments, totaling 53178 frames with a frame rate of 30 fps. The data features include robot actions (such as shoulder pan, shoulder lift, elbow bend, wrist bend, wrist rotation and gripper position) and observation states (the same 6 joint positions as the actions). The observation data also includes images from three cameras: camera1 and camera2 provide RGB videos with a resolution of 720x1280, while camera3 provides RGB videos with a resolution of 480x640. This dataset is licensed under Apache 2.0, developed based on the LeRobot platform, and is suitable for research in robotic control and visual navigation.

提供机构:
saipuneethgottam
搜集汇总
数据集介绍
saipuneethgottam/pickplace_356cam_newdemos_20260526_161032_remapped 数据集图片
构建方式
在机器人学习领域,高质量的真实世界操作数据集是推动策略泛化能力提升的关键基础。该数据集依托LeRobot框架构建,采用SO-100系列中的so_follower机械臂作为数据采集平台,通过遥操作或预设策略执行拾取与放置任务,并以30Hz的频率同步记录多路视觉观测与本体感知状态。采集过程涵盖100个完整回合,累计生成53178帧时序数据,每一帧均包含六维关节位置指令与对应状态向量。原始数据经remapped流程进行指针对齐与格式规整后,以Parquet列式存储按分块方式组织,视频流则采用AV1编码独立保存,最终形成结构统一、可直接用于模仿学习训练的操作数据集。
特点
该数据集在感知维度上呈现出显著的多视角冗余特性,三路摄像头分别以1280×720与640×480分辨率采集场景信息,为空间理解与遮挡推理提供了丰富的视觉线索。动作空间定义了肩部旋转、肩部升降、肘部弯曲、腕部弯曲、腕部旋转及夹爪开合六个自由度,与观察状态严格对应,保证状态-动作空间的一致性。数据以回合为基本单元,单任务设定简化了任务分布,使模型能够专注于精细操作技能的学习。视频采用AV1编码与分块存储策略,在压缩效率与解码灵活性之间取得平衡,适宜于大规模时序建模。
使用方法
研究者可通过LeRobot官方提供的可视化工具在线浏览该数据集,直观检视各回合的动作轨迹与视觉帧序列。加载时需依据meta/info.json中定义的路径模板解析data与videos目录下的分块文件,利用Parquet读取库与视频解码后端分别提取状态动作向量和图像帧。数据集默认划分为训练集,包含全部100个回合,可直接用于行为克隆、扩散策略或视觉-语言-动作模型的训练与评估。使用中需注意各特征字段的dtype与shape约定,确保时间戳对齐与帧率一致性,以充分发挥多相机观测与本体感知融合的潜力。
背景与挑战
背景概述
在具身智能与机器人学习领域,高质量的真实世界演示数据是驱动策略泛化与技能迁移的基石。该数据集基于LeRobot框架构建,遵循Apache-2.0许可协议,聚焦于抓取与放置这一基础而关键的机器人操作任务。数据集由SO follower机械臂采集,包含100条演示轨迹、53,178帧同步记录,涵盖三路视觉观测(两路1280×720与一路640×480视频流)及六维关节位置状态与动作。其核心研究问题在于为视觉-动作映射提供多视角、时序对齐的监督信号,以支撑模仿学习与端到端策略训练。该数据集通过统一的数据格式与可复现的采集流程,对机器人操作基准的标准化与社区协作具有积极推动作用。
当前挑战
抓取与放置任务的挑战在于物体位姿的多样性与接触动力学的高度非线性,策略需在视觉遮挡、光照变化与机械臂运动学约束下实现稳定抓取与精准放置。构建过程面临多路摄像头时空同步与标定的难题,三路视频流须在30帧率下严格对齐,同时六维关节位置与动作需与视觉帧逐帧匹配,数据采集中的硬件抖动、标定漂移与编码压缩损失均可能引入噪声。数据集仅含单一任务与100条演示,任务多样性与环境泛化性有限,如何在小样本条件下提升策略的跨场景迁移能力,以及如何验证remapped处理后动作空间与视觉观测的一致性,仍是亟待探索的关键问题。
常用场景
经典使用场景
在机器人模仿学习与灵巧操作研究领域中,该数据集凭借三路同步摄像头(两路1280×720高分辨率主视角与一路640×480辅助视角)所采集的丰富视觉信息,以及包含肩部旋转、肩部抬升、肘部弯曲、腕部弯曲、腕部旋转与夹爪开合六维关节位置的动作标注,为视觉-动作联合建模提供了典型的多模态示范数据,其最经典的使用场景在于训练端到端的视觉运动策略,使机械臂能够在拾取-放置任务中依据多视角观测直接回归连续动作序列。数据集涵盖100条演示轨迹、总计53178帧、以30帧每秒的频率记录,并依托LeRobot框架统一组织为Parquet与视频文件格式,便于研究者直接开展行为克隆与策略评估实验。
实际应用
在实际应用层面,该数据集可直接服务于桌面级机械臂的自动化拾取与放置作业,例如在仓储分拣、实验室样品搬运及轻工业装配等场景中,利用其训练的策略模型能够驱动机器人依据实时视觉输入完成目标物体的抓取与定点放置。三路摄像头配置尤其适合处理目标被机械臂自身遮挡或工作空间存在视觉盲区的情形,六维关节位置标注则为底层关节空间控制器提供了精确的监督信号。借助LeRobot生态中的可视化与训练工具,工程人员可以快速在该数据集上验证算法原型,进而迁移至真实产线中进行小样本微调,缩短从研究到部署的周期。
衍生相关工作
围绕该数据集,衍生工作主要集中于基于LeRobot框架的行为克隆策略复现与改进,包括扩散策略、动作分块变压器等序列建模方法在拾取-放置任务上的对比研究,以及多视角视觉编码器的融合机制探索。相关研究还涉及利用该数据集进行视频自监督预训练以提升样本效率,以及针对关节位置动作空间设计平滑正则化与动作约束的优化工作。这些衍生的经典工作共同丰富了真实机器人示范数据的利用范式,并为后续数据集在任务多样性扩展与跨本体迁移方面的迭代提供了参照。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务