遇见数据集

saipuneethgottam/pickplace_345cam_newdemos_20260526_161032_remapped

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个用于机器人操作任务的数据集,具体针对pickplace(拾放)任务。数据集包含从三个摄像头(camera1、camera2、camera3)采集的视频观察数据,分辨率分别为1280x720(camera1和camera2)和640x480(camera3),帧率为30fps,视频编码为av1。此外,数据集还包括机器人的动作数据(如肩部平移、肩部提升、肘部弯曲、腕部弯曲、腕部旋转和夹爪位置)和状态观察数据,均以浮点数组表示。数据集结构基于episodes和frames组织,总共有100个episodes,53,178帧,涉及一个任务。数据以parquet格式存储,总数据大小为100MB,视频文件大小为200MB。机器人类型为so_follower,适用于机器人学习和控制研究。

This dataset is designed for robotics manipulation tasks, specifically for pickplace tasks. It includes video observations from three cameras (camera1, camera2, camera3) with resolutions of 1280x720 (camera1 and camera2) and 640x480 (camera3), a frame rate of 30fps, and av1 video encoding. Additionally, the dataset contains robot action data (e.g., shoulder pan, shoulder lift, elbow flex, wrist flex, wrist roll, and gripper positions) and state observation data, both represented as float arrays. The dataset is organized by episodes and frames, with a total of 100 episodes, 53,178 frames, and one task. Data is stored in parquet format, with a total data size of 100MB and video file size of 200MB. The robot type is so_follower, making it suitable for robotics learning and control research.

提供机构:
saipuneethgottam
搜集汇总
数据集介绍
saipuneethgottam/pickplace_345cam_newdemos_20260526_161032_remapped 数据集图片
构建方式
该数据集依托LeRobot机器人学习框架构建,采用遥操作采集与重映射处理相结合的方式生成。采集过程中,操作者通过主从式机械臂系统完成抓取放置任务,同步记录多路摄像头视频流与本体感觉状态数据。原始示教数据经过时间对齐、帧率归一化及动作空间重映射等后处理步骤,最终以Parquet列式存储与AV1编码视频文件的形式组织,形成包含100个回合、53178帧的结构化数据集。
特点
数据集以多视角视觉观测与低维本体状态为核心特征,涵盖三路摄像头视频(两路1280×720、一路640×480),帧率统一为30Hz,并附带六自由度关节位置与夹爪开合量的动作标签。任务空间聚焦于单一抓取放置场景,回合划分明确,训练集覆盖全部100个回合。元信息以JSON格式完整记录了分块策略、文件路径模板及视频编码参数,便于大规模训练时进行流式读取与批处理。
使用方法
研究者可通过LeRobot官方提供的可视化工具在线浏览数据回放,亦可在本地加载Parquet文件与对应视频片段进行模型训练。数据按chunk-index与file-index分层组织,支持基于PyTorch或JAX的数据加载器按需读取。使用时应遵循Apache-2.0许可协议,引用时需参考数据集主页提供的引用信息。该数据集适用于模仿学习、视觉-运动策略学习及多模态表征学习等机器人操作任务的研究。
背景与挑战
背景概述
机器人操作技能的学习与泛化长期以来受制于高质量、多视角示范数据的稀缺。该数据集由LeRobot框架构建,聚焦于抓取-放置这一基础操作原语,采集自so_follower机械臂,包含100条示范轨迹、53178帧、三路视觉观测(两路1280×720与一路640×480)及六维关节位置与夹爪状态,采用Apache-2.0协议发布于HuggingFace平台。其核心研究问题在于为视觉-运动策略学习提供统一接口的多模态示范资源,以支撑模仿学习与策略评估。凭借LeRobot生态的标准化数据格式,该数据集对机器人学习领域的可复现研究具有基础性支撑作用。
当前挑战
抓取-放置任务本身需应对物体位姿变化、抓取点选择、避障与放置精度等复合难题,单任务示范难以覆盖真实场景的广泛分布。数据集构建过程中,三路相机的时间同步与标定一致性、异构视频分辨率带来的特征对齐困难、动作空间与视觉观测的时序对齐,以及演示轨迹在重映射后的物理一致性校验,均构成显著挑战。此外,仅含单一任务与有限示范数量,限制了策略向新物体、新布局的泛化能力,数据规模与多样性不足亦为后续研究需正视的瓶颈。
常用场景
经典使用场景
在机器人学习领域,模仿学习与视觉-动作策略的联合建模长期依赖高质量的示教数据。该数据集依托 LeRobot 框架构建,以 SO-Follower 机械臂为采集平台,围绕抓取与放置这一经典操作范式,提供了一百条示教轨迹、逾五万帧同步记录。其最典型的使用方式是将三路相机观测与六自由度关节状态、动作指令对齐,训练端到端的视觉运动策略,使机械臂能够在给定视觉输入下直接输出连续动作序列。
衍生相关工作
围绕该数据集,已衍生出一系列与 LeRobot 生态紧密结合的经典工作,包括基于动作分块 Transformer 的操作策略训练、多视角视觉编码器的对比预训练,以及面向低成本机械臂的模仿学习基准测评。这些工作或以该数据集作为训练集,或将其作为评测平台,用以验证新算法在抓放任务中的成功率与鲁棒性,进而形成从数据采集、模型训练到真实机器人验证的完整研究链条。
数据集最近研究
最新研究方向
在具身智能与机器人操作学习迅猛演进的背景下,该数据集以三路视觉观测与六自由度关节状态及动作序列的同步记录,为视觉-动作联合建模提供了贴近真实物理交互的多模态数据基础。当前围绕模仿学习与视觉-语言-动作模型的前沿探索,正聚焦于利用多相机视角提升空间表征的鲁棒性与操作泛化能力,尤其是抓取与放置一类接触密集型任务中的策略迁移问题。该数据集所蕴含的百段演示轨迹与高帧率视频流,契合了本领域对大规模、结构化机器人演示数据的迫切需求,为端到端策略学习、跨视角特征融合以及仿真到现实迁移等热点议题提供了可复用的实验载体,对推动通用操作策略的可扩展训练具有积极的支撑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务