遇见数据集

kunhsiang/eval_exp9_sc3var_grasp_the_box_on_the_plate_20260527-163847

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个用于机器人技术的数据集,专门针对so_follower类型的机器人。它包含一个任务(total_tasks: 1)和一个episode(total_episodes: 1),总共有2501帧数据,以30fps的帧率采集。数据集包括动作(action)和观察(observation)数据:动作数据由6个浮点值组成,代表机器人的关节位置(如肩部平移、肩部提升、肘部弯曲、手腕弯曲、手腕旋转和夹爪位置);观察数据包括状态(state)——同样由6个浮点值表示关节位置,以及来自三个摄像头的图像——前摄像头(front)、顶部摄像头(top)和夹爪摄像头(gripper),每个图像的分辨率为480x640像素,3个通道(RGB),以视频格式存储。数据集以Parquet文件格式组织,并包含对应的视频文件,总数据文件大小为100MB,视频文件大小为200MB。数据集使用Apache 2.0许可证,并旨在用于机器人学习和控制任务。

This dataset is designed for robotics, specifically for the so_follower robot type. It contains one task (total_tasks: 1) and one episode (total_episodes: 1), with a total of 2501 frames captured at 30fps. The dataset includes action and observation data: action data consists of 6 float values representing robot joint positions (e.g., shoulder pan, shoulder lift, elbow flex, wrist flex, wrist roll, and gripper position); observation data includes state—also represented by 6 float values for joint positions—and images from three cameras: front, top, and gripper cameras, each with a resolution of 480x640 pixels, 3 channels (RGB), stored in video format. The dataset is organized in Parquet file format and includes corresponding video files, with a total data file size of 100MB and video file size of 200MB. It is licensed under Apache 2.0 and is intended for robot learning and control tasks.

提供机构:
kunhsiang
搜集汇总
数据集介绍
kunhsiang/eval_exp9_sc3var_grasp_the_box_on_the_plate_20260527-163847 数据集图片
构建方式
该数据集依托LeRobot框架完成构建,遵循v3.0代码库版本的数据组织规范。采集过程以so_follower型机械臂为平台,在真实物理环境中通过遥操作或预设策略执行“将托盘上的盒子抓取并放置”这一单一任务,全程以30fps的帧率同步记录动作指令与多视角视觉观测。数据经分块存储为Parquet格式,视频流以AV1编码压缩为MP4文件,并按chunk与file的层级索引加以组织。总计2501帧的连续轨迹被完整保留,为机器人学习提供了高时序分辨率的操作样本。
特点
数据集聚焦于抓取与放置这一经典机器人操作任务,涵盖肩部旋转、升降、肘部弯曲、腕部俯仰与滚转以及夹爪开合六个自由度的动作空间。视觉模态由前视、顶视与夹爪三个视角组成,分辨率均为640×480,能够从不同方位捕捉场景几何与手眼协调信息。数据仅包含一条完整演示轨迹,训练集划分覆盖全部帧序列,适用于单任务模仿学习或策略验证。所有视频均不含音频,且未提供深度图,保持了视觉输入的简洁性。
使用方法
使用者可通过HuggingFace平台提供的可视化工具在线浏览该数据集的轨迹与视频,直观评估任务执行过程。在本地使用时,可依照meta/info.json中定义的data_path与video_path模板定位Parquet数据文件与MP4视频文件,进而读取动作、状态及时间戳等特征字段。由于采用统一的LeRobot数据格式,该数据集能够直接接入兼容的机器人学习训练流程,用于策略网络的监督学习或行为克隆实验,亦可作为多视角感知与动作预测研究的基准素材。
背景与挑战
背景概述
机器人操作技能的学习与泛化长期依赖高质量示教数据的积累,而抓取放置作为其中最基础且最具代表性的任务之一,一直是衡量策略泛化能力的试金石。该数据集由LeRobot框架于2026年构建,记录了SO follower机械臂在仿真环境中的单次抓取放置示教,涵盖肩部、肘部、腕部及夹爪共6维关节位置与三路视觉观测,总量为2501帧、30fps。尽管规模有限,其结构严格遵循LeRobot v3.0规范,为视觉-动作联合建模提供了标准化的研究基底,对具身智能领域的数据格式统一与可复现研究具有推动作用。
当前挑战
该数据集所承载的核心难题在于从单一示教中习得可泛化的抓取放置策略:视觉-动作映射需在6自由度连续空间中保持精确,同时模型必须克服仅有一个回合带来的分布外泛化瓶颈。构建层面,多视角视频与关节位置的高频同步采集对时序对齐精度要求严苛,30fps下2501帧的连续记录亦对存储与解码效率构成压力。此外,任务仅包含单一目标配置,缺乏物体位姿、光照及背景的多样性,难以支撑鲁棒策略的评估与迁移学习研究。
常用场景
经典使用场景
在机器人操作学习领域,基于视觉的抓取与放置任务长期被视为检验策略泛化能力的试金石。该数据集以LeRobot框架为依托,采集了so_follower机械臂执行“将盒体置于餐盘之上”这一任务的完整多模态时序数据,涵盖前视、俯视与夹爪三路视频流以及六自由度关节位置与动作序列,为模仿学习与视觉-语言-动作模型提供了高保真的单回合专家示范。研究者通常将其用于训练端到端的抓取放置策略,验证模型在真实物理约束下对目标物体空间关系的理解与操作精度。
衍生相关工作
该数据集作为LeRobot社区中的典型抓取放置示范,衍生了一系列围绕模仿学习与多视角策略融合的研究工作。相关经典方向包括基于扩散策略的动作生成、视觉-语言-动作模型的指令条件化抓取,以及利用多相机观测进行状态估计的强化学习预训练方法。这些工作以该数据集为验证载体,在抓取精度、任务成功率与跨场景泛化等指标上展开对比,逐步形成了以真实示范数据驱动机器人操作能力提升的研究脉络。
数据集最近研究
最新研究方向
在具身智能与机器人学习领域,面向精细操作任务的真实世界数据集正成为推动算法泛化的关键基础设施。该数据集基于LeRobot框架构建,聚焦于“将盘子中的盒子抓取”这一典型抓放任务,涵盖单次演示回合共2501帧、30fps的多视角视觉与本体状态-动作对,配备前置、俯视及夹爪三个同步摄像头,完整记录了so_follower机械臂的六自由度关节位置与夹爪开合指令。当前研究前沿倾向于利用此类小样本、多模态的真实操作数据,探索模仿学习与视觉-语言-动作模型在受限场景下的策略迁移能力,尤其是在抓取姿态估计、透明或低纹理物体操作以及动态避障等挑战性问题上。该数据集虽仅含单条轨迹,却为验证端到端策略在真实硬件上的可复现性与鲁棒性提供了标准化基准,呼应了社区对开放、可复现机器人数据日益增长的需求,对推动低成本机械臂技能学习与跨平台策略评估具有实证参考意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务