遇见数据集

HiloHilo/makermods_pick-cup

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集使用LeRobot创建,是一个机器人任务数据集,具体针对so101_follower类型的机器人。数据集包含10个episodes,共8999帧,帧率为30fps。数据以parquet文件格式存储,视频文件格式为mp4。数据集的特征包括动作(action)和观察状态(observation.state),两者都包含6个浮点数,分别对应机械臂的关节位置(如肩部旋转、肩部提升、肘部弯曲、手腕弯曲、手腕旋转和夹爪位置)。此外,数据集还提供两个摄像头图像:hand_cam和side_cam,分辨率均为480x640,3通道,帧率为30fps,使用av1编解码器。其他特征包括时间戳、帧索引、episode索引、索引和任务索引。数据集总大小为100MB(数据文件)和500MB(视频文件),适用于机器人控制和模仿学习任务。

This dataset was created using LeRobot and is a robotics task dataset specifically for the so101_follower robot type. It contains 10 episodes with a total of 8999 frames at 30 fps. The data is stored in parquet files, and video files are in mp4 format. The dataset features include action and observation.state, both consisting of 6 float values corresponding to the robot arms joint positions (e.g., shoulder pan, shoulder lift, elbow flex, wrist flex, wrist roll, and gripper positions). Additionally, it provides two camera images: hand_cam and side_cam, both with a resolution of 480x640, 3 channels, 30 fps, and using the av1 codec. Other features include timestamp, frame index, episode index, index, and task index. The total size is 100 MB for data files and 500 MB for video files, suitable for robotics control and imitation learning tasks.

提供机构:
HiloHilo
搜集汇总
数据集介绍
HiloHilo/makermods_pick-cup 数据集图片
构建方式
该数据集依托LeRobot框架构建,聚焦于机械臂的拾取-放置任务。通过so101_follower型机器人执行单一任务,采集了10个完整回合(episode),共计8999帧数据,涵盖约100MB的parquet格式结构化数据与500MB的视频数据。所有数据以30帧每秒的速率同步记录,划分为单一训练集,并按照chunk(每块1000帧)与file进行组织存储,确保数据读取的高效性与扩展性。
特点
数据集的一个显著特性是其多模态融合设计,同时收录了机械臂6自由度关节状态(包括肩部、肘部、腕部及夹爪位置)与双视角(hand_cam与side_cam)高清视频流,视频分辨率达480×640像素,采用AV1编码压缩。此外,数据格式严格统一,动作与观测状态共享相同的6维空间,便于端到端模仿学习模型直接使用,且视频与结构化数据通过时间戳与帧索引精确对齐,保障了时序一致性。
使用方法
数据集可直接通过LeRobot库加载,默认配置下所有数据归入训练集。用户可依据meta/info.json中的特征schema,利用parquet文件中的动作(action)、关节状态(observation.state)及多视角图像(observation.images)字段进行模型训练或评估。视频文件以MP4格式存储,配合LeRobot内置的编解码接口,可便捷地抽取图像帧并保持与结构化数据帧的对应关系,适用于机器人模仿学习与行为克隆等典型研究场景。
背景与挑战
背景概述
在机器人学习领域,模仿学习依赖于高质量、具身化的操作数据集以推动技能泛化。makermods_pick-cup数据集由Hugging Face社区基于LeRobot框架构建,面向so101_follower机器人平台,专注于“抓取杯子”这一单一精细操作任务。该数据集创建于2024年前后,服务于机器人操控的模仿学习研究,核心问题在于如何通过少量演示数据高效编码闭环操作策略。数据集包含10个演示片段,共8999帧,以30帧每秒的速率记录,融合了手部相机与侧方相机的视觉输入,并提供六维关节角度动作序列。尽管规模微小,该数据集在LeRobot生态中起到了基准测试作用,为研究小样本、高保真机器人技能的迁移与复现提供了初始验证平台,尤其适合验证基于数据增强或元学习的算法在低数据场景下的表现。
当前挑战
该数据集层面所解决的领域问题聚焦于机器人精细操作中的模仿学习泛化难题,尤其是在数据稀缺条件下,如何从有限演示中提取稳定的动作策略。构建过程中的挑战体现在多维度:硬件层面,so101_follower的6自由度关节(肩部3轴、肘部、腕部与夹爪)需精确同步,任何机械偏差会导致数据噪声累积;数据采集层面,10个演示片段(100MB结构与500MB视频)的规模易导致过拟合,且未设置验证/测试集划分,算法评估可靠性存疑;感知层面,480×640分辨率的手部与侧方图像在遮挡或光照变化下提供的视觉特征有限,加大了状态-动作映射的歧义性。此外,任务单一(仅“抓取杯子”)且演示由单一操作者完成,未覆盖场景多样性,限制了策略在未知物体位姿或环境干扰下的鲁棒性,凸显了在噪声处理、小样本迁移与跨场景泛化方面的核心挑战。
常用场景
经典使用场景
在机器人操作与模仿学习领域,makermods_pick-cup数据集作为一项精细的抓取任务基准,其经典用途集中于训练机械臂执行“拾取杯子”这一典型操作。该数据集通过LeRobot框架采集,包含10个完整轨迹,共计8999帧,以30帧每秒的速率记录,每帧融合了六维关节空间状态(肩部、肘部、腕部及夹爪位置)与多视角视觉信息(手部相机和侧方相机480×640像素视频)。研究者常用于端到端的视觉-运动策略训练,通过监督学习或强化学习方法,使机器人从观察图像序列中直接映射出关节动作指令,从而复现杯子的精准拾取与放置动作,是验证策略泛化能力与数据效率的经典试验场。
解决学术问题
该数据集在学术层面主要解决了机器人小样本模仿学习中动作细腻度与感知耦合的验证难题。过去,研究常聚焦于仿真环境中的理想化场景,而真实物理世界中机械臂的关节协同与视觉反馈存在时延和噪声挑战。makermods_pick-cup提供了真实机器人(so101_follower)的原始动作序列和同步视觉流,使得学者能够量化评估行为克隆、逆强化学习以及基于扩散模型的策略在有限轨迹下的复现精度。其意义在于推动了一种可重复的实证范式:通过标准化数据格式(Parquet+AV1视频),消除因采集差异导致的比较偏差,促使学界深入理解长时程任务中动作序列的一致性对策略稳定性的影响。
衍生相关工作
基于makermods_pick-cup数据集,衍生出多项推动机器人策略学习的前沿工作。一类典型工作是探索多模态融合的表示学习,例如结合视觉与本体感知的对比自监督模型,利用数据集中同步的关节状态和图像帧来学习不变性特征,从而在少量演示下提升跨场景泛化能力。另一类方向关注于动作因果建模,研究者利用该数据集中的时间戳序列分析动作序列中的关键因果步骤,构建出能够剪枝冗余动作的效率优化策略。此外,该数据集亦被用作验证数据增强技术的基准,如通过时序插值或视角扰动生成伪轨迹,以缓解实际采集成本高昂带来的数据稀缺瓶颈。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务