遇见数据集

HiloHilo/eval_makermods_pick-cup

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个机器人控制数据集,通过LeRobot创建,用于记录机器人执行任务时的动作和观察数据。数据集基于机器人类型so101_follower,包含1个完整的episode、1475帧和1个任务。数据以parquet文件格式存储,视频文件为mp4格式。数据集的特征包括:动作(action),由6个浮点数表示机器人的关节位置(如肩部平移、肩部提升、肘部弯曲、手腕弯曲、手腕滚动和夹爪位置);观察状态(observation.state),与动作相同,提供机器人的当前状态;两个摄像头图像观察(observation.images.hand_cam和observation.images.side_cam),均为视频数据,分辨率480x640,3通道(RGB),帧率30fps,使用av1编解码器;以及元数据如时间戳、帧索引、episode索引、索引和任务索引。这些数据适用于机器人学习、控制算法开发和模拟任务。数据集结构支持训练分割(train: 0:1),总数据文件大小为100MB,视频文件大小为500MB。

This dataset is a robotics control dataset created using LeRobot, designed to record actions and observations during robot task execution. It is based on the robot type so101_follower and includes 1 complete episode, 1475 frames, and 1 task. The data is stored in parquet file format, with video files in mp4 format. The dataset features include: action, represented by 6 floating-point numbers indicating robot joint positions (e.g., shoulder pan, shoulder lift, elbow flex, wrist flex, wrist roll, and gripper position); observation state (observation.state), identical to the action, providing the robots current state; two camera image observations (observation.images.hand_cam and observation.images.side_cam), both as video data with 480x640 resolution, 3 channels (RGB), 30fps frame rate, using the av1 codec; and metadata such as timestamp, frame index, episode index, index, and task index. This data is suitable for robot learning, control algorithm development, and simulation tasks. The dataset structure supports a training split (train: 0:1), with a total data file size of 100MB and video file size of 500MB.

提供机构:
HiloHilo
搜集汇总
数据集介绍
HiloHilo/eval_makermods_pick-cup 数据集图片
构建方式
eval_makermods_pick-cup数据集的构建依托于LeRobot框架,旨在为机器人抓取操作提供标准化训练数据。该数据集通过遥操作方式,由so101_follower机器人执行拾取杯子任务,共采集1个完整回合(episode),包含1475帧时序数据,采样频率为30帧/秒。数据以Parquet格式存储动作与状态信息,视频流则采用AV1编码的MP4文件保存,并依据chunk索引进行分块组织,便于高效加载与处理。
特点
该数据集的核心特点在于其多模态与结构性设计的统一。动作与观测状态(observation.state)均为6维浮点向量,对应机器人肩关节、肘关节、腕关节及夹爪的位姿信息。视觉观测包含手部摄像头(hand_cam)与侧方摄像头(side_cam)两个视角,分辨率统一为480×640像素,提供丰富的环境感知。数据集按训练拆分,并包含时间戳、帧索引与任务索引等元数据,支持时序建模与任务复现。
使用方法
用户可通过LeRobot库便捷加载该数据集,调用其数据集API即可读取parquet表格与视频文件。数据以chunk形式分片存储,支持按指定帧范围或回合索引进行切片。动作与状态的6维向量可直接用于监督学习或模仿学习模型的输入与输出,两路视频图像可分别或联合用于基于视觉的策略训练。推荐的典型用法是利用训练拆分中的全部1475帧数据进行端到端的机器人操作策略学习。
背景与挑战
背景概述
在机器人学习领域,从人类演示中学习精细操作技能是推动具身智能发展的关键方向之一。eval_makermods_pick-cup数据集由基于LeRobot框架的研究团队创建,聚焦于SO-101Follower机械臂执行抓取杯子的单一任务场景。该数据集于近期公开,包含1个示范轨迹、1475帧时序数据(30FPS)及手部与侧方双视角高清视频(640×480),并完整记录了六自由度关节位置动作序列与状态观测。尽管规模有限,但其设计旨在验证从仿真环境到真实机器人控制策略迁移的可行性,为低成本机械臂的灵巧操作研究提供了标准化评测基准。数据集采用的Apache-2.0协议开放了全部原始轨迹与视频,对于推动少样本模仿学习和机器人操作策略的泛化性研究具有奠基性价值。
当前挑战
该数据集面临的核心挑战集中于领域问题与构建过程两个层面。领域层面,单任务单轨迹的极低数据量严重制约了策略学习对状态空间变化的覆盖能力,且当前仅配置训练集而无验证集,难以评估模型在抓取姿态偏移或光照变化下的鲁棒性;具身智能研究中普遍存在的仿真到现实迁移鸿沟,在仅含1个示范的条件下尤为突出。构建层面,采用av1视频编码虽优化了存储效率,却在实时解码时增加了计算开销;动作空间与状态空间共享相同的6维关节参数,这种同构表达虽利于监督学习,却忽略了动力学约束与传感器噪声建模;此外,数据集未提供场景几何信息或深度图,使得从2D观测中恢复三维抓取姿态成为额外挑战。
常用场景
经典使用场景
在机器人操作领域,eval_makermods_pick-cup数据集专门用于训练和评估机械臂执行抓取-放置任务的能力,尤其聚焦于拾取杯子这一精细操作。该数据集包含了从两个摄像头视角同步采集的高清视频流以及机械臂六自由度关节状态与动作序列,为模仿学习与行为克隆等范式提供了标准化的训练素材。研究者可借助该数据集训练策略网络,使机器人学会在真实环境中根据视觉输入生成平滑、准确的抓取运动,从而验证算法在少样本或单场景下的泛化性能。
衍生相关工作
该数据集催生了多项围绕机器人操作策略学习的基础性工作,例如基于扩散过程的动作生成模型(Diffusion Policy)在其上验证了相较于传统高斯混合模型的性能优势,以及利用预训练视觉编码器(如ResNet、ViT)提升特征提取效率的研究。同时,它也被用作评估“离线模仿学习+在线微调”混合范式的基准,推动了诸如行为先验蒸馏与交互策略校正等前沿方法的提出,形成了可复现的对比平台。
数据集最近研究
最新研究方向
当前,基于模仿学习的机器人操作技能获取正成为具身智能领域的研究热点。eval_makermods_pick-cup数据集聚焦于机械臂的拾取-放置这一基础操作,通过高帧率(30 FPS)的多视角视觉观测(手部相机与侧方相机)和精细的六自由度关节动作记录,为研究视觉-运动控制策略的端到端学习提供了宝贵的训练样本。该数据集采用LeRobot开源框架构建,其标准化架构利于跨实验室的算法复现与对比。随着大规模机器人数据集与模仿学习算法的深度融合,此类精细标注的演示数据正推动机器人从简单的预设动作向复杂环境下的自主决策迈进,有望加速通用操作技能在智能制造与家庭服务等场景中的落地应用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务