遇见数据集

HyeonseokE/SO101-cap_pnp_baseline_10fps_60epi

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集使用LeRobot创建,包含一个机器人操作任务的数据集,专门针对so101_follower机器人类型。数据集包含60个episodes,总计18689帧,帧率为10fps。数据以parquet文件格式存储,视频以mp4格式存储。数据集的特征丰富,包括机器人状态观测(如关节位置)、动作控制、来自顶部和左腕摄像头的图像观测(分辨率480x640,3通道,30fps)、末端执行器位置(XYZRPY坐标)、二值化夹爪状态、技能相关的自然语言描述和验证问题、子任务的自然语言描述和目标位置、以及时间戳、帧索引、episode索引等元数据。这些数据适用于机器人学习、强化学习或模仿学习任务。

This dataset was created using LeRobot and contains data for a robotic manipulation task, specifically for the so101_follower robot type. It includes 60 episodes with a total of 18,689 frames at a frame rate of 10 fps. The data is stored in parquet files, and videos are stored in mp4 format. The dataset features rich information, including robot state observations (e.g., joint positions), action controls, image observations from top and left wrist cameras (resolution 480x640, 3 channels, 30 fps), end-effector positions (XYZRPY coordinates), binary gripper state, natural language descriptions and verification questions for skills, natural language descriptions and target positions for subtasks, as well as metadata such as timestamps, frame indices, and episode indices. This data is suitable for robot learning, reinforcement learning, or imitation learning tasks.

提供机构:
HyeonseokE
搜集汇总
数据集介绍
HyeonseokE/SO101-cap_pnp_baseline_10fps_60epi 数据集图片
构建方式
在机器人学习与操作领域,高质量的数据集是驱动智能体从示范中习得复杂技能的基础。SO101-cap_pnp_baseline_10fps_60epi数据集基于LeRobot框架构建,通过采集SO101_follower型机械臂在执行拾取与放置(Pick and Place)任务时的运行轨迹生成。数据集共包含60个episode,总帧数达18689帧,以10 FPS的采样频率记录,所有数据均被均匀划分为训练集。原始数据以Parquet格式存储,视频流则采用AV1编码的MP4文件保存,确保了数据的高效压缩与完整保留。
特点
该数据集的核心特色在于其多维度的状态与动作表征。观测空间涵盖6维关节状态(肩部、肘部、腕部及夹爪位置)以及末端执行器的笛卡尔坐标与姿态(x、y、z、roll、pitch、yaw)。此外,数据集提供了来自顶部和左腕的两个480x640像素的RGB视频流,丰富了视觉感知信息。尤为突出的是,每条轨迹均附带了自然语言描述的子任务目标、验证问题及技能类型,使得该数据集不仅适用于模仿学习,还能支持基于语言条件的机器人技能泛化研究。
使用方法
用户可通过HuggingFace的LeRobot生态便捷地加载与可视化该数据集。数据集已预设好完整的数据管道,用户只需调用LeRobot库中的数据集读取接口即可自动解析Parquet与视频文件。数据特征命名清晰,如'observation.state'与'action'均为6维浮点向量,便于直接用于端到端的行为克隆或强化学习算法训练。此外,数据集中包含的'skill.natural_language'等字段为多模态学习提供了丰富的标注,研究者可据此设计语言引导的机器人操纵模型。
背景与挑战
背景概述
在机器人学习领域,模仿学习与示教学习是推动智能体从人类演示中获取技能的核心范式,而高质量、多模态的操控数据集是实现这一目标的关键基础。SO101-cap_pnp_baseline_10fps_60epi数据集由研究人员HyeonseokE基于LeRobot框架创建,聚焦于单任务(拾取与放置)下的机器人精细操控行为。该数据集包含60个演示回合,共计约18,689帧,以10帧每秒的频率记录,提供了包含关节角度(如肩关节、肘关节、腕关节及夹爪位置)、末端执行器位姿、二值化夹爪状态、以及顶置和左腕两个视角的640×480彩色视频在内的丰富观测与动作信息。其核心研究问题在于如何通过结构化、低延迟的视觉-运动数据,赋能基于状态与图像输入的机器人策略学习,为后续在标准臂型(SO101)上开展泛化性操控研究提供了基准性资源。
当前挑战
该数据集所解决的领域挑战集中于实时操控中的视觉-运动耦合难题,即机器人如何从有限的高维视觉输入中精确提取稀疏的6自由度关节动作目标,并应对拾放任务中物体姿态变化与夹爪自适应调节的不确定性。在构建过程中,数据采集面临多源传感器同步与时间戳对齐的挑战,需协调30帧每秒的视觉流与10帧每秒的状态记录以确保帧级别的一致性;此外,视频存储采用AV1编码,虽压缩效率高但解码开销大,对后续策略训练中的数据流读取效率提出考验。数据集规模有限(仅含60个回合、单一任务),虽便于快速迭代验证,却难以支撑大规模端到端学习的泛化能力,研究者需在此基线上发展小样本迁移或数据高效增强策略以突破性能瓶颈。
常用场景
经典使用场景
SO101-cap_pnp_baseline_10fps_60epi数据集在机器人学领域扮演着标杆性角色,其核心用途是为模仿学习与基于视觉的运动规划研究提供高质量、多模态的标准化训练材料。该数据集采集自so101_follower机械臂执行抓取与放置(pick-and-place)任务的过程,以10帧/秒的频率记录了多达60个回合的完整操控轨迹。每个回合均包含6维关节状态、末端执行器位姿、二指夹爪状态以及顶部和左腕两个视角的彩色视频流,同时标注了高层技能描述、子任务目标位置和自然语言指令。这种结构使其成为训练从视觉观测到连续动作映射的端到端策略模型的首选基准,研究者可据此对比不同算法在相同机器人平台与任务上的性能表现。
解决学术问题
该数据集精准回应了机器人学习领域核心的样本效率与泛化性困境,为验证多模态融合、行为克隆、逆强化学习等算法提供了标准化的评估载体。传统研究常受困于硬件差异与采集成本导致的不可复现问题,而本数据集通过公开60个高质量演示回合,使学术界能够独立测试模型在有限示范下的策略学习能力。此外,其中包含的技能与子任务层级结构,推动了层次化任务分解与长时程动作序列生成的研究,帮助揭示隐含语义指令如何引导机器人规划多步操作路径,从而在结构化环境中实现鲁棒操控。这些贡献显著降低了机器人学习实验的门槛,促进了从仿真到真实场景的迁移方法论发展。
衍生相关工作
该数据集催生了一系列围绕机器人模仿学习与行为表征的前沿探索。研究者常基于其标准化结构开发对比基线,例如行为克隆(Behavioral Cloning)与扩散策略(Diffusion Policy)的性能测评;同时,数据集中精细化的任务分解标注引出了关于‘技能组合与迁移’的研究,促使学者构建模块化动作生成模型,将抓取、放置等原子技能库化后重组为新任务。此外,多模态对齐已成为热点方向:利用数据集的视觉-状态-语言三元组,涌现出面向机器人控制的视觉语言模型(VLM)微调方案,例如通过预训练编码器跨模态融合图像与指令,再联合关节状态解码出动作序列。这些衍生工作共同构筑了一个从数据采集到算法验证的完整研究生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务