遇见数据集

HyeonseokE/SO101-cap_pnp_baseline_10fps_80epi

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个用于机器人技术的数据集,通过LeRobot工具创建。数据集包含80个训练片段,总计24,915帧,采样率为10fps。数据记录了SO101跟随者机器人的状态信息,包括6个关节位置(如肩部平移、肩部提升、肘部弯曲等)、动作命令、顶部和左手腕视角的图像(分辨率480x640,视频编码为av1,30fps)、末端执行器位置(XYZ坐标和RPY姿态)、夹持器状态、技能描述(如自然语言指令、验证问题、技能类型、进度和目标位置)以及子任务信息(如自然语言描述、对象名称和目标位置)。数据集结构以Parquet文件存储,总数据文件大小为100MB,视频文件大小为200MB。

This dataset is a robotics dataset created using the LeRobot tool. It contains 80 training episodes, totaling 24,915 frames with a sampling rate of 10fps. The data records the state of an SO101 follower robot, including 6 joint positions (e.g., shoulder pan, shoulder lift, elbow flex), action commands, images from top and left wrist perspectives (resolution 480x640, video codec av1, 30fps), end-effector positions (XYZ coordinates and RPY orientation), gripper status, skill descriptions (e.g., natural language instructions, verification questions, skill type, progress, and goal positions), and subtask information (e.g., natural language descriptions, object names, and target positions). The dataset is structured in Parquet files, with a total data file size of 100MB and video file size of 200MB.

提供机构:
HyeonseokE
搜集汇总
数据集介绍
HyeonseokE/SO101-cap_pnp_baseline_10fps_80epi 数据集图片
构建方式
该数据集基于LeRobot框架构建,旨在为机器人操作任务提供标准化的训练数据。数据集采集自SO101_follower型号机器人,以10帧/秒的采样频率记录了80个完整的操作轨迹,共计24,915帧图像与状态数据。每个轨迹均围绕单一任务展开,任务类型为拾取与放置(pick and place),其中机器人通过肩部、肘部、腕部及夹爪的协同运动完成目标物体的抓取与搬运。数据以分块(chunk)形式存储,每块包含1,000帧,分为Parquet格式的结构化数据文件和MP4格式的视频文件,视频分辨率为480×640像素,采用AV1编码压缩。所有80个轨迹均被划分为训练集,未设置验证集或测试集,以便于端到端的行为克隆策略训练。
特点
数据集的核心特色在于其多模态观测信息的高度集成与精细化的任务标注体系。观测数据融合了机器人关节状态(6维浮点向量)、末端执行器位姿(x、y、z、roll、pitch、yaw)以及来自顶部和左手腕两个视角的高清视觉流。尤为突出的是,每条轨迹均附带自然语言描述、验证问题、技能类型及进度信息,同时明确了子任务的目标对象与三维空间位置。这种结构化标注使得数据集不仅支持模仿学习,还能服务于基于语言指令的机器人技能分解与规划研究。此外,夹爪状态单独以二进制值记录,进一步简化了抓取动作的分析。
使用方法
推荐通过LeRobot库加载与使用该数据集,用户可直接从HuggingFace仓库读取数据。加载时需指定数据集名称为SO101-cap_pnp_baseline_10fps_80epi,并调用LeRobot的数据加载接口,系统将自动解析Parquet文件中的状态向量、动作指令与时间戳,同时管理视频流的编解码与帧同步。由于所有数据已划分为训练集(索引0至79),研究者可直接用于训练基于状态或视觉的行为克隆模型。数据集兼容常见的机器人学习框架,如PyTorch和TensorFlow,方便进行端到端的策略优化实验。对于需要多任务学习的场景,可依据task_index字段筛选特定任务的数据片段。
背景与挑战
背景概述
在机器人学习领域,从人类演示中学习复杂操作技能一直是研究热点,而高质量数据集是实现这一目标的关键基石。SO101-cap_pnp_baseline_10fps_80epi数据集由HyeonseokE团队创建,依托于LeRobot框架,旨在为机器人抓取与放置(Pick and Place)任务提供标准化的基准训练数据。该数据集于2024年发布,采用Apache-2.0许可协议,聚焦于so101_follower型机器人平台,通过80个演示片段(约24915帧)记录10FPS下的关节状态、动作指令、多视角视觉信息及子任务语义标签。其核心研究问题在于如何将人类示教数据高效转化为机器人可复现的运动策略,尤其针对具有6自由度关节(肩部、肘部、腕部及夹爪)的机械臂操作。该数据集对模仿学习与行为克隆领域具有重要推动价值,为评估算法在离散任务中的泛化能力提供了结构化数据基础。
当前挑战
该数据集所应对的领域挑战主要集中于机器人操作任务的策略泛化与数据效率问题。在解决抓取放置这类精细操作时,机器人需从有限演示中提取动作策略,但实际环境中的物体位置、姿态变化及动力学差异极易导致策略失效。构建过程中面临多重技术难题:首先,多模态数据(六维状态向量、30FPS双目视频、6自由度末端位姿)的同步与对齐极为苛刻,时间戳偏差会直接影响策略训练效果。其次,80个片段的有限样本量要求子任务划分(如目标位置、语言指令)需具备高度一致性,但人工标注的语义标签(如subtask.object_name)易引入歧义。此外,可变形软体夹爪控制的精确建模、高帧率视频(30FPS)与低控制频率(10FPS)之间的时空耦合,以及不同机械臂运动学配置下的数据迁移性,均构成显著约束。视频采用AV1编解码在确保画质的同时增加了处理开销,而parquet格式的二进制存储虽优化了查询效率,却对实时数据流处理提出了内存管理挑战。
常用场景
经典使用场景
SO101-cap_pnp_baseline_10fps_80epi数据集专为机器人操作任务中的抓取与放置(Pick-and-Place)场景而设计,是模仿学习与行为克隆研究中的标杆性资源。该数据集记录了SO101机械臂在顶部摄像头与左手腕摄像头双重视觉引导下,完成单一任务的80个完整演示片段,包含近2.5万帧高精度运动状态与动作序列。每个样本提供了6维关节位置、末端执行器位姿、夹爪状态以及自然语言技能描述,为构建从视觉输入到动作输出的端到端策略模型提供了标准化的训练基准。研究者常利用此数据集训练机器人学习在动态环境中执行精准的抓取与放置操作,评估模型在多模态感知与连续动作空间中的泛化能力。
衍生相关工作
该数据集衍生了一系列具有影响力的学术工作。研究者基于其结构与格式,开发了诸如Diffusion Policy、ACT(Action Chunking Transformers)等先进的行为克隆算法,这些方法在长期预测与多模态动作分布建模上取得了突破。数据集还催生了针对机器人技能层次化分解的研究,如将抓取动作拆解为接近、闭合、提升等子技能,促进了组合性操作策略的提出。此外,围绕该数据集的基准测试,涌现了多种数据增强与域随机化技术,显著提升了策略对视角变化与动力学差异的鲁棒性,后续结合语言-动作联合建模的工作进一步拓展了其在指令跟随与人机协作中的潜力。
数据集最近研究
最新研究方向
在机器人学习领域,SO101-cap_pnp_baseline_10fps_80epi数据集聚焦于基于视觉的机械臂拾取与放置任务,为模仿学习与行为克隆算法提供了高保真度的训练样本。该数据集以10帧每秒的频率记录了80个完整回合,涵盖6维关节状态与动作序列,并配备顶部及左腕双视角视频流,为多模态感知驱动的技能习得研究奠定了坚实基础。当前前沿方向包括利用此类精细化数据集开展基于语言指令的泛化操作、跨任务零样本迁移,以及结合大规模预训练视觉模型提升机器人对非结构化环境的适应能力。该数据集的出现呼应了具身智能领域对高质量、统一格式演示数据的需求热潮,通过标准化特征结构(如状态、动作、图像和语言注释的联合对齐),有望推动通用机器人策略的标准化评估与复现,加速从实验室环境到现实场景的产业化落地进程。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务