遇见数据集

HyeonseokE/SO101-cap_pnp_baseline_10fps_40epi

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个机器人数据集,由LeRobot创建,专注于机器人任务。数据集采用so101_follower机器人类型,包含40个总片段、12463个总帧和1个总任务。数据以10帧每秒的速率采集,并分割为训练集(覆盖所有片段)。数据集结构包括多个特征:观察状态(如关节位置,包括肩部平移、肩部升降、肘部弯曲、腕部弯曲、腕部旋转和夹爪位置,形状为6维浮点数组)、动作(与观察状态类似,形状为6维浮点数组)、观察图像(包括顶部和左腕视角的视频数据,分辨率为480x640,3通道,使用av1编解码器,帧率为30)、末端执行器位置(机器人xyzrpy坐标,形状为6维浮点数组)、夹爪二进制状态(1维浮点数组)、技能信息(如自然语言描述、验证问题、类型、进度、目标位置关节坐标、目标位置机器人xyzrpy坐标、目标位置夹爪状态,其中自然语言和验证问题为字符串类型,其他为浮点或整数类型)、子任务信息(如自然语言描述、对象名称、目标位置坐标,形状为3维浮点数组)、时间戳、帧索引、片段索引、索引和任务索引(均为整数类型)。数据以parquet文件格式存储,总数据文件大小为100MB,视频文件大小为200MB,分块大小为1000。数据集适用于机器人学习和控制任务,提供丰富的多模态数据支持。

This dataset is a robotics dataset created using LeRobot, focusing on robot tasks. It employs the so101_follower robot type, containing 40 total episodes, 12463 total frames, and 1 total task. Data is collected at 10 frames per second and split into a training set (covering all episodes). The dataset structure includes multiple features: observation state (e.g., joint positions including shoulder pan, shoulder lift, elbow flex, wrist flex, wrist roll, and gripper positions, shaped as a 6-dimensional float array), action (similar to observation state, shaped as a 6-dimensional float array), observation images (including video data from top and left wrist perspectives, with a resolution of 480x640, 3 channels, using av1 codec, at 30 fps), end-effector position (robot xyzrpy coordinates, shaped as a 6-dimensional float array), gripper binary state (1-dimensional float array), skill information (such as natural language description, verification question, type, progress, goal position joint coordinates, goal position robot xyzrpy coordinates, goal position gripper state, with natural language and verification questions as string types, others as float or integer types), subtask information (e.g., natural language description, object name, target position coordinates, shaped as a 3-dimensional float array), timestamp, frame index, episode index, index, and task index (all integer types). Data is stored in parquet file format, with a total data file size of 100MB, video file size of 200MB, and chunk size of 1000. The dataset is suitable for robot learning and control tasks, providing rich multimodal data support.

提供机构:
HyeonseokE
搜集汇总
数据集介绍
HyeonseokE/SO101-cap_pnp_baseline_10fps_40epi 数据集图片
构建方式
本数据集基于LeRobot框架构建,专注于SO101型机器人夹取与放置(pick and place)任务。数据以每秒10帧的采样频率录制,共采集40个完整回合(episodes),总计12463帧,覆盖单一任务类型。数据存储采用parquet格式,视频文件以AV1编码压缩,分别存放于data和videos目录下。每条轨迹均包含6维关节位置指令与观测状态,以及来自顶部和左腕摄像头的640×480分辨率RGB图像。数据集还详尽记录了技能与子任务的语义信息,包括自然语言描述、验证问题、目标位置及进度值,为模仿学习与多模态研究提供了结构化支撑。
使用方法
数据集通过HuggingFace的LeRobot库加载,支持直接读取parquet格式的状态-动作对与编码为AV1的视频流。用户可使用LeRobot的DataModule按批次提取观察图像、状态向量及动作标签,并利用提供的train/validation分割(本数据集默认0:40均为训练集)构建监督学习任务。数据集配备可视化空间,可交互播放轨迹。对于多模态模型,可将图像输入视觉编码器,联合语义字段(如skill.natural_language)训练语言条件策略,或从subtask.target_position回归抓取目标坐标。
背景与挑战
背景概述
机器人操作技能的泛化能力是当前智能机器人领域面临的核心挑战之一,而高质量、结构化的示范数据集是推动这一领域发展的基石。SO101-cap_pnp_baseline_10fps_40epi数据集由HyeonseokE等人基于LeRobot框架创建,旨在为双臂协作机器人(so101_follower)的拾取与放置(Pick and Place)任务提供标准化训练与评估基准。该数据集以10帧/秒的采样率,记录了40个完整轨迹(共12463帧),涵盖多种传感器模态,包括6维关节状态、6维末端执行器位姿、双目视觉图像(顶部与左手腕视角,30帧/秒)以及语言指令和子任务目标信息。其结构设计遵循了LeRobot的v3.0规范,数据以Parquet格式高效存储,视觉信息以AV1编码视频保留,为模仿学习、视觉运动策略预训练及跨任务迁移研究提供了兼具丰富性与可扩展性的资源。该工作通过开放协议(Apache-2.0)发布,填补了开源社区中面向特定机器人构型、包含多模态对齐标注的精细操作数据集的空白,对促进机器人学习领域的数据驱动方法研究具有重要意义。
当前挑战
该数据集及其所服务的机器人操作领域面临多重挑战。首先,在领域问题层面,机器人操作的根本难题在于从高维、多模态的感知输入(如视觉与关节状态)中,精确建模出鲁棒、可泛化的控制策略;数据集虽包含语言指令与子任务目标,但单一任务(拾取与放置)的背景限制了模型在复杂、非结构化环境中处理任务变异性的能力,例如物体位姿不确定性、夹具滑动或动态光照变化等干扰。其次,在数据集构建过程中,挑战体现在三方面:一是数据规模与多样性之间的平衡——仅40个轨迹可能不足以覆盖机器人操作空间的全部变异性,导致策略在面向未见场景时存在过拟合风险;二是标注精确度与一致性,语言指令与子任务目标(如自然语言描述与目标位置)需要手动或半自动对齐,其主观性和噪声会给多模态融合带来系统性偏差;三是多传感器同步问题,视觉数据以30帧/秒采集而状态/动作以10帧/秒记录,需准确的时间戳对齐,任何错位都会损害策略学习中的因果关系建模效率。
常用场景
经典使用场景
在机器人学习领域,SO101-cap_pnp_baseline_10fps_40epi数据集凭借其精细标注的6自由度关节状态与动作序列,成为模仿学习(Imitation Learning)和离线强化学习(Offline Reinforcement Learning)研究的理想基准。该数据集包含40个完整操作回合,记录了SO101型机械臂在抓取与放置(Pick-and-Place)任务中的视觉观测、关节状态及末端执行器位姿,为训练机器人从感知到动作的端到端策略提供了标准化的多模态训练样本。研究者常利用该数据集验证行为克隆(Behavior Cloning)、扩散策略(Diffusion Policy)等算法在真实机器人操控任务上的迁移效果,尤其关注模型在有限示教数据下对复杂接触操作行为的泛化能力。
解决学术问题
该数据集着力攻克机器人操作学习中长期存在的数据匮乏与样本效率瓶颈。传统模仿学习依赖海量人工示教数据,而该数据集通过结构化记录包含自然语言指令、子任务分解及验证问题在内的丰富语义信息,为探究多层级任务表示与跨任务知识迁移提供了定量支撑。在学术层面,它推动了基于视频预测的隐式策略学习、残差强化学习等前沿方向的验证,解决了如何从稀疏奖励信号中提取可复用的运动原语,以及如何在视觉-运动控制联合空间中消除分布漂移(Distribution Shift)等关键难题。这些工作对构建具备泛化能力的通用机器人操控基线具有奠基性意义。
实际应用
在实际工业场景中,SO101-cap_pnp_baseline_10fps_40epi数据集可直接服务于柔性制造流水线的自动抓取与装配系统开发。其记录的机械臂运动学参数与视觉反馈流,为部署基于视觉伺服的精准操作方案提供了高保真的离线仿真环境,有效降低现场调试成本。在物流分拣、电子元器件插装等对精度要求严苛的环节,该数据集可作为预训练策略的初始化权重来源,配合迁移学习技术实现新物件的快速适配。此外,数据集中包含的秒级时间戳与帧级对齐信息,为开发低时延的实时控制算法提供了量化评估基准,加速了从实验室原型到工业级产品的落地进程。
数据集最近研究
最新研究方向
在机器人操作技能学习的前沿领域,SO101-cap_pnp_baseline_10fps_40epi数据集为基于视觉的拾放任务提供了精细化的多模态训练资源。该数据集聚焦于单任务场景下机械臂的关节空间动作与视觉观测的深度融合,采集了40个完整回合、逾1.2万帧的含6自由度位姿和夹爪状态的运动轨迹,并辅以顶部与左腕双视角视频流、自然语言技能描述及子任务目标标注。当前研究热点集中于利用此类细粒度数据驱动模仿学习与强化学习的泛化能力突破,尤其是结合大语言模型进行任务语义解析与行为克隆的协同优化。通过将关节角度、末端执行器位姿等连续状态空间与语言指令配对,该数据集为构建可解释、可迁移的机器人操作基础模型奠定了数据基石,推动服务机器人与柔性制造中透明化技能习得的发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务