遇见数据集

KS325/skill-set-r2

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

该数据集使用LeRobot创建,包含240个episodes,总计176,754帧数据,涉及5个不同任务。数据集以parquet格式存储数据,视频以mp4格式存储,帧率为30fps。数据集中包含机器人动作状态(如肩部平移、肩部升降、肘部弯曲、腕部弯曲、腕部旋转和夹爪位置)、观测状态(包括两个摄像头拍摄的图像,分辨率为480x640,3通道)以及时间戳、帧索引、episode索引、任务索引等元数据。机器人类型为so_follower,适用于机器人学任务。

This dataset is constructed using LeRobot, containing 240 episodes with a total of 176,754 frames, covering 5 distinct tasks. Core data of the dataset is stored in Parquet format, while the associated videos are saved in MP4 format at a frame rate of 30 fps. The dataset includes robot actuation states (e.g., shoulder translation, shoulder lift, elbow flexion, wrist flexion, wrist rotation and gripper position), observation states (comprising two 3-channel RGB images with a resolution of 480×640 captured by two cameras), as well as metadata such as timestamps, frame indices, episode indices, task indices and other related information. The robot platform is so_follower, which is suitable for robotics-related tasks.

提供机构:
KS325
搜集汇总
数据集介绍
KS325/skill-set-r2 数据集图片
构建方式
在机器人学习领域,复杂技能的解构与复现是推动具身智能发展的关键。skill-set-r2数据集由LeRobot框架构建,旨在为机器人操作任务提供标准化的训练与评估基准。数据集通过记录“so_follower”机器人执行5种不同任务时的状态与动作,共采集了240个episode,合计176754帧数据,涵盖6维动作空间(包括关节位置与夹爪控制)。数据以分块形式存储为Parquet文件,并辅以双视角(camera1与camera2)的同步视频(AV1编码,30 FPS),为多模态学习提供坚实基础。
特点
该数据集的核心特点在于其结构化的多模态与序列化设计。每条数据包含机器人6维关节状态与动作指令、双摄像头视频流、时间戳及帧索引,形成完整的“观测-动作”闭环。数据以episode为单元进行组织,并支持按1000帧分块存储,便于大规模高效加载。此外,数据集采用Apache-2.0许可证开放使用,且通过LeRobot可视化工具可直观查看各episode的影像与动作时序,降低使用门槛。
使用方法
研究者可通过LeRobot库直接加载该数据集,调用其标准接口访问结构化的特征字典,包括动作(action)、观测状态(observation.state)及图像(observation.images.camera1/camera2)等字段。数据集未划分验证集与测试集,全部240个episode均用于训练,适合开展模仿学习或离线强化学习实验。用户可依据任务索引(task_index)筛选特定技能数据,或利用时间戳与帧索引对齐视频与状态序列,进行端到端的策略建模与评估。
背景与挑战
背景概述
skill-set-r2数据集由Hugging Face团队基于LeRobot框架创建,专为机器人技能模仿学习设计。该数据集聚焦于SO-Follower机器人平台,采集了240个演示片段,涵盖5种不同的操作任务,共计约176,754帧有效数据。通过双视角摄像头(分辨率为640×480)以30帧/秒的频率记录机器人的关节状态与动作序列,包括肩部、肘部、腕部及夹爪的六维控制指令。作为开源机器人数据集的重要补充,它为多任务技能获取与行为克隆研究提供了标准化基准,推动了具身智能领域从简单动作复现到复杂技能泛化的范式迁移。
当前挑战
该数据集核心挑战在于解决机器人技能学习中的多任务泛化问题,其构建过程中需应对有限演示数据的分布偏移难题——仅240个轨迹却需覆盖5种不同技能模式,对模型从低维状态空间(6维关节位置)到高维视觉输入的跨模态映射能力提出严苛要求。同时,数据采集环节面临固有物理限制:单一SO-Follower平台的动作范围与夹爪精度约束了任务复杂度,双摄像头视角下的遮挡与光照变化加剧了视觉特征的不一致性。此外,原始演示中动作与状态的异质性(如不同技能的最佳控制频率差异)以及元数据碎片化(如parquet与视频文件的异步同步)显著增加了数据清洗与特征对齐的工程复杂度。
常用场景
经典使用场景
在机器人学习领域,skill-set-r2数据集以其丰富的多模态信息与精细化的动作标注,成为技能模仿学习和行为克隆研究的理想基石。该数据集记录了so_follower机械臂在240个成功演示回合中的六自由度关节运动轨迹、末端夹爪状态以及双视角视觉观测,涵盖了5种不同的操作任务。研究者常利用这些高保真的状态-动作序列,训练端到端的神经网络模型,以学习从视觉输入到连续动作空间的映射关系,进而实现机器人对复杂操作技能的精准复现与泛化。
解决学术问题
该数据集为机器人操作技能的可迁移性研究提供了关键支撑,解决了从示范数据中高效提取通用技能表征的学术难题。通过提供标准化、高频率的演示数据,研究者得以深入探索少样本学习、元学习以及多任务学习等范式在机器人领域的应用边界。其意义在于推动了从单一任务过拟合向跨任务技能泛化的跨越,显著降低了机器人部署过程中对海量重复数据采集的依赖,为构建更具智能性的通用操作模型奠定了数据基础。
衍生相关工作
围绕skill-set-r2数据集,已衍生出一系列具有影响力的研究工作。在模仿学习方向,研究者基于该数据集提出了条件变分自动编码器与扩散策略的结合模型,显著提升了长序列动作生成的连贯性。在表征学习方面,有工作利用该数据集中的多视角视频流,开发了对比学习框架以提取与任务无关的视觉共性特征。此外,数据集还被用于验证基于Transformer架构的序列建模方法在机器人技能编码中的有效性,推动了具身智能领域从传统控制论向数据驱动范式的转型。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务