遇见数据集

KS325/skill-set-r2-wm

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个机器人学数据集,使用LeRobot创建,专为机器人技能学习设计。数据集包含320个episodes,总计235207帧,覆盖5个不同任务。数据以parquet文件格式存储,视频文件为mp4格式,帧率为30fps。机器人类型为so_follower。数据集特征包括:动作数据(6个浮点数,表示肩部平移、肩部提升、肘部弯曲、腕部弯曲、腕部旋转和夹爪位置)、观察状态(与动作相同的6个浮点数关节位置)、两个摄像头图像(camera1和camera2,均为480x640分辨率、3通道彩色视频),以及时间戳、帧索引、episode索引、索引和任务索引等元数据。数据集适用于机器人控制、视觉感知和强化学习研究。

This dataset is a robotics dataset created using LeRobot, designed for robot skill learning. It contains 320 episodes, totaling 235207 frames, and covers 5 different tasks. The data is stored in parquet files, with video files in mp4 format at 30fps. The robot type is so_follower. Dataset features include: action data (6 float values representing shoulder pan, shoulder lift, elbow flex, wrist flex, wrist roll, and gripper positions), observation state (same 6 float joint positions as actions), two camera images (camera1 and camera2, both 480x640 resolution, 3-channel color videos), and metadata such as timestamp, frame index, episode index, index, and task index. The dataset is suitable for research in robot control, visual perception, and reinforcement learning.

提供机构:
KS325
搜集汇总
数据集介绍
KS325/skill-set-r2-wm 数据集图片
构建方式
该数据集依托于LeRobot框架构建,专为机器人模仿学习任务而设计。数据采集自so_follower型机器人,共包含320个演示片段,总帧数达235207帧,涵盖了五种不同的操作任务。每个片段均以30帧每秒的采样率记录,并拆分为1000帧大小的数据块,以parquet格式存储运动学状态与动作序列,同时将双视角(camera1与camera2)的640x480像素视频流编码为AV1格式的MP4文件,实现了高频非结构化数据的高效归档。
特点
数据集的核心特点在于其多模态、高保真的结构化设计。特征空间不仅包含6自由度的关节位置动作与状态信息,还同步记录了时间戳、帧索引与任务标签,便于进行时序建模与任务区分。两个同步摄像头的视频数据为视觉-运动联合学习提供了丰富的环境上下文。此外,数据集规模适宜(总数据量约300MB),并将全部320个片段划归为训练集,降低了预处理复杂度,尤其适合离线策略学习与行为克隆算法的验证。
使用方法
推荐通过LeRobot库加载与解析该数据集。用户可直接使用HuggingFace提供的可视化工具预览轨迹,或利用`lerobot.Dataset`接口按片段索引读取`action`、`observation.state`及`observation.images`等键值对,以构建模仿学习或离线强化学习的训练流水线。由于数据已预先分块并标准化,开发者仅需调用简单API即可完成批量采样与数据增强,从而聚焦于模型设计本身,无需关注底层存储细节。
背景与挑战
背景概述
在机器人学习领域,模仿学习与技能泛化能力的研究日益成为推动智能体自主作业的关键。skill-set-r2-wm数据集由Hugging Face社区基于LeRobot框架创建,旨在为机器人操作技能的采集与复用提供标准化基准数据集。该数据集涵盖了5种不同的操作任务,包含320个演示回合、超过23万帧的高频(30 FPS)观测数据,并记录了6维关节空间的动作与状态信息,以及来自两台摄像头的640×480像素视觉观测。数据集的发布填补了机器人技能学习领域在细粒度动作控制与多模态感知融合方面公开资源的空白,为研究如何从少量演示中学习鲁棒策略提供了重要支撑。
当前挑战
当前机器人操作技能学习面临的核心挑战在于如何从低维状态与高维视觉信号中提取有效的策略表征,并在不同物体与场景间实现泛化。skill-set-r2-wm数据集虽然提供了精细的关节动作与双视角视觉数据,但其规模有限(仅320个演示回合),使得在复杂动态环境下训练出具备强泛化能力的模型依然困难。此外,数据采集过程中需克服动力学模型失配与操控精度约束,确保演示轨迹的连贯性与多样性,同时保证视频与动作数据的时间同步质量。这些挑战共同制约了利用该数据集推动通用机器人操作策略迈向实际部署的进程。
常用场景
经典使用场景
skill-set-r2-wm数据集是面向机器人操作技能学习领域的高质量数据资源,其核心用途在于为模仿学习与行为克隆算法提供训练基础。该数据集收录了320条完整演示轨迹,涵盖5种不同的操作任务,每条轨迹均以30帧每秒的速率记录,包含六维关节空间的动作指令、机器人本体状态信息以及两个视角的高清视觉输入。借助这些多模态数据,研究者能够训练机器人从人类示范中直接习得精细的操作策略,从而在灵巧操控与泛化迁移方面取得突破。
实际应用
在实际产业场景中,skill-set-r2-wm数据集可被部署于服务机器人、工业协作机械臂以及智能仓储系统。例如,机器人可以学习从抓取、放置到精密装配的一系列连贯动作,以适应柔性生产线中的快速换产需求。同时,双摄像头视觉输入的设计使得机器人能够在复杂光照或遮挡环境下保持稳健的操作性能,从而降低了对结构化环境的依赖,提升了真实场景中的自主作业能力。
衍生相关工作
基于该数据集,衍生出了多项具有影响力的研究工作,包括应用于动态环境下的自适应行为克隆算法,以及结合扩散模型的高精度动作预测方法。此外,研究者利用其多任务特性开展跨技能迁移学习实验,验证了预训练策略在减少样本需求方面的有效性。还有工作以此为基础,构建了用于机器人技能组合学习的基准评测框架,这些工作共同推动了机器人操作技能从数据驱动到知识驱动的演进进程。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务