遇见数据集

HyeonseokE/SO101-cap_fold_towel_10fps_stride3_60epi

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个机器人学数据集,专门用于折叠毛巾任务,由LeRobot创建。数据集包含60个训练集片段,总计44169帧,以10帧/秒的速率采集。数据格式包括Parquet文件和相关视频文件。数据集特征丰富,涵盖机器人状态观测(如左右机械臂的12个关节位置)、动作指令、多视角视频观测(顶部、左腕和右腕摄像头,分辨率480x640)、末端执行器位置(XYZRPY坐标)、技能信息(如自然语言描述、验证问题、技能类型、进度和目标位置),以及时间戳和索引信息。这些数据适用于机器人控制、模仿学习或强化学习任务。

This dataset is a robotics dataset specifically designed for the task of folding towels, created using LeRobot. It contains 60 training episodes with a total of 44,169 frames, captured at 10 frames per second. The data is stored in Parquet files along with associated video files. The dataset features comprehensive observations including robot state (e.g., 12 joint positions for left and right arms), action commands, multi-view video observations (top, left wrist, and right wrist cameras at 480x640 resolution), end-effector positions (XYZRPY coordinates), skill information (such as natural language descriptions, verification questions, skill types, progress, and goal positions), as well as timestamps and indexing. This data is suitable for robotics control, imitation learning, or reinforcement learning tasks.

提供机构:
HyeonseokE
搜集汇总
数据集介绍
HyeonseokE/SO101-cap_fold_towel_10fps_stride3_60epi 数据集图片
构建方式
该数据集基于LeRobot框架构建,专注于机器人折叠毛巾这一精细操作任务。数据采集采用SO101型双臂机器人,以10帧/秒的采样频率记录60个完整操作回合,并通过步长3的帧采样策略进行数据增强。每个回合包含约736帧的连续观测序列,涵盖机器人的关节状态、末端执行器位姿及三视角视觉图像(顶部与左右腕部摄像头),共计44169帧高质量数据。数据以Parquet格式存储结构化状态与动作信息,视频流则采用H264编码的MP4格式保存,总数据量约300MB,其中视频数据占200MB,充分保留了操作过程的时空细节。
特点
数据集的核心特色在于其多维异构信息融合架构。观测空间同时包含12维关节角度、6维末端执行器位姿及三路640×480像素的RGB视频流,形成对操作环境与机器人状态的完整感知。动作空间精确对应12个自由度(双臂各6关节),并配备左右臂独立的技能元数据,涵盖自然语言描述、验证问题及目标关节位置等结构化标注。60个回合均匀划分至训练集,无测试集拆分,适合开展模仿学习研究。数据的时间戳与帧索引机制确保了时序对齐的精确性,为时序建模任务提供了坚实的数据基础。
使用方法
研究者可通过LeRobot数据加载工具直接读取Parquet与视频文件。推荐使用HuggingFace提供的可视化界面预览数据集内容。建模时可将12维状态向量与三路视频帧作为输入特征,输出对应的12维动作指令。数据集的技能标注字段(如自然语言描述与目标位姿)支持多模态任务学习,既可训练端到端策略网络,也可开发分层或模块化控制算法。需注意所有视频已按固定分辨率编码,无需额外预处理;若需时序建模,可利用frame_index字段构建滑动窗口训练样本。数据集采用Apache-2.0许可,允许自由使用与二次开发。
背景与挑战
背景概述
SO101-cap_fold_towel_10fps_stride3_60epi数据集由HyeonseokE团队基于LeRobot框架创建,专注于机器人操作技能的学习与模仿。该数据集通过双机械臂(so101_follower)执行折叠毛巾的精细操作任务,记录了60个完整演示片段,总计44169帧多模态数据。研究核心在于解决机器人对柔性物体(如毛巾)的操控难题,通过捕捉高精度状态信息(12维关节角度)、视觉观测(三视角RGB视频)及技能标签(自然语言描述与验证问题)等,为模仿学习、行为克隆及技能迁移提供基准。其影响力体现在推动机器人从固定程序向数据驱动的灵巧操作范式转变,为家庭服务场景中的非刚体操作研究提供了标准化数据支撑。
当前挑战
所解决的领域问题包括:柔性物体(如毛巾)的折叠操作因其形变复杂性而长期制约机器人研究,该数据集通过多模态融合(视觉、关节状态、末端执行器位姿)为学习形变-动作映射关系提供了突破口。构建过程中面临的技术挑战有三:其一,高精度同步采集10fps帧率下的多源数据(视频、力觉、关节角),需解决不同传感器间的时空对齐问题;其二,复杂技能拆解与标注,如将“折叠毛巾”分解为子技能并附加自然语言验证问题,增加了数据结构化难度;其三,双机械臂协同操作的遮挡与碰撞规避,尤其在末端执行器逼近目标时,需保证观测数据的完整性。
常用场景
经典使用场景
SO101-cap_fold_towel_10fps_stride3_60epi数据集在机器人操作与模仿学习领域占据着举足轻重的地位。该数据集记录了双臂机器人SO101执行折叠毛巾这一精细操作任务的完整过程,涵盖了60个示范片段,共计约4.4万帧。通过同步采集多视角视觉图像(含顶部和左右腕部摄像头)、12维关节状态与动作序列以及末端执行器位姿等信息,它为研究基于视觉的机器人技能学习提供了高质量的多模态示范数据。研究者可借此训练模仿学习模型,使机器人从示例中习得折叠毛巾所需的灵巧操作策略,是探索复杂柔性物体操作行为建模与泛化能力的理想基准。
衍生相关工作
SO101-cap_fold_towel数据集衍生了一系列具有影响力的经典研究工作。在模仿学习方向,基于该数据集的工作推动了扩散策略(Diffusion Policy)与基于Transformer的动作序列建模在细粒度操作任务中的应用,实现了从视觉输入到高维动作输出的端到端学习。在技能分解领域,研究者利用其标注的左右技能标签开发了模块化技能库,结合元学习实现了对新场景的快速适应。此外,该数据集还催生了针对柔性物体状态估计与动力学建模的专项研究,通过引入物理感知网络提升了操作成功率。这些工作共同构成了从数据处理到算法验证的完整知识链条。
数据集最近研究
最新研究方向
该数据集聚焦于双臂协作机器人在精细操作任务中的应用,尤其是在非结构化环境下的柔性物体操作领域,如毛巾折叠。随着具身智能与模仿学习的蓬勃发展,如何让机器人从少量示范中习得复杂且可泛化的技能成为前沿热点。该数据集通过LeRobot框架采集了60个高质量演示回合,包含多视角视觉(顶部与左右腕部摄像头,480×640分辨率)及12维关节状态与动作数据,并引入了自然语言指令与技能验证机制,为跨模态的机器人技能学习研究提供了宝贵素材。这一方向紧密关联着家庭服务机器人、工业柔性装配等实际应用场景,对于推动机器人通用技能学习范式从实验室走向现实具有重要示范意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务