遇见数据集

HyeonseokE/SO101-cap_fold_towel_10fps_stride3_40epi

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是使用LeRobot框架创建的机器人学数据集,专注于一个具体任务:折叠毛巾(cap_fold_towel)。数据集包含40个完整的情节(episodes),总计29447帧数据,帧率为每秒10帧。数据以parquet格式和视频文件存储。特征包括机器人状态观察(如左右臂的12个关节位置、末端执行器的XYZRPY坐标)、机器人动作(对应关节位置)、多视角图像观察(来自顶部摄像头、左腕摄像头和右腕摄像头的480x640分辨率RGB视频)、技能相关信息(如自然语言指令、验证问题、技能类型、进度和关节/笛卡尔空间的目标位置),以及时间戳、帧索引、情节索引等元数据。机器人类型为so101_follower,表示一个双臂机器人系统。数据集适用于机器人学习、模仿学习或强化学习任务的研究和开发。

This dataset is a robotics dataset created using the LeRobot framework, focusing on a specific task: cap_fold_towel. It contains 40 total episodes with 29,447 frames at a frame rate of 10 fps. Data is stored in parquet and video file formats. Features include robot state observations (e.g., 12 joint positions for left and right arms, end-effector XYZRPY coordinates), robot actions (corresponding joint positions), multi-view image observations (RGB videos from top, left wrist, and right wrist cameras at 480x640 resolution), skill-related information (e.g., natural language instructions, verification questions, skill type, progress, and goal positions in joint/Cartesian space), and metadata such as timestamps, frame indices, and episode indices. The robot type is so101_follower, indicating a dual-arm robot system. The dataset is suitable for research and development in robot learning, imitation learning, or reinforcement learning tasks.

提供机构:
HyeonseokE
搜集汇总
数据集介绍
HyeonseokE/SO101-cap_fold_towel_10fps_stride3_40epi 数据集图片
构建方式
SO101-cap_fold_towel_10fps_stride3_40epi数据集由Hugging Face LeRobot框架构建,旨在为机器人操作任务提供标准化训练样本。数据通过SO101型号的跟随机器人采集,聚焦于单任务——折叠毛巾,共包含40个完整操作回合,总帧数达29447帧。数据以10帧每秒的采样率记录,采用步长为3的降采样策略以平衡时间连续性与数据冗余。所有观测数据被分割为1000帧大小的数据块,以Parquet格式存储结构化数值特征,同时将多视角高清视频流(顶部、左腕、右腕视角,分辨率为640×480像素)编码为H.264格式的MP4文件,确保视觉信息的紧凑保存。
特点
该数据集的核心特点在于其精细的多模态对齐与技能标注体系。它同时记录了12维关节状态(包括双机械臂的肩部、肘部、腕部及夹爪位置)与对应的12维动作指令,并在末端执行器位姿中融入六自由度空间坐标。特别地,数据集引入了左右机械臂分立的技能标注字段,涵盖自然语言描述、验证问题、技能类型及进度指标,并附带关节空间与任务空间的双重目标位置,为分层模仿学习提供结构化监督信号。此外,每一帧均附带时间戳、帧索引及回合索引,便于时序模型训练。
使用方法
该数据集通过LeRobot库实现无缝加载,推荐从Hugging Face Datasets接口直接调用。用户可利用`lerobot`的`load_dataset`函数按回合或帧粒度读取数据,默认将全部40回合作为训练集。多模态数据需通过Parquet文件提取数值特征,并通过视频文件路径流式解码图像序列。数据集支持直接用于行为克隆、逆动力学建模或多模态融合策略的训练,技能字段可结合自然语言指令引导模型理解子任务意图。使用时应注意处理多视角图像的空间对齐与帧率同步,并利用提供的进度指标筛选特定技能阶段的数据子集。
背景与挑战
背景概述
该数据集由研究人员HyeonseokE基于LeRobot框架创建,专注于面向双机械臂协同操作的机器人学习领域。其核心研究问题在于如何通过模仿学习使机器人掌握精细的织物折叠操作——具体为将毛巾整齐折叠放入收纳盒的任务。数据集包含了由SO101 Follower型机器人采集的40条演示轨迹,以10帧/秒的采样频率记录了29447帧多模态数据,涵盖左右臂关节角度、末端执行器位姿、顶部及双腕部摄像头图像等丰富信息。作为机器人操作技能学习的重要资源,该数据集为研究面向柔性体操作的双臂协同策略提供了标准化训练语料,推动了从示教数据到可泛化操作策略的迁移研究。
当前挑战
在领域层面,织物折叠任务面临柔性物体状态建模复杂、双臂协调控制难度高、操作过程不可逆等固有难题,要求算法同时处理视觉反馈、力量感知与时序规划。在数据集构建过程中,主要挑战包括:确保40条高质量演示数据的一致性与动作精度,通过多视角摄像头精确同步捕获480×640分辨率的场景图像与关节状态;设计合理的特征空间以描述左右臂各自6自由度的关节运动与末端位姿;有效标注技能类型、语言指令及进度信息以支撑分层模仿学习架构。此外,数据采集的硬件稳定性、动作指令的可复现性以及视频与状态数据的时序对齐精度均为实现可靠训练必须克服的工程难题。
常用场景
经典使用场景
在机器人操作与模仿学习领域,SO101-cap_fold_towel_10fps_stride3_40epi数据集专注于面向精细操作任务的技能习得研究。该数据集收录了双机械臂系统执行折叠毛巾这一典型柔性物体操作任务的完整轨迹,涵盖40个演示回合,包含来自顶部、左右腕部三个视角的高清视频序列、关节角度状态、末端执行器位姿及夹爪状态等多模态信息。其经典使用场景在于为行为克隆、逆强化学习及基于视觉的运动规划算法提供训练与评估基准,尤其适用于研究如何将人类演示中蕴含的灵巧操作模式迁移至机器人系统中,从而突破传统刚性物体操作框架的局限。
解决学术问题
该数据集的核心学术贡献在于解决了柔性物体操作中状态空间建模困难与专家数据匮乏两大瓶颈问题。通过提供高保真的多视角视觉观测与完整的运动学状态对应关系,研究人员得以探索视觉-运动联合表征学习范式,有效缓解了部分可观测马尔可夫决策过程中的遮蔽状态难题。此外,数据集中精心标注的技能元信息(包括自然语言指令、验证问题及子任务进度)为分层强化学习与任务分解方法提供了结构化监督信号,推动了从原始传感器数据到语义化行为描述的抽象层次跨越,对机器人自主泛化能力的研究具有深远的理论价值与启发意义。
衍生相关工作
基于该数据集格式与任务范式,研究者已发展出一系列具有里程碑意义的经典工作。例如,利用LeRobot框架构建的扩散策略网络通过在潜在空间中对多模态演示进行概率建模,显著提升了策略在柔性物体操作中的鲁棒性。另一条技术路线则侧重于跨任务元学习,将折叠毛巾任务中的经验知识迁移至衣物整理、布料展开等衍生操作中,验证了共享状态表征的有效性。此外,数据集中嵌入的语言指令与技能进度信息催生了自然语言引导的机器人任务规划研究,以RT-2等视觉-语言模型为典范,开创了将大语言模型先验融入低层运动控制的崭新范式,推动机器人学习向更通用的人机协同方向演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务