遇见数据集

HyeonseokE/SO101-cap_fold_towel_10fps_stride3_80epi

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是使用LeRobot创建的机器人领域数据集,专注于折叠毛巾任务。它包含80个episodes,总计58955帧数据,帧率为10fps。数据集提供了丰富的多模态信息,包括机器人状态观测(如左右机械臂的12个关节位置)、动作指令、多视角图像(来自顶部、左腕和右腕摄像头的RGB视频,分辨率480x640)、末端执行器位姿(XYZRPY坐标)、技能相关数据(如自然语言指令、验证问题、技能类型、进度和目标位置)以及时间戳和索引(帧、episode、任务)。数据以parquet文件格式存储,视频以mp4格式存储,适用于机器人学习、模仿学习或强化学习任务的研究和开发。

This dataset is a robotics dataset created using LeRobot, focusing on the task of folding towels. It contains 80 episodes with a total of 58,955 frames at 10 fps. The dataset provides rich multimodal information, including robot state observations (e.g., 12 joint positions for left and right arms), action commands, multi-view images (RGB videos from top, left wrist, and right wrist cameras at 480x640 resolution), end-effector poses (XYZRPY coordinates), skill-related data (such as natural language instructions, verification questions, skill types, progress, and goal positions), as well as timestamps and indices (frame, episode, task). The data is stored in parquet file format, with videos in mp4 format, suitable for research and development in robot learning, imitation learning, or reinforcement learning tasks.

提供机构:
HyeonseokE
搜集汇总
数据集介绍
HyeonseokE/SO101-cap_fold_towel_10fps_stride3_80epi 数据集图片
构建方式
机器人操作技能的提升离不开高质量的数据集支撑。SO101-cap_fold_towel_10fps_stride3_80epi数据集基于LeRobot框架构建,聚焦于双机械臂协同折叠毛巾的精细操作任务。该数据集通过SO101型从动机器人采集,共包含80个完整操作回合,总帧数达58955帧,采样频率设定为10帧每秒,并采用步长3的策略对轨迹进行下采样。数据以Parquet格式存储,分为1000帧大小的块,同时将多视角视频(顶视、左腕、右腕)以H.264编码的MP4文件独立保存,共计300MB的存储空间。数据集已预先划分为训练集(全部80个回合),免去了用户自行拆分的繁琐。
特点
该数据集在结构与内容上展现出鲜明的特色。首先,它提供了多模态的观测信息,包括12维的关节状态与动作数据(左、右臂各6个自由度)、6维末端执行器位姿,以及三个摄像机视角(480×640分辨率)的同步视频,为模仿学习提供了充分的状态-动作对。其次,数据集引入了层次化的技能标注系统,每个手臂的回合中均包含自然语言指令、验证问题、技能类型与进度,以及三种目标位置描述(关节空间、笛卡尔空间和夹爪状态),这种结构为任务分解和阶段化学习提供了丰富的信息。最后,数据集中还包含了时间戳、帧索引、回合索引等元数据,便于序列化建模与评估。
使用方法
使用该数据集时,推荐通过LeRobot库进行加载与迭代。用户可安装lerobot后,直接通过dataset = load_dataset('HyeonseokE/SO101-cap_fold_towel_10fps_stride3_80epi')拉取数据,其默认配置会自动解析Parquet和视频文件,并以字典形式返回每一帧的特征。对于模型训练,可以将观测图像(如observation.images.top)与状态向量拼接作为输入,以action向量作为监督标签,利用LeRobot内置的DataLoader对时序数据进行批量化采样。此外,数据集支持通过episode_index索引按回合提取完整轨迹,并结合技能标注中的自然语言字段进行条件化策略的学习与评估。
背景与挑战
背景概述
该数据集由研究者HyeonseokE等人基于LeRobot框架创建,聚焦于双臂仿人机器人(SO101)执行折叠毛巾这一精细操作任务,是机器人模仿学习与操作技能迁移研究的重要数据资源。自2020年以来,机器人领域对复杂柔性物体操作的关注度日益提升,折叠毛巾任务因其对感知、规划与协调控制的高要求,成为评估机器人灵巧操作能力的典型基准。该数据集包含80个演示片段,总帧数达58955帧,以10帧/秒的频率采集,涵盖了从关节角度、末端执行器位姿到多视角视觉图像(顶部、左右腕部)的完整状态空间,并记录了相应的动作序列与技能标签(如自然语言指令、验证问题、技能类型及目标位置)。其发布的Apache-2.0许可协议促进了开源社区在双臂机器人模仿学习算法上的协同研究,为后续的少样本学习、语言引导操作与技能泛化研究提供了标准化数据支撑。
当前挑战
所解决的领域问题方面,该数据集的挑战在于实现机器人对柔性、易变形物体的精准操作。与刚性物体不同,毛巾的物理特性(如褶皱、滑移)使状态估计与动作预测变得极其复杂,要求模型能够融合高维视觉特征与低维关节运动信息,并在有限演示数据中学习到鲁棒的折叠策略。构建过程中遇到的技术挑战包括:需设计可重复的演示采集协议以最小化人为操作变异,同步多视角视频流(640×480分辨率)与高频运动记录(10Hz)以保证时间对齐精度,同时标注丰富的任务标签(如折叠进度、技能类型与自然语言描述)以供多模态学习。此外,在有限计算资源下(总数据量约300MB),如何平衡视频压缩质量与模型训练效率,以及确保左右臂协作时的运动学一致性,亦是数据集构建中的关键难点。
常用场景
经典使用场景
在机器人学习与具身智能研究领域,SO101-cap_fold_towel_10fps_stride3_80epi数据集专注于精细灵巧操作任务,尤其是叠毛巾这一日常家务场景。该数据集通过双机械臂(SO101机器人)采集了80个完整演示回合,包含58,955帧同步信息,涵盖左右各6个关节角度、末端执行器位姿、夹爪状态以及顶部和双腕共三路高清视觉输入(480×640,10fps)。经典使用方法是以观测图像和关节状态作为输入,以机械臂的动作序列为预测目标,训练模仿学习或离线强化学习模型,使机器人能端到端地复现叠毛巾的连续操作策略。
衍生相关工作
以此数据集为基础,衍生出多个方向的重要工作:在算法层面,研究者将其作为LeRobot基准套件中的标准化测试案例,用于比较行为克隆、扩散策略和ACT等模仿学习框架在柔性物体操作上的性能差异。数据集的双臂协同结构催生了针对左右手任务分配与避碰规划的专用方法。数据集中明确的子技能分割(如进度指示)启发了层次化技能提取和时序分段研究,相关论文探索了将叠毛巾分解为'抓起—折叠—压平'等可复用的子策略模块。此外,该数据也用于评估视觉-语言-动作多模态大模型在精细操作指令理解方面的局限性。
数据集最近研究
最新研究方向
在具身智能与机器人操控领域,SO101-cap_fold_towel_10fps_stride3_80epi数据集聚焦于双机械臂协调执行精细折叠任务的前沿探索。该数据集搭载LeRobot框架,记录了SO101型双臂机器人以10帧/秒速率、跨越80个演示回合的毛巾折叠动作序列,融合了多视角视觉(顶视与左右腕部摄像头)及12维关节状态与动作空间,为学习复杂织物变形操控提供了高密度轨迹样本。近期研究热点围绕利用此类数据训练基于模仿学习的策略,推动机器人从静态程序化控制向具备泛化能力的灵巧操作进化,尤其在非刚体对象处理上实现突破。该数据集的出现,呼应了家庭服务与柔性制造中对机器人自适应操作能力的需求,其结构化的技能注释(如自然语言描述与验证问题)更暗示了向语言引导的零样本技能迁移的潜力,为构建可泛化的机器人操作基模型奠定了数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务