遇见数据集

HyeonseokE/SO101-cap_fold_towel_10fps_stride3_20epi

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是通过LeRobot创建的机器人任务数据集,专注于折叠毛巾任务。数据集包含20个总集数和14779个总帧数,数据以10fps的帧率采集,并分为训练集。数据集结构包括多个特征:观察状态(如左右机械臂的关节位置)、动作(控制命令)、图像观察(来自顶部、左手腕和右手腕摄像头的视频,分辨率为480x640,3通道)、末端执行器位置(左右机械臂的XYZRPY坐标)、技能信息(如自然语言描述、验证问题、类型、进度和目标位置)以及元数据(如时间戳、帧索引和集索引)。这些数据用于支持机器人学习任务,特别是双手机器人的操作和控制。

This dataset was created using LeRobot and focuses on a towel folding task. It includes a total of 20 episodes and 14779 frames, collected at 10fps, with a training split. The dataset structure comprises multiple features: observation states (e.g., joint positions for left and right arms), actions (control commands), image observations (videos from top, left wrist, and right wrist cameras with resolution 480x640 and 3 channels), end-effector positions (XYZRPY coordinates for left and right arms), skill information (e.g., natural language descriptions, verification questions, types, progress, and goal positions), and metadata (e.g., timestamps, frame indices, and episode indices). This data is intended for robot learning tasks, particularly for bimanual robot manipulation and control.

提供机构:
HyeonseokE
搜集汇总
数据集介绍
HyeonseokE/SO101-cap_fold_towel_10fps_stride3_20epi 数据集图片
构建方式
该数据集基于LeRobot框架构建,聚焦于机器人折叠毛巾的精细操作任务。通过SO101型双臂机器人以10帧每秒的采样频率采集示教数据,并采用步长为3的滑窗策略对原始动作序列进行重采样,最终形成20个完整演示回合(episodes),总计14779帧高质量运动记录。数据以Parquet格式存储结构化信息,同时将多视角视觉观测(顶部、左腕、右腕)编码为H.264视频文件,系统性地整合了关节角度、末端执行器位姿及夹爪状态等模态信息。
特点
数据集具备多模态融合与技能语义标注的双重特性。除经典的机器人状态与动作序列外,还创新性地引入了左右机械臂的细粒度技能描述(natural_language)、验证问题(verification_question)及进度标量(progress),并对应存储了技能目标位置的关节空间与笛卡尔空间表示。视觉观测采用640×480分辨率的多视角视频流,联合12维关节状态与6维末端位姿,为模仿学习提供了从原始感知到抽象语义的完整数据层级,支持基于语言指令的泛化策略训练。
使用方法
推荐通过LeRobot库的dataset API加载,指定参数`HyeonseokE/SO101-cap_fold_towel_10fps_stride3_20epi`即可自动解析Parquet数据与视频文件。研究者可调用`dataset[episode_index]`索引完整演示回合,并直接访问`observation.state`、`action`、`observation.images`等键以获取标准化输入。尤其建议利用`left_skill`与`right_skill`字段中的语言标注进行条件式行为克隆训练,或基于`goal_position`实现目标驱动的策略优化。
背景与挑战
背景概述
该数据集由HyeonseokE等人基于LeRobot框架创建,专为双臂机器人操作任务设计,聚焦于“折叠毛巾”这一精细操作场景。数据集采用SO101构型的双机械臂系统,通过10帧每秒的采样率记录了20个完整操作回合,共计14779帧数据。其核心研究问题在于为模仿学习提供包含多模态观测信息(如顶部及双腕部摄像头图像、关节状态、末端执行器位姿)与动作序列的高质量训练样本。作为机器人学习领域的重要资源,该数据集填补了真实环境中柔顺物体操作数据的稀缺性,为双臂协同策略的泛化性研究提供了基准,对推动家用服务机器人操作能力的发展具有显著意义。
当前挑战
数据集所解决的领域问题核心在于柔顺物体操作中存在的动态非结构化和高自由度控制挑战,如毛巾在折叠过程中的形变不可预测性、双臂运动协调的精确性要求以及视触觉信息的动态耦合。构建过程中面临的主要挑战包括:1)机械臂末端夹持器与柔性材料交互时需实时调整力位混合控制策略;2)多视角视频流与高维关节状态数据(12维动作空间)在10Hz采样下的同步与标定;3)在有限20个演示回合内需涵盖多样化折叠轨迹以支持策略泛化。此外,数据标注中融合自然语言指令及技能进度标签的范式设计也增加了构建复杂度。
常用场景
经典使用场景
在机器人操作与模仿学习领域,SO101-cap_fold_towel_10fps_stride3_20epi数据集为双臂协作中的精细织物折叠任务提供了标准化训练与评估平台。其经典使用场景聚焦于基于视觉与本体感知的端到端模仿学习,研究者可借助多视角视觉输入(顶部、左右腕部摄像头)及12维关节状态与动作序列,训练双臂机器人精准执行毛巾折叠操作。该数据集以10帧/秒的采样频率记录20个完整演示片段,覆盖从抓取、对折到压平的全流程动作轨迹,尤其适合验证行为克隆、逆强化学习等算法在非刚性物体操控中的泛化能力。
解决学术问题
该数据集直击软体物体操控中状态表征复杂与动作规划困难两大核心学术瓶颈。通过提供对齐的视觉-运动数据流,其解决了如何从高维图像中提取可泛化的折叠策略这一长期难题,使研究者得以量化评估模型在变形物体上的动态适应性。所收录的多模态特征(关节角度、末端执行器位姿、夹爪状态)为分析灵巧操作的因果依赖关系提供了基准,推动了关于任务分解与技能组合理论在非结构化环境中的实证研究。这些探索显著深化了学界对机器人柔顺控制与自适应抓取机制的理解。
衍生相关工作
以此数据集为基石,衍生出多项推动软体操控领域边界的工作。一方面,研究者利用其多视角视频与关节状态序列,对比了基于Transformer的扩散策略与隐式行为克隆在折叠任务上的样本效率差异;另一方面,有工作借助其技能元数据(natural_language与goal_position字段)探索了层次化模仿学习架构,将整体任务拆解为可复用的原子动作基元。此外,针对观测噪声与动态物体形变挑战,衍生算法引入对抗性数据增强以提升策略鲁棒性,这些成果共同构筑起从数据驱动到归纳推理的完整研究链条。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务