遇见数据集

leokswang/22122025-foldclo-03_lerobot_format

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集使用LeRobot工具创建,专注于机器人学任务,具体针对YAM机器人。数据集包含10个训练片段,总帧数为24193,帧率为30fps。数据以parquet格式存储,结构包括观测图像(顶部、左侧、右侧视角,分辨率为360x640x3)、状态观测(14维浮点数组)、动作(14维浮点数组)以及时间戳、帧索引、片段索引等元数据。数据集未提供主页或论文信息,许可证为Apache-2.0。

This dataset was created using the LeRobot tool and focuses on robotics tasks, specifically for the YAM robot. It contains 10 training episodes with a total of 24193 frames at 30fps. The data is stored in parquet format and includes observation images (top, left, and right views with resolution 360x640x3), state observations (14-dimensional float32 array), actions (14-dimensional float32 array), and metadata such as timestamps, frame indices, and episode indices. No homepage or paper information is provided, and the license is Apache-2.0.

提供机构:
leokswang
搜集汇总
数据集介绍
leokswang/22122025-foldclo-03_lerobot_format 数据集图片
构建方式
该数据集依托于LeRobot框架构建,源自allenai_22122025-foldclo-03机器人操控任务。数据采集通过YAM型机器人执行单一任务,共收集10个完整的操作轨迹片段,累计24193帧时序数据,帧率为30 FPS。所有轨迹被统一划分为训练集,并分块存储为Parquet格式文件,每个块包含1000个片段,以提升数据加载效率。数据路径与视频路径采用模板化命名,便于自动化处理。
特点
数据集包含多模态观测与动作信息,其观测空间由三个360×640像素的RGB图像(顶部、左侧、右侧)以及14维浮点型状态向量构成,动作空间同样为14维连续控制信号。每个样本均附带时间戳、帧索引、片段索引及任务索引等元数据,便于时序建模与任务追踪。数据采用Apache-2.0许可证发布,结构清晰,扩展性强。
使用方法
用户可通过LeRobot库直接加载该数据集,利用其提供的API便捷地访问多模态数据流。使用时需指定训练集划分,并依据features字段定义的数据类型与形状解析观测与动作张量。图像数据为无视频压缩的原始帧,适合离线强化学习或模仿学习训练。数据集还支持自定义批处理与分块加载策略,高效适配机器人学习模型的训练流程。
背景与挑战
背景概述
在机器人学习领域,模仿学习与行为克隆技术的进步催生了对高质量、具身化数据集的需求,此类数据需包含多模态感知信息与精确的动作序列,以支撑复杂操作任务的泛化与迁移。该数据集由Hugging Face社区基于LeRobot框架构建,于2025年初步成型,依托于Allen人工智能研究所公开的机器人操作数据收集活动。核心研究聚焦于利用“YAM”型机器人平台,探索在折叠衣物这一精细操作任务中,通过10个示范片段、总计24193帧的高频观测数据(包括顶部、左侧、右侧三视角RGB图像及14维状态向量),驱动机器人学习精准的14维动作控制策略。其设计广泛遵循Apache-2.0开源协议,并采用标准化的Parquet存储与分块结构,为后续大规模机器人行为克隆研究及多任务学习提供了可复现的数据基础,在推动具身智能体从示教中获取灵巧操作能力方面具有标杆意义。
当前挑战
该数据集所应对的领域挑战在于解决机器人柔性物体操作(如折叠衣物)中存在的状态高维性、变形不可预测性及观测-动作映射的复杂非线性问题,相较于刚体抓取,衣物折叠要求策略对局部纹理与全局拓扑变化具备鲁棒理解。构建过程中面临的挑战尤为显著:首先,仅依靠单一任务与10个示范片段的有限样本量,极易导致模仿策略过拟合至特定初始状态或采集时的环境噪声,缺乏对布料不同皱褶与摆放方式的泛化能力;其次,24193帧中未包含视频流数据,而依赖离散帧间的状态对齐,增加了时间连续性建模的难度;此外,三视角视觉输入与14维状态数据的高频同步校准,对硬件传感器标定及数据预处理流水线提出了严苛要求,任何时间戳或视角偏差均会引入策略学习的系统性误差。
常用场景
经典使用场景
在机器人学习领域,该数据集作为演示数据集的典型范例,专为模仿学习与离线强化学习算法设计。其采用LeRobot标准格式,记录了YAM型机器人在单任务下10个完整轨迹的精细操作数据,涵盖多视角视觉观测(顶部、左、右三路高清图像)、14维状态向量及对应动作序列,为机器人从演示中习得复杂操控技能提供了高质量的多模态训练资源。
解决学术问题
该数据集有效解决了机器人学习中数据标准化与可复现性不足的学术难题。通过统一的数据格式和结构化存储,研究者得以聚焦于算法创新而非数据预处理,推动了模仿学习、行为克隆及离线策略优化等方向的深入探索。其意义在于为跨机构、跨平台的机器人学习研究提供了可复用的基准数据资源,加速了学术成果的验证与比较。
衍生相关工作
该数据集衍生了众多经典工作,包括基于扩散策略的机器人动作生成模型、用于多模态融合的视觉-状态编码器以及高效的离线强化学习算法如IQL和CQL。此外,研究者以此为基础开发了跨任务泛化的元学习框架,以及通过数据增强提升策略鲁棒性的方法,共同推动了机器人学习从单一演示到通用能力的范式演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务