遇见数据集

leokswang/23122025-foldclo-01_lerobot_format

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个机器人学数据集,使用LeRobot工具创建,专为YAM机器人设计。它包含9个episodes,总计16772帧,帧率为30fps,数据以parquet格式存储。数据集提供了多模态观测数据,包括来自三个摄像头(顶部、左侧、右侧)的图像(每个图像尺寸为360x640x3),以及14维的机器人状态观测。此外,还包含14维的动作数据、时间戳、帧索引、episode索引等元数据。该数据集适用于机器人控制任务的训练和评估,支持强化学习或模仿学习应用。

This robotics dataset was developed using the LeRobot toolkit and is specifically tailored for the YAM robot. It consists of 9 episodes with a total of 16772 frames at a frame rate of 30 fps, and the data is stored in Parquet format. The dataset provides multimodal observation data, including images from three cameras (top, left, right) with a resolution of 360×640×3 per image, as well as 14-dimensional robot state observations. Additionally, it also contains 14-dimensional action data, timestamps, frame indices, episode indices and other metadata. This dataset is suitable for training and evaluation of robotic control tasks, and supports applications of reinforcement learning or imitation learning.

提供机构:
leokswang
搜集汇总
数据集介绍
构建方式
本数据集依托于Hugging Face LeRobot框架构建,旨在为机器人学习领域提供标准化的数据存储与处理范式。数据采集自“yam”型号机器人,共收录9个独立任务片段(episode),累积帧数达16,772帧,所有数据以一致的30帧/秒速率记录。构建过程中,数据被划分为一个训练集块(chunk),每个块容量为1,000帧,并以Apache Parquet列式存储格式存放于“data”目录下。元信息通过“meta/info.json”文件精确定义,涵盖代码库版本v2.1及各特征向量的维度与数据类型,确保了数据的高效存取与可复现性。
特点
该数据集最显著的特点在于其多模态感知与动作信号的融合。观测空间(observation)包含了来自顶部、左侧和右侧三个视角的高清彩色图像(分辨率360×640),以及一个14维的机器人状态向量(observation.state),表征关节角度或末端执行器位姿等信息。动作空间(action)同样为14维浮点向量,与状态空间维度匹配,便于实现端到端的模仿学习策略。此外,每条记录均附有时间戳、帧索引及任务索引等辅助标识,为时序对齐与场景分割提供了便利。尽管片段数量有限,但每个片段均包含丰富的帧序列,适合用于小样本学习或策略微调等场景。
使用方法
使用此数据集时,推荐首选LeRobot相关API进行加载。用户可通过指定`23122025-foldclo-01_lerobot_format`数据集名称并配置默认配置文件,直接利用数据路径模板(`data/chunk-{episode_chunk:03d}/episode_{episode_index:06d}.parquet`)批量化读取parquet文件。在训练阶段,可将观测图像数据经预处理后输入视觉编码器,同时将14维状态与动作向量分别作为策略网络的输入和目标输出。由于数据集已预定义训练集划分(含全部9个片段),用户无需自行分割,即可快速搭建用于行为克隆或强化学习策略迁移的基础实验管线。
背景与挑战
背景概述
该数据集由LeRobot社区基于开源机器人学习框架创建,专注于利用YAM型机器人进行精细化操作任务的数据采集与标准化。其核心研究问题在于为机械臂抓取与放置等基础技能提供高质量的多模态演示数据,涵盖多视角视觉观测(顶部、左侧、右侧摄像头)与14维状态-动作空间。数据集创建于2025年,包含9个完整任务片段、16,772帧时序数据,采用Apache-2.0开源协议发布,旨在推动模仿学习与机器人操控领域的算法复现与比较。尽管规模较小,其标准化的LeRobot格式为机器人学习社区提供了可重复利用的基准资源,尤其适用于评估小样本学习与迁移泛化能力。
当前挑战
该数据集所应对的领域问题核心在于机器人操作的模仿学习泛化挑战:如何在有限演示数据下习得鲁棒的闭环控制策略,应对视觉偏移、物体位姿变化及动态环境干扰。构建过程中面临数据采集的精确性难题——14维状态与动作空间需同步高频记录(30fps),而多摄像头时序对齐与噪声抑制构成技术瓶颈。此外,单任务(9个片段)的规模限制导致模型易过拟合,需依赖数据增强与正则化方法,但视觉-动作耦合关系复杂,过度增强可能引入物理不合法样本。最终,跨机器人平台迁移时坐标系与动静态参数的适配问题,进一步制约了该数据集在通用机器人学习中的普适性。
常用场景
经典使用场景
在机器人学习与模仿学习研究领域,该数据集作为基于LeRobot框架构建的标准化数据源,为YAM机器人平台的操作技能学习提供了高质量的多模态观测信息与动作标签。每个轨迹包含来自顶置、左侧和右侧三个视角的640×360像素RGB图像,以及14维的机器人状态与动作向量,采样频率达30帧每秒。这种丰富的时间序列结构特别适用于训练从视觉观测到连续动作的端到端策略模型,如行为克隆或隐式策略,尤其在桌面级精细操作任务中展现出卓越的适用性。
衍生相关工作
基于该数据集格式和结构,研究者已衍生出多项富有影响力的工作。例如,LeRobot社区围绕其标准化接口开发了通用的策略训练流水线,支持行为克隆、扩散策略与强化学习微调等多范式融合。在此基础上,跨本体迁移研究尝试利用该数据集中的状态-动作映射关系训练通用操作基础模型,而数据增强方法则通过视角扰动和时序掩码策略提升了策略的鲁棒性。这些衍生工作共同构成了一个从单一任务演示向多任务、多环境智能体演进的技术脉络,持续推动着具身智能领域的边界拓展。
数据集最近研究
最新研究方向
在机器人学习领域,数据驱动的行为克隆与模仿学习正经历从仿真环境向真实世界迁移的关键转折。该数据集专为YAM型机器人设计,采用LeRobot框架的标准化格式,包含9个演示片段、逾1.6万帧高保真观测数据,涵盖三视角视觉图像与14维状态-动作空间。当前前沿方向聚焦于利用此类小样本但结构精良的真实操作数据集,结合扩散策略或基于Transformer的决策架构,突破传统强化学习对大量试错交互的依赖。该数据集的发布呼应了机器人社区对可复现、跨平台数据基准的迫切需求,尤其在精细化操作与多模态感知融合领域,为从闭环节点控制迈向开放世界通用具身智能提供了重要的实验基础,其Apache-2.0许可进一步促进了学术与工业界的协同创新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务