遇见数据集

leokswang/20122025-foldclo-03_lerobot_format

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集使用LeRobot工具创建,专注于机器人学领域,具体针对Yam机器人。数据集包含10个episodes,总计24888帧,帧率为30fps,所有数据均用于训练分割。数据以parquet格式存储,每个episode分为块,块大小为1000。数据集特征包括来自三个视角(顶部、左侧、右侧)的观测图像,每个图像分辨率为360x640x3;观测状态为14维浮点向量;动作为14维浮点向量;以及时间戳、帧索引、episode索引、索引和任务索引等元数据。数据集结构支持机器人控制和强化学习任务,但未提供主页、论文或引用信息。

This dataset was developed using the LeRobot toolkit, targeting the robotics domain with a specific focus on the Yam robot. It comprises 10 episodes, totaling 24,888 frames at 30fps, and all data is utilized for training segmentation tasks. The data is stored in Parquet format, with each episode divided into chunks of 1000. Dataset features include observed images from three viewpoints (top, left, right), each with a resolution of 360×640×3; observation states are 14-dimensional floating-point vectors; actions are 14-dimensional floating-point vectors; alongside metadata including timestamps, frame indices, episode indices, indices, and task indices. The dataset structure supports robotic control and reinforcement learning tasks, but no homepage, accompanying paper, or citation information is provided.

提供机构:
leokswang
搜集汇总
数据集介绍
leokswang/20122025-foldclo-03_lerobot_format 数据集图片
构建方式
该数据集基于LeRobot框架构建,专为机器人学习任务设计,源自allenai_20122025-foldclo-03项目。数据以Parquet格式存储,包含10个完整演示片段,总计24888帧,帧率为30FPS。构建时遵循统一的元信息结构,将数据组织为训练集(全部10个片段),每个片段通过chunk分块管理,路径模式为data/chunk-{episode_chunk:03d}/episode_{episode_index:06d}.parquet,确保了数据存取的高效性与标准化。
特点
数据集的核心特点在于其多模态感知与动作空间的丰富性。它包含三种视角的视觉观测(顶部、左侧、右侧),图像分辨率为360x640,提供了三维空间中的全方位场景信息;同时记录14维的机器人状态向量与对应的14维动作指令,维度对齐便于直接用于模仿学习或强化学习算法。此外,每帧附带时间戳、帧索引、片段索引等结构化元数据,支持精确的时间序列分析与任务重放。
使用方法
使用者可通过LeRobot库直接加载该数据集,利用其标准化的API快速获取观测图像、状态与动作数据。数据配置中指定了默认配置,文件路径统一采用Parquet格式,便于高效批量读取。训练时,可将train split(共10个片段)用于模型训练,借助features字段定义的dtype与shape信息,轻松构建数据加载流水线,特别适用于基于视觉的机器人操作策略学习的研究与开发。
背景与挑战
背景概述
该数据集由Hugging Face的LeRobot团队创建,发布于2025年,旨在为机器人学习领域提供标准化的训练数据。数据集基于YAM机器人平台采集,包含10个回合(共24,888帧)的单任务操作数据,属于AllenAI研究项目的一部分。其核心研究问题是如何通过多视角视觉输入(顶部、左右摄像头)与14维状态-动作空间,训练机器人完成精细操作任务。数据集的Apache-2.0许可协议降低了使用门槛,为机器人模仿学习与基于模型的控制研究提供了可复现的基准。尽管规模较小,但LeRobot标准化格式使其成为连接真实机器人数据与深度学习框架的关键桥梁,推动了机器人数据集的规范化进程。
当前挑战
当前数据集面临两大核心挑战。在领域问题上,机器人操作任务面临感知与动作的高维耦合难题——需要从三个360×640像素的视觉输入中提取语义特征,并映射至14维连续动作空间,这对模仿学习算法的样本效率与泛化能力提出了严苛要求。在数据集构建层面,仅有10个回合、单任务、无视频数据的规模限制了模型训练的有效性,帧率(30 FPS)与数据采集的一致性难以保证;此外,缺乏标准化的验证集划分与任务多样性,使得模型评估易受数据偏差影响,阻碍了跨数据集迁移能力的验证。
常用场景
经典使用场景
在机器人学习领域,该数据集专为模仿学习与行为克隆研究而设计,尤其适用于基于视觉的机械臂操控任务。其包含10个完整演示片段,总计近2.5万帧高频率(30fps)的多视角图像与14维状态-动作序列,为训练从像素到动作的端到端策略提供了标准化的样本空间。研究者可借助LeRobot框架,将多摄像头观测(顶部、左右视图)与本体感知状态作为输入,直接映射到连续动作输出,从而复现精细化的操纵技能。
解决学术问题
该数据集解决了机器人技能获取中数据稀缺与复现性差的根本难题。通过提供统一格式的、含精确时间戳的演示轨迹,它使得算法对比实验得以在公平基准下进行,尤其推动了模仿学习从单视角向多模态融合的范式演进。其开箱即用的特性降低了入门门槛,加速了从离线数据中学习复杂任务策略这一核心学术问题的探索,并为后续研究如长时序动作生成、跨任务迁移学习奠定了数据基础。
衍生相关工作
该数据集衍生工作主要集中在LeRobot生态下的策略架构创新,例如将扩散模型应用于动作序列的条件生成、或引入Transformer处理长程时间依赖。研究者常以此数据集为测试床,对比行为克隆与逆强化学习的性能差异,并衍生出数据增强方法(如随机裁剪、色彩抖动)对策略泛化能力影响的系统性分析。部分工作还探索了将多视角图像融合为隐式空间特征,从而提升视觉运动策略对光照和背景干扰的鲁棒性。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务