遇见数据集

leokswang/19122025-foldclo-02_lerobot_format

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个机器人任务数据集,使用LeRobot工具创建,专门针对Yam机器人平台。数据集中包含10个训练集,总计28928帧,帧率为30fps。数据集结构包括观察图像(顶部、左侧和右侧视角,分辨率为360x640的RGB图像)、机器人状态(14维浮点向量)、动作(14维浮点向量)以及时间戳、帧索引、集索引等元数据。数据以Parquet格式存储,适用于机器人学习和控制任务的研究与开发。

This dataset is a robotics task dataset created using the LeRobot tool, specifically designed for the Yam robot platform. It contains 10 training episodes with a total of 28,928 frames at a frame rate of 30fps. The dataset structure includes observation images (top, left, and right views as RGB images with 360x640 resolution), robot state (14-dimensional float vector), action (14-dimensional float vector), and metadata such as timestamp, frame index, and episode index. The data is stored in Parquet format and is suitable for research and development in robot learning and control tasks.

提供机构:
leokswang
搜集汇总
数据集介绍
leokswang/19122025-foldclo-02_lerobot_format 数据集图片
构建方式
该数据集基于LeRobot框架构建,源自于“allenai_19122025-foldclo-02”项目,旨在服务于机器人学习领域的研究。数据采集过程中,使用YAM类型的机器人平台,以30帧每秒的采样频率,记录了共计10个完整操作回合(episode),累积得到28928帧时序数据。数据集结构严格按照LeRobot的规范组织,以Parquet格式存储于按回合索引分块的路径中,便于高效读取与处理。每个数据样本包含来自顶部、左侧、右侧三个视角的RGB图像(360×640分辨率),以及14维的机器人状态向量与对应动作指令,同时辅以时间戳、帧序号、回合编号等元信息,形成一套完备的机器人操作行为记录。
特点
数据集最显著的特点在于其多模态观测信息的全面性与结构一致性。三视角图像提供了丰富的视觉上下文,有助于发展视觉-运动联合策略。状态与动作维度的对齐(均为14维)简化了模型输入的设计复杂度。所有回合共享同一任务索引,表明数据集聚焦于单一操作任务的精细化建模。此外,元信息文件中的分片机制(chunk_size=1000)使得大规模连续数据的分布式存储与流式加载成为可能,且训练集划分明确(前10个回合全部用于训练),为复现实验提供了坚实基础。
使用方法
使用者可借助LeRobot库便捷地加载该数据集,通过指定路径读取Parquet文件中的图像与状态序列。推荐采用标准的数据加载器(如PyTorch DataLoader)配合LeRobot提供的Dataset类进行迭代训练。训练时,可将三视角图像拼接或单独输入视觉编码器,与状态特征融合后预测动作输出。由于数据量适中(约2.9万帧),适合作为机器人模仿学习或行为克隆的基准测试集。同时,Parquet格式兼容Pandas等工具,便于进行数据分析和可视化调试。
背景与挑战
背景概述
该数据集由Allen AI团队于2025年创建,依托LeRobot框架构建,专注于机器人操作领域的研究。核心研究问题在于通过多视角视觉与状态-动作序列的数据驱动方式,提升机器人执行细粒度操作任务的泛化能力。数据集包含10个完整 episode、近2.9万帧记录,覆盖单一任务场景,并采用YAM机器人平台采集,以30帧/秒的高频采样提供丰富的运动细节。作为LeRobot生态的重要组成部分,该数据集致力于推动机器人学习从仿真环境向真实世界的迁移,为模仿学习、行为克隆等方向提供标准化的高保真训练样本,对机器人领域的实证研究具有基础性价值。
当前挑战
当前领域面临的挑战在于如何从有限数量的示范(仅10段Episode)中实现高鲁棒性的泛化,避免数据稀疏导致的过拟合问题。同时,多视角图像(顶部、左侧、右侧)与14维状态-动作空间的融合要求模型在时空一致性上具有极高精度,视角干扰或传感器噪声会显著影响学习效果。构建过程中,数据的采集与标注面临高成本与一致性保真的两难:确保不同设备、不同操作者下动作序列的重复可复现,以及数据集仅含单任务场景时跨任务迁移能力的缺失,均构成了结构化的技术瓶颈。
常用场景
经典使用场景
该数据集专为机器人模仿学习与示教复现研究而设计,借助LeRobot框架以标准化格式存储了10段由YAM机器人采集的操作演示数据,涵盖28928帧高分辨率视觉观测(顶部、左、右三视角)、14维关节状态与动作序列。其核心价值在于为端到端的行为克隆、扩散策略及基于Transformer的机器人操控模型提供多模态训练范例,使智能体能够从人类示教中学习精准的物体抓取、装配或操控技能,是验证机器人策略泛化与细粒度动作复现能力的经典基准。
解决学术问题
该数据集着力应对机器人策略学习中数据异构性与训练范式的两大关键瓶颈。一方面,通过标准化多维观测(三视角RGB图像与14维状态/动作向量)的序列化存储,解决了传统研究中因传感器配置差异导致的模型迁移困难;另一方面,10段高保真人机示教数据为研究“少样本模仿学习在复杂接触任务中的泛化边界”提供了可控实验平台,推动了视觉-运动联合表征学习、时序动作生成以及跨场景策略零样本迁移等学术问题的探索。
衍生相关工作
基于该数据格式与内容,衍生出一系列经典工作:在数据层面,研究者可将其扩展为多任务数据集(如叠加不同抓取位姿的示教序列),用于训练条件变分自编码器(CVAE)等生成式策略;在算法层面,该数据启发了对LeRobot框架中ACT(动作分块变压器)架构的改进实验,包括时序注意力机制优化与图像-状态早期融合策略。此外,基于标准化episode划分(chunk-000/episode_000000.parquet)的便利性,衍生出数据集蒸馏、跨机器人策略迁移等前沿方向,成为机器人基础模型训练的基础构件。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务