leokswang/21122025-foldclo-03_lerobot_format
收藏官方服务:
资源简介:
这是一个由LeRobot创建的机器人数据集,包含10个episodes和20784个frames,数据以parquet格式存储。数据集涉及机器人任务,特征包括来自顶部、左侧和右侧摄像头的图像观察(分辨率360x640,3通道),以及14维的状态观察和动作数据。数据采集频率为30fps,适用于机器人学习和控制研究。
This is a robotic dataset created by LeRobot, which comprises 10 episodes and 20784 frames, and is stored in Parquet format. The dataset centers on robotic tasks, with data modalities including image observations from top, left and right cameras (resolution: 360×640, 3 channels), as well as 14-dimensional state observations and action data. Collected at 30 frames per second (fps), this dataset is intended for research in robotic learning and control.
提供机构:
leokswang搜集汇总
数据集介绍

构建方式
该数据集依托于LeRobot框架构建,专为机器人学习领域设计,采用Apache-2.0开源许可协议。数据采集自YAM型机器人,共包含10个演示片段(episodes),总计20784帧数据,采样频率为每秒30帧。数据集以Parquet格式存储,通过分块(chunk)策略组织,每个分块容量为1000帧,确保大规模数据的高效存取。数据路径遵循`data/chunk-{episode_chunk:03d}/episode_{episode_index:06d}.parquet`的命名规则,便于按帧索引和片段索引检索。所有训练数据统一划分至训练集,未设置验证或测试子集,符合端到端模仿学习场景中单一任务重复演示的需求。
特点
数据集的核心特点在于其多模态融合与精细化的状态-动作表征。观测空间涵盖三路视觉图像(顶部、左侧、右侧),分辨率均为360×640像素,支持从多视角捕捉机器人操作环境的视觉细节。同时,系统状态向量包含14维浮点型数据,可精确描述机器人关节位姿或末端执行器状态。动作空间亦为14维连续值,与状态空间维度一致,便于构建状态-动作对进行策略学习。数据集还附带了时间戳、帧索引、片段索引等元信息,为时序建模和轨迹回放提供了基础支持。值得注意的是,所有感知数据均未压缩为视频格式,而是以图像序列形式直接存储,平衡了存储效率与读取速度。
使用方法
使用者可通过LeRobot库直接加载该数据集,利用其内置的`load_dataset`函数指定HuggingFace数据集标识符即可。数据集默认配置名为`default`,数据文件统一位于`data/*/*.parquet`路径下。在训练过程中,用户可基于`episode_index`字段循环遍历各个演示片段,或通过`frame_index`和`index`字段实现按帧随机采样。观测图像需经维度调整(如转换为通道优先格式)后输入神经网络,状态与动作数据可直接作为连续控制信号的输入或输出。建议结合LeRobot的`Dataset`类与`DataLoader`进行批处理,并利用其提供的标准化工具对传感器数据做归一化处理,以适配模仿学习或强化学习算法的训练流程。
背景与挑战
背景概述
该数据集由Hugging Face团队主导创建,依托于LeRobot开源框架,于2025年发布,旨在推动机器人操作策略的模仿学习与泛化研究。核心研究问题聚焦于如何通过高保真度的多模态传感器数据(包括多视角图像与关节状态)训练机器人执行精密操作任务。数据集包含10个完整任务轨迹,共计20784帧连续观测序列,采用YAM机器人平台采集,其标准化结构与Apache-2.0开源协议为机器人学习领域提供了可复现的基准。该数据集的出现弥补了现有机器人数据集在真实场景多视角感知与细粒度动作记录方面的不足,为力控操作、轨迹优化及零样本迁移等前沿课题奠定数据基础。
当前挑战
当前机器人操作学习面临三大挑战:首先,真实环境中的物理交互要求数据具备高频状态反馈与高维动作空间的精确对应,而现有数据集的采样频率(30FPS)与动作维度(14维)仍难以覆盖高速动态任务中的复杂动力学特性;其次,构建过程中需解决多相机系统标定误差与动作执行器延迟的同步问题,10个轨迹的有限规模限制了模型对非结构化场景的泛化能力;最后,缺乏统一的任务语义标注与负样本采集机制,导致强化学习训练时面临数据效率瓶颈,以及长程操作策略中的因果推断难题。
常用场景
经典使用场景
在机器人学习领域,该数据集是用于训练和评估基于视觉的机器人操作策略的经典资源。它包含由YAM机器人平台采集的10个演示片段,总帧数超过两万帧,以30帧每秒的高频率记录了三视角视觉图像(顶部、左侧、右侧)以及14维的状态与动作序列。研究者常利用此类多模态数据,借助行为克隆或模仿学习范式,训练机器人学会从视觉输入直接映射到精确动作,从而完成特定的抓取或操控任务。
解决学术问题
该数据集有效解决了机器人技能学习中数据获取昂贵、标注困难的核心学术问题。通过提供标准化、结构化的演示数据(遵循LeRobot格式),它使得研究者无需从头搭建数据采集系统,即可对比不同模仿学习算法(如Diffusion Policy、ACT)的性能。其意义在于推动了机器人学从实验室特定环境向可复现、可扩展的研究范式转型,为验证模型在视觉观察下的动作泛化能力提供了基准,加速了学习型机器人控制理论的实证进展。
衍生相关工作
该数据集衍生出多项经典工作,尤其体现在LeRobot生态内的基准模型构建上。研究者常以此数据作为种子数据,扩展生成更大规模的合成演示,或与视觉语言模型结合,提升策略对语言指令的响应能力。例如,有工作基于此类格式数据集训练了通用的机器人基础模型(如RT-1、Octo),证明了跨任务、跨场景的迁移学习潜力,推动了机器人操作策略从单一技能向多任务通用智能体的演进。
以上内容由遇见数据集搜集并总结生成



