遇见数据集

leokswang/22122025-foldclo-01_lerobot_format

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集使用LeRobot创建,是一个机器人技术数据集,专门用于YAM机器人。数据集包含10个episodes,总计23899帧,帧率为30fps。数据以parquet格式存储,分为一个chunk。特征包括三个摄像头图像(顶部、左侧和右侧摄像头,每个图像分辨率为360x640x3,RGB通道)、14维浮点数的状态观测、14维浮点数的动作、时间戳、帧索引、episode索引等。数据集没有视频文件,仅包含结构化数据。许可证为Apache-2.0。

This dataset was created using LeRobot and is a robotics dataset specifically for the YAM robot. It contains 10 episodes with a total of 23899 frames at 30 fps. The data is stored in parquet format and organized into one chunk. Features include three camera images (top, left, and right cameras, each with a resolution of 360x640x3, RGB channels), 14-dimensional float32 state observations, 14-dimensional float32 actions, timestamps, frame indices, episode indices, and more. The dataset does not include video files, only structured data. The license is Apache-2.0.

提供机构:
leokswang
搜集汇总
数据集介绍
leokswang/22122025-foldclo-01_lerobot_format 数据集图片
构建方式
在机器人学习领域,高质量的数据集是驱动算法进步的核心动力。本数据集遵循LeRobot开源框架构建,旨在为机器人操作任务提供标准化的数据支持。其构建方式依托于YAM机器人平台,通过精心设计的采集流程,录制了10个完整的情节(episode),共计23,899帧数据,所有数据均存储于高效的Parquet格式中。数据集包含单一任务,且数据分割将全部10个情节统一划归至训练集,确保了数据的一致性与完整性。具体而言,数据以分块形式组织,每个块容纳1000帧,并按照‘chunk-{编号}/episode_{索引}.parquet’的路径结构进行存储,便于高效读取与索引。此外,每个时间步均记录了包含三视角图像(顶部、左、右)在内的视觉观测,以及14维的状态向量与14维的动作向量,共同构成了一个完整的机器人操控数据闭环。
特点
该数据集最为显著的特点在于其标准化的数据结构与丰富的观测模态。数据集严格遵循LeRobot的规范,特征定义清晰,涵盖了核心的机器人学习要素。在视觉层面,数据集同步采集了顶部、左侧与右侧三个视角的360x640像素RGB图像,为算法提供了多角度的环境感知能力。在状态与动作空间方面,其14维的连续向量设计,能够精细地描述机器人的关节状态与期望动作,适用于模仿学习与强化学习等多种范式。数据以30帧/秒的固定频率采样,确保了时间序列的平滑性。尤为值得一提的是,数据集虽包含25,000帧左右的样本,但情节数量精炼,且无视频数据,专注于状态-动作对的深度挖掘,非常适合用于验证小样本场景下的学习算法效能。
使用方法
针对该数据集的使用,推荐遵循LeRobot官方推荐的加载流程。用户可直接利用LeRobot库中的数据集加载模块,通过指定数据集名称与配置即可完成数据集的初始化。由于数据以Parquet格式存储,其列式存储特性使得在Python环境中结合Pandas或DuckDB等工具进行高效的数据过滤与批量处理成为可能。对于模型训练,建议将‘observation.state’与‘observation.images’下的多视角图像作为输入,‘action’字段作为监督标签,构建端到端的策略网络。鉴于数据集已按情节划分,用户可直接基于‘episode_index’字段进行训练与评估集的随机抽样。此外,数据集中包含的‘frame_index’与‘timestamp’字段,为时序建模任务(如序列到序列预测)提供了天然的排序依据。
背景与挑战
背景概述
在机器人学习领域,模仿学习依赖于高质量、多模态的示范数据来训练机器人执行复杂操作任务。该数据集由Allen AI研究机构于2022年12月20日创建,基于LeRobot框架构建,专注于YAM机器人平台。数据集包含10个示范片段,共计23899帧,以30FPS的帧率采集,涵盖三视角视觉图像(顶部、左、右)与14维状态-动作空间。其核心研究问题在于如何通过紧凑、标准化的数据格式(如Parquet存储与元信息标注)推动机器人操作技能的泛化与复现。该数据集为多模态模仿学习提供了基准资源,促进了跨机构合作与算法对比,在机器人数据集标准化方面具有重要示范意义。
当前挑战
该领域面临的主要挑战包括:1) 数据稀缺性与多样性不足,单任务10个片段难以覆盖真实操作环境中的物体姿态、光照与动态干扰等复杂变换,限制了模型泛化能力;2) 多模态数据同步与对齐难题,三路摄像头图像与状态-动作序列的高精度时间戳匹配对硬件与采集流程提出严苛要求;3) 任务复杂性局限,当前仅涉及单一操作任务,缺乏组合式或长期任务规划数据;4) 构建过程中,确保数据传输效率与存储完整性面临挑战,如Parquet格式的读写性能、帧索引与片段切分的逻辑一致性维护,以及元信息描述的规范性保障。
常用场景
经典使用场景
该数据集作为LeRobot框架下的机器人操控数据范例,聚焦于YAM型机器人的精细操作任务。其核心应用在于为模仿学习与行为克隆算法提供高质量的专家演示数据,包含10个完整episode、近24,000帧时序数据,涵盖多视角视觉观测(顶部、左、右摄像头)以及14维的机器人状态与动作信息。研究者常利用此类数据训练端到端的视觉运动策略,使机器人能够从高维感知输入直接映射为关节或末端执行器的控制指令,特别适用于桌面级抓取与装配等结构化环境下的重复性任务。
实际应用
在实际产业场景中,该数据集能够赋能柔性制造与仓储自动化领域的机器人快速部署。依托高质量的演示数据,企业可训练机器人完成精密零件分拣、电路板插件或药物分装等需要高重复精度与安全性的操作。其多视角视觉设计尤其适合复杂光照条件下的鲁棒感知,减少了人工示教成本与编程时间。此外,结合LeRobot的开源生态,该数据集还可直接用于机器人操作技能的迁移学习,例如从仿真环境预训练的策略微调至真实产线场景,具备显著的经济效益与实用价值。
衍生相关工作
围绕此类LeRobot格式数据集,衍生出了一系列标志性工作。在算法层面,扩散策略(Diffusion Policy)与基于Transformer的决策模型(如RT-2的轻量变体)常以此类数据作为训练基底,验证动作序列分布的建模能力。在工具链方面,HuggingFace的LeRobot库结合此类数据集促成了模仿学习流程的标准化,衍生出像‘LERobot-Data-Zoo’这样的跨平台数据集索引库。更值得关注的是,该数据集作为Open X-Embodiment联合体的典型示例,推动了跨机器人形态的通用操作策略研究,为具身智能领域的大规模预训练范式奠定了数据基础设施。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务