遇见数据集

leokswang/19122025-foldclo-05_lerobot_format

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集由LeRobot创建,是一个机器人学数据集,专门用于YAM机器人。数据集包含9个episodes,总计24939帧,帧率为30fps。数据以Parquet格式存储,分为1个chunk,每个chunk大小为1000。数据集的特征包括来自三个摄像头(顶部、左侧、右侧)的图像观察,每个图像分辨率为360x640x3,以及14维的状态观察和动作数据。此外,还包含时间戳、帧索引、episode索引等元数据。数据集适用于训练和评估机器人控制模型。

This dataset was created using LeRobot and is a robotics dataset specifically for the YAM robot. It contains 9 episodes with a total of 24,939 frames at a frame rate of 30fps. The data is stored in Parquet format, divided into 1 chunk with a chunk size of 1000. The dataset features include image observations from three cameras (top, left, right), each with a resolution of 360x640x3, as well as 14-dimensional state observations and action data. Additionally, it includes metadata such as timestamps, frame indices, and episode indices. The dataset is suitable for training and evaluating robot control models.

提供机构:
leokswang
搜集汇总
数据集介绍
leokswang/19122025-foldclo-05_lerobot_format 数据集图片
构建方式
该数据集遵循LeRobot框架的规范进行构建,采用Apache-2.0开源许可协议发布,专注于机器人学习领域。数据集的元信息文件清晰地定义了其版本为v2.1,机器人类型为“yam”,共包含9个完整的情节轨迹,总计24939帧数据,由单一任务构成。数据以Parquet格式存储于分区路径“data/chunk-{episode_chunk:03d}/episode_{episode_index:06d}.parquet”中,便于按情节索引进行高效读取。所有训练样本被统一划分至训练集,无额外验证或测试集拆分,体现了数据集在特定场景下的专用性。
特点
数据集的核心特色在于其多模态观测信息与动作指令的精细对齐。观察空间包含来自顶部、左侧和右侧三个视角的高清图像,分辨率均为360×640像素,可提供机器人作业环境的丰富视觉背景。同时,状态特征与动作特征均被编码为14维的浮点向量,确保对机械臂关节位置及末端执行器姿态的精确描述。此外,每条数据还记录了时间戳、帧索引及情节索引等元数据,为时序建模提供了天然的结构化支持,且数据集帧率为每秒30帧,保障了运动序列的流畅性。
使用方法
用户可通过LeRobot库直接加载该数据集,利用其提供的标准API读取Parquet文件中的情节数据。在训练时,推荐将“observation.images.top”、“observation.images.left”与“observation.images.right”三个视角的图像作为视觉输入,并结合“observation.state”的状态向量,共同驱动策略网络生成对应的“action”指令。由于数据集已按情节组织,研究者可轻松遍历9个完整轨迹进行模仿学习或离线强化学习实验。需要注意的是,当前数据集版本未包含视频文件,所有观测数据均以图像帧的形式直接存储于表格中。
背景与挑战
背景概述
在机器人学习领域,数据驱动的方法日益成为推动智能体技能习得的关键力量。由Allen AI研究所等机构于近期构建的19122025-foldclo-05_lerobot_format数据集,遵循LeRobot框架标准,旨在为机械臂操作任务提供高质量的演示数据。该数据集聚焦于使用YAM机器人平台采集的单一任务,包含9个完整回合、共计24939帧高保真数据,采样频率为30 FPS,并提供了来自顶部、左侧和右侧三个视角的640×360像素图像观测以及14维状态与动作空间。通过标准化格式与Apache-2.0许可开放发布,该数据集为多模态机器人操作学习的研究提供了可复现的基准资源,推动了模仿学习与强化学习在该领域的实证发展。
当前挑战
该数据集所应对的核心领域挑战在于弥合仿真与真实环境之间的鸿沟,尤其在高维视觉-运动控制任务中实现从演示数据到泛化策略的有效迁移。具体挑战包括:一是多视角图像与状态动作序列的时空对齐精度问题,直接影响了策略学习对细粒度操作的解析能力;二是仅包含9个演示回合的有限数据规模,难以覆盖复杂操作场景中的任务变体与扰动,对模型在小样本条件下的鲁棒性提出了严苛要求;三是构建过程中,如何同步采集来自三种不同视角的360p RGB图像与14维机器人状态,并确保无视频缺失下的时序一致性,对硬件同步与数据预处理管线的稳定性构成了显著考验。
常用场景
经典使用场景
在机器人学习与模仿学习领域,该数据集以LeRobot标准格式记录了YAM机器人完成特定任务的多模态数据,包含来自顶部、左侧、右侧三个视角的高清图像观测、14维的机器人状态信息以及对应的动作指令,共计9个回合、近2.5万帧数据。其经典用途是作为模仿学习算法的训练素材,研究人员可利用这些成对的视觉-状态-动作序列,训练机器人模型从专家演示中学习复杂操作技能,尤其在基于视觉的运动策略研究中具有标杆意义。
实际应用
实际应用中,该数据集可直接用于训练YAM机器人在仓储物流、家庭服务等场景下的精细操作能力,例如拾取与放置物件、拧动开关等任务。借助LeRobot生态的兼容性,训练好的策略能够快速部署至实体机器人,实现从仿真到真实环境的迁移。此外,多视角图像数据还为视觉伺服控制系统的开发提供了丰富素材,助力机器人适应非结构化环境下的自主作业需求。
衍生相关工作
该数据集衍生了一系列经典研究工作,包括基于扩散策略的机器人动作生成方法、多视角融合的视觉表示学习模型以及离线强化学习中的保守Q学习算法适配。研究者围绕其数据格式开发了标准化训练流水线,催生了LeRobot社区内多个示范性基准模型,如ACT(Action Chunking with Transformers)的快速实现。这些工作共同推动了开放数据集在机器人领域从数据收集到算法验证的完整闭环生态建设。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务