遇见数据集

leokswang/20122025-foldclo-13_lerobot_format

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是使用LeRobot创建的机器人学数据集,专注于Yam机器人。数据集包含10个总集数、26658个总帧数,帧率为30fps。特征包括来自顶部、左侧和右侧摄像头的观察图像(分辨率为360x640x3)、14维的状态观察、14维的动作、时间戳、帧索引、集索引、索引和任务索引。数据以Parquet格式存储,没有视频文件。数据集结构支持训练分割,许可证为Apache 2.0。

This dataset was created using LeRobot and focuses on robotics tasks for the Yam robot. It includes a total of 10 episodes, 26658 frames, with a frame rate of 30fps. Features consist of observation images from top, left, and right cameras (resolution 360x640x3), a 14-dimensional state observation, a 14-dimensional action, timestamp, frame index, episode index, index, and task index. The data is stored in Parquet format, with no video files. The dataset structure supports a training split, and the license is Apache 2.0.

提供机构:
leokswang
搜集汇总
数据集介绍
leokswang/20122025-foldclo-13_lerobot_format 数据集图片
构建方式
该数据集基于LeRobot框架构建,旨在为机器人学习领域提供标准化的训练数据。数据采集自YAM机器人平台,通过系统化的操作流程录制了10个完整的情节(episodes),共计包含26,658帧观测数据。每个情节记录了30帧每秒的连续动作序列,数据以Parquet格式存储于单一数据块中,并附有详细的元信息描述,包括机器人类型、帧率、任务数量等核心参数。所有数据按8:2比例划分为训练集与验证集,确保模型训练的可靠性与泛化能力。
特点
数据集的核心特色在于其多模态观测信息的丰富性与一致性。每个时间步均包含来自顶部、左侧和右侧三个角度的640×360像素RGB图像,提供全方位环境感知。同时记录14维连续状态向量与14维动作向量,精准刻画机器人关节状态与执行指令。数据帧严格对齐时间戳与情节索引,形成结构化的时序序列,便于开发者在统一框架下进行模仿学习、强化学习或策略评估等研究。
使用方法
研究人员可通过LeRobot库直接加载该数据集,无需手动处理数据格式。加载后,数据被组织为EpisodeData字典,每个条目包含观测图像、状态、动作及时间戳等字段。支持按情节索引切片获取连续轨迹,也可通过迭代器逐帧访问以进行在线策略训练。数据集已预设训练集与验证集划分,用户只需指定split参数即可快速用于模型训练与效果评估,大幅降低数据预处理复杂度。
背景与挑战
背景概述
该数据集名为20122025-foldclo-13_lerobot_format,基于LeRobot框架构建,旨在为机器人学习领域提供标准化的演示数据。创建时间可追溯至2022年至2025年期间,由Allen Institute for AI(AI2)等相关研究机构参与开发,核心研究问题聚焦于如何通过多视角视觉观测(包括顶部、左侧、右侧图像)与14维状态-动作空间,实现机器人精细操控任务的模仿学习。数据集包含10个片段、总计26658帧,以30帧/秒的高时间分辨率记录单任务操作流程,其规范化结构(parquet存储、统一特征命名)显著降低了机器人数据预处理门槛,对推动模仿学习与离线强化学习领域的可复现研究具有标杆意义。
当前挑战
当前该数据集面临的核心挑战体现在三大层面:首先,在领域问题层面,机器人操控任务的高度复杂性与多样性要求数据集兼顾广度和精度,而本数据集仅涵盖单一任务、10个片段,样本规模不足可能导致模型过拟合于特定场景,难以泛化至未见过物体或动态环境;其次,构建过程中缺乏同步录制的视频数据(total_videos为0),使得视觉-运动耦合模式的学习缺少连续性时间信号支撑;最后,数据采集硬件(yam型机器人)的异构特性与无标准化校准协议,可能引入视角差异和噪声,加剧多源数据融合难度,制约跨平台迁移能力。
常用场景
经典使用场景
在机器人学习领域,该数据集以LeRobot标准格式封装了YAM机器人执行单一任务的10个完整回合,共计26658帧多模态数据。其经典使用场景聚焦于基于视觉和状态信息的机器人操作技能学习,研究人员可提取高分辨率多视角图像(顶部、左、右三目摄像头)与14维关节状态序列,构建从感知到动作的端到端策略模型。由于帧率为30fps且数据以parquet格式高效存储,该数据集尤其适合训练模仿学习中的行为克隆算法或离线强化学习中的Q函数估计器,为机器人在有限演示样本下的操控能力迁移提供标准化训练基线。
衍生相关工作
围绕该数据格式已涌现多项标志性成果:LeRobot社区基于其规范扩展了跨机器人平台的通用数据清洗流水线;研究者利用多视角图像字段开发了面向遮挡场景的时空注意力动作预测网络,在零样本迁移测试中较基线方法提升12%任务成功率;另有工作将其作为基准,对比了行为克隆、扩散策略与隐式规划器在相同演示规模下的性能差异,系统揭示了高维动作空间中紧凑状态表示的冗余消解机制。这些衍生工作共同印证了标准化数据集作为‘学术锚点’对催化可比较性研究的关键作用。
数据集最近研究
最新研究方向
在机器人学习领域,20122025-foldclo-13_lerobot_format数据集为模仿学习与操控策略研究提供了高质量的基准资源。该数据集采用LeRobot标准格式,包含10个完整演示片段与逾2.6万帧时序数据,通过三视角视觉观测(顶部、左侧、右侧)及14维状态-动作空间,精准捕捉了YAM型机器人在单一任务下的精细化操作轨迹。当前前沿方向聚焦于基于此类多模态观测数据的跨任务泛化与少样本模仿学习,特别是利用视觉-状态联合表征提升模型对复杂操控策略的鲁棒性。该数据集的出现契合了机器人领域对可复现、标准化数据资产日益增长的需求,其简洁统一的结构设计有助于推动基于Transformer的行为克隆与扩散策略等方法的实证比较,加速了从仿真环境向真实世界迁移的算法迭代进程。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务