遇见数据集

leokswang/19122025-foldclo-04_lerobot_format

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是使用LeRobot创建的,专为机器人学任务设计。它包含来自Yam机器人的数据,总共有9个episodes和22755帧,帧率为30fps。数据集结构丰富,包括来自顶部、左侧和右侧摄像头的图像观察(每张图像尺寸为360x640x3),以及状态观测(14维浮点数组)、动作(14维浮点数组)、时间戳、帧索引、episode索引、索引和任务索引等特征。所有数据都用于训练,没有视频文件。数据集基于Apache 2.0许可证发布。

This dataset was created using LeRobot and is specifically designed for robotics tasks. It contains data from the Yam robot, with a total of 9 episodes and 22755 frames at a frame rate of 30 fps. The dataset has a rich structure, including visual observations from top, left, and right cameras (each image has a resolution of 360x640x3), as well as features such as state observations (14-dimensional floating-point arrays), actions (14-dimensional floating-point arrays), timestamps, frame indices, episode indices, indices, and task indices. All data is used for training, and no video files are included. This dataset is released under the Apache 2.0 license.

提供机构:
leokswang
搜集汇总
数据集介绍
leokswang/19122025-foldclo-04_lerobot_format 数据集图片
构建方式
在机器人操作学习领域,高质量、结构化的演示数据集是推动模仿学习与行为克隆算法发展的基石。该数据集基于LeRobot框架构建,旨在为机械臂操控任务提供标准化的数据支持。数据采集过程围绕YAM机器人平台展开,共收录9个完整演示回合,累计22,755帧时序数据,帧率为30赫兹。每条轨迹均以Parquet格式存储于分块目录中,位于`data/chunk-{episode_chunk:03d}/episode_{episode_index:06d}.parquet`路径下,便于高效随机访问。数据集仅包含一个训练集划分,覆盖全部演示,充分体现了构建流程的简洁性与实用性。
特点
该数据集的一个显著特点在于其多模态感知信息的深度融合。观测空间包含三组RGB图像,分别来自顶部、左侧和右侧摄像头,分辨率均为360×640像素,为环境感知提供了丰富的视觉线索。同时,14维的机器人状态向量与动作向量保持维度一致,构成了状态-动作对,适合直接用于行为克隆训练。元信息文件详细记录了特征名称、数据类型、张量形状及物理轴名称,确保数据结构一目了然。此外,数据集采用Apache-2.0开源许可,降低了研究与复用的门槛,为机器人领域的学术交流与工业应用奠定了开放基础。
使用方法
使用该数据集时,推荐通过LeRobot框架提供的API进行加载与预处理。开发者可借助`lerobot.common.datasets`中的工具,直接指定数据集名称或本地路径,即可自动化解析元信息、读取Parquet文件并重构完整轨迹。每条样本均包含观察图像、状态向量、动作指令及时间戳等字段,模型可据此构建端到端的策略网络。由于数据已按回合进行索引,训练时可通过`episode_index`字段按序抽取连续帧,或随机打乱单步样本以支持离线强化学习。建议将数据集与LeRobot的标准化数据加载流程结合,以减少重复开发并提升实验可复现性。
背景与挑战
背景概述
该数据集由LeRobot框架(Hugging Face主导开发)于2025年创建,专注于机器人操作任务的模仿学习研究。其核心研究问题在于如何利用多视角视觉观测(顶部、左侧、右侧摄像头)与14维状态-动作空间,使机器人通过少量演示(仅9个回合)高效习得精细操控技能。数据集采用YAM机器人平台,采集频率为30帧/秒,总帧数达22755帧,为小样本模仿学习提供了标准化基准。作为LeRobot生态的重要组成部分,该数据集推动了机器人学习从仿真向真实场景的迁移,尤其在低数据量场景下验证了模型泛化能力,对具身智能领域的数据效率提升具有示范意义。
当前挑战
该数据集面临的核心挑战在于领域问题与构建双重维度。领域层面,机器人操控任务受限于小样本学习中的过拟合风险,仅9个演示回合极易因动作多样性不足导致泛化能力薄弱,且多视角图像与高维状态空间的异质特征融合仍是难题。构建过程中,数据采集面临演示质量一致性控制困难——人类操作者难以在14维动作空间中保持精确复现,而360*640分辨率的三路视频流同步采集对硬件时序精度提出严苛要求。此外,无视频存储的配置设计(total_videos=0)限制了视觉特征与动作序列的联合时序建模,加剧了长程任务中的因果推断挑战。
常用场景
经典使用场景
在机器人学习领域,该数据集遵循LeRobot框架标准格式,包含9个完整操作回合、超过22000帧时序数据,记录单一机械臂操作任务。通过多视角视觉观测(顶部、左侧、右侧三路RGB图像)与14维机器人状态-动作序列的同步采集,为模仿学习、行为克隆等算法提供了高保真的专家演示数据。研究者可基于此数据训练机器人策略,使其从视觉输入直接映射到连续动作空间,实现复杂的灵巧操作技能迁移。
实际应用
在实际应用层面,该数据集可服务于工业精密装配、医疗辅助操作及家庭服务机器人等场景。通过预训练策略模型,机器人可学会在动态环境中完成如物体抓取、精密插拔等任务。配合LeRobot生态系统的兼容性,开发者能快速将训练好的策略部署至YAM型机器人硬件平台,降低从数据采集到实际部署的工程门槛,加速机器人技能学习技术从研究原型向实用产品的转化进程。
衍生相关工作
该数据集衍生出的研究工作多集中于跨机器人平台泛化策略、多任务联合训练框架以及数据增强技术方向。基于其结构化格式,学界已发展出时序对齐的视觉-运动融合网络、适用于小样本场景的元学习架构等经典方法。此外,该数据促进了LeRobot社区标准化基准的建立,催生了对比不同演示质量与数据规模对策略性能影响的系统性分析工作,为机器人学习领域的可重复性研究奠定了数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务