遇见数据集

leokswang/23122025-foldclo-02_lerobot_format

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集使用LeRobot创建,是一个机器人学数据集,专门针对Yam机器人。数据集包含10个episodes,总计18140帧,帧率为30fps。数据以parquet格式存储,分为1个chunk,每个chunk大小为1000。数据集特征包括来自顶部、左侧和右侧摄像头的图像观测(每个图像分辨率为360x640x3),状态观测(14维浮点数),动作(14维浮点数),以及时间戳、帧索引、episode索引、索引和任务索引等元数据。数据用于训练分割,无视频数据。

This dataset was created using LeRobot and is a robotics dataset specifically for the Yam robot. It contains 10 episodes, totaling 18140 frames at a frame rate of 30fps. The data is stored in parquet format, divided into 1 chunk with a chunk size of 1000. Dataset features include image observations from top, left, and right cameras (each image resolution is 360x640x3), state observations (14-dimensional float), actions (14-dimensional float), and metadata such as timestamp, frame index, episode index, index, and task index. The data is used for training splits, with no video data.

提供机构:
leokswang
搜集汇总
数据集介绍
构建方式
该数据集基于LeRobot框架构建,围绕YAM机器人平台采集,共包含10个完整的演示片段,总计18140帧图像与状态信息。数据通过多视角摄像头(顶部、左侧、右侧)同步记录360×640像素的视觉观测,同时以30帧/秒的速率捕捉机器人关节状态与动作指令,每个状态与动作向量维度均为14。数据集将全部片段划归为训练集,并以parquet格式高效存储于分块文件中,辅以JSON元数据文件描述数据规模与特征结构。
特点
数据集具备多模态融合特性,整合了来自三个固定视角的RGB图像时序数据以及14维连续状态与动作序列,为模仿学习研究提供了丰富的环境感知与执行信息。此外,数据遵循LeRobot标准格式,支持通过相关工具链无缝加载与预处理。尽管仅包含单一任务场景,但10个独立片段与超过1.8万帧的数据量足以支撑小规模策略训练与验证。
使用方法
使用时可通过LeRobot库的`load_dataset`接口直接加载该数据集,指定配置名为`default`后系统自动解析parquet文件中的图像、状态与动作数据。研究者可依据元信息中的`total_episodes`与`total_frames`参数评估数据规模,并利用`codebase_version v2.1`确保兼容性。由于数据集仅含训练切分,可直接用于训练行为克隆或强化学习基线模型,无需额外拆分验证集。
背景与挑战
背景概述
随着机器人学习领域的蓬勃发展,模仿学习与强化学习对高质量、结构化的数据集需求日益迫切。该数据集由AllenAI机构于2025年前后创建,依托LeRobot框架构建,聚焦于一种名为“yam”的机器人平台。核心研究问题在于如何为机器人操作任务提供标准化、多模态(视觉与状态)的观测数据,以支持策略学习与行为克隆研究。数据集包含10个演示片段,共计18140帧,采集速率30帧/秒,涵盖三视角图像(顶部、左、右)、14维状态与动作空间,为机器人精细操控任务奠定了坚实的数据基础。其在LeRobot生态中的发布,推动了对机器人数据格式统一与可复现研究的探索,对开源机器人社区具有重要影响。
当前挑战
该数据集所解决的领域挑战集中在机器人操作任务中数据稀缺性与异构性问题:一方面,机器人演示数据采集成本高昂,本数据集仅有10个片段,规模有限,难以支撑复杂策略的泛化训练;另一方面,构建过程中面临多传感器同步、动作与状态维度对齐的难题,14维连续状态与动作空间对噪声处理与时间序列一致性提出严苛要求。此外,三目视觉图像的分辨率(360x640)相对较低,可能限制细粒度特征提取;无视频文件(total_videos为0)的设计虽简化存储,却牺牲了动态时序信息的连续性。这些挑战凸显了在有限样本下平衡数据质量与规模,以及实现跨平台标准化格式的持续难度。
常用场景
经典使用场景
在机器人学习领域,该数据集基于LeRobot框架构建,以YAM机器人平台采集的10个示范片段、共计18140帧高质量时序数据为核心,涵盖了来自顶部、左侧和右侧三个视角的RGB图像以及14维状态与动作向量。经典使用场景聚焦于模仿学习与行为克隆,研究者可利用多视角视觉观测和连续状态-动作序列,训练机器人从人类示范中精确复现复杂操作任务,如精密抓取与装配。数据集以30帧每秒的稳定频率记录,为动态操作建模提供了可靠的时间分辨率支持。
解决学术问题
该数据集系统性地解决了机器人学中数据稀缺与跨模态对齐的学术难题。通过提供标准化的多模态观测-动作对,它使研究者能够深入探究视觉-运动耦合机制,攻克小样本模仿学习中的泛化瓶颈。在任务泛化与域适应研究中,数据集促进了从有限示范中提取可迁移策略的算法开发,推动了离线强化学习在真实机器人上的可行性验证。其开放许可格式也降低了科研门槛,加速了从数据效率到鲁棒策略迁移等前沿课题的突破。
衍生相关工作
该数据集衍生了一系列具有影响力的学术工作。基于其结构化时序格式,研究者开发了多种变分推断与注意力机制的模仿学习架构,如结合视觉Transformer的端到端策略网络。在离线强化学习领域,该数据成为评测模型保守性更新与分布外泛化的基准之一。此外,围绕YAM机器人平台催生了多种数据增强工具与仿真训练框架,推动了Sim-to-Real迁移、多任务分层学习等方向的发展,并已嵌入LeRobot生态作为标准测试用例。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务