遇见数据集

leokswang/19122025-foldclo-13_lerobot_format

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集由LeRobot创建,用于机器人学习任务,具体针对YAM机器人类型。数据集包含10个episodes,总计27577帧,帧率为30fps。数据以parquet文件格式存储,划分为训练集(全部10个episodes)。特征包括三个视角的图像观察(顶部、左侧和右侧摄像头,每个图像分辨率为360x640x3)、状态观察(14维浮点数组)、动作(14维浮点数组),以及时间戳、帧索引、episode索引等元数据。数据集主要用于机器人控制和行为模仿学习,适用于强化学习或模仿学习任务。

This dataset was created using LeRobot for robotics learning tasks, specifically for the YAM robot type. It contains 10 episodes with a total of 27,577 frames at 30 fps. The data is stored in parquet files and split into a training set (all 10 episodes). Features include image observations from three perspectives (top, left, and right cameras, each with a resolution of 360x640x3), state observations (14-dimensional float32 array), actions (14-dimensional float32 array), and metadata such as timestamp, frame index, and episode index. The dataset is primarily intended for robot control and behavior imitation learning, suitable for reinforcement learning or imitation learning tasks.

提供机构:
leokswang
搜集汇总
数据集介绍
leokswang/19122025-foldclo-13_lerobot_format 数据集图片
构建方式
本数据集依托LeRobot框架构建,旨在为机器人学习领域提供标准化的训练数据。其数据来源为物理机器人平台“yam”的实际运行记录,通过采集多视角视觉观测与状态-动作序列,生成了10个完整回合(episode),总计27577帧,帧率设置为30 FPS。数据以Parquet格式高效存储于分块文件中,每块容纳1000帧,并按照训练集与验证集的划分进行组织,便于后续的模型训练与评估。
特点
数据集的核心特点在于其多模态感知信息的融合。它包含三个视角的视觉图像观测(顶部、左侧、右侧),分辨率均为360×640像素,为环境理解提供了丰富的空间信息。同时,14维的连续状态向量与对应的14维动作向量共同构成了完整的控制闭环,能够支持精细的机器人操控任务学习。此外,数据集还提供了精确的时间戳与帧索引,确保了时序数据的可追溯性与对齐性。
使用方法
使用者可通过LeRobot库直接加载本数据集,利用其内置的DataLoader高效读取Parquet文件中的多模态数据。数据集的配置信息统一存储在meta/info.json中,其中明确了特征维度与数据类型,便于开发者快速适配现有的模仿学习或强化学习算法。建议将数据划分为训练与验证子集进行模型训练,并在评估时利用回合索引(episode_index)对模型的连续决策能力进行验证。
背景与挑战
背景概述
该数据集由AllenAI研究机构于2025年2月19日创建,依托LeRobot框架构建,专注于机器人操作领域。核心研究问题在于构建标准化的机器人演示数据,以支持模仿学习与机器人技能泛化。数据集采用YAM机器人平台采集,包含10个完整序章,总计27,577帧,涉及单一任务场景,涵盖多视角图像(顶部、左侧、右侧,分辨率360×640)及14维状态与动作空间。作为基于开源协议Apache-2.0发布的数据资源,其在机器人学习社区中推动了数据共享与可复现研究,为机器人操控任务的基准测试与算法评估提供了基础数据支撑。
当前挑战
当前数据集面临的核心挑战包括:其一,序章数量有限(仅10个)且任务单一,难以覆盖机器人操作中多样化场景与复杂交互需求,限制了模型对未见任务的泛化能力;其二,构建过程中需确保高精度动作与状态同步采集,但机器人硬件差异性及校准误差可能导致数据质量波动;其三,多视角图像(360×640分辨率)与特征对齐的困难,增加了多模态融合的学习难度;此外,缺乏公开论文与引用信息,阻碍了其在学术界的影响力与后续迭代改进。
常用场景
经典使用场景
在机器人学习领域,该数据集为模仿学习与行为克隆算法的训练提供了标准化的多模态示范数据。其采用LeRobot框架的v2.1格式,每一条轨迹均包含三视角视觉图像(顶部、左侧、右侧)、14维的状态向量与动作序列,并以30帧每秒的稳定频率采样。研究者可将其直接用于从视觉-状态输入到低维连续动作的映射学习,例如在YAM机器人平台上验证端到端模仿策略的泛化能力。
实际应用
在实际工业场景中,该数据集适用于精细操作任务的技能迁移与部署。例如,利用其多视角视觉数据训练机器人进行物品抓取、装配或分拣,仅需少量示范即可通过行为克隆实现快速部署。其Apache-2.0许可协议降低了商业应用门槛,企业可在YAM或类似构型的机械臂上复现模型,并进一步结合领域随机化与域适应技术,提升在动态生产线上的鲁棒性。
衍生相关工作
该数据集衍生了多项迁移学习与表征解耦的经典工作。研究者基于其多模态通道开展了视角对齐与特征共享的对比学习研究,例如探索跨视角注意力机制以提升策略的视点不变性。此外,其紧凑的14维状态-动作空间催生了高效策略蒸馏与轻量化网络架构的改进,相关成果已应用于LeRobot社区中的多种预训练模型,促进了机器人基础模型的发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务