遇见数据集

leokswang/18122025-foldclo-12_lerobot_format

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是使用LeRobot创建的机器人数据集,适用于机器人任务。数据集包含10个episodes,总计31681帧,帧率为30fps。数据以Parquet格式存储,结构包括多个特征:三个视角的图像观测(顶部、左侧和右侧,每个图像的分辨率为360x640,3通道)、14维的状态观测(float32类型)、14维的动作(float32类型)、时间戳、帧索引、episode索引、索引和任务索引。机器人类型为yam,数据分割为训练集(涵盖所有episodes)。数据集遵循Apache 2.0许可证。

This dataset is a robotics dataset created using LeRobot, suitable for robotics tasks. It contains 10 episodes with a total of 31,681 frames at a frame rate of 30 fps. The data is stored in Parquet format and includes multiple features: image observations from three perspectives (top, left, and right, each with a resolution of 360x640 and 3 channels), 14-dimensional state observations (float32 type), 14-dimensional actions (float32 type), timestamps, frame indices, episode indices, indices, and task indices. The robot type is yam, and the data is split into a training set (covering all episodes). The dataset is licensed under Apache 2.0.

提供机构:
leokswang
搜集汇总
数据集介绍
构建方式
该数据集依托于LeRobot框架构建,旨在为机器人学习领域提供标准化的训练数据。数据集采集自型号为“yam”的机器人平台,共计包含10个完整任务片段(episode),累计帧数达31681帧,帧率为每秒30帧。所有数据以Parquet格式存储于归一化的分块目录结构中(data/chunk-{chunk:03d}/episode_{episode:06d}.parquet),并依据元信息文件(meta/info.json)中的规范进行索引。数据采集过程涵盖了多模态观测与执行动作的同步记录,确保了状态-动作对在时间序列上的一致性。
特点
该数据集的核心特色在于其丰富的多模态感知信息与结构化的物理状态表征。在观测层面,集成了三个视角的RGB图像(top、left、right),分辨率均为360×640像素,为场景理解提供了全景与局部相结合的视觉输入。同时,14维的机器人状态向量(observation.state)与对应的14维动作向量(action)完整刻画了机器人的构型与运动指令。整个数据集聚焦于单一任务,排除了任务间的干扰,非常适合用于模仿学习或行为克隆的精细化研究。此外,采用Parquet列式存储格式,支持高效的数据读取与批处理操作。
使用方法
使用者可通过LeRobot库提供的API直接加载该数据集,利用其内置的数据加载器将Parquet文件与视频流无缝对齐。建议将全部10个片段按默认划分(splits字典中train:0:10)用作训练集,无需额外拆分。在模型训练中,可将三个视角的图像(observation.images)作为视觉编码器的输入,结合14维状态向量(observation.state)作为辅助特征,共同预测14维的动作输出(action)。数据集的元信息文件(meta/info.json)已包含完整的特征定义与通道顺序,用户可直接参考以适配自定义的神经网络架构。由于总帧数约3万帧,在小规模验证或原型开发中尤为高效。
背景与挑战
背景概述
该数据集由Hugging Face的LeRobot社区于2025年创建,聚焦于机器人操作学习领域。其核心研究问题在于通过多视角视觉与状态-动作序列的联合建模,提升机器人在复杂环境中的任务执行能力。数据集基于YAM型机器人采集,包含10个完整回合、共计31681帧的高频(30 FPS)观测数据,覆盖顶部、左侧及右侧三个摄像头视角的640×360像素图像,以及14维的机器人关节状态与动作向量。作为开源基准资源,该数据集为研究模仿学习、强化学习中的视觉运动控制提供了标准化测试平台,其Apache-2.0许可协议进一步降低了学术与工业界的准入门槛,对推动机器人智能决策的前沿探索具有显著意义。
当前挑战
该数据集所解决的领域核心挑战在于构建高保真、多模态的机器人操作轨迹数据,以克服现实场景中策略泛化性不足的瓶颈。具体而言,单任务(仅1种任务)的10回合规模限制了模型对动态环境的适应性,亟需应对从有限样本中提取通用运动primitive的难题。构建过程中面临的挑战包括:多相机视野同步与数据对齐的精度控制,14维高维动作空间与视觉特征之间的因果建模困难,以及确保低延迟(30 FPS)条件下不丢失关键序列信息的存储与采样策略设计。此外,缺失视频模态(total_videos=0)进一步增加了从原始状态-动作映射中推断完整环境时空结构的难度。
常用场景
经典使用场景
在机器人学习领域,该数据集以LeRobot格式存储,专为模仿学习与行为克隆任务而设计。它提供了来自YAM机器人平台的多视角视觉观测(顶部、左侧、右侧摄像头)以及14维的关节状态与动作序列,适用于训练机器人从演示中复现复杂操作技能。每条数据以30帧/秒的高采样率记录,共包含10个完整回合与3万余帧时空对齐的观测-动作对,为构建端到端的视觉运动策略提供了标准化训练基础。
实际应用
在实际应用中,该数据集可用于训练YAM机器人完成精细抓取、物体搬运等工业与家庭场景下的自动化任务。其多视角图像与状态动作的精确对应,使得部署的机器人能够适应光照变化、遮挡等复杂环境。基于此数据训练的模型可集成至智能仓储或服务机器人系统,降低人工编程成本,提升操作鲁棒性与任务执行的可迁移性。
衍生相关工作
基于该数据集的工作已衍生出面向机器人策略学习的多种模型改进。例如,研究者利用其多视角特性探索了跨模态注意力机制与隐式策略表示;也有工作针对该数据的时序稠密性开发了高效率的扩散策略先验。这些衍生研究不仅验证了数据集在模仿学习领域的基准价值,还催生了面向少样本泛化的因果推理框架,进一步拓展了机器人技能学习的边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务