遇见数据集

leokswang/21122025-foldclo-08_lerobot_format

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是使用LeRobot创建的,专用于机器人技术任务。数据集包含10个总片段,总帧数为22901,帧率为30 FPS,使用YAM机器人类型。数据结构包括多个特征:观测图像(顶部、左侧、右侧视角,每张图像尺寸为360x640x3),观测状态(14维浮点数组),动作(14维浮点数组),以及时间戳、帧索引、片段索引等元数据。数据以Parquet格式存储,适用于训练机器人控制模型。

This dataset was created using LeRobot and is specifically designed for robotics tasks. It includes 10 total segments, with 22901 overall frames and a frame rate of 30 FPS, and uses the YAM robot type. The data structure contains multiple features: observation images (top, left, and right viewpoints, each with a resolution of 360x640x3), observation states (14-dimensional floating-point arrays), actions (14-dimensional floating-point arrays), as well as metadata such as timestamps, frame indices, and segment indices. The data is stored in Parquet format and is applicable for training robot control models.

提供机构:
leokswang
搜集汇总
数据集介绍
leokswang/21122025-foldclo-08_lerobot_format 数据集图片
构建方式
本数据集基于LeRobot框架构建,源自allenai_21122025-foldclo-08项目,专注于机器人操控任务的数据采集。数据集共包含10个独立的操作片段(episodes),总帧数达到22901帧,采样频率为30帧每秒。所有数据以Parquet格式存储于data目录下,遵循chunk-{episode_chunk:03d}/episode_{episode_index:06d}.parquet的组织结构,便于按片段索引高效加载。数据集仅含单一任务类型,且未包含视频数据。其元数据信息记录于meta/info.json文件中,详细定义了特征字段的维度与类型。
特点
数据集的核心特点在于其多模态观测与动作信息的丰富性。观测空间包含三个视角的彩色图像:顶部、左侧和右侧,图像尺寸统一为360×640像素,通道数为3,为机器人提供了全面的环境感知能力。状态(state)与动作(action)均为14维浮点向量,精准反映了机器人的关节或末端执行器状态和控制指令。每个时间步还包含时间戳、帧索引、片段索引等元数据,便于进行时序分析和序列建模。数据集划分仅包含训练集,共10个片段,适用于离线模仿学习或行为克隆的训练场景。
使用方法
使用该数据集时,建议通过LeRobot库的接口进行加载。用户可基于meta/info.json中的特征定义,构造数据加载器来批量读取Parquet文件中的状态、动作和图像数据。由于数据格式为标准化的LeRobot格式,可直接用于训练策略网络,如基于卷积神经网络或Transformer的模型。需注意,图像数据以原生数组形式存储,使用前可能需要根据模型要求进行归一化或尺寸调整。此外,数据集无视频文件,若需可视化可自行渲染图像序列。建议使用GPU加速的数据加载管道以匹配30fps的采样率,确保训练效率。
背景与挑战
背景概述
该数据集由Allen Institute for AI与LeRobot社区协作构建,发布于2025年,旨在为机器人操作任务提供标准化训练数据。核心研究问题聚焦于通过多视角视觉输入(顶部、左、右摄像头)与14维状态动作空间表征,驱动单任务(如物体抓取或放置)的模仿学习。数据集包含10个片段、22901帧,以30FPS高频率记录,依托LeRobot框架统一格式,显著降低了机器人学习研究的复现门槛,对推动具身智能领域的数据共享范式具有重要参考价值。
当前挑战
该领域面临的核心挑战在于如何从有限的高维感知数据中泛化至复杂真实环境。具体而言,单任务10个片段的规模可能导致模型过拟合,难以适应光照、背景或物体位姿变化。构建过程中,同步三路360×640 RGB图像与14维动作信号需精密校准,且Parquet格式压缩文件的管理要求高效的数据读取与解压管道,对实时训练框架的兼容性构成考验。
常用场景
经典使用场景
该数据集以LeRobot标准化格式存储,专为机器人模仿学习与行为克隆研究设计。其数据包含多视角视觉观测(顶部、左、右三路摄像头图像)与14维机器人状态及动作序列,适用于训练端到端的机器人操控策略。经典用法是将连续10个episode、总计22901帧的轨迹数据划分为训练集,用于监督学习场景下从观测到动作的映射建模,尤其在桌面抓取、折叠等精细操作任务中广泛采用。
解决学术问题
该数据集着力解决了机器人学习领域数据异构性与复现困难的核心痛点。通过统一的数据结构与元信息规范,研究者得以聚焦于算法创新而非数据预处理。其多模态感知与低层次控制信号的同步记录,为探索视觉-运动闭环控制、长程任务序列建模等学术问题提供了标准基准,推动了模仿学习从固定环境向更泛化场景的跃迁。
衍生相关工作
该数据集衍生了若干重要工作,包括基于扩散策略的机器人动作生成方法、结合视觉Transformer的多视角融合模型,以及用于跨本体迁移学习的域自适应技术。此外,LeRobot社区围绕该格式开发了标准化训练流水线与评估工具链,催生了针对YAM机械臂的预训练基座模型和少样本适应框架,为机器人基础模型研究提供了可复现的数据基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务