遇见数据集

leokswang/18122025-foldclo-09_lerobot_format

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集使用LeRobot创建,包含机器人任务数据,具体针对YAM机器人类型。数据集结构包括2个episodes、10834帧、1个任务,无视频数据。特征涵盖顶部、左侧和右侧图像观察(分辨率360x640x3)、状态观察(14维浮点数组)、动作(14维浮点数组),以及时间戳、帧索引等元数据。数据以Parquet格式存储,帧率为30fps,许可证为Apache-2.0。

This dataset was created using LeRobot and contains robotics task data, specifically for the YAM robot type. The dataset structure includes 2 episodes, 10834 frames, 1 task, and no video data. Features encompass top, left, and right image observations (resolution 360x640x3), state observations (14-dimensional float array), actions (14-dimensional float array), along with metadata such as timestamp and frame index. Data is stored in Parquet format, with a frame rate of 30fps, and is licensed under Apache-2.0.

提供机构:
leokswang
搜集汇总
数据集介绍
构建方式
该数据集基于LeRobot框架构建,专为机器人学习任务设计。数据集包含两个完整回合(episode),共计10834帧图像,以30帧/秒的采样频率采集自名为“yam”的机器人平台。数据存储采用Parquet格式,按分块结构组织,每个分块容量为1000帧,数据路径遵循“data/chunk-{episode_chunk:03d}/episode_{episode_index:06d}.parquet”的命名规范。特征空间涵盖三类视觉观测(顶部、左侧、右侧摄像头),每幅图像尺寸为360×640像素,并包括14维机器人状态向量(如关节位置、速度)及其对应的14维动作指令。时间戳、帧索引、回合索引等辅助信息亦被完整记录,确保时间序列的连续性与可追溯性。
特点
数据集最显著的特点在于其多模态感知与动作的联合表征能力。视觉观测部分提供三路同步的RGB图像流,覆盖机器人作业空间的不同视角,有利于场景理解与遮挡处理。14维状态向量与动作空间保持维度一致,可直接用于端到端模仿学习或强化学习算法的训练。此外,数据集在结构上采用了LeRobot的标准化格式,兼容社区中主流机器人学习流水线,并遵循Apache-2.0开源协议,降低了使用门槛。虽然总回合数较少,但密集的帧率与丰富的观测维度使其成为验证算法在小样本场景下泛化性能的理想测试基准。
使用方法
用户可通过HuggingFace Datasets库加载该数据集,指定配置名称'default'后,数据文件将自动从'data/*/*.parquet'路径读取。推荐使用LeRobot配套的API对数据进行流式访问,以便高效处理大规模序列。在实际应用中,研究者可将'observation.state'与'observation.images'作为模型输入,'action'作为监督信号,构建模仿学习或逆动力学模型。由于数据集已按回合划分训练集(第0至1回合),用户可直接利用'episode_index'字段进行分片,或借助LeRobot内置的重放工具进行可视化调试,验证策略在真实机器人环境中的表现。
背景与挑战
背景概述
该数据集由LeRobot社区基于Hugging Face的机器人学习框架创建,聚焦于利用YAM机器人平台开展精细操作任务的研究。数据集于2025年采集,由Allen AI研究机构主导,旨在为模仿学习与强化学习提供标准化的多模态训练样本。核心研究问题在于如何通过高频率(30 FPS)的多视角视觉观测(顶部、左、右摄像头)与14维状态-动作空间,推动机器人从示教中习得复杂操控技能。尽管仅包含2次完整演示、10834帧数据,但其高质量的结构化格式(Parquet存储、LeRobot规范)为机器人行为克隆领域的基准测试与迁移学习奠定了重要基础。作为Apache-2.0许可的开源资源,该数据集在促进机器人学习社区协作与可复现研究方面具有示范价值。
当前挑战
数据集当前面临多重挑战。领域问题层面,仅覆盖单一任务与少量示范样本,难以支撑对机器人泛化能力的系统评估,例如在动态环境或未见场景下,从有限数据中提取的行为策略极易产生过拟合。构建过程层面,多摄像头同步采集(640×360分辨率)与14维连续动作空间的精确对齐存在技术瓶颈,噪声或时间偏移会直接劣化模型性能。此外,无视频记录(total_videos=0)的设计限制了时空特征的学习,而数据分块(chunk size=1000)的硬编码格式可能阻碍大规模增量扩展与实时推理应用。
常用场景
经典使用场景
该数据集专为机器人操作任务中的模仿学习而设计,尤其适用于YAM型机器人的精细操控研究。数据以LeRobot标准格式存储,包含多视角视觉观测(顶部、左、右三路640×360图像)以及14维的机器人状态与动作序列,为端到端的行为克隆算法提供了完整的输入输出对。研究者可借助该数据集训练模型,使其学习从视觉感知到关节动作的直接映射,典型应用包括物体抓取、堆叠与装配等操作技能的复现。
实际应用
实际应用中,该数据集可被用于家庭服务机器人的日常任务训练,例如餐具整理、物品分类或简单家电操作。工业场景下,它可作为柔性生产线上机械臂的快速部署基础,通过模仿少量人工示教即可完成新工序的自动化执行。此外,其Apache-2.0开源协议降低了科研机构与中小企业的使用门槛,促进了人机协作场景下技能库的共享与迭代。
衍生相关工作
基于该数据格式,LeRobot社区已衍生出一系列基准模型与工具链,包括适用于YAM机器人的行为克隆基线(BC)、隐式Q学习(IQL)以及扩散策略(Diffusion Policy)的实现。相关研究者也利用此类数据集验证了视觉-语言模型在机器人任务中的组合泛化能力,同时催生了多任务统一训练的框架,例如将多个单任务数据集联合训练通用操作策略。这些工作共同构建了从数据采集到策略部署的完整生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务