遇见数据集

eval_yellow_block

收藏
Hugging Face2026-05-28 更新2026-05-29 收录
官方服务:

资源简介:

该数据集是使用LeRobot工具创建的机器人领域数据集,包含5个完整的情节(episodes),总计4430帧数据,对应1个任务。数据以parquet文件格式存储(总大小约100MB),并包含相应的视频文件(总大小约200MB),视频帧率为30fps。数据集目前仅包含训练集。每个样本包含动作(6维浮点数组表示机器人末端执行器的关节位置)、观测状态(6维浮点数组表示当前机器人状态)、图像观测(两个视角的视频流:手腕视角和俯视视角,分辨率为480x640 RGB,使用h.264编码)以及元数据(如时间戳、帧索引等)。该数据集适用于机器人学习任务,如模仿学习、强化学习或行为克隆,模型需基于多模态观测预测机器人动作,使用的机器人平台为“so_follower”。

This dataset is a robotics domain dataset created using the LeRobot tool. It contains 5 complete episodes, totaling 4430 frames of data, corresponding to 1 task. The data is stored in parquet file format (total size approximately 100MB) and includes corresponding video files (total size approximately 200MB) with a frame rate of 30fps. The dataset currently only includes a training set. Each sample includes actions (a 6-dimensional floating-point array representing the joint positions of the robot end-effector), observation states (a 6-dimensional floating-point array representing the current robot state), image observations (two video streams from wrist and overhead perspectives, with a resolution of 480x640 RGB, encoded using h.264), and metadata (such as timestamp, frame index, etc.). The dataset is suitable for robotics learning tasks, such as imitation learning, reinforcement learning, or behavior cloning, where models need to predict robot actions based on multimodal observations, and the robot platform used is so_follower.

创建时间:
2026-05-28
原始信息汇总

数据集概述

  • 数据集名称: eval_yellow_block
  • 许可证: Apache-2.0
  • 任务类别: 机器人学 (Robotics)
  • 标签: LeRobot
  • 创建工具: 使用 LeRobot 创建

数据集结构

  • 代码版本: v3.0
  • 机器人类型: so_follower
  • 总片段数: 5
  • 总帧数: 4430
  • 总任务数: 1
  • 块大小: 1000
  • 数据文件大小: 100 MB
  • 视频文件大小: 200 MB
  • 帧率: 30 fps
  • 数据分割:
    • 训练集: 片段 0 至 4 (共5个片段)

数据特征

动作 (action):

  • 数据类型: float32
  • 维度: 6
  • 名称: shoulder_pan.pos, shoulder_lift.pos, elbow_flex.pos, wrist_flex.pos, wrist_roll.pos, gripper.pos

观察状态 (observation.state):

  • 数据类型: float32
  • 维度: 6
  • 名称: shoulder_pan.pos, shoulder_lift.pos, elbow_flex.pos, wrist_flex.pos, wrist_roll.pos, gripper.pos

观察图像 - 腕部摄像头 (observation.images.wrist):

  • 数据类型: video
  • 分辨率: 480 x 640 (高 x 宽)
  • 通道数: 3
  • 视频编码: h264
  • 像素格式: yuv420p
  • 帧率: 30 fps
  • 非深度图

观察图像 - 俯视摄像头 (observation.images.overhead):

  • 数据类型: video
  • 分辨率: 480 x 640 (高 x 宽)
  • 通道数: 3
  • 视频编码: h264
  • 像素格式: yuv420p
  • 帧率: 30 fps
  • 非深度图

时间戳 (timestamp):

  • 数据类型: float32
  • 维度: 1

帧索引 (frame_index):

  • 数据类型: int64
  • 维度: 1

片段索引 (episode_index):

  • 数据类型: int64
  • 维度: 1

全局索引 (index):

  • 数据类型: int64
  • 维度: 1

任务索引 (task_index):

  • 数据类型: int64
  • 维度: 1

数据路径

  • 数据文件: data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet
  • 视频文件: videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4

可视化

搜集汇总
数据集介绍
eval_yellow_block 数据集图片
构建方式
在机器人学习与模仿学习的研究浪潮中,数据集的质量与结构直接影响算法的泛化能力与鲁棒性。eval_yellow_block数据集由LeRobot框架构建,旨在为机器人操作任务提供标准化的评估基准。该数据集包含5个完整演示轨迹,共计4430帧时序数据,全部用于训练集划分。数据以Parquet格式存储动作与状态序列,同时附带H.264编码的腕部与俯视角视频流,帧率为30 FPS。视频与数值数据通过分块索引(chunk)组织,确保大规模序列的高效存取与流式加载。数据集结构清晰,便于研究者快速接入并复现实验。
特点
eval_yellow_block数据集在设计上体现了对机器人操作任务的精准建模。其核心特征在于统一了动作空间与观测状态空间,均采用六维关节位置向量(shoulder_pan至gripper),便于执行器与控制算法的直接映射。视觉观测涵盖两个视角——腕部相机与俯视相机,分辨率均为480×640,为多模态融合学习提供丰富信息。数据集仅包含单一任务,但通过多视角视频与高频稀疏时序结合,能够有效支撑策略学习中的空间感知与时序依赖建模。此外,Apache-2.0许可证进一步降低了学术应用的门槛。
使用方法
使用eval_yellow_block数据集时,推荐通过LeRobot库进行加载与预处理。研究者可以利用data_files路径直接读取Parquet格式的数值数据,并通过video_path索引对应的视频片段。数据集不预设测试集,适合用于训练阶段的在线评估或交叉验证。在使用过程中,可借助LeRobot内置的DataLoader对时序帧进行批量化采样,亦可结合stable-baselines3等深度学习框架构建端到端的模仿学习或强化学习模型。建议在加载时关注chunks_size参数,以平衡内存占用与数据吞吐效率,实现流畅的训练流程。
背景与挑战
背景概述
eval_yellow_block数据集是机器人操作领域中的一个重要评估基准,由Hugging Face团队于近期基于LeRobot框架构建而成。该数据集聚焦于单任务机器人操作场景,通过so_follower机器人平台采集了5个示范回合,共计4430帧动作状态与视觉观测数据。数据集的核心研究问题在于评估机器人从视觉感知到动作执行的闭环控制能力,特别是针对黄色方块这一特定物体的抓取与操作任务。尽管数据集规模有限,但其规范的parquet格式存储、多视角视觉输入(腕部与俯视摄像头)以及精准的6自由度动作标注,为机器人模仿学习与强化学习算法的标准化评估提供了关键平台。该数据集已融入LeRobot生态体系,对于推动机器人操作技能的可复现研究具有重要意义。
当前挑战
该数据集所应对的领域挑战在于机器人精细化操作中的泛化能力瓶颈,尤其是在目标物体(黄色方块)位置、姿态及光照环境变化下的鲁棒抓取难题。现有方法依赖大规模示教数据,而该数据集仅含5个回合的少量样本,对数据高效学习算法提出了严苛考验。构建过程中,挑战尤为突出:首先,动作空间涵盖6个自由度(肩部、肘部、腕部等关节位置与夹爪开合),如何精准同步多关节控制与视觉反馈形成闭环是技术难点;其次,两类摄像头(腕部与俯视)的时空对齐要求高精度的时间戳标定与帧同步;再者,从parquet分块存储到H.264视频编码的混合格式,数据整合与无损回放需克服异构数据管线的兼容性问题。
常用场景
经典使用场景
在机器人操作领域,eval_yellow_block数据集专为模仿学习中的任务泛化评估而设计。其核心使用场景涵盖基于视觉的运动策略训练,特别是针对抓取与放置(pick-and-place)这类精细操作任务。该数据集通过记录SO-Follower机器人末端执行器在6自由度空间内的连续轨迹,并同步采集腕部与俯视视角的双路RGB视频流,为端到端的行为克隆提供了高保真度的多模态观测样本。研究者可基于此框架验证模型在低样本量(仅5个示范回合)下的策略学习效果,探索视觉特征与关节状态的联合表征机制,从而深入分析机器人对未知初始姿态和环境扰动的鲁棒性响应能力。
解决学术问题
该数据集核心解决了机器人学习领域中长期存在的‘小样本策略迁移’与‘多模态感知融合’两大难题。传统方法依赖大规模人工标注轨迹,而eval_yellow_block通过标准化采集流程,降低了示范数据获取成本,使得探索数据效率优化的算法成为可能。它还为视觉运动策略中的时序建模提供了基准:由30 FPS视频与6维关节状态构成的高频同步流,便于研究时间注意力机制在动作预测中的作用。更重要的是,其公开的仿真-真实对照范式推动了sim-to-real迁移理论的实证检验,为构建具备环境适应力的通用机器人控制器奠定了数据基础。
衍生相关工作
该数据集催生了一系列围绕数据效率策略蒸馏与跨视角泛化的代表性研究。例如,ACT(Action Chunking with Transformers)算法常以此类多回合关节轨迹为基础,验证其时序集成策略在小样本场景下的性能增益。此外,基于该数据集的双路视频特征,研究者开发了空间特征对齐模块,用于弥合腕部与俯视视角间的语义鸿沟。在预训练-微调范式方面,一些工作利用其5回合的结构化数据,探索了掩码自编码器(Masked Autoencoder)在机器人状态表征学习中的迁移潜力。这些衍生工作共同揭示了有限工业级数据在推动具身智能研究中的关键支撑作用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务