遇见数据集

metaworld_mt50_push_v2_image

收藏
Hugging Face2025-03-01 更新2025-04-08 收录
官方服务:

资源简介:

该数据集是使用LeRobot创建的,涉及机器人技术。数据集包含100个片段,6125帧,1个任务,但没有视频。数据以parquet格式存储,包含多种特征,如观察状态(4维浮点数组)、动作(4维浮点数组,包括x、y、z和夹持器)、奖励(1维浮点数组)、成功标志(布尔值)、环境状态(39维浮点数组,代表关键点)、图像(3通道480x480像素)、任务ID(整型)、时间戳(浮点型)、帧索引、片段索引、索引和任务索引。数据集的帧率为80fps,并包含训练分割(0:100)。此外,还对相机位置进行了调整和图像翻转。

This dataset was developed using LeRobot for robotics-related research and applications. It comprises 100 episodes, 6125 frames, and targets a single task, with no video data included. The data is stored in Parquet format and encompasses a variety of features: observation states (4-dimensional floating-point arrays), actions (4-dimensional floating-point arrays covering x, y, z, and gripper state), rewards (1-dimensional floating-point arrays), success flags (boolean values), environment states (39-dimensional floating-point arrays representing key points), images (3-channel 480×480 pixels), task IDs (integer type), timestamps (floating-point type), frame indices, episode indices, global indices, and task indices. The dataset has a frame rate of 80 fps and provides a training split indexed as 0:100. Additionally, camera poses have been adjusted and image flipping has been performed on the data.

提供机构:
lerobot
创建时间:
2025-02-13
原始信息汇总

数据集概述

基本信息

  • 名称: metaworld_mt50_push_v2_image
  • 许可证: apache-2.0
  • 任务类别: 机器人学 (robotics)
  • 标签: LeRobot

数据集描述

  • 创建工具: 使用 LeRobot 创建。
  • 相机调整: 重新定位相机并翻转渲染图像,具体参数为 env.model.cam_pos[2] = [0.75, 0.075, 0.7]。

数据集结构

  • 数据文件格式: Parquet 文件 (data/*/*.parquet)
  • 元数据文件: meta/info.json 包含以下信息:
    • 代码库版本: v2.0
    • 机器人类型: metaworld
    • 总剧集数: 100
    • 总帧数: 6125
    • 总任务数: 1
    • 总视频数: 0
    • 总块数: 1
    • 块大小: 1000
    • 帧率: 80 fps
    • 分割: 训练集 (train: 0:100)
    • 数据路径: data/chunk-{episode_chunk:03d}/episode_{episode_index:06d}.parquet
    • 视频路径: videos/chunk-{episode_chunk:03d}/{video_key}/episode_{episode_index:06d}.mp4

特征

  • observation.state:
    • 数据类型: float32
    • 形状: [4]
  • action:
    • 数据类型: float32
    • 形状: [4]
    • 轴名称: ["x", "y", "z", "gripper"]
  • next.reward:
    • 数据类型: float32
    • 形状: [1]
  • next.success:
    • 数据类型: bool
    • 形状: [1]
  • observation.environment_state:
    • 数据类型: float32
    • 形状: [39]
    • 名称: ["keypoints"]
  • observation.image:
    • 数据类型: image
    • 形状: [3, 480, 480]
    • 名称: ["channels", "height", "width"]
  • task_id:
    • 数据类型: int16
    • 形状: [1]
  • timestamp:
    • 数据类型: float32
    • 形状: [1]
  • frame_index:
    • 数据类型: int64
    • 形状: [1]
  • episode_index:
    • 数据类型: int64
    • 形状: [1]
  • index:
    • 数据类型: int64
    • 形状: [1]
  • task_index:
    • 数据类型: int64
    • 形状: [1]

引用

  • BibTeX: [More Information Needed]
搜集汇总
数据集介绍
metaworld_mt50_push_v2_image 数据集图片
构建方式
在机器人学习领域,数据集的质量与结构直接决定了模型训练的效能。metaworld_mt50_push_v2_image数据集基于LeRobot框架构建,聚焦于MetaWorld模拟环境中的推物体任务。该数据集共包含100个完整轨迹片段,累计6125帧数据,采样频率高达80帧/秒。数据以Parquet格式存储于分块文件中,同时将视觉观测以MP4视频形式独立保存,实现了高效的数据存取与处理。数据集仅设训练集,覆盖从0至99的轨迹索引,确保了数据划分的简洁性与完整性。
特点
该数据集的核心特色在于其多模态与高维度特征融合。观测空间涵盖4维状态向量、39维环境关键点信息以及480×480像素的RGB图像,动作空间则包含x、y、z方向位移与夹爪控制共4维连续量。此外,数据还记录了即时奖励、任务成功标志、任务标识符及时间戳等关键元信息,为强化学习与模仿学习研究提供了丰富的监督信号。100个轨迹片段与80帧/秒的高频采样,赋予了数据集良好的统计稳定性与时间分辨率。
使用方法
使用者可通过LeRobot库便捷地加载与解析该数据集。推荐调用LeRobot的数据集加载接口,指定数据集路径与配置名称即可自动完成Parquet数据与视频文件的索引构建。加载后的数据以结构化字典形式呈现,包含观测、动作、奖励等字段,可直接用于策略网络的训练输入。对于视觉-运动联合建模任务,可结合图像与状态特征进行端到端学习。数据集总计约300MB的存储规模,兼顾了信息密度与加载效率,适合在单机或分布式训练环境中使用。
背景与挑战
背景概述
在机器人学习领域,基于视觉的操控任务一直是研究的热点与难点,其核心在于如何让智能体从高维图像输入中提取有效信息并完成精准的动作决策。MetaWorld MT50 Push V2 Image数据集正是为应对这一挑战而构建,由Hugging Face团队通过LeRobot框架创建,专注于推动机器人推物体任务的视觉模仿学习。该数据集收录了100个演示片段,共计6125帧图像,以每秒80帧的高频采样记录了机器人末端执行器在三维空间中的位置与夹爪状态,同时提供了480×480像素的视觉观测。其研究价值在于为多任务视觉运动策略的泛化性评估提供了标准化基准,尤其针对单任务场景下的图像到动作映射能力进行精细刻画,对后续机器人操控领域的算法迁移与对比研究具有重要推动作用。
当前挑战
该数据集所解决的领域问题聚焦于视觉引导的机器人推物体操作,其核心挑战在于从高维图像中鲁棒地提取物体与环境的空间特征,并克服演示数据中存在的视角变化、光照差异及物体纹理多样性对策略泛化的干扰。在构建过程中,数据采集面临显著困难:首先,每段轨迹需在物理仿真环境中精确复现,确保动作与视觉反馈的时空同步,这对仿真器的保真度提出严苛要求;其次,数据规模有限(仅100个片段),如何从有限演示中学习到可迁移的操控策略成为算法设计的瓶颈;此外,数据集仅包含单任务配置,缺乏多场景交互数据,使得策略在未观测环境中的零样本适应能力面临严峻考验。
常用场景
经典使用场景
MetaWorld MT50 Push v2 Image数据集专为机器人视觉运动控制研究而设计,其核心应用场景聚焦于基于视觉输入的推箱子任务。该数据集通过高帧率(80 FPS)采集了100个完整轨迹,包含480×480像素的RGB图像、机器人关节状态及四维动作指令(x、y、z坐标与夹爪开合)。研究者可借此构建端到端的视觉运动策略,例如利用卷积神经网络或视觉变换器从图像中提取特征,结合强化学习算法(如SAC、PPO)训练机器人完成精准推送操作。数据集提供的稀疏奖励信号与成功标志位,为评估算法在长时序任务中的表现提供了标准化基准。
解决学术问题
该数据集有效解决了机器人学习领域中视觉策略泛化性与样本效率的经典难题。通过提供标准化的推箱子任务环境,它使研究者能够聚焦于算法核心创新而非底层仿真搭建,从而推动了模仿学习与离线强化学习的理论发展。数据集中的多模态观测数据(图像、状态、环境关键点)为探索多传感器融合策略提供了实验载体,而稀疏奖励设置则激励了层次化强化学习与内在动机机制的突破。其公开的100条轨迹虽规模有限,却为小样本学习与数据高效算法的验证设立了可复现的基准,对理解视觉运动控制的维度灾难问题具有里程碑意义。
衍生相关工作
该数据集催生了多项具有影响力的研究工作,其中最具代表性的是基于预训练视觉表征的机器人操作范式。研究者借鉴了CLIP等视觉-语言模型的预训练思想,利用该数据集验证了视觉编码器在机器人下游任务中的迁移能力。另一经典工作是将扩散模型引入动作序列生成,通过在MetaWorld数据上训练条件扩散策略,实现了比传统高斯策略更优的多模态动作分布拟合。此外,该数据集被广泛用作离线强化学习算法的评测基准,如CQL、IQL等方法的论文中均将其作为标准测试环境,推动了基于价值函数的离线策略优化理论在视觉运动控制中的系统化发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务