遇见数据集

tutorial_v2

收藏
Hugging Face2026-03-06 更新2026-03-06 收录
官方服务:

资源简介:

该数据集为HuggingFace LeRobot格式机器人数据集。

This dataset is a robotics dataset in the HuggingFace LeRobot format.

提供机构:
y0-0n
创建时间:
2026-03-06
原始信息汇总

数据集概述

基本信息

  • 数据集名称: tutorial_v2
  • 创建工具: LeRobot (https://github.com/huggingface/lerobot)
  • 许可证: Apache 2.0
  • 任务类别: 机器人学
  • 标签: LeRobot

数据集结构

  • 配置名称: default
  • 数据文件格式: Parquet
  • 数据文件路径模式: data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet
  • 视频文件路径模式: videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4
  • 数据划分: 仅包含训练集(train),涵盖全部50个片段。

数据规模

  • 总片段数: 50
  • 总帧数: 9758
  • 总任务数: 1
  • 块大小: 1000
  • 数据文件总大小: 100 MB
  • 视频文件总大小: 200 MB
  • 帧率: 20 FPS

数据特征

数据集包含以下特征字段:

观测数据

  • observation.image: 图像数据,数据类型为图像,形状为 [256, 256, 3]。
  • observation.wrist_image: 腕部图像数据,数据类型为图像,形状为 [256, 256, 3]。
  • observation.state: 状态数据,数据类型为 float32,形状为 [8]。
  • observation.eef_pose: 末端执行器位姿数据,数据类型为 float32,形状为 [7]。

动作数据

  • action: 动作数据,数据类型为 float32,形状为 [7]。

环境数据

  • env.obj_pose: 物体位姿数据,数据类型为 float32,形状为 [10, 6]。
  • env.obj_names: 物体名称数据,数据类型为 string,形状为 [1]。
  • env.obj_q_names: 物体关节名称数据,数据类型为 string,形状为 [1]。
  • env.obj_q_states: 物体关节状态数据,数据类型为 float32,形状为 [10]。
  • env.config_file_name: 配置文件名称数据,数据类型为 string,形状为 [1]。

索引与时间数据

  • timestamp: 时间戳数据,数据类型为 float32,形状为 [1]。
  • frame_index: 帧索引数据,数据类型为 int64,形状为 [1]。
  • episode_index: 片段索引数据,数据类型为 int64,形状为 [1]。
  • index: 索引数据,数据类型为 int64,形状为 [1]。
  • task_index: 任务索引数据,数据类型为 int64,形状为 [1]。

元数据

  • 代码库版本: v3.0
  • 机器人类型: omy

补充信息

  • 主页: 信息缺失
  • 论文: 信息缺失
  • 引用格式: 信息缺失
搜集汇总
数据集介绍
构建方式
在机器人学习领域,高质量的数据集是驱动智能体从感知到行动的核心基石。tutorial_v2数据集依托于LeRobot框架构建,专为模仿学习与机器人操控任务设计。该数据集共收录50个完整轨迹片段,总计9758帧时序数据,数据以20帧每秒的采样率采集,并严格划分为训练集(索引0至49)。数据结构采用分块存储策略,元数据与视频文件分别以parquet和mp4格式组织于data与videos目录下,每块包含1000帧,确保大规模数据的高效存取与扩展性。
特点
tutorial_v2数据集在特征设计上展现出高度的结构化与多模态融合特性。其观测空间包含256×256像素的RGB图像与腕部图像,辅以8维状态向量及7维末端执行器位姿,全面捕获机器人本体与环境交互的视觉与动力学信息。动作空间为7维连续控制信号,同时提供10个物体的6维位姿、名称及关节状态等环境变量,为复杂操作任务提供丰富的上下文。数据集仅包含单一任务类型,但通过多样化的物体状态与配置文件名,隐式支持了场景泛化能力的评估。
使用方法
使用tutorial_v2数据集时,推荐通过LeRobot库加载与预处理。用户可依据meta/info.json中的特征定义,直接读取parquet文件获取时序数据,并关联对应视频帧用于视觉输入。训练过程中,需将观测图像、状态与动作序列对齐,构建用于模仿学习的状态-动作对或轨迹块。数据集已预设训练集划分,无需额外拆分,但可基于task_index或episode_index进行任务级筛选。对于多模态融合,可分别处理图像与状态特征,并通过时间戳同步,以适配端到端策略网络或基于Transformer的轨迹预测模型。
背景与挑战
背景概述
在机器人学习领域,数据驱动的范式正逐步取代传统基于模型的控制方法,成为推动具身智能发展的关键力量。tutorial_v2数据集诞生于这一背景下,由Hugging Face的LeRobot团队创建,旨在为机器人操作任务提供标准化、可复用的训练数据。该数据集基于omy型机器人平台采集,包含50个完整回合、近万帧高频率(20fps)的观测与动作记录,覆盖单一任务场景。其核心研究问题聚焦于如何利用多模态感知信息(包括主视角与腕部图像、关节状态、末端执行器位姿及环境物体属性)来学习鲁棒的机器人操控策略。作为LeRobot生态系统的组成部分,该数据集为社区提供了易于接入的基准,推动了模仿学习与强化学习算法在真实机器人上的验证与比较。
当前挑战
tutorial_v2数据集所面临的挑战首先体现在领域问题的复杂性上:机器人操控任务要求模型在动态环境中实现精准的视觉-运动耦合,而当前数据仅包含单一任务与50个回合,样本多样性严重不足,难以泛化至未见的物体布局或操作轨迹。构建过程中,数据采集依赖人工遥操作或预设程序,不仅耗时且难以保证动作质量的一致性,同时多模态传感器(如腕部相机与关节编码器)的同步与标定误差会引入噪声。此外,数据存储采用Parquet与视频分离的格式,虽利于高效压缩,却增加了流式读取与实时处理的工程难度。如何在小样本条件下提升策略的鲁棒性,以及如何降低数据采集与预处理的门槛,仍是该数据集亟待突破的瓶颈。
常用场景
经典使用场景
在机器人学习与智能控制领域,tutorial_v2数据集以其结构化、多模态的观测与动作记录,成为训练机器人操作策略的经典基准。该数据集包含50个完整回合、近万帧数据,涵盖了高分辨率视觉图像(包括主视角与腕部视角)、机器人关节状态、末端执行器位姿以及环境物体位姿等丰富信息,为模仿学习与强化学习算法提供了标准化的训练与评估平台。研究者常利用该数据集验证行为克隆、逆强化学习及离线强化学习等方法的有效性,尤其在单任务精细操作场景中,其高保真度观测与精确动作标签使得策略学习具备可重复性与可比性。
衍生相关工作
围绕tutorial_v2数据集,衍生出一系列具有影响力的研究工作。例如,基于该数据集的模仿学习研究提出了多模态注意力融合架构,利用视觉与状态信息联合预测动作序列;离线强化学习领域涌现出针对高维观测空间的正则化策略优化方法,有效缓解了外推误差。同时,该数据集被用作数据增强与领域随机化技术验证的测试床,催生了如动态时间规整与对抗扰动训练等提升策略泛化性的经典方法。这些工作不仅深化了对机器人操作学习机制的理解,也为后续大规模多任务数据集的构建奠定了方法论基础。
数据集最近研究
最新研究方向
在机器人学习领域,tutorial_v2数据集作为基于LeRobot框架构建的示范性资源,正推动着模仿学习与行为克隆技术的前沿探索。该数据集包含50个完整回合、近万帧高分辨率视觉与状态动作序列,其多模态特征设计——涵盖256×256的观测与腕部图像、8维机器人状态、7维末端执行器位姿及10个物体的6D位姿信息——为复杂操作任务的端到端学习提供了标准化基准。当前研究热点聚焦于利用此类高质量专家演示数据训练通用机器人策略,尤其在物体抓取与精细操控任务中,通过对比学习与扩散策略等方法提升模型对动态环境的泛化能力。该数据集的出现响应了机器人社区对可复现、低门槛数据资源的迫切需求,其与Hugging Face生态的深度整合,加速了从仿真到真实场景的迁移学习研究,为构建类人灵巧操作能力奠定了数据基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务