遇见数据集

VLA_Reasoning_Training_Dataset_1200

收藏
Hugging Face2026-08-06 更新2026-08-06 收录
官方服务:

资源简介:

用于推理基准的修正版LeRobot v3.0微调数据集。包含1200个episodes,612733帧,五个RGB相机流,六维机器人状态和六维动作,帧率为30 FPS。此外,数据集还涉及替换和组装细节:episodes 0-199来自justintiensmith/MT_State_Recognition_New,episodes 200-1199保留自justintiensmith/VLA_Benchmark_Prompted_1200,每个episode的最终提示来自meta/benchmark/VLA_Reasoning_Dataset_Missing_Cell_Prompt_Manifest.csv,总共包含321个唯一的提示字符串。

This is a corrected version of LeRobot v3.0 fine-tuning dataset for reasoning benchmark. Contains 1200 episodes, 612733 frames, five RGB camera streams, six-dimensional robot state and six-dimensional action, at 30 FPS. Additionally, the dataset involves replacement and assembly details: episodes 0-199 from justintiensmith/MT_State_Recognition_New, episodes 200-1199 kept from justintiensmith/VLA_Benchmark_Prompted_1200, with final prompt for each episode from meta/benchmark/VLA_Reasoning_Dataset_Missing_Cell_Prompt_Manifest.csv, totaling 321 unique prompt strings.

提供机构:
justintiensmith
创建时间:
2026-08-06
原始信息汇总

数据集概述

VLA Reasoning Training Dataset 1200 是一个面向机器人推理任务的微调数据集,基于 LeRobot v3.0 格式构建。数据集包含 1,200 个episodes612,733 帧,配备 五个RGB摄像头流六维机器人状态六维动作数据,采样频率为 30 FPS。该数据集主要用于视觉-语言-动作(VLA)模型的训练,特别聚焦于组合泛化(compositional generalization)能力。

数据集构建与来源

数据集的构建分为两个部分:

每个 episode 的最终提示(prompt)来源于 meta/benchmark/VLA_Reasoning_Dataset_Missing_Cell_Prompt_Manifest.csv 文件。整个数据集共包含 321 个唯一提示字符串

元数据与设计

数据集的完整 episode 级设计和来源信息存储在以下文件中:

  • meta/training_manifest.parquet
  • meta/training_manifest.csv
  • 可读的工作簿文件位于 meta/benchmark/ 目录下。

状态识别缺失单元

状态识别子集明确覆盖了 105 个已见的物体-状态单元,并包含 95 个状态掩蔽的物理曝光。以下正提示组合被保留为未出现(held out):

  • upside-down white cup
  • open yellow-white striped cup
  • closed brown cup
  • upright glass spice container

其余五个任务使用清单中记录的缺失单元提示分配方案。

其他信息

  • 许可证:Apache-2.0
  • 任务类别:机器人(robotics)
  • 标签:LeRobot、VLA、机器人、组合泛化
  • 数据格式:Parquet 文件(data/*/*.parquet
二维码
社区交流群
二维码
科研交流群
商业服务