遇见数据集

VLA_Benchmark_Prompted_1200

收藏
Hugging Face2026-07-29 更新2026-07-30 收录
官方服务:

资源简介:

VLA Benchmark Prompted 1200 数据集是一个非破坏性的 LeRobot v3.0 版本,由六个各包含 200 个 episodes 的基准数据集合并而成。该数据集总计包含 1,200 个训练 episodes 和 614,367 帧数据。每个 episode 的任务字符串均来源于 `meta/benchmark/prompt_manifest_v2.csv` 文件中指定的提示。数据集中,可乐和百事可乐对象被规范地标注为压扁的可乐罐和压扁的百事可乐罐。所有数据行均属于训练集分割。在提示设计方面,提示清单 v2 版本仅更改了 200 个状态识别任务字符串:在微调过程中明确展示了“打开”和“倒置”状态;而“关闭”和“直立”状态则被保留,不出现在微调语言中。关闭/直立状态的物理演示仍保留在训练集中,但使用诸如“将白色杯子放入碗中”之类的类别专用提示。这些类别专用提示在所有四种物理状态/朝向单元中共享,因此通用措辞并非关闭或直立状态的代称。数据集还包含一个状态识别回忆覆盖层:在 2026-07-29,按照检查表行顺序,用来自 `justintiensmith/MT_State_Recognition_40` 数据集的 episodes 0–39 替换了 40 个经检查表选定的 episode 插槽,同时保留了原有的 episode 提示和任务索引。替换后数据集仍包含 614,367 帧。该数据集整合了六个源数据集,分别专注于不同的子任务:状态识别、关系放置、指代消歧、排序、计数和大小识别。它适用于机器人学和视觉语言动作(VLA)领域的研究与开发,特别是涉及多任务学习、状态理解、物体操作和基于提示的任务执行等场景。

The VLA Benchmark Prompted 1200 dataset is a non-destructive LeRobot v3.0 version, merged from six benchmark datasets each containing 200 episodes. The dataset contains a total of 1,200 training episodes and 614,367 frames. Each episodes task string is derived from the prompts specified in the `meta/benchmark/prompt_manifest_v2.csv` file. In the dataset, Coke and Pepsi objects are consistently labeled as crushed Coke can and crushed Pepsi can. All data rows belong to the training set split. In terms of prompt design, the prompt manifest v2 only changed 200 state recognition task strings: during fine-tuning, the "open" and "inverted" states are explicitly demonstrated; while the "closed" and "upright" states are retained and not present in the fine-tuning language. Physical demonstrations of closed/upright states are still preserved in the training set, but use category-specific prompts such as "place the white cup in the bowl". These category-specific prompts are shared across all four physical state/orientation units, so the generic wording is not a substitute for closed or upright states. The dataset also includes a state recognition recall overlay: on 2026-07-29, 40 episode slots selected by a checklist were replaced with episodes 0–39 from the `justintiensmith/MT_State_Recognition_40` dataset, preserving the original episode prompts and task indices. The dataset still contains 614,367 frames after replacement. This dataset integrates six source datasets, each focusing on different sub-tasks: state recognition, relational placement, reference disambiguation, sorting, counting, and size recognition. It is suitable for research and development in robotics and visual language action (VLA), especially for scenarios involving multi-task learning, state understanding, object manipulation, and prompt-based task execution.

创建时间:
2026-07-27
原始信息汇总

数据集概述:VLA Benchmark Prompted 1200

  • 数据集地址:https://huggingface.co/datasets/justintiensmith/VLA_Benchmark_Prompted_1200
  • 许可证:Apache-2.0
  • 任务类别:机器人学(robotics)
  • 标签:LeRobot、VLA、机器人学

数据集构成

  • 总集数:1,200 个训练集(episodes)
  • 总帧数:614,367 帧
  • 数据格式:Parquet 文件,位于 data/*/*.parquet
  • 数据分割:所有数据均为训练集(training split)

数据来源

该数据集是对六个各包含 200 集(episodes)的基准数据集进行的非破坏性 LeRobot v3.0 合并,每个子集的修订版本如下(均锁定到特定提交哈希):

  • justintiensmith/MT_State_Recognition_200(提交 168e12e735da9ad62716dca89cff660b53082cc3
  • justintiensmith/SP_Relational_Placement_200(提交 8eff46af18af7a9a6f763ed975f8b3357c673685
  • justintiensmith/SP_Referential_Disambiguation_200(提交 2642784f74a0c91bc118702b7993895aacd311f5
  • justintiensmith/SP_Sequencing_200(提交 1cda4c4c3c6ae1fa4b5dc6d2cf4c887bb9f1da4e
  • justintiensmith/SP_Counting_200(提交 6591c0f19952e23010b7c6a0630e4d60f8714cbb
  • justintiensmith/MT_Size_Recognition_200(提交 3a6e75d91e8339a87eebd8e545d87b148ae19925

此外,在 2026-07-29,通过从数据集 justintiensmith/MT_State_Recognition_40(提交 33c4b378b5867aa82ef7fd0b4f6157f0c11f7a05)替换了 40 个选中的集(episodes),替换后总帧数仍为 614,367 帧。

任务与提示设计

  • 任务字符串:每个集(episode)的任务字符串由 meta/benchmark/prompt_manifest_v2.csv 中的指定提示(prompt)确定
  • V2 提示设计:仅对 200 个“状态识别”(State Recognition)任务字符串进行了修改:
    • openupside-down 在微调时被明确展示
    • closedupright 在微调语言中未被包含(被故意保留)
    • closedupright 的物理演示仍保留在训练中,但仅使用类别提示,例如“Place a white cup in the bowl.”
    • 类别提示在所有四种物理状态/方向单元格中共享
  • 采样权重:推荐采样权重记录在 meta/benchmark/prompt_manifest_v2.xlsx 中(该数据集不复制或过采样集)
  • 原视频与轨迹:与 V1 提示版本相比无变化
  • 保留文件:V1 清单和验证文件被保留用于溯源

物体标注

  • Coke 和 Pepsi 物体:标准标注为压扁的可口可乐罐和压扁的百事可乐罐

本地标识符

  • justintiensmith/VLA_Benchmark_Prompted_1200
搜集汇总
数据集介绍
VLA_Benchmark_Prompted_1200 数据集图片
构建方式
本数据集通过非破坏性合并六个各含200个演示片段的基准数据集构建而成,最终汇聚了1200个训练片段与614367帧图像。每个片段的任务指令均严格源自`prompt_manifest_v2.csv`中的指定提示。在构建过程中,特别采用了主动提示设计策略:对`open`与`upside-down`状态在微调时显式呈现,而`closed`与`upright`状态则从语言指令中完全剔除,但其物理演示仍保留于训练集中,仅以类别通用提示(如“将白色杯子放入碗中”)进行标记,以此检验模型对未见语言的泛化能力。此外,还针对状态识别任务引入了回忆覆盖机制,将40个选定片段替换为专用数据集的对应片段,并保留了原有提示与任务索引。
特点
该数据集的核心特点在于其精巧的提示设计结构:通过有策略地保留与遮蔽特定状态描述,迫使模型在物理演示中学习隐含的状态概念,而非依赖词汇线索直接对应。同时,数据集明确标注了所有源数据的不可变修订版本号,确保了实验的可重复性与来源溯源性。所有数据均已预先划分为训练集,无需用户再行拆分。推荐采样器权重作为审计元数据存储于清单中,数据集本身不进行任何重复或过采样操作,维持了原始分布的真实性。
使用方法
用户可直接从HuggingFace加载该数据集,利用默认配置即可获取包含所有片段与帧的Parquet格式文件。数据分为六个子数据集,每个子数据集对应特定的任务类型,如状态识别、关系放置、指代消歧等。在使用时,建议参阅随附的`prompt_manifest_v2.xlsx`电子表格以获取完整的提示清单及其对应的推荐采样权重。对于涉及状态识别的研究,尤其需要注意其提示设计逻辑,以避免在微调或评估时错误地泄露测试信息。视频与轨迹数据均保持与原始版本的一致性,无需额外处理。
背景与挑战
背景概述
随着视觉-语言-动作(VLA)模型在机器人操作任务中的广泛应用,如何构建能够系统评估模型在复杂语言指令与物理状态理解能力上的基准数据集成为关键。VLA_Benchmark_Prompted_1200数据集由研究团队于2026年创建,整合了六个各含200个示范片段的子数据集,总计1200个训练片段与614,367帧图像。其核心研究问题聚焦于VLA模型在状态识别、关系放置、引用消歧、排序、计数及尺寸识别等多样化任务上的泛化能力,尤其关注模型对指令中语义细微差异(如“打开”与“关闭”,“正放”与“倒置”)的响应。该数据集通过精心设计的prompt控制策略,在物理演示中嵌入语言挑战,为探究语言表征与物理状态之间的对应关系提供了重要资源。
当前挑战
该数据集所解决的领域问题在于VLA模型对语言指令中隐含物理状态与空间关系的理解能力不足,例如模型需区分“将压扁的可乐罐放入碗中”与“将立着的杯子放入碗中”等指令背后的状态差异。构建过程中的挑战在于:一方面,需设计严格的prompt控制实验,部分提示词(如“关闭”“正放”)在微调阶段被刻意隐藏,仅通过类别性描述(如“将白色杯子放入碗中”)间接训练,以避免模型依赖表面词汇对应;另一方面,需保证被替换的40个特定片段在保留原任务轨迹的前提下重新收集,并保持数据集版本的可追溯性,确保基准评估的公平性与可复现性。
常用场景
经典使用场景
在机器人学习与视觉-语言-动作(VLA)模型研究的前沿领域,VLA_Benchmark_Prompted_1200数据集被广泛用于多任务策略的泛化能力评估。该数据集精心整合了六个各含200条示范的基准子集,涵盖状态识别、关系放置、指代消歧、序列操作、计数及尺寸感知等核心机器人操作任务。研究者利用其统一的提示标注机制,训练模型在自然语言指令驱动下完成物理世界中物体的抓取、放置与状态判断,尤其关注模型对未见过的状态描述(如“闭合”与“直立”的词汇)的零样本或小样本适应能力,成为验证VLA模型语义理解与动作耦合水平的经典测试平台。
衍生相关工作
基于该数据集衍生出一系列经典工作,诸如针对提示工程的细粒度分析揭示了语言编码与策略网络间耦合的脆弱性,促使研究者提出自适应提示重标注与对比学习框架。另有工作以此为基础构建了多模态逆强化学习模型,成功从跨任务共享的机械臂轨迹中提取出可迁移的奖励函数。值得一提的是,数据集中状态识别覆盖子集(MT_State_Recognition_40)的引入,为验证模型对部分属性遗忘的鲁棒性提供了案例,相关研究进而催生了基于注意力剪枝与经验回放缓冲的持续学习范式,显著提升了长序列任务下的操作成功率。
数据集最近研究
最新研究方向
VLA_Benchmark_Prompted_1200数据集面向具身智能领域中的视觉-语言-动作(VLA)大模型,专注于机器人操作的主动提示设计与状态识别泛化能力评估。其核心创新在于通过精细的提示工程控制语言符号与物理状态之间的关联,例如在训练中显式展示“open”与“closed”等状态词汇,同时保留对未显式呈现的“upright”状态的测试能力,从而系统性地衡量模型在语言与动作间进行复杂映射时的鲁棒性与零样本泛化潜力。该数据集通过精心设计的提示清单与状态识别回忆覆盖机制,整合了多种基准任务(如关系放置、指代消歧、序列执行与计数),为研究多模态融合、上下文依赖行为及机器人对非显式指令的适应性提供了标准化测试平台。其发布紧贴大语言模型与机器人学交叉前沿,推动了以数据驱动的提示敏感型智能体评估范式的发展,对于构建更可靠、可解释的交互式机器人系统具有重要基准意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务