Behavior-Skill
收藏资源简介:
Behavior-Skill是一个以技能为中心的数据集与评估基准,构建于BEHAVIOR-1K仿真环境之上,专门用于评估长时移动操作任务中的视觉-语言-动作(VLA)策略。该数据集将可执行的构成性技能作为策略学习和评估的基本单元。数据集包含从50个家庭任务的10,000个演示中提取的235,492个技能实例,覆盖34个语义技能类别。每个实例均包含技能指令及其在对应BEHAVIOR-1K演示中对齐的帧区间。对于500个评估演示(每个任务10个),数据集额外提供了每技能的BDDL成功条件以及可恢复的OmniGibson中间状态,支持独立的闭环技能评估。注释覆盖全部演示集,评估配置和初始状态仅覆盖500个评估演示。数据以JSON和YAML文件组织,包括技能注释、评估配置和初始状态三部分,并通过任务ID、演示ID和技能索引实现跨组件映射。数据集采用MIT许可证发布。
Behavior-Skill is a skill-centric dataset and evaluation benchmark built upon the BEHAVIOR-1K simulation environment, specifically designed for evaluating Vision-Language-Action (VLA) policies in long-horizon mobile manipulation tasks. The dataset uses executable compositional skills as the basic unit for policy learning and evaluation. It contains 235,492 skill instances extracted from 10,000 demonstrations of 50 household tasks, covering 34 semantic skill categories. Each instance includes a skill instruction and its aligned frame interval in the corresponding BEHAVIOR-1K demonstration. For 500 evaluation demonstrations (10 per task), the dataset additionally provides per-skill BDDL success conditions and recoverable OmniGibson intermediate states, supporting independent closed-loop skill evaluation. Annotations cover the entire demonstration set, while evaluation configurations and initial states only cover the 500 evaluation demonstrations. The data is organized in JSON and YAML files, comprising three parts: skill annotations, evaluation configurations, and initial states, with cross-component mapping via task ID, demonstration ID, and skill index. The dataset is released under the MIT license.
Behavior-Skill 数据集概述
Behavior-Skill 是一个基于 BEHAVIOR-1K 构建的技能中心数据集与评估基准,专为长时程移动操作任务中的视觉-语言-动作(VLA)策略设计,以可执行的组成技能作为策略学习和评估的基本单元。
核心统计
| 统计项 | 数值 |
|---|---|
| 来源基准 | BEHAVIOR-1K |
| 家庭任务数 | 50 |
| 演示数量 | 10,000 |
| 技能实例总数 | 235,492 |
| 语义技能类别 | 34 |
| 平均技能时长 | 16.6 秒 |
| 评估演示数量 | 500(每个任务10个) |
数据内容
数据集包含四类核心内容:
- 技能标注(skill_annotations):全量演示集中的逐回合技能指令及对齐帧区间,用于技能策略训练和数据分析。
- 技能评估配置(skill_eval_configs):针对500条评估演示的每回合YAML文件,包含BDDL上下文和每个技能的成功目标,支持独立的技能评估。
- 技能初始状态(skill_init_states):评估演示中每个技能执行前的可恢复OmniGibson场景快照及对齐元数据,用于在有效前置条件下初始化技能级回放。
- 评估回合映射(eval_episodes.json):将50个任务映射到其提示词、任务ID和10个评估回合,便于解析评估子集与文件路径。
评估配置和初始状态仅覆盖500条评估演示,而非全部235,492个技能实例。
数据格式
- 技能标注文件(JSON格式)包含任务名称、任务级指令、有序技能指令列表及其对应的起止帧。
- 评估配置(YAML格式)包含任务级BDDL上下文(对象声明、初始事实、额外对象名映射)及按序排列的技能列表,每个技能条目记录其ID、指令、语义类别、类型和BDDL目标。
- 初始状态文件包含每项评估技能对应的场景快照(JSON)和携带帧区间信息的对齐元数据(NPZ),以及记录全部技能映射关系的状态清单。场景快照的恢复依赖于特定版本的OmniGibson(3.7.2)、BDDL(3.7.0)和BEHAVIOR-1K资源(3.7.2rc1)。
组件关联方式
任务ID、回合ID和局部技能索引三者相互关联,例如 task-0000 的 episode_00000010 中第3个技能(索引2)可分别通过标注文件中的 cot_skill_list[2]、YAML配置中的 skills[2]、状态清单中的 skills[2] 以及对应的 skill_02_scene.json 与 skill_02_state.npz 进行定位。
许可与引用
该数据集标注、评估配置、状态快照、元数据和文档以MIT许可证发布,但第三方数据集、模拟器及资源仍受各自许可约束。相关论文发表于arXiv(编号2608.30536),代码及联系方式已在GitHub仓库公开。





