遇见数据集

Behavior-Skill

收藏
Hugging Face2026-09-06 更新2026-09-07 收录
官方服务:

资源简介:

Behavior-Skill是一个以技能为中心的数据集与评估基准,构建于BEHAVIOR-1K仿真环境之上,专门用于评估长时移动操作任务中的视觉-语言-动作(VLA)策略。该数据集将可执行的构成性技能作为策略学习和评估的基本单元。数据集包含从50个家庭任务的10,000个演示中提取的235,492个技能实例,覆盖34个语义技能类别。每个实例均包含技能指令及其在对应BEHAVIOR-1K演示中对齐的帧区间。对于500个评估演示(每个任务10个),数据集额外提供了每技能的BDDL成功条件以及可恢复的OmniGibson中间状态,支持独立的闭环技能评估。注释覆盖全部演示集,评估配置和初始状态仅覆盖500个评估演示。数据以JSON和YAML文件组织,包括技能注释、评估配置和初始状态三部分,并通过任务ID、演示ID和技能索引实现跨组件映射。数据集采用MIT许可证发布。

Behavior-Skill is a skill-centric dataset and evaluation benchmark built upon the BEHAVIOR-1K simulation environment, specifically designed for evaluating Vision-Language-Action (VLA) policies in long-horizon mobile manipulation tasks. The dataset uses executable compositional skills as the basic unit for policy learning and evaluation. It contains 235,492 skill instances extracted from 10,000 demonstrations of 50 household tasks, covering 34 semantic skill categories. Each instance includes a skill instruction and its aligned frame interval in the corresponding BEHAVIOR-1K demonstration. For 500 evaluation demonstrations (10 per task), the dataset additionally provides per-skill BDDL success conditions and recoverable OmniGibson intermediate states, supporting independent closed-loop skill evaluation. Annotations cover the entire demonstration set, while evaluation configurations and initial states only cover the 500 evaluation demonstrations. The data is organized in JSON and YAML files, comprising three parts: skill annotations, evaluation configurations, and initial states, with cross-component mapping via task ID, demonstration ID, and skill index. The dataset is released under the MIT license.

创建时间:
2026-08-26
原始信息汇总

Behavior-Skill 数据集概述

Behavior-Skill 是一个基于 BEHAVIOR-1K 构建的技能中心数据集与评估基准,专为长时程移动操作任务中的视觉-语言-动作(VLA)策略设计,以可执行的组成技能作为策略学习和评估的基本单元。

核心统计

统计项 数值
来源基准 BEHAVIOR-1K
家庭任务数 50
演示数量 10,000
技能实例总数 235,492
语义技能类别 34
平均技能时长 16.6 秒
评估演示数量 500(每个任务10个)

数据内容

数据集包含四类核心内容:

  • 技能标注(skill_annotations):全量演示集中的逐回合技能指令及对齐帧区间,用于技能策略训练和数据分析。
  • 技能评估配置(skill_eval_configs):针对500条评估演示的每回合YAML文件,包含BDDL上下文和每个技能的成功目标,支持独立的技能评估。
  • 技能初始状态(skill_init_states):评估演示中每个技能执行前的可恢复OmniGibson场景快照及对齐元数据,用于在有效前置条件下初始化技能级回放。
  • 评估回合映射(eval_episodes.json):将50个任务映射到其提示词、任务ID和10个评估回合,便于解析评估子集与文件路径。

评估配置和初始状态仅覆盖500条评估演示,而非全部235,492个技能实例。

数据格式

  • 技能标注文件(JSON格式)包含任务名称、任务级指令、有序技能指令列表及其对应的起止帧。
  • 评估配置(YAML格式)包含任务级BDDL上下文(对象声明、初始事实、额外对象名映射)及按序排列的技能列表,每个技能条目记录其ID、指令、语义类别、类型和BDDL目标。
  • 初始状态文件包含每项评估技能对应的场景快照(JSON)和携带帧区间信息的对齐元数据(NPZ),以及记录全部技能映射关系的状态清单。场景快照的恢复依赖于特定版本的OmniGibson(3.7.2)、BDDL(3.7.0)和BEHAVIOR-1K资源(3.7.2rc1)。

组件关联方式

任务ID、回合ID和局部技能索引三者相互关联,例如 task-0000episode_00000010 中第3个技能(索引2)可分别通过标注文件中的 cot_skill_list[2]、YAML配置中的 skills[2]、状态清单中的 skills[2] 以及对应的 skill_02_scene.jsonskill_02_state.npz 进行定位。

许可与引用

该数据集标注、评估配置、状态快照、元数据和文档以MIT许可证发布,但第三方数据集、模拟器及资源仍受各自许可约束。相关论文发表于arXiv(编号2608.30536),代码及联系方式已在GitHub仓库公开。

搜集汇总
数据集介绍
Behavior-Skill 数据集图片
构建方式
Behavior-Skill数据集以BEHAVIOR-1K仿真环境为基石,针对移动操控任务中视觉-语言-动作策略的长时程执行特性,创新性地将技能作为策略学习与评估的基本单元。该数据集从10,000条成功演示中,通过精细的注释流程,提取出覆盖50项家务活动的235,492个技能实例,每个实例均包含语言指令及其对应的帧区间。注释过程遵循认知链(CoT)策略,确保技能划分的逻辑连贯性。此外,为支持独立的闭环评估,数据集为500条评估演示(每任务10条)提供了逐技能的BDDL成功条件和可恢复的OmniGibson状态快照,从而构建了从指令到状态恢复的完整评估链路。
特点
Behavior-Skill数据集的核心特点在于其技能中心的设计范式,将长时程任务分解为语义可解释、时序可对齐的技能单元,显著降低了策略学习的复杂性。其规模与粒度优势突出,涵盖34个语义技能类别,平均技能时长16.6秒,实现了对多样化家务操作的细粒度覆盖。评估机制是另一大亮点,通过提供技能级别的BDDL目标与初始状态恢复文件,支持独立的闭环技能评估,避免了整任务评估中误差累积的干扰。此外,数据集的模块化结构(注释、配置、状态分离)与版本敏感性兼容机制,确保了研究的可复现性与扩展性。
使用方法
使用Behavior-Skill数据集时,研究者可通过HuggingFace CLI按需求下载相应组件,如使用`hf download`命令获取完整数据集或仅下载技能评估配置。训练技能策略时,可加载`skill_annotations`目录下的JSON文件,利用其中的技能指令和帧区间对齐原始BEHAVIOR-1K演示数据。进行技能评估时,需结合`skill_eval_configs`中的YAML文件与`skill_init_states`中的场景/状态快照,在匹配的OmniGibson环境(版本3.7.2等)中初始化回滚,并根据BDDL目标判断成功与否。跨组件映射通过任务ID、片段ID及技能索引实现,用户可参照数据集文档进行灵活的实验设计与结果分析。
背景与挑战
背景概述
Behavior-Skill数据集由国防科技大学Nubot团队联合多所机构于2026年构建,是基于BEHAVIOR-1K仿真平台、面向长时程移动操控任务的技能中心基准。该数据集将可执行的子技能确立为视觉-语言-动作(VLA)策略学习与评估的基本单元,提供23.5万个技能实例,覆盖50个家务任务与34类语义技能,并配套500条评估演示的BDDL成功条件与可恢复仿真状态。其研究核心在于弥合高层任务指令与低层动作执行间的鸿沟,为VLA策略的细粒度、可重复评测提供标准化平台,对具身智能领域技能分解、策略泛化及闭环评估研究具有推动意义。
当前挑战
Behavior-Skill应对的核心挑战在于长时程移动操控任务中现有VLA策略评估粒度粗糙、可复现性不足,难以支撑技能级学习与诊断。该数据集通过将任务分解为可执行技能,并引入BDDL条件及可恢复仿真状态,有效化解了评估逻辑缺失与初始化瓶颈。构建中则遭遇了大规模跨任务技能注释一致性、帧对齐精度控制、BDDL上下文与状态快照的版本兼容性(如OmniGibson 3.7.2)等难题,需在10,000条演示中精细标注并确保500条评估演示的独立闭环可执行性,同时规避场景特定专家知识带来的偏差,最终实现高效、标准化的技能级评测生态。
常用场景
经典使用场景
Behavior-Skill数据集作为面向长时程移动操控任务的技能中心基准,为视觉-语言-动作(VLA)策略研究提供了精细化的评估框架。该数据集基于BEHAVIOR-1K构建,将复杂任务分解为可执行的原子技能,涵盖50个家庭任务、34种技能类别及超过23万个技能实例,每个实例均配备指令文本与时间对齐的帧区间。研究者可利用该数据集训练VLA模型掌握细粒度技能执行能力,亦可作为标准基准评估策略在不同技能层面的泛化性能与鲁棒性,从而推动具身智能体在真实世界复杂场景中的任务分解与执行效能研究。
解决学术问题
该数据集直面长时程任务中VLA策略评估粒度粗糙的学术症结,传统基准常以整个任务为单位评判成效,难以定位策略的具体薄弱环节。Behavior-Skill提出以技能为基本单元的评估范式,通过提供每项技能的BDDL成功条件与可恢复的OmniGibson状态,实现了技能级别的闭环评估,使研究者能够精确剖析策略在特定操作环节的表现。此举显著提升了评估的可解释性,为探究任务分解策略、技能复用机制以及层次化决策等核心科学问题奠定了数据基石,并对技能学习理论的发展起到推动作用。
衍生相关工作
该数据集的发布催生了多项衍生研究,包括面向长时程任务的技能感知策略学习方法、基于技能分解的层次化强化学习框架,以及融合技能指令的跨任务泛化模型。后续工作亦利用其评估配置探索技能级奖励塑形、状态可恢复性分析与数据高效训练等课题,并推动BEHAVIOR-1K生态内标准评估协议的形成。这些衍生工作共同巩固了以技能为中心的评测理念,为具身智能领域树立了新的参照体系。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务