遇见数据集

Behavior-Skill

收藏
github2026-09-03 更新2026-09-04 收录
官方服务:

资源简介:

Behavior-Skill是一个以技能为中心的数据集和评估基准,基于BEHAVIOR-1K构建。它重新定义了长时域任务的学习和评估,围绕可执行的组成技能展开。每个评估单元结合了一个技能指令、一个可恢复的中间模拟器状态、一个可执行的BDDL成功条件以及一个评估时域。

Behavior-Skill is a skill-centric dataset and evaluation benchmark built upon BEHAVIOR-1K. It redefines the learning and evaluation of long-horizon tasks, centered on executable compositional skills. Each evaluation unit combines a skill instruction, a recoverable intermediate simulator state, an executable BDDL success condition, and an evaluation time horizon.

创建时间:
2026-08-31
原始信息汇总

Behavior-Skill 数据集概述

Behavior-Skill 是一个围绕技能(skill)构建的细粒度基准数据集与评测框架,基于 BEHAVIOR-1K 构建,面向长时间跨度的视觉-语言-动作(VLA)策略评估。其核心将长时程任务的评估拆分为可独立执行的语义技能,每个评测单元包含技能指令、可恢复的仿真中间状态、可执行的 BDDL 成功条件以及评测时间范围,使每个技能能够在有效的执行前置条件下独立评估。

数据集规模与构成

  • 技能实例数量:235,492 个技能实例
  • 演示数据来源:10,000 段演示
  • 任务覆盖:50 个长时程家务任务
  • 技能类别:34 个语义技能类别
  • 技能对齐信息:包含指令、观测、动作、物体信息、执行上下文(奖励充足,可供技能条件策略学习)

核心特点

  • 独立技能评测:复原每个组成技能的中间状态,允许整个任务能力画像被逐一测量,避免后续技能因中间失败而不被执行和观测
  • 自动成功验证:技能专属 BDDL 目标 + 自动成功条件检查
  • 能力导向指标:包括任务技能完成率 (TSCR) 和技能类型成功率 (STSR),用于识别被总体任务成功率掩盖的策略瓶颈
  • 资源链接:数据集托管于 Hugging Face(mafangniu/Behavior-Skill),模型检查点托管于 mafangniu/Behavior-Skill-VLA-Checkpoints,另提供排行榜与结果提交入口

数据组织

数据拆分存放至三个目录组件,各自承担不同角色:

目录 内容
skill_annotations 技能描述、类别、涉及物体、时间区间、动作上下文
skill_eval_configs 任务上下文、技能指令、技能类别/类型、可执行的 BDDL 目标
skill_init_states 用于恢复技能起始状态的状态清单与场景文件

评测协议

每个组成技能的评估流程为:

  1. 依据任务上下文及局部目标构建技能专属 BDDL 问题
  2. 恢复发布的场景与序列化仿真器状态
  3. 重建辅助抓取约束并同步关节驱动目标
  4. 推进 25 步物理稳定化(不发出机器人动作)
  5. 在步骤 0 检查目标是否已经满足
  6. 闭合回路执行策略,并在每一步后检查 BDDL 目标
  7. 成功即终止,或者达到记录演示时长的两倍后终止

评测输出与指标

单次运行生成 JSON(指标文件)与 MP4(头、左腕、右腕三视角 RGB 合成视频)。跨任务汇总脚本可按技能描述和类型聚合成功率矩阵,输出整体技能排序与按任务的 TSCR 表,完整结果保存至 cross_task_skill_summary.json

模型检查点

提供 4 个微调后的 pi0.5 检查点(来自论文的 Task / Skill 两种设置),任务覆盖 50 或 12 个,语言条件分完整任务指令与组成技能指令两种;另提供用于单技能评估的 WebSocket 策略服务实现(mafangniu/pi05-behavior-skill)。

策略集成

支持两种策略后端:

  • WebSocket 策略:由模型侧启动策略服务器,评测端发送处理后的观测字典并注入当前指令至 prompt 字段,服务器返回与 R1Pro 环境兼容的动作
  • 本地 Hydra 策略:支持加载本地策略配置

两种配置中必须恰好提供一种。

搜集汇总
数据集介绍
Behavior-Skill 数据集图片
构建方式
Behavior-Skill基准数据集基于BEHAVIOR-1K构建,通过重新定义长时程任务的评价单位,将每个任务分解为可独立执行的子技能。数据构建过程中,从10,000个示范中提取了235,492个技能实例,覆盖50个家庭任务和34个语义技能类别。每个评价单元包含技能指令、可恢复的中间模拟状态、可执行的BDDL成功条件及评价horizon,从而确保每个子技能都能在原任务的有效前置条件下被独立评估。标注数据含技能描述、类别、涉及物体、时间间隔和行为上下文,并通过状态快照实现场景的精准恢复。
特点
Behavior-Skill具备高粒度与可恢复性两大核心特性。其依据技能粒度重新划分任务,使每个技能实例均配有专属的指令、观测、动作与执行上下文,支持技能条件策略学习。通过从中间状态恢复进行独立评估,突破传统全任务回放中因中间失败导致的后续技能执行中断限制,实现完整能力画像。同时引入能力导向指标TSCR与STSR,从任务与技能类型维度精准识别策略瓶颈,为视觉-语言-动作(VLA)模型提供细粒度的性能诊断工具。
使用方法
Behavior-Skill使用流程涵盖环境配置、数据获取与评估执行。首先通过一键脚本setup.sh创建conda环境并安装OmniGibson、BDDL等依赖,随后利用Hugging Face CLI下载并部署标注、配置及状态快照至指定目录。评估过程支持三种层级:单技能CLI接口benchmark.skill_eval、整集技能运行脚本run_all_skills.sh及多GPU自动化驱动run_auto_eval.sh。用户需配置策略后端(WebSocket或Hydra),按需指定技能ID、评价次数与提示词,系统将自动恢复状态、执行闭环策略并验证BDDL目标,最终生成metrics、视频及汇总结果。
背景与挑战
背景概述
Behavior-Skill数据集由国防科技大学nubot团队构建,于2025年发布,旨在解决长时程机器人操作任务中细粒度技能评估的难题。该数据集基于BEHAVIOR-1K仿真平台,通过重新构建任务为可执行的子技能单元,创建了包含235,492个技能实例的大规模基准,涵盖50个家庭任务和34种语义技能类别。其核心研究问题是突破传统全任务评估的局限,实现对每个组成技能的独立验证与性能剖析,为视觉-语言-动作模型提供细粒度的能力评估与瓶颈识别手段。该基准在机器人学习领域具有开创性影响,为技能级策略学习与评估设立了新标准。
当前挑战
该领域面临的挑战在于长时程任务的复杂性与评估的粗粒度性:传统全任务回滚一旦中途失败即终止,后续技能无法得到执行与观测,导致任务级成功率掩盖了各技能的独立表现,难以定位策略缺陷。构建过程中亦面临多重技术难题,包括从1万条演示中精确切分并语义标注技能片段,从BEHAVIOR-1K海量场景中恢复可复现的中间仿真状态,为每个技能设计可执行的BDDL目标条件,以及确保状态恢复的稳定性和评估环境的物理一致性。此外,技能间的依赖关系及指令条件差异也增加了评估协议设计的难度。
常用场景
经典使用场景
Behavior-Skill数据集的核心应用场景在于对视觉-语言-动作(VLA)策略进行细粒度的长时程任务评估。该基准基于BEHAVIOR-1K构建,将长时程任务解构为可执行的技能单元,每一项评估单元均包含独立的技能指令、可恢复的中间状态、可执行的BDDL成功条件等。研究者借助此数据集,可对策略模型在每一构成技能上的表现进行独立验证,从而规避传统全任务评估中因单点失败而阻断后续能力测量的局限性,实现策略全貌的精确刻画。
解决学术问题
Behavior-Skill有效解决了传统长时程任务评估中存在的两大关键问题:其一,全任务滚动评估在中间技能失败后即告终止,导致后续技能从未被执行与观测,造成能力评估的盲区;其二,整体任务成功率的聚合性指标难以定位策略的瓶颈所在。通过为每个构成技能提供状态恢复与独立成功判定机制,数据集聚类出任务技能完成率(TSCR)与技能类型成功率(STSR)等维度性指标,从而精细化识别策略在各技能维度上的薄弱环节,为VLA泛化性能的严谨对比提供了方法论支撑。
衍生相关工作
Behavior-Skill衍生了一系列经典工作,如基于pi0.5模型微调的多组检查点(涵盖任务级与技能级训练设置),以及配套的WebSocket策略服务器适配方案,为社区提供了即插即用的评估范例。同时,该基准发布了细粒度的技能标注、包括技能分类、时间区间与行动上下文等,促进了技能级决策领域研究进展。此外,其高可扩展性亦催生了对多任务学习、状态恢复机制及成功率聚合指标等方向的深入探讨,成为VLA评测领域的重要参照。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务