Behavior-Skill
收藏资源简介:
Behavior-Skill是一个以技能为中心的数据集和评估基准,基于BEHAVIOR-1K构建。它重新定义了长时域任务的学习和评估,围绕可执行的组成技能展开。每个评估单元结合了一个技能指令、一个可恢复的中间模拟器状态、一个可执行的BDDL成功条件以及一个评估时域。
Behavior-Skill is a skill-centric dataset and evaluation benchmark built upon BEHAVIOR-1K. It redefines the learning and evaluation of long-horizon tasks, centered on executable compositional skills. Each evaluation unit combines a skill instruction, a recoverable intermediate simulator state, an executable BDDL success condition, and an evaluation time horizon.
Behavior-Skill 数据集概述
Behavior-Skill 是一个围绕技能(skill)构建的细粒度基准数据集与评测框架,基于 BEHAVIOR-1K 构建,面向长时间跨度的视觉-语言-动作(VLA)策略评估。其核心将长时程任务的评估拆分为可独立执行的语义技能,每个评测单元包含技能指令、可恢复的仿真中间状态、可执行的 BDDL 成功条件以及评测时间范围,使每个技能能够在有效的执行前置条件下独立评估。
数据集规模与构成
- 技能实例数量:235,492 个技能实例
- 演示数据来源:10,000 段演示
- 任务覆盖:50 个长时程家务任务
- 技能类别:34 个语义技能类别
- 技能对齐信息:包含指令、观测、动作、物体信息、执行上下文(奖励充足,可供技能条件策略学习)
核心特点
- 独立技能评测:复原每个组成技能的中间状态,允许整个任务能力画像被逐一测量,避免后续技能因中间失败而不被执行和观测
- 自动成功验证:技能专属 BDDL 目标 + 自动成功条件检查
- 能力导向指标:包括任务技能完成率 (TSCR) 和技能类型成功率 (STSR),用于识别被总体任务成功率掩盖的策略瓶颈
- 资源链接:数据集托管于 Hugging Face(mafangniu/Behavior-Skill),模型检查点托管于 mafangniu/Behavior-Skill-VLA-Checkpoints,另提供排行榜与结果提交入口
数据组织
数据拆分存放至三个目录组件,各自承担不同角色:
| 目录 | 内容 |
|---|---|
skill_annotations |
技能描述、类别、涉及物体、时间区间、动作上下文 |
skill_eval_configs |
任务上下文、技能指令、技能类别/类型、可执行的 BDDL 目标 |
skill_init_states |
用于恢复技能起始状态的状态清单与场景文件 |
评测协议
每个组成技能的评估流程为:
- 依据任务上下文及局部目标构建技能专属 BDDL 问题
- 恢复发布的场景与序列化仿真器状态
- 重建辅助抓取约束并同步关节驱动目标
- 推进 25 步物理稳定化(不发出机器人动作)
- 在步骤 0 检查目标是否已经满足
- 闭合回路执行策略,并在每一步后检查 BDDL 目标
- 成功即终止,或者达到记录演示时长的两倍后终止
评测输出与指标
单次运行生成 JSON(指标文件)与 MP4(头、左腕、右腕三视角 RGB 合成视频)。跨任务汇总脚本可按技能描述和类型聚合成功率矩阵,输出整体技能排序与按任务的 TSCR 表,完整结果保存至 cross_task_skill_summary.json。
模型检查点
提供 4 个微调后的 pi0.5 检查点(来自论文的 Task / Skill 两种设置),任务覆盖 50 或 12 个,语言条件分完整任务指令与组成技能指令两种;另提供用于单技能评估的 WebSocket 策略服务实现(mafangniu/pi05-behavior-skill)。
策略集成
支持两种策略后端:
- WebSocket 策略:由模型侧启动策略服务器,评测端发送处理后的观测字典并注入当前指令至
prompt字段,服务器返回与 R1Pro 环境兼容的动作 - 本地 Hydra 策略:支持加载本地策略配置
两种配置中必须恰好提供一种。





