ActProbe
收藏资源简介:
ActProbe是一个用于生成机器人策略早期故障检测的数据集,包含五个基准测试(如pi0_libero、openvla_libero等),每个基准提供每步动作空间特征和任务嵌入数据,用于训练和评估轻量级探测器。数据集以JSONL和PKL格式存储,涵盖时序一致性误差和动作块幅度等信号。
ActProbe is a dataset designed for early fault detection of robotic policies. It includes five benchmark tests (e.g., pi0_libero, openvla_libero, etc.), with each benchmark providing per-step action space features and task embedding data for training and evaluating lightweight detectors. The dataset is stored in JSONL and PKL formats, covering signals such as temporal consistency errors and action block magnitudes.
数据集概述:ActProbe
ActProbe 是一个轻量级的、纯动作空间(action-space)的探测器,用于在生成式机器人策略(如VLA和世界-动作模型)执行任务时,在故障变得视觉上可识别之前提前预测故障。它通过分析策略发出的动作块(action chunks)中的两个紧凑信号——时间一致性误差(TCE) 和动作块幅度(ACM)——并利用一个小型(约24K参数)的任务条件化LSTM-MLP模型将其映射为每步故障概率,实现早期故障检测。该探测器无需白盒访问、无需重采样,也无需融合观测空间信息。
数据集内容
该数据集是自包含的,用于训练和评估ActProbe。每个基准测试(benchmark)目录下提供了用于训练和探测的每步动作空间特征以及用于任务条件化的任务嵌入(task embeddings)。注意:本数据集不包含预训练的探测权重,因为模型极小(~24K参数),用户使用提供的数据即可在约一分钟内完成训练。
数据组成
| 基准测试 | 提供的ActProbe数据 | 任务条件化数据 |
|---|---|---|
pi0_libero |
data/metrics_logs/task_{0..9}.jsonl |
data/task_embeddings.npy, data/task_instructions.json |
openvla_libero |
data/metrics_logs/task_{0..9}.jsonl |
data/task_embeddings.npy, data/task_instructions.json |
groot_robocasa |
data/metrics_logs/*.jsonl |
data/task_embeddings.npy, data/task_instructions.json |
pi05_robocasa |
data/probe_data/*.pkl |
data/qwen3_emb.pkl |
pi05_robocasa_multistage |
data/probe_data/*.pkl |
data/qwen3_emb.pkl |
- 每个基准测试目录均包含以下子目录:
code/(方法实现,包括lib/、train/、eval/)、scripts/(数据预处理、入口点和特征收集代码)、以及env.sh(环境变量配置文件)。 - 特征收集代码位于
benchmarks/<name>/scripts/collect/目录,用户可据此从原始策略的 rollout 记录中重新生成特征。
数据集用途
- 训练与评估:用户可通过每个基准测试目录下的脚本(如
train_all.sh)训练ActProbe模型,并使用eval_main_table.py进行评估。 - 特征数据复现(可选):用户可使用提供的收集代码,从策略的 rollout 记录中重新生成特征。收集方式分为两种:
- 事后提取(post-hoc extraction):离线处理已保存的 rollout 记录(适用于
pi0_libero和openvla_libero)。 - 在线日志记录(online logging):在策略运行过程中实时记录特征(适用于
groot_robocasa和pi05_robocasa)。
- 事后提取(post-hoc extraction):离线处理已保存的 rollout 记录(适用于
- 强化学习(RL)微调:ActProbe还可用于加速在线RL微调,通过提前终止预测将失败的rollout来节省时间。相关PPO集成代码在另一个独立的仓库中。
基准测试与策略环境
数据集涵盖以下5个基准测试,每个对应不同的策略和环境:
| 基准测试 | 策略 | 环境 | 动作类型 |
|---|---|---|---|
pi0_libero |
π0 | LIBERO-10 | 块(chunk) |
openvla_libero |
OpenVLA | LIBERO-10 | 自回归 |
groot_robocasa |
GR00T | RoboCasa(单阶段) | 块(chunk) |
pi05_robocasa |
π0.5 | RoboCasa(单阶段) | 块(chunk) |
pi05_robocasa_multistage |
π0.5 | RoboCasa(多阶段) | 块(chunk) |
方法对比
数据集中包含ActProbe本身以及多个基线方法(参考相关论文):
| 方法 | 类型 | 参考文献 |
|---|---|---|
| ActProbe (本工作) | 基于2个动作空间特征 + LSTM-MLP 的学习型探测器 | 本文 |
| SAFE-MLP / SAFE-LSTM | 基于隐藏状态特征的学习型探测器 | Gu et al., NeurIPS 2025 |
| SAFE-MLP-TDQC / SAFE-LSTM-TDQC | 带时序差分校准的学习型探测器 | Francis-Meretzki et al., 2026 |
| LogpZO | 基于动作序列密度的评分方法 | Xu et al., 2025 |
| STAC-Single | 基于块重叠差异的方法 | Agia et al., CoRL 2024 |
| Cosine k-NN | 非参数的隐藏状态基线方法 | — |
注意:基线方法需要使用大规模的隐藏状态特征,这些特征不包含在本数据集中;仅ActProbe的结果可通过本数据完全复现。
安装与使用
bash
克隆仓库
git clone https://github.com/air-embodied-brain/actprobe.git cd actprobe
安装依赖(torch>=2.7, numpy, scipy, scikit-learn, transformers等)
pip install -r requirements.txt
每个基准测试目录自包含,通过source其env.sh文件设置环境变量后,即可运行训练和评估脚本。





