遇见数据集

ActProbe

收藏
github2026-07-02 更新2026-07-04 收录
官方服务:

资源简介:

ActProbe是一个用于生成机器人策略早期故障检测的数据集,包含五个基准测试(如pi0_libero、openvla_libero等),每个基准提供每步动作空间特征和任务嵌入数据,用于训练和评估轻量级探测器。数据集以JSONL和PKL格式存储,涵盖时序一致性误差和动作块幅度等信号。

ActProbe is a dataset designed for early fault detection of robotic policies. It includes five benchmark tests (e.g., pi0_libero, openvla_libero, etc.), with each benchmark providing per-step action space features and task embedding data for training and evaluating lightweight detectors. The dataset is stored in JSONL and PKL formats, covering signals such as temporal consistency errors and action block magnitudes.

创建时间:
2026-06-07
原始信息汇总

数据集概述:ActProbe

ActProbe 是一个轻量级的、纯动作空间(action-space)的探测器,用于在生成式机器人策略(如VLA和世界-动作模型)执行任务时,在故障变得视觉上可识别之前提前预测故障。它通过分析策略发出的动作块(action chunks)中的两个紧凑信号——时间一致性误差(TCE)动作块幅度(ACM)——并利用一个小型(约24K参数)的任务条件化LSTM-MLP模型将其映射为每步故障概率,实现早期故障检测。该探测器无需白盒访问、无需重采样,也无需融合观测空间信息。

数据集内容

该数据集是自包含的,用于训练和评估ActProbe。每个基准测试(benchmark)目录下提供了用于训练和探测的每步动作空间特征以及用于任务条件化的任务嵌入(task embeddings)。注意:本数据集不包含预训练的探测权重,因为模型极小(~24K参数),用户使用提供的数据即可在约一分钟内完成训练。

数据组成

基准测试 提供的ActProbe数据 任务条件化数据
pi0_libero data/metrics_logs/task_{0..9}.jsonl data/task_embeddings.npy, data/task_instructions.json
openvla_libero data/metrics_logs/task_{0..9}.jsonl data/task_embeddings.npy, data/task_instructions.json
groot_robocasa data/metrics_logs/*.jsonl data/task_embeddings.npy, data/task_instructions.json
pi05_robocasa data/probe_data/*.pkl data/qwen3_emb.pkl
pi05_robocasa_multistage data/probe_data/*.pkl data/qwen3_emb.pkl
  • 每个基准测试目录均包含以下子目录:code/(方法实现,包括lib/train/eval/)、scripts/(数据预处理、入口点和特征收集代码)、以及env.sh(环境变量配置文件)。
  • 特征收集代码位于 benchmarks/<name>/scripts/collect/ 目录,用户可据此从原始策略的 rollout 记录中重新生成特征。

数据集用途

  • 训练与评估:用户可通过每个基准测试目录下的脚本(如train_all.sh)训练ActProbe模型,并使用eval_main_table.py进行评估。
  • 特征数据复现(可选):用户可使用提供的收集代码,从策略的 rollout 记录中重新生成特征。收集方式分为两种:
    • 事后提取(post-hoc extraction):离线处理已保存的 rollout 记录(适用于pi0_liberoopenvla_libero)。
    • 在线日志记录(online logging):在策略运行过程中实时记录特征(适用于groot_robocasapi05_robocasa)。
  • 强化学习(RL)微调:ActProbe还可用于加速在线RL微调,通过提前终止预测将失败的rollout来节省时间。相关PPO集成代码在另一个独立的仓库中。

基准测试与策略环境

数据集涵盖以下5个基准测试,每个对应不同的策略和环境:

基准测试 策略 环境 动作类型
pi0_libero π0 LIBERO-10 块(chunk)
openvla_libero OpenVLA LIBERO-10 自回归
groot_robocasa GR00T RoboCasa(单阶段) 块(chunk)
pi05_robocasa π0.5 RoboCasa(单阶段) 块(chunk)
pi05_robocasa_multistage π0.5 RoboCasa(多阶段) 块(chunk)

方法对比

数据集中包含ActProbe本身以及多个基线方法(参考相关论文):

方法 类型 参考文献
ActProbe (本工作) 基于2个动作空间特征 + LSTM-MLP 的学习型探测器 本文
SAFE-MLP / SAFE-LSTM 基于隐藏状态特征的学习型探测器 Gu et al., NeurIPS 2025
SAFE-MLP-TDQC / SAFE-LSTM-TDQC 带时序差分校准的学习型探测器 Francis-Meretzki et al., 2026
LogpZO 基于动作序列密度的评分方法 Xu et al., 2025
STAC-Single 基于块重叠差异的方法 Agia et al., CoRL 2024
Cosine k-NN 非参数的隐藏状态基线方法

注意:基线方法需要使用大规模的隐藏状态特征,这些特征不包含在本数据集中;仅ActProbe的结果可通过本数据完全复现。

安装与使用

bash

克隆仓库

git clone https://github.com/air-embodied-brain/actprobe.git cd actprobe

安装依赖(torch>=2.7, numpy, scipy, scikit-learn, transformers等)

pip install -r requirements.txt

每个基准测试目录自包含,通过source其env.sh文件设置环境变量后,即可运行训练和评估脚本。

搜集汇总
数据集介绍
ActProbe 数据集图片
构建方式
在机器人策略部署过程中,早期失效检测对于提升系统可靠性至关重要。ActProbe数据集专为生成式机器人策略(如视觉-语言-动作模型与世界动作模型)的运行时故障预测而构建。其构建方式独辟蹊径,完全基于纯动作空间信号,从策略输出的连续动作块中提取两种紧凑特征:相邻动作块间的时序一致性误差(TCE)与当前动作块的动作块幅度(ACM)。每个时间步的特征数据均以JSON格式存储,并附带对应任务嵌入向量以实现任务条件化。数据收集涵盖五种策略-环境设置,包括LIBERO与RoboCasa等基准平台,既有从已保存的交互记录中离线提取,亦有在策略实时部署时在线记录。
特点
该数据集最显著的特点在于其极致的轻量级设计与纯粹的动作空间依赖。不同于传统方法需获取隐藏状态或进行观测融合,ActProbe仅需两个动作空间信号即可运行,相关探头参数量不足2.4万,训练时间仅约一分钟。数据集支持任务条件化处理,通过任务嵌入向量使检测模型可适应多任务场景。覆盖的基准测试包含π0、OpenVLA、GR00T与π0.5等多种前沿策略,以及单阶段与多阶段RoboCasa任务,展现出广泛适用性。数据集中每个样本均包含完整的失败检测标注,使研究者可直接复现并比较不同检测方法的性能。
使用方法
ActProbe数据集的使用流程简洁高效。用户首先克隆代码仓库并安装依赖,随后进入任一基准测试目录并加载环境配置。由于探头权重未预置,需先通过训练脚本训练三个随机种子对应的探头模型,训练过程约一分钟即可完成。训练完成后,调用评估脚本即可生成检测性能指标。对于已发布的数据集,用户无需重新收集,直接利用内置的特征数据与任务嵌入即可完成训练与评估。此外,若需从原始策略交互中重新生成特征,仓库提供了配套的数据收集脚本,支持离线提取与在线记录两种模式,方便用户扩展至新环境与新策略。
背景与挑战
背景概述
在具身智能领域,生成式机器人策略(如视觉-语言-动作模型VLA和世界-动作模型)的部署正面临可靠性瓶颈——执行中的微小偏差往往只有在视觉上显现时才能被检测,此时失败已不可挽回。ActProbe由Huang Bingjia、Li Xiangyu等研究者于2026年提出,隶属于AIR Embodied Brain团队,旨在解决这一时序监测难题。该数据集聚焦于通过纯动作空间信号实现早期失效预测,摒弃了传统的白盒访问与观测侧融合范式,转而利用时序一致性误差(TCE)与动作块幅度(ACM)两种紧凑特征。ActProbe覆盖了π0、OpenVLA、GR00T、π0.5等主流策略在LIBERO-10与RoboCasa环境中的多阶段任务,其轻量级LSTM-MLP探测头仅含约2.4万参数,为机器人策略的运行时安全性评估提供了高效且普适的基准。
当前挑战
当前领域面临的核心挑战在于:生成式机器人策略的失效具有隐蔽性与延迟性,传统方法依赖隐状态特征或图像重采样,不仅计算开销大,且往往在失败发生后才发出警报。具体而言,现有检测器(如SAFE、LogpZO)需访问模型内部表示或进行多次推理,缺乏对动作流时域一致性的有效建模。构建过程中,ActProbe面临多源策略异构性的难题——不同VLA的动作空间维度、输出格式(块预测vs自回归)、以及环境动力学差异导致特征提取协议难以统一。此外,离线提取与在线日志混合的数据收集策略要求精准对齐轨迹片段,而RoboCasa多阶段任务中动作块的累积误差放大效应进一步加剧了探测阈值设定的不确定性。这些挑战共同制约了早期失效检测方法在实际部署中的鲁棒性与迁移性。
常用场景
经典使用场景
ActProbe数据集专为生成式机器人策略(如视觉-语言-动作模型VLA和世界-动作模型)的早期故障检测而设计。其核心应用场景是在机器人执行任务的过程中,通过实时监测动作空间信号来实现故障预警。具体而言,该数据集提供了从动作块中提取的两个紧凑信号——时序一致性误差(TCE)和动作块幅度(ACM),并利用轻量级任务条件化的LSTM-MLP网络将信号映射为每步故障概率。这种纯动作空间的探测方式无需白盒访问、重采样或观测融合,适用于π0、OpenVLA、GR00T等主流策略在LIBERO和RoboCasa环境中的单阶段及多阶段任务,为机器人安全部署提供了高效可靠的故障预警途径。
衍生相关工作
ActProbe数据集的发布衍生了一系列相关的经典工作。其中,SAFE系列方法(如SAFE-MLP、SAFE-LSTM)从隐藏状态角度进行故障探测,可与ActProbe形成互补。时序差分校准的SAFE变体(SAFE-MLP-TDQC、SAFE-LSTM-TDQC)进一步提升了预测精度。基于动作序列得分的LogpZO方法和基于块重叠不一致性的STAC-Single方法也为故障检测提供了不同视角。此外,该数据集推动了非参数隐藏状态基线(如Cosine k-NN)的发展,并催生了将动作空间探测与强化学习微调相结合的创新框架(如RLinf-ActProbe),形成了以动作空间信号为核心的故障检测研究生态。
数据集最近研究
最新研究方向
在机器人学习领域,生成式策略(如视觉-语言-动作模型)的部署安全性与实时故障检测成为前沿焦点。ActProbe作为一项突破性工作,通过纯粹的动作空间信号——即时间一致性误差(TCE)和动作块幅度(ACM)——以极轻量级LSTM-MLP架构实现故障预判,无需白盒访问或观测融合。该方法不仅与跨策略环境基准(涵盖π0、OpenVLA、GR00T等主流模型)兼容,更被验证能加速强化学习在线微调中的早停机制,显著降低失败轨迹的成本。其开源框架与简洁特征设计,为机器人策略在开放世界中的可信执行提供了可复现的实用范式,呼应了具身智能安全部署这一紧迫需求。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务