遇见数据集

rapt-g1-ood

收藏
Hugging Face2026-07-23 更新2026-07-24 收录
官方服务:

资源简介:

RAPT G1 OOD Benchmark是一个用于人形机器人分布外(OOD)检测的模拟数据集,伴随研究论文《RAPT: Model-Predictive Out-of-Distribution Detection and Failure Diagnosis for Sim-to-Real Humanoid Deployment》发布。该数据集旨在支持从模拟到真实环境部署中的故障检测与诊断研究。核心数据在NVIDIA Isaac Lab模拟环境中收集,基于Unitree G1人形机器人,采样频率为50 Hz,涵盖三个任务:全向速度跟踪(g1_velocity)、舞蹈动作模仿(Dance-102,g1_mimic_dance102)和特定风格动作模仿(Gangnam Style,g1_mimic_gangnam)。每个任务提供多个数据文件,包括用于训练自监督检测器的纯名义数据(train.npz和train_small.npz)、用于校准的专用名义数据(calibration.npz)以及包含标记的评估数据(test.npz)。此外,包含真实机器人部署数据(g1_velocity_real),用于模拟到真实协议研究。数据规模方面,速度跟踪任务观测维度96,动作维度29,训练时长约6.2小时(小版本1.5小时),测试包含432个OOD序列和401个名义序列;模仿任务观测维度154,动作维度29,训练时长约6.8小时(小版本1.7小时),测试序列数分别为521/523和268/837。数据集总大小从491 MB到1.28 GB不等。数据格式为NumPy存档文件(float16精度),每个序列包含观测数组、动作数组,测试文件中还包含标签、故障注入步长和故障类别名称。OOD类别涵盖观测层面(如传感器漂移、噪声)和物理层面(如执行器动力学、环境扰动)的故障。适用于时间序列预测、异常检测、分布外检测、机器人学及模拟到真实迁移等研究任务,特别关注名义数据效率和检测算法在模拟与真实环境中的性能。

RAPT G1 OOD Benchmark is a simulation dataset for out-of-distribution (OOD) detection in humanoid robots, released alongside the research paper RAPT: Model-Predictive Out-of-Distribution Detection and Failure Diagnosis for Sim-to-Real Humanoid Deployment. It aims to support fault detection and diagnosis research in sim-to-real deployment. The core data consists of proprioceptive trajectory data collected at 50 Hz in the NVIDIA Isaac Lab simulation environment, using an expert reinforcement learning policy on the Unitree G1 humanoid robot. It covers three tasks: omnidirectional velocity tracking (g1_velocity), dance motion imitation (Dance-102, g1_mimic_dance102), and specific style motion imitation (Gangnam Style, g1_mimic_gangnam). Each task directory provides multiple data files: pure nominal data for training self-supervised detectors (train.npz, approximately 1.2 million steps, and a smaller version train_small.npz, approximately 300,000 steps for studying detection performance with limited nominal data), dedicated nominal data batches for calibrating detector operating points (calibration.npz), and labeled evaluation episode data (test.npz, which includes parallel environment sequences with perturbations and unperturbed nominal controls starting from step 50 for each OOD category). Additionally, it includes a real robot deployment data directory (g1_velocity_real) with proprioceptive logs from running the velocity policy on a physical Unitree G1 robot, including nominal calibration runs and 50 labeled runs with 8 induced fault categories for sim-to-real protocol studies. In terms of scale, the velocity tracking task has an observation dimension of 96, action dimension of 29, training duration of approximately 6.2 hours (small version 1.5 hours), and test data includes 432 OOD sequences and 401 nominal sequences; the two imitation tasks have an observation dimension of 154, action dimension of 29, training duration of approximately 6.8 hours (small version 1.7 hours), and test sequence counts of 521/523 and 268/837, respectively. The total dataset size ranges from 491 MB to 1.28 GB. The data format is NumPy archive files (float16 precision), with each sequence containing observation arrays (seq_%05d) and action arrays (act_%05d), and test files also include labels (0 for nominal/1 for anomaly), fault injection step (onset), and fault category name (fault). OOD categories cover observation-level faults (e.g., sensor drift, zeroing, scaling, swapping, noise, delay) and physical-level faults (e.g., actuator dynamics, initial state, environmental perturbations, friction). The dataset is suitable for research tasks such as time series forecasting, anomaly detection, out-of-distribution detection, robotics, and sim-to-real transfer, with a focus on studying nominal data efficiency and detection algorithm performance in both simulated and real environments.

创建时间:
2026-07-22
原始信息汇总

数据集概述

RAPT G1 OOD Benchmark 是一个用于人形机器人 Unitree G1 的离群检测(OOD)仿真与真实数据集,随论文 RAPT: Model-Predictive Out-of-Distribution Detection and Failure Diagnosis for Sim-to-Real Humanoid Deployment 发布。数据集包含从 NVIDIA Isaac Lab 中专家强化学习策略采集的本体感知轨迹(50 Hz),用于训练和评估离群检测模型。

任务与规模

任务目录 任务描述 观测维度 动作维度 训练集(小规模) 校准集 测试序列(OOD / 正常) 大小
g1_velocity 全向速度跟踪 96 29 ~6.2小时(~1.5小时) 225 432 / 401 491 MB
g1_mimic_dance102 动作模仿(Dance-102) 154 29 ~6.8小时(~1.7小时) 437 521 / 523 1.25 GB
g1_mimic_gangnam 动作模仿(Gangnam Style) 154 29 ~6.8小时(~1.7小时) 407 268 / 837 1.28 GB
  • 专家策略:论文中的 GCR-PPO 速度策略和已部署的模仿策略。
  • 论文中的第四个任务(抛掷任务)尚未包含在此发布中。

数据集文件

每个任务目录包含以下文件:

  • train.npz:仅含正常数据的训练序列,约 120 万步,用于训练自监督检测器。
  • train_small.npz:正常训练集的 4 倍缩小版本(约 30 万步),用于研究有限正常数据下的检测性能。
  • calibration.npz:专用于校准检测器操作点的正常数据批次。
  • test.npz:标注的评估序列(速度任务 1000 步,模仿任务 1500 步)。每个 OOD 类别中,一半的并行环境从第 50 步开始被扰动,另一半正常运行作为正常对照。
  • metadata.json:包含任务、策略、维度、时间步长、扰动开始步、类别列表、分割大小等信息。

真实机器人数据(g1_velocity_real

来自论文中物理 Unitree G1 部署的本体感知日志(50 Hz,同 96 维):

  • calibration.npz:真实世界正常校准运行数据(约 2.3 分钟)。
  • test.npz:50 个标注的运行序列(约 76 分钟),包括 11 个正常行走和 39 个异常运行(覆盖 8 种诱导故障类别:action_scalinginitial_statepolicy_latencymotor_dynamicsmotor_failureobservation_orderingsensor_noisefootwear_contact)。无训练集分割,检测器在仿真数据(g1_velocity/train.npz)上训练并使用真实校准运行进行校准。

注意:故障开始时间未知(onset = -1);部分异常日志仅包含 1-22 步(故障导致机器人立即失稳);论文中的推、负载、碰撞/障碍和可变形地形运行未包含在此发布中(此处 N=50 vs. 论文中 N=78)。

OOD 类别(测试集)

  • 观测层面sensor_driftsensor_zeroscale_halfscale_doubleobs_swapaction_swapnoiselatency_offsetlatency_slowfrozen_sensor
  • 物理层面(在 Isaac Lab 中仿真):actuator_dynamicsinit_stateenv_disturbance(推/负载)、env_friction

采样范围遵循论文补充材料中的“仿真 OOD 类别”。如果机器人摔倒(安全终止),序列会提前结束,因此长度可变。

数据格式

使用 float16 的 Ragged NumPy 存档。每个序列 i 包含键:

  • seq_%05d[T_i, obs_dim] 的观测数据
  • act_%05d[T_i, action_dim] 的动作数据
  • dim_names:命名观测维度列表
  • test.npz 中额外包含:
    • labels:0(正常)/ 1(异常)
    • onset:扰动注入步(正常序列为 -1)
    • fault:故障类别名称

使用示例

python from huggingface_hub import snapshot_download path = snapshot_download("hmunn/rapt-g1-ood", repo_type="dataset")

使用 RAPT 代码库加载

from rapt import load_sequences train = load_sequences(f"{path}/g1_velocity/train.npz") # 仅正常数据 test = load_sequences(f"{path}/g1_velocity/test.npz") # 标注数据

或使用纯 NumPy

import numpy as np data = np.load(f"{path}/g1_velocity/test.npz") obs0 = data["seq_00000"].astype("float32")

训练和评估 RAPT(指标保存为 JSON):

bash python scripts/benchmark.py <path>/g1_velocity <path>/g1_mimic_* --out results

引用

bibtex @article{munn2026rapt, title = {RAPT: Model-Predictive Out-of-Distribution Detection and Failure Diagnosis for Sim-to-Real Humanoid Deployment}, author = {Munn, Humphrey and Tidd, Brendan and B{"o}hm, Peter and Gallagher, Marcus and Howard, David}, journal = {arXiv preprint arXiv:2602.01515}, year = {2026} }

搜集汇总
数据集介绍
rapt-g1-ood 数据集图片
构建方式
RAPT G1 OOD基准数据集为评估仿人机器人分布外检测性能而构建,基于Unitree G1人形机器人在NVIDIA Isaac Lab仿真环境中的本体感知轨迹数据。数据集通过专家强化学习策略收集,以50 Hz频率记录本体感知信号,涵盖三个代表性任务:全方位速度追踪与两种动作模仿(Dance-102与Gangnam Style)。每个任务目录包含训练、小规模训练、校准与测试四种数据分割,并以参差不齐的NumPy存档格式存储,其中测试分割额外标注了异常类别与注入时刻。
特点
该数据集设计精妙,兼具规模性与实用性。其训练集提供了约120万时间步的标称数据,并附带缩小四倍的版本以模拟真实系统中标称数据稀缺的困境。测试分割巧妙地为每个分布外类别保留了一半环境的干净标称控制,另一半则从第50步开始施加扰动,形成了平衡的评估基准。此外,数据集还包含了真实的机器人运行日志,涵盖8种诱导故障类别,为仿真到现实的迁移研究提供了珍贵资源。
使用方法
研究者可通过Hugging Face Hub便捷下载数据集,并配合RAPT官方代码库中的评估脚本进行使用。使用`scripts/evaluate_paper.py`可复现论文中的仿真评估协议,该协议采用RAPT模型门控机制,以校准数据分割设定阈值,并通过ROC曲线在0.5%假阳性率下的真阳性率作为安全评分指标。而`scripts/benchmark.py`则提供了部署风格的评估方式,支持混合门控与分位数校准的决策边界。数据集加载兼容NumPy标准接口,也可通过RAPT库的`load_sequences`函数直接读取结构化序列。
背景与挑战
背景概述
RAPT G1 OOD基准数据集由Humphrey Munn等研究者于2026年发布,旨在解决仿人机器人从仿真环境迁移至真实世界时的分布外(OOD)检测难题。该数据集以Unitree G1仿人机器人为载体,基于NVIDIA Isaac Lab仿真平台,通过专家强化学习策略采集本体感知轨迹,涵盖速度跟踪与动作模仿两类任务。作为RAPT方法的配套数据资源,它支持自监督异常检测器的训练与评估,为sim-to-real迁移中模型预测式OOD检测提供了标准化测试平台,在机器人安全部署领域具有重要的基准价值。
当前挑战
该数据集面临的核心挑战包括:首先,仿人机器人在真实部署中的OOD检测需应对复杂的物理扰动(如执行器动力学变化、环境摩擦突变)和传感器异常(漂移、冻结、延迟),现有模型极易因分布偏移产生误判。其次,数据集构建中需平衡仿真数据的丰富性与真实数据的稀缺性——真实机器人标定数据仅2.3分钟,且故障样本因机器人倾覆而截断,导致标签噪声。此外,标定协议中约300个名义样本的阈值设置易受极端事件影响,造成检测指标不稳定,需在有限数据下实现鲁棒的操作点校准。
常用场景
经典使用场景
在仿人机器人领域,将强化学习策略从仿真环境迁移至真实物理世界时,策略在遭遇未见过的异常状态(如传感器漂移、执行器故障、环境扰动)时可能产生不可预测行为,带来安全隐患。RAPT G1 OOD基准数据集为此而生,它基于Unitree G1仿人机器人平台,在NVIDIA Isaac Lab仿真环境中采集了包含速度跟踪与动作模仿等多种任务的自身感知运动轨迹数据。数据集中精心设计了标称(正常)运行与多种分布外(OOD)异常类别的对比样本,并区分了训练集、校准集与测试集,为开发与评估面向仿真到真实迁移场景的分布外检测与故障诊断方法提供了标准化的实验平台。
衍生相关工作
围绕RAPT G1 OOD基准,已催生了一系列拓展性研究工作。该数据集的核心论文RAPT提出了混合模型预测的分布外检测架构,其设计中的逐维度最大值聚合被证明是检测性能的关键选择,校准公式的微小变动对结果影响可忽略(变化小于0.01)。此外,数据集提供了两种训练规模(约120万步与约30万步),直接支持了标称数据效率的专门研究,揭示了在标称数据极其稀缺时检测性能的衰减规律。在真实机器人日志中(g1_velocity_real),研究者可直接验证检测方法对传感器噪声、策略延迟、电机故障等八类真实硬件异常的反应,为仿真到真实的检测鲁棒性提供了可复现的对比基准。这些基础设计促使后续工作深入探索在极低标称样本下优化OOD检测阈值、融合多模态信息以及实现实时故障根因定位等方向。
数据集最近研究
最新研究方向
该数据集聚焦于人形机器人领域从仿真到现实迁移任务中的分布外检测问题,关联前沿的具身智能与安全部署热点。通过提供Unitree G1机器人在NVIDIA Isaac Lab仿真环境中的本体感知轨迹数据(涵盖速度追踪与动作模仿任务),并结合真实机器人运行日志,为研究模型预测式异常检测与故障诊断提供了标准化基准。其独特之处在于模拟了传感器漂移、动作延迟、物理扰动等10余种分布外类别,并引入两种规模的名义训练集以探讨有限数据下的检测效率,这对于推动人形机器人安全落地现实场景具有关键意义,也为Sim-to-Real领域的鲁棒性研究树立了可复现的评测标杆。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务