遇见数据集

go2-air-controlbench-v1

收藏
Hugging Face2026-06-13 更新2026-06-14 收录
官方服务:

资源简介:

Go2 Air ControlBench v1 Public Preview 是一个针对标准Unitree Go2 Air四足机器人的紧凑型命令到结果基准测试数据集。其核心目的是回答一个对机器人规划器和世界模型评分器至关重要的问题:当命令机器人移动时,实际会发生什么?以及规划器本应选择哪个候选命令?该数据集并非用于模仿学习或提供动作捕捉级地面真值,而是一个公开安全的基准预览,旨在桥接决策追踪(DecisionTrace)和世界锻造(WorldForge)框架,关注“为何选择此行动而非其他替代方案,以及根据实测结果该选择是否正确”。 数据集包含多个稳定预览表格,包括原始116次试验的标准化数据(`all_trials_normalized.csv`)、按命令分组的结果统计、基线模型报告(包含朴素、仿射和死区仿射模型)、有界ArUco参考连接表,以及外部参考质量指标。此外,还提供了Release05扩展,增加了115次在第二表面捕获的衍生试验行、相应的标准化表格、分组结果统计和基线报告。数据集还整合了包含231次试验的合并表(`all_trials_plus_release05_normalized.csv`)以及一个逆向命令基准测试(`inverse_command_benchmark.csv`),该测试要求模型根据目标位移或偏航角从观察到的候选命令集中选择最佳命令。 数据形式主要为表格数据(CSV、JSON)和紧凑的Parquet预览。关键字段包括命令速度(`cmd_x`, `cmd_y`, `cmd_z`)、命令持续时间(`duration_s`)、原生里程计位移和偏航角变化(`odom_dx_m`, `odom_dy_m`, `odom_dyaw_rad`)以及前后位置姿态。数据集还提供了证据和演示材料,如DecisionTrace v1草案示例、SVG图表、验证和基准测试脚本,以及简短的论文。 该数据集适用于机器人学领域,特别是四足机器人的系统识别、命令选择基准测试、规划算法验证以及世界模型评分工作流的评估。其内置的评估协议建议使用原始预览数据(116次试验)进行拟合,然后在Release05第二表面数据(115次试验)上进行留出评估,以测试模型在不同表面的泛化能力。数据集遵循CC-BY-4.0许可证。

Go2 Air ControlBench v1 Public Preview is a compact command-to-result benchmarking dataset for the standard Unitree Go2 Air quadruped robot. Its core purpose is to answer a critical question for robot planners and world model scorers: What actually happens when a robot is commanded to move? And which candidate command should the planner have chosen? The dataset is not intended for imitation learning or providing motion-capture-level ground truth, but is a public, safe benchmark preview designed to bridge the DecisionTrace and WorldForge frameworks, focusing on why choose this action over other alternatives, and whether that choice was correct based on measured results. The dataset includes multiple stable preview tables, such as normalized data from the original 116 trials (`all_trials_normalized.csv`), result statistics grouped by command, baseline model reports (including naive, affine, and deadzone-affine models), bounded ArUco reference linkage tables, and external reference quality metrics. Additionally, it provides a Release05 extension, adding 115 derived trial rows captured on a second surface, along with corresponding normalized tables, grouped result statistics, and baseline reports. The dataset also integrates a combined table with 231 trials (`all_trials_plus_release05_normalized.csv`) and an inverse command benchmark (`inverse_command_benchmark.csv`), which requires models to select the best command from observed candidate sets based on target displacement or yaw angle. The data is primarily in tabular form (CSV, JSON) and compact Parquet previews. Key fields include command velocities (`cmd_x`, `cmd_y`, `cmd_z`), command duration (`duration_s`), native odometry displacement and yaw changes (`odom_dx_m`, `odom_dy_m`, `odom_dyaw_rad`), and pre/post position poses. The dataset also provides evidence and demonstration materials, such as DecisionTrace v1 draft examples, SVG charts, validation and benchmarking scripts, and a short paper. It is applicable in the field of robotics, particularly for system identification of quadruped robots, command selection benchmarking, planning algorithm validation, and evaluation of world model scoring workflows. Its built-in evaluation protocol recommends fitting on the original preview data (116 trials) and then performing hold-out evaluation on the Release05 second-surface data (115 trials) to test model generalization across different surfaces. The dataset is licensed under CC-BY-4.0.

创建时间:
2026-06-04
原始信息汇总

数据集概述

  • 数据集名称:Go2 Air ControlBench v1 Public Preview
  • 许可证:CC-BY-4.0
  • 语言:英语
  • 任务类别:机器人学
  • 标签:机器人学、四足机器人、Unitree Go2、系统辨识、决策证据、DecisionTrace、WorldForge、ArUco、LeRobot
  • 数据规模:1,000 < 样本数 < 10,000
  • 数据集配置
    • trial_level_preview:训练集,Parquet 文件
    • yaw_native_rate_preview:训练集,Parquet 文件
    • release05_trial_level_preview:训练集,Parquet 文件
    • combined_trial_table:训练集,Parquet 文件
    • inverse_command_benchmark:训练集,Parquet 文件

数据集目的与核心问题

该基准测试针对标准 Unitree Go2 Air 机器人,探究一个对机器人规划器和世界模型评分器至关重要的狭窄问题:

如果命令机器人移动,实际会发生什么,以及规划器本应选择哪个候选命令?

该数据集并非模仿学习语料库,也非动捕级真值,而是一个公开安全的基准预览,包含衍生表格、基线模型、图表、DecisionTrace 示例和紧凑的 Parquet 预览。

数据集包含内容

稳定公开预览表格

  • tables/all_trials_normalized.csv:116 行标准化试验数据
  • tables/command_group_stats.csv:按命令分组的本体位姿结果
  • tables/baseline_model_report.json:朴素、仿射和死区仿射基线模型报告
  • tables/release04_trial_aruco_join.csv:Release04 的 ArUco 参考数据
  • tables/release04_aruco_metrics.json:外部参考质量指标

Release05 扩展数据

  • tables/release05_second_surface_trials.csv:115 行第二表面试验数据
  • tables/release05_second_surface_trials_normalized.csv:归一化的 Release05 表格
  • tables/release05_second_surface_group_stats.csv:Release05 分组结果
  • tables/release05_baseline_model_report.json:Release05 基线模型报告
  • tables/all_trials_plus_release05_normalized.csv:合并的 231 行试验表格
  • tables/combined_baseline_model_report.json:合并基线模型报告
  • tables/inverse_command_benchmark.csv:目标运动命令选择基准行
  • tables/inverse_command_benchmark_summary.json:遗憾值、命中率和秩相关汇总

证据与演示

  • decision_traces/:DecisionTrace v1 示例(含正遗憾值)、JSON Schema 及参考验证器/构建器
  • decision_traces/decision_trace.v1.schema.json:DecisionTrace v1 格式的 JSON Schema
  • figures/:SVG 格式的图表
  • lerobot_v3_native_rate/:可加载的 LeRobot v3.0 数据集(36 个片段 / 900 帧)
  • lerobot_v3_preview/:紧凑的 Parquet 预览及元数据
  • metadata/croissant_metadata.json:Croissant 样式元数据草案
  • scripts/:验证和基线脚本
  • paper/:短论文及 Release05 附录

关键指标

原始公开预览

  • 总试验数:116
  • 运动试验数:106
  • 前进/后退试验数:50
  • 偏航试验数:56
  • 原生偏航率预览:1,118 行 ROBOTODOM 数据,约 18.7 Hz
  • Release04 ArUco 前后覆盖率:35/59 试验

Release05 扩展

  • 干净的第二表面试验数:115
  • 本地运行中的原生 ROBOTODOM 消息数:5,160
  • 本地运行中的原生 ULIDAR_ARRAY 消息数:2,121
  • 保存的本地 LiDAR 侧车文件数:510

合并预览

  • 合并标准化试验数:231
  • 平移命令试验数:108
  • 偏航命令试验数:106

基线模型结果

原始公开预览 RMSE

| 任务 | 朴素 | 仿射 | 死区仿射 | |---|---|---:|---:|---:| | 有符号平面平移 | 0.0444 m | 0.0313 m | 0.0296 m | | 偏航 | 0.141 rad | 0.0166 rad | 0.00995 rad |

Release05 RMSE

| 任务 | 朴素 | 仿射 | 死区仿射 | |---|---|---:|---:|---:| | 有符号平面平移 | 0.0612 m | 0.0316 m | 0.0225 m | | 偏航 | 0.122 rad | 0.0191 rad | 0.00926 rad |

合并 RMSE

| 任务 | 朴素 | 仿射 | 死区仿射 | |---|---|---:|---:|---:| | 有符号平面平移 | 0.0540 m | 0.0399 m | 0.0349 m | | 偏航 | 0.132 rad | 0.0179 rad | 0.0102 rad |

核心结论:在做出学习规划或世界模型相关声明之前,必须使用死区感知基线。

逆命令基准测试

该基准测试询问:

给定目标位移或偏航,规划器应从观察到的候选命令集中选择哪个命令?

Release05 平均测量遗憾值

任务 朴素 仿射 死区仿射
平移 0.0243 m 0.00712 m 0.00607 m
偏航 0.0153 rad 0.00231 rad 0.00143 rad

合并平均测量遗憾值

任务 朴素 仿射 死区仿射
平移 0.0159 m 0.00776 m 0.00638 m
偏航 0.0116 rad 0.00509 rad 0.00513 rad

留出评估协议

建议使用原始预览与 Release05 第二表面扩展作为留出泛化检验:在原始 116 试验上拟合/校准,在 115 个 Release05 试验上评估,报告平移 RMSE、偏航 RMSE 和平均测量遗憾值。

数据加载方式

python import pandas as pd trials = pd.read_csv("tables/all_trials_normalized.csv") release05 = pd.read_csv("tables/release05_second_surface_trials_normalized.csv") combined = pd.read_csv("tables/all_trials_plus_release05_normalized.csv")

从 Hub 加载:

python from datasets import load_dataset trial_level = load_dataset("espejelomar/go2-air-controlbench-v1", "trial_level_preview", split="train") release05 = load_dataset("espejelomar/go2-air-controlbench-v1", "release05_trial_level_preview", split="train") combined = load_dataset("espejelomar/go2-air-controlbench-v1", "combined_trial_table", split="train") inverse = load_dataset("espejelomar/go2-air-controlbench-v1", "inverse_command_benchmark", split="train")

数据字典

共享的标准化表格包含以下列:

列名 单位/类型 含义
release string 采集/发布组
trial_index integer 试验索引
suite string 子套件标签
name string 命令组名称
rep integer/string 重复索引
cmd_x m/s 前向/后向速度命令
cmd_y m/s 侧向速度命令
cmd_z rad/s 偏航速度命令
duration_s s 命令持续时间
cmd_integral_x_m m 朴素 cmd_x * duration_s
cmd_integral_y_m m 朴素 cmd_y * duration_s
cmd_integral_yaw_rad rad 朴素 cmd_z * duration_s
odom_dx_m, odom_dy_m m 本位姿位移分量
odom_planar_m m 本位姿平面位移幅度
odom_dyaw_rad, odom_dyaw_deg rad, deg 本位姿偏航变化量
pre_x, pre_y, pre_yaw m, m, rad 命令前本位姿
post_x, post_y, post_yaw m, m, rad 命令后本位姿
hardware_executed boolean 是否向硬件发送运动命令
outcome_kind string 结果来源标签

DecisionTrace v1

DecisionTrace 是一种便携、与提供商无关的记录,用于记录单个具身决策:观察内容、目标、考虑的候选动作、评分方式、选择的动作、预测结果、测量结果以及可复现性元数据。所有示例迹线均使用 schema_version: decision_trace.v1。包含 JSON Schema 文件和依赖无关的参考实现。

声明边界

可用的声明:一个针对标准 Go2 Air 的紧凑命令-结果基准预览,包含本位姿结果、LiDAR 元数据摘要、有限的 ArUco 参考表、基线模型、第二表面衍生结果和 DecisionTrace 示例。

不可声明的:动捕级真值、首个外部真值四足机器人数据集、世界模型当前最优、完整的多发布原生 LeRobot v3.0 导出、跨所有表面的泛化能力。

搜集汇总
数据集介绍
go2-air-controlbench-v1 数据集图片
构建方式
Go2 Air ControlBench v1 是一个专为 Unitree Go2 Air 四足机器人设计的指令到结果基准测试集,旨在回答一个对机器人规划器和世界模型评分器至关重要的核心问题:当机器人接收到移动指令后,实际发生了什么,以及规划器应如何从候选指令中做出最优选择?该数据集通过严格控制的实验过程构建,涵盖原始公开预览的116次试验与Release05扩展的115次试验,共计231次归一化试验。每次试验均记录机器人的指令参数(如线速度、角速度、持续时间)、本地里程计测量的实际位移与偏航变化,以及指令前后的状态数据。数据采用CSV表格、Parquet文件和LeRobot v3.0兼容格式存储,并附带基线模型评估结果与逆指令基准测试,从而形成了一个结构化的指令-结果对应体系。
使用方法
用户可通过Python的pandas库直接读取CSV表格文件,例如使用`pd.read_csv('tables/all_trials_normalized.csv')`加载归一化试验数据。同时,借助Hugging Face的datasets库,支持通过`load_dataset`函数按配置名称(如`trial_level_preview`、`release05_trial_level_preview`等)分批次获取数据。对于需要高时间分辨率分析的研究者,LeRobot v3.0原生速率数据集(`lerobot_v3_native_rate`)提供了36个试验片段、900帧的本地里程计流(约18.7 Hz),可直接与LeRobot工具链集成。此外,DecisionTrace v1的实现代码和验证脚本(`decision_trace.py`)允许用户自定义构建、验证决策跟踪记录,为机器人规划器的复盘与诊断提供了标准化工具。
背景与挑战
背景概述
Go2 Air ControlBench v1 数据集由研究团队于2024年创建,聚焦于四足机器人Unitree Go2 Air的运动控制指令与执行结果之间的映射关系。在机器人运动规划与模型评估领域,现有大规模数据集如Open X-Embodiment和DROID主要集中于操作任务和模仿学习,缺乏对指令选择质量的系统性量化评估。该数据集通过构建紧凑的指令-结果基准,开创性地提出了基于决策迹(DecisionTrace)的框架,将指令预测、候选动作选择与实测结果对比相结合,为世界模型评分和规划器决策提供了可审计的量化指标。其核心价值在于填补了消费级四足机器人运动控制验证领域的空白,通过标准化基线模型和逆命令基准,为后续研究建立了可复现的评估范式。
当前挑战
该数据集需应对的核心挑战包括:首先,机器人运动控制领域长期面临指令到实际运动的非线性映射难题,尤其是四足机器人存在死区效应和表面依赖性,使得简单线性模型无法准确预测运动结果,亟需构建死区感知的基线模型;其次,数据集构建过程中面临多源数据对齐与质量控制的困难,如原生里程计与外部ArUco参考系之间的精度差异、不同采集批次间地表条件变化带来的泛化挑战,以及原始日志中敏感信息(如IP地址、序列号)的脱敏处理;此外,如何在有限样本(231次试验)条件下设计具有统计意义的逆命令基准和留出评估协议,以验证模型在未见表面上的泛化能力,亦是构建过程中的关键技术挑战。
常用场景
经典使用场景
在四足机器人运动规划与控制的学术研究中,当研究者需要验证候选指令对机体真实运动影响的映射关系时,Go2 Air ControlBench v1 数据集提供了一个紧凑而严谨的“指令-结果”基准。该数据集以宇树Go2 Air四足机器人为平台,记录了在指令平面运动与偏航运动下,原生里程计测得的真实位移与旋转响应。其经典用法包括评估不同基线模型(如朴素模型、仿射模型、死区仿射模型)对运动输出的预测精度,并通过逆指令基准测试衡量规划器从候选集中选择最优指令的正确性。这一设计直接服务于世界模型评分和决策证据追溯的两大核心任务,使得研究者能够从“预测输出”与“实测输出”的差异中量化控制策略的后悔值,从而进行更精准的决策优化。
解决学术问题
该数据集旨在解决机器人学领域中一个长期存在的学术难题:如何在缺乏高精度外部定位系统(如动捕系统)的条件下,对四足机器人的运动控制指令进行可信的基准测试与模型校准。现有大规模机器人数据集如Open X-Embodiment和DROID主要关注机械臂操作演示学习,忽略了足式机器人运动规划的指令选择验证。Go2 Air ControlBench v1通过系统性地采集原生里程计数据,并引入死区仿射基线模型,揭示了朴素预测模型在偏航运动中的高误差(RMSE达0.141 rad),而加入死区补偿后误差可降低至0.010 rad以下。这一发现挑战了行业中对四足机器人运动模型过于简单的假设,推动了基于指令-结果映射的世界模型评估方法论的发展,为后续决策证据格式标准的建立提供了实证基础。
实际应用
在实际的机器人部署中,Go2 Air ControlBench v1 数据集的应用价值体现在为地面机器人自主规划系统提供离线校准与在线决策验证支持。例如,当四足机器人在未知地形上执行搜索救援或巡检任务时,规划器需要从多个候选运动指令中快速选择最可能达到目标位移的指令。该数据集提供了从朴素基线到死区仿射基线的完整性能比较,使得开发者可以在不额外采集大量实机数据的情况下,通过跨表面泛化测试(如将原始预览集的116次试验用于训练,将Release05的115次试验用于验证)评估不同模型的表面迁移鲁棒性。此外,数据集附带的DecisionTrace v1格式为每个决策提供了可审计的记录,包括观测、目标、候选指令、得分、预测和实测结果,这对于需要高可靠性保障的工业级应用(如仓库巡检、农业监测)至关重要。
数据集最近研究
最新研究方向
Go2 Air ControlBench v1作为一款面向宇树Go2 Air四足机器人的紧凑型指令-结果基准数据集,标志着机器人规划与模型评估范式的重要转变。该数据集聚焦于一个基础却关键的问题:当向机器人发出运动指令时,实际产生的物理响应是否与预期一致?其核心贡献在于构建了从候选指令到测量结果的完整闭环评估链路——即所谓的'遗憾值'框架,从而为决策追踪和世界模型评分提供了透明、可审计的实证基础。该基准的诞生弥补了现有大规模机器人数据集(如Open X-Embodiment)主要集中于技能模仿学习而在规划层面缺乏精确指令-结果对应关系的不足,特别适用于评估机器人运动规划器在考虑死区、模型偏差等实际因素时的决策正确性。通过引入逆指令基准和可泛化的离线评估协议,为欠驱动足式机器人的系统辨识、模型校准以及可解释性决策提供了重要的参考标准与研究工具。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务