go2-air-controlbench-v1
收藏资源简介:
Go2 Air ControlBench v1 Public Preview 是一个针对标准Unitree Go2 Air四足机器人的紧凑型命令到结果基准测试数据集。其核心目的是回答一个对机器人规划器和世界模型评分器至关重要的问题:当命令机器人移动时,实际会发生什么?以及规划器本应选择哪个候选命令?该数据集并非用于模仿学习或提供动作捕捉级地面真值,而是一个公开安全的基准预览,旨在桥接决策追踪(DecisionTrace)和世界锻造(WorldForge)框架,关注“为何选择此行动而非其他替代方案,以及根据实测结果该选择是否正确”。 数据集包含多个稳定预览表格,包括原始116次试验的标准化数据(`all_trials_normalized.csv`)、按命令分组的结果统计、基线模型报告(包含朴素、仿射和死区仿射模型)、有界ArUco参考连接表,以及外部参考质量指标。此外,还提供了Release05扩展,增加了115次在第二表面捕获的衍生试验行、相应的标准化表格、分组结果统计和基线报告。数据集还整合了包含231次试验的合并表(`all_trials_plus_release05_normalized.csv`)以及一个逆向命令基准测试(`inverse_command_benchmark.csv`),该测试要求模型根据目标位移或偏航角从观察到的候选命令集中选择最佳命令。 数据形式主要为表格数据(CSV、JSON)和紧凑的Parquet预览。关键字段包括命令速度(`cmd_x`, `cmd_y`, `cmd_z`)、命令持续时间(`duration_s`)、原生里程计位移和偏航角变化(`odom_dx_m`, `odom_dy_m`, `odom_dyaw_rad`)以及前后位置姿态。数据集还提供了证据和演示材料,如DecisionTrace v1草案示例、SVG图表、验证和基准测试脚本,以及简短的论文。 该数据集适用于机器人学领域,特别是四足机器人的系统识别、命令选择基准测试、规划算法验证以及世界模型评分工作流的评估。其内置的评估协议建议使用原始预览数据(116次试验)进行拟合,然后在Release05第二表面数据(115次试验)上进行留出评估,以测试模型在不同表面的泛化能力。数据集遵循CC-BY-4.0许可证。
Go2 Air ControlBench v1 Public Preview is a compact command-to-result benchmarking dataset for the standard Unitree Go2 Air quadruped robot. Its core purpose is to answer a critical question for robot planners and world model scorers: What actually happens when a robot is commanded to move? And which candidate command should the planner have chosen? The dataset is not intended for imitation learning or providing motion-capture-level ground truth, but is a public, safe benchmark preview designed to bridge the DecisionTrace and WorldForge frameworks, focusing on why choose this action over other alternatives, and whether that choice was correct based on measured results. The dataset includes multiple stable preview tables, such as normalized data from the original 116 trials (`all_trials_normalized.csv`), result statistics grouped by command, baseline model reports (including naive, affine, and deadzone-affine models), bounded ArUco reference linkage tables, and external reference quality metrics. Additionally, it provides a Release05 extension, adding 115 derived trial rows captured on a second surface, along with corresponding normalized tables, grouped result statistics, and baseline reports. The dataset also integrates a combined table with 231 trials (`all_trials_plus_release05_normalized.csv`) and an inverse command benchmark (`inverse_command_benchmark.csv`), which requires models to select the best command from observed candidate sets based on target displacement or yaw angle. The data is primarily in tabular form (CSV, JSON) and compact Parquet previews. Key fields include command velocities (`cmd_x`, `cmd_y`, `cmd_z`), command duration (`duration_s`), native odometry displacement and yaw changes (`odom_dx_m`, `odom_dy_m`, `odom_dyaw_rad`), and pre/post position poses. The dataset also provides evidence and demonstration materials, such as DecisionTrace v1 draft examples, SVG charts, validation and benchmarking scripts, and a short paper. It is applicable in the field of robotics, particularly for system identification of quadruped robots, command selection benchmarking, planning algorithm validation, and evaluation of world model scoring workflows. Its built-in evaluation protocol recommends fitting on the original preview data (116 trials) and then performing hold-out evaluation on the Release05 second-surface data (115 trials) to test model generalization across different surfaces. The dataset is licensed under CC-BY-4.0.
数据集概述
- 数据集名称:Go2 Air ControlBench v1 Public Preview
- 许可证:CC-BY-4.0
- 语言:英语
- 任务类别:机器人学
- 标签:机器人学、四足机器人、Unitree Go2、系统辨识、决策证据、DecisionTrace、WorldForge、ArUco、LeRobot
- 数据规模:1,000 < 样本数 < 10,000
- 数据集配置:
trial_level_preview:训练集,Parquet 文件yaw_native_rate_preview:训练集,Parquet 文件release05_trial_level_preview:训练集,Parquet 文件combined_trial_table:训练集,Parquet 文件inverse_command_benchmark:训练集,Parquet 文件
数据集目的与核心问题
该基准测试针对标准 Unitree Go2 Air 机器人,探究一个对机器人规划器和世界模型评分器至关重要的狭窄问题:
如果命令机器人移动,实际会发生什么,以及规划器本应选择哪个候选命令?
该数据集并非模仿学习语料库,也非动捕级真值,而是一个公开安全的基准预览,包含衍生表格、基线模型、图表、DecisionTrace 示例和紧凑的 Parquet 预览。
数据集包含内容
稳定公开预览表格:
tables/all_trials_normalized.csv:116 行标准化试验数据tables/command_group_stats.csv:按命令分组的本体位姿结果tables/baseline_model_report.json:朴素、仿射和死区仿射基线模型报告tables/release04_trial_aruco_join.csv:Release04 的 ArUco 参考数据tables/release04_aruco_metrics.json:外部参考质量指标
Release05 扩展数据:
tables/release05_second_surface_trials.csv:115 行第二表面试验数据tables/release05_second_surface_trials_normalized.csv:归一化的 Release05 表格tables/release05_second_surface_group_stats.csv:Release05 分组结果tables/release05_baseline_model_report.json:Release05 基线模型报告tables/all_trials_plus_release05_normalized.csv:合并的 231 行试验表格tables/combined_baseline_model_report.json:合并基线模型报告tables/inverse_command_benchmark.csv:目标运动命令选择基准行tables/inverse_command_benchmark_summary.json:遗憾值、命中率和秩相关汇总
证据与演示:
decision_traces/:DecisionTrace v1 示例(含正遗憾值)、JSON Schema 及参考验证器/构建器decision_traces/decision_trace.v1.schema.json:DecisionTrace v1 格式的 JSON Schemafigures/:SVG 格式的图表lerobot_v3_native_rate/:可加载的 LeRobot v3.0 数据集(36 个片段 / 900 帧)lerobot_v3_preview/:紧凑的 Parquet 预览及元数据metadata/croissant_metadata.json:Croissant 样式元数据草案scripts/:验证和基线脚本paper/:短论文及 Release05 附录
关键指标
原始公开预览:
- 总试验数:116
- 运动试验数:106
- 前进/后退试验数:50
- 偏航试验数:56
- 原生偏航率预览:1,118 行
ROBOTODOM数据,约 18.7 Hz - Release04 ArUco 前后覆盖率:35/59 试验
Release05 扩展:
- 干净的第二表面试验数:115
- 本地运行中的原生
ROBOTODOM消息数:5,160 - 本地运行中的原生
ULIDAR_ARRAY消息数:2,121 - 保存的本地 LiDAR 侧车文件数:510
合并预览:
- 合并标准化试验数:231
- 平移命令试验数:108
- 偏航命令试验数:106
基线模型结果
原始公开预览 RMSE:
| 任务 | 朴素 | 仿射 | 死区仿射 | |---|---|---:|---:|---:| | 有符号平面平移 | 0.0444 m | 0.0313 m | 0.0296 m | | 偏航 | 0.141 rad | 0.0166 rad | 0.00995 rad |
Release05 RMSE:
| 任务 | 朴素 | 仿射 | 死区仿射 | |---|---|---:|---:|---:| | 有符号平面平移 | 0.0612 m | 0.0316 m | 0.0225 m | | 偏航 | 0.122 rad | 0.0191 rad | 0.00926 rad |
合并 RMSE:
| 任务 | 朴素 | 仿射 | 死区仿射 | |---|---|---:|---:|---:| | 有符号平面平移 | 0.0540 m | 0.0399 m | 0.0349 m | | 偏航 | 0.132 rad | 0.0179 rad | 0.0102 rad |
核心结论:在做出学习规划或世界模型相关声明之前,必须使用死区感知基线。
逆命令基准测试
该基准测试询问:
给定目标位移或偏航,规划器应从观察到的候选命令集中选择哪个命令?
Release05 平均测量遗憾值:
| 任务 | 朴素 | 仿射 | 死区仿射 |
|---|---|---|---|
| 平移 | 0.0243 m | 0.00712 m | 0.00607 m |
| 偏航 | 0.0153 rad | 0.00231 rad | 0.00143 rad |
合并平均测量遗憾值:
| 任务 | 朴素 | 仿射 | 死区仿射 |
|---|---|---|---|
| 平移 | 0.0159 m | 0.00776 m | 0.00638 m |
| 偏航 | 0.0116 rad | 0.00509 rad | 0.00513 rad |
留出评估协议
建议使用原始预览与 Release05 第二表面扩展作为留出泛化检验:在原始 116 试验上拟合/校准,在 115 个 Release05 试验上评估,报告平移 RMSE、偏航 RMSE 和平均测量遗憾值。
数据加载方式
python import pandas as pd trials = pd.read_csv("tables/all_trials_normalized.csv") release05 = pd.read_csv("tables/release05_second_surface_trials_normalized.csv") combined = pd.read_csv("tables/all_trials_plus_release05_normalized.csv")
从 Hub 加载:
python from datasets import load_dataset trial_level = load_dataset("espejelomar/go2-air-controlbench-v1", "trial_level_preview", split="train") release05 = load_dataset("espejelomar/go2-air-controlbench-v1", "release05_trial_level_preview", split="train") combined = load_dataset("espejelomar/go2-air-controlbench-v1", "combined_trial_table", split="train") inverse = load_dataset("espejelomar/go2-air-controlbench-v1", "inverse_command_benchmark", split="train")
数据字典
共享的标准化表格包含以下列:
| 列名 | 单位/类型 | 含义 |
|---|---|---|
release |
string | 采集/发布组 |
trial_index |
integer | 试验索引 |
suite |
string | 子套件标签 |
name |
string | 命令组名称 |
rep |
integer/string | 重复索引 |
cmd_x |
m/s | 前向/后向速度命令 |
cmd_y |
m/s | 侧向速度命令 |
cmd_z |
rad/s | 偏航速度命令 |
duration_s |
s | 命令持续时间 |
cmd_integral_x_m |
m | 朴素 cmd_x * duration_s |
cmd_integral_y_m |
m | 朴素 cmd_y * duration_s |
cmd_integral_yaw_rad |
rad | 朴素 cmd_z * duration_s |
odom_dx_m, odom_dy_m |
m | 本位姿位移分量 |
odom_planar_m |
m | 本位姿平面位移幅度 |
odom_dyaw_rad, odom_dyaw_deg |
rad, deg | 本位姿偏航变化量 |
pre_x, pre_y, pre_yaw |
m, m, rad | 命令前本位姿 |
post_x, post_y, post_yaw |
m, m, rad | 命令后本位姿 |
hardware_executed |
boolean | 是否向硬件发送运动命令 |
outcome_kind |
string | 结果来源标签 |
DecisionTrace v1
DecisionTrace 是一种便携、与提供商无关的记录,用于记录单个具身决策:观察内容、目标、考虑的候选动作、评分方式、选择的动作、预测结果、测量结果以及可复现性元数据。所有示例迹线均使用 schema_version: decision_trace.v1。包含 JSON Schema 文件和依赖无关的参考实现。
声明边界
可用的声明:一个针对标准 Go2 Air 的紧凑命令-结果基准预览,包含本位姿结果、LiDAR 元数据摘要、有限的 ArUco 参考表、基线模型、第二表面衍生结果和 DecisionTrace 示例。
不可声明的:动捕级真值、首个外部真值四足机器人数据集、世界模型当前最优、完整的多发布原生 LeRobot v3.0 导出、跨所有表面的泛化能力。




