HPinParallelRL
收藏资源简介:
本数据集是论文《从重要性迁移到地形拓扑:表征和利用并行强化学习中的超参数空间》的配套数据与图件,遵循CC-BY-4.0许可。它包含一个全面的近端策略优化(PPO)超参数实验语料库,用于支持论文中的所有分析与图表。数据集核心由37,200次完整的PPO训练运行构成,这些运行按照结构化实验设计组织:覆盖5个超参数组(PPO核心、GAE、归一化、优化、架构)、4个Brax/MuJoCo连续控制环境(ant、halfcheetah、hopper、walker2d)、5个并行化级别(num_envs ∈ {64, 128, 256, 512, 1024})以及3个随机种子(42, 43, 44)。所有运行均成功完成,并记录了最终评估性能指标final_eval_return。数据集提供三种主要数据文件:configs_with_hyperparameters.csv(包含超参数配置和性能结果)、all_runs.parquet(完整合并语料库)和eval_trajectories.parquet(评估回报轨迹)。此外,还包括衍生分析表格和论文图表PDF文件。该数据集适用于强化学习、超参数优化、自动化机器学习(AutoML)、适应性景观分析、fANOVA以及并行RL系统分析等领域的研究。
This dataset is the accompanying data and figures for the paper From Importance Transfer to Topographic Topology: Characterizing and Exploiting Hyperparameter Space in Parallel Reinforcement Learning, released under the CC-BY-4.0 license. It contains a comprehensive corpus of Proximal Policy Optimization (PPO) hyperparameter experiments to support all analyses and figures in the paper. The core of the dataset consists of 37,200 complete PPO training runs, organized according to a structured experimental design: covering 5 hyperparameter groups (PPO core, GAE, normalization, optimization, architecture), 4 Brax/MuJoCo continuous control environments (ant, halfcheetah, hopper, walker2d), 5 parallelization levels (num_envs ∈ {64, 128, 256, 512, 1024}), and 3 random seeds (42, 43, 44). All runs completed successfully and recorded the final evaluation performance metric final_eval_return. The dataset provides three main data files: configs_with_hyperparameters.csv (containing hyperparameter configurations and performance results), all_runs.parquet (the complete merged corpus), and eval_trajectories.parquet (evaluation return trajectories). Additionally, it includes derived analysis tables and final paper figure PDF files. This dataset is suitable for research in reinforcement learning, hyperparameter optimization, automated machine learning (AutoML), adaptive landscape analysis, fANOVA, and parallel RL system analysis.
数据集概述
PPO Hyperparameter Corpus — From Importance Shifts to Landscape Topology (PPSN 2026) 是一个用于并行强化学习中PPO算法超参数空间研究的公开数据集,由英国埃克塞特大学的Yingjie Zou和Zhong Fan发布,配套PPSN 2026会议论文。数据集采用CC-BY-4.0许可协议。
数据规模与构成
数据集包含 37,200次PPO训练运行,组织方式如下:
- 5个超参数章节(HP组):
- Chap1:PPO核心参数
- Chap2:GAE(广义优势估计)参数
- Chap3:归一化参数
- Chap4:优化器参数
- Chap5:网络架构参数
- 4个连续控制环境:ant、halfcheetah、hopper、walker2d(基于Brax/MuJoCo)
- 5个并行度水平:num_envs ∈ {64, 128, 256, 512, 1024}
- 3个随机种子:42、43、44
各章节配置数:Chap1/2/4/5各135个配置(每个8,100次运行),Chap3共80个配置(4,800次运行)。每次运行均成功完成(state == finished),且final_eval_return非空。训练采用evorl PPO实现,基于NVIDIA GH200 GPU和SLURM调度系统。
数据文件与结构
数据集包含以下核心文件(位于data/目录):
| 文件 | 描述 | 规模 |
|---|---|---|
configs_with_hyperparameters.csv |
每运行一行,含23列 | 37,200行 × 23列 |
all_runs.parquet |
完整合并语料库 | 37,200行 × 48列 |
eval_trajectories.parquet |
评估回报轨迹,每次运行10个快照 | 用于阶段分析 |
derived/ |
验证后的分析表格(支撑论文图表) | 多个CSV文件 |
configs_with_hyperparameters.csv 主要列字段:
| 列名 | 类型 | 说明 |
|---|---|---|
chapter |
str | 超参数章节(Chap1–Chap5) |
env_name |
str | 环境名称 |
num_envs |
int | 并行环境数量(64–1024) |
seed |
int | 随机种子(42/43/44) |
rollout_length |
int | PPO rollout长度 |
discount |
float | 折扣因子γ |
gae_lambda |
float | GAE λ |
clip_epsilon |
float | PPO裁剪ε |
optimizer.lr |
float | Adam学习率 |
normalize_obs |
bool | 观测归一化开关 |
final_eval_return |
float | 最终评估episodic回报(输出指标) |
total_timesteps |
int | 固定训练预算常数(≈1×10^7) |
注意:
total_timesteps在所有37,200次运行中为固定常数,并非被扫描的超参数。
论文图表对应关系
数据集文件直接支撑论文中的以下图表:
configs_with_hyperparameters.csv:所有fANOVA/景观/HPO分析的输入fanova_individual_importance.csv:支撑表3、图S1、图S4(超参数重要性偏移)graphfla_landscape_features_validated.csv:支撑§5景观分析、表4、图S5/S6/S8hpo_results_v2.csv:支撑§6 HPO基准测试、图3、图S7/S8stagewise_importance.csv:支撑§4.2阶段重要性、图S3fig_*.pdf:主论文图(图1–4)和补充材料图(图S1–S12)
数据完整性
- 提供
CHECKSUMS.sha256文件,列明所有发布数据、图表和文档文件的SHA256哈希值 eval_trajectories.parquet的SHA256为:e7ef8116687e4bee178f04800c649ac35b03bc1806fe66cd5b175f5f2b70cb1f
引用
使用本数据集时请引用PPSN 2026论文。许可协议:CC-BY-4.0。




