遇见数据集

HPinParallelRL

收藏
Hugging Face2026-06-06 更新2026-06-07 收录
官方服务:

资源简介:

本数据集是论文《从重要性迁移到地形拓扑:表征和利用并行强化学习中的超参数空间》的配套数据与图件,遵循CC-BY-4.0许可。它包含一个全面的近端策略优化(PPO)超参数实验语料库,用于支持论文中的所有分析与图表。数据集核心由37,200次完整的PPO训练运行构成,这些运行按照结构化实验设计组织:覆盖5个超参数组(PPO核心、GAE、归一化、优化、架构)、4个Brax/MuJoCo连续控制环境(ant、halfcheetah、hopper、walker2d)、5个并行化级别(num_envs ∈ {64, 128, 256, 512, 1024})以及3个随机种子(42, 43, 44)。所有运行均成功完成,并记录了最终评估性能指标final_eval_return。数据集提供三种主要数据文件:configs_with_hyperparameters.csv(包含超参数配置和性能结果)、all_runs.parquet(完整合并语料库)和eval_trajectories.parquet(评估回报轨迹)。此外,还包括衍生分析表格和论文图表PDF文件。该数据集适用于强化学习、超参数优化、自动化机器学习(AutoML)、适应性景观分析、fANOVA以及并行RL系统分析等领域的研究。

This dataset is the accompanying data and figures for the paper From Importance Transfer to Topographic Topology: Characterizing and Exploiting Hyperparameter Space in Parallel Reinforcement Learning, released under the CC-BY-4.0 license. It contains a comprehensive corpus of Proximal Policy Optimization (PPO) hyperparameter experiments to support all analyses and figures in the paper. The core of the dataset consists of 37,200 complete PPO training runs, organized according to a structured experimental design: covering 5 hyperparameter groups (PPO core, GAE, normalization, optimization, architecture), 4 Brax/MuJoCo continuous control environments (ant, halfcheetah, hopper, walker2d), 5 parallelization levels (num_envs ∈ {64, 128, 256, 512, 1024}), and 3 random seeds (42, 43, 44). All runs completed successfully and recorded the final evaluation performance metric final_eval_return. The dataset provides three main data files: configs_with_hyperparameters.csv (containing hyperparameter configurations and performance results), all_runs.parquet (the complete merged corpus), and eval_trajectories.parquet (evaluation return trajectories). Additionally, it includes derived analysis tables and final paper figure PDF files. This dataset is suitable for research in reinforcement learning, hyperparameter optimization, automated machine learning (AutoML), adaptive landscape analysis, fANOVA, and parallel RL system analysis.

创建时间:
2026-06-02
原始信息汇总

数据集概述

PPO Hyperparameter Corpus — From Importance Shifts to Landscape Topology (PPSN 2026) 是一个用于并行强化学习中PPO算法超参数空间研究的公开数据集,由英国埃克塞特大学的Yingjie Zou和Zhong Fan发布,配套PPSN 2026会议论文。数据集采用CC-BY-4.0许可协议。

数据规模与构成

数据集包含 37,200次PPO训练运行,组织方式如下:

  • 5个超参数章节(HP组)
    • Chap1:PPO核心参数
    • Chap2:GAE(广义优势估计)参数
    • Chap3:归一化参数
    • Chap4:优化器参数
    • Chap5:网络架构参数
  • 4个连续控制环境:ant、halfcheetah、hopper、walker2d(基于Brax/MuJoCo)
  • 5个并行度水平:num_envs ∈ {64, 128, 256, 512, 1024}
  • 3个随机种子:42、43、44

各章节配置数:Chap1/2/4/5各135个配置(每个8,100次运行),Chap3共80个配置(4,800次运行)。每次运行均成功完成(state == finished),且final_eval_return非空。训练采用evorl PPO实现,基于NVIDIA GH200 GPU和SLURM调度系统。

数据文件与结构

数据集包含以下核心文件(位于data/目录):

文件 描述 规模
configs_with_hyperparameters.csv 每运行一行,含23列 37,200行 × 23列
all_runs.parquet 完整合并语料库 37,200行 × 48列
eval_trajectories.parquet 评估回报轨迹,每次运行10个快照 用于阶段分析
derived/ 验证后的分析表格(支撑论文图表) 多个CSV文件

configs_with_hyperparameters.csv 主要列字段:

列名 类型 说明
chapter str 超参数章节(Chap1–Chap5)
env_name str 环境名称
num_envs int 并行环境数量(64–1024)
seed int 随机种子(42/43/44)
rollout_length int PPO rollout长度
discount float 折扣因子γ
gae_lambda float GAE λ
clip_epsilon float PPO裁剪ε
optimizer.lr float Adam学习率
normalize_obs bool 观测归一化开关
final_eval_return float 最终评估episodic回报(输出指标)
total_timesteps int 固定训练预算常数(≈1×10^7)

注意:total_timesteps在所有37,200次运行中为固定常数,并非被扫描的超参数。

论文图表对应关系

数据集文件直接支撑论文中的以下图表:

  • configs_with_hyperparameters.csv:所有fANOVA/景观/HPO分析的输入
  • fanova_individual_importance.csv:支撑表3、图S1、图S4(超参数重要性偏移)
  • graphfla_landscape_features_validated.csv:支撑§5景观分析、表4、图S5/S6/S8
  • hpo_results_v2.csv:支撑§6 HPO基准测试、图3、图S7/S8
  • stagewise_importance.csv:支撑§4.2阶段重要性、图S3
  • fig_*.pdf:主论文图(图1–4)和补充材料图(图S1–S12)

数据完整性

  • 提供CHECKSUMS.sha256文件,列明所有发布数据、图表和文档文件的SHA256哈希值
  • eval_trajectories.parquet的SHA256为:e7ef8116687e4bee178f04800c649ac35b03bc1806fe66cd5b175f5f2b70cb1f

引用

使用本数据集时请引用PPSN 2026论文。许可协议:CC-BY-4.0。

搜集汇总
数据集介绍
HPinParallelRL 数据集图片
构建方式
HPinParallelRL数据集源自一项关于并行强化学习中超参数空间特性的系统研究,由Yingjie Zou和Zhong Fan于埃克塞特大学构建,并发表于PPSN 2026会议。该数据集囊括了37,200次PPO算法训练运行,横跨五个超参数组(PPO核心、GAE、归一化、优化、架构),在四种连续控制环境(ant、halfcheetah、hopper、walker2d)中开展,并覆盖五级并行度(num_envs从64至1024)与三组随机种子。运行管理依托NVIDIA GH200 GPU集群及SLURM调度系统,确保计算的高效与可复现。数据以层次化结构组织,包含核心运行表、完整语料库及评估轨迹等多份文件,并附有校验和以确保完整性。
特点
该数据集最显著的特点在于其多维度的系统性覆盖与精细化的分析支持。它不仅提供了超参数配置与性能指标间的直接映射,更通过fANOVA、景观分析等方法,揭示了并行度提升如何引发超参数重要性的系统性偏移。数据集中包含了章节级超参数映射、成对交互效应、阶段性重要性演化及景观拓扑特征等衍生分析表,为理解并行强化学习中的超参数空间拓扑结构提供了定量基础。所有运行记录均包含完整的最终评估回报,并保留了训练过程中的十阶段快照,支持从微观到宏观的多层级探索。
使用方法
研究者可直接加载configs_with_hyperparameters.csv或all_runs.parquet文件,利用其中的37,200条运行记录进行超参数重要性分析、性能预测或迁移学习研究。借助eval_trajectories.parquet中的阶段轨迹,可剖析训练过程中的性能演化模式。数据集内含的衍生分析表(如fanova_individual_importance.csv、graphfla_landscape_features_validated.csv)可作为验证理论假设或开展元学习的直接输入。项目同时提供了完整的图形复现脚本,支持从原始数据到论文结果的端到端验证。所有数据均以CSV和Parquet格式存储,便于集成至主流数据科学生态系统。
背景与挑战
背景概述
在深度强化学习领域,近端策略优化(PPO)作为连续控制任务的主流算法,其超参数选择对训练性能具有决定性影响。然而,现有研究多集中于单智能体场景下的超参数调优,且受限于计算资源,鲜有系统探索并行化程度与超参数重要性之间的交互关系。为填补这一空白,Yingjie Zou与Zhong Fan(埃克塞特大学)于PPSN 2026发布了HPinParallelRL数据集,该数据集基于37,200次PPO训练运行,覆盖五组超参数、四种Brax/MuJoCo连续控制环境、五种并行度(64至1024)及三重随机种子,系统刻画了并行强化学习中超参数空间的结构特性。其核心研究问题在于揭示并行度如何引发超参数重要性的非平稳迁移,并借助功能方差分析(fANOVA)与适应度景观分析(Fitness Landscape Analysis)构建可解释的超参数空间拓扑,为自动化机器学习(AutoML)在分布式强化学习场景下的高效部署提供了坚实的数据基础。
当前挑战
该数据集所解决的领域挑战包括:一是超参数重要性随环境并行度动态变化的未知性,传统静态超参数优化方法难以适应分布式训练的复杂性,而该数据集通过多层级并行度实验首次系统量化了这一重要性迁移现象;二是并行强化学习中超参数景观拓扑结构的表征难题,高维度、多交互的超参数空间导致传统调优策略效率低下,数据集引入基于图结构的景观分析方法,揭示不同并行度下超参数间非单调的关联模式。在构建过程中面临的挑战包括:需要协调37,200次运行在NVIDIA GH200 GPU集群上的资源调度与任务管理,确保训练过程在固定预算(约10^7时间步)下稳定完成;同时维护五组超参数章节的独立实验设计,并处理缺失值、异常种子行为等数据质量验证问题,最终通过校验和与来源追踪机制保证实验的可复现性。
常用场景
经典使用场景
在强化学习领域,超参数配置对近端策略优化算法的性能影响至关重要。HPinParallelRL数据集为研究者提供了一个系统探究PPO超参数在并行连续控制任务中行为的标准化平台。该数据集囊括了37,200次完整训练会话,覆盖五个关键超参数章节、四种Brax/MuJoCo仿真环境以及五个并行度级别。经典使用方式通常聚焦于利用该语料库开展超参数重要性分析、适应性景观拓扑构建以及多层级超参数优化方法验证,为并行强化学习中的超参数效应分离与表征提供了坚实的数据基础。
衍生相关工作
围绕HPinParallelRL数据集已衍生出多项具有影响力的研究工作。其中心包含功能方差分析驱动的超参数重要性漂移检测方法,为理解并行度对PPO性能的异质性影响提供了标准化分析管线。基于图论的功能景观分析框架通过提取超参数景观的拓扑特征,揭示了不同并行度下的优化瓶颈与动态变化模式。此外,研究者还基于该数据集构建了超参数优化基准测试,系统比较了进化算法、贝叶斯优化与随机搜索在多样并行环境下的相对效能,这些工作共同奠定了并行强化学习中超参数科学调优的理论与实践基石。
数据集最近研究
最新研究方向
该数据集聚焦于并行强化学习中超参数空间的特征刻画与拓扑分析,前沿研究方向包括超参数重要性的动态漂移、适应度景观拓扑的并行性依赖性以及自动化超参数优化(HPO)在连续控制任务中的应用。通过系统性地在多个并行度(64至1024个环境实例)下对PPO算法进行大规模实验(37,200次运行),揭示了并行度增加如何引发超参数重要性的非平凡迁移,并构建了基于fANOVA和GraphFLA的景观拓扑特征体系。该工作紧密关联AutoML与并行计算领域的热点事件,为理解大规模并行训练中强化学习算法的超参数敏感性提供了元知识框架,对设计更具鲁棒性的RL系统和自动化调参策略具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务