NeoRL-2
收藏资源简介:
NeoRL-2是由南京大学等研究机构构建的近现实世界离线强化学习基准数据集。该数据集包含7个模拟任务,旨在反映现实世界任务中的复杂性,涵盖时间延迟、外部因素、控制策略约束、传统控制方法收集的数据以及数据可用性的限制等特点。数据集通过模拟器收集,以模拟现实世界中的挑战,并用于训练和测试强化学习策略,推动算法在真实应用场景中的发展。
NeoRL-2 is a near-real-world offline reinforcement learning benchmark dataset constructed by Nanjing University and other research institutions. It contains 7 simulated tasks, which aim to reflect the complexity of real-world tasks, covering characteristics such as time delays, external factors, control policy constraints, data collected by traditional control methods, and limitations on data availability. This dataset is collected through simulators to mimic real-world challenges, and is utilized for training and testing reinforcement learning policies, so as to promote the development of algorithms in real-world application scenarios.
NeoRL2数据集概述
数据集简介
- NeoRL2是离线强化学习基准NeoRL的扩展版本。
- 包含用于训练的数据集和用于测试训练策略的相应环境。
- 数据集来源于7个开源环境:Pipeline、Simglucose、RocketRecovery、RandomFrictionHopper、DMSD、Fusion和SafetyHalfCheetah任务。
- 数据采集方式:使用强化学习算法或PID策略进行在线训练,选择回报在专家回报50%到80%之间的次优策略生成离线数据集。
环境安装
-
基础安装命令:
git clone https://agit.ai/Polixir/neorl2.git cd neorl pip install -e .
-
需要MuJoCo许可证的环境(RandomFrictionHopper和SafetyHalfCheetah):
pip install -e .[mujoco]
环境使用
-
基于OpenAI Gym API创建环境: python import neorl2 import gymnasium as gym env = gym.make("Pipeline")
-
获取数据集: python train_data, val_data = env.get_dataset()
-
支持设置和获取环境的奖励函数和终止函数。
环境参数表
| 环境名称 | 观测维度 | 动作维度 | 有终止标志 | 最大时间步长 |
|---|---|---|---|---|
| Pipeline | 52 | 1 | False | 1000 |
| Simglucose | 31 | 1 | True | 480 |
| RocketRecovery | 7 | 2 | True | 500 |
| RandomFrictionHopper | 13 | 3 | True | 1000 |
| DMSD | 6 | 2 | False | 100 |
| Fusion | 15 | 6 | False | 100 |
| SafetyHalfCheetah | 18 | 6 | False | 1000 |
数据结构
get_dataset()返回的训练数据和验证数据为相同格式的字典,包含以下字段:
obs:当前步的观测数组(N×观测维度)next_obs:下一步的观测数组(N×观测维度)action:动作数组(N×动作维度)reward:奖励数组(N维)done:回合终止标志数组(N维)index:轨迹编号数组(指示轨迹的开始)
许可证




