ODRL
收藏资源简介:
ODRL是由清华大学深圳国际研究生院等机构创建的第一个用于评估非动态强化学习方法的基准数据集。该数据集包含四个实验设置,涵盖了运动、导航和灵巧操作等多个领域,提供了多种动态变化的任务,旨在全面评估代理在目标领域中的适应能力。数据集包括80个任务,涉及摩擦、重力、运动学和形态学等多种动态变化。创建过程中,数据集采用了统一框架,并将算法实现分离为单个文件,以便于理解和比较。ODRL主要应用于强化学习领域,旨在解决不同领域间动态差异下的策略迁移问题。
ODRL is the first benchmark dataset for evaluating non-dynamic reinforcement learning methods, developed by the Graduate School at Shenzhen, Tsinghua University and other institutions. This dataset includes four experimental setups spanning multiple domains such as locomotion, navigation, and dexterous manipulation, and offers a variety of dynamically changing tasks, with the goal of comprehensively evaluating the adaptation capabilities of agents in target domains. The dataset comprises 80 tasks involving diverse dynamic variations including friction, gravity, kinematics, and morphology. During its creation, a unified framework was adopted for the dataset, and algorithm implementations are separated into individual files to facilitate understanding and comparative analysis. ODRL is primarily utilized in the field of reinforcement learning, aiming to address the policy transfer problem under dynamic discrepancies across different domains.
ODRL: An Off-dynamics Reinforcement Learning Benchmark
概述
ODRL是首个针对动态差异强化学习问题的基准测试,其中目标域数据有限,而源域数据相对充足。目标是利用两个域的数据在目标域中获得更好的性能。
特点
- 单文件算法实现
- 支持多种实验设置
- 提供离线目标域数据集
- 支持广泛的动态变化
实验设置
ODRL包含以下四种实验设置:
- Online-Online:源域和目标域均为在线
- Offline-Online:源域离线,目标域在线
- Online-Offline:源域在线,目标域离线
- Offline-Offline:源域和目标域均为离线
实现算法
针对每种实验设置,实现了多种基准算法。
Online-Online Setting
- DARC
- VGDF
- PAR
- SAC
- SAC_IW
- SAC_tune
Offline-Online Setting
- H2O
- BC_VGDF
- BC_PAR
- BC_SAC
- CQL_SAC
- MCQ_SAC
- RLPD
Online-Offline Setting
- H2O
- PAR_BC
- SAC_BC
- SAC_CQL
- SAC_MCQ
Offline-Offline Setting
- IQL
- TD3_BC
- DARA
- BOSA
数据集
- Locomotion:支持摩擦、重力、运动学、形态学变化,提供离线数据集
- Navigation:支持地图布局变化,提供离线数据集
- Dexterous Manipulation:支持运动学、形态学变化,提供离线数据集
运行方式
通过train.py文件运行四种实验设置,通过--mode标志切换不同的设置。
许可证
本仓库采用MIT许可证。




