micahr234/play_ns_cartpole
收藏资源简介:
该数据集包含强化学习环境中的交互数据,用于训练和评估智能体。特征包括环境名称(env_name)、环境索引(env_idx)、全局步数(global_step)、回合步数(episode_step)、动作(action)、奖励(reward)、变换后的奖励(xformed_reward)、完成标志(done)、观测值(observation)以及元数据如质量杆标志(metadata_masspole_flag)、质量杆值(metadata_masspole)、重力标志(metadata_gravity_flag)、重力值(metadata_gravity)和q星值(metadata_q_star)。数据分为训练集(1000万个示例)和评估集(20万个示例),总大小约为1.4GB。
This dataset contains interaction data from reinforcement learning environments, used for training and evaluating agents. Features include environment name (env_name), environment index (env_idx), global step (global_step), episode step (episode_step), action (action), reward (reward), transformed reward (xformed_reward), done flag (done), observation (observation), and metadata such as masspole flag (metadata_masspole_flag), masspole value (metadata_masspole), gravity flag (metadata_gravity_flag), gravity value (metadata_gravity), and q-star value (metadata_q_star). The data is split into a training set (10 million examples) and an evaluation set (200,000 examples), with a total size of approximately 1.4GB.



