micahr234/play_ns_frozenlake_random
收藏资源简介:
该数据集是一个强化学习数据集,包含环境交互记录,涉及多个特征如环境名称(env_name)、环境索引(env_idx)、全局步数(global_step)、回合步数(episode_step)、动作(action)、奖励(reward)、转换后奖励(xformed_reward)、完成标志(done)、离散观察(observation_discrete)以及元数据(如P_flag、P、q_star)。数据划分为训练集(400,000个示例)和评估集(80,000个示例),适用于强化学习算法的训练和评估任务。
This dataset is a reinforcement learning dataset containing records of environment interactions, with features such as environment name (env_name), environment index (env_idx), global step (global_step), episode step (episode_step), action (action), reward (reward), transformed reward (xformed_reward), done flag (done), discrete observation (observation_discrete), and metadata (e.g., P_flag, P, q_star). The data is split into training (400,000 examples) and evaluation (80,000 examples) sets, suitable for training and evaluating reinforcement learning algorithms.



