遇见数据集

micahr234/play_ns_cartpole

收藏
Hugging Face2026-05-08 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含强化学习环境中的交互数据,用于训练和评估智能体。特征包括环境名称(env_name)、环境索引(env_idx)、全局步数(global_step)、回合步数(episode_step)、动作(action)、奖励(reward)、变换后的奖励(xformed_reward)、完成标志(done)、观测值(observation)以及元数据如质量杆标志(metadata_masspole_flag)、质量杆值(metadata_masspole)、重力标志(metadata_gravity_flag)、重力值(metadata_gravity)和q星值(metadata_q_star)。数据分为训练集(1000万个示例)和评估集(20万个示例),总大小约为1.4GB。

This dataset contains interaction data from reinforcement learning environments, used for training and evaluating agents. Features include environment name (env_name), environment index (env_idx), global step (global_step), episode step (episode_step), action (action), reward (reward), transformed reward (xformed_reward), done flag (done), observation (observation), and metadata such as masspole flag (metadata_masspole_flag), masspole value (metadata_masspole), gravity flag (metadata_gravity_flag), gravity value (metadata_gravity), and q-star value (metadata_q_star). The data is split into a training set (10 million examples) and an evaluation set (200,000 examples), with a total size of approximately 1.4GB.

提供机构:
micahr234
二维码
社区交流群
二维码
科研交流群
商业服务