遇见数据集

micahr234/play_ns_frozenlake_random_big2

收藏
Hugging Face2026-05-09 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含强化学习智能体在多个环境中的交互数据,特征包括环境名称、环境索引、全局步数、回合步数、动作、奖励、转换后的奖励、完成标志、离散观察以及元数据(P标志、P值、q_star值)。数据集分为训练集(252万样本)和评估集(4万样本),可用于训练和评估强化学习算法。

This dataset contains interaction data of reinforcement learning agents in multiple environments, including features such as environment name, environment index, global step, episode step, action, reward, transformed reward, done flag, discrete observation, and metadata (P_flag, P, q_star). The dataset is split into training (2.52 million examples) and evaluation (40,000 examples) sets, suitable for training and evaluating reinforcement learning algorithms.

提供机构:
micahr234
二维码
社区交流群
二维码
科研交流群
商业服务