OpenDILabCommunity/Pong-v4-expert-MCTS
收藏资源简介:
该数据集包含8个pong-v4环境的片段。专家策略是EfficientZero,能够生成MCTS隐藏状态。由于每个观察值都包含隐藏状态,该数据集适用于从序列中学习的模仿学习方法,如Procedure Cloning (PC)。数据字段包括观察值(obs)、动作(actions)和隐藏状态(hidden_state)。观察值是一个包含8个轨迹的Array3D,数据类型为uint8,每个值在0到255之间,形状为[96, 96, 3]。动作是一个整数,表示8个轨迹中的动作,值在0到5之间。隐藏状态是一个Array3D,包含由EfficientZero生成的隐藏状态,数据类型为float32。数据集仅包含训练集,评估通过与模拟器交互进行。数据收集由EfficientZero策略完成,专家数据的标准是每个8个片段的回报超过20。未应用标准化,即每个观察值的值是一个uint8标量,范围在0到255之间。
该数据集包含8个pong-v4环境的片段。专家策略是EfficientZero,能够生成MCTS隐藏状态。由于每个观察值都包含隐藏状态,该数据集适用于从序列中学习的模仿学习方法,如Procedure Cloning (PC)。数据字段包括观察值(obs)、动作(actions)和隐藏状态(hidden_state)。观察值是一个包含8个轨迹的Array3D,数据类型为uint8,每个值在0到255之间,形状为[96, 96, 3]。动作是一个整数,表示8个轨迹中的动作,值在0到5之间。隐藏状态是一个Array3D,包含由EfficientZero生成的隐藏状态,数据类型为float32。数据集仅包含训练集,评估通过与模拟器交互进行。数据收集由EfficientZero策略完成,专家数据的标准是每个8个片段的回报超过20。未应用标准化,即每个观察值的值是一个uint8标量,范围在0到255之间。
数据集概述
数据集名称
- Pong-v4-expert-MCTS
支持的任务和基准
- 任务:支持Procedure Cloning (PC)算法的训练。
- 基准:
- 决策序列长度为0时:
- 训练损失:

- 测试准确率:0.90
- 奖励:20
- 训练损失:
- 决策序列长度为4时:
- 训练动作损失:

- 训练隐藏状态损失:

- 训练准确率(自回归模式):

- 奖励:-21
- 训练动作损失:
- 决策序列长度为0时:
数据使用
- 数据描述:包含8个pong-v4环境下的剧集,专家策略为EfficientZero,能生成MCTS隐藏状态,适用于序列型模仿学习方法。
- 数据字段:
obs:uint8类型,形状为[96, 96, 3]的Array3D,包含8个评估代理的观察数据。actions:整数类型,范围0到5,来自8个评估代理的动作数据。hidden_state:float32类型,形状为Array3D,包含8个评估代理的隐藏状态数据。
- 数据分割:仅包含训练集,评估通过与模拟器交互进行。
- 数据收集和标准化:
- 数据由EfficientZero策略收集。
- 专家数据标准为每8个剧集的回报超过20。
- 未进行预先标准化处理。
附加信息
-
数据源生产者:@kxzxvbk
-
社会影响:可用于模仿学习,尤其是序列学习算法的研究。
-
已知限制:仅限于学术研究使用。
-
引用信息:
@misc{Pong-v4-expert-MCTS, title={{Pong-v4-expert-MCTS: OpenDILab} A dataset for Procedure Cloning algorithm using Pong-v4.}, author={Pong-v4-expert-MCTS Contributors}, publisher = {huggingface}, howpublished = {url{https://huggingface.co/datasets/OpenDILabCommunity/Pong-v4-expert-MCTS}}, year={2023}, }




