flappy_200ep
收藏资源简介:
该数据集是一个用于强化学习研究的交互式环境数据集,基于Flappy Bird游戏场景。它包含多个配置变体,主要差异在于模拟的固定延迟参数(0-4档)和训练周期设置(200个周期或7200步)。每个样本记录了智能体在环境中的完整交互轨迹,包含13个特征字段:环境图像观察(image)、执行的动作(action, action_id, action_text)、原始奖励信号(raw_reward)、决策步数(decision_step)、回合索引(episode_idx)、环境名称(env_name)、提示文本(prompt)、随机种子(seed)、数据划分(split),以及专门用于延迟研究的两个字段:延迟毫秒数(latency_ms)和延迟原始帧数(latency_raw_frames)。数据规模较大,训练集包含约129万样本(15.67GB),验证集约14.4万样本(1.75GB),总数据量约17.42GB。数据以Parquet格式存储,适用于游戏人工智能、强化学习算法训练、延迟感知策略研究等任务。
This dataset is an interactive environment dataset for reinforcement learning research, based on the Flappy Bird game scenario. It includes multiple configuration variants, primarily differing in simulated fixed latency parameters (levels 0-4) and training cycle settings (200 cycles or 7200 steps). Each sample records the complete interaction trajectory of an agent in the environment, containing 13 feature fields: environment image observation (image), executed actions (action, action_id, action_text), raw reward signal (raw_reward), decision steps (decision_step), episode index (episode_idx), environment name (env_name), prompt text (prompt), random seed (seed), data split (split), and two fields specifically for latency research: latency in milliseconds (latency_ms) and latency in raw frames (latency_raw_frames). The dataset is large in scale, with the training set containing approximately 1.29 million samples (15.67GB), the validation set about 144,000 samples (1.75GB), and a total data volume of about 17.42GB. The data is stored in Parquet format and is suitable for tasks such as game artificial intelligence, reinforcement learning algorithm training, and latency-aware policy research.
数据集名称:flappy_200ep
数据集版本与配置:该数据集包含5个配置,每个配置对应不同的时延设置(latency 从0到4),所有配置均经过200个训练周期(200ep)。
flappy_fix_latency_0_200epflappy_fix_latency_1_200epflappy_fix_latency_2_200epflappy_fix_latency_3_200epflappy_fix_latency_4_200ep
数据划分:每个配置包含两个数据子集:
train:训练集,文件为train.parquetval:验证集,文件为val.parquet
数据格式:所有数据文件为 Parquet 格式。




