遇见数据集

sgai-team-alien

收藏
Hugging Face2026-07-28 更新2026-07-29 收录
官方服务:

资源简介:

Team Alien Deluxe RL数据集是一个用于强化学习数据收集和分析的数据集,专门为Team Alien的Deluxe RL项目设计。数据集主要包含基础游戏模式下的实验数据,分为两个基线代理(harish和karunya)的结果。数据集由多个文件组成:episodes.csv文件包含约1000个完整游戏回合的统计信息,记录每个回合的模型标识符、运行ID、随机种子、结束原因、各种动作数量(保存、跳过、压碎、扰乱、弹出)、回合数、保存和杀死数量、保存值和奖励等。steps.csv文件包含约40000个步骤级别的详细信息,记录每个步骤的模型标识符、运行ID、随机种子、步骤索引、回合索引、决策类型、执行动作、选择的动作索引、Q值、动作掩码、贪婪标志、观察状态、人形特征、真实状态、载具状态、载具概率、显示载具百分比、剩余时间、使用槽位、总槽位、乘客数量、健康救护车、受伤救护车、僵尸救护车、尸体救护车、健康载具救护车、受伤载具救护车、救护车价值、载具后验概率、安全扰乱概率、弹出槽位、弹出真实状态、弹出载具状态、弹出载具概率、弹出显示百分比等。此外还包括评估摘要文件(eval.md)和训练好的模型检查点文件(harish.pth和karunya.pth)。Deluxe游戏模式目录当前为空,预留用于未来扩展。该数据集适用于强化学习算法分析、游戏AI行为研究、决策过程建模等任务。

The Team Alien Deluxe RL dataset is a dataset designed for reinforcement learning data collection and analysis, specifically for Team Aliens Deluxe RL project. It primarily contains experimental data from the basic game mode, divided into results from two baseline agents (harish and karunya). The dataset consists of multiple files: episodes.csv includes statistics for approximately 1000 complete game episodes, recording each episodes model identifier, run ID, random seed, termination reason, counts of various actions (save, skip, crush, disrupt, pop), episode number, save and kill counts, save value, and reward. steps.csv contains detailed step-level information for about 40,000 steps, recording each steps model identifier, run ID, random seed, step index, episode index, decision type, executed action, selected action index, Q-value, action mask, greedy flag, observation state, humanoid features, true state, vehicle state, vehicle probability, displayed vehicle percentage, remaining time, used slots, total slots, passenger count, healthy ambulance, injured ambulance, zombie ambulance, corpse ambulance, healthy vehicle ambulance, injured vehicle ambulance, ambulance value, vehicle posterior probability, safe disruption probability, pop slots, pop true state, pop vehicle state, pop vehicle probability, pop displayed percentage, etc. Additionally, it includes an evaluation summary file (eval.md) and trained model checkpoint files (harish.pth and karunya.pth). The Deluxe game mode directory is currently empty, reserved for future expansion. This dataset is suitable for tasks such as reinforcement learning algorithm analysis, game AI behavior research, and decision process modeling.

创建时间:
2026-07-25
原始信息汇总

数据集概述

数据集名称: Team Alien Deluxe RL Dataset
许可证: MIT License
数据集地址: https://huggingface.co/datasets/maxzhangalt/sgai-team-alien

该数据集用于 Team Alien 的 Deluxe RL 数据收集与分析,主要包含强化学习游戏模式下的训练数据、评估结果和模型权重。


仓库结构

├── base/ │ ├── baselineRL_harish/ │ │ ├── episodes.csv │ │ ├── steps.csv │ │ └── eval.md │ ├── baselineRL_karunya/ │ │ ├── episodes.csv │ │ ├── steps.csv │ │ └── eval.md │ └── models/ │ ├── harish.pth │ └── karunya.pth └── deluxe/


基础游戏模式(Base Game Mode)

base/ 目录包含基础游戏模式下的数据集、评估结果和训练好的模型。

基线目录

  • base/baselineRL_harish/
  • base/baselineRL_karunya/

每个基线目录包含以下三个文件。


episodes.csv - 回合级统计数据

包含每局完整游戏的回合级统计量。

  • 行数: 约 1,000 行
  • 回合标识符: run_id
  • 列字段:

model_id, run_id, seed, end_reason, n_save, n_skip, n_squish, n_scram, n_eject, n_turns, saved, killed, saved_value, reward

每一行代表一局完整的游戏回合。


steps.csv - 步骤级详细信息

包含每个回合中每一步的行动和决策详细数据。

  • 行数: 约 40,000 行
  • 回合标识符: run_id
  • 步骤标识符: step_index
  • 列字段:

model_id, run_id, seed, step_index, turn_index, decision_kind, action, chosen_action_index, q_values, action_mask, greedy, obs_json, humanoid_fp, true_state, is_carrier, carrier_prob, displayed_carrier_pct, remaining_time, slots_used, slots_total, n_passengers, amb_healthy, amb_injured, amb_zombie, amb_corpse, amb_carrier_healthy, amb_carrier_injured, ambulance_value, carrier_posterior, p_safe_scram, ejected_slot, ejected_true_state, ejected_is_carrier, ejected_carrier_prob, ejected_displayed_pct

可通过 run_id 分组,重建并分析每个回合内完整的决策序列。


eval.md - 评估摘要

包含评估总结和终端指标,用于快速查看每个模型的整体行为和性能。


训练好的模型

base/models/ 目录包含训练好的强化学习模型检查点:

base/models/ ├── harish.pth └── karunya.pth


豪华游戏模式(Deluxe Game Mode)

deluxe/ 目录预留用于存放豪华游戏模式下生成的数据集、评估结果和训练模型。

当前状态: 该目录为空。待添加豪华模式数据时将更新数据集说明。

搜集汇总
数据集介绍
sgai-team-alien 数据集图片
构建方式
该数据集专为Team Alien的Deluxe强化学习项目构建,旨在系统收集与分析游戏代理的决策行为。数据集包含基础(base)与豪华(deluxe)两种游戏模式,其中base目录下设有harish与karunya两个基线代理的子目录,每个子目录存储了约1000轮完整游戏回合的episodes.csv文件(记录回合级统计信息,如终止原因、乘客状态与奖励值),以及约40000步的steps.csv文件(记录每一步的决策动作、Q值、观测状态与载体的概率分布等细粒度信息)。此外,数据集还包含了代理训练好的.pth模型权重与eval.md评估摘要,便于复现与分析。deluxe目录当前为空,预留未来扩展。
使用方法
使用者可直接利用steps.csv中按run_id分组的步骤序列,复现代理在每一轮游戏中的完整决策轨迹,并结合episodes.csv中的回合级奖励、存活数等指标,评估不同模型或策略的宏观效能。适用于训练新的强化学习代理、对比不同基线策略的行为差异,或对代理的决策可解释性进行深入分析。数据加载时需注意steps.csv字段较多,建议按需选择关键列(如q_values、action、true_state)进行分析。模型权重(.pth文件)可直接加载至PyTorch环境,用于继续训练或行为克隆实验。
背景与挑战
背景概述
Team Alien Deluxe RL数据集创建于强化学习在复杂博弈场景中应用蓬勃发展的时期,由Harish和Karunya等研究人员主导构建。该数据集聚焦于外星主题的强化学习环境,核心研究问题涵盖智能体在动态不确定条件下的决策优化,尤其是在乘客运输与危机管理情境中的策略学习。通过记录游戏回合与决策步骤的详尽数据,该数据集为评估与比较不同强化学习基线模型的行为特性提供了标准化平台,推动了多智能体强化学习与序列决策领域的基准测试与可复现研究,对理解智能体在资源受限与信息不完整环境中的适应能力具有重要价值。
当前挑战
该数据集所面对的领域挑战主要在于强化学习环境中决策与奖励的稀疏性及状态空间的高维度,此问题使得智能体在大量无关或噪声信息中难以提取有效策略。构建过程中则面临数据收集与标注一致性的挑战,不同基线模型生成的episodes与steps数据格式庞杂且需对齐,维护大规模训练与评估结果的同时,还需保证各模型checkpoint的复现性与可解释性。此外,Deluxe游戏模式暂时空缺数据,新模式的引入将带来环境动态性的变化与状态表征的扩展需求,对数据集的结构扩展性与兼容性构成进一步挑战。
常用场景
经典使用场景
在强化学习研究领域中,Team Alien Deluxe RL Dataset为多智能体协作与决策建模提供了宝贵的数据基础。该数据集收录了基于不同基线智能体在基础游戏模式下生成的完整回合数据,包含约1000个回合的统计信息与约40000步的细粒度步骤记录。研究人员可据此分析智能体在复杂任务环境中的行为模式,例如探讨奖励函数设计、探索-利用权衡或状态表征学习对决策质量的影响。其结构化的观测变量与动作掩码等信息,尤其适合用于离线强化学习与逆强化学习的基准测试,助力算法鲁棒性与泛化能力的评估。
解决学术问题
该数据集直击强化学习研究中可复现性与透明性不足的痛点,通过公开完整的回合日志、步骤级决策记录及模型权重,为学术社区提供了标准化评估基准。它解决了多智能体系统中状态空间建模困难、动作约束模糊等关键问题,使得研究者能够系统性地剖析智能体在部分可观测环境下的推理过程。数据集中包含的载波概率、后验信念等指标,还促进了关于不确定性建模与风险评估的理论探索,推动了从单纯性能优化向可解释性强化学习范式的演进。
实际应用
在实际应用层面,该数据集可服务于游戏AI的反作弊系统开发,通过分析智能体的决策序列与异常行为模式,提升对非玩家角色操控的真实性检测能力。同时,其细粒度的状态与动作记录可直接用于训练医疗应急响应中的资源调度智能体,例如优化救护车派遣策略中健康与受伤人员的运载优先级。此外,数据集中的人形角色追踪与环境观测字段,为机器人导航与自主避障场景中的策略预训练提供了仿真验证平台。
数据集最近研究
最新研究方向
该数据集聚焦于强化学习在复杂决策环境中的应用,特别关注团队协作与不确定性管理的前沿方向。围绕'Team Alien'游戏场景,数据集通过精细的步骤级日志和奖励机制,为研究多智能体策略优化、部分可观测状态下的推理以及动态环境中的抗干扰能力提供了标准化基准。当前研究热点包括利用该数据集的基线模型探索迁移学习在游戏模式切换中的效果,以及通过载波概率推断与安全决策分析推动强化学习在实时策略领域的可解释性突破。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务