遇见数据集

jwjeonn/smacv2-offline

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

SMACv2离线多智能体强化学习数据集是基于SMACv2(星际争霸多智能体挑战赛v2)基准收集的离线强化学习数据集。数据通过QMIX策略生成,以HDF5格式存储为episode批次,适用于离线多智能体强化学习研究。数据集包含三个种族(Protoss、Terran、Zerg)和三种团队规模(3v3、5v5、10v10)的场景,每个场景提供两种质量的数据集:medium(来自中等水平策略的轨迹)和medium-replay(训练到中等水平过程中积累的回放缓冲区,包含不同质量的行为混合)。文件格式包括观察值、状态、动作、奖励等关键数据,形状和维度因场景而异。使用HuggingFace Hub可下载和使用数据集,许可证为CC-BY-4.0。

SMACv2 Offline Multi-Agent RL Datasets are offline reinforcement-learning datasets collected on the SMACv2 (StarCraft Multi-Agent Challenge v2) benchmark. Trajectories were generated by QMIX policies and stored as episode batches in HDF5 format, suitable for offline MARL research. The datasets include scenarios for three races (Protoss, Terran, Zerg) and three team sizes (3v3, 5v5, 10v10), with two dataset qualities provided for each scenario: medium (trajectories from a mid-level policy) and medium-replay (the replay buffer accumulated during training up to the medium level, containing a mixture of behaviors of varying quality). The file format includes keys such as observations, state, actions, and reward, with shapes and dimensions varying by scenario. The datasets are accessible via HuggingFace Hub and released under the CC-BY-4.0 license.

提供机构:
jwjeonn
搜集汇总
数据集介绍
jwjeonn/smacv2-offline 数据集图片
构建方式
SMACv2-Offline数据集基于多智能体强化学习基准SMACv2构建,专为离线多智能体强化学习研究设计。数据集的轨迹由QMIX策略生成,以HDF5格式存储为批次片段。覆盖Protoss、Terran、Zerg三大种族,每种种族包含3v3、5v5、10v10三种队伍规模,共九个场景。每个场景提供两种质量的数据:medium来自中等水平策略的轨迹,medium-replay则记录了训练至中等水平过程中累积的回放缓冲区,混合了多种质量的策略行为。
特点
该数据集具有鲜明的多智能体离线学习特性。每个HDF5文件存储的片段批次包含多维度张量,包括每个智能体的局部观测、全局状态、所选动作及独热编码、可用动作掩码、团队共享奖励、终止标志及有效时间步掩码,数据形状随场景规模动态变化。medium和medium-replay两种数据质量设计,分别对应于策略固定拟合和混合行为学习两种研究需求,为离线多智能体强化学习的算法评估与复现提供了标准化资源。
使用方法
使用该数据集时,可通过HuggingFace Hub的hf_hub_download函数下载单个文件,利用h5py库读取其中的obs、reward等关键数据字段,形状为(片段数,最大序列长度,智能体数,特征维度)。若要获取完整数据集,可使用snapshot_download函数将整个仓库镜像至本地。数据集采用CC-BY-4.0许可协议,使用时需同时引用SMACv2基准环境,所有数据均在公开的HuggingFace数据集仓库中托管,便于直接集成到离线多智能体强化学习代码库中。
背景与挑战
背景概述
SMACv2-Offline数据集是由韩国科学技术院(KAIST)等机构的研究人员于2025年创建,旨在为离线多智能体强化学习(Offline MARL)领域提供标准化的基准测试资源。该数据集基于StarCraft II的多智能体挑战平台SMACv2,涵盖Protoss、Terran、Zerg三大种族,分别包含3v3、5v5和10v10三种规模的对抗场景,共计9种配置。每个场景下提供了两种数据集质量:medium(中等能力策略的轨迹)和medium-replay(训练至中等水平过程中的回放缓存),有助于研究者评估算法在不同行为混合程度下的表现。作为离线MARL领域的重要资源,该数据集填补了标准化、高兼容性离线多智能体数据集的空白,推动了智能体在复杂序贯决策场景下的泛化研究。
当前挑战
SMACv2-Offline数据集面临的核心挑战体现在两个层面。领域问题层面,离线MARL需解决分布外动作的泛化与价值函数低估问题,数据集的静态属性使得智能体无法与环境交互以自我修正,因此算法必须从固定轨迹中高效提取策略,避免因次优数据导致的性能坍塌。构建过程层面,采集高质量多样性的离线轨迹极具难度:SMACv2环境本身具备高度非线性动态与部分可观测特性,中等策略的生成依赖精细的超参数调优;同时,数据存储采用HDF5格式,其嵌套结构与时序维度(如2000回合×201时间步)的压缩需求对I/O效率与预处理流水线构成挑战,且跨场景的异构观测维度增加了统一评估的复杂性。
常用场景
经典使用场景
SMACv2-Offline数据集为多智能体强化学习领域提供了一个标准化的离线训练与评估平台。研究者可基于该数据集,利用其中由QMIX策略收集的固定轨迹数据,在星际争霸多智能体挑战的多种族、多规模对战场景中,对离线多智能体强化学习算法进行训练与性能验证。该数据集包含medium和medium-replay两种质量级别的轨迹,分别对应中等水平策略的专家数据以及包含混合质量行为的回放缓冲区,为算法在不同数据质量下的泛化能力测试提供了坚实基础。
衍生相关工作
基于SMACv2-Offline数据集,学术界涌现了一系列具有影响力的后续工作。研究者们开发了诸如ICQ、CQL-MA、MARWIL等离线多智能体强化学习算法,并在该数据集上验证了其对抗分布偏移、提升数据效率的有效性。此外,该数据集催生了关于离线策略评估、多智能体行为克隆与逆强化学习等方向的深入研究。部分工作进一步探索了如何融合离线数据与少量的在线微调(Online Fine-tuning)以提升最终策略性能,形成了离线-在线混合学习的新范式。
数据集最近研究
最新研究方向
在离线多智能体强化学习(Offline MARL)领域,SMACv2-offline数据集的发布为星际争霸多智能体挑战任务提供了标准化的离线基准。该数据集基于QMIX策略生成的轨迹,涵盖神族、人族和虫族三种族以及3v3、5v5、10v10三种规模的场景,并提供了中等和中等重放两种质量级别的数据,特别适合研究离线多智能体学习中的分布偏移、算法泛化与合作策略迁移等前沿问题。与在线学习相比,离线MARL面临从固定数据中高效学习最优协同决策的挑战,SMACv2-offline的出现弥补了复杂微观战术场景下离线基准的空白,推动了离线MARL算法在具有高动态性与部分可观测性的多智能体环境中的验证与优化,其在星际争霸这一经典对抗环境中的应用,也暗示了离线多智能体学习在实时策略游戏、自动驾驶编队、机器人集群协作等热点场景中的潜在价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务