遇见数据集

gameplayer-data

收藏
Hugging Face2026-08-20 更新2026-08-21 收录
官方服务:

资源简介:

GamePlayer V16 Broad EventChunk-SFT 是一个用于事件驱动控制(EventChunk-FPS)研究的视觉-语言-动作数据集。训练集包含1,351,283条对话记录(10,677,608个有效助手轮次),验证集包含73,980条对话记录(586,786个有效助手轮次),总计1,425,263条记录和11,264,394个图像/动作监督轮次。数据来自OpenP2P、CrossFPS、CS2、Gaming500以及少量的ViZDoom成功锚点集,其中大部分条目来自OpenP2P,类别分布不平衡。每条记录采用ShareGPT风格的多轮对话格式,图像路径为仓库相对路径,助手轮次包含严格的动态动作块DSL(如<p>和<a>标签)。动作时间跨度包括8、12、16或24个原子动作,环境在生成期间暂停,每个动作块执行一次。该数据集是V16系列的历史归档版本,用于训练发布,并非V31因果统一开发集。下游用户须遵守所有源数据集及适用游戏发行商的政策,保留上游归属,不得代表V31训练集。

GamePlayer V16 Broad EventChunk-SFT is a vision-language-action dataset for event-driven control (EventChunk-FPS) research. The training set contains 1,351,283 conversation records (10,677,608 valid assistant turns), and the validation set contains 73,980 conversation records (586,786 valid assistant turns), totaling 1,425,263 records and 11,264,394 image/action supervision turns. The data comes from OpenP2P, CrossFPS, CS2, Gaming500, and a small number of ViZDoom success anchor sets, with most entries from OpenP2P and imbalanced class distribution. Each record adopts the ShareGPT-style multi-turn conversation format, with image paths as repository-relative paths, and assistant turns contain strict dynamic action block DSL (e.g., <p> and <a> tags). The action time span includes 8, 12, 16, or 24 atomic actions, the environment is paused during generation, and each action block is executed once. This dataset is a historical archive version of the V16 series for training release, not the V31 causal unified development set. Downstream users must comply with all source datasets and applicable game publisher policies, retain upstream attribution, and not represent the V31 training set.

创建时间:
2026-08-19
原始信息汇总

数据集概述

数据集名称:GamePlayer V16 Broad EventChunk-SFT

语言:英语(en)

标签:视觉-语言-动作(vision-language-action)、游戏代理(gaming-agent)、第一人称射击(fps)、动作分块(action-chunk)、事件驱动控制(event-driven-control)

许可证:其他(other)


数据集内容

  • 训练集:1,351,283 条对话记录,10,677,608 个有效助手轮次。
  • 验证集:73,980 条对话记录,586,786 个有效助手轮次。
  • 总计:1,425,263 条记录,11,264,394 个图像/动作监督轮次。
  • 轨迹组:训练集 23,509 个,验证集 1,359 个;训练/验证轨迹重叠为零,缺失图像路径为零。
  • 动作视野(Action Horizons):8、12、16 或 24 个原子动作;环境在生成期间暂停,每个分块执行一次。

数据来源

数据来自以下来源的混合:

  • OpenP2P(占比最大)
  • CrossFPS
  • CS2
  • Gaming500
  • 小规模 ViZDoom 成功锚点集

该混合设计为宽泛但不均衡,大部分数据来自 OpenP2P。具体来源和游戏数量详见 sft_v16_scale100_mixture.manifest.jsonvalidation.json


数据布局

  • JSONL 文件位于 game/research/formal/artifacts/v16_scales/sft_v16_scale100_mixture/
  • 图像引用为仓库相对路径,根目录为 game/research/formal/
  • 完整发布存储在 archives/ 目录下,为未压缩的 tar 分片及 SHA256SUMS 校验文件,避免创建大量单独对象。
  • 使用前需校验校验和并解压所有分片,例如在数据集检查目录下执行 for f in archives/*.tar; do tar -xf "$f"; done,以重建原始目录布局,确保 images 路径可解析。

数据格式

  • 行格式:ShareGPT 风格的多轮对话。
  • images 字段包含每个决策对应的 RGB 图像路径。
  • 每个助手轮次包含严格的“动作分块 DSL”格式: text <p>m=... h=... i=...</p> <a>k=... x=... y=... l=... r=... m=...</a> ... <eoc>

来源与使用注意事项

  • 数据包含来自多个源数据集和视频游戏衍生的游戏媒体。
  • 下游用户必须遵守每个源数据集的条款及适用游戏发行商的政策。
  • 此数据集卡不授予游戏资产所有权,也不放弃第三方权利。
  • 在重新分发衍生材料时,必须保留上游归属。
  • 该 V16 标签契约早于更严格的 V31 因果数据门控,不应与 V31 结果混用或作为 V31 训练集。

其他说明

  • 该数据集是 EventChunk-FPS 研究系列中的冻结 V16 广泛多游戏 SFT 混合版本,属于存档性训练发布,不代表当前基准结果。
搜集汇总
数据集介绍
gameplayer-data 数据集图片
构建方式
在视觉-语言-动作(VLA)与游戏智能体研究领域,高质量、大规模的多模态行为数据是训练通用决策模型的关键基石。GamePlayer-1.4M的构建遵循事件驱动的动作分块范式,从OpenP2P、CrossFPS、CS2、Gaming500等公开游戏数据集中抽取帧序列,并补充少量ViZDoom成功锚点样本。所有样本经统一编码为ShareGPT风格多轮对话,每个决策步对应一帧RGB图像,助手回复被严格约束为动作块DSL,涵盖移动、视角、射击等原子操作的组合。数据集总计142万余条对话行,包含1126万余个图像-动作监督回合,划分出23509个训练轨迹组与1359个验证轨迹组,且训练与验证之间无轨迹重叠,图像路径完整无缺失。
使用方法
使用GamePlayer-1.4M时,研究者应遵循其多轮对话与动作分块格式进行模型训练或评估。每条样本包含图像路径列表与对应的助手动作块序列,模型需以图像为条件,自回归地生成严格DSL格式的动作块。训练时可依据动作视野(8/12/16/24)配置预测窗口,并利用<eoc>标记控制块边界。验证时应按轨迹组划分,避免与训练轨迹重叠,以评估跨轨迹泛化能力。由于数据集仅提供编码帧,原始视频需从OpenP2P、CrossFPS等源仓库获取。元数据文件sft_v16_scale100_mixture.manifest.json与validation.json可用于溯源与统计。该数据集适用于视觉-语言-动作模型、游戏智能体及事件驱动控制策略的研究。
背景与挑战
背景概述
视觉-语言-动作模型在游戏智能体领域的兴起,对大规模、多游戏、细粒度动作监督数据提出了迫切需求。GamePlayer-1.4M数据集于2024年前后由EventChunk-FPS研究团队构建,整合了OpenP2P、CrossFPS、CS2、Gaming500及自建ViZDoom成功锚点集等多个来源,旨在为第一人称射击游戏中的事件驱动控制提供标准化监督信号。该数据集包含约142万轮对话、1126万条图像/动作监督样本,覆盖23,509个训练轨迹组和1,359个验证轨迹组,动作视界涵盖8至24个原子动作,成为当前游戏智能体研究中规模与多样性兼具的重要资源,推动了视觉-语言-动作范式在复杂交互环境中的落地。
当前挑战
该数据集所应对的核心领域问题在于,如何让智能体在动态、部分可观测的第一人称射击环境中,依据视觉输入与语言指令生成时序连贯且语义合理的原子动作序列,这要求模型同时具备细粒度空间感知、长程规划与实时决策能力。其构建过程亦面临多重挑战:多源异构数据在帧率、分辨率、动作语义及标注规范上存在显著差异,需设计统一的动作块DSL与轨迹分组策略以实现跨游戏对齐;确保训练与验证轨迹零重叠及图像路径完整无缺,对数据清洗与元数据管理提出严苛要求;动作视界的多尺度设定还需平衡监督密度与计算开销,以支撑事件驱动控制范式的有效训练与泛化评估。
常用场景
经典使用场景
在视觉-语言-动作(Vision-Language-Action, VLA)模型的研究中,GamePlayer-1.4M数据集为第一人称射击游戏(FPS)智能体的行为克隆与序列决策建模提供了大规模、多游戏混合的监督微调(SFT)资源。其经典使用场景聚焦于训练模型依据当前游戏画面与历史交互,生成以动作块(action-chunk)为单位的连续控制指令,涵盖移动、视角调整、射击等原子操作的组合预测。数据集严格的多轮对话格式与动作序列领域特定语言(DSL)标注,使模型能够学习长时程动作依赖与事件驱动的控制策略,成为评估FPS智能体感知-决策-执行闭环能力的基准平台。
解决学术问题
该数据集直面游戏智能体研究中长期存在的泛化性不足与长时程动作建模困难两大核心挑战。通过整合OpenP2P、CrossFPS、CS2、Gaming500等多个来源的异质游戏轨迹,并引入成功率锚点样本,GamePlayer-1.4M有效缓解了单一游戏环境导致的过拟合问题,为跨游戏策略迁移提供了数据基础。其动作块设计(动作视界8至24个原子动作)解决了逐步动作预测中误差累积与决策频率失配的痼疾,使得模型能够输出语义连贯的行为片段。该数据集为零样本游戏适应、多模态指令跟随等前沿课题提供了标准化评测条件,推动了游戏智能体从封闭环境向开放世界泛化的研究进程。
实际应用
GamePlayer-1.4M的实际应用场景广泛覆盖游戏AI开发、自动化测试与交互式内容生成等领域。在游戏产业中,该数据集可用于训练具备拟人化操作风格的NPC或陪玩智能体,提升玩家体验;在自动化测试环节,基于该数据微调的模型能够模拟真实玩家行为,执行回归测试与漏洞挖掘任务。此外,该数据集支持构建通用游戏助手,通过自然语言指令完成复杂游戏任务,降低新手上手门槛。其多游戏混合特性亦为跨平台游戏AI的部署提供了数据支撑,使得单一模型能够适应不同游戏的控制语义与视觉风格,显著降低特定游戏定制化开发成本。
数据集最近研究
最新研究方向
在视觉-语言-动作模型向交互式决策领域纵深演进的背景下,GamePlayer-1.4M作为EventChunk-FPS研究谱系的冻结型多游戏监督微调混合数据集,正推动以动作分块与事件驱动控制为核心的前沿探索。该数据集汇聚OpenP2P、CrossFPS、CS2及Gaming500等多元第一人称射击环境,构建逾一百四十万轮对话与千万级图-动作监督信号,其8至24步原子动作预测视野为长时程决策建模提供了关键支撑。当前研究聚焦于跨越异构游戏分布的动作序列泛化与轨迹一致性,力求突破单一场景过拟合瓶颈,进而为通用游戏智能体的可扩展训练范式奠定数据基石,对交互式具身智能的评测标准与社区基准建设具有深远影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务