gameplayer-data
收藏资源简介:
GamePlayer V16 Broad EventChunk-SFT 是一个用于事件驱动控制(EventChunk-FPS)研究的视觉-语言-动作数据集。训练集包含1,351,283条对话记录(10,677,608个有效助手轮次),验证集包含73,980条对话记录(586,786个有效助手轮次),总计1,425,263条记录和11,264,394个图像/动作监督轮次。数据来自OpenP2P、CrossFPS、CS2、Gaming500以及少量的ViZDoom成功锚点集,其中大部分条目来自OpenP2P,类别分布不平衡。每条记录采用ShareGPT风格的多轮对话格式,图像路径为仓库相对路径,助手轮次包含严格的动态动作块DSL(如<p>和<a>标签)。动作时间跨度包括8、12、16或24个原子动作,环境在生成期间暂停,每个动作块执行一次。该数据集是V16系列的历史归档版本,用于训练发布,并非V31因果统一开发集。下游用户须遵守所有源数据集及适用游戏发行商的政策,保留上游归属,不得代表V31训练集。
GamePlayer V16 Broad EventChunk-SFT is a vision-language-action dataset for event-driven control (EventChunk-FPS) research. The training set contains 1,351,283 conversation records (10,677,608 valid assistant turns), and the validation set contains 73,980 conversation records (586,786 valid assistant turns), totaling 1,425,263 records and 11,264,394 image/action supervision turns. The data comes from OpenP2P, CrossFPS, CS2, Gaming500, and a small number of ViZDoom success anchor sets, with most entries from OpenP2P and imbalanced class distribution. Each record adopts the ShareGPT-style multi-turn conversation format, with image paths as repository-relative paths, and assistant turns contain strict dynamic action block DSL (e.g., <p> and <a> tags). The action time span includes 8, 12, 16, or 24 atomic actions, the environment is paused during generation, and each action block is executed once. This dataset is a historical archive version of the V16 series for training release, not the V31 causal unified development set. Downstream users must comply with all source datasets and applicable game publisher policies, retain upstream attribution, and not represent the V31 training set.
数据集概述
数据集名称:GamePlayer V16 Broad EventChunk-SFT
语言:英语(en)
标签:视觉-语言-动作(vision-language-action)、游戏代理(gaming-agent)、第一人称射击(fps)、动作分块(action-chunk)、事件驱动控制(event-driven-control)
许可证:其他(other)
数据集内容
- 训练集:1,351,283 条对话记录,10,677,608 个有效助手轮次。
- 验证集:73,980 条对话记录,586,786 个有效助手轮次。
- 总计:1,425,263 条记录,11,264,394 个图像/动作监督轮次。
- 轨迹组:训练集 23,509 个,验证集 1,359 个;训练/验证轨迹重叠为零,缺失图像路径为零。
- 动作视野(Action Horizons):8、12、16 或 24 个原子动作;环境在生成期间暂停,每个分块执行一次。
数据来源
数据来自以下来源的混合:
- OpenP2P(占比最大)
- CrossFPS
- CS2
- Gaming500
- 小规模 ViZDoom 成功锚点集
该混合设计为宽泛但不均衡,大部分数据来自 OpenP2P。具体来源和游戏数量详见 sft_v16_scale100_mixture.manifest.json 和 validation.json。
数据布局
- JSONL 文件位于
game/research/formal/artifacts/v16_scales/sft_v16_scale100_mixture/。 - 图像引用为仓库相对路径,根目录为
game/research/formal/。 - 完整发布存储在
archives/目录下,为未压缩的 tar 分片及SHA256SUMS校验文件,避免创建大量单独对象。 - 使用前需校验校验和并解压所有分片,例如在数据集检查目录下执行
for f in archives/*.tar; do tar -xf "$f"; done,以重建原始目录布局,确保images路径可解析。
数据格式
- 行格式:ShareGPT 风格的多轮对话。
images字段包含每个决策对应的 RGB 图像路径。- 每个助手轮次包含严格的“动作分块 DSL”格式: text <p>m=... h=... i=...</p> <a>k=... x=... y=... l=... r=... m=...</a> ... <eoc>
来源与使用注意事项
- 数据包含来自多个源数据集和视频游戏衍生的游戏媒体。
- 下游用户必须遵守每个源数据集的条款及适用游戏发行商的政策。
- 此数据集卡不授予游戏资产所有权,也不放弃第三方权利。
- 在重新分发衍生材料时,必须保留上游归属。
- 该 V16 标签契约早于更严格的 V31 因果数据门控,不应与 V31 结果混用或作为 V31 训练集。
其他说明
- 该数据集是 EventChunk-FPS 研究系列中的冻结 V16 广泛多游戏 SFT 混合版本,属于存档性训练发布,不代表当前基准结果。




