遇见数据集

RekaAI/CS2-10k

收藏
Hugging Face2026-06-29 更新2026-07-22 收录
官方服务:

资源简介:

CS2-10k是一个大规模的第一人称视角游戏数据集,构建自专业的《反恐精英2》(CS2)比赛。它包含60万+玩家回合视频,覆盖1万+小时的第一人称镜头,并配有逐帧注释,涵盖键盘状态、鼠标移动和3D玩家轨迹。数据集从HLTV的公开专业比赛演示中构建,使用CS2内的演示回放工具以720p、48 fps渲染第一人称视频,每个玩家每回合生成一个视频。每个视频附带一个.parquet文件,包含与视频时间线同步的逐帧注释。数据集以WebDataset格式发布:数据/<地图>/目录下包含约2GB的tar分片,每个样本是一个<uuid>.mp4视频及其<uuid>.parquet注释。顶层index.parquet文件列出了每个剪辑及其分片位置,用于查找和过滤。

CS2-10k is a large-scale egocentric gameplay dataset built from professional CS2 matches. It contains 600,000+ player-round videos spanning 10,000+ hours of first-person footage, paired with per-frame annotations covering keyboard state, mouse movement, and 3D player trajectory. CS2-10k is built from public professional match demos sourced from HLTV. For each demo, we render first-person video at 720p, 48 fps using the demo replay tool inside CS2, producing one video per player per round. Alongside each video, we store a .parquet file containing per-frame annotations synchronized to the video timeline. The dataset is published in WebDataset format: ~2 GB tar shards under data/<map>/, where each sample is a <uuid>.mp4 video paired with its <uuid>.parquet annotations. A top-level index.parquet lists every clip with its shard location for lookup and filtering.

提供机构:
RekaAI
搜集汇总
数据集介绍
RekaAI/CS2-10k 数据集图片
构建方式
CS2-10k数据集源自公开的职业比赛录制文件,经由HLTV平台获取,并利用CS2内置的演示回放工具,为每位选手的每一回合渲染出720p分辨率、48帧每秒的第一人称视频。每个视频片段均与一个包含逐帧标注的.parquet文件配对,确保数据同步。数据集采用WebDataset格式进行封装,将约2GB的tar分片存储于data/目录下,每个样本由UUID命名的视频和标注文件构成,并通过顶层的index.parquet文件索引所有片段,便于检索与过滤。
特点
该数据集规模宏大,涵盖超过60万个选手回合视频,总时长逾一万小时,提供了海量的第一人称视角游素材。其独特之处在于每帧都附有详尽的标注,包括键盘按键状态(如W/A/S/D移动、跳跃、蹲伏等)、鼠标移动的水平和垂直增量,以及三维空间中的玩家轨迹、视角偏航角和俯仰角,为行为建模与预测研究提供了坚实的数据基础。
使用方法
使用者可直接通过HuggingFace平台访问数据集,利用WebDataset库高效加载tar分片中的视频与标注文件。数据集的索引文件index.parquet支持基于地图、回合等维度的快速筛选。在研究中,可提取逐帧的键盘动作、鼠标delta和位置信息,用于训练模仿学习、动作预测或世界模型,也可将视频与标注对齐,开展第一人称视觉理解等任务。数据集遵循CC BY-NC 4.0许可,仅限非商业研究用途。
背景与挑战
背景概述
随着电子竞技与人工智能的交叉研究日益深入,从复杂的第一人称射击游戏中提取结构化知识以训练智能体,成为具身智能与模仿学习领域的重要前沿。2026年,Reka AI团队发布了CS2-10k数据集,该数据集源自《反恐精英2》职业比赛的公开录像,经由HLTV平台收集并利用游戏内置回放工具渲染,构建出超过60万段玩家回合视频,总时长逾一万小时。每段视频均以720p分辨率、48帧每秒的高帧率记录,并同步提供逐帧的键盘状态、鼠标移动轨迹与三维坐标位置等精确标注。这一大规模、高精度的自中心视角数据集,为研究人类专家在动态对抗环境中的策略行为、感知动作耦合机制,以及开发具有类人决策能力的游戏智能体提供了坚实的数据基础,显著推动了世界模型与行为克隆等方向的研究进程。
当前挑战
CS2-10k数据集的构建与运用面临多重挑战。首先,在第一人称射击游戏这一复杂动态场景中,智能体需处理高维视觉输入与连续的鼠标键盘动作流,传统方法难以捕捉人类专家在瞬间决策中蕴含的战术意图与长程规划,这成为动作预测与模仿学习领域的核心难题。其次,数据构建过程中,职业比赛录像的原始格式与游戏版本差异导致渲染参数需精心调校,以保证视频帧与注释数据毫秒级同步;从回放工具中提取每帧的鼠标增量、按键组合与三维坐标,涉及对游戏引擎接口的深度逆向分析与大量自动化脚本的编写。此外,近20TB的原始视频数据如何高效编码、分片存储并以WebDataset格式发布,以及在不引入伪影的前提下压缩为约2GB的分片文件,均对工程实施提出了严苛要求。最终,非商业许可的限定亦平衡了学术开放与原始内容版权之间的张力。
常用场景
经典使用场景
在游戏人工智能与具身智能研究领域,CS2-10k凭借其海量的第一人称视角视频与细粒度的逐帧动作标注,成为构建世界模型与模仿学习系统的基石。研究人员可借助该数据集训练智能体,使其通过观察专业玩家的键盘鼠标操作与三维轨迹,习得复杂的战术决策与精细操控能力。数据集包含超过60万个玩家回合视频,覆盖10,000小时的职业比赛实况,为从视觉输入直接预测动作序列提供了丰富且标准化的训练素材,尤其适用于需要理解长程时序依赖与多智能体协作的竞技场景建模。
解决学术问题
该数据集有效突破了以往游戏数据集规模小、标注粗糙、场景单一的局限,解决了从高维视觉观测中学习连续控制策略的学术难题。CS2-10k提供的同步动作标签(如移动、跳跃、瞄准)与精确的鼠标增量信号,使得研究者能够探索动作预测、逆强化学习以及离线策略优化等核心问题。其开放的职业比赛数据来源确保了行为的专业性与多样性,为评估模仿学习算法的泛化能力与鲁棒性建立了标准化基准,推动了具身智能体在复杂动态环境中决策能力的前沿研究。
衍生相关工作
源于CS2-10k的丰富标注与大规模特性,学术界已涌现出多项经典衍生工作,包括基于Transformer的视觉-动作联合预测模型、面向FPS游戏的离线强化学习算法,以及探索多智能体通信与协作策略的仿真环境。研究者还以此数据集为训练源,开发了能够从视频中提取结构化行为图谱的表示学习方法,并进一步衍生出面向游戏内作弊检测与行为分析的应用框架。这些工作不仅拓展了数据集本身的使用边界,也为构建更通用的视觉决策系统奠定了方法论基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务