遇见数据集

CS2-10k

收藏
Hugging Face2026-06-26 更新2026-06-29 收录
官方服务:

资源简介:

CS2-10k是一个大规模、以自我为中心(第一人称视角)的《反恐精英2》游戏数据集,基于从HLTV网站获取的公开职业比赛演示构建。数据集包含超过60万个玩家回合视频,总计超过1万小时的第一人称游戏画面,视频以720p分辨率和48帧每秒渲染。每个视频都配有精确同步的逐帧注释数据,存储为.parquet文件。注释分为两个层次:剪辑级元数据(包括地图名称、回合编号、玩家队伍、总帧数、帧率、时长和视野)和逐帧注释(记录玩家的按键操作、相机视角增量、三维坐标以及偏航角和俯仰角)。该数据集适用于需要第一人称视角时序行为数据的研究任务,如世界模型构建、模仿学习、动作预测、游戏AI智能体训练和计算机视觉中的以自我为中心的视频理解,采用CC BY-NC 4.0许可证发布,仅供研究用途。

CS2-10k is a large-scale, egocentric (first-person perspective) dataset for the game Counter-Strike 2, constructed using public professional match demos obtained from the HLTV website. The dataset contains over 600,000 player round videos, totaling more than 10,000 hours of first-person in-game footage rendered at 720p resolution and 48 frames per second. Each video is paired with precisely synchronized frame-by-frame annotation data stored in .parquet files. The annotations are split into two tiers: clip-level metadata (including map name, round number, player team, total frame count, frame rate, duration, and field of view) and frame-by-frame annotations, which record the player's input actions, camera view delta, three-dimensional coordinates, as well as yaw and pitch angles. This dataset is applicable to research tasks requiring first-person temporal behavioral data, such as world model construction, imitation learning, action prediction, game AI Agent training, and egocentric video understanding in computer vision. It is released under the CC BY-NC 4.0 license for research use only.

创建时间:
2026-06-24
搜集汇总
数据集介绍
CS2-10k 数据集图片
构建方式
CS2-10k数据集源自HLTV平台收录的公开职业比赛录像,通过CS2内置的演示回放工具,以720p分辨率、48帧每秒的规格渲染每位玩家在每个回合中的第一人称视角视频,生成超过60万条玩家回合级视频片段。每条视频均与一个.parquet格式的注释文件配对,该文件以帧级别记录键盘按键状态、鼠标移动量以及三维空间中的玩家轨迹。数据集以WebDataset格式发布,将样本打包为约2GB的.tar分片文件,并附带顶层index.parquet索引,便于按图名等条件进行检索与过滤。
特点
该数据集规模宏大,涵盖超过10,000小时、60万条以上的第一人称游戏视频,在电子竞技领域的研究中实属罕见。每一帧均同步标注了包括WASD移动、跳跃、下蹲、开火等在内的离散动作向量,以及与视角变化对应的鼠标X/Y增量,还有玩家在游戏世界坐标系中的精确位置和朝向角度。这些密集的时序标注为实现基于视觉的世界模型、模仿学习以及动作预测等前沿任务提供了高度对齐且丰富的数据基础。此外,视频与注释以WebDataset格式高效组织,便于大规模分布式训练与数据流式读取。
使用方法
用户可通过HuggingFace Datasets库直接加载CS2-10k,默认配置指向data目录下所有.tar分片文件,支持按split划分读取。每个样本由唯一的UUID标识,包含一个.mp4视频文件及其对应的.parquet注释文件。使用时,首先利用顶层index.parquet进行元数据筛选,例如按地图名称或回合编号定位所需片段,而后通过WebDataset工具解包并流式加载视频帧与相应的帧级注释。注释中的actions字段为紧凑编码的按键序列,mouse_x_delta与mouse_y_delta提供连续的控制信号,position与rotation字段则可用于重建玩家的完整运动轨迹。
背景与挑战
背景概述
在人工智能与游戏交互领域,从第一人称视角理解玩家行为并预测其操作序列,是实现智能体模仿学习与世界模型构建的关键任务。CS2-10k数据集由Reka AI于2026年创建,源自《反恐精英2》职业比赛的高质量演示文件,包含超过60万段玩家回合视频,总时长逾一万小时。该数据集以720p分辨率、48帧/秒的帧率渲染每名选手的第一人称视角,并详细标注了键盘按键、鼠标移动以及三维空间轨迹等逐帧信息。作为目前规模最大的自我中心视角游戏数据集之一,CS2-10k为动作预测、世界模型训练以及行为克隆等研究提供了前所未有的基准资源,显著推动了人类行为建模与游戏智能体的发展。
当前挑战
CS2-10k致力于解决多维度感知与预测的领域难题:传统模型难以在动态、高实时性的第一人称场景中同时精确预测离散按键状态与连续视角变化,而本数据集通过提供对齐的逐帧动作与传感器数据,为端到端模仿学习开辟了新路径。在构建过程中,数据采集面临两大挑战:一是职业比赛演示使用专有回放工具渲染,需确保视频与标注文件在48帧/秒下的严格同步;二是海量原始数据(超2TB)需要高效分片与索引,采用WebDataset格式组织为约2GB的tar分片,并借助顶层Parquet索引实现快速检索与过滤,从而平衡存储效率与访问性能。
常用场景
经典使用场景
CS2-10k数据集为构建第一人称射击游戏中的具身智能体提供了高质量的训练素材。研究者可基于其60万段职业比赛录像及逐帧标注的键盘状态、鼠标移动与三维轨迹信息,训练能够理解复杂游戏环境的模仿学习模型。该数据集特别适合用于动作预测与决策序列建模,通过将视频帧与动作标签对齐,模型可学习从视觉输入到操作输出的映射关系,从而在虚拟环境中实现类人的战术行为。
解决学术问题
CS2-10k解决了大规模第一人称视角行为数据稀缺的学术难题。传统游戏数据集往往规模有限或缺乏精细的逐帧控制信号,难以支撑对复杂多智能体交互策略的深度研究。该数据集以超过一万小时的职业比赛录像填补了这一空白,使研究者能够系统性探索人类玩家的空间导航、目标追踪与协同决策机制,推动了具身智能、行为克隆与世界模型等方向的理论验证与方法创新。
衍生相关工作
CS2-10k的发布催生了多项衍生研究工作。基于其逐帧动作标注,研究者已探索将视觉Transformer与因果编码器结合用于离线强化学习预训练,提升了模型应对长时序依赖任务的能力。同时,该数据集在训练世界模型方面展现出潜力,例如通过预测未来帧与动作空间分布来模拟游戏动态,为无需环境交互的策略优化提供了新范式。此外,跨场景零样本迁移研究亦借力该数据集在多样地图与回合配置上的覆盖优势。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务