遇见数据集

EgoCS-400K

收藏
github2026-06-17 更新2026-06-18 收录
数据链接:
官方服务:

资源简介:

EgoCS-400K是一个大规模以自我为中心的游戏数据集,包含同步视频、回放遥测数据、动作链、片段和多粒度字幕。它结合了第一人称游戏视频、每帧游戏状态、键盘/鼠标输入、原子动作、保护动作链、基于动态规划的时间片段以及多粒度视频语言字幕,旨在为世界模型提供支持。

EgoCS-400K is a large-scale ego-centric gaming dataset that comprises synchronized videos, playback telemetry data, action chains, temporal segments, and multi-granularity subtitles. It incorporates first-person gaming videos, per-frame game states, keyboard and mouse inputs, atomic actions, protected action chains, dynamic programming-based temporal segments, and multi-granularity video-language subtitles, with the objective of supporting world models.

创建时间:
2026-06-17
原始信息汇总

🎮 EgoCS-400K:一个面向世界模型的自我中心游戏数据集

一个大规模的第一人称CS数据集,包含同步视频、回放遥测、动作链、片段和字幕。

📖 概述

EgoCS-400K 将第一人称游戏视频与以下数据对齐:

  • 从演示文件导出的逐帧遥测数据
  • 键盘/鼠标输入
  • 原子动作
  • 受保护的动作链
  • 基于动态规划的时序片段
  • 多粒度视频-语言字幕
规模维度 数值
游戏视频时长 10,000+ 小时
回合级轨迹 40,000+ 回合
地图数量 13 张(CSGO/CS2 场景)
每回合视角 10 位玩家
注释类型 6 种(从帧到字幕)

✨ 核心特点

  • 🎥 回放驱动的视频:第一人称视频与每帧的相机、空间、武器、玩家、回合和事件状态对齐。
  • ⌨️ 控制级痕迹:细粒度的键盘和鼠标输入,包括移动、开火、换弹、检视和瞄准。
  • 🧩 多级注释:涵盖逐帧状态、原子动作、受保护链、片段和完整序列的层级结构。
  • 🧮 动作感知分割:动态规划算法生成模型就绪的剪辑,同时不破坏有意义的动作链。
  • 🔍 质量感知过滤:视觉、空间和动作信号用于移除无效渲染和低信息片段。
  • 🤖 视觉语言模型就绪与交互式:结构化字幕上下文,以及用于检查视频、时间线、动作和片段的查看器。

🧩 数据集组成

多粒度组成

层级 含义 典型监督任务
玩家视角序列 完整的第一人称回合/玩家轨迹 长视频理解、玩家行为建模
连贯片段 具有稳定时间边界的模型就绪剪辑 片段字幕、检索、视频-语言对齐
受保护动作链 不应被分割的动作组 动作感知分割、长动作建模
原子回放动作 开火、检视、换弹、切换、跳跃、投掷物、瞄准等 细粒度动作识别/定位
逐帧状态轨迹 32Hz 的移动、相机、输入、武器和玩家状态 基本的控制/动作分析与评估

🏗️ 数据构建

EgoCS-400K 从公开的回放文件构建为同步视频、结构化注释、过滤后的片段和多粒度字幕,完整的构建流程在专门的数据构建指南中详细介绍。

构建流程包括:演示文件收集 → 视频渲染 → 渲染视频过滤 → 逐帧注释 → 动态规划分割 → 空间/动作过滤 → 视觉语言模型字幕生成。

🗂️ 仓库布局

  • data/ — 包含导出的解析回合示例(CSV/JSON)和查看器资源
  • docs/ — 数据构建指南和 README 图片
  • pipeline/ — 包含演示解析、视频叠加渲染、动作时间线生成和查看器资源构建的代码
  • requirements.txt — Python 依赖项
  • .gitignore — 排除演示文件、视频和缓存

📝 引用

bibtex @misc{guo2026egocs400k, title={EgoCS-400K: An Egocentric Gameplay Dataset for World Models}, author={Guo, Rongjin and Liang, Dong and Liu, Yuhao and Liu, Fang and Huang, Tianyu and Hancke, Gerhard P. and Lau, Rynson W. H.}, year={2026}, note={Project page: https://EgoCS-400K.github.io} }

🔗 相关资源

  • 数据集查看器:https://huggingface.co/spaces/Cooler-Master/cs2-action-annotation-viewer-preview
  • 技术报告:https://arxiv.org/pdf/2606.18180
  • 代码仓库:https://github.com/egocs-400k/Dataset
  • 项目页面:https://egocs-400k.github.io/
搜集汇总
数据集介绍
EgoCS-400K 数据集图片
构建方式
EgoCS-400K的构建根植于对《反恐精英》公开对战录像(.dem文件)的系统化处理。首先,通过自研解析器从录像中提取每帧(每秒32次)的玩家状态、键盘鼠标输入、武器信息及环境数据,并同步渲染出第一人称视角视频。随后,基于动态时间规整与规则引擎,将连续的控制信号抽象为原子动作(如开火、换弹),并通过保护性动作链算法将不可分割的动作序列聚合为连贯片段。最后,利用视觉质量过滤、空间有效性筛查与动作信息密度评估,剔除无效渲染和低信息片段,形成高质量的样本集合。
特点
该数据集最显著的特征在于其多层次、结构化且高度对齐的标注体系。它不仅提供超过10,000小时的第一人称游戏视频,而且将视频与每帧的游戏状态、控制指令、原子动作时间线、保护性动作链及动态规划分割后的语义片段精确同步。此外,数据集还配备了多粒度视频语言描述,覆盖从整局行为到微观动作的语义层次,为世界模型、具身智能与视觉语言导航等研究提供了从低级控制到高级规划的全链条监督信号。
使用方法
研究者可通过Hugging Face平台直接下载EgoCS-400K的完整数据集与元数据。数据以JSONL与Parquet格式组织,便于直接接入深度学习框架。用户可依据自身需求灵活选择使用层级:针对细粒度动作识别,可直接访问原子动作标签与每帧状态轨迹;对于视频语言对齐与长视频理解,则可使用动态规划分割后的语义片段及其配对的描述文本。此外,项目提供了交互式数据集查看器与开源解析管线,支持研究者快速阅览样本、理解数据格式,并复现或扩展从原始录像到结构化标注的完整构建流程。
背景与挑战
背景概述
近年来,以自我为中心的视频理解与具身智能研究蓬勃发展,亟需大规模、多模态对齐的交互数据以支撑世界模型等前沿课题的突破。由郭荣进、梁栋等研究者在2026年提出的EgoCS-400K数据集,汇聚了来自反恐精英游戏(CSGO/CS2)的海量第一人称视角素材,包含超10000小时游戏视频、40000余回合轨迹,并在13张经典地图上由10位玩家采集而成。其核心贡献在于构建了像素级对齐的视觉-控制-动作-语义四维映射,将每帧视频与逐刻游戏状态、键盘鼠标输入、原子动作链、动态规划分割片段以及多粒度语言描述进行精密关联,为细粒度行为建模、长程交互理解与视频-语言联合学习提供了前所未有的基础资源,迅速成为相关领域的标杆性数据资产。
当前挑战
该数据集着力应对双重挑战。其一,在领域问题层面,现有数据集多聚焦于粗粒度动作分类或短时事件检测,难以支撑世界模型对连续控制信号、动作因果链条及长程行为语义的联合建模需求,而EgoCS-400K通过引入保护动作链与DP时序分割策略,在保持自然动作完整性的同时生成模型友好的片段,但如何从海量弱结构化的竞赛回放中自动提取精准的语义边界仍是关键难题。其二,在构建过程中,面对原始演示文件的异构格式、64赫兹高精度遥测数据的解析、渲染视频中无效帧的视觉-空间-动作质量过滤,以及基于视觉语言模型的多层级标题生成,均需设计复杂的流水线以平衡标注精度与扩展效率,确保十万级别样本的可靠产出。
常用场景
经典使用场景
在具身智能与视觉语言模型交叉的前沿领域,EgoCS-400K凭借其同步的第一人称游戏视频与逐刻遥测数据,成为构建世界模型(World Models)的经典基准。研究者利用该数据集训练模型学习玩家视角下的因果推理与行动规划,例如从键盘鼠标输入到原子动作(如射击、换弹、投掷手雷)的映射关系,以及动态环境变化(如敌方位置、武器状态)对决策的影响。其多层次标注体系——从逐刻状态轨迹到受保护动作链、再到动态规划分割的连贯片段——为时序理解任务提供了结构化监督,尤其适用于长视频中的行为建模与语言对齐。数据集覆盖超过10,000小时游戏视频、40,000余回合轨迹及13张地图场景,使得模型在复杂战术环境中进行泛化训练成为可能。
实际应用
在实际应用层面,EgoCS-400K促进了多个垂直领域的智能化变革。开发者利用其控制级遥测与视频对齐特性,可构建高性能游戏AI代理——通过强化学习或模仿学习训练战术决策模型,提升自动驾驶式游戏体验。其多级动作注释体系(如原子动作与保护链)直接赋能游戏内实时动作识别系统,用于自动生成战术回放摘要、新手教学提示或违规行为检测。此外,数据集的结构化字幕上下文和交互式查看器为视觉语言模型(VLM)的微调提供了真实复杂的场景素材,推动教育型游戏助手(如实时解说与策略推荐)的发展。在电子竞技领域,分析师可依托逐刻状态轨迹进行选手行为模式挖掘与战术优劣量化评估。
衍生相关工作
EgoCS-400K的发布已催生了一系列衍生研究工作。在其构建框架下,团队开源的动态规划分段算法(DP Segmentation)被广泛复用,用于从任意长视频中提取语义连贯的动作片段,避免了传统滑动窗口法带来的边界模糊问题。保护动作链(Protected Action Chains)的概念被后续研究继承,用于长距离动作依赖建模与分层强化学习策略设计。受其多粒度标注启发的视觉-语言对齐方法(如利用逐刻状态增强对比学习)在游戏视频理解领域成为新范式。此外,数据集提供的结构化字幕上下文(包括玩家状态、地图信息等)被用于训练条件式视频生成模型,在可控游戏场景合成和战术模拟方面产生突破。其开源代码与完整的解析-标注-滤波管线也为构建类似大规模具身数据集提供了可复制模板。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务