遇见数据集

EgoCS-400K

收藏
arXiv2026-06-17 更新2026-06-18 收录
数据链接:
官方服务:

资源简介:

EgoCS-400K是由香港城市大学研究团队构建的大规模第一人称视角游戏数据集,旨在为世界模型研究提供交互式视觉建模的基础数据。该数据集源自《反恐精英:全球攻势》和《反恐精英2》的公开职业比赛录像,包含超过40万条第一人称视频,总计超过1万小时的游戏时长,覆盖13张地图和4万多回合的对局,每条视频均与玩家的键盘鼠标操作、相机运动、游戏状态及事件实现精确时间对齐。数据集通过解析游戏回放文件并渲染生成高质量视频流,采用分层标注结构,从玩家视角序列到受保护动作链均提供结构化注释。其核心应用在于支持动作条件化的未来预测、状态感知的场景推演以及具身智能体的行为理解,为连接被动网络视频与高成本现实世界数据提供了高效的中间测试平台。

EgoCS-400K is a large-scale first-person perspective gaming dataset constructed by the research team at City University of Hong Kong, designed to provide foundational data for interactive visual modeling in world model research. Derived from public professional competitive match replays of *Counter-Strike: Global Offensive* and *Counter-Strike 2*, this dataset contains over 400,000 first-person video clips with a total gameplay duration exceeding 10,000 hours, covering 13 maps and more than 40,000 match rounds. Each video is precisely time-aligned with the player's keyboard and mouse inputs, camera motions, in-game states, and game events. Generated by parsing game replay files and rendering high-quality video streams, the dataset adopts a hierarchical annotation structure that delivers structured annotations spanning from player viewpoint sequences to privileged action chains. Its core applications cover action-conditioned future prediction, state-aware scene reasoning, and behavior understanding for embodied AI agents, acting as an efficient intermediate test platform bridging passive online videos and high-cost real-world datasets.

提供机构:
香港城市大学
创建时间:
2026-06-17
原始信息汇总

EgoCS-400K 数据集概述

数据集名称: EgoCS-400K: An Egocentric Gameplay Dataset for World Models
项目主页: https://EgoCS-400K.github.io

核心内容

  • 一个面向世界模型训练的自我中心游戏玩法数据集。
  • 将干净的《反恐精英》(CS:GO 和 CS2)第一人称游戏视频与时间上对齐的动作、键盘和鼠标信号、相机运动、玩家状态、游戏事件、字幕和提示进行配对。
  • 数据集来自公开的职业比赛回放,每个视频片段均可追溯至生成它的回放时间线。

数据集规模

  • 400K+ 个回合-玩家视频片段
  • 10K+ 小时游戏时长
  • 40K+ 个回合
  • 1K+ 场职业比赛
  • 13 张 CS:GO 和 CS2 地图
  • 每回合 10 个玩家视角
  • 6 种标注类型

标注内容与层次结构

所有级别的标注共享同一回放时间线,包含以下层次:

层次 工件 监督信息
Tick状态 ticks.csv 控制输入、视角、位置、速度、状态
原子动作 events.csv 开火、换弹、切换、检视、开镜、投掷、蹲伏
动作时间线 action.json, protected_action.json 帧级动作及受保护动作链
训练片段 dp_segments.json 基于DP算法规划的片段边界及包含的动作
字幕 segment_caption.json, protected_caption.json 结构化场景草稿及长提示

特性

  • 第一人称观察: 每回合10个玩家视角的干净渲染视频。
  • 密集动作轨迹: 键盘、鼠标、武器、移动、道具及事件信号。
  • 层次化片段: 玩家序列、DP选择的片段、受保护动作链及原子动作。
  • 先验引导字幕: 由回放衍生事实约束的片段和受保护链字幕。

构建流程

从公开职业比赛回放 → 渲染第一人称视频 → 过滤无效捕获 → 解析每Tick信号 → 构建受保护动作片段 → 生成先验引导字幕。

引用

如需引用,请使用以下 BibTeX 格式:

bibtex @misc{guo2026egocs400k, title={EgoCS-400K: An Egocentric Gameplay Dataset for World Models}, author={Guo, Rongjin and Liang, Dong and Liu, Yuhao and Liu, Fang and Huang, Tianyu and Hancke, Gerhard P. and Lau, Rynson W. H.}, year={2026}, note={Project page: https://EgoCS-400K.github.io} }

联系

如有疑问,请联系 Yuhao LIU: yuhaoliu7456@gmail.com

搜集汇总
数据集介绍
EgoCS-400K 数据集图片
构建方式
EgoCS-400K的构建源于对交互式世界模型数据需求的深刻洞察。传统网络视频缺乏可执行动作与可靠状态,机器人数据集成本高昂且场景有限,而现有模拟器难以提供大规模人类驱动的交互轨迹。为填补这一空白,研究团队从公开的职业CS:GO与CS2比赛Demo出发,利用DemoParser2解析每场回放,提取玩家状态、视角方向、移动、键盘/按键输入、视角变化、武器使用、游戏事件及回合级上下文。同时,通过CS Demo Manager将相同回放轨迹渲染为清洁的第一人称视频,实现视觉观测与解析信号的时序对齐。随后,数据被组织为层级化时间单元,包括以玩家为中心的序列、视频片段、受保护动作链、受保护原子动作及逐帧状态轨迹,并借助视觉语言模型生成受结构化先验约束的多粒度描述。
特点
EgoCS-400K具备大规模、多粒度与高保真对齐三大核心特征。该数据集涵盖超过1000场比赛、40000个回合、13张地图,通过每回合10个玩家视角的渲染,共产生超过400000段第一人称视频,总时长逾10000小时。其独创的层级化组织从玩家视角序列延伸至逐帧状态轨迹,并在每一层面提供丰富的回放驱动标注,包括动作序列、相机与移动描述、提示词及键盘/鼠标信号。尤为重要的是,所有标注共享同一基于Tick的时间参考系,每个视频片段均可追溯至原始回放事件,形成天然的可审计路径。这种设计使数据集不仅具备视觉多样性,更在动作、状态、事件与语言之间建立了严密的因果关联。
使用方法
EgoCS-400K面向交互式视觉建模的多项核心任务。研究者可利用其动作与状态标注进行动作条件下的未来帧预测,通过给定键盘鼠标信号或高级指令生成后续视觉演化;亦可开展状态与事件感知的场景推演,利用游戏状态与事件记录实现可控的以自我为中心的视频模拟。对于具身智能体研究,该数据集支持智能体对第一人称动作的深度理解,涵盖导航、视觉搜索、视角控制及多智能体交互等迁移性先验。所有数据按回合-玩家维度组织,用户可通过匹配、回合与玩家标识符检索视频及对应的结构化标注文件,并依据DP规划的训练片段边界直接构建模型输入,无需额外时间对齐或预处理。
背景与挑战
背景概述
随着视频生成技术向交互式世界建模的演进,学界对数据集的需求已从被动式视频-文本对转向具备时间对齐的视频-动作-语言轨迹,以支撑模型理解动作如何驱动场景演变。然而,现有大规模网络视频虽具有广泛视觉覆盖,却缺乏可执行的动作指令与可靠状态记录;机器人数据集虽能提供动作与状态监督,但采集成本高昂且场景多样性受限。在此背景下,香港城市大学研究团队于2026年发布了EgoCS-400K,一个基于公开职业CS:GO与CS2比赛回放构建的大规模第一人称游戏数据集。该数据集涵盖超过1000场职业比赛、40000余回合,从每回合10个玩家视角渲染出40万段第一人称视频,累计时长超10000小时,覆盖13张地图。EgoCS-400K通过解析回放文件,提取了玩家状态、视角方向、键盘鼠标输入、武器使用、游戏事件等细粒度标注,并以回放可追溯的方式实现了视频、动作、语言与状态的时间对齐,为交互式世界模型和具身智能研究提供了关键的桥梁性数据资源。
当前挑战
EgoCS-400K旨在解决领域内数据稀缺的核心挑战:现有数据集要么缺失与未来场景变化因果关联的精确动作轨迹(如网络视频),要么因成本与场景限制难以规模化(如机器人数据集),而游戏模拟虽具可扩展性却缺乏大规模人类驱动的交互轨迹。在构建过程中,团队面临多重技术难题:如何从二进制回放文件中准确解析玩家状态、视角变化与键盘鼠标信号,并利用动态规划算法在保护动作链完整性的前提下将长序列分割为适合下游任务的训练片段,同时避免切片中断动作的语义连续性。此外,为确保视觉观察与解析信号的精准对齐,团队需要剔除回放渲染中因版本兼容性或录制故障导致的无效片段;在生成字幕时,还需设计先验引导机制,过滤噪声动作与视角抖动,防止视觉语言模型将无实际效果的操作或微小晃动错误描述为显著行为,从而产出时间上忠实于真实游戏进程的结构化描述。
常用场景
经典使用场景
EgoCS-400K作为大规模、多粒度的第一人称游戏数据集,最经典的使用场景是为世界模型提供动作条件化的未来预测训练基础。研究者可利用其中超过40万段第一人称视频与同步记录的键盘鼠标输入、视角变化、玩家状态及游戏事件,训练模型在复杂动态环境中依据控制信号预测下一帧画面。数据集精心设计的保护性动作链与动态规划分割策略,使得模型能够在保持动作语义完整性的前提下学习短时程视觉动态,适用于可控视频生成、交互式场景推演以及智能体自我中心行为理解等任务。
衍生相关工作
基于EgoCS-400K的结构化监督范式,衍生出一系列开创性工作。在可控视频生成方向,研究者利用其精准的动作条件化标注训练扩散模型实现按指令实时演变的交互式世界模拟;在具身智能领域,相关工作借鉴其回放锚定设计将视频生成与动作策略学习耦合,发展出视觉-语言-动作联合模型;此外,数据集的分层动作链标注推动了视频时序分割与动作语义解析算法的进步,催生了基于动态规划的最优片段切分方法,这些工作共同将视频生成从被动观察推向主动交互的新范式。
数据集最近研究
最新研究方向
在交互式世界模型与体现智能迅速崛起的当下,EgoCS-400K聚焦于填补大规模第一人称视频数据中精细动作、状态与语言轨迹的对齐空白。该数据集通过从职业《反恐精英》对局回放中提取超过400,000段第一人称视频及10,000小时的游戏历程,构建了具有可追溯性的多层标注框架,涵盖玩家状态、视角运动、键盘鼠标输入及事件级上下文。其核心创新在于将被动视频观看与可控仿真环境相连,为动作条件性未来预测、状态感知场景推演以及代理的自我中心动作理解提供了可扩展的试验平台,成为连接网络视频数据与现实具身数据的关键桥梁。
相关研究论文
  • 1
    EgoCS-400K: An Egocentric Gameplay Dataset for World Models香港城市大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务